آنچه یاد خواهید گرفت:
تسلط به اصول بینایی کامپیوتری: درک میکنید که رایانهها چگونه داده ویژوال را پردازش و تفسیر میکنند؛ از دستکاری پیکسلها و فضاهای رنگی تا فیلترینگ پیشرفته
ساخت و استقرار مدلهای یادگیری عمیق: شبکههای عصبی کانولوشن (CNN) را با استفاده از TensorFlow و PyTorch طراحی، آموزش و بهینه میکنید، از جمله معماریهای پیشرفته
پیادهسازی سامانههای تشخیص آبجکت پیشرفته: با استفاده از YOLO و R-CNN سریعتر و DETR و اپلیکیشنهای تشخیص آبجکت آماده تولید میسازید که بتوانند شناسایی کنند.
ایجاد مدلهای پیشرفته بخشبندی و مولد: سیستمهای بخشبندی سمانتیک و نمونه را با U-Net و Mask R-CNN میسازید و اپلیکیشنهای generative AI ایجاد میکنید.
اعمال تکنیکهای یادگیری انتقالی و فاین تیونینگ: از مدلهای از پیش آموزش دیده روی ImageNet و سایر مجموعه دادههای بزرگ برای حل مؤثر مسائل بینایی کامپیوتری سفارشی بهره میگیرید.
توسعه پورتفولیوی حرفهای: بیش از 7 پروژه مرتبط با صنعت را تکمیل میکنید، از جمله classifiers تصویر، آشکارسازهای آبجکت بلادرنگ و ابزارهای حذف پسزمینه
درک نظریه و ریاضیات پشت یادگیری عمیق: اصول ریاضی پشت شبکههای عصبی را درک میکنید، از جمله پسانتشار، نزول گرادیان و توابع ضرر
تسلط به ابزارها و چارچوبهای استاندارد صنعت: کسب مهارت در TensorFlow و PyTorch و OpenCV و scikit-image و شیوههای مدرن MLOps برای استقرار مدل
آمادگی برای مصاحبههای مهندسی بینایی کامپیوتری: با اطمینان درباره معماریهایی مانند اتصالات باقیمانده ResNet، تشخیص تکمرحلهای YOLO بحث میکنید.
استقرار مدلها در تولید: بهترین شیوهها برای بهینهسازی مدل، کوانتیزاسیون، پایپلاینهای استقرار و ارائه مدلهای بینایی کامپیوتری در کاربردهای واقعی را میآموزید.
پیشنیازهای دوره
برای بهره بردن حداکثری از دوره، باید درک خوبی از برنامهنویسی اولیه پایتون داشته باشید؛ از جمله متغیرها، حلقهها، توابع و شرطیها و همچنین با Jupyter Notebooks یا IDE دلخواه پایتون خود آشنا باشید.
هر چند آشنایی پایه با ریاضیات به ویژه جبر و مفاهیم اولیه حسابان مفید است، اما الزامی نیست.
از نظر سختافزاری، به یک رایانه با حداقل 8GB RAM و دسترسی مدیریتی برای نصب پکیجهای پایتون نیاز دارید.
مهمتر از همه، هیچ تجربه قبلی در یادگیری ماشین، یادگیری عمیق یا بینایی کامپیوتری لازم نیست، زیرا همه موارد را از ابتدا شروع میکنیم
تنها چیزی که نیاز دارید اشتیاق به یادگیری و تمایل به ورود به پروژههای کدنویسی عملی است.
توضیحات دوره
تسلط به بینایی کامپیوتری: از پیکسل تا تشخیص تا Gen-CV
در 34 ساعت، از یک یادگیرنده کنجکاو به یک مهندس بینایی کامپیوتری مطمئن تبدیل شوید.
آیا آمادهاید فناوری را بسازید که جهان ویژوال ما را شکل میدهد؟
بینایی کامپیوتری فقط آینده نیست همین حالا در جریان است. ماشینهای خودران در خیابانها ناوبری میکنند. اپلیکیشنها چهره شما را تشخیص میدهند. هوش مصنوعی آثار هنری خیرهکننده خلق میکند. پشت هر نوآوری ویژوال، فناوری بینایی کامپیوتری قرار دارد و تقاضا برای مهندسان ماهر بینایی کامپیوتری هرگز تا این اندازه بالا نبوده است. شرکتهایی مانند گوگل، Tesla و Meta و بیشمار استارتاپ دیگر به شدت به دنبال متخصصانی هستند که بتوانند سامانههای بینایی را بسازند، مستقر و بهینهسازی کنند.
اما چالش اینجاست: بیشتر دورهها یا شما را در نظریه غرق میکنند بدون اینکه کاربرد عملی ارائه دهند، یا شما را بدون ایجاد دانش پایهای لازم، مستقیم وارد چارچوبهای یادگیری عمیق میکنند؛ در حالی که برای موفقیت واقعی به آن پایه نیاز دارید.
این دوره متفاوت است.
«تسلط به بینایی کامپیوتری - از پیکسل تا تشخیص تا Gen-CV» مسیر کامل را ارائه میدهد از درک اینکه رایانهها چگونه پیکسلهای جداگانه را پردازش میکنند تا استقرار مدلهای generative AI پیشرفته
چه دانشجویی باشید که میخواهد متمایز شود، چه یک فرد حرفهای که مسیر شغلی خود را تغییر میدهد، چه پژوهشگری که به مهارتهای پیادهسازی نیاز دارد، یا کارآفرینی که محصولی مبتنی بر بینایی میسازد، این مسیر جامع شما را از صفر تا آمادگی برای استقرار پیش میبرد.
آنچه دوره را منحصربهفرد میکند؟
معماری یادگیری تدریجی: ما هیچ مرحلهای را حذف نمیکنیم. شما با پردازش کلاسیک تصویر و مبانی OpenCV شروع میکنید و شهود لازم برای درک اینکه رایانهها واقعاً چگونه «میبینند» را میسازید. شما سپس شبکههای عصبی کانولوشن را به طور کامل یاد میگیرید؛ نه فقط اینکه چگونه از آنها استفاده کنید، بلکه چرا کار میکنند. در نهایت، معماریهای پیشرفته مانند ترنسفرمرهای بینایی، DETR و SAM را بررسی میکنید همان مدلهایی که امروز پشت پیشرفتهای هوش مصنوعی قرار دارند.
34 ساعت تمرین عملی: هر مفهوم با کد نمایش داده میشود. هر ماژول شامل پروژههای عملی است. شما فقط ویدئو تماشا نمیکنید بلکه با TensorFlow و PyTorch و فریمورکهای استاندارد صنعت، اپلیکیشنهای واقعی میسازید.
بیش از 7 پروژه آماده برای پورتفولیو: در پایان دوره، یک CNN برای دستهبندی مد با دقت بیش از %92، یک آشکارساز آبجکت YOLO بلادرنگ با سرعت 45+ FPS، یک سیستم حذف پسزمینه مبتنی بر U-Net، یک اپلیکیشن انتقال سبک تصویر، یک سامانه تشخیص چهره با شناسایی نقاط کلیدی، یک ابزار بخشبندی نمونه Mask R-CNN، و مدلهای سفارشی آموزش دیده از پایه و مستقر شده در تولید را ساختهاید.
آمادگی برای مصاحبه داخلی: با اطمینان درباره اتصالات باقیمانده ResNet، نوآوریهای معماری YOLO، اتصالات میانبر U-Net و مکانیسم توجه (attention) در ترنسفرمرهای بینایی صحبت خواهیم کرد. هر معماری با شفافیت توضیح داده میشود تا بتوانید در مصاحبههای فنی، «دلیل» پشت «چگونگی» را بیان کنید.
مخاطبان دوره:
این دوره برای گروههای مختلف از جمله دانشجویانی که به دنبال مهارتهای تخصصی هوش مصنوعی هستند تا در بازار کار رقابتی برجسته شوند، توسعهدهندگان نرمافزار که میخواهند بینایی کامپیوتری را به ابزار حرفهای خود اضافه کنند، افرادی که مسیر شغلی خود را تغییر میدهند و به نقشهای پردرآمد مهندسی هوش مصنوعی وارد میشوند، پژوهشگرانی که برای پروژههای هوش مصنوعی ویژوال به مهارتهای پیادهسازی عملی نیاز دارند، کارآفرینانی که محصولات مبتنی بر بینایی میسازند و به تخصص فنی نیاز دارند، و دانشمندان داده که میخواهند به حوزه بینایی کامپیوتری و یادگیری عمیق گسترش پیدا کنند، طراحی شده است.
بررسی برنامه کامل دوره
ماژول 1: اصول پایه (پردازش تصویر و OpenCV) - تسلط به اصول اولیه: نمایش پیکسل، فضاهای رنگی (RGB و HSV و Grayscale)، تبدیلات هندسی و فیلترینگ با کرنلهای کانولوشن - شما یک جعبه ابزار دستکاری تصویر میسازید که کنترل کامل بر داده ویژوال را نشان میدهد.
ماژول 2: یادگیری عمیق و CNNs - شما شبکههای عصبی مانند نورونها، توابع فعالسازی، پسانتشار و نزول گرادیان را از پایه درک کرده و سپس میفهمید چرا CNNs برای بینایی به طور منحصربهفردی مناسب هستند: لایههای کانولوشن که ویژگیهای سلسلهمراتبی را یاد میگیرند، لایههای pooling برای ناوردایی مکانی و معماری کامل انقلابی در بینایی کامپیوتری
ماژول 3: معماریهای پیشرفته CNN - شما در میان نوآوریهای برنده ImageNet سفر کرده و عمق VGG، یادگیری باقیمانده ResNet، پردازش چندمقیاسی Inception و مقیاسبندی متوازن EfficientNet را درک میکنید. شما به یادگیری انتقالی، قدرتمندترین تکنیک در بینایی کامپیوتری مدرن برای تطبیق مدلهای از پیش آموزش دیده با تسکهای سفارشی خود مسلط میشوید، روشی که زمان را ذخیره میکند و با داده محدود، نتایج برتری به دست میدهد.
ماژول 4: تشخیص آبجکت - شما سیستمهایی میسازید که چندین آبجکت را در تصاویر شناسایی و مکانیابی میکنند. شما آشکارسازهای دو مرحلهای (خانواده R-CNN و Faster R-CNN) و آشکارسازهای تکمرحلهای (YOLO و SSD) را بررسی میکنید که عملکرد بلادرنگ ارائه میدهند. شما معماری مدرن DETR را پیاده میکنید که از ترنسفرمرها برای تشخیص آبجکت end-to-end و بدون کامپوننتهای دستساز استفاده میکند.
ماژول 5: بخشبندی تصویر - شما طبقهبندی در سطح پیکسل را انجام میدهید تا ماسکهای دقیق آبجکت ایجاد کنید. شما به بخشبندی سمانتیک با معماری رمزگذار-رمزگشا و اتصالات میانبر U-Net مسلط میشوید و بخشبندی نمونه را با Mask R-CNN پیاده میکنید. شما مدلهای بنیادین مانند SAM (Segment Anything Model) را بررسی میکنید که قادر به بخشبندی zero-shot و قابل هدایت با پرامپت هستند.
ماژول 6: مدلهای مولد و ترنسفرمرهای بینایی - شما وارد مرز هوش مصنوعی ویژوال میشوید. شما رمزگذارهای خودکار متغیر (VAE) و نمایشهای نهفته آنها را درک میکنید. شما شبکههای مولد متخاصم (GAN) میسازید که از طریق آموزش متخاصم تصاویر واقعگرایانه ایجاد میکنند. شما به ترنسفرمرهای بینایی (ViT)) و مکانیسمهای self-attention آنها که کانتکس گلوبال را ضبط میکنند، مسلط میشوید و فضاهای تعبیه ویژوال را برای تسکهای جستجوی تصویر و جستجوی شباهت ایجاد میکنید.
در پایان دوره، شما بینایی کامپیوتری را از اصول اولیه تا مدلهای مرزی درک خواهید کرد، نه فقط اینکه چگونه از کتابخانهها استفاده کنید، بلکه ریاضیات و شهود پشت هر تکنیک را نیز خواهید فهمید.
شما اپلیکیشنهای آماده تولید خواهید ساخت که آبجکتها را تشخیص میدهند، تصاویر را بخشبندی کرده و محتوای ویژوال را با عملکرد پیشرفته تولید میکنند.
شما با اطمینان درباره معماریهایی مانند ResNet و YOLO و U-Net و ترنسفرمرهای بینایی و DETR و SAM در مصاحبههای فنی شرکتهایی مانند گوگل، Tesla و آزمایشگاههای پیشروی هوش مصنوعی صحبت خواهید کرد.
شما سیستمهای واقعی را با استفاده از TensorFlow و PyTorch و شیوههای مدرن MLOps مستقر خواهید کرد.
شما یک پورتفولیو شامل بیش از 7 پروژه مرتبط با صنعت خواهید داشت که تخصص شما را در سراسر پایپلاین کامل بینایی کامپیوتری نشان میدهد.
شما زبان فنی مهندسان CV را خواهید آموخت و تفاوتهای میان دقت و سرعت، پیچیدگی مدل و نیازهای استقرار را درک خواهید کرد.
تحول شما از همین حالا آغاز میشود
از دستکاری پیکسل تا generative AI شما به کل این پایپلاین مسلط خواهید شد. انقلاب ویژوال با شما یا بدون شما در حال رخ دادن است. تنها پرسش این است: آیا شما سازنده آن خواهید بود یا فقط از دور تماشا میکنید؟
همین امروز در دوره شرکت کرده و از یک یادگیرنده کنجکاو به یک مهندس مطمئن بینایی کامپیوتری تبدیل شوید.
این دوره شامل 34 ساعت محتوای ویدئویی، نمایشهای عملی کدنویسی و بیش از 7 پروژه کامل است.
به دانشجویانی بپیوندید که با این مسترکلاس جامع بینایی کامپیوتری، مسیر شغلی خود را متحول کردهاند. سفر شما از مبتدی تا مهندس حرفهای بینایی کامپیوتری همینجا آغاز میشود.
این دوره برای چه کسانی مناسب است؟
Gemini گفت این دوره برای طیف متنوعی از متخصصان و افراد مشتاق طراحی شده است؛ از دانشجویان و فارغالتحصیلان تازهواردی که میخواهند در AI و بینایی کامپیوتری تخصص پیدا کنند تا در بازار رقابتی به نقشهای پردرآمد دست یابند.
این دوره همچنین برای توسعهدهندگان نرمافزار، مهندسان و دانشمندان داده که میخواهند شکاف میان برنامهنویسی سنتی و یادگیری عمیق را پر کنند و مهارتهای خود را به پردازش تصویر و تحلیل داده ویژوال گسترش دهند، بسیار مناسب است.
افرادی که از توسعه وب یا سایر حوزههای فنی به مسیر شغلی جدیدی وارد میشوند، و نیز پژوهشگران و دانشگاهیانی که نیاز دارند مدلهای نظری را به نمونههای عملی تبدیل کنند، این برنامه درسی مهارتهای لازم برای پیادهسازی عملی را فراهم میکند.
علاوه بر این، کارآفرینان و مدیران محصول که استارتاپهای مبتنی بر بینایی میسازند، پایه فنی لازم برای محصولات دارای تشخیص و شناسایی آبجکت را به دست خواهند آورد.
در نهایت، مهندسان یادگیری ماشین که میخواهند معماریهای پیشرفته مانند ترنسفرمرهای بینایی را به خوبی یاد بگیرند و علاقهمندان به هوش مصنوعی که مشتاق درک مکانیسم ماشینهای خودران و تولید تصویر هستند، بینشهای عمیقی را که برای ساخت این فناوریها از پایه نیاز دارند، پیدا خواهند کرد.