آنچه یاد خواهید گرفت:
ساخت یک پایپلاین برچسبگذاری خودکار end-to-end با Segment Anything (SAM) برای مجموعهدادههای تصویری در مقیاس بزرگ
درک چگونگی کارکرد داخلی ترنسفورمرهای بینایی (ViTها)، از جمله patch embedding و self-attention
توضیح ریاضیات اصلی پشت SAM، از جمله رمزگشایی ماسک و prompt conditioning
اجرای حجمهای کاری بخشبندی شتابدهی شده با GPU بهصورت کارآمد با پشتههای مدرن یادگیری عمیق
مقایسه مدلهای SAM ViT-B ،ViT-L و ViT-H و انتخاب گزینه مناسب از نظر هزینه، سرعت و دقت
یکپارچهسازی AWS Rekognition برای تشخیص سطحبالای شی و استخراج متادیتا
ترکیب خروجیهای AWS Rekognition با ماسکهای SAM برای ایجاد برچسبهای دقیق در سطح پیکسل
مصورسازی ماسکهای بخشبندی، bounding boxها و امتیازهای اطمینان برای اشکالزدایی مدل
تحلیل trade-offها بین مدلهای متنباز بینایی کامپیوتر و سرویسهای ابری مدیریتشده
بخشبندی تصویر
چگونه از مدلهای متنباز در AWS Sagemaker استفاده کنیم؟
بهینهسازی عملکرد و مصرف حافظه هنگام اجرای SAM در تصاویر بزرگ
استفاده از پایپلاینهای مبتنی بر AWS برای مقیاسبندی مطمئن حجمهای کاری بینایی کامپیوتر
ایجاد پل بین تئوری (ریاضیات و مدلها) و پایپلاینهای عملی در محیط تولید
AWS Rekognition
تشخیص شی
پیشنیازهای دوره
مبانی اولیه پایتون
ریاضیات دبیرستان
توضیحات دوره
ساخت یک محصول موفق در حوزه بینایی کامپیوتر، بهویژه برای ادراک در خودروهای خودران، از دو چیز، پایههای قوی و سیستمهای واقعی و مقیاسپذیر شروع میشود.
در این دوره، یاد میگیرید چگونه با Segment Anything Model (SAM) متعلق به متا، ترنسفورمرهای بینایی (ViTها) و AWS Rekognition، پایپلاین بینایی شبیه به سیستمهای رانندگی خودکار خودتان را بسازید، در حالی که واقعاً ریاضیات و شهود پشت عملکرد این مدلها را هم درک میکنید.
ابتدا، ترنسفورمرهای بینایی را از ابتدا بررسی میکنیم و روی توضیحهای روشن و شهودی patch embedding، مکانیزمهای توجه و نمایشهای مدل تمرکز داریم. خواهید دید ریاضیات پشت توجه، تعبیهسازیها و شباهت چگونه به قابلیتهای ادراک تبدیل میشوند که پشتههای مدرن خودروهای خودران به آن تکیه دارند. سپس، به معماری SAM از متا میپردازیم و توضیح میدهیم پرامپتها، تعبیهسازیها و رمزگشایی ماسک چگونه با هم کار میکنند تا نتایج بخشبندی باکیفیت تولید شود و باز هم ریاضیات را به رفتاری که مشاهده میکنید وصل میکنیم، بدون اینکه مدل را بهصورت یک جعبه سیاه ببینیم.
بعد میبینید این مدلهای متنباز چگونه در گردش کارهای واقعی ادراک برای خودروهای خودران به کار میروند. AWS Rekognition را برای تشخیص سطحبالا و استخراج متادیتای یکپارچه میکنیم و آن را با SAM ترکیب میکنیم تا پایپلاینهای برچسبگذاری خودکار در سطح پیکسل بسازیم، از همان نوعی که برای مقیاسبندی ایجاد مجموعهداده در رانندگی خودکار استفاده میشود. در طول دوره، یاد میگیرید خروجیهای مدل (امتیازها، تعبیهسازیها و ماسکها) چگونه به اهداف و نمایشهای بنیادی مرتبطاند که این پایپلاین را قابلاعتماد میکنند.
تأکید زیادی بر مصورسازی و درک عملی گذاشته شده است. ماسکها، bounding boxها، سیگنالهای اطمینان، تعبیهسازیها و حالتهای خطا را بررسی میکنید و یاد میگیرید مفاهیم ریاضی چگونه مستقیماً به رفتار مدل تبدیل میشوند؛ رفتاری که میتوانید آن را مشاهده و اشکالزدایی کنید و بهبود دهید که هنگام ساخت سیستمهای ادراک برای کاربردهای حساس به ایمنی مانند خودروهای خودران حیاتی هستند.
در پایان دوره، فقط نخواهید دانست چگونه SAM را اجرا کنید یا یک AWS API را فراخوانی کنید. بلکه خواهید فهمید چرا مدلها کار میکنند، چگونه سرویسهای ابری مدیریتشده را با پژوهشهای متنباز ترکیب کنید و چگونه مانند کسی فکر کنید که در حال ساخت یک استارتاپ واقعی بینایی کامپیوتر با تمرکز بر ادراک مقیاسپذیر برای خودروهای خودران است، نه اینکه فقط یک دمو را بررسی کنید.
این دوره برای شما ایدهآل است اگر میخواهید فراتر از آموزشهای سطحی بروید و درک روشن و شهودی از سیستمهای مدرن بینایی کامپیوتر بدست آورید، از ریاضیات پشت ترنسفورمرها و بخشبندی تا پایپلاینهای ادراک در سطح تولید که در رانندگی خودکار استفاده میشوند.
این دوره برای چه کسانی مناسب است؟
مهندسان یادگیری ماشین که میخواهند پایپلاینهای واقعی بینایی کامپیوتر را فراتر از مثالهای ساده بسازند.
مهندسان بینایی کامپیوتر که میخواهند SAM و ترنسفورمرهای بینایی را در گردش کارهای تولید به کار بگیرند.
دانشمندان داده که میخواهند برچسبگذاری تصاویر را خودکار کنند و ساخت مجموعهداده را سرعت بدهند.
مهندسان هوش مصنوعی که به ترکیب مدلهای بینایی متنباز با سرویسهای AWS علاقه دارند.
مهندسان نرمافزار که به سمت یادگیری ماشین کاربردی و بینایی کامپیوتر در حال گذار هستند.