آنچه یاد خواهید گرفت:
یادگیری تقویتی (RL) را از پایه درک کنید (شامل اثباتها و استنتاجهای مرتبط)
تکنیکهای RL مبتنی بر مدل و بدون مدل را درک کنید.
تکنیکهای بهینهسازی RL مبتنی بر مقدار و مبتنی بر گرادیان سیاست را درک کنید.
درک کنید چگونه از یادگیری عمیق در ترکیب با یادگیری تقویتی استفاده میشود.
تکنیکهای RL برای کنترل اعمال گسسته و پیوسته را درک کنید.
یادگیری تقویتی از بازخورد انسانی (RLHF) و از پاداشهای قابلراستیآزمایی (RLVR) را درک کنید.
درک کنید LLMها چگونه یاد میگیرند استدلال کنند و زنجیرههای افکار ارائه دهند.
درک کنید LLMها چگونه آموزش میبینند تا از ابزارهای دیگر استفاده کنند و با سایر LLMها و ایجنتها همکاری کنند.
پیشنیازهای دوره
درک پایهای از احتمال و آمار (برای مثال: توزیعها، میانگین، واریانس و امید ریاضی)
جبر خطی و حسابان پایه
دانش خوب از شبکههای عصبی و یادگیری عمیق (برای مثال: گرادیان کاهشی، پسانتشار)
توضیحات دوره
این دوره یک بررسی عمیق و جامع از یادگیری تقویتی است. سطح آن در حد دانشگاهی و عمیق است.
دوره از پایهترین مفاهیم RL در مسائل ساده و محدود شروع میشود و گامبهگام با افزایش پیچیدگی پیش میرود. تا به معرفی الگوریتمهایی برسد که میتوانند مسائل پیچیده واقعی را برای اعمال گسسته (برای مثال: LLMها) و پیوسته (برای مثال: رباتیک) حل کنند.
این دوره از نظر ریاضی نیز بسیار غنی است. در آن الگوریتمها، اثباتها و استنتاجهای زیادی معرفی میشود. با این حال، رویکرد آن همچنان بسیار شهودی است. برای توضیح هر مفهوم یا ایده، مثالهای شهودی فراوانی ارائه شده است.
با اینکه چند نمونه کد هم وجود دارد، ما هدف اصلی دوره را کدنویسی نمیدانیم. تمرکز دوره بسیار بیشتر بر مفاهیم، شهودها و استنتاجهاست. کدنویسی عمدتاً برای نمایش و توضیح استفاده میشود.
این دوره بسیاری از الگوریتمهای سنتی و SOTA را با جزئیات غنی و رضایتبخش پوشش میدهد. برخی از الگوریتمهای مطرح شده در دوره عبارتند از: ارزیابی تکراری سیاست (PE)، تکرار مقدار (VI)، تکرار سیاست (PI)، ارزیابی مونته کارلو، TD(0) و TD(lambda) و TD معکوس TD(lambda) با eligibility traces و SARSA و Q-Learning و Double Q-Learning و Expected SARSA و Deep SARSA و Deep Q-Learning و Deep Double Q-Learning و REINFORCE و A2C و A3C و DDPG و SAC و TRPO، PPO و GRPO و DPO
در نهایت، دوره یک بخش مطالعه موردی قابل توجه درباره RL با LLMها دارد. این بخش توضیح میدهد که مدلهای زبانی بزرگ و ایجنتهای مکاملهای چگونه با استفاده از یادگیری تقویتی آموزش میبینند تا همسویی بهتری با ترجیحات انسانی داشته باشند، زنجیرههای افکار تولید کنند، و در ریاضی و کدنویسی بهتر شوند. الگوریتمهای RLHF و RLVR با جزئیات عمیق پوشش داده شدهاند.
این دوره برای چه کسانی مناسب است؟
دانشجویان دانشگاه که یک دوره جدی یادگیری تقویتی (RL) میگذرانند.
مهندسان یادگیری ماشین که میخواهند درک عمیقتری از RL به دست آورند.
مهندسان LLM که میخواهند سازوکار درونی RLHF و RLVR را درک کنند.