آنچه یاد خواهید گرفت:
طبقهبندی چیست و چه تفاوتی با رگرسیون دارد؟
چگونگی تفسیر احتمالات، شانس و Log-odds در Logistic Regression
چگونگی تخمین مدلهای Logistic Regression با استفاده از Maximum Likelihood
چگونگی برازش و تفسیر مدلهای رگرسیون لجستیک در چارچوب tidymodels
معیارهای کلیدی طبقهبندی کدامند و چگونه محاسبه میشوند.
چگونگی استفاده از Accuracy ،Precision ،Recall ،Specificity و F1 score
چگونگی مصورسازی و تفسیر منحنیهای ROC
تأثیر آستانههای احتمالی بر نتایج طبقهبندی
پیامدهای عدم توازن داده و روشهای مدیریت آن
استفاده از Balanced Accuracy و معیارهای پیشرفته برای داده نامتوازن
تنظیم آستانههای احتمالی و ارزیابی منحنیهای Precision-Recall
تکنیکهای نمونهبرداری مجدد برای داده نامتوازن (Up-sampling، Down-sampling ،SMOTE)
چگونگی پیادهسازی تکنیکهای نمونهبرداری در ساختار tidymodels
آموزش و تنظیم طبقهبندیکنندههای KNN در tidymodels
قضیه بیز چیست و چگونه به طبقهبندیکننده Naive Bayes منجر میشود؟
چگونگی عملکرد Naive Bayes برای ویژگیهای گسسته و پیوسته
ساخت و مقایسه مدلهای Naive Bayes در اکوسیستم tidymodels
پیشنیازهای دوره
گذراندن بخش دوم دوره به شدت توصیه میشود.
آشنایی با فریمورک tidymodels و گردش کارهای یادگیری ماشین که در بخشهای قبلی پوشش داده شد.
نصب بودن R و RStudio بر روی سیستم.
دانش اولیه آمار (مفاهیمی مانند احتمال، رگرسیون و طبقهبندی) مزیت محسوب میشود.
دانش متوسط زبان R و تجربه کار با سینتکس tidyverse توصیه میگردد.
اگر در برنامهنویسی یا زبان R کاملاً مبتدی هستید، این دوره ممکن است برای شما چالشبرانگیز باشد.
علاقه به علوم داده، یادگیری ماشین و مدلسازی طبقهبندی
کنجکاوی برای درک احتمالات، معیارها و ارزیابی مدلها
علاقه به نوشتن کدهای R تمیز، کارآمد و تکرارپذیر
لطفاً در صورت نیاز R و کتابخانههای آن را بروزرسانی کنید. لیست نسخههای مورد استفاده در انتهای هر بخش ارائه شده است.
توضیحات دوره
شما به مدلسازی رگرسیون تسلط یافتهاید و الگوریتمهای پیشرفته را بررسی کردهاید؛ اکنون زمان ورود به دنیای طبقهبندی فرا رسیده است.
این دوره برای دانشجویانی طراحی شده است که میخواهند مدلهایی بسازند که دستهها را پیشبینی کنند، نه اعداد را، و مایلند مبانی آماری و یادگیری ماشین پشت آنها را درک کنند.
آنچه خواهید آموخت
در این دوره، مدرس شما را از شهود احتمالات به سمت گردش کارهای کامل طبقهبندی با استفاده از tidymodels (اکوسیستم مدرن R برای یادگیری ماشین) هدایت میکند:
درک ماهیت طبقهبندی و تفاوتهای آن با رگرسیون
یادگیری منطق Logistic Regression و ارتباط آن با احتمالات، شانس و log-odds
برازش و تفسیر مدلهای لجستیک با استفاده از Maximum Likelihood Estimation
ارزیابی مدلها با معیارهای Accuracy ،Precision ،Recall ،Specificity و F1 score
مصورسازی عملکرد مدل از طریق منحنیهای ROC و AUC
تنظیم آستانههای احتمالی و مشاهده تأثیر آنها بر پیشبینیها
مدیریت داده نامتوازن با استفاده از Balanced Accuracy، تنظیم آستانه و معیارهای پیشرفته
اعمال تکنیکهای نمونهبرداری مانند Upsampling، Downsampling و SMOTE
ساخت و تنظیم طبقهبندیکنندههای K-nearest neighbors (KNN)
بررسی Naive Bayes به عنوان یک طبقهبندیکننده احتمالی برای داده عددی و متنی
پیشپردازش متن با textrecipes و ساخت یک مدل ساده فیلترینگ اسپم
مقایسه چندین مدل طبقهبندی در قالب یک گردش کار واحد در tidymodels
چرا این دوره را انتخاب کنید؟
مسائل طبقهبندی در همه جا حضور دارند؛ از تشخیصهای پزشکی و شناسایی تقلب گرفته تا فیلتر کردن ایمیل و بخشبندی مشتریان
این دوره به شما کمک میکند درک کنید این مدلها چگونه تصمیم میگیرند و چگونه آنها را به شکلی مسئولانه ارزیابی کنید.
شما نه تنها مهارتهای فنی برای ساخت مدلهای طبقهبندی را کسب میکنید، بلکه شهود لازم برای انتخاب معیار صحیح و تفسیر رفتار مدل را نیز به دست میآورید؛ در حالی که تمام کارهای خود را مرتب، تکرارپذیر و قابل توضیح نگه میدارید.
آنچه دریافت خواهید کرد
توضیحات شفاف و ساختاریافته از تئوری طبقهبندی و پیادهسازی عملی
گردش کارهای گامبهگام مدلسازی در R و tidymodels
مثالهای واقعی و توضیحات بصری برای معیارها
تمرینها و پروژهها همراه با پاسخ کامل
دسترسی به تمام کدها، مجموعهداده و خروجیها
دسترسی مادامالعمر و بروزرسانیها
این دوره برای چه کسانی مناسب است؟
علاقهمندان به علوم داده و یادگیری ماشین
کسانی که میخواهند مدلسازی طبقهبندی در R را یاد بگیرند.
هر کسی که به دنبال تحلیل و پیشبینی خروجیهای طبقهای است.
تحلیلگران و دانشمندان داده که میخواهند مهارتهای خود در tidymodels را ارتقا دهند.
علاقهمندان به الگوریتمهای Logistic Regression ،KNN یا Naive Bayes
افرادی که مایلند ارزیابی مدلها را با معیارهای واقعی بیاموزند.
متخصصانی که با داده نامتوازن یا پیشبینیهای مبتنی بر احتمال سر و کار دارند.
دانشجویان و محققانی که در حال ساخت مدلهای طبقهبندی هستند.
کاربران R که به دنبال تعمیق تخصص خود در اکوسیستم tidyverse/tidymodels هستند.
دانشمندان دادهای که عمدتاً از پایتون استفاده میکنند و میخواهند مهارتهای خود را به R گسترش دهند.