آنچه یاد خواهید گرفت:
ساخت پایپ لاین های Delta Lake سرتاسری (Bronze → Silver → Gold) در Databricks و ذخیرهسازی جداول Delta مدیریتشده در Unity Catalog
پیادهسازی ETL قدرتمند با PySpark: تبدیل نوع ایمن، مدیریت duplicate، اعمال اجباری اسکیما و تبدیلهای مقیاسپذیر
بهینهسازی jobهای Spark با استفاده از پارتیشنبندی، کشینگ، استراتژیهای join و عیبیابی با Spark UI برای کاهش زمان اجرا و هزینه
ایجاد تحلیلهای آماده تولید: SQL پیشرفته (CTEs، توابع پنجره، MERGE) و views کسب و کار قابل استفاده مجدد
تولید مصورسازیها و گزارشهای شفاف از داده Spark با استفاده از ابزارهای داخلی Databricks و کتابخانههای Python (Matplotlib/Seaborn)
ساخت پایپ لاین های اولیه Structured Streaming با مقصدهای Delta Lake و مدیریت رویدادهای دیررس/duplicate با نشانگذاری آبی و deduplication
اعمال یک گردش کار مقدماتی یادگیری ماشین (ML): آمادهسازی ویژگیها، آموزش/ارزیابی مدل، ردیابی با MLflow و ذخیرهسازی مدل
پیشنیازهای دوره
آشنایی اولیه با برنامهنویسی (راحتی در خواندن و ویرایش کد Python)
دانش اولیه SQL (SELECT ،JOIN ،GROUP BY)
یک لپتاپ/رایانه رومیزی با دسترسی به اینترنت
یک حساب Databricks (نسخه Community یا آزمایشی) - دستورالعملها در بخش 2 ارائه شده است
توصیه میشود اما ضروری نیست: تجربه پایه با pandas یا Jupyter notebook برای شروع سریعتر
هیچ تجربه قبلی با Spark یا Databricks لازم نیست - این دوره با راهاندازی workspace شروع میشود و شما را گامبهگام راهنمایی میکند.
توضیحات دوره
دوره عملی Databricks + Delta Lake: ETL با PySpark، پایپ لاین های مدالیون، مصورسازی، پردازش استریمینگ و یادگیری ماشین اولیه
این دوره مسیر حرفه ای برای آموزش مهارتهای عملی و آماده بازار کار در Databricks طراحی شده است و بهطور ویژه برای مهندسان داده و متخصصان تحلیل داده مناسب است. شما از مبانی راهاندازی workspace و دریافت داده شروع میکنید و بهتدریج پایپ لاین های داده تکرارپذیر Bronze به Silver به Gold را با استفاده از فناوری Delta Lake میسازید. در طول دوره، پاکسازی قدرتمند داده و تبدیلهای پیچیده را با PySpark انجام میدهید و از الگوهای پیشرفته SQL برای پشتیبانی از تحلیلهای جامع استفاده میکنید. این برنامه درسی تأکید زیادی بر روشهای مهندسی دفاعی دارد؛ از جمله تبدیل نوع ایمن، مدیریت مؤثر duplicates، اعمال اسکیما و پیادهسازی استراتژیهای آزمون کامل تا اطمینان حاصل شود که پایپ لاین ها داده شما در محیطهای تولید بهصورت قابل اعتماد و پایدار اجرا میشوند.
علاوه بر این، یاد خواهید گرفت چگونه گردشکارهای تبدیل را بهصورت کارآمد طراحی و اجرا کنید، Databricks Jobs را برای خودکارسازی زمانبندی کنید و با استفاده از تکنیکهایی مانند پارتیشنبندی، کشینگ و تحلیل Spark UI، عملکرد Spark را بهینه کنید. این دوره همچنین شامل بخشهایی در مورد مصورسازی و گزارشسازی است و نشان میدهد چگونه خروجیهای پاکسازیشده Spark را با ابزارهای مصورسازی داخلی Databricks و همچنین کتابخانههای محبوب Python مانند Matplotlib و Seaborn به نمودارهای قانعکننده و بینشمحور تبدیل کنید. علاوه بر این، Pro Track مفاهیم اولیه پردازش structured streaming، از جمله عملیات stateful را پوشش میدهد و یک گردش کار مقدماتی یادگیری ماشین را با استفاده از MLlib و MLflow برای ردیابی و مدیریت آزمایشها معرفی میکند.
آزمایشگاههای عملی، مطالعههای موردی واقعی بر پایه مجموعه داده مانند Netflix و IMDb، و دفترچههای قابل دانلود، فرصت کافی برای تمرین کل فرآیند سرتاسری فراهم میکنند. این فرآیند شامل دریافت داده خام، پاکسازی و اعتبارسنجی آن، ساخت جداول Delta، ایجاد پایپ لاین های داده، مصورسازی بینشها و استقرار jobهای پایه است. تا پایان دوره، قادر خواهید بود پایپ لاین های داده درجه تولید را پیادهسازی کنید، jobهای Spark را برای عملکرد بهتر بهینه کنید و تحلیلهای قابل اعتماد و عملی را به ذینفعان ارائه دهید.
موضوعات مرتبط را بررسی کنید.
الزامات Databricks
ناوبری عمیق در workspace
خوشهها در مقابل انبارهای SQL
دفترچهها: Python در مقابل SQL در مقابل Scala
اصول Spark
RDDها در مقابل DataFrames در مقابل Datasets
تبدیلها و اقدامات
مدل اجرای Spark (jobs ،stages ،tasks)
مهندسی داده در Databricks
دریافت داده (فایلها، پایگاههای داده، APIs)
بارهای افزایشی و زمانبندی با Jobs
مبانی Delta Lake (جداول ACID، سفر در زمان)
تحلیل SQL در Databricks
Joins، توابع پنجره، تجمیعها
ساخت داشبورد در Databricks SQL
مبانی بهینهسازی کوئری
مفاهیم Delta Lake و Lakehouse
معماری Bronze / Silver / Gold
تکامل و اعمال اجباری اسکیما
CDC و پردازش استریمینگ با Delta
کیفیت داده و مشاهدهپذیری
بررسی null/duplicate در مقیاس بزرگ
انتظارات (به عنوان مثال با کتابخانههایی مانند Great Expectations)
نظارت پایپ لاین های داده
یادگیری ماشین (ML) و تحلیل پیشرفته
استفاده از MLflow در Databricks
مهندسی ویژگی در دفترچهها
نمونههای اولیه خوشهبندی/رگرسیون
هزینه و حاکمیت
اندازهگذاری خوشه و کنترل هزینه
کنترل دسترسی، مجوزهای جدول
مبانی حسابرسی/لاگ کردن
این دوره برای چه کسانی مناسب است؟
مهندسان داده سطح junior تا mid-level و مهندسان تحلیل که باید پایپ لاین های ETL قابل اعتماد و گردشکارهای تولید Delta Lake بسازند.
تحلیلگران داده و مهندسان BI که میخواهند تحلیلها را از دفترچهها به پایپ لاین های قابل تکرار مقیاس دهند و گزارشهای مصور قابل اشتراک تولید کنند.
مهندسان نرمافزار یا مهندسان بکاند که به سمت مهندسی داده حرکت میکنند، Python/SQL اولیه میدانند و به تجربه عملی Spark/Databricks نیاز دارند.
سرپرستان تیم یا مشارکتکنندگان فنی که باید کیفیت داده را اعتبارسنجی کنند، jobهای Spark را بهینه کنند یا گردشکارهای ساده پردازش استریمینگ/یادگیری ماشین را پیادهسازی کنند.