آنچه یاد خواهید گرفت:
راهاندازی و کار با محیط Apache Spark با استفاده از PySpark برای پردازش مجموعهداده واقعی.
خواندن داده از فرمتهای رایج مانند CSV و Parquet
پاکسازی، تبدیل و تجمیع داده با استفاده از Spark DataFrame API و Spark SQL
ساخت یک پایپلاین کامل Spark ETL از ابتدا تا انتها
درک چگونگی کار Apache Spark در لایههای داخلی
پیشنیازهای دوره
دانش اولیه برنامهنویسی: باید با مفاهیم اولیه برنامهنویسی مانند متغیرها، توابع و حلقهها راحت باشید (Python یا هر زبان مشابه دیگر)
آشنایی اولیه با Python یا Scala (توصیه میشود، اما اجباری نیست): دانستن مبانی Python یا Scala به شما کمک میکند مثالها را بهتر دنبال کنید، اما مفاهیم Spark برای هر دو زبان کاربرد دارند.
دانش اولیه SQL: درک کوئریهای ساده SQL (SELECT، WHERE، GROUP BY) مفید است، اما ضروری نیست.
یک رایانه با دسترسی به اینترنت: یک لپتاپ یا کامپیوتر رومیزی معمولی کافی است. به سختافزار خاصی نیاز نیست.
توضیحات دوره
چرا Apache Spark را یاد بگیریم؟
Apache Spark یکی از پرکاربردترین ابزارها در مهندسی داده مدرن است.
این ابزار به شما امکان میدهد مجموعهداده بزرگ را بهصورت کارآمد پردازش کنید و پایپلاینهای داده مقیاسپذیری بسازید که در پروژههای واقعی استفاده میشوند
با این حال، Spark در ابتدا میتواند گیجکننده به نظر برسد - بهویژه زمانی که دورهها خیلی زود روی تئوری یا جزئیات داخلی تمرکز میکنند.
این دوره دقیقاً برای برعکسِ این رویکرد طراحی شده است.
این دوره درباره چیست؟
این یک دوره عملی و کاربردی است که روی چگونگی استفاده واقعی از Spark در گردشکارهای مهندسی داده تمرکز دارد.
شما Spark را با نوشتن کد واقعی PySpark، کار با مجموعهداده واقعی و ساخت یک پایپلاین کامل Spark ETL از ابتدا تا انتها یاد میگیرید
هدف این نیست که شما را یکشبه به متخصص Spark تبدیل کند -
هدف این است که یک اصول روشن و محکم در اختیار شما بگذارد تا با اطمینان روی آن پیشرفت کنید.
- آنچه یاد خواهید گرفت
تا پایان این دوره، قادر خواهید بود:
یک محیط Spark ایجاد و با آن کار کنید.
داده را از فرمتهای رایج مانند CSV و Parquet بخوانید.
اسکیماها و انواع داده را درک کنید.
داده را با استفاده از PySpark DataFrameها تبدیل کنید.
داده را فیلتر کنید و ستونهای مشتقشده را با منطق کسبوکار ایجاد کنید.
چندین مجموعهداده را با هم join کنید.
داده را با استفاده از groupBy و توابع تجمیع، aggregate کنید.
در کنار DataFrame API از Spark SQL هم استفاده کنید.
داده پردازششده را دوباره در محل ذخیرهسازی بنویسید.
یک پایپلاین کامل Spark ETL را از داده خام تا خروجی نهایی بسازید.
اینها مهارتهای اصلی مورد استفاده در پروژههای واقعی مهندسی داده با Spark هستند.
این دوره چگونه ساختاربندی شده است؟
درسهای کوتاه و متمرکز
تأکید قوی بر تمرین و کدنویسی، نه تئوری
روند تدریجی سختی - مفاهیم فقط زمانی معرفی میشوند که به آنها نیاز باشد.
یک پروژه واقعی Spark ETL برای پیوند دادن همه بخشها به هم
موضوعات پیشرفته مانند جزئیات داخلی Spark و بهینهسازی عملکرد بهوضوح بهعنوان اختیاری مشخص شدهاند، بنابراین مبتدیان میتوانند بدون احساس سردرگمی دوره را دنبال کنند
این دوره برای چه کسانی است؟
این دوره برای افراد زیر ایدهآل است:
مبتدیانی که میخواهند Apache Spark را از ابتدا یاد بگیرند.
تحلیلگران داده یا مهندسانی که به ابزارهای Big Data مهاجرت میکنند.
توسعهدهندگانی که دانش اولیه Python دارند.
هر کسی که میخواهد یک معرفی عملی از Spark و PySpark داشته باشد.
برای دنبال کردن این دوره، نیازی به تجربه قبلی با Spark ندارید
این دوره برای چه کسانی نیست؟
این دوره برای افراد زیر طراحی نشده است:
مهندسان باتجربه Spark که به دنبال تنظیمات پیشرفته عملکرد هستند.
یادگیرندگانی که از همان ابتدا میخواهند وارد جزئیات عمیق داخلی Spark شوند.
یک دوره پیشرفته با تمرکز بر جزئیات داخلی Spark و بهینهسازی عملکرد بهصورت جداگانه برای یادگیرندگانی که میخواهند عمیقتر شوند، ارائه خواهد شد
چرا این دوره متفاوت است؟
روی کاربرد واقعی Spark تمرکز دارد، نه تئوری دانشگاهی
Spark را از طریق پایپلاینهای ETL عملی آموزش میدهد.
پیچیدگی را برای یادگیری بهتر تحت کنترل نگه میدارد.
برای ایجاد اعتمادبهنفس طراحی شده است، نه سردرگمی
آمادهاید شروع کنید؟
اگر میخواهید Apache Spark را به شکلی روشن و عملی یاد بگیرید و ساخت پایپلاینهای واقعی داده را با PySpark شروع کنید.
این دوره برای شماست.
این دوره برای چه کسانی مناسب است؟
توسعهدهندگان، تحلیلگران داده و مهندسانی که میخواهند Apache Spark را از ابتدا یاد بگیرند و برای نقشهای مهندسی داده، پایپلاینهای واقعی داده بسازند.