آنچه یاد خواهید گرفت:
کار با داده بزرگتر از حافظه
استفاده از تحلیلهای موازی و بهینهسازی شده با Polars
یادگیری استراتژیهایی برای بهینهسازی استفاده از حافظه و سرعت پردازش هنگام کار با مجموعههای داده بزرگ
شما یاد خواهید گرفت که چگونه از DuckDB در محیط پایتون استفاده کنید (تمرین)
تحلیل مجموعه داده یک میلیاردی با استفاده از DuckDB
شما یاد خواهید گرفت که چگونه در MotherDuck کار کنید - یک محیط Cloud-native (SaaS) برای DuckDB (تمرین)
پیشنیازهای دوره
نیازی به تجربه قبلی نیست. این دوره برای مبتدیان طراحی شده است، دانش اولیه از پایتون خوب است و ما گامبهگام شما را راهنمایی میکنیم. تنها چیزی که نیاز دارید یک کامپیوتر با اتصال اینترنت و تمایل به یادگیری است.
توضیحات دوره
تسلط به DuckDB - تحلیلهای سریع و سبک برای گردشکارهای داده مدرن
DuckDB یک پایگاه داده مدرن و با عملکرد بالای SQL OLAP است که برای تحلیلهای سریع طراحی شده و به اندازهای سبک است که به طور کامل درون اپلیکیشن، Jupyter notebook یا اسکریپت پایتون شما اجرا شود. بدون نیاز به راهاندازی، بدون هیچ سرور و عملکرد نزدیک به آنی، DuckDB در حال متحول کردن نحوه تعامل ما با داده محلی است.
چه شما تحلیلگر داده باشید که به بررسی فایلهای CSV مشغول است، مهندس داده که در حال ساخت ETL هستید یا دانشمند داده که روی داده ساختاری شده تست انجام میدهد، DuckDB به شما در صرفهجویی در زمان و تلاش کمک خواهد کرد. این دوره با تمرینهای عملی، پروژههای واقعی و بینشهای کارشناسی، راهنمای کامل شما برای تسلط به DuckDB از ابتدا است.
آنچه یاد خواهید گرفت:
این دوره به گونهای طراحی شده که شما را از مبانی تا یوزکیسهای پیشرفته با DuckDB هدایت کند. در اینجا بررسی دقیقی از آنچه که به دست میآورید انجام میدهیم:
مقدمهای بر DuckDB
DuckDB چیست و چرا در حال محبوب شدن است؟
OLAP در مقابل OLTP و جایی که DuckDB در آن قرار میگیرد.
چگونه DuckDB با SQLite و Pandas و Postgres و ابزارهای کلان داده مقایسه میشود؟
نصب DuckDB در پلتفرمهای مختلف (ویندوز، مک و لینوکس)
استفاده از DuckDB از طریق CLI، پایتون، Jupyter و SQL
شروع کار با SQL در DuckDB
ایجاد پایگاه دادهها و اجرای کوئریها
فیلترینگ، تجمیع، group by، جوینها و کوئریهای فرعی
توابع Window و CTEs (عبارات جدول مشترک) و توابع تاریخ و زمان
ایجاد views و جداول موقت
استفاده از SQL برای بررسی، پروفایلینگ و گزارشدهی داده
کوئری فایلهای داده به طور مستقیم (بدون نیاز به ایمپورت)
کوئری فایلهای CSV به طور مستقیم از دیسک با SQL
کار با فایلهای بزرگ Parquet به طور کارآمد و سریع
یکپارچهسازی با Apache Arrow
استفاده از DuckDB برای خواندن و نوشتن جیسان، اکسل و فرمتهای دیگر
ترکیب چندین فایل به یک جدول مجازی واحد با استفاده از wildcards
یکپارچهسازی DuckDB + پایتون
راهاندازی DuckDB در یک محیط پایتون
اجرای کوئریهای SQL روی دیتافریمها بدون تبدیل
نوشتن کوئریهای SQL بهعنوان بخشی از پایپلاین داده پایتون
تبدیلهای داده کارآمد بدون حلقهها یا ()apply
DuckDB در Jupyter Notebooks
فرمانهای ویژه برای SQL سریع در نوتبوکها
بررسی مجموعه دادهها به طور مستقیم در نوتبوکها با استفاده از SQL + پایتون با هم
گردشکار ایدهآل برای پروژههای علم داده
عملکرد، بهترین شیوهها و بهینهسازی
اجرای برداری و توضیح ذخیرهسازی ستونی
چه زمانی باید از DuckDB در مقابل Pandas یا پایگاه دادههای SQL استفاده کنید؟
پرفورمنس تیونینگ - پچ کردن، ارزیابی lazy، دسترسی کارآمد به فایلها
مدیریت حافظه و مدیریت مجموعه دادههای بزرگ
مخاطبان دوره:
این دوره برای کسی که با داده کار میکند و به دنبال ابزاری بهتر، سریعتر و سادهتر برای تحلیل است:
تحلیلگران داده - آیا از بارگذاری آهسته فایلهای CSV یا قابلیتهای محدود اکسل خسته شدهاید؟ DuckDB نحوه بررسی و تحلیل داده را متحول خواهد کرد.
دانشمندان داده - به سرعت داده را با SQL به طور مستقیم در نوتبوک خود اکتشاف، پاکسازی و پردازش میکنید.
توسعهدهندگان پایتون - از SQL بدون نیاز به یک پایگاه داده کامل، مستقیماً در اسکریپت یا اپلیکیشن خود استفاده میکنید.
مهندسان داده - با حذف وابستگیهای اضافی به پایگاه داده و استفاده از DuckDB برای پردازش فایلهای خام، پایپ لاینهای خود را ساده میکنید.
دانشجویان و یادگیرندگان - اگر در پایگاه دادهها تازهکار هستید، این نقطه ورودی عالی با ابزارهای مدرن و پروژههای عملی است.
نیازی به تجربه قبلی با DuckDB نیست. آشنایی اولیه با SQL یا پایتون مفید خواهد بود، اما ما از پایه شروع میکنیم.
ابزارها و فناوریهای تحت پوشش
استفاده از DuckDB CLI و به صورت تعبیه شده
DuckDB با پایتون و Pandas
DuckDB در Jupyter Notebook
مدیریت CSV و Parquet و Arrow و جیسان
SQL (از پایه تا پیشرفته)
اختیاری - یکپارچهسازی با Streamlit برای داشبوردها
چرا باید DuckDB را یاد بگیرید؟
DuckDB به سرعت در حال تبدیل شدن به یک ابزار ضروری در زنجیره مدرن داده است. دلیل این امر چیست:
بدون نیاز به راهاندازی - هیچ سروری، هیچ استقراری، فقط اجرا کنید و بروید.
عملکرد بالا - به راحتی میلیونها سطر را به طور محلی مدیریت کنید.
تعبیه شده و قابل حمل - در درون نوتبوکها، اسکریپتها یا حتی اپلیکیشنهای دسکتاپ اجرا میشوند.
مجهز به SQL - ایدهآل برای تحلیلگران و کسی که عاشق SQL است.
فایل نیتیو - به طور مستقیم با Parquet و CSV و موارد دیگر کار کنید - نیازی به پایگاه داده نیست.
متنباز و در حال رشد - به طور مداوم در حال بهبود و رشد با کامیونیتی است.
یادگیری DuckDB اکنون شما را در موقعیتی پیشرو قرار میدهد، زیرا شرکتها و تیمهای بیشتری شروع به پذیرش آن برای تحلیلهای مقیاسپذیر و محلی میکنند.
آنچه یاد خواهید گرفت:
بیش از 6 ساعت دروس ویدئویی الهامبخش
نوتبوکهای و مجموعه دادههای قابل دانلود
پروژهها و تمرینهای عملی
آزمونها برای تست درک شما
آمادهاید تا به DuckDB تسلط پیدا کنید؟
در پایان دوره، شما به استفاده از DuckDB در پروژههای داده خود اطمینان خواهید داشت. چه در حال بررسی فایلهای داده، چه در حال ساخت ETL، یا ترکیب SQL با پایتون برای تحلیلهای سریع باشید.
به ما بپیوندید و یاد بگیرید که چگونه DuckDB میتواند کارهای داده شما را سریعتر، آسانتر و با لذت بیشتری انجام دهد.
بیایید وارد شویم و دوباره لذت را در تحلیلها با DuckDB به ارمغان بیاوریم.
این دوره برای چه کسانی مناسب است؟
این دوره برای مبتدیانی که میخواهند Polars را از ابتدا یاد بگیرند عالی است. چه شما دانشجو هستید، چه یک حرفهای فعال یا صرفاً درباره Polars کنجکاو هستید، این دوره به شما پایهای قوی میدهد. نیازی به تجربه قبلی نیست.