آنچه یاد خواهید گرفت:
طراحی و استقرار زیرساخت هوش مصنوعی مبتنی بر GPU با تسلط به راهکارهای ذخیرهسازی، شبکه، ارکستراسیون و مقیاسپذیری
پیکربندی و مدیریت قابلیتهای پیشرفته GPU مانند MIG ،vGPU و زمانبندی Kubernetes برای بهینهسازی بارهای کاری multi-tenant هوش مصنوعی
پیادهسازی ابزارهای بهینهسازی عملکرد و نظارت مانند Nsight ،DLProf ،TensorRT و DCGM برای بیشینهسازی کارایی
اعمال چارچوبهای امنیت، انطباق و حاکمیت (GDPR ،HIPAA ،RBAC ،DOCA) برای حفاظت از زیرساخت هوش مصنوعی در سطح سازمانی
پیشنیازهای دوره
دانش اولیه از گردشکارهای هوش مصنوعی و یادگیری ماشین (آموزش، استنتاج، پایپلاینها).
آشنایی با خط فرمان Linux و مدیریت سیستم
درک مفاهیم کانتینرسازی (آشنایی با Docker و مبانی Kubernetes ترجیح دارد).
دسترسی به یک سرور Linux یا محیط ابری با GPU انویدیا (A100، H100 یا مشابه) برای آزمایشگاه های عملی
(اختیاری اما مفید) تجربه اسکریپتنویسی با Python و کار با فریمورکهایی مانند TensorFlow یا PyTorch
توضیحات دوره
دوره گواهینامه SoAI-Certified Professional: AI Infrastructure (NCP-AII) برای حرفهایهای پیشرفتهای طراحی شده است که میخواهند زیرساخت مجهز به GPU را برای بارهای کاری هوش مصنوعی در مقیاس بزرگ بهطور کامل بیاموزند. با پیچیدهتر شدن مدلهای هوش مصنوعی، موفقیت فقط به الگوریتمها وابسته نیست، بلکه به توانایی طراحی، بهینهسازی و ایمنسازی زیرساخت هوش مصنوعی نیز بستگی دارد. این گواهینامه شما را برای ساخت، مدیریت و مقیاسدهی محیطهای پیشرفتهای آماده میکند که کارایی، بهرهوری و آمادگی سازمانی را فراهم میسازند.
ابتدا با اصول زیرساخت هوش مصنوعی شروع میکنید و نقش حیاتی GPU، DPU و CPU و چگونگی ترکیب آنها برای شتابدهی به پایپلاینهای یادگیری ماشین (ML) و یادگیری عمیق (DL) را بررسی میکنید. با درک برنامهنویسی CUDA، منابع NGC (NVIDIA GPU Cloud) و Triton Inference Server، اصول محکم در اکوسیستم NVIDIA که زیربنای هوش مصنوعی مدرن است، خواهید ساخت.
در ادامه، دوره به مدیریت منابع GPU و مجازیسازی میپردازد؛ جایی که تجربه عملی در پیکربندی MIG (Multi-Instance GPU)، اشتراکگذاری و ایزولهسازی GPU و راهاندازی GPU مجازی (vGPU) به دست میآورید. همچنین یاد میگیرید چگونه بارهای کاری GPU را در کلاسترهای Kubernetes ادغام کنید تا زمانبندی کارآمد و مقیاسپذیری در محیطهای multi-tenant تضمین شود.
سپس برنامه آموزشی به ذخیرهسازی، شبکه و پایپلاینهای داده میپردازد و ارتباطات پرسرعتی مانند NVLink ،Infiniband و RDMA را، همراه با راهکارهایی برای حذف گلوگاههای جابهجایی داده پوشش میدهد. شما پایپلاینهای سرتاسری هوش مصنوعی را طراحی میکنید که ETL، آموزش و استنتاج را مدیریت میکنند و جریان یکپارچهای از داده خام تا استقرار در محیط تولید را تضمین مینمایند.
بر این اساس، ارکستراسیون و مقیاسپذیری کلاستر را بررسی میکنید و از Kubernetes ،Helm ،Operators و Kubeflow برای ارکستراسیون بارهای کاری چند-GPU استفاده می کنید. همچنین توپولوژیهای کلاستر درونسازمانی، ابری و هیبرید را مطالعه میکنید تا بتوانید راهکارهای انعطافپذیر و متناسب با نیازهای سازمانی پیادهسازی کنید.
بهینهسازی عملکرد نیز یکی از محورهای اصلی دوره است. یاد میگیرید چگونه بارهای کاری GPU را با استفاده از Nsight ،DLProf و nvtop پروفایل کنید، شاخصهای GPU را نظارت کنید و با اعمال بهینهسازی TensorRT سرعت استنتاج را افزایش دهید. این دوره بر شناسایی گلوگاهها، تنظیم سیستمها و اطمینان از اجرای بارهای کاری با حداکثر کارایی تأکید دارد.
امنیت و انطباق در هوش مصنوعی سازمانی حیاتی هستند. شما سیاستهای امنیتی بار کاری را پیادهسازی میکنید، کنترل دسترسی مبتنی بر نقش (RBAC) را پیکربندی میکنید و DPUها را با DOCA برای رمزنگاری پیشرفته و ایزولهسازی شبکه یکپارچه میسازید. همچنین یاد میگیرید چگونه زیرساخت را با استانداردهای GDPR، HIPAA و FedRAMP همسو کنید تا انطباق در صنایع حساسی مانند سلامت و مالی تضمین شود.
این دوره به زیرساخت هوش مصنوعی لبه نیز گسترش مییابد و ماژولهایی درباره NVIDIA Jetson و دستگاههای Orin، یادگیری فدرهای و استقرارهای صنعتی IoT ارائه میدهد. سپس با استفاده از NGC و Triton Inference Server، به استقرار مدل در مقیاس بزرگ؛ از جمله سرویسدهی چندفریمورکی، لود بالانسینگ و طراحی با دسترسپذیری بالا مسلط خواهید شد.
در نهایت، مطالعات موردی واقعی و یک پروژه نهایی به شما امکان میدهند یک معماری کامل زیرساخت هوش مصنوعی را طراحی و ارائه کنید که نیازهای سازمانی را برآورده میسازد. از طریق آزمایشگاهها، آزمونهای شبیهسازیشده و فلشکارتها، بهطور کامل برای آزمون گواهینامه NCP-AII آماده خواهید شد.
با گذراندن این برنامه، مهارت لازم برای طراحی، بهینهسازی و ایمنسازی زیرساخت هوش مصنوعی در سطح سازمانی را به دست میآورید؛ زیرساختی که از سنگینترین بارهای کاری آینده پشتیبانی میکند. این گواهینامه شما را بهعنوان یک رهبر در مهندسی زیرساخت هوش مصنوعی متمایز میکند.
این دوره برای چه کسانی مناسب است؟
مهندسان هوش مصنوعی و دانشمندان داده که نیاز دارند پایپلاینهای آموزش و استنتاج خود را روی GPUهای NVIDIA با کارایی بالا مقیاسدهی کنند.
مدیران سیستم و مهندسان DevOps که مسئول مدیریت کلاسترهای GPU، بارهای کاری Kubernetes و نظارت عملکرد هستند.
معماران ابری و متخصصان زیرساخت که راهکارهای زیرساخت هوش مصنوعی هیبرید، ابری یا لبه را طراحی میکنند.
مدیران IT و رهبران فنی که به دنبال تضمین امنیت، انطباق و بهرهوری در استقرارهای سازمانی هوش مصنوعی هستند.
حرفهایهایی که برای دریافت گواهینامه NVIDIA-Certified Professional: AI Infrastructure (NCP-AII) آماده میشوند تا مهارتهای خود را تأیید کنند.