دوره آموزشی پای‌اسپارک پر‌قدرت: راهکارهای پیشرفته برای پردازش بهینه داده‌ها

دوره آموزشی پای‌اسپارک پر‌قدرت: راهکارهای پیشرفته برای پردازش بهینه داده‌ها

1 ساعت 22 دقیقهپیشرفته2025-04-16

مدرسین

Ameena Ansari

Ameena Ansari

جزئیات دوره

استاد داده‌ها شو با دوره پیشرفته PySpark!
اگر می‌خوای توی پردازش داده‌های بزرگ حرفه‌ای بشی، این دوره مخصوص مهندس‌های داده مثل تو طراحی شده. با استاد آمینا انصاری همراه شو و یاد بگیر چطور داده‌ها رو سریع و تمیز کنی، ساختارهای درست تعریف کنی و فرمت‌ها و روش‌های فشرده‌سازی مختلف رو به کار ببری تا هر چقدر داده هم داشته باشی، سیستم‌ت روان و بهینه کار کنه.

در پایان این دوره، می‌تونی با استفاده از PySpark، پایپلاین‌های پردازش داده‌ای بسازی که هم مقیاس‌پذیر باشن و هم کارآمد.

اهداف یادگیری
تسلط به تکنیک‌های پاک‌سازی داده، از جمله مقابله با مقادیر گمشده، شناسایی داده‌های پرت، نرمال‌سازی و تبدیل داده‌ها
تعریف ساختارهای داده (Schema) به‌گونه‌ای که عملکرد و مقیاس‌پذیری افزایش پیدا کنه
آشنایی با فرمت‌های مختلف داده مثل Parquet، ORC، Avro، JSON و CSV و استفاده بهینه از هر کدوم
استفاده از تکنیک‌های فشرده‌سازی مثل Gzip، Snappy و LZO برای صرفه‌جویی در فضا و افزایش سرعت پردازش
به حداقل رساندن مشکلاتی مثل داده‌های نابرابر (Skew) و جابجایی بیش از حد داده‌ها (Shuffle) و بهینه‌سازی عملیات Join، Aggregation و Repartition

مهارت ها

Data EngineeringData ScienceOne-Off

سرفصل ها

مقدمه

  • مهندسی داده با کارایی بالا با PySpark

مقدمه ای بر پاکسازی داده با کارایی بالا در PySpark

  • پاکسازی داده‌ها چیست
  • مسائل رایج کیفیت داده ها
  • چالش در پاکسازی داده ها
  • چرا PySpark برای پاکسازی داده ها

تکنیک‌های پاکسازی داده‌ها با PySpark

  • کار با فضاهای کد GitHub
  • کیفیت داده‌ها در PySpark - شناسایی مسائل و تکنیک‌های تمیز کردن مؤثر
  • تشخیص و مدیریت مقادیر تهی در PySpark
  • تکنیک‌هایی برای شناسایی و حذف داده‌های ناسازگار در PySpark
  • تقسیم ستون‌های داده ترکیبی در PySpark

ساختار طرحواره‌های داده

  • اهمیت طراحی طرحواره در مهندسی داده
  • استفاده از PySpark برای اجرای طرح و اعتبار
  • مدیریت طرحواره در دریاچه‌ها و انبارهای داده

فرمت‌های داده و تکنیک‌های فشرده سازی

  • مقدمه ای بر فرمت‌های داده - درک JSON و CSV
  • کاوش JSON
  • کاوش Avro
  • Avro چگونه سریال سازی و سریال سازی را مدیریت می‌کند
  • تکامل طرحواره Avro - مدیریت تغییرات در ساختار داده ها
  • Avro جوانب مثبت و منفی
  • درک ORC - ذخیره‌سازی ستونی ردیف بهینه شده
  • مزایا و معایب ORC
  • پارکت - قالب ستونی برای تجزیه‌و‌تحلیل با کارایی بالا
  • الگوریتم‌های فشرده سازی در Spark - مقایسه Zstd، Snappy و LZ4

مدیریت درهم ریختگی داده‌ها و انحراف

  • آشنایی با تکنیک‌های درهم ریختن داده‌ها برای به حداقل رساندن درهم ریختن داده ها
  • آدرس دادن به انحراف داده ها
۴۰,۰۰۰ تومان