دوره آموزشی راهنمای کامل دریاچه‌های داده (Data Lakes) و Lakehouses

دوره آموزشی راهنمای کامل دریاچه‌های داده (Data Lakes) و Lakehouses

4 ساعت 24 دقیقهپیشرفته2024-08-30

مدرسین

Thalia Barrera

Thalia Barrera

جزئیات دوره

در این دوره، مهندس داده و نویسنده فنی Thalia Barrera یک مرور کلی مقدماتی و در عین حال جامع از دریاچه های داده ارائه می دهد. در مورد مفاهیم کلیدی مانند معماری دریاچه داده، عملیات، و ادغام با سیستم های داده موجود بیاموزید. بررسی کنید که دریاچه های داده چگونه در جریان کار هوش مصنوعی و یادگیری ماشینی یکپارچه هستند. تفاوت‌های بین دریاچه‌های داده، انبارهای داده و پایگاه‌های داده را بررسی کنید. فرمت های مختلف داده و کاربرد آنها را در محیط دریاچه داده کاوش کنید. از تمرین‌های عملی برای تمرین راه‌اندازی یک دریاچه داده اولیه و انجام عملیات داده ساده استفاده کنید. پس از اتمام این دوره، برای تصمیم گیری آگاهانه در مورد پیاده سازی و مدیریت دریاچه های داده در سازمان خود مجهز خواهید شد.

مهارت ها

Artificial Intelligence FoundationsData EngineeringArtificial Intelligence (AI)Data ScienceOne-Off

سرفصل ها

مقدمه

  • دریاچه‌های داده، خانه‌های دریاچه و موارد دیگر
  • آنچه باید بدانید
  • پیش نمایش پروژه Capstone

مقدمه ای بر دریاچه‌های داده

  • دریاچه داده چیست
  • پیدایش و تکامل
  • اجزای اصلی معماری
  • دریاچه داده در مقابل انبار داده
  • دریاچه داده در مقابل مش داده

ذخیره‌سازی در دریاچه‌های داده

  • انواع ذخیره سازی
  • میزبانی ذخیره سازی
  • راه حل‌های ذخیره‌سازی - S3، GCS و Azure Blob Storage و HDFS
  • سازه‌های پوشه
  • فرمت‌های فایل
  • فشرده سازی داده ها
  • پارتیشن بندی داده ها

بلع داده‌ها در دریاچه‌های داده

  • روش‌های بلع داده ها
  • ETL در مقابل ELT
  • تبدیل داده ها
  • کیفیت داده ها
  • رسیدگی به خطا، ثبت و پایش
  • ارکستراسیون
  • پلتفرم‌های هضم داده ها

مدیریت داده‌ها و حاکمیت در دریاچه‌های داده

  • مقدمه ای بر مدیریت و حاکمیت داده
  • مدیریت فراداده
  • فهرست نویسی داده ها
  • نسب داده
  • امنیت داده ‌ها , حریم خصوصی و انطباق
  • ابزارها و بسترهای مدیریت داده

مقدمه ای بر Data Lakehouses

  • خانه دریاچه داده چیست
  • معاملات اسید
  • مدیریت طرحواره
  • فرمت‌های جدول - دریاچه دلتا، کوه یخ آپاچی، آپاچی هودی

مصرف داده و موتورهای کوئری‌ در دریاچه‌ها و خانه‌های دریاچه

  • مقدمه ای بر مصرف داده
  • تجزیه‌و‌تحلیل یکپارچه داده‌ها - اسپارک
  • SQL در Hadoop - Hive and Impala
  • موتورهای کوئری‌ تعاملی - Presto و Trino
  • پروفایل سازی داده ها
  • بهینه‌سازی عملکرد پرس و جو
  • ملاحظات امنیتی مصرف داده ها

بسترهای داده پیشرفته برای دریاچه‌ها و خانه‌های دریاچه

  • پلتفرم‌های تحلیلی یکپارچه - Databricks و Snowflake
  • انبارهای داده ابری - BigQuery، Azure Synapse و Redshift
  • پلتفرم‌های داده سلف سرویس - Dremio و Starburst
  • نوت بوک‌های تعاملی - Jupyter، Zeppelin، Databricks
  • ابزارهای BI - Tableau، Power‌BI , Superset، Metabase
  • API‌ها و خدمات برای مصرف داده

Capstone - ساختن دیتا لیک هاوس

  • نمای کلی پروژه Capstone
  • نمای کلی مدل داده
  • نصب پروژه و ارائه کد
  • راه‌اندازی زیرساخت
  • مصرف داده‌های خام
  • بررسی اجمالی مدل‌های تبدیل
  • راه حل - ساخت مدل داده با SQL
  • اجرای تبدیل داده ها
  • ارکستراسیون داده ها

Capstone - BI، Advanced Analytics و ML in the Lakehouse

  • پیشرفت Dremio
  • اجرای کوئری‌ و ایجاد مجموعه داده‌های مجازی
  • ایجاد مجموعه داده‌های مجازی پیچیده با استفاده از SQL
  • اتصال Dremio به Apache Superset
  • ایجاد داشبورد بازاریابی
  • اتصال Dremio به نوت بوک Jupyter
  • تجزیه‌و‌تحلیل بررسی‌های محصول پیشرفته
  • راه حل - تجزیه‌و‌تحلیل سلامت خودرو در Jupyter

Capstone - هوش مصنوعی مولد در Lakehouse

  • مقدمه ای بر LLM‌ها و جاسازی‌های برداری - لاما
  • مقدمه ای بر RAG (نسل تقویت شده بازیابی)
  • مقدمه ای بر پایگاه‌های داده برداری - کروما
  • لنگ چین چیست
  • نمای کلی پروژه هوش مصنوعی مولد - کمک فروش
  • نصب و راه‌اندازی کد
  • اجرای پروژه - استفاده از Copilot

نتیجه گیری

  • جمع بندی و مواد غذایی کلیدی
  • مراحل بعدی در سفر داده شما
۱۰۰,۰۰۰ تومان