دوره آموزشی راهنمای کامل دریاچههای داده (Data Lakes) و Lakehouses
4 ساعت 24 دقیقهپیشرفته2024-08-30
مدرسین

Thalia Barrera
جزئیات دوره
در این دوره، مهندس داده و نویسنده فنی Thalia Barrera یک مرور کلی مقدماتی و در عین حال جامع از دریاچه های داده ارائه می دهد. در مورد مفاهیم کلیدی مانند معماری دریاچه داده، عملیات، و ادغام با سیستم های داده موجود بیاموزید. بررسی کنید که دریاچه های داده چگونه در جریان کار هوش مصنوعی و یادگیری ماشینی یکپارچه هستند. تفاوتهای بین دریاچههای داده، انبارهای داده و پایگاههای داده را بررسی کنید. فرمت های مختلف داده و کاربرد آنها را در محیط دریاچه داده کاوش کنید. از تمرینهای عملی برای تمرین راهاندازی یک دریاچه داده اولیه و انجام عملیات داده ساده استفاده کنید. پس از اتمام این دوره، برای تصمیم گیری آگاهانه در مورد پیاده سازی و مدیریت دریاچه های داده در سازمان خود مجهز خواهید شد.
مهارت ها
Artificial Intelligence FoundationsData EngineeringArtificial Intelligence (AI)Data ScienceOne-Off
سرفصل ها
مقدمه
- دریاچههای داده، خانههای دریاچه و موارد دیگر
- آنچه باید بدانید
- پیش نمایش پروژه Capstone
مقدمه ای بر دریاچههای داده
- دریاچه داده چیست
- پیدایش و تکامل
- اجزای اصلی معماری
- دریاچه داده در مقابل انبار داده
- دریاچه داده در مقابل مش داده
ذخیرهسازی در دریاچههای داده
- انواع ذخیره سازی
- میزبانی ذخیره سازی
- راه حلهای ذخیرهسازی - S3، GCS و Azure Blob Storage و HDFS
- سازههای پوشه
- فرمتهای فایل
- فشرده سازی داده ها
- پارتیشن بندی داده ها
بلع دادهها در دریاچههای داده
- روشهای بلع داده ها
- ETL در مقابل ELT
- تبدیل داده ها
- کیفیت داده ها
- رسیدگی به خطا، ثبت و پایش
- ارکستراسیون
- پلتفرمهای هضم داده ها
مدیریت دادهها و حاکمیت در دریاچههای داده
- مقدمه ای بر مدیریت و حاکمیت داده
- مدیریت فراداده
- فهرست نویسی داده ها
- نسب داده
- امنیت داده ها , حریم خصوصی و انطباق
- ابزارها و بسترهای مدیریت داده
مقدمه ای بر Data Lakehouses
- خانه دریاچه داده چیست
- معاملات اسید
- مدیریت طرحواره
- فرمتهای جدول - دریاچه دلتا، کوه یخ آپاچی، آپاچی هودی
مصرف داده و موتورهای کوئری در دریاچهها و خانههای دریاچه
- مقدمه ای بر مصرف داده
- تجزیهوتحلیل یکپارچه دادهها - اسپارک
- SQL در Hadoop - Hive and Impala
- موتورهای کوئری تعاملی - Presto و Trino
- پروفایل سازی داده ها
- بهینهسازی عملکرد پرس و جو
- ملاحظات امنیتی مصرف داده ها
بسترهای داده پیشرفته برای دریاچهها و خانههای دریاچه
- پلتفرمهای تحلیلی یکپارچه - Databricks و Snowflake
- انبارهای داده ابری - BigQuery، Azure Synapse و Redshift
- پلتفرمهای داده سلف سرویس - Dremio و Starburst
- نوت بوکهای تعاملی - Jupyter، Zeppelin، Databricks
- ابزارهای BI - Tableau، PowerBI , Superset، Metabase
- APIها و خدمات برای مصرف داده
Capstone - ساختن دیتا لیک هاوس
- نمای کلی پروژه Capstone
- نمای کلی مدل داده
- نصب پروژه و ارائه کد
- راهاندازی زیرساخت
- مصرف دادههای خام
- بررسی اجمالی مدلهای تبدیل
- راه حل - ساخت مدل داده با SQL
- اجرای تبدیل داده ها
- ارکستراسیون داده ها
Capstone - BI، Advanced Analytics و ML in the Lakehouse
- پیشرفت Dremio
- اجرای کوئری و ایجاد مجموعه دادههای مجازی
- ایجاد مجموعه دادههای مجازی پیچیده با استفاده از SQL
- اتصال Dremio به Apache Superset
- ایجاد داشبورد بازاریابی
- اتصال Dremio به نوت بوک Jupyter
- تجزیهوتحلیل بررسیهای محصول پیشرفته
- راه حل - تجزیهوتحلیل سلامت خودرو در Jupyter
Capstone - هوش مصنوعی مولد در Lakehouse
- مقدمه ای بر LLMها و جاسازیهای برداری - لاما
- مقدمه ای بر RAG (نسل تقویت شده بازیابی)
- مقدمه ای بر پایگاههای داده برداری - کروما
- لنگ چین چیست
- نمای کلی پروژه هوش مصنوعی مولد - کمک فروش
- نصب و راهاندازی کد
- اجرای پروژه - استفاده از Copilot
نتیجه گیری
- جمع بندی و مواد غذایی کلیدی
- مراحل بعدی در سفر داده شما