دوره آموزشی آمادگی آزمون مهندس داده Databricks Certified Data Engineer Associate
5 ساعت 2 دقیقهمتوسط2026-08-17
مدرسین

Packt Publishing
جزئیات دوره
Databricks یکی از پلتفرمهای مهم در حوزه مهندسی داده، تحلیل داده و یادگیری ماشین است که این قابلیتها را در یک محیط یکپارچه و مبتنی بر Apache Spark در اختیار متخصصان قرار میدهد. این دوره با تمرکز بر مفاهیم اصلی Databricks و مهندسی داده، شما را برای شرکت در آزمون Databricks Certified Data Engineer Associate آماده میکند.
در ابتدا با محیط کاربری Databricks، نحوه مدیریت Workflowها و جایگاه این پلتفرم در معماریهای مدرن داده آشنا میشوید. سپس سراغ Apache Spark میروید و معماری، نحوه اجرای Jobها، Transformations، Actions و مفهوم Lazy Evaluation را بررسی میکنید.
در ادامه یاد میگیرید چگونه عملکرد پردازشهای سنگین داده را با استفاده از تکنیکهایی مانند Partitioning و Parallelism بهبود دهید. همچنین با Delta Lake و قابلیتهای مهم آن مانند ACID Transactions و Time Travel آشنا میشوید و مفاهیم اصلی Data Warehousing از جمله OLAP و OLTP را بررسی میکنید.
بخش دیگری از دوره به قابلیتهای پیشرفته Databricks اختصاص دارد. در این بخش با Unity Catalog برای مدیریت و حاکمیت داده و Delta Live Tables برای ساخت و Orchestration پایپلاینهای داده کار میکنید. همچنین نحوه ایجاد و مدیریت Notebook، دریافت و تبدیل داده و اتصال Workflowها به GitHub را بهصورت عملی تمرین خواهید کرد.
در پایان، یک پروژه عملی جامع بهعنوان Capstone Project انجام میدهید تا مفاهیمی را که در طول دوره آموختهاید در یک سناریوی واقعی به کار بگیرید و برای موفقیت در آزمون Databricks Certified Data Engineer Associate آمادگی بیشتری پیدا کنید.
اهداف یادگیری
کار با محیط کاربری Databricks و مدیریت Workflowها
درک جایگاه Databricks و Apache Spark در معماریهای مدرن مهندسی داده
آشنایی با معماری Spark و نحوه اجرای عملیات پردازش داده
درک مفاهیمی مانند Transformations، Actions و Lazy Evaluation
بررسی و تفسیر Execution Planهای Spark
بهینهسازی پردازش داده با استفاده از Partitioning و Parallelism
مدیریت دادهها با استفاده از Delta Lake
استفاده از ACID Transactions برای حفظ یکپارچگی دادهها
استفاده از قابلیت Time Travel در Delta Lake
آشنایی با مفاهیم Data Warehousing و تفاوت OLAP و OLTP
استفاده از Unity Catalog برای Governance و مدیریت داده
ساخت و Orchestrate کردن Data Pipeline با استفاده از Delta Live Tables
ایجاد و مدیریت Notebookهای Databricks
Ingest و Transform کردن دادهها در محیط Databricks
اتصال Workflowهای داده به GitHub و استفاده از Git در فرایند توسعه
بهکارگیری مفاهیم دوره در یک پروژه عملی جامع و آمادهسازی برای آزمون Databricks Certified Data Engineer Associate
در ابتدا با محیط کاربری Databricks، نحوه مدیریت Workflowها و جایگاه این پلتفرم در معماریهای مدرن داده آشنا میشوید. سپس سراغ Apache Spark میروید و معماری، نحوه اجرای Jobها، Transformations، Actions و مفهوم Lazy Evaluation را بررسی میکنید.
در ادامه یاد میگیرید چگونه عملکرد پردازشهای سنگین داده را با استفاده از تکنیکهایی مانند Partitioning و Parallelism بهبود دهید. همچنین با Delta Lake و قابلیتهای مهم آن مانند ACID Transactions و Time Travel آشنا میشوید و مفاهیم اصلی Data Warehousing از جمله OLAP و OLTP را بررسی میکنید.
بخش دیگری از دوره به قابلیتهای پیشرفته Databricks اختصاص دارد. در این بخش با Unity Catalog برای مدیریت و حاکمیت داده و Delta Live Tables برای ساخت و Orchestration پایپلاینهای داده کار میکنید. همچنین نحوه ایجاد و مدیریت Notebook، دریافت و تبدیل داده و اتصال Workflowها به GitHub را بهصورت عملی تمرین خواهید کرد.
در پایان، یک پروژه عملی جامع بهعنوان Capstone Project انجام میدهید تا مفاهیمی را که در طول دوره آموختهاید در یک سناریوی واقعی به کار بگیرید و برای موفقیت در آزمون Databricks Certified Data Engineer Associate آمادگی بیشتری پیدا کنید.
اهداف یادگیری
کار با محیط کاربری Databricks و مدیریت Workflowها
درک جایگاه Databricks و Apache Spark در معماریهای مدرن مهندسی داده
آشنایی با معماری Spark و نحوه اجرای عملیات پردازش داده
درک مفاهیمی مانند Transformations، Actions و Lazy Evaluation
بررسی و تفسیر Execution Planهای Spark
بهینهسازی پردازش داده با استفاده از Partitioning و Parallelism
مدیریت دادهها با استفاده از Delta Lake
استفاده از ACID Transactions برای حفظ یکپارچگی دادهها
استفاده از قابلیت Time Travel در Delta Lake
آشنایی با مفاهیم Data Warehousing و تفاوت OLAP و OLTP
استفاده از Unity Catalog برای Governance و مدیریت داده
ساخت و Orchestrate کردن Data Pipeline با استفاده از Delta Live Tables
ایجاد و مدیریت Notebookهای Databricks
Ingest و Transform کردن دادهها در محیط Databricks
اتصال Workflowهای داده به GitHub و استفاده از Git در فرایند توسعه
بهکارگیری مفاهیم دوره در یک پروژه عملی جامع و آمادهسازی برای آزمون Databricks Certified Data Engineer Associate
سرفصل ها
مقدمه
- معرفی دوره
شروع کار با Databricks
- معرفی بخش
- Databricks چیست و چرا وجود دارد
- نمایش - نسخههای Databricks و راهنمای رابط کاربری ثبتنام رایگان
- نمایش - کاوش در داشبورد Databricks
- نمایش - ایجاد اولین نوتبوک و دریافت داده
- خلاصه
درک اصول Spark
- معرفی بخش
- Apache Spark و PySpark چیست
- معماری Spark - درایور، اجراکنندهها و مفهوم خوشه
- Spark session - نقطه ورود به Spark
- نمایش - عملیات پایه DataFrame
- نمایش - جابجایی بین PySpark و SQL
- نمایش - دستورات جادویی در Databricks و Spark session
- نمایش - بارگذاری و تبدیل داده با استفاده از Apache Spark DataFrames
- خلاصه
درک اصول اجرای Spark
- معرفی بخش
- درک برنامههای Spark با توضیح ()explain
- نمایش - درک برنامههای اجرایی Spark با توضیح ()explain
- تبدیلها در مقابل اقدامات و ارزیابی تنبل (lazy evaluation)
- تبدیلهای محدود در مقابل گسترده
- خلاصه
مبانی عملکرد
- معرفی بخش
- پارتیشنها و موازیسازی - مفهومی
- Repartition در مقابل Coalesce
- نمایش - Repartition در مقابل Coalesce
- خلاصه
مبانی انبار داده
- معرفی بخش
- انبار داده چیست - OLTP در مقابل OLAP
- درک انبار داده، دریاچه داده و دریاچهخانه (lakehouse)
- چرا از Databricks برای بارهای کاری تحلیلی استفاده میشود
- مفاهیم پایه انبار - جدول واقعیت، بعد و طرح ستاره در سطح بالا
- چگونه عملکرد، پارتیشنها و چیدمان فایل در انبارها اهمیت دارند
- خلاصه
Delta Lake و مدیریت داده
- معرفی بخش
- معرفی پروژه - مورد استفاده کسبوکار
- Delta Lake چیست و چرا اهمیت دارد
- درک تراکنشهای ACID و سفر در زمان
- جداول مدیریتشده در مقابل خارجی
- نمایش - آمادهسازی مجموعه داده
- نمایش - یکپارچهسازی سرتاسری داده خارجی با S3 و انواع جداول
- نمایش - تراکنشهای ACID Delta Lake و سفر در زمان
- معماری مدالیون (برنز نقره طلا)
- نمایش - مرور سرتاسری معماری مدالیون
- خلاصه
حاکمیت، هوش تجاری و لولههای داده
- معرفی بخش
- مقدمهای بر Unity Catalog - چرا حاکمیت اهمیت دارد
- نمایش - حاکمیت داده در فضای کاری Databricks
- درک داده و جریان ساده پردازش داده
- نمایش - جریان داده ساده سرتاسری با استفاده از Delta Live Tables
- نمایش - درک تنظیمات لوله داده Delta Live Tables
- نمایش - دریافت بینش با Genie و داشبوردهای هوش تجاری
- خلاصه
ارکستراسیون در Databricks
- معرفی بخش
- نمایش - اتصال GitHub با Databricks
- مقدمهای بر ارکستراسیون در Databricks
- نمایش - ایجاد و زمانبندی وظایف Databricks
- خلاصه
پروژه پایانی
- مرور پروژه نهایی
- نمایش - پروژه پایانی، بخش ۱
- نمایش - پروژه پایانی، بخش ۲
- نمایش - پروژه پایانی، بخش ۳
نتیجهگیری
- نتیجهگیری دوره