دوره آموزشی Apache Flink: تجزیه و تحلیل داده های اکتشافی با SQL
1 ساعت 8 دقیقهپیشرفته2020-02-21
مدرسین

Kumaran Ponnambalam
Working with data for 20+ years
جزئیات دوره
تجزیه و تحلیل داده های اکتشافی یک مرحله اساسی در علم داده است که با بررسی داده ها برای استخراج بینش سروکار دارد. در دنیای داده های بزرگ ، جستجوی مجموعه داده های عظیم یک چالش است ، زیرا به فناوری هایی نیاز دارد که مقیاس پذیر ، سریع و دارای ویژگی های غنی باشند. Apache Flink - بستر محبوب پردازش جریان - برای این تلاش کاملا مناسب است. این دوره بر بررسی مجموعه داده ها با SQL در Apache Flink تمرکز دارد. Kumaran Ponnambalam مربی کار خود را با مرور API های رابطه ای که Flink برای تجزیه و تحلیل داده های بزرگ فراهم می کند شروع می کند. سپس کوماران نگاه عمیق تری به توابع Table API و SQL دارد. او قابلیت های مختلف SQL موجود برای کاوش داده ها ، از جمله فیلتر کردن ، تجمیع و پیوستن را کشف می کند. برای جمع بندی ، او یک پروژه مورد استفاده را ارائه می دهد که به شما امکان می دهد مهارت های جدید خود را تمرین کنید.
موضوعات مورد بحث عبارتند از:
- اتصالات و یکپارچه سازی های موجود در API های Flink
- ایجاد جداول از CSV
- انتخاب و فیلتر کردن داده های جدول
- استفاده از توابع تجمع در SQL
- پیوستن به جداول
- پنجره در جریان ها
- زمان برگزاری با جداول Flink
موضوعات مورد بحث عبارتند از:
- اتصالات و یکپارچه سازی های موجود در API های Flink
- ایجاد جداول از CSV
- انتخاب و فیلتر کردن داده های جدول
- استفاده از توابع تجمع در SQL
- پیوستن به جداول
- پنجره در جریان ها
- زمان برگزاری با جداول Flink
مهارت ها
ApacheSQLDatabase AdministrationData EngineeringDatabase DevelopmentDatabase ManagementData AnalysisProgramming LanguagesData ScienceBusiness Analysis and StrategyBusiness Software and ToolsOpen SourceSoftware DevelopmentDeep Dive (X:Y)
سرفصل ها
مقدمه
- Apache Flink برای تجزیه و تحلیل اکتشافی
Flink Relational APIs
- Apache Flink چیست؟
- API های رابطه ای Flink
- ادغام ها و کانکتورها
- پیش نیازهای دوره
- تنظیم فایل های تمرین
تجزیه و تحلیل دسته ای پایه
- ایجاد محیط جدول
- ایجاد جداول از CSV
- انتخاب داده های جدول
- فیلتر کردن داده ها در جداول
- نوشتن جداول روی فایل ها
تجزیه و تحلیل دسته ای پیشرفته
- تجمیع روی میزها
- سفارش و محدود کردن داده ها
- اضافه کردن ستون های جدید
- جداول به هم پیوستن
- کار با مجموعه داده ها
جریان SQL
- چالش های پخش SQL
- جدول پویا
- الحاق و پس گرفتن داده ها
- مصرف منابع کافکا
- اجرای پرس و جوهای مداوم
تجزیه و تحلیل جریان پیشرفته
- پنجره زنی روی نهرها
- استفاده از پنجره های غلتشی و کشویی
- جدول نوشتن به کافکا
- کار با جریان های داده
- استفاده از زمان رویداد
از پروژه Case استفاده کنید
- از تعریف مسئله مورد استفاده استفاده کنید
- داده های منبع را در جدول Flink بخوانید
- نمرات کل را محاسبه کنید
- تجمیع را محاسبه کنید
نتیجه
- مراحل بعدی