دوره آموزشی تجزیه و تحلیل داده های بزرگ با Hadoop و Apache Spark آپدیت (2020)
1 ساعت 2 دقیقهمتوسط2020-02-24
مدرسین

Kumaran Ponnambalam
Working with data for 20+ years
جزئیات دوره
Apache Hadoop در دنیای فناوری های کلان داده پیشگام بود و همچنان در ذخیره سازی داده های بزرگ سازمانی پیشرو است. Apache Spark برترین موتور پردازش داده های بزرگ است و مجموعه ای چشمگیر از ویژگی ها و قابلیت ها را فراهم می کند. هنگامی که با هم استفاده می شود ، سیستم پرونده توزیع شده Hadoop (HDFS) و Spark می توانند یک تنظیم تجزیه و تحلیل داده های بزرگ واقعاً مقیاس پذیر را ارائه دهند. در این دوره ، یاد بگیرید چگونه از این دو فناوری برای ساخت خطوط لوله تجزیه و تحلیل مقیاس پذیر و بهینه استفاده کنید. مربی Kumaran Ponnambalam روش هایی را برای بهینه سازی مدل سازی و ذخیره سازی داده ها در HDFS بررسی می کند. در مورد مصرف و استخراج داده های مقیاس پذیر با استفاده از Spark بحث می کند. و نکاتی را برای بهینه سازی پردازش داده ها در Spark ارائه می دهد. به علاوه ، او یک پروژه مورد استفاده را فراهم می کند که به شما امکان می دهد تکنیک های جدید خود را تمرین کنید.
موضوعات مورد بحث عبارتند از:
- توضیح دهید که Apache Spark داده های خود را در کجا ذخیره می کند.
- بین انواع داده ها برای کار تفاوت قائل شوید.
- نحوه استفاده از سطل برای پارتیشن بندی داده ها را توضیح دهید.
- هنگام خواندن پرونده های HDFS با طرح ، برنامه اجرا را تجزیه و تحلیل کنید.
- تعیین زمان و چگونگی اعمال بهترین روشها برای پردازش داده ها.
- از ابزارها و تکنیک های مختلف برای ساختن راه حل با استفاده از Apache Spark و Hadoop استفاده کنید.
موضوعات مورد بحث عبارتند از:
- توضیح دهید که Apache Spark داده های خود را در کجا ذخیره می کند.
- بین انواع داده ها برای کار تفاوت قائل شوید.
- نحوه استفاده از سطل برای پارتیشن بندی داده ها را توضیح دهید.
- هنگام خواندن پرونده های HDFS با طرح ، برنامه اجرا را تجزیه و تحلیل کنید.
- تعیین زمان و چگونگی اعمال بهترین روشها برای پردازش داده ها.
- از ابزارها و تکنیک های مختلف برای ساختن راه حل با استفاده از Apache Spark و Hadoop استفاده کنید.
مهارت ها
HadoopApache SparkApacheData EngineeringData AnalysisData ScienceBusiness Analysis and StrategyBusiness Software and ToolsDeep Dive (X:Y)
سرفصل ها
مقدمه
- قدرت ترکیبی Spark و Hadoop Distributed File System (HDFS)
معرفی و راه اندازی
- Apache Hadoop نمای کلی
- Apache Spark نمای کلی
- یکپارچه سازی هادوپ و اسپارک
- تنظیم محیط
- استفاده از فایل های تمرینی
مدل سازی داده HDFS برای تجزیه و تحلیل
- فرمت های ذخیره سازی
- فشرده سازی
- پارتیشن بندی
- سطوبندی
- بهترین روش ها برای ذخیره سازی داده ها
بلع داده ها با Spark
- خواندن فایل های خارجی در Spark
- نوشتن به HDFS
- موازی می نویسد با پارتیشن بندی
- موازی با سطل می نویسد
- بهترین شیوه ها برای بلع
استخراج داده ها با اسپارک
- چگونه اسپارک کار می کند
- خواندن فایل های HDFS با طرحواره
- خواندن داده های پارتیشن بندی شده
- خواندن داده های سطلی
- بهترین روش ها برای استخراج داده ها
بهینه سازی پردازش جرقه
- فشار دادن به پایین برآمدگی ها
- فیلترها را فشار دهید
- مدیریت پارتیشن ها
- مدیریت زدن
- بهبود اتصالات
- ذخیره نتایج میانی
- بهترین شیوه ها برای پردازش داده ها
از پروژه Case استفاده کنید
- تعریف مسئله
- بارگذاری داده ها
- تحلیل نمره کل
- تحلیل میانگین امتیاز
- تحلیل دانش آموزان برتر
نتیجه
- مراحل بعدی