دوره آموزشی تجزیه و تحلیل داده های بزرگ با Hadoop و Apache Spark آپدیت (2020)

دوره آموزشی تجزیه و تحلیل داده های بزرگ با Hadoop و Apache Spark آپدیت (2020)

1 ساعت 2 دقیقهمتوسط2020-02-24

مدرسین

Kumaran Ponnambalam

Kumaran Ponnambalam

Working with data for 20+ years

جزئیات دوره

Apache Hadoop در دنیای فناوری های کلان داده پیشگام بود و همچنان در ذخیره سازی داده های بزرگ سازمانی پیشرو است. Apache Spark برترین موتور پردازش داده های بزرگ است و مجموعه ای چشمگیر از ویژگی ها و قابلیت ها را فراهم می کند. هنگامی که با هم استفاده می شود ، سیستم پرونده توزیع شده Hadoop (HDFS) و Spark می توانند یک تنظیم تجزیه و تحلیل داده های بزرگ واقعاً مقیاس پذیر را ارائه دهند. در این دوره ، یاد بگیرید چگونه از این دو فناوری برای ساخت خطوط لوله تجزیه و تحلیل مقیاس پذیر و بهینه استفاده کنید. مربی Kumaran Ponnambalam روش هایی را برای بهینه سازی مدل سازی و ذخیره سازی داده ها در HDFS بررسی می کند. در مورد مصرف و استخراج داده های مقیاس پذیر با استفاده از Spark بحث می کند. و نکاتی را برای بهینه سازی پردازش داده ها در Spark ارائه می دهد. به علاوه ، او یک پروژه مورد استفاده را فراهم می کند که به شما امکان می دهد تکنیک های جدید خود را تمرین کنید.
موضوعات مورد بحث عبارتند از:
- توضیح دهید که Apache Spark داده های خود را در کجا ذخیره می کند.
- بین انواع داده ها برای کار تفاوت قائل شوید.
- نحوه استفاده از سطل برای پارتیشن بندی داده ها را توضیح دهید.
- هنگام خواندن پرونده های HDFS با طرح ، برنامه اجرا را تجزیه و تحلیل کنید.
- تعیین زمان و چگونگی اعمال بهترین روشها برای پردازش داده ها.
- از ابزارها و تکنیک های مختلف برای ساختن راه حل با استفاده از Apache Spark و Hadoop استفاده کنید.

مهارت ها

HadoopApache SparkApacheData EngineeringData AnalysisData ScienceBusiness Analysis and StrategyBusiness Software and ToolsDeep Dive (X:Y)

سرفصل ها

مقدمه

  • قدرت ترکیبی Spark و Hadoop Distributed File System (HDFS)

معرفی و راه اندازی

  • Apache Hadoop نمای کلی
  • Apache Spark نمای کلی
  • یکپارچه سازی هادوپ و اسپارک
  • تنظیم محیط
  • استفاده از فایل های تمرینی

مدل سازی داده HDFS برای تجزیه و تحلیل

  • فرمت های ذخیره سازی
  • فشرده سازی
  • پارتیشن بندی
  • سطوبندی
  • بهترین روش ها برای ذخیره سازی داده ها

بلع داده ها با Spark

  • خواندن فایل های خارجی در Spark
  • نوشتن به HDFS
  • موازی می نویسد با پارتیشن بندی
  • موازی با سطل می نویسد
  • بهترین شیوه ها برای بلع

استخراج داده ها با اسپارک

  • چگونه اسپارک کار می کند
  • خواندن فایل های HDFS با طرحواره
  • خواندن داده های پارتیشن بندی شده
  • خواندن داده های سطلی
  • بهترین روش ها برای استخراج داده ها

بهینه سازی پردازش جرقه

  • فشار دادن به پایین برآمدگی ها
  • فیلترها را فشار دهید
  • مدیریت پارتیشن ها
  • مدیریت زدن
  • بهبود اتصالات
  • ذخیره نتایج میانی
  • بهترین شیوه ها برای پردازش داده ها

از پروژه Case استفاده کنید

  • تعریف مسئله
  • بارگذاری داده ها
  • تحلیل نمره کل
  • تحلیل میانگین امتیاز
  • تحلیل دانش آموزان برتر

نتیجه

  • مراحل بعدی
۴۰,۰۰۰ تومان