دوره آموزشی Data Ingestion با پایتون
1 ساعت 24 دقیقهمتوسط2023-12-22
مدرسین

Miki Tebeka
CEO at 353Solutions
جزئیات دوره
بخش قابل توجهی از وقت دانشمندان داده، اغلب صرف واکشی و تمیز کردن دادههای لازم برای آموزش الگوریتمهای آنها میشود. در این دوره یاد بگیرید که چگونه از ابزارها و تکنیکهای پایتون استفاده کنید تا دادههای مناسب و باکیفیت مورد نیاز خود را بدست آورید. مربی Miki Tebeka خواندن فایلها را پوشش میدهد، از جمله نحوه کار با فایلهای CSV، XML و JSON . او همچنین در مورد فراخوانی API، scraping وب (و چرا باید آخرین راه حل) و اعتبار و تمیز کردن دادهها، بحث میکند. به علاوه، نحوه ایجاد و نظارت بر شاخصهای کلیدی عملکرد (KPI) را که به شما در نظارت بر مسیر داده کمک میکند را کشف کنید.
اهداف یادگیری
ویژگی های انواع داده های مختلف و کار دانشمندان داده را شرح دهید.
فرمت های مختلف سریال سازی داده ها را توضیح دهید و نحوه استفاده از آنها را در پایتون توضیح دهید.
API ها را تعریف کنید و نحوه استفاده از آنها را با پایتون برای برقراری تماس http، تفسیر JSON و استفاده از صف های پیام توضیح دهید.
توضیح دهید که اسکرپ وب چیست و روشهای انجام آن را توضیح دهید.
طرحواره را تعریف کنید و ویژگی های طرحواره ها و نحوه تأثیر آنها بر عملیات را شرح دهید.
ویژگی های انواع مختلف پایگاه های داده را شرح دهید.
انواع خطاها را دسته بندی کرده و نحوه اصلاح آنها را توضیح دهید.
معیارهای طراحی سیستم های داده را توضیح دهید و نحوه نظارت بر عملکرد را با استفاده از KPI توضیح دهید.
اهداف یادگیری
ویژگی های انواع داده های مختلف و کار دانشمندان داده را شرح دهید.
فرمت های مختلف سریال سازی داده ها را توضیح دهید و نحوه استفاده از آنها را در پایتون توضیح دهید.
API ها را تعریف کنید و نحوه استفاده از آنها را با پایتون برای برقراری تماس http، تفسیر JSON و استفاده از صف های پیام توضیح دهید.
توضیح دهید که اسکرپ وب چیست و روشهای انجام آن را توضیح دهید.
طرحواره را تعریف کنید و ویژگی های طرحواره ها و نحوه تأثیر آنها بر عملیات را شرح دهید.
ویژگی های انواع مختلف پایگاه های داده را شرح دهید.
انواع خطاها را دسته بندی کرده و نحوه اصلاح آنها را توضیح دهید.
معیارهای طراحی سیستم های داده را توضیح دهید و نحوه نظارت بر عملکرد را با استفاده از KPI توضیح دهید.
مهارت ها
Data EngineeringPythonProgramming LanguagesData ScienceOpen SourceSoftware DevelopmentOne-Off
سرفصل ها
مقدمه
- چرا Data Ingestion مهم است
- آنچه باید بدانید
- استفاده از فایلهای تمرین
- استفاده از آزمونهای Coderpad
مروری بر Data Ingestion
- مروری بر کار دانشمندان داده
- دادهها از کجا میآیند
- انواع مختلف داده ها
- خط لوله داده (ETL)
- مقصد نهایی (دریاچه داده)
خواندن فایل ها
- کار در CSV
- کار در XML
- کار در پارکت، Avro، و ORC
- متن بدون ساختار
- JSON
- راه حل - CSV به JSON
فراخوانی APIها
- کار با JSON
- برقراری تماس HTTP
- پردازش دادههای مبتنی بر رویداد
- راه حل - مکان از IP
Web Scraping
- سعی کنید یک API پیدا کنید
- کار با Beautiful Soup
- کار با اسکرپی
- کار با سلنیوم
- سایر ملاحظات
- راه حل - اطلاعات سهام را از HTML دریافت کنید
طرحواره
- طرحوارهها چیست؟
- کار با ontologies
- آنچه باید در طرحواره باشد
- تغییرات طرحواره
- اعتبارسنجی طرحواره
کار با پایگاههای داده
- انواع پایگاههای اطلاعاتی
- میزبانی و هزینه عملیات
- کار با پایگاه دادههای رابطه ای
- کار با پایگاه دادههای کلیدی یا ارزشی
- کار با پایگاههای اسناد
- کار با پایگاه دادههای گراف
- راه حل - ETL
عیب یابی داده ها
- دادهها هرگز 100 نیست
- علل خطا
- پر کردن مقادیر از دست رفته
- یافتن نقاط پرت (دستی)
- یافتن نقاط پرت (ML)
- راه حل - مجموعه داده سواری تمیز
KPIهای داده و فرآیند
- دادههای خود را طراحی کنید
- KPI
- چه چیزی را نظارت کنیم
نتیجه
- مراحل بعدی