دوره آموزشی تحلیل اکتشافی داده با Python
3 ساعت 13 دقیقهمتوسط2026-08-27
مدرسین

Anaconda, Inc
جزئیات دوره
دادههای واقعی تقریباً هیچوقت در همان ابتدا آماده تحلیل نیستند. فایلهای خام معمولاً شامل مقادیر گمشده، ستونهای نامنظم، دادههای ناسازگار و اطلاعاتی هستند که برای رسیدن به یک تحلیل قابل اعتماد باید ابتدا پردازش و آمادهسازی شوند. مهارت اصلی یک تحلیلگر داده فقط اجرای چند دستور تحلیلی نیست؛ بلکه توانایی مدیریت داده از فایل خام تا Insight قابل استفاده است.
در این دوره، با استفاده از Python و pandas و یک مجموعهداده واقعی مربوط به برخورد پرندگان با هواپیماها (FAA Bird Strike)، یک فرآیند کامل Exploratory Data Analysis (EDA) را از ابتدا تا انتها اجرا میکنید. ابتدا یاد میگیرید چگونه یک دیتاست بزرگ و خام را بارگذاری و بررسی کنید، مقادیر گمشده را مدیریت کنید و ستونهای نامنظم را پاکسازی و به Data Type مناسب تبدیل کنید.
در ادامه، با Feature Engineering آشنا میشوید و یاد میگیرید چگونه با استفاده از Join، Aggregation و Boolean Indicator ویژگیهای جدیدی ایجاد کنید. سپس روابط میان متغیرها را با Correlation Analysis بررسی کرده و با استفاده از ماتریسهای همبستگی و تحلیل روندهای زمانی، الگوهای مهم موجود در داده را شناسایی میکنید.
بخش دیگری از دوره به شناسایی و مدیریت Outlierها اختصاص دارد؛ اما نه صرفاً بر اساس یک قانون آماری، بلکه با در نظر گرفتن زمینه و ماهیت مسئله. همچنین با تحلیلهای Time-Based و Geospatial کار میکنید و یاد میگیرید چگونه با استفاده از GeoPandas الگوهای جغرافیایی موجود در داده را روی لایههای نقشه نمایش دهید.
در پایان، با استفاده از Group By و Pivot Table دادهها را در سطوح مختلف تجمیع و خلاصه میکنید و از نتایج بهدستآمده برای پیدا کردن الگوها و Insights معنادار استفاده خواهید کرد. این دوره برای Data Analystها، Data Scientistها، Python Developerها و افرادی طراحی شده است که میخواهند بهجای کار با دادههای ازپیشآماده، مهارت تحلیل یک دیتاست واقعی را از ابتدا تا انتها یاد بگیرند.
اهداف یادگیری
بارگذاری و بررسی یک دیتاست بزرگ و واقعی با استفاده از pandas
شناسایی ساختار، کیفیت و مشکلات اولیه موجود در دادههای خام
مدیریت مقادیر گمشده و تبدیل ستونها به Data Type مناسب
پاکسازی و استانداردسازی ستونهای نامنظم برای آمادهسازی تحلیل
ایجاد Featureهای جدید با استفاده از Join، Aggregation و Boolean Indicator
تحلیل روابط میان متغیرها با استفاده از Correlation Matrix و روندهای زمانی
شناسایی و مدیریت Outlierها با توجه به زمینه و ماهیت مسئله
تحلیل الگوهای زمانی و جغرافیایی موجود در دادههای واقعی
نمایش الگوهای جغرافیایی با استفاده از GeoPandas و Map Layers
اجرای یک Workflow کامل EDA و تبدیل داده خام به الگوها و Insights قابل استفاده
در این دوره، با استفاده از Python و pandas و یک مجموعهداده واقعی مربوط به برخورد پرندگان با هواپیماها (FAA Bird Strike)، یک فرآیند کامل Exploratory Data Analysis (EDA) را از ابتدا تا انتها اجرا میکنید. ابتدا یاد میگیرید چگونه یک دیتاست بزرگ و خام را بارگذاری و بررسی کنید، مقادیر گمشده را مدیریت کنید و ستونهای نامنظم را پاکسازی و به Data Type مناسب تبدیل کنید.
در ادامه، با Feature Engineering آشنا میشوید و یاد میگیرید چگونه با استفاده از Join، Aggregation و Boolean Indicator ویژگیهای جدیدی ایجاد کنید. سپس روابط میان متغیرها را با Correlation Analysis بررسی کرده و با استفاده از ماتریسهای همبستگی و تحلیل روندهای زمانی، الگوهای مهم موجود در داده را شناسایی میکنید.
بخش دیگری از دوره به شناسایی و مدیریت Outlierها اختصاص دارد؛ اما نه صرفاً بر اساس یک قانون آماری، بلکه با در نظر گرفتن زمینه و ماهیت مسئله. همچنین با تحلیلهای Time-Based و Geospatial کار میکنید و یاد میگیرید چگونه با استفاده از GeoPandas الگوهای جغرافیایی موجود در داده را روی لایههای نقشه نمایش دهید.
در پایان، با استفاده از Group By و Pivot Table دادهها را در سطوح مختلف تجمیع و خلاصه میکنید و از نتایج بهدستآمده برای پیدا کردن الگوها و Insights معنادار استفاده خواهید کرد. این دوره برای Data Analystها، Data Scientistها، Python Developerها و افرادی طراحی شده است که میخواهند بهجای کار با دادههای ازپیشآماده، مهارت تحلیل یک دیتاست واقعی را از ابتدا تا انتها یاد بگیرند.
اهداف یادگیری
بارگذاری و بررسی یک دیتاست بزرگ و واقعی با استفاده از pandas
شناسایی ساختار، کیفیت و مشکلات اولیه موجود در دادههای خام
مدیریت مقادیر گمشده و تبدیل ستونها به Data Type مناسب
پاکسازی و استانداردسازی ستونهای نامنظم برای آمادهسازی تحلیل
ایجاد Featureهای جدید با استفاده از Join، Aggregation و Boolean Indicator
تحلیل روابط میان متغیرها با استفاده از Correlation Matrix و روندهای زمانی
شناسایی و مدیریت Outlierها با توجه به زمینه و ماهیت مسئله
تحلیل الگوهای زمانی و جغرافیایی موجود در دادههای واقعی
نمایش الگوهای جغرافیایی با استفاده از GeoPandas و Map Layers
اجرای یک Workflow کامل EDA و تبدیل داده خام به الگوها و Insights قابل استفاده
سرفصل ها
مقدمه
- شروع کار با Anaconda Notebooks
- مرور کلی دوره و اهداف یادگیری
جمعآوری و انتخاب داده
- جمعآوری و پاکسازی داده
- مجموعه داده برخورد با پرندگان
- پاکسازی اولیه
- ذخیره دادههای ما
- کاوش در منابع داده
- تمرین - انتخاب ویژگیها
دادههای گمشده و پاکسازی
- یافتن مقادیر گمشده
- متغیرهای طبقهبندی و عددی
- تبدیل تاریخ و زمان
- تبدیل دادههای عددی
- تبدیل دادههای طبقهبندی
- تمرین - فیلتر کردن کدهای فرودگاه
تحلیل تکمتغیره و نقاط پرت
- متغیر ارتفاع
- متغیر مرحله پرواز
- متغیر سرعت
- نقاط پرت - دامنه میانچهارکی (IQR) و صدکها
- نقاط پرت - دامنه میانچهارکی (IQR) و صدکها ادامه
- نقاط پرت بر اساس انحراف معیار
- تمرین - تحلیل متغیرها
تحلیل دومتغیره و چندمتغیره
- مقایسه ارتفاع با سرعت
- مقایسه متغیرها با مسافت
- متغیرهای پیشبینیکننده
- تحلیل چندمتغیره
- تحلیل چندمتغیره ادامه
- تمرین - تحلیل هزینه سرعت
تحلیل سری زمانی
- برخورد با پرندگان بر اساس تاریخ
- فرضیه برخورد با پرندگان بر اساس تاریخ
- برخورد با پرندگان بر اساس زمان روز
- تمرین - تحلیل روزهای هفته
تحلیل مکانی
- نقشه پایه با استفاده از ژئوپانداس
- استانها و ایالتها
- تمرین - برخوردهای پرندگان
نتیجهگیری
- خلاصه