دوره آموزشی پاکسازی داده با pandas
3 ساعت 6 دقیقهمتوسط2026-08-27
مدرسین

Anaconda, Inc
جزئیات دوره
دادههای واقعی بهندرت در شرایط ایدهآل وارد فرایند تحلیل میشوند. مقادیر گمشده، متنهای ناسازگار، دادههای تکراری و Outlierها میتوانند بدون اینکه بهسادگی متوجه آنها شوید، نتایج تحلیل را تحت تأثیر قرار دهند. بنابراین، یکی از مهمترین مهارتها در مسیر تحلیل داده، توانایی تبدیل دادههای خام و نامنظم به یک Dataset تمیز، قابل اعتماد و آماده تحلیل است.
این دوره به شما یاد میدهد چگونه با استفاده از pandas دادههای خام را بررسی، پاکسازی و برای مراحل بعدی تحلیل آماده کنید. ابتدا با ساختارهای اصلی pandas مانند Series و DataFrame آشنا میشوید و سپس به سراغ تکنیکهایی میروید که تحلیلگران و متخصصان داده در پروژههای واقعی برای بهبود کیفیت داده استفاده میکنند.
در ادامه یاد میگیرید چگونه با استفاده از iloc و loc ردیفها و ستونهای موردنظر را انتخاب کنید و با کمک Boolean Conditions دادهها را بر اساس شرایط مختلف فیلتر کنید. این مهارتها پایهای برای کار مؤثر با Datasetهای بزرگتر و انجام عملیات دقیقتر روی دادهها هستند.
بخش دیگری از دوره به پاکسازی دادههای متنی اختصاص دارد. در این بخش با Regular Expressions (Regex) آشنا میشوید و یاد میگیرید چگونه متنهای نامنظم را پاکسازی، استاندارد و با الگوهای مشخص تطبیق دهید.
سپس به یکی از رایجترین مشکلات دادههای واقعی، یعنی Missing Data، میپردازید. یاد میگیرید چه زمانی حذف مقادیر گمشده منطقی است، چه زمانی باید آنها را با مقادیر مناسب جایگزین کنید و چگونه از روشهای آماری برای Imputation دادههای ناقص استفاده کنید.
در نهایت با Outlierها و نحوه برخورد صحیح با آنها آشنا میشوید. بهجای اینکه هر مقدار غیرعادی را بهصورت خودکار حذف کنید، یاد میگیرید ابتدا بررسی کنید این مقادیر چه معنایی دارند و آیا واقعاً ناشی از خطا هستند یا بخشی معتبر از مسئله موردنظر محسوب میشوند.
در پایان دوره، میتوانید مشکلات مربوط به کیفیت یک Dataset را شناسایی کنید، دادههای نامنظم و ناقص را اصلاح کنید و یک مجموعه داده قابل اعتماد برای تحلیلهای بعدی آماده کنید. این دوره در سطح Intermediate طراحی شده و برای تحلیلگران داده، دانشمندان داده، توسعهدهندگان Python و تمام افرادی مناسب است که بهصورت حرفهای با داده کار میکنند.
اهداف یادگیری
کار با ساختارهای Series و DataFrame در کتابخانه pandas
انتخاب ردیفها و ستونهای موردنظر با استفاده از iloc و loc
فیلتر کردن دادهها با استفاده از Boolean Conditions
پاکسازی و تطبیق دادههای متنی با استفاده از Regular Expressions
شناسایی و مدیریت مقادیر گمشده در Dataset
انتخاب روش مناسب برای حذف، جایگزینی یا Imputation مقادیر ناقص
شناسایی Outlierها و بررسی علت وجود آنها پیش از حذف
حذف یا مدیریت Outlierها متناسب با ماهیت مسئله و کاربرد داده
تشخیص مشکلات مختلف کیفیت داده و ارزیابی تأثیر آنها بر تحلیل
آمادهسازی یک Dataset تمیز، منسجم و قابل اعتماد برای تحلیلهای بعدی
این دوره به شما یاد میدهد چگونه با استفاده از pandas دادههای خام را بررسی، پاکسازی و برای مراحل بعدی تحلیل آماده کنید. ابتدا با ساختارهای اصلی pandas مانند Series و DataFrame آشنا میشوید و سپس به سراغ تکنیکهایی میروید که تحلیلگران و متخصصان داده در پروژههای واقعی برای بهبود کیفیت داده استفاده میکنند.
در ادامه یاد میگیرید چگونه با استفاده از iloc و loc ردیفها و ستونهای موردنظر را انتخاب کنید و با کمک Boolean Conditions دادهها را بر اساس شرایط مختلف فیلتر کنید. این مهارتها پایهای برای کار مؤثر با Datasetهای بزرگتر و انجام عملیات دقیقتر روی دادهها هستند.
بخش دیگری از دوره به پاکسازی دادههای متنی اختصاص دارد. در این بخش با Regular Expressions (Regex) آشنا میشوید و یاد میگیرید چگونه متنهای نامنظم را پاکسازی، استاندارد و با الگوهای مشخص تطبیق دهید.
سپس به یکی از رایجترین مشکلات دادههای واقعی، یعنی Missing Data، میپردازید. یاد میگیرید چه زمانی حذف مقادیر گمشده منطقی است، چه زمانی باید آنها را با مقادیر مناسب جایگزین کنید و چگونه از روشهای آماری برای Imputation دادههای ناقص استفاده کنید.
در نهایت با Outlierها و نحوه برخورد صحیح با آنها آشنا میشوید. بهجای اینکه هر مقدار غیرعادی را بهصورت خودکار حذف کنید، یاد میگیرید ابتدا بررسی کنید این مقادیر چه معنایی دارند و آیا واقعاً ناشی از خطا هستند یا بخشی معتبر از مسئله موردنظر محسوب میشوند.
در پایان دوره، میتوانید مشکلات مربوط به کیفیت یک Dataset را شناسایی کنید، دادههای نامنظم و ناقص را اصلاح کنید و یک مجموعه داده قابل اعتماد برای تحلیلهای بعدی آماده کنید. این دوره در سطح Intermediate طراحی شده و برای تحلیلگران داده، دانشمندان داده، توسعهدهندگان Python و تمام افرادی مناسب است که بهصورت حرفهای با داده کار میکنند.
اهداف یادگیری
کار با ساختارهای Series و DataFrame در کتابخانه pandas
انتخاب ردیفها و ستونهای موردنظر با استفاده از iloc و loc
فیلتر کردن دادهها با استفاده از Boolean Conditions
پاکسازی و تطبیق دادههای متنی با استفاده از Regular Expressions
شناسایی و مدیریت مقادیر گمشده در Dataset
انتخاب روش مناسب برای حذف، جایگزینی یا Imputation مقادیر ناقص
شناسایی Outlierها و بررسی علت وجود آنها پیش از حذف
حذف یا مدیریت Outlierها متناسب با ماهیت مسئله و کاربرد داده
تشخیص مشکلات مختلف کیفیت داده و ارزیابی تأثیر آنها بر تحلیل
آمادهسازی یک Dataset تمیز، منسجم و قابل اعتماد برای تحلیلهای بعدی
سرفصل ها
مقدمه
- شروع کار با Anaconda Notebooks
- مبانی pandas
- DataFrameهای pandas
- وارد کردن داده در pandas
انتخاب سطرها و ستونها
- انتخاب سطرها و ستونها
- حذف سطرها بر اساس شرط
- بهروزرسانی دادهها - تمرین
مرتبسازی، نگاشت و دستهبندی
- مرتبسازی، تبدیل نوع و دستهبندی
- دستهبندی - تمرین
حذف دادههای تکراری و پراکنده
- حذف دادههای تکراری و پراکنده
- حذف ستونهایی با یک مقدار
- حذف ستونهایی با واریانس پایین - تمرین
مدیریت دادههای ازدسترفته
- مدیریت دادههای ازدسترفته
- حذف سطرهای دارای مقادیر ازدسترفته
- پر کردن مقادیر ازدسترفته با نزدیکترین همسایه - تمرین
نقاط پرت
- نقاط پرت
- استفاده از عامل پرت محلی (LOF) - تمرین
تاریخها و زمانها
- تاریخها و زمانها
- فیلتر کردن بر اساس تاریخزمان
- تاریخها و زمانها - تمرین
پردازش متن
- پردازش متن
- مبانی عبارت منظم (RegEx)
- تطابق جزئی و کامل رشته
- یافتن همه تطابقها - تمرین
نتیجهگیری
- نتیجهگیری