دوره آموزشی پردازش متون با یادگیری جامع زبان R
56 دقیقهمتوسط2019-09-19
مدرسین

Kumaran Ponnambalam
Working with data for 20+ years
جزئیات دوره
کلان داده ها و خطوط لوله تحلیلی امروزی داده های متنی تولید شده از طریق وب سایت ها، رسانه های اجتماعی و ارتباطات خصوصی را بیشتر و بیشتر مصرف می کنند. اما استخراج بینش از متن ساده نیست. برای تهیه متن برای تجزیه و تحلیل و یادگیری ماشین به یک سری تکنیک ها و فرم ها نیاز دارد. در این دوره، تکنیک های ضروری برای پاکسازی و پردازش متن در R را بیاموزید و نحوه تبدیل متن به فرمی آماده برای تجزیه و تحلیل و پیش بینی را بیاموزید. Kumaran Ponnambalam با مرور تکنیکهای استخراج، پاکسازی و پردازش متن شروع میکند. سپس نحوه تبدیل متن به فرم آماده تجزیه و تحلیل، از جمله نحوه استفاده از n-gram و TF-IDF را نشان می دهد. در طول دوره، او نمونه هایی برای تمرین این تکنیک ها با استفاده از کتابخانه های R و tm ارائه می دهد.
اهداف یادگیری
دریافت متن از منابع مختلف
پاکسازی و تبدیل داده های متنی
آماده سازی ماتریس های TF-IDF برای یادگیری ماشین
ساخت پایگاه داده n-gram برای پیش بینی متن
بهترین روش ها برای مقیاس پذیری و ذخیره متن
اهداف یادگیری
دریافت متن از منابع مختلف
پاکسازی و تبدیل داده های متنی
آماده سازی ماتریس های TF-IDF برای یادگیری ماشین
ساخت پایگاه داده n-gram برای پیش بینی متن
بهترین روش ها برای مقیاس پذیری و ذخیره متن
مهارت ها
RStatisticsEssential TrainingProgramming LanguagesData ScienceOpen SourceSoftware Development
سرفصل ها
مقدمه
- پیدایش تجزیه و تحلیل متن
مقدمه ای بر متن کاوی
- هدف
- سند
- پیکره
- کتابخانه های پردازش متن R
- راه اندازی محیط
Corpus در R
- PCorpus و VCorpus
- خواندن فایل ها با CorpusReader
- کاوش پیکره
- تداوم پیکره
پاکسازی و استخراج متن
- راه اندازی برای پردازش
- متن پاک کننده
- حذف کلمه را متوقف کنید
- ساقه
- مدیریت ابرداده
TF-IDF
- مقدمه ای بر tf-idf
- تولید ماتریس فرکانس مدت
- بهبود ماتریس فرکانس مدت
- فرکانس ترم رسم
- تولید tf-idf
N-گرم
- مفاهیم N گرم
- استفاده از RWeka NGramTokenizer
- ایجاد ماتریس بسامد متن n گرم
- استخراج جفت n گرم
بهترین شیوه ها
- ذخیره متن
- پردازش داده های متنی
- مقیاس پذیری
نتیجه
- مراحل بعدی