دوره آموزشی مدلهای استدلالی هوش مصنوعی: پایههای ساخت نسل بعدی اپلیکیشنهای هوش مصنوعی
1 ساعت 17 دقیقهپیشرفته2026-09-11
مدرسین

Sebastian Raschka
جزئیات دوره
مدلهای زبانی بزرگ مجهز به قابلیت استدلال (Reasoning-Enhanced LLMs) نسل جدیدی از مدلهای هوش مصنوعی هستند که برای حل مسائل پیچیدهتر، از جمله چالشهای برنامهنویسی، مسائل چندمرحلهای و وظایفی که به حل مسئله پیشرفته نیاز دارند، طراحی شدهاند. در این دوره، با تفاوت این مدلها با LLMهای معمولی آشنا میشوید و بررسی میکنید چه زمانی استفاده از یک Reasoning Model میتواند انتخاب مناسبی باشد.
در طول دوره، با استفاده از نمونههای واقعی مانند DeepSeek-R1، روشهای اصلی ایجاد و تقویت قابلیت استدلال در مدلهای زبانی را بررسی میکنید. موضوعاتی مانند Inference-Time Scaling، Reinforcement Learning و Distillation بهصورت کاربردی بررسی میشوند تا درک کنید چگونه میتوان توانایی استدلال مدلها را افزایش داد.
همچنین مزایا و محدودیتهای Reasoning Modelها را در مقایسه با مدلهای معمولی بررسی خواهید کرد و با Trade-offهای میان کیفیت خروجی، سرعت و کارایی، هزینه محاسباتی و هزینه توسعه آشنا میشوید. در ادامه، راهکارهایی برای توسعه مدلهای استدلالی با بودجه محدود، از جمله استفاده از Distillation، مورد بررسی قرار میگیرد.
در پایان دوره، دید بهتری نسبت به معماری و روشهای توسعه Reasoning LLMها خواهید داشت و میتوانید هنگام طراحی پروژههای هوش مصنوعی، انتخاب آگاهانهتری میان مدلهای معمولی و مدلهای مجهز به قابلیت استدلال داشته باشید.
اهداف یادگیری
تفاوتهای اصلی میان LLMهای معمولی و Reasoning-Enhanced LLMها را توضیح دهید
مزایا و محدودیتهای Reasoning Modelها را در مقایسه با مدلهای متداول ارزیابی کنید
کاربرد Reasoning Modelها را در مسائل پیچیده، Coding و وظایف چندمرحلهای بررسی کنید
رویکردهای اصلی ساخت و تقویت قابلیت استدلال در مدلهای زبانی را توضیح دهید
کاربرد و جایگاه Inference-Time Scaling را در توسعه مدلهای استدلالی بررسی کنید
نقش Reinforcement Learning را در بهبود قابلیتهای Reasoning مدلها تحلیل کنید
فرآیند Distillation را برای انتقال قابلیتهای یک مدل قوی به مدل کوچکتر بررسی کنید
Trade-off میان کیفیت، کارایی، زمان پردازش و هزینه توسعه Reasoning Modelها را مقایسه کنید
راهکارهای مقرونبهصرفه برای توسعه مدلهای استدلالی با منابع محدود را شناسایی کنید
بر اساس نیاز پروژه، پیچیدگی مسئله و محدودیتهای منابع، رویکرد مناسب برای استفاده یا توسعه Reasoning Model انتخاب کنید
در طول دوره، با استفاده از نمونههای واقعی مانند DeepSeek-R1، روشهای اصلی ایجاد و تقویت قابلیت استدلال در مدلهای زبانی را بررسی میکنید. موضوعاتی مانند Inference-Time Scaling، Reinforcement Learning و Distillation بهصورت کاربردی بررسی میشوند تا درک کنید چگونه میتوان توانایی استدلال مدلها را افزایش داد.
همچنین مزایا و محدودیتهای Reasoning Modelها را در مقایسه با مدلهای معمولی بررسی خواهید کرد و با Trade-offهای میان کیفیت خروجی، سرعت و کارایی، هزینه محاسباتی و هزینه توسعه آشنا میشوید. در ادامه، راهکارهایی برای توسعه مدلهای استدلالی با بودجه محدود، از جمله استفاده از Distillation، مورد بررسی قرار میگیرد.
در پایان دوره، دید بهتری نسبت به معماری و روشهای توسعه Reasoning LLMها خواهید داشت و میتوانید هنگام طراحی پروژههای هوش مصنوعی، انتخاب آگاهانهتری میان مدلهای معمولی و مدلهای مجهز به قابلیت استدلال داشته باشید.
اهداف یادگیری
تفاوتهای اصلی میان LLMهای معمولی و Reasoning-Enhanced LLMها را توضیح دهید
مزایا و محدودیتهای Reasoning Modelها را در مقایسه با مدلهای متداول ارزیابی کنید
کاربرد Reasoning Modelها را در مسائل پیچیده، Coding و وظایف چندمرحلهای بررسی کنید
رویکردهای اصلی ساخت و تقویت قابلیت استدلال در مدلهای زبانی را توضیح دهید
کاربرد و جایگاه Inference-Time Scaling را در توسعه مدلهای استدلالی بررسی کنید
نقش Reinforcement Learning را در بهبود قابلیتهای Reasoning مدلها تحلیل کنید
فرآیند Distillation را برای انتقال قابلیتهای یک مدل قوی به مدل کوچکتر بررسی کنید
Trade-off میان کیفیت، کارایی، زمان پردازش و هزینه توسعه Reasoning Modelها را مقایسه کنید
راهکارهای مقرونبهصرفه برای توسعه مدلهای استدلالی با منابع محدود را شناسایی کنید
بر اساس نیاز پروژه، پیچیدگی مسئله و محدودیتهای منابع، رویکرد مناسب برای استفاده یا توسعه Reasoning Model انتخاب کنید
سرفصل ها
مقدمه
- درک LLMها و مدلهای استدلال
مدلهای استدلال چیستند
- توسعه LLMها - مروری مختصر
- LLMها در مقابل مدلهای استدلال
- مفهوم استدلال در LLMها
- موارد کاربرد مدلهای استدلال
بهبود استدلال با مقیاسدهی در زمان استنتاج
- مقیاسدهی در زمان استنتاج چیست
- مثال عملی - پرامپتدهی زنجیره افکار (CoT)
- خود-سازگاری و رأیگیری اکثریت
- مثال عملی - استفاده از LLMها از طریق مدلهای GitHub
- مثال عملی - مقیاسدهی در زمان استنتاج از طریق فراخوانیهای API
- مقیاسدهی در زمان آزمون در مقابل مقیاسدهی در زمان آموزش - موازنههای عملکرد و هزینه
تقطیر برای مدلهای استدلالی
- تنظیم دقیق نظارتشده (SFT) چیست؟
- تقطیر در LLMها چیست؟
- انواع دادههای SFT برای استدلال
- مطالعه موردی - DeepSeek R1-Distill
- پروژههای تقطیر مقرونبهصرفه
- تمرین عملی - یک مدل تقطیرشده در عمل
یادگیری تقویتی برای استدلال
- مقدمهای بر یادگیری تقویتی (RL) در LLMها
- سیگنالهای آموزشی - مبتنی بر قانون در مقابل بازخورد انسانی
- مطالعه موردی - DeepSeek-R1-Zero و استدلال با RL خالص
- RL و تنظیم دقیق دستورالعمل (SFT)
- مثال عملی - مقایسه مدلهای استدلالی مبتنی بر RL
- تقطیر در مقابل یادگیری تقویتی
نتیجهگیری
- گامهای بعدی با مدلهای استد