دوره آموزشی ارزیابیهای هوش مصنوعی در n8n: ساخت خروجیهای باکیفیت و قابلاعتماد
1 ساعت 24 دقیقهمتوسط2026-09-02
مدرسین

Tobias Zwingmann
جزئیات دوره
با انتقال سازمانها از مرحله آزمایش مدلهای زبانی بزرگ (LLM) به استفاده از Workflowهای هوش مصنوعی در محیط تولید، ارزیابی عملکرد AI به یک مهارت ضروری تبدیل شده است. یک Workflow ممکن است در ابتدا عملکرد مناسبی داشته باشد، اما با تغییر پرامپتها، منابع داده یا نسخه مدل، دچار خطا، افت کیفیت یا توهمگویی (Hallucination) شود. بنابراین، تیمهای توسعه و سازنده سیستمهای AI به روشی قابل اعتماد برای اندازهگیری کیفیت و شناسایی این تغییرات نیاز دارند.
این دوره به شما نشان میدهد چگونه یک Pipeline ارزیابی قدرتمند و قابل اتکا در n8n ایجاد کنید تا بتوانید بهصورت مستمر عملکرد Workflowهای هوش مصنوعی خود را اندازهگیری و کنترل کنید. برای شروع، یک Workflow واقعی پرسشوپاسخ مبتنی بر RAG را بهعنوان سیستم تحت آزمایش قرار میدهید و یک Golden Dataset ایجاد میکنید. سپس با استفاده از معیارهای داخلی مانند Exact Match و Contains، خروجیها را ارزیابی میکنید و یاد میگیرید هر معیار چه اطلاعاتی در اختیار شما قرار میدهد و چه محدودیتهایی دارد.
در ادامه، وارد ارزیابی مبتنی بر LLM-as-a-Judge میشوید؛ روشی که در آن یک مدل زبانی عملکرد خروجی مدل دیگر را بر اساس معیارهای مشخص ارزیابی میکند. در این بخش، نحوه طراحی Judge Promptهای ساختاریافته، ایجاد Rubric یا معیار امتیازدهی، بررسی Faithfulness و افزایش سازگاری و کاهش سوگیری ارزیاب را یاد میگیرید.
در پایان، همه اجزای ارزیابی را در یک Pipeline یکپارچه قرار میدهید که میتواند معیارها را اجرا کند، امتیازها را تجمیع و خلاصه کند، هشدارهای خودکار ارسال کند و نتایج اجرای Workflowها را در یک محل ذخیرهسازی پایدار ثبت کند. به این ترتیب، ارزیابی از یک بررسی مقطعی به بخشی زنده و مستمر از فرایند توسعه، انتشار و نگهداری سیستمهای هوش مصنوعی تبدیل میشود.
اهداف یادگیری
مفهوم ارزیابی Workflowهای هوش مصنوعی و اهمیت آن در محیطهای Production را توضیح دهید.
یک Golden Dataset برای ارزیابی سیستمهای AI و Workflowهای مبتنی بر RAG ایجاد کنید.
خروجیهای هوش مصنوعی را با معیارهای مبتنی بر قانون مانند Exact Match و Contains اعتبارسنجی کنید.
محدودیتها و کاربردهای هر یک از معیارهای Rule-Based Evaluation را تحلیل کنید.
از روش LLM-as-a-Judge برای ارزیابی Correctness، Faithfulness و ظرافتهای تخصصی خروجیها استفاده کنید.
Judge Promptهای ساختاریافته را با استفاده از Scoring Rubric در نود LLM ابزار n8n طراحی کنید.
بررسیهای Faithfulness را برای شناسایی پاسخهای نادرست یا فاقد پشتوانه در Workflowهای RAG ایجاد کنید.
سازگاری ارزیابیکننده را بهبود دهید و عوامل ایجاد سوگیری در فرایند LLM-as-a-Judge را کاهش دهید.
یک Pipeline ارزیابی End-to-End در n8n برای اجرای معیارها و تولید خلاصه امتیازها طراحی کنید.
هشدارها و ثبت نتایج را بهصورت خودکار اجرا کنید تا روند کیفیت Workflowهای هوش مصنوعی در طول زمان قابل پایش باشد.
این دوره به شما نشان میدهد چگونه یک Pipeline ارزیابی قدرتمند و قابل اتکا در n8n ایجاد کنید تا بتوانید بهصورت مستمر عملکرد Workflowهای هوش مصنوعی خود را اندازهگیری و کنترل کنید. برای شروع، یک Workflow واقعی پرسشوپاسخ مبتنی بر RAG را بهعنوان سیستم تحت آزمایش قرار میدهید و یک Golden Dataset ایجاد میکنید. سپس با استفاده از معیارهای داخلی مانند Exact Match و Contains، خروجیها را ارزیابی میکنید و یاد میگیرید هر معیار چه اطلاعاتی در اختیار شما قرار میدهد و چه محدودیتهایی دارد.
در ادامه، وارد ارزیابی مبتنی بر LLM-as-a-Judge میشوید؛ روشی که در آن یک مدل زبانی عملکرد خروجی مدل دیگر را بر اساس معیارهای مشخص ارزیابی میکند. در این بخش، نحوه طراحی Judge Promptهای ساختاریافته، ایجاد Rubric یا معیار امتیازدهی، بررسی Faithfulness و افزایش سازگاری و کاهش سوگیری ارزیاب را یاد میگیرید.
در پایان، همه اجزای ارزیابی را در یک Pipeline یکپارچه قرار میدهید که میتواند معیارها را اجرا کند، امتیازها را تجمیع و خلاصه کند، هشدارهای خودکار ارسال کند و نتایج اجرای Workflowها را در یک محل ذخیرهسازی پایدار ثبت کند. به این ترتیب، ارزیابی از یک بررسی مقطعی به بخشی زنده و مستمر از فرایند توسعه، انتشار و نگهداری سیستمهای هوش مصنوعی تبدیل میشود.
اهداف یادگیری
مفهوم ارزیابی Workflowهای هوش مصنوعی و اهمیت آن در محیطهای Production را توضیح دهید.
یک Golden Dataset برای ارزیابی سیستمهای AI و Workflowهای مبتنی بر RAG ایجاد کنید.
خروجیهای هوش مصنوعی را با معیارهای مبتنی بر قانون مانند Exact Match و Contains اعتبارسنجی کنید.
محدودیتها و کاربردهای هر یک از معیارهای Rule-Based Evaluation را تحلیل کنید.
از روش LLM-as-a-Judge برای ارزیابی Correctness، Faithfulness و ظرافتهای تخصصی خروجیها استفاده کنید.
Judge Promptهای ساختاریافته را با استفاده از Scoring Rubric در نود LLM ابزار n8n طراحی کنید.
بررسیهای Faithfulness را برای شناسایی پاسخهای نادرست یا فاقد پشتوانه در Workflowهای RAG ایجاد کنید.
سازگاری ارزیابیکننده را بهبود دهید و عوامل ایجاد سوگیری در فرایند LLM-as-a-Judge را کاهش دهید.
یک Pipeline ارزیابی End-to-End در n8n برای اجرای معیارها و تولید خلاصه امتیازها طراحی کنید.
هشدارها و ثبت نتایج را بهصورت خودکار اجرا کنید تا روند کیفیت Workflowهای هوش مصنوعی در طول زمان قابل پایش باشد.
سرفصل ها
خوشآمدگویی
- 01 - خوشآمدگویی
1. مقدمهای بر ارزیابیها و پروژهای که میسازیم
- 02 - گشتوگذار در نود ارزیابی n8n و منوی معیارها
- 03 - چرا ارزیابیها مهم هستند - اندازهگیری عملکرد واقعی هوش مصنوعی شما
- 04 - نمای کلی پروژه - ساخت پایپلاین ارزیابی برای یک گردش کار RAG
- 05 - راهاندازی مجموعه داده ارزیابی شما
2. اولین ارزیابی شما - تطابق دقیق و شامل بودن
- 06 - تطابق دقیق چگونه کار میکند و چه زمانی باید از آن استفاده کرد
- 07 - ساخت ارزیابی تطابق دقیق روی خروجی RAG شما
- 08 - استفاده از تطابق شباهت برای راستیآزمایی منعطف حقایق
- 09 - مرور - معیارهایی که تاکنون استفاده کردهایم و موازنههای آنها
3. ارزیابیهای LLM-as-a-Judge
- 10 - LLM-as-a-judge چیست و چرا فراتر از تطابق رشتهای عمل میکند
- 11 - ساخت یک قاضی امتیازدهی با روبیک
- 12 - ساخت یک قاضی وفاداری
4. تجمیع نتایج و اقدام بر اساس آنها
- 13 - ارزیابی کل گردش کار شما در چندین معیار مختلف
- 14 - پیگیری ارزیابیها و تجمیع امتیازات
- 15 - پایش نتایج ارزیابی در طول زمان
- 16 - ثبت نتایج ارزیابی برای تحلیل روندها و هشداردهی
- 17 - مرور پروژه - پایپلاین کامل ارزیابی شما و مسیر پیش رو