دوره آموزشی ارزیابی‌های هوش مصنوعی در n8n: ساخت خروجی‌های باکیفیت و قابل‌اعتماد

دوره آموزشی ارزیابی‌های هوش مصنوعی در n8n: ساخت خروجی‌های باکیفیت و قابل‌اعتماد

1 ساعت 24 دقیقهمتوسط2026-09-02

مدرسین

Tobias Zwingmann

Tobias Zwingmann

جزئیات دوره

با انتقال سازمان‌ها از مرحله آزمایش مدل‌های زبانی بزرگ (LLM) به استفاده از Workflowهای هوش مصنوعی در محیط تولید، ارزیابی عملکرد AI به یک مهارت ضروری تبدیل شده است. یک Workflow ممکن است در ابتدا عملکرد مناسبی داشته باشد، اما با تغییر پرامپت‌ها، منابع داده یا نسخه مدل، دچار خطا، افت کیفیت یا توهم‌گویی (Hallucination) شود. بنابراین، تیم‌های توسعه و سازنده سیستم‌های AI به روشی قابل اعتماد برای اندازه‌گیری کیفیت و شناسایی این تغییرات نیاز دارند.

این دوره به شما نشان می‌دهد چگونه یک Pipeline ارزیابی قدرتمند و قابل اتکا در n8n ایجاد کنید تا بتوانید به‌صورت مستمر عملکرد Workflowهای هوش مصنوعی خود را اندازه‌گیری و کنترل کنید. برای شروع، یک Workflow واقعی پرسش‌وپاسخ مبتنی بر RAG را به‌عنوان سیستم تحت آزمایش قرار می‌دهید و یک Golden Dataset ایجاد می‌کنید. سپس با استفاده از معیارهای داخلی مانند Exact Match و Contains، خروجی‌ها را ارزیابی می‌کنید و یاد می‌گیرید هر معیار چه اطلاعاتی در اختیار شما قرار می‌دهد و چه محدودیت‌هایی دارد.

در ادامه، وارد ارزیابی مبتنی بر LLM-as-a-Judge می‌شوید؛ روشی که در آن یک مدل زبانی عملکرد خروجی مدل دیگر را بر اساس معیارهای مشخص ارزیابی می‌کند. در این بخش، نحوه طراحی Judge Promptهای ساختاریافته، ایجاد Rubric یا معیار امتیازدهی، بررسی Faithfulness و افزایش سازگاری و کاهش سوگیری ارزیاب را یاد می‌گیرید.

در پایان، همه اجزای ارزیابی را در یک Pipeline یکپارچه قرار می‌دهید که می‌تواند معیارها را اجرا کند، امتیازها را تجمیع و خلاصه کند، هشدارهای خودکار ارسال کند و نتایج اجرای Workflowها را در یک محل ذخیره‌سازی پایدار ثبت کند. به این ترتیب، ارزیابی از یک بررسی مقطعی به بخشی زنده و مستمر از فرایند توسعه، انتشار و نگهداری سیستم‌های هوش مصنوعی تبدیل می‌شود.

اهداف یادگیری
مفهوم ارزیابی Workflowهای هوش مصنوعی و اهمیت آن در محیط‌های Production را توضیح دهید.
یک Golden Dataset برای ارزیابی سیستم‌های AI و Workflowهای مبتنی بر RAG ایجاد کنید.
خروجی‌های هوش مصنوعی را با معیارهای مبتنی بر قانون مانند Exact Match و Contains اعتبارسنجی کنید.
محدودیت‌ها و کاربردهای هر یک از معیارهای Rule-Based Evaluation را تحلیل کنید.
از روش LLM-as-a-Judge برای ارزیابی Correctness، Faithfulness و ظرافت‌های تخصصی خروجی‌ها استفاده کنید.
Judge Promptهای ساختاریافته را با استفاده از Scoring Rubric در نود LLM ابزار n8n طراحی کنید.
بررسی‌های Faithfulness را برای شناسایی پاسخ‌های نادرست یا فاقد پشتوانه در Workflowهای RAG ایجاد کنید.
سازگاری ارزیابی‌کننده را بهبود دهید و عوامل ایجاد سوگیری در فرایند LLM-as-a-Judge را کاهش دهید.
یک Pipeline ارزیابی End-to-End در n8n برای اجرای معیارها و تولید خلاصه امتیازها طراحی کنید.
هشدارها و ثبت نتایج را به‌صورت خودکار اجرا کنید تا روند کیفیت Workflowهای هوش مصنوعی در طول زمان قابل پایش باشد.

سرفصل ها

خوش‌آمدگویی

  • 01 - خوش‌آمدگویی

1. مقدمه‌ای بر ارزیابی‌ها و پروژه‌ای که می‌سازیم

  • 02 - گشت‌وگذار در نود ارزیابی n8n و منوی معیارها
  • 03 - چرا ارزیابی‌ها مهم هستند - اندازه‌گیری عملکرد واقعی هوش مصنوعی شما
  • 04 - نمای کلی پروژه - ساخت پایپ‌لاین ارزیابی برای یک گردش کار RAG
  • 05 - راه‌اندازی مجموعه داده ارزیابی شما

2. اولین ارزیابی شما - تطابق دقیق و شامل بودن

  • 06 - تطابق دقیق چگونه کار می‌کند و چه زمانی باید از آن استفاده کرد
  • 07 - ساخت ارزیابی تطابق دقیق روی خروجی RAG شما
  • 08 - استفاده از تطابق شباهت برای راستی‌آزمایی منعطف حقایق
  • 09 - مرور - معیارهایی که تاکنون استفاده کرده‌ایم و موازنه‌های آن‌ها

3. ارزیابی‌های LLM-as-a-Judge

  • 10 - LLM-as-a-judge چیست و چرا فراتر از تطابق رشته‌ای عمل می‌کند
  • 11 - ساخت یک قاضی امتیازدهی با روبیک
  • 12 - ساخت یک قاضی وفاداری

4. تجمیع نتایج و اقدام بر اساس آن‌ها

  • 13 - ارزیابی کل گردش کار شما در چندین معیار مختلف
  • 14 - پیگیری ارزیابی‌ها و تجمیع امتیازات
  • 15 - پایش نتایج ارزیابی در طول زمان
  • 16 - ثبت نتایج ارزیابی برای تحلیل روندها و هشداردهی
  • 17 - مرور پروژه - پایپ‌لاین کامل ارزیابی شما و مسیر پیش رو

جمع‌بندی

۴۰,۰۰۰ تومان