آموزش هوش مصنوعی

ارزیابی ایجنت هوش مصنوعی؛ سنجش کیفیت، زمان و هزینه

متوسط مطالعه در ۹ دقیقه
mahdyar

ارزیابی ایجنت هوش مصنوعی مرحله‌ای است که بیشتر پروژه‌ها از آن جا می‌مانند. ایجنت در نمایش اول عالی کار می‌کند، اما در محیط واقعی گاهی کند است، گاهی پرهزینه و گاهی پاسخ اشتباه می‌دهد. بدون سنجش دقیق، حتی نمی‌دانید این مشکلات چقدر رایج‌اند.

در این قسمت از مجموعه‌ی «از پرامپت تا دستیار هوش مصنوعی» یاد می‌گیریم ایجنت را از یک «جعبه‌ی سیاه» به سیستمی شفاف و قابل‌سنجش تبدیل کنیم. اول مشاهده‌پذیری را می‌بینیم و بعد دو روش اصلی ارزیابی، یعنی آفلاین و آنلاین، را مرور می‌کنیم.

مشاهده‌پذیری در ایجنت هوش مصنوعی

مشاهده‌پذیری (Observability) یعنی بفهمید درون ایجنت چه می‌گذرد؛ از روی نشانه‌های بیرونی مثل لاگ، معیار و ردپای اجرا. برای ایجنت‌ها یعنی ثبت اقدام‌ها، استفاده از ابزارها، فراخوانی‌های مدل و پاسخ‌ها تا بتوانید خطا را پیدا کنید و عملکرد را بهتر کنید.

چرا بدون مشاهده‌پذیری کور هستیم؟

بدون مشاهده‌پذیری، ایجنت یک جعبه‌ی سیاه است. سؤالی وارد می‌شود و جوابی بیرون می‌آید، اما نمی‌دانید در این میان چه اتفاقی افتاد. ابزارهای مشاهده‌پذیری ایجنت را شفاف می‌کنند و به شما اجازه می‌دهند:

  • هزینه و دقت را بسنجید: بفهمید بین این دو چه تعادلی برقرار است.
  • زمان پاسخ را اندازه بگیرید: بدانید کدام قدم کار را کند می‌کند.
  • محتوای مضر را شناسایی کنید: زبان توهین‌آمیز و تزریق پرامپت را تشخیص دهید.
  • بازخورد کاربران را پایش کنید: بدانید کاربران از کدام پاسخ‌ها راضی نیستند.

به زبان ساده، مشاهده‌پذیری ایجنت نمایشی شما را آماده‌ی محیط تولید می‌کند. داشبورد زیر نمونه‌ای از این شفافیت است؛ تعداد Traceها، هزینه‌ی هر مدل و امتیازهای ارزیابی در یک نگاه.

داشبورد مشاهده‌پذیری Langfuse برای ارزیابی ایجنت هوش مصنوعی با هزینه مدل‌ها و امتیازها

ابزارهای مشاهده‌پذیری

ابزارهای رایج این حوزه پلتفرم‌هایی مثل Langfuse و Arize هستند. این ابزارها ردپای کامل اجرا را جمع می‌کنند و داشبوردهای لحظه‌ای برای پایش معیارها دارند. برخی متن‌بازند و برخی روی بخشی از چرخه‌ی LLMOps، مثل ارزیابی یا مدیریت پرامپت، تمرکز دارند.

بسیاری از فریم‌ورک‌ها، از جمله smolagents، از استاندارد OpenTelemetry برای ارسال اطلاعات به این ابزارها استفاده می‌کنند. در قسمت سیزدهم دیدیم فعال‌کردن آن در smolagents فقط یک خط کد است.

Trace و Span؛ ساختار ردپای اجرا

ابزارهای مشاهده‌پذیری اجرای ایجنت را با دو مفهوم نشان می‌دهند. Trace کل یک کار ایجنت را از شروع تا پایان نشان می‌دهد؛ مثلاً پاسخ به یک پرسش کاربر. Span هر قدم جداگانه درون این Trace است؛ مثل یک فراخوانی مدل یا بازیابی داده.

خواندن یک Trace

یک Trace نمونه از CodeAgent را در نظر بگیرید. در قدم اول، مدل فراخوانی می‌شود و دو بار ابزار جستجوی گوگل را صدا می‌زند. در قدم دوم، مدل دوباره فراخوانی می‌شود و ابزار پاسخ نهایی را اجرا می‌کند.

هر کدام از این‌ها یک Span است که زمان اجرا، ورودی، خروجی و هزینه‌ی خودش را دارد. وقتی ایجنت کند است، با نگاه به Spanها دقیقاً می‌فهمید کدام قدم مقصر است. ساختار این Trace را در تصویر زیر می‌بینید.

ساختار Trace و Spanهای اجرای CodeAgent در ابزار مشاهده‌پذیری

هفت معیار کلیدی برای ارزیابی ایجنت هوش مصنوعی

ابزارهای مشاهده‌پذیری معیارهای مختلفی را پایش می‌کنند. در عمل، ترکیب این معیارها بهترین تصویر را از سلامت ایجنت می‌دهد. جدول زیر هفت معیار اصلی را همراه نمونه‌ی اقدام اصلاحی نشان می‌دهد.

معیارچه چیزی را می‌سنجدنمونه‌ی اقدام اصلاحی
زمان پاسخسرعت پاسخ کل کار و هر قدممدل سریع‌تر یا فراخوانی موازی
هزینههزینه‌ی هر اجرای ایجنتکاهش فراخوانی‌ها یا مدل ارزان‌تر
خطای درخواستتعداد درخواست‌های شکست‌خوردهتلاش دوباره یا ارائه‌دهنده‌ی جایگزین
بازخورد صریحامتیاز و نظر مستقیم کاربربررسی پاسخ‌های با امتیاز منفی
بازخورد ضمنیرفتار کاربر مثل تکرار سؤالیافتن پرسش‌هایی که ایجنت نمی‌فهمد
دقتمیزان خروجی درست یا مطلوببرچسب موفق یا ناموفق روی Traceها
ارزیابی خودکارامتیاز داور خودکار به پاسخداوری با مدل زبانی، RAGAS یا LLM Guard

زمان پاسخ و هزینه

انتظار طولانی تجربه‌ی کاربر را خراب می‌کند. اگر ایجنتی برای همه‌ی فراخوانی‌های مدلش بیست ثانیه وقت بگذارد، می‌توانید با مدل سریع‌تر یا اجرای موازی فراخوانی‌ها سرعتش را بالا ببرید. زمان را هم برای کل کار و هم برای هر قدم بسنجید.

هزینه هم مستقیم به تعداد فراخوانی‌ها بستگی دارد. اگر ایجنت پنج بار مدل را صدا می‌زند و کیفیت فقط کمی بهتر می‌شود، باید بسنجید این هزینه ارزشش را دارد یا نه. پایش لحظه‌ای جهش‌های ناگهانی هزینه را هم نشان می‌دهد؛ مثلاً باگی که ایجنت را در حلقه‌ی بی‌پایان فراخوانی API انداخته است.

بازخورد صریح و ضمنی کاربر

بازخورد صریح یعنی امتیازی که کاربر مستقیم می‌دهد؛ دکمه‌ی موافق و مخالف، ستاره یا نظر متنی. بازخورد منفی پیوسته زنگ خطری است که ایجنت درست کار نمی‌کند.

بازخورد ضمنی از رفتار کاربر می‌آید، حتی بدون امتیاز. کاربری که بلافاصله سؤالش را بازنویسی می‌کند، پرسش را تکرار می‌کند یا دکمه‌ی «دوباره» را می‌زند، دارد می‌گوید پاسخ خوب نبود. این نشانه‌ها اغلب از بازخورد صریح فراوان‌ترند.

دقت و داوری خودکار

دقت یعنی ایجنت چند بار خروجی درست یا مطلوب تولید می‌کند. تعریف «درست» به کار شما بستگی دارد. قدم اول این است که مشخص کنید موفقیت برای ایجنتتان چه شکلی دارد. بعد Traceها را با برچسب «موفق» یا «ناموفق» علامت بزنید.

ارزیابی خودکار هم امکان‌پذیر است. می‌توانید از یک مدل زبانی بخواهید پاسخ ایجنت را از نظر مفید بودن و درستی امتیاز دهد. کتابخانه‌های متن‌بازی هم وجود دارند؛ RAGAS برای ایجنت‌های RAG و LLM Guard برای تشخیص محتوای مضر و تزریق پرامپت.

ارزیابی آفلاین و آنلاین

مشاهده‌پذیری معیار می‌دهد. ارزیابی یعنی تحلیل همین داده‌ها و انجام آزمون برای اینکه بفهمید ایجنت چقدر خوب کار می‌کند و چطور می‌شود بهترش کرد. ارزیابی منظم ضروری است، چون ایجنت‌ها غیرقطعی‌اند و با به‌روزرسانی مدل‌ها رفتارشان تغییر می‌کند.

ارزیابی آفلاین با مجموعه‌ی آزمون

ارزیابی آفلاین در محیطی کنترل‌شده و با مجموعه‌ی آزمون انجام می‌شود، نه با پرسش‌های واقعی کاربران. داده‌هایی دارید که پاسخ درستشان را می‌دانید و ایجنت را روی آن‌ها اجرا می‌کنید. مثلاً برای ایجنت حل مسئله‌ی ریاضی، صد مسئله با پاسخ مشخص.

مزیت اصلی این روش تکرارپذیری است. چون پاسخ درست را دارید، معیار دقت روشنی به دست می‌آورید. می‌توانید آن را بخشی از فرایند CI/CD کنید تا هر تغییری که کیفیت را پایین بیاورد، پیش از انتشار شناسایی شود.

چالش اصلی این است که مجموعه‌ی آزمون جامع و به‌روز بماند. ایجنت ممکن است روی آزمون ثابت عالی باشد، اما در محیط واقعی با پرسش‌های کاملاً متفاوتی روبه‌رو شود. ترکیبی از آزمون‌های کوچک برای بررسی سریع و مجموعه‌های بزرگ‌تر برای سنجش گسترده بهترین نتیجه را می‌دهد.

ارزیابی آنلاین روی کاربران واقعی

ارزیابی آنلاین در محیط واقعی و هنگام استفاده‌ی کاربران انجام می‌شود. عملکرد ایجنت روی تعامل‌های واقعی به‌طور مداوم پایش می‌شود؛ مثلاً نرخ موفقیت، رضایت کاربر و معیارهای دیگر روی ترافیک زنده.

مزیت این روش این است که چیزهایی را نشان می‌دهد که در آزمایشگاه پیش‌بینی نکرده بودید. می‌توانید افت تدریجی کیفیت را ببینید و پرسش‌های تازه‌ای را پیدا کنید که در داده‌ی آزمون نبودند. آزمون A/B هم در این دسته قرار می‌گیرد؛ نسخه‌ی جدید ایجنت کنار نسخه‌ی قدیم اجرا می‌شود تا مقایسه شوند.

چرخه‌ی بهبود مداوم

در عمل، ارزیابی موفق هر دو روش را ترکیب می‌کند. بسیاری از تیم‌ها یک چرخه را دنبال می‌کنند. اول ارزیابی آفلاین، بعد انتشار نسخه‌ی جدید، سپس پایش معیارهای آنلاین و جمع‌آوری نمونه‌های شکست. این نمونه‌ها به مجموعه‌ی آزمون آفلاین اضافه می‌شوند و چرخه دوباره تکرار می‌شود.

به این ترتیب ارزیابی یک کار یک‌باره نیست؛ فرایندی پیوسته است که هر بار ایجنت را کمی بهتر می‌کند. هر شکست واقعی، به یک آزمون تازه تبدیل می‌شود تا دیگر تکرار نشود.

تمرین عملی؛ ارزیابی دستیار دوره‌ها

برای دستیار پروژه‌ی مشترک یک ارزیابی ساده راه بیندازید:

  1. ده پرسش واقعی بنویسید و برای هر کدام پاسخ درست، یعنی دوره‌ی مناسب، را مشخص کنید.
  2. ایجنت را روی این ده پرسش اجرا کنید و درصد پاسخ درست، میانگین زمان و هزینه‌ی کل را ثبت کنید.
  3. SmolagentsInstrumentor را فعال کنید و Trace کندترین اجرا را در Langfuse بررسی کنید.

هر پرسشی که ایجنت اشتباه جواب داد، بعد از اصلاح در مجموعه‌ی آزمون بماند. این همان چرخه‌ی بهبود مداوم است؛ در مقیاس کوچک.

سخن پایانی

ارزیابی ایجنت هوش مصنوعی با مشاهده‌پذیری شروع می‌شود: Trace و Spanهایی که نشان می‌دهند درون ایجنت چه می‌گذرد. بعد معیارهایی مثل زمان، هزینه، خطا، بازخورد و دقت، سلامت ایجنت را عددی می‌کنند. ارزیابی آفلاین پیش از انتشار جلوی خطاهای شناخته‌شده را می‌گیرد و ارزیابی آنلاین مشکلات تازه را پیدا می‌کند. ترکیب این دو در یک چرخه‌ی پیوسته، ایجنت نمایشی را به محصولی قابل‌اعتماد تبدیل می‌کند.

در قسمت بیستم، که بخش نخست این مجموعه را می‌بندد، سراغ امنیت برنامه‌های هوش مصنوعی مولد می‌رویم.

این آموزش بر پایه‌ی بخش AI Agent Observability and Evaluation از دوره‌ی آزاد Agents Course در Hugging Face (مجوز Apache-2.0) به فارسی بازنویسی و تکمیل شده است.

پرسش‌های پرتکرار

مشاهده‌پذیری در ایجنت هوش مصنوعی یعنی چه؟

یعنی بتوانید از روی نشانه‌های بیرونی مثل لاگ، معیار و Trace بفهمید درون ایجنت چه می‌گذرد؛ کدام ابزار صدا زده شد، مدل چه پاسخی داد، هر قدم چقدر طول کشید و چقدر هزینه داشت.

فرق Trace و Span چیست؟

Trace کل یک کار ایجنت را از شروع تا پایان نشان می‌دهد؛ مثلاً پاسخ به یک پرسش کاربر. Span هر قدم جداگانه درون آن Trace است؛ مثل یک فراخوانی مدل یا اجرای یک ابزار.

ارزیابی آفلاین و آنلاین چه فرقی دارند؟

ارزیابی آفلاین روی مجموعه‌ی آزمونی با پاسخ‌های مشخص و پیش از انتشار انجام می‌شود و تکرارپذیر است. ارزیابی آنلاین روی تعامل‌های واقعی کاربران در محیط تولید انجام می‌شود و مشکلاتی را نشان می‌دهد که در آزمون پیش‌بینی نشده بودند.

می‌توان کیفیت پاسخ ایجنت را خودکار سنجید؟

بله. می‌توان از یک مدل زبانی به‌عنوان داور استفاده کرد تا مفید بودن و درستی پاسخ را امتیاز دهد. کتابخانه‌هایی مثل RAGAS برای ایجنت‌های RAG و LLM Guard برای تشخیص محتوای مضر و تزریق پرامپت هم وجود دارند.

دیدگاه‌ها

هنوز دیدگاهی ثبت نشده است. شروع‌کننده باشید — پرسش و اصلاح را با آغوش باز می‌پذیریم.

دیدگاه بگذارید

برای **پررنگ**، *مورب*، `کد` و لینک از Markdown استفاده کنید. لینک‌ها nofollow هستند.

پنج رقم داخل تصویر را وارد کنید. اعداد فارسی و انگلیسی پذیرفته می‌شوند.

تصویر کد امنیتی پنج‌رقمی

در حال دریافت کد امنیتی…

مهلت کد تمام شد. روی «کد جدید» بزنید.