آموزش هوش مصنوعی

انتخاب مدل زبانی برای دستیار هوش مصنوعی؛ مقایسه با آزمون واقعی

متوسط مطالعه در ۱۱ دقیقه
mahdyar

انتخاب مدل زبانی از جایی سخت می‌شود که چند پاسخ نمایشی خوب جای ارزیابی واقعی را بگیرد. مدلی که در یک گفت‌وگوی آزمایشی درخشان است، ممکن است پرسش فارسی کاربران شما را بد بفهمد، محدودیت منابع را رعایت نکند یا آن‌قدر کند باشد که کاربر صفحه را ببندد.

این مقاله آغاز فصل دوم مجموعه‌ی آموزش هوش مصنوعی تخته سبز است. در بیست قسمت اول از پرامپت به ایجنت رسیدیم. حالا سراغ تصمیم‌های طراحی یک محصول واقعی می‌رویم و اولینشان انتخاب مدل است. هدف پیدا کردن «بهترین مدل دنیا» نیست؛ هدف انتخاب مدل مناسب برای همین محصول و همین کاربران است.

چرا انتخاب مدل زبانی یک تصمیم آزمایشی است؟

بسیاری از تیم‌ها مدل را بر اساس شهرت، تاریخ انتشار یا جدول‌های مقایسه‌ی عمومی انتخاب می‌کنند. این جدول‌ها مفیدند، اما کار شما را نمی‌سنجند. یک دستیار آموزشی فارسی با یک دستیار کدنویسی انگلیسی نیازهای کاملاً متفاوتی دارد.

پس انتخاب مدل را باید مثل یک آزمایش دید. مجموعه‌ای از کارهای واقعی تعریف می‌کنید، چند مدل را روی آن اجرا می‌کنید و کیفیت پاسخ را کنار هزینه، زمان پاسخ و امکان استقرار می‌سنجید. نتیجه یک تصمیم مستند است که هر وقت مدل تازه‌ای آمد، می‌توانید دوباره تکرارش کنید.

انواع مدل‌های زبانی را بشناسید

پیش از مقایسه، باید بدانید با چه دسته‌هایی روبه‌رو هستید. مدل‌ها را می‌توان بر اساس کاربرد، نوع دسترسی، خروجی و معماری دسته‌بندی کرد. هر دسته‌بندی یک پرسش تازه در انتخاب شما ایجاد می‌کند.

دسته‌بندی بر اساس نوع کار

بسته به اینکه با متن، صدا، تصویر یا ویدئو کار دارید، مدل متفاوتی لازم است. برای تبدیل گفتار به متن، مدل‌های خانواده‌ی Whisper و نسل‌های جدیدتر گفتار به متن گزینه‌های رایج‌اند. پوشش زبان فارسی، تأخیر و هزینه را برای آن‌ها جداگانه بسنجید.

برای تولید تصویر، مدل‌هایی مثل GPT Image، Stable Diffusion، Imagen و Flux وجود دارند. برای متن، طیف گسترده‌ای از مدل‌های پیشرو، مدل‌های استدلالی، مدل‌های کوچک و سریع و مدل‌های وزن‌باز در دسترس است. بسیاری از مدل‌های امروزی هم چندحالتی‌اند؛ یعنی علاوه بر متن، تصویر یا صدا را هم می‌فهمند. پیش از ساخت هر گردش کاری، کارت مدل را برای ورودی‌ها و خروجی‌های پشتیبانی‌شده بخوانید.

مدل پایه در برابر مدل زبانی بزرگ

اصطلاح مدل پایه (Foundation Model) را پژوهشگران دانشگاه استنفورد مطرح کردند. مدل پایه سه ویژگی دارد: با یادگیری خودنظارتی روی داده‌ی بی‌برچسب آموزش دیده، بسیار بزرگ است و میلیاردها پارامتر دارد، و پایه‌ای برای ساخت مدل‌های دیگر است.

مدل زبانی بزرگ معمولاً نوعی مدل پایه است که روی متن تمرکز دارد. نسخه‌های اولیه‌ی ChatGPT نمونه‌ی خوبی‌اند. آن‌ها از یک مدل پایه شروع کردند و با داده‌ی گفت‌وگو برای چت تنظیم شدند. امروز سرویس‌ها مرتب میان نسخه‌های مختلف مدل جابه‌جا می‌شوند. پس نام سرویس همیشه با نام مدل زیرساختی یکی نیست.

وزن‌باز یا اختصاصی؟

مدل‌های وزن‌باز و متن‌باز اجازه می‌دهند وزن‌ها را دانلود، بررسی و سفارشی کنید. نمونه‌هایشان Llama، بعضی مدل‌های Mistral و هزاران مدل در Hugging Face است. این مدل‌ها وقتی ارزش دارند که کنترل بیشتری بر محل داده، هزینه یا سفارشی‌سازی لازم دارید. اما مجوزشان یکسان نیست و اجرایشان سخت‌افزار و تخصص عملیاتی می‌خواهد.

مدل‌های اختصاصی مثل مدل‌های OpenAI، Gemini و Claude متعلق به ارائه‌دهنده‌اند و از طریق سرویس او در دسترس‌اند. معمولاً برای استفاده‌ی تولیدی بهینه شده‌اند و پشتیبانی، سازوکار ایمنی و ابزارهای یکپارچه دارند. در عوض، وزن‌ها در اختیار شما نیست و باید شرایط حریم خصوصی و نگه‌داری داده را دقیق بخوانید.

جدول زیر تفاوت‌های اصلی را کنار هم می‌گذارد.

معیارمدل وزن‌بازمدل اختصاصی
دسترسی به وزن‌هادارد؛ طبق مجوزندارد
محل پردازش دادهزیرساخت خودتانسرورهای ارائه‌دهنده
هزینه‌ی شروعسخت‌افزار و راه‌اندازیتقریباً صفر؛ پرداخت مصرفی
نگه‌داری و به‌روزرسانیبر عهده‌ی تیم شمابر عهده‌ی ارائه‌دهنده
سفارشی‌سازی عمیقآزادترمحدود به امکانات سرویس

تعبیه، تولید تصویر و تولید متن

مدل‌ها را بر اساس خروجی هم دسته‌بندی می‌کنند. مدل‌های تعبیه (Embedding) متن را به بردار عددی تبدیل می‌کنند و پایه‌ی جستجوی معنایی و RAG هستند. مدل‌های تولید تصویر برای ساخت، ویرایش و بزرگ‌نمایی تصویر به کار می‌روند.

مدل‌های تولید متن و کد هم برای خلاصه‌سازی، ترجمه، پاسخ به پرسش و نوشتن کد استفاده می‌شوند. یک دستیار واقعی معمولاً از چند نوع کنار هم استفاده می‌کند؛ مثلاً یک مدل تعبیه برای جستجو و یک مدل متنی برای تولید پاسخ.

معماری؛ رمزگذار، رمزگشا یا هر دو

یک مثال ساده کمک می‌کند. فرض کنید باید برای دانش‌آموزان آزمونی بسازید و دو همکار دارید. همکار اول محتوا تولید می‌کند؛ این مثل مدل فقط-رمزگشا است، مانند خانواده‌ی GPT و Llama. در نوشتن محتوای روان عالی است، اما برای دسته‌بندی و بازیابی بهترین گزینه نیست.

همکار دوم متن را بازبینی می‌کند و رابطه‌ی پرسش و پاسخ را می‌فهمد؛ این مثل مدل فقط-رمزگذار است، مانند BERT. کسی که هم بسازد و هم بازبینی کند، مدل رمزگذار-رمزگشاست، مثل BART و T5. این تفاوت توضیح می‌دهد چرا برای جستجو و دسته‌بندی گاهی مدل‌های کوچک‌تر و تخصصی‌تر بهتر عمل می‌کنند.

سرویس یا مدل؛ تفاوت در عمل

سرویس محصولی است که یک ارائه‌دهنده‌ی ابری عرضه می‌کند و ترکیبی از مدل، زیرساخت و امکانات دیگر است. Azure OpenAI نمونه‌ای از سرویس است. پرداخت بر اساس مصرف است، امنیت سازمانی و چارچوب هوش مصنوعی مسئولانه هم کنار مدل ارائه می‌شود.

مدل، خود شبکه‌ی عصبی است: پارامترها، وزن‌ها، معماری، توکنایزر و پیکربندی. اجرای مدل در محیط خودتان سخت‌افزار مناسب، زیرساخت سرویس‌دهی، پایش و مجوز سازگار می‌خواهد. پس «رایگان بودن» مدل وزن‌باز به معنای رایگان بودن اجرای آن نیست.

پلتفرم‌های مقایسه‌ی مدل

پلتفرم‌هایی مثل Microsoft Foundry، که پیش‌تر Azure AI Foundry نام داشت، فهرستی از مدل‌های اختصاصی و وزن‌باز را یک‌جا ارائه می‌دهند. می‌توانید مدل‌ها را بر اساس کار، ارائه‌دهنده، مجوز و نوع استقرار فیلتر کنید و کارت هر مدل را ببینید.

این پلتفرم‌ها معمولاً بخش مقایسه‌ی عملکرد روی مجموعه‌داده‌های استاندارد، امکان فاین‌تیون و استقرار روی نقطه‌ی پاسخ‌گویی هم دارند. فقط یادتان باشد همه‌ی مدل‌های فهرست برای فاین‌تیون یا استقرار مصرفی در دسترس نیستند. کارت مدل را پیش از تصمیم بخوانید.

سه راه بهبود نتیجه‌ی مدل

انتخاب مدل فقط توانایی پایه را به شما می‌دهد. تقریباً همیشه داده‌ی خاص کسب‌وکار شما باید به‌نحوی به مدل برسد. سه رویکرد اصلی وجود دارد که از ساده و ارزان تا پیچیده و پرهزینه مرتب شده‌اند.

مهندسی پرامپت با زمینه

مدل‌های آموزش‌دیده در کارهای عمومی زبان حتی با یک پرامپت کوتاه خوب عمل می‌کنند. اما هرچه درخواست را با دستور دقیق و مثال، یعنی زمینه، بهتر قالب‌بندی کنید، پاسخ به انتظارتان نزدیک‌تر می‌شود. آوردن یک مثال را یادگیری تک‌نمونه‌ای و چند مثال را یادگیری چندنمونه‌ای می‌گویند.

این ارزان‌ترین و سریع‌ترین نقطه‌ی شروع است. پیش از هر کار پیچیده‌تری، مطمئن شوید پرامپت شما دقیق است. در بسیاری از پروژه‌ها، همین قدم بیشتر مشکلات را حل می‌کند.

تولید افزوده با بازیابی

مدل فقط از داده‌ای که با آن آموزش دیده استفاده می‌کند. از رویدادهای بعدی و داده‌ی خصوصی شرکت خبر ندارد. RAG این مشکل را با افزودن بخش‌های مرتبط اسناد به پرامپت حل می‌کند. پایگاه‌های داده‌ی برداری بخش‌های مفید را پیدا می‌کنند و به زمینه‌ی پرامپت اضافه می‌کنند.

RAG برای کسب‌وکاری که داده، زمان یا منابع کافی برای فاین‌تیون ندارد، بسیار مناسب است. هم پاسخ را به داده‌ی واقعی متکی می‌کند و هم احتمال پاسخ ساختگی یا قدیمی را کم می‌کند.

فاین‌تیون و آموزش از صفر

فاین‌تیون مدل را با نمونه‌های ورودی و خروجی شما بیشتر آموزش می‌دهد و یک مدل تازه با وزن‌های به‌روز می‌سازد. این رویکرد وقتی مناسب است که می‌خواهید یک مدل کوچک‌تر را برای کاری محدود ارزان‌تر و سریع‌تر کنید، پرامپت‌های طولانی زمان پاسخ را بالا برده، یا رفتار ثابتی در قالب و لحن لازم دارید.

آموزش مدل از صفر سخت‌ترین گزینه است و داده‌ی عظیم، نیروی متخصص و توان محاسباتی زیاد می‌خواهد. برای بیشتر کسب‌وکارها گزینه‌ی واقع‌بینانه‌ای نیست. قاعده‌ی کلی روشن است: از پرامپت شروع کنید، برای داده‌ی خصوصی RAG اضافه کنید و فاین‌تیون را آخرین گزینه بدانید.

مقایسه‌ی عملی مدل‌ها برای یک دستیار آموزشی

حالا همه‌ی این مفاهیم را روی یک سناریوی واقعی پیاده می‌کنیم. یک مرکز آموزشی می‌خواهد دستیاری بسازد که به پرسش‌ها درباره‌ی پیش‌نیاز دوره‌ها پاسخ دهد، سرفصل‌ها را مقایسه کند و مسیر یادگیری پیشنهاد دهد. نمودار زیر چهار قدم این مقایسه را نشان می‌دهد.

مراحل انتخاب مدل زبانی برای دستیار آموزشی از تعریف کار تا تصمیم مستند

تعریف کار و داده‌ی آزمون

دامنه‌ی نسخه‌ی اول را محدود کنید. دوازده پرسش فارسی واقعی، توضیح سه دوره و یک سقف زمان پاسخ کافی است. برای هر پرسش، پاسخ درست یا معیار پذیرش را پیش از اجرا بنویسید. اگر پاسخ درست معلوم نیست، آن را با کارشناس همان فرایند تعیین کنید.

دو نوع نمونه آماده کنید. نمونه‌ی عادی نشان می‌دهد مسیر اصلی کار می‌کند. نمونه‌ی ناقص، مثلاً پرسش درباره‌ی دوره‌ای که در اسناد نیست، نشان می‌دهد سیستم هنگام کمبود اطلاعات چه رفتاری دارد.

اجرای آزمون یکسان

پرسش‌های یکسان را با ورودی و معیار ثابت روی دو یا سه مدل اجرا کنید. خروجی هر مدل را جدا نگه دارید و به هر نمونه یک شناسه بدهید تا در نسخه‌های بعدی همان شرایط قابل تکرار باشد.

سه معیار اصلی را بسنجید: درستی پاسخ، وفاداری به سند و رعایت محدودیت طول. زمان پاسخ و هزینه‌ی هر اجرا را هم ثبت کنید. جدول زیر یک قالب ساده برای ثبت نتایج است.

معیارمدل الفمدل بمدل ج
پاسخ درست از ۱۲ پرسش
پاسخ وفادار به سند
میانگین زمان پاسخ
هزینه‌ی کل آزمون
رفتار در پرسش بی‌جواب

نمونه‌ی شکستی که باید عمداً دنبالش بگردید

مهم‌ترین خطایی که باید دنبالش باشید این است: مدلی که روان‌تر می‌نویسد، اما پیش‌نیازهای دوره را از خودش اضافه می‌کند. این خطا در نگاه اول دیده نمی‌شود، چون پاسخ قانع‌کننده است. اما برای کاربری که بر اساس آن ثبت‌نام می‌کند، خطرناک است.

این نمونه را عمداً در آزمون بگذارید و نتیجه‌ی مورد انتظار را پیش از اجرا ثبت کنید. اگر نسخه‌ی جدیدی ظاهراً بهتر بود، همین نمونه را دوباره بسنجید. خطای داده، خطای انتخاب مسیر و خطای تولید پاسخ را هم از هم جدا کنید؛ هرکدام راه‌حل متفاوتی دارد.

تمرین عملی؛ گزارش انتخاب مدل

خروجی این تمرین یک گزارش کوتاه است که به همکارتان تحویل می‌دهید:

  1. جدول مقایسه‌ی مدل‌ها را با نتایج واقعی آزمون پر کنید.
  2. مدل منتخب و دلیل انتخابش را در سه جمله بنویسید.
  3. مشخص کنید کدام بخش را واقعاً اجرا کرده‌اید و کدام بخش هنوز فرض است.

این تفکیک اهمیت دارد. خواننده‌ی گزارش باید بداند کدام نتیجه مشاهده شده و کدام تصمیم به آزمون بیشتر نیاز دارد. همین گزارش را نگه دارید؛ در قسمت‌های بعدی محدودیت‌های ثبت‌شده‌اش را یکی‌یکی بررسی می‌کنیم.

سخن پایانی

انتخاب مدل زبانی یک تصمیم آزمایشی است، نه یک انتخاب سلیقه‌ای. انواع مدل‌ها را بشناسید، تفاوت وزن‌باز و اختصاصی و سرویس و مدل را در نظر بگیرید و بدانید پرامپت، RAG و فاین‌تیون هرکدام چه زمانی به کار می‌آیند. بعد با کار واقعی محصولتان، چند مدل را منصفانه مقایسه کنید. تصمیمی که با داده‌ی خودتان گرفته شود، با آمدن مدل بعدی هم قابل تکرار است.

در قسمت بعد سراغ طراحی دستیار مسئولانه می‌رویم؛ یعنی دستیاری که ادعای نادرست نکند و کنترل را به کاربر بدهد.

این آموزش بر پایه‌ی درس Exploring and Comparing Different LLMs از مجموعه‌ی آزاد Generative AI for Beginners مایکروسافت (مجوز MIT) به فارسی بازنویسی و تکمیل شده است.

پرسش‌های پرتکرار

بهترین مدل زبانی کدام است؟

بهترین مدل برای همه‌ی کارها وجود ندارد. مدلی مناسب است که روی کار واقعی محصول شما، با زبان و داده‌ی شما، کیفیت کافی را با زمان پاسخ و هزینه‌ی قابل‌قبول بدهد. این را فقط با آزمون روی نمونه‌های واقعی می‌شود فهمید.

مدل وزن‌باز بهتر است یا مدل اختصاصی؟

مدل وزن‌باز کنترل بیشتری بر محل داده، استقرار و سفارشی‌سازی می‌دهد اما زیرساخت و نگه‌داری می‌خواهد. مدل اختصاصی آماده‌ی استفاده است و پشتیبانی و امکانات ایمنی دارد، اما وزن‌هایش در اختیار شما نیست. انتخاب به نیاز حریم خصوصی، بودجه و تیم شما بستگی دارد.

برای بهبود نتیجه‌ی مدل اول چه کاری کنیم؟

از مهندسی پرامپت و زمینه‌ی دقیق شروع کنید که ارزان‌ترین راه است. اگر مدل به داده‌ی خصوصی یا به‌روز نیاز دارد، RAG را اضافه کنید. فاین‌تیون را فقط وقتی انتخاب کنید که نمونه‌ی باکیفیت کافی دارید و رفتار ثابتی در قالب یا لحن می‌خواهید.

تفاوت سرویس و مدل در هوش مصنوعی چیست؟

مدل خود شبکه‌ی عصبی با وزن‌ها و توکنایزر است. سرویس محصولی از یک ارائه‌دهنده است که مدل را همراه زیرساخت، مقیاس‌پذیری، امنیت و صورت‌حساب مصرفی ارائه می‌کند؛ مثل Azure OpenAI.

دیدگاه‌ها

هنوز دیدگاهی ثبت نشده است. شروع‌کننده باشید — پرسش و اصلاح را با آغوش باز می‌پذیریم.

دیدگاه بگذارید

برای **پررنگ**، *مورب*، `کد` و لینک از Markdown استفاده کنید. لینک‌ها nofollow هستند.

پنج رقم داخل تصویر را وارد کنید. اعداد فارسی و انگلیسی پذیرفته می‌شوند.

تصویر کد امنیتی پنج‌رقمی

در حال دریافت کد امنیتی…

مهلت کد تمام شد. روی «کد جدید» بزنید.