مدل زبانی کوچک چیست؟ تفاوت SLM و LLM و کاربردها

مدل زبانی کوچک یا SLM برای اجرای سریع و اقتصادی وظایف مشخص طراحی شده است. در این مقاله تفاوت SLM و LLM، کاربردها، محدودیت‌ها و معماری استفاده از مدل‌های کوچک و بزرگ با API را بررسی می‌کنیم.

Share
مدل زبانی کوچک چیست؟ تفاوت SLM و LLM و کاربردها

بیشتر توجه بازار هوش مصنوعی به مدل‌های بسیار بزرگ و قدرتمند معطوف شده است؛ اما بسیاری از درخواست‌های واقعی به بزرگ‌ترین مدل موجود نیاز ندارند.

برای دسته‌بندی یک پیام، استخراج چند فیلد، تشخیص موضوع درخواست، تولید پاسخ کوتاه، بازنویسی متن یا انتخاب ابزار مناسب، استفاده از یک مدل بسیار بزرگ می‌تواند هزینه و زمان پاسخ‌گویی را بدون ایجاد ارزش متناسب افزایش دهد.

مدل‌های زبانی کوچک یا Small Language Models برای حل همین مسئله مورد توجه قرار گرفته‌اند. این مدل‌ها با تعداد پارامتر کمتر و نیاز پردازشی پایین‌تر، تلاش می‌کنند وظایف مشخص را سریع‌تر و اقتصادی‌تر انجام دهند.

هدف SLM این نیست که در تمام زمینه‌ها جایگزین مدل زبانی بزرگ شود. کاربرد اصلی آن انجام کارهای محدود، پرتعداد و قابل‌اندازه‌گیری است؛ به‌خصوص زمانی که سرعت، هزینه و امکان اجرای گسترده اهمیت دارد.

مدل زبانی کوچک یا SLM چیست؟

SLM مخفف Small Language Model و به‌معنای «مدل زبانی کوچک» است. این مدل نوعی سامانه هوش مصنوعی برای درک و تولید زبان است که نسبت به مدل‌های زبانی بزرگ، تعداد پارامتر و نیاز پردازشی کمتری دارد.

مدل زبانی کوچک می‌تواند بسیاری از وظایف متنی را انجام دهد:

  • پاسخ‌گویی به پرسش‌های مشخص
  • خلاصه‌سازی متن
  • دسته‌بندی پیام
  • استخراج اطلاعات
  • بازنویسی
  • ترجمه
  • تشخیص موضوع و هدف کاربر
  • تولید خروجی ساختاریافته
  • انتخاب Function یا ابزار مناسب
  • تولید کدهای کوتاه
  • اجرای وظایف تخصصی پس از فاین‌تیونینگ

اصطلاح «کوچک» یک تعریف عددی ثابت ندارد. مدلی که امروز کوچک محسوب می‌شود، ممکن است چند سال قبل یک مدل بزرگ به شمار می‌رفته باشد.

در عمل، مدل‌هایی با چندصد میلیون تا چند میلیارد پارامتر معمولاً در گروه SLM قرار می‌گیرند. بعضی منابع مدل‌های بزرگ‌تر را نیز، در مقایسه با مدل‌های بسیار بزرگ بازار، در همین گروه قرار می‌دهند.

بنابراین، بهتر است SLM را فقط بر اساس تعداد پارامتر تعریف نکنیم. یک مدل زبانی کوچک معمولاً برای اجرای اقتصادی‌تر، پاسخ‌گویی سریع‌تر و تمرکز بر مجموعه مشخصی از وظایف طراحی شده است.

تفاوت SLM و LLM چیست؟

LLM مخفف Large Language Model و به‌معنای مدل زبانی بزرگ است. هر دو گروه می‌توانند متن را درک و تولید کنند، اما هدف طراحی و شیوه استفاده از آن‌ها متفاوت است.

معیارمدل زبانی کوچک SLMمدل زبانی بزرگ LLM
اندازهمعمولاً از چندصد میلیون تا چند میلیارد پارامترمعمولاً ده‌ها یا صدها میلیارد پارامتر
سرعتاغلب سریع‌ترمعمولاً کندتر در درخواست‌های مشابه
هزینه اجراکمتربیشتر
نیاز پردازشیمحدودترسنگین‌تر
دانش عمومیمحدودترگسترده‌تر
وظایف تخصصیمناسب، به‌ویژه پس از تنظیممناسب اما گاهی بیش از نیاز
استدلال پیچیدهمحدودترمعمولاً قوی‌تر
اجرای پرتعدادمناسب‌ترممکن است پرهزینه باشد
اجرای روی دستگاهدر برخی مدل‌ها امکان‌پذیرمعمولاً دشوارتر
کاربرد اصلیوظایف محدود، تکراری و مشخصمسائل پیچیده، عمومی و چندمرحله‌ای

بزرگ‌بودن مدل الزاماً به‌معنای بهتر‌بودن آن برای تمام وظایف نیست. اگر هدف فقط تشخیص موضوع یک تیکت یا استخراج شماره سفارش از متن باشد، یک مدل کوچکِ مناسب می‌تواند نتیجه کافی را با سرعت بیشتر ارائه دهد.

از طرف دیگر، اگر مسئله شامل تحلیل چند سند، درک ابهام، برنامه‌ریزی چندمرحله‌ای یا استدلال پیچیده باشد، مدل بزرگ معمولاً انتخاب مناسب‌تری است.

چرا مدل‌های زبانی کوچک مهم شده‌اند؟

کاهش هزینه استفاده از هوش مصنوعی

در یک نمونه آزمایشی با چند درخواست محدود، اختلاف قیمت مدل‌ها ممکن است مهم به نظر نرسد. این اختلاف در محصولی با صدها هزار یا میلیون‌ها درخواست می‌تواند قابل‌توجه باشد.

اگر بخش بزرگی از درخواست‌ها ساده باشند، انتقال آن‌ها به یک مدل کوچک می‌تواند هزینه متوسط هر درخواست را کاهش دهد.

پاسخ‌گویی سریع‌تر

مدل کوچک‌تر معمولاً محاسبات کمتری انجام می‌دهد و می‌تواند پاسخ را سریع‌تر تولید کند. این ویژگی برای قابلیت‌هایی مانند پیشنهاد لحظه‌ای، تکمیل متن، دسته‌بندی پیام و پاسخ‌گویی کوتاه اهمیت دارد.

اجرای تعداد بیشتری درخواست

نیاز پردازشی کمتر به این معناست که زیرساخت یکسان می‌تواند تعداد بیشتری درخواست را مدیریت کند. این مزیت در محصولاتی با کاربران زیاد یا پردازش گروهی داده‌ها اهمیت بیشتری پیدا می‌کند.

اجرای روی دستگاه‌های معمولی‌تر

برخی مدل‌های کوچک برای اجرا روی لپ‌تاپ، تلفن همراه، مرورگر یا دستگاه‌های Edge طراحی شده‌اند.

برای مثال، گوگل مدل‌های کوچک Gemma 4 با اندازه مؤثر 2B و 4B را برای سناریوهایی مانند موبایل، Edge و مرورگر معرفی کرده است. مایکروسافت نیز استفاده آزمایشی از مدل‌های کوچک داخلی را در Prompt API مرورگر Edge توسعه داده است.

تخصصی‌سازی برای یک وظیفه

یک مدل کوچک عمومی ممکن است از مدل بزرگ ضعیف‌تر باشد؛ اما پس از آموزش یا فاین‌تیونینگ روی یک وظیفه مشخص می‌تواند عملکرد مناسبی ارائه دهد.

برای مثال، مدل می‌تواند به‌طور اختصاصی برای این کارها تنظیم شود:

  • تشخیص موضوع تیکت
  • استخراج مشخصات محصول
  • انتخاب ابزار مناسب
  • تبدیل متن به JSON
  • تشخیص هدف کاربر
  • دسته‌بندی نظرات
  • پاسخ به پرسش‌های یک حوزه مشخص

ساخت معماری چندمدلی

SLM به توسعه‌دهنده اجازه می‌دهد هر درخواست را با مدلی متناسب با پیچیدگی آن پردازش کند. درخواست‌های ساده به مدل کوچک و درخواست‌های دشوار به مدل قوی‌تر ارسال می‌شوند.

این معماری به‌جای انتخاب یک مدل برای تمام وظایف، از ترکیب چند مدل استفاده می‌کند.

مدل زبانی کوچک چگونه کار می‌کند؟

بیشتر مدل‌های زبانی کوچک جدید از همان مفاهیم اصلی مدل‌های بزرگ استفاده می‌کنند. ورودی به واحدهایی به نام توکن تقسیم می‌شود و مدل بر اساس توکن‌های قبلی، ادامه مناسب را پیش‌بینی می‌کند.

تفاوت اصلی در مقیاس، داده آموزشی، معماری و هدف بهینه‌سازی است.

مدل کوچک معمولاً لایه‌ها، پارامترها یا ظرفیت پردازشی کمتری دارد. در نتیجه:

  • حافظه کمتری مصرف می‌کند.
  • اجرای آن سریع‌تر است.
  • هزینه پردازش پایین‌تری دارد.
  • دانش ذخیره‌شده محدودتری دارد.
  • در وظایف پیچیده زودتر به محدودیت می‌رسد.

کیفیت SLM فقط به اندازه آن وابسته نیست. داده آموزشی باکیفیت، روش آموزش، معماری، فاین‌تیونینگ و نوع وظیفه نیز بر نتیجه اثر می‌گذارند.

به همین دلیل ممکن است یک مدل کوچک جدید در وظیفه‌ای مشخص از یک مدل بزرگ‌تر اما قدیمی‌تر نتیجه بهتری تولید کند.

مدل‌های زبانی کوچک چگونه ساخته می‌شوند؟

آموزش روی داده‌های انتخاب‌شده

یک مدل کوچک می‌تواند از ابتدا روی مجموعه‌ای از داده‌های باکیفیت آموزش داده شود. در این روش، انتخاب و پاک‌سازی داده اهمیت زیادی دارد؛ زیرا ظرفیت مدل برای یادگیری محدودتر است.

تقطیر دانش

در Knowledge Distillation، یک مدل بزرگ‌تر نقش معلم را ایفا می‌کند و مدل کوچک‌تر از خروجی‌ها یا الگوهای رفتاری آن می‌آموزد.

هدف این است که بخشی از توانایی مدل بزرگ به مدلی کوچک‌تر و اقتصادی‌تر منتقل شود. پژوهش Google Research درباره Distilling Step-by-Step نشان داده است که در بعضی وظایف مشخص، مدل کوچکِ آموزش‌دیده با این روش می‌تواند عملکردی رقابتی ارائه کند.

فاین‌تیونینگ

در فاین‌تیونینگ، مدل ازپیش‌آموزش‌دیده با داده‌های یک وظیفه یا حوزه مشخص ادامه آموزش می‌بیند.

برای مثال، یک مدل کوچک را می‌توان با نمونه‌های واقعی پشتیبانی مشتریان تنظیم کرد تا موضوع پیام، اولویت و واحد پاسخ‌گو را تشخیص دهد.

کوانتیزه‌کردن

Quantization دقت عددی وزن‌های مدل را کاهش می‌دهد تا حجم حافظه و نیاز پردازشی کمتر شود. این روش می‌تواند اجرای مدل روی سخت‌افزارهای محدودتر را ساده‌تر کند.

کوانتیزه‌کردن بیش از حد ممکن است بخشی از کیفیت مدل را کاهش دهد؛ بنابراین نسخه‌های مختلف باید با داده واقعی ارزیابی شوند.

هرس‌کردن

در Pruning بخش‌هایی از مدل که اثر کمتری بر خروجی دارند حذف می‌شوند. هدف، سبک‌ترکردن مدل با کمترین افت قابل‌قبول در کیفیت است.

نمونه‌هایی از مدل‌های زبانی کوچک

خانواده Gemma

Gemma خانواده‌ای از مدل‌های باز گوگل است که در اندازه‌ها و معماری‌های مختلف عرضه می‌شود.

طبق مستندات رسمی، خانواده Gemma 4 شامل مدل‌های کوچک با اندازه مؤثر 2B و 4B است که برای اجرا روی موبایل، مرورگر و دستگاه‌های Edge طراحی شده‌اند. نسخه‌های دیگر این خانواده برای وظایف سنگین‌تر ارائه می‌شوند.

گوگل همچنین FunctionGemma را بر پایه یک مدل 270M معرفی کرده است. این مدل به‌طور خاص برای توسعه قابلیت Function Calling طراحی شده و نمونه‌ای از تمرکز SLM بر یک وظیفه محدود است.

خانواده Phi

Phi خانواده مدل‌های کوچک مایکروسافت است. نسخه‌های مختلف آن برای وظایف متنی، استدلالی و اجرای محلی توسعه یافته‌اند.

مایکروسافت از Phi-4-mini در Prompt API آزمایشی مرورگر Edge استفاده کرده است. این نمونه نشان می‌دهد مدل‌های کوچک چگونه می‌توانند مستقیماً وارد مرورگر و نرم‌افزارهای کاربر شوند.

مدل‌های کوچک تخصصی

بعضی مدل‌های کوچک برای گفت‌وگوی عمومی ساخته نشده‌اند. آن‌ها ممکن است فقط برای یکی از این کارها طراحی شده باشند:

  • Embedding
  • Reranking
  • طبقه‌بندی متن
  • استخراج موجودیت
  • Function Calling
  • ترجمه
  • تولید کد
  • پردازش یک زبان یا صنعت مشخص

در چنین مواردی، محدودبودن دامنه مدل یک ضعف نیست؛ بلکه بخشی از طراحی آن است.

مدل زبانی کوچک برای چه کارهایی مناسب است؟

دسته‌بندی پیام‌ها

فرض کنید یک سامانه روزانه هزاران پیام دریافت می‌کند. یک SLM می‌تواند هر پیام را در یکی از دسته‌های فروش، پشتیبانی، پیگیری سفارش، شکایت یا پیشنهاد قرار دهد.

این وظیفه خروجی محدود و معیار ارزیابی مشخصی دارد؛ بنابراین گزینه مناسبی برای مدل کوچک است.

استخراج اطلاعات ساختاریافته

مدل می‌تواند نام، شماره سفارش، نام محصول، تاریخ، شهر یا موضوع درخواست را از متن استخراج و در قالب JSON تحویل دهد.

خلاصه‌سازی کوتاه

برای تبدیل یک پیام، تیکت یا یادداشت کوتاه به خلاصه یک یا دو جمله‌ای معمولاً نیازی به بزرگ‌ترین مدل موجود نیست.

تشخیص هدف کاربر

در چت‌بات‌ها و دستیارهای هوشمند، می‌توان از SLM برای تشخیص Intent استفاده کرد:

  • مشاهده وضعیت سفارش
  • درخواست بازپرداخت
  • دریافت راهنما
  • تغییر اطلاعات
  • صحبت با کارشناس

پس از تشخیص هدف، برنامه ابزار یا مسیر مناسب را انتخاب می‌کند.

مسیریابی درخواست‌ها

یک مدل کوچک می‌تواند قبل از مدل اصلی قرار بگیرد و نوع درخواست را مشخص کند:

  • درخواست ساده
  • نیازمند مدل استدلالی
  • نیازمند مدل کدنویسی
  • نیازمند مدل چندوجهی
  • قابل‌پاسخ با اطلاعات موجود
  • نیازمند بازیابی سند

Function Calling

مدل‌های کوچک تخصصی می‌توانند میان چند تابع محدود، ابزار مناسب را انتخاب و ورودی موردنیاز آن را تولید کنند.

برای مثال، یک دستیار فروش ممکن است فقط این ابزارها را داشته باشد:

  • دریافت موجودی محصول
  • استعلام وضعیت سفارش
  • ثبت درخواست تماس
  • محاسبه هزینه ارسال

اگر تعداد ابزارها و ساختار ورودی‌ها محدود باشد، یک مدل کوچکِ ارزیابی‌شده می‌تواند انتخاب مناسبی باشد.

پردازش گروهی

کارهایی مانند دسته‌بندی هزاران نظر، ساخت برچسب، استانداردسازی عنوان‌ها یا استخراج داده از مجموعه بزرگی از متن‌ها با مدل کوچک اقتصادی‌تر می‌شوند.

قابلیت‌های سریع داخل محصول

پیشنهاد عنوان، تکمیل جمله، اصلاح لحن، تولید پاسخ کوتاه و تبدیل متن به قالب مشخص از کاربردهایی هستند که به زمان پاسخ پایین نیاز دارند.

چه زمانی SLM انتخاب مناسبی نیست؟

پرسش‌های عمومی و گسترده

مدل کوچک دانش عمومی محدودتری دارد و ممکن است در پاسخ به پرسش‌هایی که چند حوزه را ترکیب می‌کنند ضعیف‌تر باشد.

استدلال پیچیده و چندمرحله‌ای

برنامه‌ریزی طولانی، تحلیل چند سناریو، حل مسئله دشوار و بررسی قیود متعدد معمولاً به مدل قدرتمندتری نیاز دارند.

تحلیل اسناد طولانی

اگر مدل باید ارتباط میان بخش‌های متعدد یک سند طولانی را درک کند، محدودیت ظرفیت و توان پردازشی SLM ممکن است بر کیفیت نتیجه اثر بگذارد.

وظایف مبهم و پیش‌بینی‌نشده

مدل کوچک در مسئله‌ای محدود و تعریف‌شده عملکرد بهتری دارد. اگر کاربران هر نوع سؤال غیرقابل‌پیش‌بینی مطرح می‌کنند، مدل عمومی بزرگ‌تر انعطاف بیشتری خواهد داشت.

تولید محتوای عمیق

مقاله تحلیلی، گزارش مفصل، برنامه کسب‌وکار یا محتوایی که نیازمند انسجام طولانی است معمولاً با مدل بزرگ‌تر نتیجه بهتری می‌دهد.

Agentهای پیچیده

اگر عامل هوش مصنوعی باید از میان تعداد زیادی ابزار انتخاب کند، چند مرحله برنامه‌ریزی انجام دهد و پس از هر اقدام تصمیم تازه‌ای بگیرد، مدل کوچک ممکن است زودتر دچار خطا شود.

آیا مدل کوچک می‌تواند بهتر از مدل بزرگ باشد؟

بله، اما نه در تمام شرایط.

یک مدل کوچک می‌تواند در وظیفه‌ای مشخص بهتر باشد، به‌خصوص اگر:

  • برای همان وظیفه آموزش دیده باشد.
  • خروجی مورد انتظار محدود باشد.
  • نمونه‌های آموزشی باکیفیت داشته باشد.
  • معیار موفقیت دقیق تعریف شده باشد.
  • پرامپت و قالب خروجی ثابت باشند.
  • وظیفه به دانش عمومی گسترده نیاز نداشته باشد.

برای مثال، یک مدل تخصصی تشخیص Intent ممکن است از یک مدل عمومی بزرگ در دسته‌بندی پیام‌های یک کسب‌وکار دقیق‌تر، سریع‌تر و اقتصادی‌تر باشد.

اما از این نتیجه نمی‌توان برداشت کرد که همان مدل برای تحلیل پیچیده، برنامه‌نویسی یا تولید محتوای طولانی نیز بهتر خواهد بود.

معماری ترکیبی SLM و LLM

بهترین روش استفاده از مدل کوچک در بسیاری از محصولات، جایگزینی کامل مدل بزرگ نیست. می‌توان یک معماری ترکیبی ساخت که درخواست را به مدل مناسب هدایت کند.

فرایند ساده آن به این شکل است:

  1. برنامه درخواست کاربر را دریافت می‌کند.
  2. یک مدل کوچک نوع و میزان پیچیدگی درخواست را مشخص می‌کند.
  3. درخواست‌های ساده توسط همان مدل یا یک مدل اقتصادی پاسخ داده می‌شوند.
  4. درخواست‌های پیچیده به مدل قدرتمندتر ارسال می‌شوند.
  5. خروجی با ساختار مورد انتظار کنترل می‌شود.
  6. نتیجه نهایی به کاربر نمایش داده می‌شود.

نمونه تصمیم‌های Router:

  • دسته‌بندی و استخراج ← مدل کوچک
  • خلاصه کوتاه ← مدل کوچک
  • پاسخ عمومی ساده ← مدل اقتصادی
  • تحلیل چندمرحله‌ای ← مدل استدلالی
  • بررسی تصویر ← مدل چندوجهی
  • تولید کد پیچیده ← مدل کدنویسی
  • گزارش طولانی ← مدل بزرگ‌تر

این معماری هزینه را کاهش می‌دهد، اما باید دقت Router نیز اندازه‌گیری شود. اگر درخواست دشوار به اشتباه ساده تشخیص داده شود، کیفیت پاسخ نهایی کاهش پیدا می‌کند.

استفاده از SLM با API درواره

درواره یک API یکپارچه و سازگار با OpenAI برای دسترسی به مدل‌های مختلف ارائه می‌کند. این ساختار به توسعه‌دهنده اجازه می‌دهد مدل‌های سریع، اقتصادی، استدلالی و تخصصی را بدون طراحی یک اتصال جداگانه برای هر ارائه‌دهنده آزمایش کند.

برای استفاده از مدل کوچک در یک محصول می‌توانید:

  • مدل‌های مناسب را در کاتالوگ درواره بررسی کنید.
  • مدل کوچک را روی داده واقعی آزمایش کنید.
  • هزینه، سرعت و کیفیت آن را با مدل‌های بزرگ‌تر مقایسه کنید.
  • برای هر وظیفه یک Model ID مشخص در نظر بگیرید.
  • درخواست‌های پیچیده را به مدل دیگری ارسال کنید.
  • مصرف مدل‌ها را از یک داشبورد مدیریت کنید.

فهرست مدل‌ها و شناسه آن‌ها ممکن است تغییر کند؛ بنابراین برای انتخاب SLM یا مدل اقتصادی مناسب باید کاتالوگ فعلی درواره بررسی شود.

نمونه اتصال به یک مدل از طریق API درواره

ابتدا کتابخانه لازم را نصب کنید:

pip install openai

سپس یک درخواست ساده ارسال کنید:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1"
)

response = client.chat.completions.create(
    model="YOUR_SMALL_MODEL_ID",
    messages=[
        {
            "role": "system",
            "content": """
پیام مشتری را فقط در یکی از دسته‌های زیر قرار بده:
فروش، پشتیبانی، پیگیری سفارش، شکایت، سایر

فقط نام دسته را برگردان.
"""
        },
        {
            "role": "user",
            "content": "سه روز است سفارشم ثبت شده اما هنوز ارسال نشده است."
        }
    ],
    temperature=0
)

print(response.choices[0].message.content)

خروجی مورد انتظار:

پیگیری سفارش

این وظیفه محدود است و پاسخ آن فقط یکی از پنج گزینه خواهد بود. چنین سناریویی برای ارزیابی مدل کوچک مناسب است.

ساخت Router میان مدل کوچک و مدل بزرگ

در نمونه زیر ابتدا یک مدل کوچک پیچیدگی درخواست را تشخیص می‌دهد. سپس برنامه مدل پاسخ‌دهنده را انتخاب می‌کند.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1"
)

SMALL_MODEL = "YOUR_SMALL_MODEL_ID"
ADVANCED_MODEL = "YOUR_ADVANCED_MODEL_ID"

user_message = """
سه طرح قیمت‌گذاری برای یک نرم‌افزار سازمانی پیشنهاد بده،
مزایا و معایب هرکدام را مقایسه کن و سناریوی مناسب ورود به بازار را توضیح بده.
"""

router_response = client.chat.completions.create(
    model=SMALL_MODEL,
    messages=[
        {
            "role": "system",
            "content": """
پیچیدگی درخواست را تشخیص بده.
اگر درخواست کوتاه، محدود و مستقیم است SIMPLE بنویس.
اگر به تحلیل، مقایسه یا استدلال چندمرحله‌ای نیاز دارد COMPLEX بنویس.
فقط یکی از این دو کلمه را برگردان.
"""
        },
        {
            "role": "user",
            "content": user_message
        }
    ],
    temperature=0
)

route = router_response.choices[0].message.content.strip()

selected_model = (
    ADVANCED_MODEL
    if route == "COMPLEX"
    else SMALL_MODEL
)

final_response = client.chat.completions.create(
    model=selected_model,
    messages=[
        {
            "role": "user",
            "content": user_message
        }
    ]
)

print(final_response.choices[0].message.content)

این نمونه برای توضیح معماری است. در محصول واقعی نباید تصمیم Router فقط بر یک کلمه آزاد متکی باشد. بهتر است خروجی ساختاریافته، اعتبارسنجی، ثبت نتیجه و مسیر جایگزین نیز در نظر گرفته شوند.

چگونه مدل کوچک مناسب را انتخاب کنیم؟

وظیفه را محدود کنید

به‌جای ارزیابی کلی مدل، دقیقاً مشخص کنید چه کاری باید انجام دهد:

  • دسته‌بندی در ۱۰ گروه
  • استخراج پنج فیلد
  • تولید خلاصه زیر ۱۰۰ کلمه
  • انتخاب میان چهار ابزار
  • بازنویسی در یک لحن مشخص

داده آزمایشی واقعی بسازید

مجموعه‌ای از نمونه‌های واقعی و پاسخ درست آن‌ها آماده کنید. این مجموعه باید موارد ساده، دشوار، مبهم و کم‌تکرار را پوشش دهد.

عملکرد فارسی را جداگانه بررسی کنید

مدلی که در آزمون‌های انگلیسی عملکرد خوبی دارد الزاماً در فارسی همان کیفیت را ارائه نمی‌کند.

در ارزیابی فارسی، این موارد را بررسی کنید:

  • متن رسمی و محاوره‌ای
  • نیم‌فاصله و شکل‌های مختلف نوشتن کلمات
  • متن ترکیبی فارسی و انگلیسی
  • اعداد فارسی و لاتین
  • تاریخ شمسی
  • غلط‌های تایپی رایج
  • نام محصول و برند
  • جمله‌های کوتاه یا ناقص کاربران

سرعت را اندازه‌گیری کنید

زمان شروع پاسخ و زمان تکمیل آن را در شرایط یکسان ثبت کنید. فقط یک درخواست آزمایشی برای تصمیم‌گیری کافی نیست.

هزینه را بر اساس مصرف واقعی محاسبه کنید

طول ورودی و خروجی، تعداد درخواست‌ها و توکن مصرفی را در سناریوی واقعی اندازه‌گیری کنید.

قالب خروجی را آزمایش کنید

اگر برنامه به JSON نیاز دارد، درصد پاسخ‌های معتبر را ثبت کنید. مدلی که متن خوبی می‌نویسد ممکن است همیشه Schema را رعایت نکند.

با یک مدل بزرگ‌تر مقایسه کنید

هدف فقط پیداکردن ارزان‌ترین مدل نیست. باید ارزان‌ترین مدلی را پیدا کنید که کیفیت موردنیاز محصول را تأمین کند.

معیارهای ارزیابی SLM در یک محصول فارسی

برای انتخاب درست می‌توانید این معیارها را ثبت کنید:

  • درصد پاسخ صحیح
  • رعایت دستور
  • کیفیت زبان فارسی
  • اعتبار خروجی JSON
  • زمان شروع پاسخ
  • زمان کامل‌شدن پاسخ
  • تعداد توکن ورودی و خروجی
  • هزینه هر هزار درخواست
  • نرخ ارجاع به مدل بزرگ‌تر
  • عملکرد روی نمونه‌های دشوار
  • ثبات پاسخ در اجرای مجدد

یک مدل کوچک زمانی انتخاب خوبی است که در معیار اصلی وظیفه به حد قابل‌قبول برسد؛ نه اینکه الزاماً در تمام آزمون‌ها بالاترین امتیاز را داشته باشد.

اشتباهات رایج در استفاده از مدل زبانی کوچک

استفاده از SLM برای تمام درخواست‌ها

مدل کوچک برای وظایف محدود مناسب است. اجبار آن به پاسخ‌گویی به مسائل پیچیده باعث افت کیفیت می‌شود.

انتخاب مدل فقط بر اساس تعداد پارامتر

معماری، داده آموزشی، زبان، فاین‌تیونینگ و نوع وظیفه به‌اندازه تعداد پارامتر اهمیت دارند.

نداشتن مسیر انتقال به مدل قوی‌تر

اگر مدل کوچک نتوانست مسئله را حل کند، برنامه باید بتواند درخواست را به مدل مناسب دیگری ارسال کند.

ارزیابی فقط با چند پرامپت ساده

نمونه‌های نمایشی معمولاً عملکرد واقعی محصول را نشان نمی‌دهند. ارزیابی باید با داده‌های نزدیک به رفتار کاربران انجام شود.

نادیده‌گرفتن کیفیت فارسی

بعضی مدل‌ها در انگلیسی قوی‌اند اما در متن فارسی، محاوره، اعداد یا خروجی ساختاریافته عملکرد متفاوتی دارند.

استفاده از بزرگ‌ترین SLM موجود

اگر یک مدل کوچک‌تر کیفیت موردنیاز را تأمین می‌کند، مدل بزرگ‌تر همان خانواده الزاماً انتخاب اقتصادی‌تری نیست.

تمرکز صرف بر قیمت

مدل ارزان اما کم‌دقت ممکن است باعث افزایش تلاش مجدد، ارجاع بیشتر و نارضایتی کاربران شود. قیمت باید در کنار کیفیت و سرعت بررسی شود.

آینده مدل‌های زبانی کوچک

روند توسعه مدل‌های کوچک به‌سمت تخصصی‌ترشدن حرکت می‌کند. به‌جای یک مدل عمومی برای تمام کارها، مدل‌های سبک‌تری برای وظایفی مانند Function Calling، ترجمه، استخراج، کدنویسی، پردازش چندوجهی و اجرای روی دستگاه عرضه می‌شوند.

پیشرفت در داده آموزشی، تقطیر دانش، Quantization و معماری‌های کارآمد نیز باعث می‌شود مدل‌های کوچک با منابع کمتر، وظایف پیچیده‌تری انجام دهند.

بااین‌حال، احتمالاً آینده به انتخاب میان SLM یا LLM محدود نمی‌شود. معماری رایج‌تر ترکیبی خواهد بود:

  • مدل کوچک برای تشخیص و پردازش اولیه
  • مدل تخصصی برای وظیفه مشخص
  • مدل بزرگ برای مسائل دشوار
  • Router برای انتخاب مسیر
  • سیستم ارزیابی برای کنترل کیفیت

در چنین معماری‌ای، ارزش اصلی از انتخاب درست مدل برای هر درخواست به دست می‌آید.

پرسش‌های متداول

SLM مخفف چیست؟

SLM مخفف Small Language Model و به‌معنای مدل زبانی کوچک است.

تفاوت اصلی SLM و LLM چیست؟

SLM معمولاً پارامتر و نیاز پردازشی کمتری دارد و برای اجرای سریع و اقتصادی وظایف مشخص مناسب‌تر است. LLM دانش عمومی و توانایی بیشتری برای مسائل پیچیده دارد.

مدل زبانی کوچک چند پارامتر دارد؟

تعریف ثابتی وجود ندارد. معمولاً مدل‌هایی از چندصد میلیون تا چند میلیارد پارامتر در این گروه قرار می‌گیرند، اما مرز آن با تغییر نسل مدل‌ها جابه‌جا می‌شود.

آیا مدل کوچک از مدل بزرگ سریع‌تر است؟

در شرایط مشابه معمولاً بله؛ اما سرعت نهایی به سخت‌افزار، معماری مدل، طول ورودی، طول خروجی، حجم هم‌زمان درخواست‌ها و شیوه ارائه سرویس نیز وابسته است.

آیا SLM برای زبان فارسی مناسب است؟

بعضی مدل‌های کوچک می‌توانند فارسی را پردازش کنند، اما کیفیت آن‌ها یکسان نیست. عملکرد باید با متن رسمی، محاوره‌ای و نمونه‌های واقعی کاربران فارسی ارزیابی شود.

آیا SLM می‌تواند روی لپ‌تاپ اجرا شود؟

بسیاری از مدل‌های کوچک، به‌ویژه نسخه‌های Quantized، روی لپ‌تاپ یا سخت‌افزار معمولی اجرا می‌شوند. سرعت و کیفیت به اندازه مدل و مشخصات دستگاه بستگی دارد.

آیا SLM برای چت‌بات مناسب است؟

برای چت‌بات محدود، پاسخ‌های کوتاه، تشخیص هدف و انتخاب ابزار می‌تواند مناسب باشد. چت‌بات عمومی با پرسش‌های متنوع ممکن است به مدل بزرگ‌تر یا معماری ترکیبی نیاز داشته باشد.

آیا می‌توان SLM و LLM را هم‌زمان استفاده کرد؟

بله. مدل کوچک می‌تواند درخواست‌های ساده را پردازش یا مسیریابی کند و درخواست‌های پیچیده به مدل بزرگ‌تر فرستاده شوند.

آیا API درواره مدل‌های کوچک دارد؟

فهرست مدل‌های فعال و مشخصات آن‌ها در کاتالوگ درواره قابل‌مشاهده است. از آنجا که مدل‌ها و مسیرهای دسترسی تغییر می‌کنند، باید شناسه و قیمت فعلی هر مدل را در صفحه مدل‌ها بررسی کنید.

جمع‌بندی

مدل زبانی کوچک یا SLM برای انجام سریع و اقتصادی وظایف مشخص طراحی شده است. این مدل‌ها می‌توانند در دسته‌بندی، استخراج اطلاعات، خلاصه‌سازی کوتاه، تشخیص هدف، Function Calling و مسیریابی درخواست‌ها مفید باشند.

SLM جایگزین کامل LLM نیست. مدل کوچک در وظیفه محدود و پرتعداد ارزش ایجاد می‌کند، درحالی‌که مدل بزرگ برای تحلیل پیچیده، دانش گسترده و استدلال چندمرحله‌ای مناسب‌تر است.

بهترین راه، انتخاب یک مدل برای تمام کارها نیست. معماری چندمدلی می‌تواند درخواست‌های ساده را به مدل سبک‌تر و مسائل پیچیده را به مدل قدرتمندتر ارسال کند.

برای پیاده‌سازی چنین معماری‌ای می‌توانید از API درواره استفاده کنید، مدل‌های مختلف را با یک رابط سازگار آزمایش کنید و بر اساس کیفیت، سرعت و هزینه، مدل مناسب هر وظیفه را انتخاب کنید.

مقالات مرتبط

منابع

این مقاله صرفاً با هدف آموزش و اطلاع‌رسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویس‌ها و صفحه سلب مسئولیت را مطالعه کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.