Inkling چیست؟ بررسی کامل مدل چندوجهی Thinking Machines، معماری MoE، Reasoning، Coding و آموزش API درواره

Inkling نخستین مدل عمومی Thinking Machines Lab است؛ مدلی چندوجهی با ۹۷۵ میلیارد پارامتر، معماری MoE، زمینه یک میلیون توکنی و قابلیت‌های Reasoning، Coding و Tool Calling. در این راهنما با مشخصات و روش استفاده از آن از طریق API درواره آشنا می‌شوید.

Share
Inkling چیست؟ بررسی کامل مدل چندوجهی Thinking Machines، معماری MoE، Reasoning، Coding و آموزش API درواره

مدل‌های هوش مصنوعی Open Weight در سال‌های اخیر به بخش مهمی از اکوسیستم هوش مصنوعی تبدیل شده‌اند. این مدل‌ها به توسعه‌دهندگان و سازمان‌ها اجازه می‌دهند به وزن‌های مدل دسترسی داشته باشند، آن را برای نیازهای تخصصی تنظیم کنند و کنترل بیشتری بر نحوه استقرار و استفاده از هوش مصنوعی داشته باشند.

Inkling یکی از جدیدترین مدل‌های این حوزه و نخستین مدل عمومی شرکت Thinking Machines Lab است؛ شرکت هوش مصنوعی تأسیس‌شده توسط میرا موراتی، مدیر ارشد فناوری پیشین OpenAI.

Inkling یک مدل چندوجهی مبتنی بر معماری Mixture of Experts یا MoE است که مجموعاً ۹۷۵ میلیارد پارامتر دارد، اما هنگام پردازش هر توکن فقط حدود ۴۱ میلیارد پارامتر آن فعال می‌شوند. این طراحی تلاش می‌کند میان ظرفیت بالا، کیفیت خروجی و هزینه پردازش تعادل ایجاد کند.

این مدل روی ۴۵ تریلیون توکن شامل متن، تصویر، صدا و ویدئو آموزش دیده و از پنجره زمینه‌ای تا حدود یک میلیون توکن پشتیبانی می‌کند.

Inkling برای طیف گسترده‌ای از کاربردها طراحی شده است:

  • استدلال و حل مسائل پیچیده؛
  • برنامه‌نویسی و تحلیل کد؛
  • ساخت AI Agent؛
  • Tool Calling؛
  • درک تصویر و صدا؛
  • پردازش اسناد و Contextهای طولانی؛
  • شخصی‌سازی و Fine-tuning؛
  • ساخت مدل‌های تخصصی سازمانی.

در این مقاله بررسی می‌کنیم Inkling چیست، چگونه کار می‌کند، چه قابلیت‌ها و محدودیت‌هایی دارد و چگونه می‌توان آن را از طریق API درواره در اپلیکیشن‌ها و سرویس‌های هوش مصنوعی به کار گرفت.

Inkling چیست؟

Inkling یک مدل پایه چندوجهی و Open Weight از Thinking Machines Lab است که در ۱۵ ژوئیه ۲۰۲۶ معرفی شد.

این مدل با هدف تبدیل‌شدن به یک مدل پایه انعطاف‌پذیر برای توسعه، شخصی‌سازی و Fine-tuning ساخته شده است. Thinking Machines نیز صریحاً Inkling را به‌عنوان قوی‌ترین مدل عمومی جهان معرفی نمی‌کند؛ بلکه تمرکز اصلی آن روی ایجاد تعادل میان چند ویژگی قرار دارد:

  • توانایی چندوجهی؛
  • استدلال کنترل‌پذیر؛
  • بهره‌وری محاسباتی؛
  • قابلیت شخصی‌سازی؛
  • عملکرد متوازن در حوزه‌های مختلف؛
  • امکان استفاده در سیستم‌های Agentic.

برخلاف مدل‌هایی که صرفاً برای کسب بالاترین امتیاز در Benchmarkها ساخته می‌شوند، Inkling قرار است یک پایه عمومی و قابل‌تطبیق برای توسعه محصولات هوش مصنوعی باشد.

مشخصات این مقاله بر اساس معرفی رسمی Inkling توسط Thinking Machines Lab تنظیم شده است.

مشخصات فنی Inkling

مشخصهمقدار
توسعه‌دهندهThinking Machines Lab
تاریخ معرفی۱۵ ژوئیه ۲۰۲۶
نوع مدلمدل پایه چندوجهی
معماریMixture of Experts
تعداد کل پارامترها۹۷۵ میلیارد
پارامترهای فعالحدود ۴۱ میلیارد
داده‌های آموزش۴۵ تریلیون توکن
Context Windowتا حدود یک میلیون توکن
ورودی متندارد
ورودی تصویردارد
ورودی صدادارد
آموزش با داده ویدئوییدارد
خروجی اصلیمتن
Reasoningدارد
Codingدارد
Tool Callingدارد
Fine-tuningدارد
نوع انتشارOpen Weight
کاربرد اصلیمدل عمومی قابل‌سفارشی‌سازی

پشتیبانی عملی هر قابلیت ممکن است به Endpoint، زیرساخت ارائه مدل و تنظیمات فعال‌شده برای آن وابسته باشد.

Thinking Machines Lab چیست؟

Thinking Machines Lab یک شرکت پژوهشی و توسعه هوش مصنوعی است که توسط میرا موراتی تأسیس شد. او پیش‌تر به‌عنوان مدیر ارشد فناوری OpenAI فعالیت می‌کرد و در توسعه و عرضه چند نسل از محصولات هوش مصنوعی نقش داشت.

این شرکت بر توسعه سیستم‌های هوش مصنوعی قابل‌سفارشی‌سازی تمرکز دارد. دیدگاه اصلی Thinking Machines این است که یک مدل عمومی ثابت نمی‌تواند بهترین انتخاب برای تمام کاربران و سازمان‌ها باشد.

سازمان‌های مختلف داده‌ها، فرایندها، اصطلاحات و نیازهای متفاوتی دارند. به همین دلیل، امکان تطبیق و Fine-tuning مدل به بخشی مهم از راهبرد این شرکت تبدیل شده است.

Inkling نخستین مدل عمومی این مجموعه محسوب می‌شود و به‌عنوان پایه‌ای برای ساخت مدل‌های تخصصی‌تر طراحی شده است.

معنی نام Inkling چیست؟

واژه Inkling در زبان انگلیسی به معنای «نشانه‌ای کوچک»، «درکی اولیه» یا «تصوری مبهم از چیزی» است.

انتخاب این نام می‌تواند به نقش مدل به‌عنوان نخستین نشانه از مسیر آینده Thinking Machines اشاره داشته باشد. Inkling اولین عضو یک خانواده از مدل‌هاست و شرکت سازنده اعلام کرده است که مدل‌هایی با اندازه‌های متفاوت نیز در این خانواده ارائه خواهند شد.

معماری Mixture of Experts در Inkling

Inkling از معماری Mixture of Experts استفاده می‌کند که معمولاً به‌اختصار MoE نامیده می‌شود.

در یک مدل Dense، تمام یا بخش بزرگی از پارامترها برای پردازش هر توکن درگیر می‌شوند. در معماری MoE، مدل از مجموعه‌ای از بخش‌های تخصصی یا Expert تشکیل شده است و یک سیستم مسیریابی تعیین می‌کند کدام Expertها برای پردازش هر ورودی فعال شوند.

Inkling در مجموع ۹۷۵ میلیارد پارامتر دارد، اما فقط حدود ۴۱ میلیارد پارامتر برای هر توکن فعال می‌شوند.

این موضوع به مدل اجازه می‌دهد ظرفیت دانشی بسیار بزرگی داشته باشد، بدون اینکه در هر مرحله تمام پارامترهای آن وارد محاسبه شوند.

معماری MoE چگونه کار می‌کند؟

فرایند ساده‌شده پردازش در مدل MoE را می‌توان این‌گونه توضیح داد:

  1. ورودی به توکن‌ها تبدیل می‌شود.
  2. بخش Router هر توکن را بررسی می‌کند.
  3. مناسب‌ترین Expertها برای آن توکن انتخاب می‌شوند.
  4. فقط Expertهای انتخاب‌شده وارد محاسبات می‌شوند.
  5. خروجی Expertها با یکدیگر ترکیب می‌شود.
  6. مدل توکن یا پاسخ بعدی را تولید می‌کند.

برای مثال، ممکن است یک Expert در برنامه‌نویسی، دیگری در تحلیل متن و Expert دیگری در استدلال ریاضی تخصص بیشتری پیدا کرده باشد. این تخصص الزاماً به‌صورت دستی تعریف نمی‌شود، بلکه در فرایند آموزش شکل می‌گیرد.

مزایای معماری MoE

مهم‌ترین مزیت‌های احتمالی MoE عبارت‌اند از:

  • ظرفیت بسیار زیاد مدل؛
  • کاهش محاسبات نسبت به فعال‌کردن تمام پارامترها؛
  • امکان شکل‌گیری تخصص‌های مختلف در مدل؛
  • تعادل بهتر میان کیفیت و هزینه پردازش؛
  • مقیاس‌پذیری برای وظایف متنوع.

محدودیت‌های معماری MoE

اجرای مدل‌های MoE همچنان ساده نیست. حتی اگر تعداد پارامترهای فعال پایین‌تر باشد، تمام وزن‌های مدل باید در زیرساخت مناسب نگهداری شوند.

مهم‌ترین چالش‌ها عبارت‌اند از:

  • نیاز به حافظه بسیار زیاد؛
  • پیچیدگی توزیع Expertها میان شتاب‌دهنده‌ها؛
  • هزینه بالای انتقال داده بین سرورها؛
  • نیاز به زیرساخت تخصصی؛
  • پیچیدگی بیشتر Fine-tuning و استقرار.

بنابراین ۴۱ میلیارد پارامتر فعال به این معنا نیست که Inkling را می‌توان مانند یک مدل ۴۱ میلیارد پارامتری معمولی روی هر سیستم اجرا کرد.

Inkling-Small چیست؟

Thinking Machines همراه با مدل اصلی، پیش‌نمایشی از Inkling-Small نیز معرفی کرده است.

Inkling-Small نسخه‌ای سبک‌تر از این خانواده است که حدود ۱۲ میلیارد پارامتر فعال دارد و با رویکردی مشابه مدل اصلی آموزش دیده است.

هدف این نسخه ارائه:

  • سرعت بیشتر؛
  • هزینه کمتر؛
  • تأخیر پایین‌تر؛
  • استقرار آسان‌تر؛
  • امکان استفاده در وظایف پرتعداد

است.

Inkling اصلی برای وظایف پیچیده‌تر و Inkling-Small برای سناریوهایی مناسب است که سرعت و هزینه اهمیت بیشتری دارند.

برای استفاده عملی، باید بررسی کنید کدام نسخه در فهرست مدل‌های درواره فعال شده است و Model ID دقیق همان نسخه را انتخاب کنید.

Context Window یک میلیون توکنی

Inkling از پنجره زمینه‌ای تا سقف تقریبی یک میلیون توکن پشتیبانی می‌کند.

پنجره زمینه مشخص می‌کند مدل در یک درخواست چه مقدار اطلاعات را می‌تواند هم‌زمان در نظر بگیرد.

این ظرفیت در کاربردهای زیر مفید است:

  • تحلیل یک Codebase بزرگ؛
  • پردازش چند کتاب یا گزارش؛
  • بررسی مجموعه اسناد سازمانی؛
  • تحلیل قراردادهای طولانی؛
  • کار با تاریخچه طولانی مکالمه؛
  • تحلیل لاگ‌های گسترده؛
  • ساخت Agentهای چندمرحله‌ای؛
  • مقایسه تعداد زیادی سند.

یک میلیون توکن به چه معناست؟

تعداد دقیق کلمات معادل یک میلیون توکن به زبان و نوع محتوا بستگی دارد. متن فارسی، کد، JSON و متن انگلیسی با نسبت یکسانی به توکن تبدیل نمی‌شوند.

به‌طور کلی یک میلیون توکن می‌تواند شامل مقدار بسیار زیادی متن، کد یا داده ساختاریافته باشد؛ اما استفاده از تمام این ظرفیت در هر درخواست لزوماً تصمیم مناسبی نیست.

آیا Context بزرگ همیشه بهتر است؟

خیر. ارسال Context بزرگ می‌تواند باعث افزایش موارد زیر شود:

  • هزینه درخواست؛
  • زمان پاسخ؛
  • حجم انتقال داده؛
  • احتمال ورود اطلاعات نامرتبط؛
  • پیچیدگی ارزیابی پاسخ.

بهتر است ابتدا اطلاعات مرتبط را با روش‌هایی مانند RAG، Semantic Search و Metadata Filtering انتخاب کنید و فقط همان بخش‌ها را در اختیار مدل قرار دهید.

برای آشنایی بیشتر می‌توانید راهنمای Context Window در مدل‌های هوش مصنوعی را مطالعه کنید.

قابلیت‌های چندوجهی Inkling

Inkling روی ۴۵ تریلیون توکن شامل متن، تصویر، صدا و ویدئو آموزش دیده است.

چندوجهی‌بودن به این معناست که مدل می‌تواند اطلاعات چند نوع ورودی را در کنار یکدیگر تحلیل کند.

پردازش متن

مدل می‌تواند برای وظایف متنی مختلف استفاده شود:

  • پاسخ‌گویی به پرسش‌ها؛
  • تولید محتوا؛
  • خلاصه‌سازی؛
  • استخراج اطلاعات؛
  • طبقه‌بندی متن؛
  • بازنویسی؛
  • ترجمه؛
  • تحلیل اسناد؛
  • تولید خروجی ساختاریافته.

درک تصویر

Inkling می‌تواند تصویر را همراه با دستور متنی دریافت و تحلیل کند.

نمونه کاربردها:

  • توصیف تصویر؛
  • تحلیل نمودار؛
  • استخراج اطلاعات از Screenshot؛
  • بررسی طراحی رابط کاربری؛
  • خواندن اسناد تصویری؛
  • تحلیل عکس محصول؛
  • پاسخ‌گویی درباره محتوای تصویر؛
  • تبدیل طراحی بصری به توضیح یا کد.

پردازش صدا

Inkling قابلیت استدلال روی ورودی صوتی را نیز دارد. این قابلیت می‌تواند برای تحلیل محتوای صدا، تشخیص اطلاعات موجود در مکالمه و ترکیب آن با سایر داده‌ها استفاده شود.

نمونه کاربردها:

  • تحلیل جلسه؛
  • بررسی مکالمات پشتیبانی؛
  • استخراج نکات مهم از فایل صوتی؛
  • دسته‌بندی محتوای صوتی؛
  • پاسخ‌گویی درباره یک فایل صوتی.

آموزش با ویدئو

ویدئو بخشی از داده‌های پیش‌آموزش Inkling بوده است. بااین‌حال، فرمت‌های ورودی ویدئو و شیوه دسترسی API می‌تواند در زیرساخت‌های مختلف متفاوت باشد.

پیش از استفاده از ویدئو، باید Modalities فعال‌شده برای مدل را در درواره بررسی کنید.

خروجی متنی

Inkling داده‌های چندوجهی را دریافت می‌کند، اما خروجی اصلی آن متن است. این مدل مستقیماً تصویر، صدا یا ویدئو تولید نمی‌کند.

برای تولید محتوای رسانه‌ای باید از مدل‌های اختصاصی تولید تصویر، صدا یا ویدئو استفاده کنید.

Reasoning در Inkling

Inkling برای استدلال کنترل‌پذیر طراحی شده است. این مدل می‌تواند پیش از تولید پاسخ نهایی، محاسبات بیشتری برای تحلیل مسئله انجام دهد.

این قابلیت در وظایف زیر اهمیت دارد:

  • حل مسائل پیچیده؛
  • برنامه‌ریزی چندمرحله‌ای؛
  • تحلیل کد؛
  • استدلال ریاضی؛
  • مقایسه چند گزینه؛
  • طراحی معماری نرم‌افزار؛
  • تصمیم‌گیری Agent؛
  • بررسی ارتباط میان چند سند.

کنترل میزان Thinking

در صورت پشتیبانی Endpoint، توسعه‌دهنده می‌تواند میزان تلاش استدلالی مدل را متناسب با وظیفه تنظیم کند.

برای مثال:

  • Low: وظایف ساده و سریع؛
  • Medium: تحلیل‌های عمومی؛
  • High: مسائل دشوار و چندمرحله‌ای.

افزایش Reasoning Effort ممکن است کیفیت پاسخ را در مسائل دشوار بهتر کند، اما معمولاً زمان و هزینه بیشتری نیاز دارد.

برای سؤال‌های ساده بهتر است از سطح پایین‌تر استفاده شود و Reasoning قوی فقط به وظایفی اختصاص پیدا کند که واقعاً به آن نیاز دارند.

توانایی برنامه‌نویسی Inkling

Coding یکی از حوزه‌های اصلی ارزیابی Inkling است. این مدل می‌تواند برای تولید و تحلیل کد در زبان‌ها و Frameworkهای مختلف استفاده شود.

قابلیت‌های احتمالی مدل در برنامه‌نویسی عبارت‌اند از:

  • تولید کد؛
  • تکمیل کد؛
  • توضیح کد؛
  • تشخیص Bug؛
  • Refactoring؛
  • نوشتن Unit Test؛
  • تولید مستندات؛
  • تحلیل معماری پروژه؛
  • طراحی API؛
  • بررسی خطاهای Build؛
  • مهاجرت میان زبان‌ها و Frameworkها؛
  • کمک به توسعه Agentهای کدنویسی.

استفاده در Codebaseهای بزرگ

پنجره زمینه بزرگ Inkling می‌تواند برای بررسی فایل‌های متعدد یک پروژه مفید باشد. بااین‌حال، ارسال کامل مخزن کد در هر درخواست بهترین روش نیست.

یک Agent برنامه‌نویسی بهتر است:

  1. ابتدا ساختار پروژه را بخواند.
  2. فایل‌های مرتبط را پیدا کند.
  3. فقط بخش‌های موردنیاز را وارد Context کند.
  4. تغییرات را به قسمت‌های کوچک تقسیم کند.
  5. Testها را اجرا کند.
  6. نتیجه را پیش از تکمیل کار بررسی کند.

آیا Inkling جایگزین برنامه‌نویس است؟

خیر. مدل می‌تواند سرعت توسعه را افزایش دهد، اما کد تولیدشده باید بررسی، آزمایش و از نظر امنیتی ارزیابی شود.

در پروژه‌های Production، نباید تغییرات مدل بدون Code Review و Test مناسب منتشر شوند.

قابلیت Tool Calling

Inkling می‌تواند در سیستم‌هایی استفاده شود که مدل به ابزارها و APIهای بیرونی دسترسی دارد.

برای مثال، توسعه‌دهنده می‌تواند ابزارهای زیر را تعریف کند:

  • جست‌وجوی اطلاعات مشتری؛
  • دریافت موجودی محصول؛
  • ایجاد تیکت؛
  • اجرای Query روی پایگاه داده؛
  • دریافت اطلاعات سفارش؛
  • محاسبه قیمت؛
  • جست‌وجو در اسناد؛
  • اجرای کد؛
  • ارسال درخواست به سرویس داخلی.

مدل بر اساس درخواست کاربر تصمیم می‌گیرد کدام ابزار باید فراخوانی شود و پارامترهای لازم را تولید می‌کند.

نمونه تعریف ابزار

{
  "type": "function",
  "function": {
    "name": "get_order_status",
    "description": "دریافت وضعیت سفارش بر اساس شناسه سفارش",
    "parameters": {
      "type": "object",
      "properties": {
        "order_id": {
          "type": "string",
          "description": "شناسه سفارش"
        }
      },
      "required": ["order_id"]
    }
  }
}

خروجی Tool Calling نباید بدون اعتبارسنجی اجرا شود. پارامترهای تولیدشده توسط مدل باید در Backend بررسی شوند.

استفاده از Inkling برای ساخت AI Agent

Inkling می‌تواند به‌عنوان موتور استدلال یک AI Agent استفاده شود.

Agent معمولاً از اجزای زیر تشکیل می‌شود:

  • مدل هوش مصنوعی؛
  • System Prompt؛
  • مجموعه ابزارها؛
  • حافظه کوتاه‌مدت و بلندمدت؛
  • حلقه اجرای وظیفه؛
  • سیستم ثبت رویدادها؛
  • محدودیت دسترسی؛
  • فرایند تأیید انسانی.

در یک جریان کاری ساده، Agent:

  1. درخواست کاربر را دریافت می‌کند.
  2. هدف را تحلیل می‌کند.
  3. ابزار مناسب را انتخاب می‌کند.
  4. ابزار را فراخوانی می‌کند.
  5. نتیجه ابزار را بررسی می‌کند.
  6. در صورت نیاز ابزار دیگری را اجرا می‌کند.
  7. پاسخ نهایی را ارائه می‌دهد.

نمونه کاربردهای Agent

  • دستیار تحلیل اسناد؛
  • Agent پشتیبانی مشتری؛
  • Agent برنامه‌نویسی؛
  • دستیار پژوهشی؛
  • Agent تحلیل داده؛
  • خودکارسازی فرایندهای داخلی؛
  • بررسی و دسته‌بندی درخواست‌ها؛
  • تولید گزارش‌های مدیریتی.

برای آشنایی بیشتر با این مفهوم، مقاله AI Agent چیست؟ را مطالعه کنید.

Fine-tuning و شخصی‌سازی Inkling

یکی از مهم‌ترین اهداف Inkling، فراهم‌کردن یک مدل پایه مناسب برای شخصی‌سازی است.

Fine-tuning می‌تواند برای تطبیق مدل با موارد زیر استفاده شود:

  • اصطلاحات تخصصی یک صنعت؛
  • سبک پاسخ‌گویی یک سازمان؛
  • فرمت خروجی مشخص؛
  • نوع خاصی از کدنویسی؛
  • استفاده بهتر از ابزارهای اختصاصی؛
  • وظایف تخصصی علمی یا تجاری؛
  • زبان و داده‌های یک حوزه خاص.

Fine-tuning چه زمانی مناسب است؟

Fine-tuning زمانی ارزشمند است که:

  • نمونه‌های آموزشی باکیفیت دارید؛
  • وظیفه به‌صورت تکراری انجام می‌شود؛
  • Prompt Engineering کافی نیست؛
  • مدل باید رفتار ثابتی داشته باشد؛
  • قالب خروجی بسیار مشخص است؛
  • عملکرد مدل پایه در یک حوزه تخصصی کافی نیست.

چه زمانی RAG بهتر است؟

اگر هدف شما اضافه‌کردن اطلاعات جدید، اسناد سازمانی یا داده‌های متغیر است، معمولاً RAG انتخاب مناسب‌تری است.

به‌طور ساده:

  • برای تغییر دانش قابل‌بازیابی از RAG استفاده کنید.
  • برای تغییر رفتار و سبک مدل از Fine-tuning استفاده کنید.
  • در پروژه‌های پیشرفته می‌توان هر دو روش را ترکیب کرد.

برای یادگیری بیشتر، راهنمای ساخت RAG با LangChain و LlamaIndex را ببینید.

مزایای Inkling

معماری بزرگ و کارآمد MoE

مدل ظرفیت ۹۷۵ میلیارد پارامتری دارد، اما در هر مرحله فقط بخشی از پارامترها فعال می‌شوند.

ورودی چندوجهی

توانایی تحلیل متن، تصویر و صدا، مدل را برای کاربردهای متنوع مناسب می‌کند.

Context Window بسیار بزرگ

پنجره زمینه یک میلیون توکنی برای پروژه‌های طولانی و مجموعه اسناد بزرگ مفید است.

قابلیت Reasoning

مدل می‌تواند برای مسائل چندمرحله‌ای و نیازمند تحلیل عمیق استفاده شود.

عملکرد مناسب در Coding

Inkling برای تولید، تحلیل و اصلاح کد کاربرد دارد.

مناسب برای Agent

Tool Calling، Context طولانی و Reasoning باعث می‌شوند مدل برای سیستم‌های Agentic مناسب باشد.

امکان شخصی‌سازی

انتشار Open Weight و تمرکز بر Fine-tuning، Inkling را به پایه‌ای مناسب برای مدل‌های تخصصی تبدیل می‌کند.

صداقت درباره جایگاه مدل

Thinking Machines ادعا نمی‌کند Inkling در تمام Benchmarkها بهترین مدل جهان است. تمرکز مدل بر ایجاد مجموعه‌ای متوازن از قابلیت‌هاست.

محدودیت‌های Inkling

بهترین مدل Frontier نیست

بر اساس اعلام خود شرکت سازنده، Inkling قوی‌ترین مدل موجود در تمام حوزه‌ها نیست.

اجرای محلی دشوار است

۹۷۵ میلیارد پارامتر به حافظه و زیرساخت بسیار قدرتمندی نیاز دارد. اجرای مدل اصلی روی رایانه شخصی یا یک GPU معمولی عملی نیست.

هزینه Context طولانی

ارسال حجم زیادی از متن، تصویر یا داده می‌تواند هزینه پردازش را افزایش دهد.

خروجی محدود به متن

این مدل چندوجهی است، اما خروجی اصلی آن متن است و برای تولید مستقیم تصویر یا ویدئو ساخته نشده است.

نیاز به کنترل خروجی

مدل ممکن است اطلاعات نادرست، کد معیوب یا Tool Call نامناسب تولید کند.

پیچیدگی Fine-tuning

Fine-tuning یک مدل MoE بزرگ به داده باکیفیت، زیرساخت مناسب و ارزیابی دقیق نیاز دارد.

Inkling برای چه کسانی مناسب است؟

Inkling می‌تواند انتخاب مناسبی برای گروه‌های زیر باشد:

  • توسعه‌دهندگان AI Agent؛
  • تیم‌های برنامه‌نویسی؛
  • شرکت‌های دارای اسناد طولانی؛
  • پژوهشگران هوش مصنوعی؛
  • سازمان‌های نیازمند مدل تخصصی؛
  • تیم‌های فعال در Fine-tuning؛
  • سازندگان ابزارهای چندوجهی؛
  • استارتاپ‌های توسعه محصولات هوش مصنوعی.

برای وظایف ساده و پرتعداد، مدل‌های کوچک‌تر احتمالاً سرعت بیشتر و هزینه کمتری خواهند داشت.

مقایسه Inkling با مدل‌های Dense

معیارInkling با معماری MoEمدل Dense
تعداد کل پارامترهابسیار زیادمعمولاً کمتر
پارامترهای فعال در هر توکنبخش محدودی از مدلبیشتر یا تمام مدل
ظرفیت تخصصیبالاوابسته به اندازه مدل
بهره‌وری محاسباتیبهتر از مدل Dense هم‌اندازهمحاسبات یکنواخت‌تر
پیچیدگی استقرارزیادمعمولاً ساده‌تر
نیاز حافظههمچنان بسیار بالاوابسته به اندازه
مدیریت زیرساختپیچیده‌ترساده‌تر
Fine-tuningتخصصی‌ترمعمولاً ساده‌تر

آموزش اتصال Inkling به API درواره

درواره یک API یکپارچه و سازگار با OpenAI برای دسترسی به مدل‌های هوش مصنوعی فراهم می‌کند.

برای شروع به این موارد نیاز دارید:

  1. ثبت‌نام در درواره؛
  2. شارژ کیف پول؛
  3. ساخت API Key؛
  4. دریافت Model ID از صفحه مدل‌ها؛
  5. اتصال اپلیکیشن به Base URL درواره.

اطلاعات اتصال

تنظیممقدار
Base URLhttps://api.darvareh.ir/v1
API Keyکلید ساخته‌شده در پنل
Model IDدرواره
Endpoint/chat/completions

در نمونه‌کدها، مقدار MODEL_ID_FROM_DARVAREH را با شناسه دقیق نمایش‌داده‌شده در درواره جایگزین کنید.

شناسه مدل را حدس نزنید و از نام نمایشی مدل به‌جای Model ID استفاده نکنید.

دریافت فهرست مدل‌های فعال

curl https://api.darvareh.ir/v1/models \
  -H "Authorization: Bearer DARVAREH_API_KEY"

مقدار فیلد id را از پاسخ دریافت کرده و دقیقاً همان مقدار را در درخواست قرار دهید.

نمونه درخواست cURL

curl https://api.darvareh.ir/v1/chat/completions \
  -H "Authorization: Bearer DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MODEL_ID_FROM_DARVAREH",
    "messages": [
      {
        "role": "system",
        "content": "You are a precise reasoning and coding assistant."
      },
      {
        "role": "user",
        "content": "برای یک سیستم پشتیبانی مبتنی بر RAG معماری فنی پیشنهاد بده."
      }
    ]
  }'

نمونه استفاده در Python

ابتدا کتابخانه موردنیاز را نصب کنید:

pip install openai

سپس:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1"
)

response = client.chat.completions.create(
    model="MODEL_ID_FROM_DARVAREH",
    messages=[
        {
            "role": "system",
            "content": (
                "You are a senior AI engineer. "
                "Analyze each problem carefully and provide practical answers."
            )
        },
        {
            "role": "user",
            "content": (
                "معماری یک AI Agent برای تحلیل اسناد مالی، "
                "استخراج اطلاعات و تولید گزارش طراحی کن."
            )
        }
    ]
)

print(response.choices[0].message.content)

نمونه استفاده در JavaScript

ابتدا SDK را نصب کنید:

npm install openai

سپس:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.DARVAREH_API_KEY,
  baseURL: "https://api.darvareh.ir/v1",
});

const response = await client.chat.completions.create({
  model: "MODEL_ID_FROM_DARVAREH",
  messages: [
    {
      role: "system",
      content:
        "You are an AI assistant specialized in software architecture.",
    },
    {
      role: "user",
      content:
        "یک معماری مقیاس‌پذیر برای پردازش اسناد چندوجهی طراحی کن.",
    },
  ],
});

console.log(response.choices[0].message.content);

ارسال تصویر به Inkling

در صورت فعال‌بودن ورودی تصویر برای مدل در Endpoint درواره، می‌توانید متن و تصویر را در یک پیام چندبخشی ارسال کنید.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1"
)

response = client.chat.completions.create(
    model="MODEL_ID_FROM_DARVAREH",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": (
                        "این تصویر رابط کاربری را بررسی کن، "
                        "مشکلات طراحی را پیدا کن و پیشنهاد اصلاح بده."
                    )
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/interface.png"
                    }
                }
            ]
        }
    ]
)

print(response.choices[0].message.content)

برای فایل‌های محلی یا خصوصی می‌توان تصویر را به Base64 تبدیل کرد. بهتر است متن پرامپت پیش از بخش تصویر قرار گیرد.

نمونه پرامپت برای تحلیل کد

نقش شما یک Senior Software Engineer است.

وظیفه:
کد ارائه‌شده را بررسی کن و مشکلات آن را پیدا کن.

خروجی را با این ساختار ارائه بده:
1. خلاصه عملکرد کد
2. خطاهای منطقی
3. مشکلات Performance
4. مشکلات امنیتی
5. مشکلات Maintainability
6. نسخه اصلاح‌شده
7. Testهای پیشنهادی

اگر برای نتیجه‌گیری اطلاعات کافی نداری، فرضیه را به‌عنوان واقعیت بیان نکن.

نمونه پرامپت برای تحلیل اسناد طولانی

اسناد ارائه‌شده را به‌عنوان یک مجموعه مرتبط بررسی کن.

وظایف:
- موضوع اصلی هر سند را مشخص کن.
- اطلاعات تکراری را ادغام کن.
- تناقض‌های میان اسناد را پیدا کن.
- ادعاهای بدون شواهد را مشخص کن.
- یک خلاصه مدیریتی تهیه کن.
- اقدامات پیشنهادی را بر اساس اولویت مرتب کن.

هر نتیجه باید به بخش مرتبط از اسناد متصل باشد.
اگر اطلاعات کافی وجود ندارد، آن را صریحاً اعلام کن.

نمونه پرامپت برای ساخت Agent

شما عامل اصلی این گردش‌کار هستید.

هدف:
درخواست مشتری را بررسی و راه‌حل مناسب را پیدا کن.

مراحل:
1. نوع درخواست را طبقه‌بندی کن.
2. اطلاعات موردنیاز را مشخص کن.
3. فقط ابزارهای ضروری را فراخوانی کن.
4. خروجی ابزارها را اعتبارسنجی کن.
5. اگر اطلاعات ناقص بود، سؤال دقیق بپرس.
6. عملیات حساس را بدون تأیید کاربر انجام نده.
7. در پایان پاسخ کوتاه و عملی ارائه کن.

محدودیت:
حداکثر ۵ Tool Call مجاز است.
هیچ داده‌ای را حذف یا ویرایش نکن.

مدیریت هزینه استفاده از Inkling

برای کنترل هزینه API:

  • فقط اطلاعات مرتبط را ارسال کنید؛
  • Contextهای طولانی را پیش‌پردازش کنید؛
  • اسناد را Chunk کنید؛
  • از RAG استفاده کنید؛
  • تعداد Tool Callها را محدود کنید؛
  • سقف خروجی مشخص کنید؛
  • برای درخواست‌های ساده مدل کوچک‌تر انتخاب کنید؛
  • درخواست‌های تکراری را Cache کنید؛
  • مصرف هر API Key را پایش کنید؛
  • Reasoning بالا را فقط برای مسائل دشوار فعال کنید.

قیمت مدل را از صفحه مدل‌ها و بخش قیمت‌گذاری درواره بررسی کنید، زیرا هزینه نهایی می‌تواند بر اساس میزان ورودی، خروجی، Cache و تنظیمات درخواست متفاوت باشد.

برای اطلاعات بیشتر، مقاله قیمت API هوش مصنوعی چگونه محاسبه می‌شود؟ را مطالعه کنید.

نکات امنیتی

  • API Key را در Frontend قرار ندهید.
  • کلید را در Environment Variable نگهداری کنید.
  • خروجی مدل را پیش از اجرا اعتبارسنجی کنید.
  • برای ابزارها Allowlist تعریف کنید.
  • دسترسی Agent را به حداقل برسانید.
  • برای عملیات حساس تأیید انسانی قرار دهید.
  • ورودی‌های کاربر را از دستورهای سیستمی جدا کنید.
  • در برابر Prompt Injection کنترل مستقل داشته باشید.
  • اطلاعات محرمانه را بدون ضرورت ارسال نکنید.
  • تمام Tool Callها را ثبت کنید.

Open Weight بودن یک مدل به معنای درست یا امن‌بودن تمام خروجی‌های آن نیست.

خطاهای رایج API

خطای 401

API Key نامعتبر است یا Header احراز هویت به‌درستی ارسال نشده است.

Authorization: Bearer DARVAREH_API_KEY

خطای 403

ممکن است API Key به مدل انتخاب‌شده دسترسی نداشته باشد.

خطای 404

Base URL را بررسی کنید:

https://api.darvareh.ir/v1

در SDK نباید مسیر /chat/completions را به Base URL اضافه کنید؛ زیرا SDK آن را به‌صورت خودکار اضافه می‌کند.

خطای 429

تعداد درخواست‌ها از Rate Limit عبور کرده است. از Retry کنترل‌شده و Exponential Backoff استفاده کنید.

خطای Model Not Found

شناسه مدل اشتباه است. Model ID را از پاسخ Endpoint زیر دریافت کنید:

GET /v1/models

خطای Context Length

حجم پیام‌ها از Context قابل‌استفاده در Endpoint بیشتر شده است. اطلاعات غیرضروری را حذف یا اسناد را بخش‌بندی کنید.

Timeout

درخواست‌های طولانی یا دارای Reasoning بالا ممکن است زمان بیشتری نیاز داشته باشند. Timeout اپلیکیشن را متناسب تنظیم کرده و وظیفه را به مراحل کوچک‌تر تقسیم کنید.

Inkling چه زمانی انتخاب مناسبی است؟

Inkling زمانی گزینه مناسبی است که پروژه به موارد زیر نیاز داشته باشد:

  • Context بسیار طولانی؛
  • تحلیل متن و تصویر؛
  • پردازش ورودی صوتی؛
  • Reasoning چندمرحله‌ای؛
  • Coding؛
  • Tool Calling؛
  • ساخت Agent؛
  • Fine-tuning؛
  • مدل پایه قابل‌سفارشی‌سازی.

اگر هدف فقط تولید متن کوتاه، ترجمه ساده یا طبقه‌بندی پرتعداد است، احتمالاً یک مدل کوچک‌تر انتخاب اقتصادی‌تری خواهد بود.

جمع‌بندی

Inkling نخستین مدل عمومی Thinking Machines Lab و یکی از مدل‌های مهم Open Weight در سال ۲۰۲۶ است.

این مدل از معماری Mixture of Experts استفاده می‌کند و دارای:

  • ۹۷۵ میلیارد پارامتر کل؛
  • حدود ۴۱ میلیارد پارامتر فعال؛
  • ۴۵ تریلیون توکن داده آموزشی؛
  • Context Window تا حدود یک میلیون توکن؛
  • قابلیت پردازش متن، تصویر و صدا؛
  • توانایی Reasoning و Coding؛
  • پشتیبانی از Tool Calling؛
  • قابلیت Fine-tuning و شخصی‌سازی

است.

Inkling لزوماً قوی‌ترین مدل جهان در تمام Benchmarkها نیست، اما ترکیب معماری MoE، ورودی چندوجهی، Context طولانی و امکان شخصی‌سازی، آن را به مدلی جذاب برای توسعه‌دهندگان، پژوهشگران و سازمان‌ها تبدیل می‌کند.

با استفاده از API درواره می‌توانید مدل‌های مختلف هوش مصنوعی را از طریق یک اتصال یکپارچه در اپلیکیشن‌ها، Agentها و سرویس‌های خود به کار بگیرید.

برای شروع، در درواره ثبت‌نام کنید، API Key بسازید و Model ID دقیق مدل را از فهرست مدل‌های فعال دریافت کنید.

مقالات مرتبط

پرسش‌های متداول

مدل Inkling چیست؟

Inkling نخستین مدل عمومی Thinking Machines Lab است. این مدل چندوجهی از معماری Mixture of Experts استفاده می‌کند و برای Reasoning، Coding، Tool Calling و Fine-tuning طراحی شده است.

سازنده Inkling چه شرکتی است؟

Inkling توسط Thinking Machines Lab، شرکت هوش مصنوعی تأسیس‌شده توسط میرا موراتی، توسعه یافته است.

Inkling چند پارامتر دارد؟

این مدل در مجموع ۹۷۵ میلیارد پارامتر دارد که حدود ۴۱ میلیارد پارامتر آن هنگام پردازش هر توکن فعال می‌شوند.

Context Window مدل Inkling چقدر است؟

Inkling از پنجره زمینه‌ای تا حدود یک میلیون توکن پشتیبانی می‌کند.

آیا Inkling یک مدل چندوجهی است؟

بله. این مدل برای پردازش و استدلال روی متن، تصویر و صدا طراحی شده و با داده‌های متنی، تصویری، صوتی و ویدئویی آموزش دیده است.

آیا Inkling تصویر تولید می‌کند؟

خیر. Inkling می‌تواند ورودی چندوجهی را تحلیل کند، اما خروجی اصلی آن متن است. برای تولید تصویر باید از مدل‌های تولید تصویر استفاده کنید.

آیا Inkling برای برنامه‌نویسی مناسب است؟

بله. Coding یکی از قابلیت‌های مهم Inkling است و می‌توان از آن برای تولید، تحلیل، رفع خطا، Refactoring و مستندسازی کد استفاده کرد.

معماری MoE در Inkling چه مزیتی دارد؟

معماری MoE اجازه می‌دهد مدل ظرفیت کل بسیار بزرگی داشته باشد، اما در هر مرحله فقط بخش مرتبطی از پارامترهای آن فعال شود. این روش میان ظرفیت مدل و هزینه محاسبات تعادل ایجاد می‌کند.

آیا می‌توان Inkling را روی لپ‌تاپ اجرا کرد؟

نسخه اصلی Inkling به دلیل داشتن ۹۷۵ میلیارد پارامتر به زیرساخت محاسباتی بسیار قدرتمندی نیاز دارد و اجرای کامل آن روی لپ‌تاپ معمولی عملی نیست.

Inkling-Small چیست؟

Inkling-Small نسخه سبک‌تر خانواده Inkling است که حدود ۱۲ میلیارد پارامتر فعال دارد و برای هزینه کمتر و سرعت بیشتر طراحی شده است.

آیا Inkling قوی‌ترین مدل هوش مصنوعی است؟

خیر. شرکت سازنده نیز Inkling را قوی‌ترین مدل موجود معرفی نمی‌کند. هدف آن ارائه یک مدل پایه متوازن، چندوجهی و قابل‌سفارشی‌سازی است.

Base URL درواره چیست؟

https://api.darvareh.ir/v1

Model ID صحیح Inkling را از کجا پیدا کنیم؟

Model ID را از صفحه مدل‌های درواره یا پاسخ Endpoint استاندارد /v1/models دریافت کنید. شناسه مدل را حدس نزنید و نام نمایشی را به‌جای آن وارد نکنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.