هوش مصنوعی چندوجهی چیست؟ راهنمای کامل Multimodal AI

هوش مصنوعی چندوجهی می‌تواند چند نوع داده مانند متن، تصویر، صدا، سند و ویدئو را پردازش و میان آن‌ها ارتباط برقرار کند. در این راهنما با نحوه کار، کاربردها، محدودیت‌ها و استفاده از مدل‌های چندوجهی با API آشنا می‌شوید.

Share
هوش مصنوعی چندوجهی چیست؟ راهنمای کامل Multimodal AI

بسیاری از مدل‌های اولیه هوش مصنوعی فقط یک نوع داده را پردازش می‌کردند. یک مدل زبانی متن دریافت می‌کرد و پاسخ متنی می‌داد، یک مدل تشخیص گفتار صدا را به متن تبدیل می‌کرد و یک سیستم بینایی ماشین فقط تصویر را تحلیل می‌کرد.

نسل جدیدی از مدل‌ها می‌توانند چند نوع داده را در یک فرایند واحد دریافت، تحلیل یا تولید کنند. برای مثال، کاربر می‌تواند تصویر یک فاکتور را همراه با یک سؤال فارسی ارسال کند و از مدل بخواهد مبلغ، تاریخ، نام فروشنده و اقلام خریداری‌شده را استخراج کند.

به چنین سیستمی «هوش مصنوعی چندوجهی» یا Multimodal AI گفته می‌شود.

هوش مصنوعی چندوجهی می‌تواند با ترکیبی از متن، تصویر، صدا، ویدئو، سند و داده‌های دیگر کار کند. مهم‌ترین قابلیت این مدل‌ها فقط پشتیبانی از چند فرمت نیست؛ بلکه توانایی ایجاد ارتباط معنایی میان اطلاعات موجود در آن‌هاست.

هوش مصنوعی چندوجهی چیست؟

هوش مصنوعی چندوجهی به مدل یا سامانه‌ای گفته می‌شود که می‌تواند اطلاعات متعلق به چند Modality یا «وجه داده» را پردازش و با یکدیگر ترکیب کند.

هر روش نمایش یا دریافت اطلاعات یک Modality محسوب می‌شود. نمونه‌های رایج عبارت‌اند از:

  • متن
  • تصویر
  • صدا
  • ویدئو
  • فایل و سند
  • کد
  • داده حسگر
  • نقشه عمق
  • اطلاعات حرکتی
  • داده‌های حرارتی

براساس تعریف IBM از Multimodal AI، این مدل‌ها اطلاعات چند نوع داده را پردازش و یکپارچه می‌کنند تا درک کامل‌تری از ورودی به دست آورند.

برای مثال، یک مدل چندوجهی ممکن است تصویر یک نمودار را دریافت کند، عنوان و اعداد آن را بخواند، روند نمودار را تحلیل کند و نتیجه را به زبان فارسی توضیح دهد.

منظور از Modality چیست؟

Modality روشی است که اطلاعات از طریق آن نمایش داده یا دریافت می‌شوند.

انسان‌ها نیز جهان را به‌صورت چندوجهی درک می‌کنند. هنگام گفت‌وگو فقط کلمات طرف مقابل را نمی‌شنویم؛ لحن صدا، حالت چهره، حرکات بدن و محیط اطراف را نیز درک می‌کنیم.

در یک جلسه آنلاین، اطلاعات ممکن است هم‌زمان از چند مسیر منتقل شوند:

  • صدای گوینده
  • تصویر دوربین
  • متن داخل اسلاید
  • نمودارهای ارائه
  • پیام‌های نوشته‌شده در چت
  • فایل‌های ضمیمه

یک سامانه چندوجهی تلاش می‌کند میان این اطلاعات ارتباط برقرار کند و آن‌ها را جدا از یکدیگر نبیند.

مدل تک‌وجهی چیست؟

مدل تک‌وجهی یا Unimodal Model فقط روی یک نوع ورودی یا خروجی تمرکز دارد.

برای مثال:

  • مدل Text-to-Text متن دریافت و متن تولید می‌کند.
  • مدل Speech-to-Text صدا را به متن تبدیل می‌کند.
  • مدل Text-to-Image از توضیح متنی تصویر می‌سازد.
  • مدل Image Classification تصویر را در یک گروه قرار می‌دهد.
  • مدل Text-to-Speech متن را به صدا تبدیل می‌کند.

وجود یک ورودی و خروجی متفاوت همیشه به معنی درک چندوجهی عمیق نیست. بعضی سیستم‌ها از چند مدل مستقل در یک Pipeline استفاده می‌کنند؛ درحالی‌که بعضی مدل‌های جدید از ابتدا برای یادگیری ارتباط میان چند نوع داده آموزش دیده‌اند.

مدل زبانی چندوجهی یا MLLM چیست؟

MLLM مخفف Multimodal Large Language Model و به معنی «مدل زبانی بزرگ چندوجهی» است.

این مدل‌ها قابلیت‌های یک مدل زبانی را با توانایی پردازش ورودی‌هایی مانند تصویر، صدا یا ویدئو ترکیب می‌کنند.

یک MLLM ممکن است بتواند:

  • درباره یک تصویر سؤال و جواب کند.
  • Screenshot نرم‌افزار را تحلیل کند.
  • متن دست‌نویس را بخواند.
  • محتوای نمودار را توضیح دهد.
  • چند تصویر را با یکدیگر مقایسه کند.
  • فایل PDF را همراه با جدول‌ها تحلیل کند.
  • صدای جلسه را خلاصه کند.
  • ویدئو را به فصل‌های مختلف تقسیم کند.
  • براساس تصویر، خروجی JSON تولید کند.

همه مدل‌های چندوجهی از تمام این قابلیت‌ها پشتیبانی نمی‌کنند. نوع ورودی، حجم فایل، مدت صوت یا ویدئو و فرمت خروجی در هر مدل متفاوت است.

آیا مدل Vision همان مدل چندوجهی است؟

این دو اصطلاح مرتبط‌اند، اما همیشه دقیقاً یک معنی ندارند.

مدل Vision معمولاً برای پردازش تصویر ساخته شده است. ممکن است تصویر را دسته‌بندی کند، اشیا را تشخیص دهد یا ویژگی‌های بصری را استخراج کند.

مدل چندوجهی علاوه بر تحلیل تصویر می‌تواند آن را با متن، صدا یا داده‌های دیگر مرتبط کند.

برای مثال:

  • یک مدل Vision تشخیص می‌دهد که تصویر شامل خودرو است.
  • یک مدل Vision-Language می‌تواند به سؤال «خودرو در کدام سمت خیابان قرار دارد؟» پاسخ دهد.
  • یک مدل چندوجهی پیشرفته ممکن است تصویر، توضیح متنی و صدای محیط را با هم تحلیل کند.

در کاربردهای عمومی، اصطلاح Vision Model گاهی برای مدل‌های زبانی دارای ورودی تصویر نیز استفاده می‌شود.

آیا هوش مصنوعی مولد و چندوجهی یکسان‌اند؟

خیر. این دو مفهوم با یکدیگر هم‌پوشانی دارند، اما یکسان نیستند.

هوش مصنوعی مولد یا Generative AI روی تولید محتوای جدید تمرکز دارد؛ مانند تولید متن، تصویر، صدا، موسیقی یا ویدئو.

هوش مصنوعی چندوجهی روی پردازش یا ایجاد ارتباط میان چند نوع داده تمرکز دارد.

یک مدل می‌تواند:

  • مولد و تک‌وجهی باشد.
  • تحلیل‌گر و چندوجهی باشد.
  • هم مولد و هم چندوجهی باشد.
  • چند نوع ورودی بگیرد، اما فقط متن تولید کند.
  • ورودی متنی بگیرد و چند نوع خروجی تولید کند.

برای مثال، مدلی که تصویر و متن دریافت می‌کند و پاسخ متنی می‌دهد، یک مدل چندوجهی است؛ حتی اگر خودش تصویر تولید نکند.

هوش مصنوعی چندوجهی چگونه کار می‌کند؟

معماری دقیق مدل‌ها متفاوت است، اما فرایند کلی شامل چند بخش اصلی می‌شود.

تبدیل هر نوع داده به نمایش قابل‌پردازش

مدل نمی‌تواند مستقیماً عکس، صدا یا متن خام را مانند انسان درک کند. هر ورودی باید به نمایش عددی قابل‌پردازش تبدیل شود.

برای مثال:

  • متن به Token تبدیل می‌شود.
  • تصویر به بخش‌ها یا ویژگی‌های بصری تقسیم می‌شود.
  • صدا به قطعات زمانی و ویژگی‌های صوتی تبدیل می‌شود.
  • ویدئو به مجموعه‌ای از فریم‌ها و اطلاعات زمانی تبدیل می‌شود.

بخشی که این تبدیل را انجام می‌دهد معمولاً Encoder نامیده می‌شود.

قرارگرفتن داده‌ها در یک فضای معنایی

برای ارتباط میان چند نوع داده، مدل باید مفهوم‌های مرتبط را به یکدیگر نزدیک کند.

برای مثال، این ورودی‌ها باید به مفهوم مشترکی اشاره کنند:

  • کلمه «گربه»
  • تصویر یک گربه
  • صدای میو
  • ویدئوی حرکت گربه

پروژه پژوهشی ImageBind متعلق به Meta نمونه‌ای از تلاش برای قراردادن شش وجه داده شامل تصویر، متن، صدا، عمق، داده حرارتی و اطلاعات حرکتی در یک فضای Embedding مشترک است.

هم‌ترازکردن اطلاعات

Alignment به معنی پیداکردن رابطه درست میان بخش‌های داده‌های مختلف است.

برای مثال، در یک ویدئو باید مشخص شود:

  • هر جمله در چه زمانی گفته شده است؟
  • کدام تصویر با کدام توضیح مرتبط است؟
  • حرکت موجود در تصویر با کدام صدای محیط هماهنگ است؟
  • یک زیرنویس به کدام بخش ویدئو تعلق دارد؟

ضعف در Alignment می‌تواند باعث شود مدل اطلاعات درست را به بخش اشتباهی نسبت دهد.

ترکیب چند نوع داده

پس از استخراج ویژگی‌ها، مدل باید اطلاعات را با یکدیگر ترکیب کند. به این مرحله Multimodal Fusion گفته می‌شود.

ترکیب ممکن است در مراحل مختلف انجام شود:

  • ترکیب زودهنگام داده‌ها
  • ترکیب در لایه‌های میانی مدل
  • پردازش جداگانه و ترکیب نتایج در پایان

در بعضی سامانه‌ها چند مدل تخصصی مستقل وجود دارند. در مدل‌های یکپارچه‌تر، چند نوع داده در معماری مشترک پردازش می‌شوند.

تولید پاسخ

پس از تحلیل ورودی‌ها، مدل می‌تواند خروجی مناسب تولید کند:

  • پاسخ متنی
  • JSON ساختاریافته
  • توضیح تصویر
  • Transcript
  • صدا
  • تصویر
  • ویدئو
  • Embedding
  • فرمان برای یک ابزار

نوع خروجی به مدل و Endpoint مورد استفاده وابسته است.

ورودی و خروجی چندوجهی چه تفاوتی دارند؟

هنگام انتخاب مدل باید میان Input Modality و Output Modality تفاوت قائل شوید.

نوع قابلیتنمونه
ورودی متندریافت سؤال یا دستور متنی
ورودی تصویرتحلیل عکس، Screenshot یا اسکن
ورودی صداتشخیص و تحلیل گفتار
ورودی ویدئوتحلیل فریم‌ها، حرکت و صدای ویدئو
خروجی متنپاسخ، خلاصه یا JSON
خروجی تصویرتولید یا ویرایش تصویر
خروجی صداتولید گفتار یا موسیقی
خروجی ویدئوتولید کلیپ یا انیمیشن

مدلی که تصویر دریافت می‌کند الزاماً تصویر تولید نمی‌کند. همچنین مدلی که با متن تصویر می‌سازد، لزوماً توانایی تحلیل تصویر ورودی را ندارد.

این تفاوت هنگام انتخاب مدل از کاتالوگ API اهمیت زیادی دارد.

کاربردهای هوش مصنوعی چندوجهی

تحلیل فاکتور و رسید

یک فروشگاه یا نرم‌افزار حسابداری می‌تواند تصویر فاکتور را دریافت و اطلاعات زیر را استخراج کند:

  • نام فروشنده
  • تاریخ
  • شماره فاکتور
  • مبلغ کل
  • مالیات
  • اقلام خرید
  • تعداد
  • قیمت هر ردیف
  • روش پرداخت

خروجی می‌تواند به‌صورت JSON تولید و پس از اعتبارسنجی وارد سیستم حسابداری شود.

پردازش اسناد اسکن‌شده

مدل چندوجهی می‌تواند علاوه بر متن، ساختار بصری سند را نیز بررسی کند:

  • جدول
  • عنوان
  • مهر
  • امضا
  • کادرها
  • نمودار
  • محل قرارگیری اطلاعات
  • رابطه میان بخش‌های صفحه

برای استخراج متن ساده، OCR تخصصی ممکن است سریع‌تر و ارزان‌تر باشد. مدل چندوجهی زمانی ارزش بیشتری دارد که درک ساختار یا معنی سند نیز لازم باشد.

پشتیبانی مشتری با Screenshot

کاربر می‌تواند تصویر خطا یا Screenshot پنل را برای سامانه پشتیبانی ارسال کند. مدل با مشاهده تصویر و خواندن توضیح کاربر می‌تواند:

  • پیام خطا را استخراج کند.
  • بخش مربوط به خطا را شناسایی کند.
  • مشکل احتمالی را توضیح دهد.
  • مقاله راهنمای مرتبط را پیشنهاد کند.
  • اطلاعات لازم برای تیکت را ساختاریافته کند.

در محیط Production، پاسخ مدل نباید بدون کنترل به انجام عملیات حساس منجر شود.

جست‌وجوی تصویری محصول

کاربر می‌تواند تصویر یک کالا را بارگذاری کند و محصولات مشابه را پیدا کند.

در یک معماری معمول، از Multimodal Embedding برای تبدیل تصویر و توضیحات محصولات به بردارهای قابل‌مقایسه استفاده می‌شود. سپس نزدیک‌ترین محصولات از پایگاه داده برداری بازیابی می‌شوند.

تولید توضیحات محصول از روی تصویر

فروشگاه می‌تواند تصاویر محصول و مشخصات اولیه را به مدل بدهد و خروجی‌هایی مانند موارد زیر دریافت کند:

  • عنوان محصول
  • توضیح کوتاه
  • ویژگی‌های قابل‌مشاهده
  • Alt Text
  • دسته‌بندی پیشنهادی
  • برچسب‌ها
  • متن اولیه صفحه محصول

مدل نباید ویژگی‌هایی را که در تصویر قابل‌تشخیص نیستند، مانند جنس دقیق، ضمانت یا مشخصات فنی، حدس بزند.

تحلیل نمودار و داشبورد

مدل چندوجهی می‌تواند Screenshot یک داشبورد را همراه با سؤال کاربر دریافت کند و روندها یا نقاط غیرعادی قابل‌مشاهده را توضیح دهد.

برای تصمیم‌گیری دقیق، بهتر است داده خام نیز در اختیار سیستم قرار گیرد. خواندن عدد از روی نمودار جایگزین تحلیل مستقیم داده ساختاریافته نیست.

دستیار آموزشی

دانش‌آموز یا دانشجو می‌تواند تصویر یک صفحه، نمودار یا سؤال را همراه با درخواست توضیح ارسال کند.

مدل می‌تواند:

  • محتوای صفحه را توضیح دهد.
  • بخش‌های مهم را خلاصه کند.
  • سؤال تمرینی بسازد.
  • تصویر و متن را با یکدیگر مرتبط کند.
  • پاسخ را متناسب با سطح کاربر ساده‌سازی کند.

در موضوعات علمی، پاسخ و محاسبات مدل باید با منبع آموزشی معتبر بررسی شوند.

تحلیل جلسه و ویدئو

یک Pipeline چندوجهی می‌تواند صدای جلسه، تصویر اسلایدها و متن چت را ترکیب کند و خروجی‌هایی مانند این موارد بسازد:

  • Transcript
  • خلاصه جلسه
  • تصمیم‌های گرفته‌شده
  • وظایف هر فرد
  • فصل‌بندی زمانی
  • فهرست سؤال‌های بدون پاسخ
  • گزارش مدیریتی

پردازش کامل ویدئو معمولاً پرهزینه‌تر از متن یا تصویر است و همه APIها ورودی مستقیم ویدئو را پشتیبانی نمی‌کنند.

دسترس‌پذیری

مدل‌های چندوجهی می‌توانند برای تولید توضیح تصویر، خواندن اسناد و کمک به کاربران دارای محدودیت بینایی استفاده شوند.

خروجی باید متناسب با کاربرد نوشته شود. Alt Text مناسب یک تصویر معمولاً کوتاه‌تر از شرح کامل تمام اجزای آن است.

کنترل کیفیت تولید

کارخانه یا فروشگاه می‌تواند تصاویر محصولات را برای یافتن ایرادهای ظاهری بررسی کند. در کاربردهای حساس و پرتعداد، مدل عمومی باید با مدل تخصصی، قواعد مشخص و ارزیابی انسانی ترکیب شود.

کاربرد هوش مصنوعی چندوجهی در بازار ایران

مدل‌های چندوجهی برای زبان و اسناد فارسی با چالش‌های خاصی روبه‌رو هستند:

  • متن راست‌به‌چپ
  • اتصال حروف فارسی
  • ترکیب فارسی و انگلیسی
  • اعداد فارسی و لاتین
  • تاریخ شمسی
  • کیفیت پایین اسکن
  • فونت‌های متنوع
  • دست‌خط فارسی
  • جدول‌های پیچیده
  • مهر و امضای روی متن
  • نام‌های خاص ایرانی
  • واحدهای تومان و ریال

قبل از انتخاب مدل، باید آن را با نمونه‌های واقعی کسب‌وکار خود آزمایش کنید. عملکرد مناسب روی اسناد انگلیسی تضمین نمی‌کند که همان مدل فاکتور یا فرم فارسی را نیز با دقت کافی تحلیل کند.

یک مجموعه آزمایشی می‌تواند شامل این موارد باشد:

  • فاکتور چاپی فارسی
  • رسید کارت‌خوان
  • Screenshot موبایل
  • سند اسکن‌شده
  • جدول راست‌به‌چپ
  • متن دارای اعداد فارسی
  • عکس تار یا زاویه‌دار
  • سند دارای مهر
  • تصویر محصول
  • نمودار دارای برچسب فارسی

نتیجه باید با پاسخ صحیح مقایسه شود و خطاها براساس نوع داده دسته‌بندی شوند.

تفاوت OCR و مدل چندوجهی چیست؟

OCR برای تبدیل نوشته موجود در تصویر به متن طراحی شده است. مدل چندوجهی علاوه بر خواندن نوشته می‌تواند درباره معنی، ساختار و ارتباط اجزای تصویر استدلال کند.

قابلیتOCRمدل چندوجهی
استخراج متنکاربرد اصلیمعمولاً امکان‌پذیر
حفظ چیدمانوابسته به ابزارممکن است درک شود
تحلیل معناییمحدودقوی‌تر
پاسخ به سؤال درباره تصویرمعمولاً ندارددارد
استخراج JSON براساس مفهومنیازمند پردازش بعدیقابل درخواست
سرعت و هزینهمعمولاً مناسب‌ترممکن است بیشتر باشد
خروجی قابل‌تکرارمعمولاً پایدارترامکان تغییر پاسخ وجود دارد

در بسیاری از پروژه‌ها، ترکیب OCR و مدل زبانی نتیجه بهتری ایجاد می‌کند:

  1. OCR متن را استخراج می‌کند.
  2. قواعد نرم‌افزار قالب را بررسی می‌کنند.
  3. مدل زبانی اطلاعات را دسته‌بندی می‌کند.
  4. Validation خطاهای ساختاری را تشخیص می‌دهد.
  5. موارد مشکوک برای بازبینی انسانی ارسال می‌شوند.

محدودیت‌های مدل‌های چندوجهی

خطا در خواندن متن داخل تصویر

متن کوچک، تار، مورب یا دارای فونت غیرمعمول ممکن است اشتباه خوانده شود. این مشکل در متن فارسی، اعداد و جدول‌ها می‌تواند شدیدتر باشد.

توصیف اشیای غیرموجود

مدل ممکن است جزئیاتی را توصیف کند که در تصویر وجود ندارند یا از شواهد بصری قابل‌اثبات نیستند.

ضعف در شمارش

شمارش دقیق تعداد زیاد اشیا همچنان می‌تواند برای مدل‌های عمومی دشوار باشد.

خطای فضایی

مدل ممکن است جهت، فاصله، ترتیب یا رابطه مکانی اشیا را اشتباه تشخیص دهد.

محدودیت فایل

هر مدل محدودیت مشخصی برای این موارد دارد:

  • اندازه فایل
  • رزولوشن
  • تعداد تصاویر
  • مدت صوت
  • مدت ویدئو
  • فرمت فایل
  • Context Window

این محدودیت‌ها باید در مستندات و کاتالوگ مدل بررسی شوند.

هزینه و تأخیر بیشتر

پردازش تصویر، صدا و ویدئو معمولاً منابع بیشتری از یک درخواست متنی کوتاه مصرف می‌کند. فایل بزرگ‌تر الزاماً پاسخ بهتر تولید نمی‌کند.

ناپایداری خروجی

مدل مولد ممکن است برای ورودی مشابه پاسخ‌هایی با جزئیات متفاوت ارائه کند. خروجی‌های عملیاتی باید Schema، Validation و آزمون داشته باشند.

محدودیت در صحت

نتایج FACTS Benchmark Suite گوگل دیپ‌مایند نشان می‌دهد حتی مدل‌های پیشرفته در ارزیابی‌های چندوجهی همچنان فضای قابل‌توجهی برای بهبود دارند. بنابراین تحلیل چندوجهی نباید ذاتاً بدون خطا فرض شود.

چگونه مدل چندوجهی مناسب انتخاب کنیم؟

نوع ورودی موردنیاز را مشخص کنید

ابتدا تعیین کنید محصول شما دقیقاً چه چیزی دریافت می‌کند:

  • یک تصویر
  • چند تصویر
  • PDF
  • فایل صوتی
  • ویدئو
  • ترکیب متن و تصویر
  • Screenshot
  • داده حسگر

نوع خروجی را مشخص کنید

آیا پاسخ آزاد متنی می‌خواهید یا خروجی باید JSON قابل‌پردازش باشد؟

برای نرم‌افزارهای عملیاتی، خروجی ساختاریافته معمولاً قابل‌کنترل‌تر است.

مدل را با داده واقعی ارزیابی کنید

ارزیابی فقط با چند تصویر تمیز کافی نیست. نمونه‌های دشوار و رایج کاربران را نیز وارد آزمون کنید.

معیارهای مفید عبارت‌اند از:

  • دقت استخراج متن
  • دقت اعداد
  • درک جدول
  • کیفیت زبان فارسی
  • صحت JSON
  • نرخ اطلاعات ساختگی
  • زمان پاسخ
  • هزینه هر سند
  • درصد نیاز به بازبینی انسانی
  • موفقیت کامل وظیفه

مدل‌های مختلف را مقایسه کنید

یک مدل ممکن است در تحلیل نمودار مناسب باشد و مدل دیگر متن فارسی را بهتر بخواند. انتخاب باید براساس آزمون اختصاصی پروژه انجام شود، نه صرفاً نام یا محبوبیت مدل.

استفاده از مدل چندوجهی با API درواره

توسعه‌دهندگان می‌توانند مدل‌های دارای قابلیت Vision یا ورودی چندوجهی را از طریق API درواره در نرم‌افزار خود استفاده کنند.

درواره امکان دسترسی یکپارچه به مدل‌های مختلف را با Base URL زیر فراهم می‌کند:

https://api.darvareh.ir/v1

پیش از ارسال درخواست باید در کاتالوگ مدل‌ها بررسی کنید که مدل انتخاب‌شده از نوع ورودی موردنظر پشتیبانی می‌کند.

نمونه تحلیل تصویر با Python

در این مثال، تصویر به Base64 تبدیل و همراه با یک پرامپت متنی ارسال می‌شود:

import os
import base64
import requests

API_KEY = os.environ["DARVAREH_API_KEY"]
MODEL_ID = os.environ["DARVAREH_MODEL_ID"]
IMAGE_PATH = "invoice.jpg"

with open(IMAGE_PATH, "rb") as image_file:
    encoded_image = base64.b64encode(image_file.read()).decode("utf-8")

response = requests.post(
    "https://api.darvareh.ir/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json",
    },
    json={
        "model": MODEL_ID,
        "messages": [
            {
                "role": "system",
                "content": (
                    "تو یک دستیار دقیق برای تحلیل اسناد فارسی هستی. "
                    "اگر بخشی خوانا نیست، آن را حدس نزن."
                ),
            },
            {
                "role": "user",
                "content": [
                    {
                        "type": "text",
                        "text": (
                            "این فاکتور را بررسی کن و نام فروشنده، تاریخ، "
                            "شماره فاکتور، اقلام و مبلغ کل را استخراج کن. "
                            "تومان و ریال را با هم اشتباه نگیر."
                        ),
                    },
                    {
                        "type": "image_url",
                        "image_url": {
                            "url": (
                                "data:image/jpeg;base64,"
                                + encoded_image
                            )
                        },
                    },
                ],
            },
        ],
        "temperature": 0.1,
    },
    timeout=120,
)

response.raise_for_status()
result = response.json()
print(result["choices"][0]["message"]["content"])

ساختار دقیق ورودی و قابلیت‌های پشتیبانی‌شده ممکن است میان مدل‌ها متفاوت باشد. شناسه مدل، فرمت تصویر، سقف حجم و امکان استفاده از Base64 یا URL باید در مشخصات مدل بررسی شوند.

نمونه پرامپت برای استخراج اطلاعات فاکتور

تصویر فاکتور فارسی را تحلیل کن.

فقط اطلاعاتی را استخراج کن که در تصویر قابل‌خواندن هستند. هیچ مقدار نامشخصی را حدس نزن.

خروجی شامل این موارد باشد:نام فروشندهشماره فاکتورتاریخاقلامتعداد هر قلمقیمت واحدمبلغ کلواحد پولبخش‌های ناخوانا

اگر میان تومان و ریال ابهام وجود دارد، مقدار را در بخش «نیازمند بررسی» قرار بده.

این پرامپت احتمال حدس‌زدن را کاهش می‌دهد، اما Validation نرم‌افزاری همچنان لازم است.

چگونه یک سامانه چندوجهی قابل‌اعتماد بسازیم؟

ورودی را پیش‌پردازش کنید

قبل از ارسال تصویر می‌توان:

  • حاشیه‌های اضافی را حذف کرد.
  • زاویه تصویر را اصلاح کرد.
  • رزولوشن را متناسب ساخت.
  • تصویر تار را شناسایی کرد.
  • صفحه‌های PDF را جدا کرد.
  • فایل‌های تکراری را حذف کرد.

از Pipeline چندمرحله‌ای استفاده کنید

برای مثال، پردازش فاکتور می‌تواند شامل این مراحل باشد:

  1. بررسی نوع و حجم فایل
  2. بهبود اولیه تصویر
  3. OCR
  4. تحلیل معنایی با مدل چندوجهی
  5. تولید JSON
  6. اعتبارسنجی مبلغ و تاریخ
  7. تعیین Confidence
  8. ارسال موارد مشکوک برای بررسی انسانی

خروجی را اعتبارسنجی کنید

اگر مبلغ کل باید عدد باشد، رشته نامعتبر نباید مستقیماً وارد پایگاه داده شود.

مواردی که می‌توان بررسی کرد:

  • نوع داده
  • فیلدهای اجباری
  • محدوده قابل‌قبول
  • قالب تاریخ
  • واحد پول
  • جمع مبالغ
  • شماره ملی یا شناسه
  • تکراری‌بودن سند

امکان اعلام «نامشخص» را فراهم کنید

مدل نباید مجبور شود برای تمام فیلدها پاسخ قطعی تولید کند. گزینه‌هایی مانند null، «ناخوانا» و «نیازمند بررسی» باعث کاهش اطلاعات ساختگی می‌شوند.

بازبینی انسانی را براساس ریسک تنظیم کنید

تمام خروجی‌ها به بررسی دستی نیاز ندارند. می‌توان فقط موارد زیر را وارد صف بازبینی کرد:

  • تصویر کم‌کیفیت
  • مبلغ بالا
  • اختلاف میان OCR و مدل
  • فیلد اجباری خالی
  • واحد پول نامشخص
  • خروجی نامعتبر
  • Confidence پایین

چگونه هزینه پردازش چندوجهی را کاهش دهیم؟

فایل را بزرگ‌تر از نیاز ارسال نکنید

تصویر بسیار بزرگ می‌تواند هزینه و زمان پردازش را افزایش دهد. رزولوشن باید برای خواندن اطلاعات کافی باشد، نه بیشتر.

ناحیه مرتبط را Crop کنید

اگر فقط جدول پایین فاکتور مهم است، لازم نیست تمام صفحه یا پس‌زمینه ارسال شود.

از مدل اقتصادی برای مرحله اول استفاده کنید

مدل سریع‌تر می‌تواند نوع سند یا کیفیت تصویر را تشخیص دهد. فقط موارد پیچیده به مدل قوی‌تر ارسال شوند.

نتایج را Cache کنید

اگر یک فایل چند بار ارسال شد، می‌توان با Hash آن را شناسایی و از پردازش تکراری جلوگیری کرد.

برای ویدئو Frame Sampling انجام دهید

ارسال تمام فریم‌های ویدئو همیشه ضروری نیست. می‌توان فریم‌های کلیدی یا بازه‌های مرتبط را استخراج کرد.

وظیفه ساده را به ابزار تخصصی بسپارید

برای استخراج ساده متن، OCR ممکن است ارزان‌تر باشد. برای تبدیل صدا به متن نیز مدل Speech-to-Text تخصصی انتخاب مناسب‌تری است.

مصرف را برای هر نوع ورودی ثبت کنید

هزینه، زمان پاسخ و نرخ موفقیت تصویر، صوت و ویدئو را جداگانه اندازه‌گیری کنید. میانگین کلی ممکن است مشکلات یک نوع ورودی را پنهان کند.

هوش مصنوعی چندوجهی و معماری چندمدلی

استفاده از یک مدل برای تمام وظایف همیشه بهترین تصمیم نیست.

یک معماری چندمدلی می‌تواند درخواست‌ها را براساس نوع ورودی هدایت کند:

  • متن ساده به مدل زبانی اقتصادی
  • تصویر به مدل Vision
  • صوت به مدل Speech-to-Text
  • ویدئو به مدل دارای Video Understanding
  • تصویر محصول به Multimodal Embedding
  • تحلیل پیچیده به مدل Reasoning
  • درخواست ناموفق به مدل جایگزین

این معماری کنترل بیشتری روی هزینه، کیفیت و پایداری ایجاد می‌کند.

API یکپارچه درواره می‌تواند تغییر و مقایسه مدل‌ها را ساده‌تر کند؛ زیرا برنامه برای استفاده از هر مدل مجبور نیست به‌طور کامل با یک سرویس جداگانه بازنویسی شود.

آینده هوش مصنوعی چندوجهی

روند توسعه مدل‌ها از پردازش جداگانه متن، تصویر و صدا به سمت مدل‌ها و Agentهایی حرکت می‌کند که محیط را از چند مسیر درک می‌کنند.

چند روند مهم عبارت‌اند از:

  • مکالمه صوتی و تصویری بلادرنگ
  • تحلیل هم‌زمان صفحه و صدای کاربر
  • Agentهای دارای Computer Use
  • جست‌وجوی ترکیبی متن و تصویر
  • درک و تولید ویدئو
  • ارتباط مدل با ربات و حسگرها
  • Multimodal RAG
  • Embedding مشترک برای متن، تصویر و ویدئو
  • پردازش روی موبایل و دستگاه‌های Edge
  • تولید محتوای یکپارچه شامل متن، تصویر، صدا و ویدئو

بااین‌حال، افزایش تعداد Modalityها به معنی حذف خطا نیست. ارزیابی، Validation، کنترل هزینه و نظارت انسانی همچنان بخش‌های اصلی یک محصول قابل‌اعتماد خواهند بود.

چک‌لیست انتخاب مدل چندوجهی

پیش از استفاده از یک مدل بررسی کنید:

  • چه نوع ورودی‌هایی را می‌پذیرد؟
  • چه نوع خروجی‌هایی تولید می‌کند؟
  • آیا زبان فارسی را به‌خوبی پردازش می‌کند؟
  • متن راست‌به‌چپ را درست می‌خواند؟
  • محدودیت حجم و تعداد فایل چیست؟
  • آیا URL و Base64 پشتیبانی می‌شوند؟
  • آیا خروجی JSON معتبر تولید می‌کند؟
  • هزینه پردازش هر فایل چقدر است؟
  • زمان پاسخ برای محصول مناسب است؟
  • داده‌ها برای چه مدتی نگهداری می‌شوند؟
  • نرخ خطا روی نمونه‌های واقعی چقدر است؟
  • در صورت خطا چه مدل جایگزینی وجود دارد؟
  • کدام خروجی‌ها به تأیید انسانی نیاز دارند؟

جمع‌بندی

هوش مصنوعی چندوجهی یا Multimodal AI می‌تواند چند نوع داده مانند متن، تصویر، صدا و ویدئو را پردازش و میان آن‌ها ارتباط ایجاد کند.

این فناوری در تحلیل اسناد، استخراج اطلاعات فاکتور، جست‌وجوی تصویری، پشتیبانی مشتری، آموزش، تحلیل جلسه، دسترس‌پذیری و پردازش ویدئو کاربرد دارد.

چندوجهی‌بودن یک مدل به معنی پشتیبانی از تمام ورودی‌ها و خروجی‌ها نیست. پیش از انتخاب باید Input Modality، Output Modality، محدودیت فایل، کیفیت فارسی، هزینه و دقت مدل بررسی شوند.

برای ساخت محصول قابل‌اعتماد، خروجی مدل را با Validation، قواعد نرم‌افزاری، ابزارهای تخصصی و بازبینی انسانی ترکیب کنید. همچنین مدل را با اسناد، تصاویر و شرایط واقعی کاربران ایرانی ارزیابی کنید.

اگر می‌خواهید قابلیت تحلیل تصویر یا سایر ورودی‌های چندوجهی را به وب‌سایت و نرم‌افزار خود اضافه کنید، می‌توانید مدل‌های مختلف را از طریق API درواره آزمایش کنید. درواره دسترسی به مدل‌های متعدد، پرداخت ریالی و یک API سازگار با OpenAI را برای توسعه‌دهندگان و کسب‌وکارهای ایرانی فراهم می‌کند.

سؤالات متداول

هوش مصنوعی چندوجهی چیست؟

هوش مصنوعی چندوجهی مدلی است که می‌تواند چند نوع داده مانند متن، تصویر، صدا یا ویدئو را پردازش و میان آن‌ها ارتباط برقرار کند.

Multimodal به چه معناست؟

Multimodal به معنی «چندوجهی» است. هر وجه یا Modality یک روش نمایش اطلاعات مانند متن، تصویر، صدا یا ویدئو محسوب می‌شود.

مدل چندوجهی چه تفاوتی با مدل زبانی دارد؟

مدل زبانی معمولی بیشتر روی متن تمرکز دارد. مدل زبانی چندوجهی می‌تواند علاوه بر متن، ورودی‌هایی مانند تصویر، صدا یا ویدئو را نیز پردازش کند.

آیا مدل Vision چندوجهی است؟

اگر مدل فقط ویژگی‌های تصویر را پردازش کند، یک مدل بینایی ماشین است. اگر تصویر را همراه با متن یا داده‌های دیگر تحلیل کند، می‌توان آن را یک مدل چندوجهی دانست.

آیا مدل چندوجهی می‌تواند تصویر تولید کند؟

بعضی مدل‌ها می‌توانند، اما ورودی تصویر به معنی پشتیبانی از خروجی تصویر نیست. قابلیت‌های ورودی و خروجی باید جداگانه بررسی شوند.

آیا هوش مصنوعی چندوجهی متن فارسی را از روی تصویر می‌خواند؟

بسیاری از مدل‌ها می‌توانند متن فارسی را بخوانند، اما دقت آن‌ها به کیفیت تصویر، فونت، چیدمان، دست‌خط و مدل انتخاب‌شده وابسته است. نتیجه باید با نمونه‌های واقعی آزمایش شود.

تفاوت OCR و هوش مصنوعی چندوجهی چیست؟

OCR برای استخراج نوشته از تصویر طراحی شده است. مدل چندوجهی علاوه بر خواندن متن، می‌تواند ساختار، محتوا و ارتباط اجزای تصویر را نیز تحلیل کند.

آیا می‌توان فایل PDF را به مدل چندوجهی داد؟

پشتیبانی مستقیم PDF به مدل و API بستگی دارد. در بعضی سیستم‌ها باید صفحات PDF را به تصویر یا متن تبدیل و سپس ارسال کرد.

آیا پردازش تصویر با API گران است؟

هزینه به مدل، رزولوشن، تعداد تصاویر و حجم پردازش بستگی دارد. Crop، کاهش اندازه مناسب، Cache و مسیریابی درخواست‌ها می‌توانند هزینه را کاهش دهند.

چگونه یک مدل چندوجهی را ارزیابی کنیم؟

مجموعه‌ای از تصاویر و اسناد واقعی تهیه کنید و دقت متن، اعداد، جدول، زبان فارسی، JSON، زمان پاسخ، هزینه و نرخ نیاز به بررسی انسانی را اندازه‌گیری کنید.

آیا API درواره از مدل‌های چندوجهی پشتیبانی می‌کند؟

درواره مدل‌های متنوعی در دسته‌های متن، تصویر، صوت و ویدئو ارائه می‌کند. قابلیت دقیق هر مدل و نوع ورودی پشتیبانی‌شده باید در صفحه مشخصات همان مدل بررسی شود.

مقالات مرتبط

منابع

این مقاله صرفاً با هدف آموزش و اطلاع‌رسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویس‌ها و صفحه سلب مسئولیت را مطالعه کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.