پیدا کردن اسم فیلم از روی عکس با هوش مصنوعی؛ آموزش تشخیص فیلم و سریال

نام یک فیلم یا سریال را فراموش کرده‌اید؟ در این راهنما یاد می‌گیرید چگونه با عکس، اسکرین‌شات، کلیپ، دیالوگ یا توضیح داستان و کمک هوش مصنوعی، نام اثر را دقیق‌تر پیدا کنید.

Share
پیدا کردن اسم فیلم از روی عکس با هوش مصنوعی؛ آموزش تشخیص فیلم و سریال

احتمالاً برای شما هم پیش آمده است که بخشی از یک فیلم یا سریال را در اینستاگرام، یوتیوب، تلگرام یا شبکه‌های اجتماعی مشاهده کنید، اما نام آن در توضیحات نوشته نشده باشد. گاهی فقط یک اسکرین‌شات از بازیگر، محیط فیلم، لباس شخصیت یا زیرنویس در اختیار دارید و گاهی تنها یک دیالوگ یا بخشی از داستان را به خاطر می‌آورید.

در گذشته، پیدا کردن چنین فیلمی بیشتر به پرسیدن از دیگران یا جست‌وجوی طولانی در اینترنت وابسته بود. اکنون موتورهای جست‌وجوی تصویری و مدل‌های چندوجهی هوش مصنوعی می‌توانند تصویر، نوشته، چهره، اشیاء، فضای صحنه و توضیحات شما را بررسی کنند و فهرستی از فیلم‌های احتمالی ارائه دهند.

البته تشخیص نام فیلم از روی یک تصویر همیشه قطعی نیست. ممکن است اسکرین‌شات کیفیت پایینی داشته باشد، تصویر ویرایش شده باشد، صحنه در چند اثر مشابه دیده شود یا مدل نام یک فیلم نادرست را با اطمینان پیشنهاد دهد. به همین دلیل، بهترین نتیجه معمولاً از ترکیب چند روش به دست می‌آید:

  • جست‌وجوی معکوس عکس
  • تحلیل تصویر با هوش مصنوعی
  • استخراج متن زیرنویس
  • جست‌وجوی دیالوگ
  • توصیف داستان و شخصیت‌ها
  • بررسی بازیگران احتمالی
  • تطبیق نتیجه در چند منبع

در این مقاله، تمام این روش‌ها را به‌صورت عملی بررسی می‌کنیم و در پایان نیز یاد می‌گیریم چگونه توسعه‌دهندگان می‌توانند با API هوش مصنوعی درواره، قابلیت تشخیص فیلم از روی تصویر را به وب‌سایت یا اپلیکیشن خود اضافه کنند.

آیا واقعاً می‌توان نام فیلم را از روی یک عکس پیدا کرد؟

بله، اما میزان موفقیت به اطلاعات موجود در تصویر بستگی دارد.

هوش مصنوعی و موتور جست‌وجوی تصویر ممکن است از نشانه‌های زیر استفاده کنند:

  • چهره بازیگر
  • لباس و ظاهر شخصیت
  • لوکیشن یا دکور
  • زیرنویس روی تصویر
  • لوگوی شبکه یا سرویس پخش
  • اشیاء شاخص
  • سبک فیلم‌برداری
  • رنگ‌بندی صحنه
  • دوره تاریخی داستان
  • وسیله نقلیه یا ساختمان
  • پوستر یا نوشته موجود در پس‌زمینه
  • شباهت تصویر با تصاویر منتشرشده در وب

اگر همان فریم یا تصویر مشابه آن قبلاً در یک وب‌سایت، خبر، نقد فیلم، شبکه اجتماعی یا پایگاه اطلاعات سینمایی منتشر شده باشد، جست‌وجوی معکوس معمولاً روش مؤثری است.

اگر تصویر در اینترنت وجود نداشته باشد، یک مدل چندوجهی می‌تواند محتویات آن را تحلیل کند و براساس چهره، فضا، لباس و سایر نشانه‌ها چند احتمال ارائه دهد.

بهترین روش به نوع اطلاعات شما بستگی دارد

قبل از شروع، مشخص کنید چه چیزی در اختیار دارید.

اطلاعات موجودبهترین روش اولیه
اسکرین‌شات واضح از صحنهGoogle Lens یا Bing Visual Search
عکس واضح از بازیگرجست‌وجوی تصویری و سپس بررسی نام بازیگر
تصویر دارای زیرنویساستخراج متن و جست‌وجوی دیالوگ
کلیپ چندثانیه‌ایگرفتن چند اسکرین‌شات از لحظات متفاوت
فقط بخشی از داستانمدل زبانی و جست‌وجوی توصیفی
صدای فیلم یا دیالوگتبدیل صدا به متن و جست‌وجوی عبارت
موسیقی فیلمابزار شناسایی موسیقی
پوستر ناقص یا تارجست‌وجوی معکوس تصویر
تصویر بدون چهرهتحلیل اشیاء، لوکیشن و سبک صحنه
چند نشانه پراکندهترکیب هوش مصنوعی با جست‌وجوی وب

بهتر است از ساده‌ترین روش شروع کنید و در صورت نگرفتن نتیجه، اطلاعات بیشتری به جست‌وجو اضافه کنید.

روش اول: پیدا کردن اسم فیلم با Google Lens

Google Lens یکی از ساده‌ترین ابزارها برای جست‌وجو براساس تصویر است. این ابزار تلاش می‌کند اشیاء، چهره‌ها، نوشته‌ها و تصاویر مشابه را پیدا کند.

طبق راهنمای رسمی Google، نتایج جست‌وجوی تصویری می‌توانند شامل تصاویر مشابه، وب‌سایت‌های دارای همان تصویر یا تصویر مشابه و اطلاعات مربوط به اشیاء موجود در تصویر باشند.

استفاده در کامپیوتر

  1. از صحنه فیلم یک اسکرین‌شات واضح تهیه کنید.
  2. وارد Google شوید.
  3. روی آیکون جست‌وجو با تصویر کلیک کنید.
  4. گزینه آپلود فایل را انتخاب کنید.
  5. تصویر را بارگذاری کنید.
  6. نتایج تصویری و صفحات مشابه را بررسی کنید.
  7. در صورت نیاز، محدوده جست‌وجو را روی چهره، زیرنویس یا بخش شاخص تصویر تنظیم کنید.
  8. یک عبارت تکمیلی مانند movie، film scene یا actor به جست‌وجو اضافه کنید.

استفاده در تلفن همراه

در Android می‌توانید تصویر را در Google Photos باز کرده و گزینه Lens را انتخاب کنید. در مرورگر Chrome نیز معمولاً با لمس طولانی تصویر، گزینه جست‌وجو با Google Lens نمایش داده می‌شود.

در iPhone و iPad می‌توان از برنامه Google، مرورگر Chrome یا بخش جست‌وجوی تصویری استفاده کرد. راهنمای رسمی این مراحل در صفحه Google Lens برای iPhone و iPad ارائه شده است.

چگونه نتیجه Google Lens را دقیق‌تر کنیم؟

اگر جست‌وجوی کل تصویر نتیجه مناسبی نداد، چند بار با محدوده‌های متفاوت جست‌وجو کنید:

  • فقط چهره بازیگر
  • فقط لباس شخصیت
  • نوشته یا زیرنویس
  • ساختمان یا لوکیشن
  • شیء خاص داخل صحنه
  • دو بازیگر کنار یکدیگر

گاهی جست‌وجوی کل فریم به دلیل وجود عناصر زیاد، نتیجه پراکنده‌ای ایجاد می‌کند؛ اما انتخاب یک چهره یا شیء شاخص می‌تواند نتیجه را دقیق‌تر کند.

Bing Visual Search امکان جست‌وجوی وب با تصویر را فراهم می‌کند. براساس مستندات رسمی Microsoft، می‌توانید فایل تصویر را بارگذاری کنید، تصویر را داخل کادر بکشید، آدرس آن را وارد کنید یا با وب‌کم عکس بگیرید.

نتایج ممکن است شامل موارد زیر باشد:

  • صفحات دارای همان تصویر
  • تصاویر مشابه
  • اطلاعات مرتبط با محتوای عکس
  • نتایج وب درباره اشیاء یا افراد دیده‌شده

روش استفاده:

  1. وارد بخش تصاویر Bing شوید.
  2. آیکون دوربین را انتخاب کنید.
  3. اسکرین‌شات را بارگذاری کنید.
  4. تصاویر مشابه را بررسی کنید.
  5. عنوان صفحات نتیجه را بخوانید.
  6. نام‌های احتمالی فیلم و بازیگر را جداگانه جست‌وجو کنید.

گاهی یک تصویر در Google Lens پیدا نمی‌شود، اما Bing منبع دیگری از همان فریم را نمایش می‌دهد. بنابراین امتحان کردن هر دو موتور جست‌وجو ارزش دارد.

روش سوم: تحلیل عکس با مدل هوش مصنوعی چندوجهی

مدل‌های چندوجهی یا Vision-Language Models می‌توانند هم‌زمان تصویر و متن را دریافت کنند. شما می‌توانید اسکرین‌شات را همراه با یک سؤال دقیق برای مدل ارسال کنید.

برای مثال، به‌جای اینکه فقط بنویسید:

اسم این فیلم چیست؟

بهتر است از پرامپت دقیق‌تری استفاده کنید:

این تصویر احتمالاً مربوط به یک فیلم یا سریال است.

تصویر را بررسی کن و موارد زیر را استخراج کن:
1. بازیگر یا شخصیت احتمالی
2. دوره زمانی و سبک لباس
3. نوع لوکیشن
4. اشیاء یا نشانه‌های شاخص
5. ژانر احتمالی
6. فیلم‌ها یا سریال‌های محتمل

اگر از نام اثر مطمئن نیستی، پاسخ قطعی نده و سه تا پنج احتمال را همراه با دلیل ارائه کن.
در پایان توضیح بده برای تأیید نتیجه باید چه اطلاعات دیگری از کلیپ استخراج کنم.

این شیوه احتمال پاسخ ساختگی را کاهش می‌دهد؛ زیرا از مدل می‌خواهید بین مشاهده مستقیم، حدس و نتیجه قطعی تفاوت قائل شود.

پرامپت مناسب برای تصویر دارای بازیگر

این تصویر را به‌عنوان یک فریم احتمالی از فیلم یا سریال بررسی کن.

اگر بازیگر را با اطمینان تشخیص نمی‌دهی، نام قطعی اعلام نکن.
ابتدا ویژگی‌های قابل مشاهده مانند ظاهر، لباس، محیط، نورپردازی و دوره احتمالی تولید را توضیح بده.
سپس حداکثر پنج فیلم یا سریال محتمل پیشنهاد کن و برای هر گزینه دلیل بنویس.
در پایان یک جدول مقایسه برای تأیید یا رد گزینه‌ها ارائه بده.

پرامپت مناسب برای صحنه بدون چهره

این تصویر چهره واضحی ندارد. براساس لوکیشن، طراحی صحنه، لباس، وسایل، معماری، خودروها، نوشته‌ها و سبک تصویربرداری بررسی کن که ممکن است متعلق به کدام فیلم یا سریال باشد.

مشاهدات قطعی را از حدس‌ها جدا کن.
برای هر حدس، یک عبارت جست‌وجوی پیشنهادی انگلیسی ارائه بده.

نکته مهم درباره پاسخ مدل

مدل چندوجهی ممکن است یک نام نادرست را با لحنی مطمئن اعلام کند. هر پیشنهاد را با حداقل یکی از این روش‌ها تأیید کنید:

  • جست‌وجوی نام فیلم همراه با توضیح صحنه
  • بررسی تصاویر فیلم
  • مشاهده تریلر
  • تطبیق بازیگران
  • بررسی سال تولید
  • مقایسه لباس و لوکیشن
  • خواندن خلاصه داستان

روش چهارم: استخراج زیرنویس و جست‌وجوی دیالوگ

اگر اسکرین‌شات دارای زیرنویس است، متن آن می‌تواند از چهره و فضای تصویر نیز مفیدتر باشد.

مراحل کار

  1. تصویر را در یک ابزار OCR بارگذاری کنید.
  2. متن زیرنویس را استخراج کنید.
  3. اشتباه‌های OCR را اصلاح کنید.
  4. جمله را داخل علامت نقل‌قول جست‌وجو کنید.
  5. اگر زیرنویس فارسی است، ترجمه احتمالی انگلیسی آن را نیز جست‌وجو کنید.
  6. کلمات کلیدی جمله را همراه با عباراتی مانند movie quote یا episode جست‌وجو کنید.

برای مثال، اگر زیرنویس چنین باشد:

من تمام این مدت منتظر بودم که برگردی

این جمله ممکن است ترجمه‌های مختلفی داشته باشد. از هوش مصنوعی بخواهید چند ترجمه طبیعی احتمالی تولید کند:

این جمله زیرنویس فارسی یک فیلم است:

«من تمام این مدت منتظر بودم که برگردی»

پنج عبارت انگلیسی محتمل که ممکن است دیالوگ اصلی بوده باشند پیشنهاد بده.
عبارت‌ها را طبیعی و مناسب جست‌وجوی نقل‌قول بنویس.

سپس هر عبارت را جداگانه جست‌وجو کنید:

"I've been waiting all this time for you to come back" movie

اگر ترجمه زیرنویس آزاد باشد، شاید عبارت دقیق پیدا نشود. در این حالت، نام شخصیت، مکان یا کلمات خاص صحنه را نیز اضافه کنید.

روش پنجم: پیدا کردن نام فیلم از روی کلیپ

اگر یک کلیپ کوتاه در اختیار دارید، فقط اولین فریم آن را جست‌وجو نکنید. از چند لحظه متفاوت اسکرین‌شات بگیرید.

بهترین فریم‌ها معمولاً شامل این موارد هستند:

  • نمای واضح از صورت بازیگر
  • نمای دو یا چند شخصیت
  • نمای محیط یا ساختمان
  • نوشته، تابلو یا پلاک
  • لباس خاص
  • وسیله نقلیه
  • شیء مهم داستان
  • نمایی با زیرنویس کامل

روش پیشنهادی

  1. کلیپ را متوقف کنید.
  2. از سه تا شش لحظه متفاوت اسکرین‌شات بگیرید.
  3. هر تصویر را جداگانه در Google Lens و Bing بررسی کنید.
  4. نشانه‌های مشترک نتایج را یادداشت کنید.
  5. تصاویر را به یک مدل چندوجهی بدهید.
  6. از مدل بخواهید همه فریم‌ها را متعلق به یک اثر در نظر بگیرد.
  7. نام‌های احتمالی را در جست‌وجوی وب تأیید کنید.

پرامپت پیشنهادی برای چند فریم:

این تصاویر چند فریم متوالی از یک کلیپ هستند و احتمالاً به یک فیلم یا سریال تعلق دارند.

همه تصاویر را با یکدیگر تحلیل کن و به موارد زیر توجه کن:
- چهره‌ها
- لباس‌ها
- محیط
- اشیاء مشترک
- نوشته‌های قابل مشاهده
- سبک فیلم‌برداری
- ژانر و دوره احتمالی تولید

سپس حداکثر پنج اثر محتمل پیشنهاد بده.
برای هر پیشنهاد، شواهد موافق و مواردی که هنوز باید تأیید شوند را بنویس.

چند فریم، اطلاعات بسیار بیشتری از یک عکس منفرد در اختیار مدل قرار می‌دهد و احتمال تشخیص درست را افزایش می‌دهد.

روش ششم: پیدا کردن فیلم از روی توضیح داستان

گاهی هیچ عکس یا کلیپی در اختیار ندارید و فقط بخشی از داستان را به یاد می‌آورید. در این حالت باید جزئیات حافظه خود را به یک توضیح ساخت‌یافته تبدیل کنید.

اطلاعات مفید عبارت‌اند از:

  • ژانر فیلم
  • زبان یا کشور احتمالی
  • حدود سالی که فیلم را دیده‌اید
  • قدیمی یا جدید بودن تصویر
  • جنسیت و سن تقریبی شخصیت اصلی
  • مکان رخ دادن داستان
  • اتفاق خاص
  • پایان فیلم
  • نوع رابطه شخصیت‌ها
  • شغل شخصیت اصلی
  • یک شیء یا وسیله مهم
  • شبکه یا کانالی که فیلم را پخش کرده است
  • انیمیشن یا فیلم زنده بودن اثر
  • سریال یا فیلم سینمایی بودن
  • رنگی یا سیاه‌وسفید بودن

پرامپت پیشنهادی:

نام یک فیلم را فراموش کرده‌ام. فقط اطلاعات زیر را به خاطر دارم:

- ژانر احتمالی:
- کشور یا زبان:
- حدود سالی که آن را دیدم:
- شخصیت‌های اصلی:
- اتفاق مهم داستان:
- لوکیشن:
- پایان احتمالی:
- جزئیات دیگری که به خاطر دارم:

براساس این اطلاعات، حداکثر 10 فیلم محتمل پیشنهاد بده.
برای هر گزینه:
1. نام اصلی
2. سال تولید
3. خلاصه بسیار کوتاه
4. میزان تطابق با توضیحات من
5. دلیل انتخاب
6. تفاوت آن با اطلاعاتی که داده‌ام

اگر اطلاعات کافی نیست، قبل از پیشنهاد فیلم پنج سؤال دقیق از من بپرس.

درخواست پرسش تکمیلی بسیار مهم است. گاهی یک سؤال ساده مانند «فیلم انیمیشن بود یا با بازیگر واقعی؟» می‌تواند صدها گزینه را حذف کند.

روش هفتم: پیدا کردن فیلم از روی دیالوگ یا صدای کلیپ

اگر صدای یک کلیپ را دارید، ابتدا دیالوگ آن را به متن تبدیل کنید.

فرایند کلی:

کلیپ صوتی
    ↓
تبدیل گفتار به متن
    ↓
اصلاح نام‌ها و کلمات نامفهوم
    ↓
تشخیص زبان
    ↓
جست‌وجوی عبارت دقیق
    ↓
تحلیل نتایج و تطبیق با تصویر

اگر صدای پس‌زمینه بلند است، ابتدا نویز یا موسیقی را کاهش دهید. سپس بخش گفتاری واضح‌تر را به متن تبدیل کنید.

برای دیالوگ‌های فارسی دوبله‌شده، جست‌وجوی عین جمله همیشه نتیجه نمی‌دهد؛ زیرا دوبله ممکن است با زیرنویس یا متن اصلی تفاوت داشته باشد. در این حالت:

  1. مفهوم دیالوگ را استخراج کنید.
  2. چند ترجمه انگلیسی محتمل بسازید.
  3. عبارت‌های انگلیسی را جست‌وجو کنید.
  4. موضوع صحنه را به پرس‌وجو اضافه کنید.

مثال:

"you should never have come back" movie scene hospital

اگر کلیپ شامل موسیقی شناخته‌شده‌ای است، شناسایی آهنگ و بررسی فیلم‌هایی که از آن استفاده کرده‌اند نیز می‌تواند مسیر دیگری برای رسیدن به پاسخ باشد.

چگونه یک اسکرین‌شات مناسب تهیه کنیم؟

کیفیت تصویر ورودی روی دقت جست‌وجو اثر زیادی دارد.

فریم مناسب انتخاب کنید

فریمی را انتخاب کنید که حداقل یکی از این عناصر را داشته باشد:

  • چهره واضح
  • محیط مشخص
  • نوشته خوانا
  • لباس منحصربه‌فرد
  • شیء شاخص
  • بیش از یک شخصیت

فریم‌های تار، بسیار تاریک یا دارای حرکت شدید معمولاً نتیجه ضعیف‌تری ایجاد می‌کنند.

عناصر اضافی را حذف کنید

اگر تصویر از شبکه اجتماعی گرفته شده است، موارد زیر ممکن است جست‌وجو را منحرف کنند:

  • نام کاربری
  • آیکون‌های لایک و اشتراک‌گذاری
  • متن تبلیغاتی روی ویدئو
  • حاشیه‌های بزرگ
  • لوگوی صفحه منتشرکننده
  • استیکرها و ایموجی‌ها

تصویر را طوری برش دهید که صحنه اصلی بیشترین فضا را اشغال کند.

دو نسخه آماده کنید

بهتر است دو نسخه از تصویر داشته باشید:

  • نسخه کامل صحنه
  • نسخه برش‌خورده از چهره یا عنصر مهم

گاهی نسخه کامل، نام فیلم را پیدا می‌کند و نسخه برش‌خورده، بازیگر را تشخیص می‌دهد.

کیفیت را بیش از حد دست‌کاری نکنید

افزایش وضوح ممکن است تصویر را خواناتر کند، اما ابزارهای افزایش کیفیت گاهی جزئیاتی می‌سازند که در فایل اصلی وجود نداشته است. ابتدا تصویر اصلی را جست‌وجو کنید و فقط در صورت نیاز نسخه بهبودیافته را نیز آزمایش کنید.

استراتژی ترکیبی برای بیشترین دقت

بهترین راه این است که به یک ابزار وابسته نباشید.

گام اول: جست‌وجوی تصویری

تصویر کامل و بخش‌های مهم آن را در Google Lens و Bing Visual Search بررسی کنید.

گام دوم: استخراج اطلاعات

این موارد را یادداشت کنید:

  • نام احتمالی بازیگر
  • جمله زیرنویس
  • زبان
  • کشور احتمالی
  • دوره تاریخی
  • محیط صحنه
  • نتیجه‌های تکرارشونده

گام سوم: تحلیل با مدل چندوجهی

تصویر و اطلاعات استخراج‌شده را به مدل بدهید و بخواهید گزینه‌ها را رتبه‌بندی کند.

گام چهارم: جست‌وجوی متنی

نام بازیگر، توضیح صحنه و دیالوگ را با یکدیگر ترکیب کنید.

مثال:

movie scene woman red coat train station

یا:

actor name hospital scene movie

گام پنجم: تأیید نهایی

نام فیلم را فقط زمانی قطعی در نظر بگیرید که چند نشانه مستقل آن را تأیید کنند.

برای مثال:

  • چهره بازیگر مطابقت دارد
  • لباس مربوط به همان صحنه است
  • خلاصه داستان با کلیپ هماهنگ است
  • تصویر مشابه در منابع دیگر دیده می‌شود
  • دیالوگ به همان اثر مربوط است

روش امتیازدهی به گزینه‌های پیشنهادی

اگر هوش مصنوعی چند فیلم پیشنهاد کرد، می‌توانید از جدول زیر برای مقایسه آن‌ها استفاده کنید.

معیارامتیاز
تطابق چهره یا بازیگر۲۵
تطابق لوکیشن و طراحی صحنه۱۵
تطابق لباس و دوره زمانی۱۵
تطابق دیالوگ یا زیرنویس۲۰
تطابق خلاصه داستان۱۵
وجود تصویر مشابه در وب۱۰
مجموع۱۰۰

برای هر فیلم، فقط براساس شواهد امتیاز بدهید.

نمونه:

نام فیلم: گزینه اول

تطابق بازیگر: 25 از 25
تطابق لوکیشن: 12 از 15
تطابق لباس: 13 از 15
تطابق دیالوگ: 10 از 20
تطابق داستان: 14 از 15
تصویر مشابه: 8 از 10

امتیاز نهایی: 82 از 100

این روش از پذیرش سریع اولین حدس مدل جلوگیری می‌کند.

پرامپت کامل برای پیدا کردن نام فیلم

می‌خواهم نام فیلم یا سریالی را از روی تصویر پیدا کنم.

وظیفه تو:
1. فقط مواردی را که واقعاً در تصویر مشاهده می‌کنی فهرست کن.
2. نوشته‌ها و زیرنویس‌های قابل مشاهده را استخراج کن.
3. چهره‌ها، لباس‌ها، محیط، اشیاء، معماری و دوره زمانی احتمالی را تحلیل کن.
4. ژانر و کشور احتمالی تولید را با ذکر میزان اطمینان پیشنهاد بده.
5. حداکثر پنج فیلم یا سریال محتمل ارائه کن.
6. برای هر گزینه، دلایل موافق و دلایل تردید را بنویس.
7. نتیجه قطعی نساز و میزان اطمینان را اعلام کن.
8. برای تأیید هر گزینه، یک عبارت جست‌وجوی دقیق پیشنهاد بده.
9. اگر تصویر اطلاعات کافی ندارد، توضیح بده چه فریم دیگری باید تهیه کنم.

خروجی را به شکل جدول ارائه بده.

پرامپت برای اصلاح نتیجه اشتباه

اگر مدل یک فیلم اشتباه پیشنهاد داد، فقط نگویید «اشتباه است». اطلاعات جدید اضافه کنید:

گزینه‌های قبلی درست نبودند.

اطلاعات جدید:
- فیلم را تقریباً بین سال‌های ۱۳۹۰ تا ۱۳۹۵ دیده‌ام.
- اثر احتمالاً اروپایی بود.
- شخصیت اصلی یک مرد مسن بود.
- صحنه داخل قطار اتفاق می‌افتاد.
- فیلم فضای کمدی نداشت.
- تصویر ارسالی احتمالاً مربوط به نیمه دوم فیلم است.

گزینه‌های قبلی را تکرار نکن.
براساس اطلاعات جدید، فهرست را بازسازی کن و برای هر مورد میزان تطابق را توضیح بده.

هر بار اطلاعات تازه‌ای اضافه کنید تا دامنه جست‌وجو محدودتر شود.

خطاهای رایج هنگام پیدا کردن اسم فیلم

استفاده از یک تصویر بسیار تار

اگر چهره، نوشته و محیط قابل تشخیص نباشد، مدل فقط حدس‌های عمومی ارائه می‌دهد.

اعتماد به اولین پاسخ

پاسخ سریع الزاماً پاسخ درست نیست. نام فیلم، سال تولید و بازیگران را جداگانه بررسی کنید.

ارسال تصویر دارای نوشته‌های مزاحم

متن روی تصویر ممکن است متعلق به صفحه منتشرکننده باشد، نه خود فیلم. این متن می‌تواند جست‌وجو را منحرف کند.

ارائه توضیح بسیار کلی

عبارتی مانند «فیلمی درباره یک مرد که سفر می‌کند» هزاران نتیجه دارد. جزئیات متمایزکننده را اضافه کنید.

ترکیب اطلاعات قطعی و نامطمئن

مشخص کنید کدام جزئیات را دقیق به خاطر دارید و درباره کدام موارد مطمئن نیستید.

مثال:

اطلاعات قطعی:
- داستان در یک بیمارستان رخ می‌داد.
- شخصیت اصلی زن بود.

اطلاعات نامطمئن:
- فیلم احتمالاً فرانسوی بود.
- شاید مربوط به دهه ۲۰۱۰ باشد.

جست‌وجوی فقط ترجمه فارسی دیالوگ

زیرنویس‌ها و دوبله‌های مختلف ممکن است ترجمه متفاوتی داشته باشند. مفهوم جمله یا نسخه‌های احتمالی انگلیسی را نیز جست‌وجو کنید.

نادیده گرفتن احتمال سریال بودن

ممکن است تصویر متعلق به سریال، فیلم تلویزیونی، تبلیغ، موزیک‌ویدئو یا یک ویدئوی کوتاه اینترنتی باشد. دامنه جست‌وجو را زود محدود نکنید.

ساخت ابزار تشخیص فیلم از روی عکس با API درواره

اگر توسعه‌دهنده هستید، می‌توانید یک ابزار ساده بسازید که تصویر را از کاربر دریافت کند و آن را برای تحلیل به یک مدل چندوجهی ارسال کند.

درواره زیرساخت API برای دسترسی به مدل‌های هوش مصنوعی را فراهم می‌کند. برای این کاربرد باید یک مدل دارای قابلیت دریافت تصویر یا Vision انتخاب کنید.

معماری ساده سامانه:

آپلود تصویر توسط کاربر
    ↓
اعتبارسنجی نوع و اندازه فایل
    ↓
کاهش اندازه یا فشرده‌سازی کنترل‌شده
    ↓
ارسال تصویر به مدل چندوجهی
    ↓
دریافت مشاهدات و گزینه‌های احتمالی
    ↓
نمایش نتایج همراه با میزان اطمینان
    ↓
تأیید نتیجه با جست‌وجو یا داده‌های تکمیلی

درواره پایگاه اطلاعات اختصاصی فیلم یا موتور جست‌وجوی معکوس تصویر نیست. مدل چندوجهی می‌تواند تصویر را تحلیل و گزینه‌های احتمالی را پیشنهاد کند، اما برای تأیید قطعی بهتر است نتیجه با منابع جست‌وجویی و اطلاعات فیلم‌ها تطبیق داده شود.

نمونه درخواست چندوجهی با cURL

ابتدا یک API Key از درواره دریافت کنید و Model ID یک مدل پشتیبانی‌کننده تصویر را از صفحه مدل‌ها انتخاب کنید.

curl https://api.darvareh.ir/v1/chat/completions \
  -H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_MODEL_ID",
    "temperature": 0.2,
    "messages": [
      {
        "role": "system",
        "content": "تو یک دستیار تحلیل تصویر هستی. بین مشاهده مستقیم، استنباط و حدس تفاوت قائل شو و نام فیلم را بدون شواهد کافی قطعی اعلام نکن."
      },
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "این تصویر احتمالاً فریمی از یک فیلم یا سریال است. ابتدا عناصر قابل مشاهده را تحلیل کن، سپس حداکثر پنج اثر محتمل را همراه با دلیل، شواهد مخالف و میزان اطمینان ارائه بده."
          },
          {
            "type": "image_url",
            "image_url": {
              "url": "https://example.com/movie-frame.jpg"
            }
          }
        ]
      }
    ]
  }'

در این نمونه:

  • YOUR_DARVAREH_API_KEY باید با کلید API واقعی جایگزین شود
  • YOUR_MODEL_ID همان Model ID انتخاب‌شده در درواره است
  • آدرس تصویر باید برای سرویس قابل دسترسی باشد
  • مدل انتخاب‌شده باید ورودی تصویر را پشتیبانی کند
  • دمای پایین‌تر می‌تواند به ثبات بیشتر پاسخ کمک کند

برای مشاهده مدل‌های در دسترس، قابلیت‌ها و قیمت به‌روز آن‌ها به صفحه مدل‌های درواره مراجعه کنید.

ارسال تصویر Base64 با پایتون

اگر تصویر روی یک آدرس عمومی قرار ندارد، می‌توانید آن را به Data URL تبدیل کنید. پشتیبانی دقیق از این قالب به مدل انتخاب‌شده بستگی دارد.

import base64
import mimetypes
import requests

API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"
IMAGE_PATH = "movie-frame.jpg"

mime_type, _ = mimetypes.guess_type(IMAGE_PATH)
mime_type = mime_type or "image/jpeg"

with open(IMAGE_PATH, "rb") as image_file:
    encoded_image = base64.b64encode(image_file.read()).decode("utf-8")

data_url = f"data:{mime_type};base64,{encoded_image}"

payload = {
    "model": MODEL_ID,
    "temperature": 0.2,
    "messages": [
        {
            "role": "system",
            "content": (
                "تصویر را دقیق تحلیل کن. مشاهدات را از حدس‌ها جدا کن و "
                "نام فیلم را بدون شواهد کافی قطعی اعلام نکن."
            ),
        },
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": (
                        "این تصویر احتمالاً از یک فیلم یا سریال است. "
                        "عناصر بصری، نوشته‌ها، محیط و دوره احتمالی را بررسی کن. "
                        "سپس حداکثر پنج گزینه محتمل را با دلیل و میزان اطمینان ارائه بده."
                    ),
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": data_url
                    },
                },
            ],
        },
    ],
}

response = requests.post(
    "https://api.darvareh.ir/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json",
    },
    json=payload,
    timeout=120,
)

response.raise_for_status()
result = response.json()

print(result["choices"][0]["message"]["content"])

در نسخه عملیاتی بهتر است موارد زیر را نیز پیاده‌سازی کنید:

  • محدودیت حجم فایل
  • پذیرش فقط فرمت‌های تصویری مشخص
  • حذف Metadata غیرضروری تصویر
  • Timeout مناسب
  • مدیریت خطاهای API
  • محدودیت تعداد درخواست هر کاربر
  • ثبت میزان مصرف
  • ذخیره نکردن تصویر بیش از مدت موردنیاز
  • نمایش پاسخ به‌صورت «احتمال» به‌جای نتیجه قطعی
  • امکان افزودن توضیح متنی توسط کاربر

دریافت خروجی JSON برای اپلیکیشن

برای نمایش گزینه‌ها در رابط کاربری، خروجی ساخت‌یافته مفیدتر است.

پرامپت پیشنهادی:

تصویر را تحلیل کن و خروجی را فقط به‌صورت JSON معتبر با ساختار زیر ارائه بده:

{
  "observations": [
    "مشاهده قطعی اول"
  ],
  "visible_text": [
    "متن قابل مشاهده"
  ],
  "candidates": [
    {
      "title": "نام اصلی اثر",
      "year": 2020,
      "type": "movie یا series",
      "confidence": 0,
      "supporting_evidence": [
        "شاهد اول"
      ],
      "conflicting_evidence": [
        "مورد ناسازگار"
      ],
      "verification_query": "عبارت پیشنهادی برای جست‌وجو"
    }
  ],
  "need_more_information": true,
  "follow_up_questions": [
    "سؤال تکمیلی"
  ]
}

در سمت سرور باید JSON را اعتبارسنجی کنید و اجازه ندهید پاسخ ناقص یا دارای ساختار اشتباه مستقیماً وارد رابط کاربری شود.

طراحی تجربه کاربری ابزار تشخیص فیلم

یک رابط مناسب می‌تواند شامل این بخش‌ها باشد:

بخش ورودی

  • آپلود یا کشیدن تصویر
  • وارد کردن لینک تصویر
  • نوشتن توضیحات اختیاری
  • انتخاب نوع محتوا: فیلم، سریال یا نامشخص
  • مشخص کردن اطلاعاتی که کاربر به خاطر دارد

بخش نتیجه

برای هر گزینه نمایش دهید:

  • نام فیلم یا سریال
  • سال احتمالی
  • میزان اطمینان
  • دلیل پیشنهاد
  • شواهد موافق
  • موارد نامطمئن
  • عبارت پیشنهادی برای جست‌وجوی بیشتر

بخش اصلاح نتیجه

کاربر باید بتواند اعلام کند:

  • هیچ‌کدام درست نیست
  • یکی از بازیگران درست است
  • کشور یا زبان اشتباه است
  • اثر قدیمی‌تر یا جدیدتر است
  • تصویر مربوط به فیلم نیست
  • اطلاعات بیشتری در اختیار دارد

این بازخورد را می‌توان در درخواست بعدی به مدل اضافه کرد تا فهرست جدیدی تولید شود.

چگونه هزینه ابزار را کاهش دهیم؟

پردازش تصویر معمولاً از درخواست متنی ساده پرهزینه‌تر است. برای کاهش مصرف:

  • تصاویر بسیار بزرگ را پیش از ارسال کوچک کنید
  • فقط فریم‌های باکیفیت را پردازش کنید
  • از ارسال چند تصویر تقریباً یکسان خودداری کنید
  • نتیجه تحلیل هر تصویر را Cache کنید
  • ابتدا OCR و جست‌وجوی معکوس را امتحان کنید
  • فقط در صورت نیاز از مدل قوی‌تر استفاده کنید
  • در مرحله اول تعداد گزینه‌های خروجی را محدود کنید
  • متن Prompt را کوتاه اما دقیق نگه دارید
  • فریم‌های جدید را فقط پس از ناموفق بودن مرحله قبلی ارسال کنید

یک روش اقتصادی این است که ابتدا تصویر با یک مدل سریع‌تر تحلیل شود و فقط گزینه‌های مبهم برای بررسی دوباره به مدل قوی‌تر فرستاده شوند.

ملاحظات حریم خصوصی تصویر

پیش از بارگذاری تصویر در هر سرویس آنلاین، بررسی کنید که عکس حاوی اطلاعات خصوصی یا محرمانه نباشد.

در اسکرین‌شات ممکن است موارد زیر ناخواسته دیده شوند:

  • اعلان‌های تلفن همراه
  • نام کاربری
  • شماره تلفن
  • پیام‌های شخصی
  • تصویر افراد دیگر
  • آدرس فایل یا پوشه
  • اطلاعات حساب کاربری

پیش از ارسال، تصویر را برش دهید و بخش‌های غیرضروری را حذف یا محو کنید. همچنین شرایط نگهداری داده و حریم خصوصی ابزار مورد استفاده را مطالعه کنید.

چک‌لیست سریع پیدا کردن نام فیلم

اگر می‌خواهید سریع‌تر به نتیجه برسید، این ترتیب را اجرا کنید:

  1. از واضح‌ترین لحظه کلیپ اسکرین‌شات بگیرید.
  2. تصویر کامل را در Google Lens جست‌وجو کنید.
  3. چهره یا عنصر مهم را جداگانه جست‌وجو کنید.
  4. همان تصاویر را در Bing Visual Search امتحان کنید.
  5. متن زیرنویس را استخراج کنید.
  6. دیالوگ را به فارسی و انگلیسی جست‌وجو کنید.
  7. چند فریم را به مدل چندوجهی بدهید.
  8. توضیحات داستان را به نتیجه اضافه کنید.
  9. گزینه‌های احتمالی را امتیازدهی کنید.
  10. نتیجه را با تصاویر، تریلر و خلاصه داستان تأیید کنید.

پرسش‌های متداول

بهترین هوش مصنوعی برای پیدا کردن اسم فیلم از روی عکس چیست؟

یک ابزار واحد همیشه بهترین نتیجه را نمی‌دهد. برای تصاویر منتشرشده در وب، Google Lens و Bing Visual Search مفید هستند. برای تحلیل محتوای صحنه و ترکیب آن با توضیحات شما، مدل‌های چندوجهی گزینه مناسبی‌اند.

آیا می‌توان اسم فیلم را از روی چهره بازیگر پیدا کرد؟

گاهی بله، به‌خصوص اگر چهره واضح و بازیگر شناخته‌شده باشد. بااین‌حال، تشخیص چهره می‌تواند اشتباه کند. بهتر است نام بازیگر احتمالی را با فهرست آثار و تصاویر همان فیلم تطبیق دهید.

چگونه نام فیلم را از روی یک کلیپ اینستاگرام پیدا کنیم؟

از چند لحظه متفاوت کلیپ اسکرین‌شات بگیرید، تصویرها را در موتورهای جست‌وجوی تصویری بررسی کنید، متن زیرنویس را استخراج کنید و سپس همه اطلاعات را برای تحلیل به یک مدل چندوجهی بدهید.

اگر تصویر هیچ بازیگری نداشته باشد چه کنیم؟

لوکیشن، لباس، خودرو، اشیاء، معماری، نوشته‌ها و سبک فیلم‌برداری را بررسی کنید. یک شیء یا تابلوی خاص ممکن است سرنخ بهتری از چهره باشد.

آیا هوش مصنوعی همیشه نام فیلم را درست تشخیص می‌دهد؟

خیر. مدل ممکن است اطلاعات ناقص را با یک فیلم مشابه تطبیق دهد یا پاسخ نادرست بسازد. هر پاسخ باید با شواهد مستقل تأیید شود.

آیا می‌توان فیلم را از روی توضیح داستان پیدا کرد؟

بله. هرچه جزئیات متمایزکننده بیشتری مانند کشور، سال تقریبی، لوکیشن، پایان داستان یا ویژگی شخصیت‌ها ارائه دهید، احتمال رسیدن به نتیجه درست بیشتر می‌شود.

آیا می‌توان فیلم را از روی دیالوگ فارسی پیدا کرد؟

بله، اما اگر دیالوگ مربوط به دوبله یا زیرنویس ترجمه‌شده باشد، عبارت اصلی ممکن است متفاوت باشد. از هوش مصنوعی بخواهید چند نسخه انگلیسی احتمالی تولید کند و آن‌ها را جداگانه جست‌وجو کنید.

آیا درواره یک اپلیکیشن آماده تشخیص فیلم است؟

خیر. درواره زیرساخت API مدل‌های هوش مصنوعی را فراهم می‌کند. توسعه‌دهندگان می‌توانند با انتخاب یک مدل چندوجهی، قابلیت تحلیل تصویر و پیشنهاد نام فیلم را در محصول خود پیاده‌سازی کنند.

جمع‌بندی

پیدا کردن اسم فیلم از روی عکس با هوش مصنوعی زمانی بهترین نتیجه را می‌دهد که چند روش را با هم ترکیب کنید. جست‌وجوی معکوس تصویر برای پیدا کردن نسخه‌های مشابه در وب مناسب است، OCR می‌تواند دیالوگ زیرنویس را استخراج کند و مدل‌های چندوجهی می‌توانند چهره، محیط، لباس، نوشته‌ها و توضیحات شما را کنار هم قرار دهند.

برای یک جست‌وجوی موفق:

  • تصویر واضح تهیه کنید
  • چند فریم متفاوت را بررسی کنید
  • زیرنویس و دیالوگ را استخراج کنید
  • اطلاعات قطعی را از حدس‌ها جدا نگه دارید
  • از مدل بخواهید چند احتمال ارائه دهد
  • پاسخ را بدون تأیید نپذیرید
  • نام فیلم را با بازیگران، تصاویر و داستان تطبیق دهید

اگر می‌خواهید قابلیت تحلیل تصویر و پیشنهاد فیلم‌های احتمالی را به سایت، ربات یا اپلیکیشن خود اضافه کنید، می‌توانید از API هوش مصنوعی درواره و مدل‌های چندوجهی موجود در آن استفاده کنید. برای انتخاب Model ID مناسب و مشاهده قیمت به‌روز مدل‌ها، صفحه مدل‌های درواره را ببینید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.