تبدیل عکس به پرامپت با هوش مصنوعی؛ آموزش استخراج Prompt از روی تصویر

در این راهنمای عملی یاد می‌گیرید چگونه عکس دلخواه را با هوش مصنوعی تحلیل و به پرامپتی دقیق شامل سوژه، سبک، نور، رنگ، ترکیب‌بندی و جزئیات فنی تبدیل کنید.

Share
تبدیل عکس به پرامپت با هوش مصنوعی؛ آموزش استخراج Prompt از روی تصویر

گاهی تصویری در اینترنت، شبکه‌های اجتماعی یا یک مجموعه طراحی می‌بینید و دوست دارید بدانید برای ساخت تصویری مشابه باید چه پرامپتی بنویسید. تشخیص سوژه آسان است، اما بازسازی دقیق نور، زاویه دوربین، ترکیب‌بندی، رنگ‌ها، بافت، سبک هنری و حال‌وهوای تصویر به تجربه زیادی در پرامپت‌نویسی نیاز دارد.

ابزارهای تبدیل عکس به پرامپت با استفاده از مدل‌های چندوجهی یا Multimodal می‌توانند تصویر را تحلیل کنند و توضیحی ساختاریافته از عناصر بصری آن بسازند. این توضیح سپس به یک پرامپت قابل استفاده برای مدل‌های تولید تصویر تبدیل می‌شود.

این فرایند با نام‌های مختلفی شناخته می‌شود:

  • تبدیل عکس به پرامپت
  • استخراج پرامپت از تصویر
  • Image to Prompt
  • Reverse Prompt
  • Prompt from Image
  • تحلیل تصویر برای تولید عکس مشابه

در این راهنما یاد می‌گیرید چگونه یک تصویر را به پرامپتی حرفه‌ای تبدیل کنید، خروجی را برای کاربردهای مختلف بهینه کنید و با استفاده از API درواره، ابزار خودکار استخراج پرامپت بسازید.

آیا می‌توان پرامپت اصلی یک عکس را دقیقاً استخراج کرد؟

خیر. این نکته یکی از مهم‌ترین محدودیت‌های تبدیل عکس به پرامپت است.

یک تصویر معمولاً اطلاعات زیر را در خود نگه نمی‌دارد:

  • متن دقیق پرامپت اولیه
  • مدل مورد استفاده
  • نسخه مدل
  • Seed یا بذر تولید
  • تنظیمات Sampler
  • تعداد مراحل تولید
  • مقدار Guidance
  • تصویر مرجع اولیه
  • ویرایش‌های انجام‌شده پس از تولید
  • دستورهای منفی یا Negative Prompt

مدل هوش مصنوعی نمی‌تواند پرامپت اصلی را از پیکسل‌های تصویر بازیابی کند. کاری که انجام می‌دهد، مشاهده و تحلیل عناصر بصری و ساختن یک پرامپت احتمالی است.

بنابراین عبارت دقیق‌تر این است:

هوش مصنوعی پرامپت اصلی را بازیابی نمی‌کند؛ بلکه پرامپتی می‌سازد که می‌تواند تصویری با ویژگی‌های مشابه تولید کند.

حتی اگر پرامپت، مدل و تنظیمات یکسان باشند، ممکن است تصویر جدید دقیقاً مانند تصویر مرجع نباشد. تولید تصویر ذاتاً فرایندی احتمالاتی است.

تبدیل عکس به پرامپت چگونه کار می‌کند؟

مدل‌های چندوجهی می‌توانند هم‌زمان متن و تصویر را پردازش کنند. وقتی یک تصویر برای چنین مدلی ارسال می‌شود، مدل تلاش می‌کند ویژگی‌های قابل مشاهده را به مفاهیم زبانی تبدیل کند.

یک سامانه مناسب Image to Prompt معمولاً مراحل زیر را طی می‌کند:

  1. دریافت تصویر
  2. تشخیص سوژه‌های اصلی
  3. تحلیل محیط و پس‌زمینه
  4. تشخیص سبک بصری
  5. تحلیل نور و رنگ
  6. بررسی ترکیب‌بندی
  7. تخمین زاویه دوربین و نوع کادر
  8. شناسایی بافت و جنس سطوح
  9. تعیین حال‌وهوا
  10. تولید پرامپت فارسی و انگلیسی
  11. پیشنهاد Negative Prompt
  12. ساخت چند نسخه جایگزین

خروجی اولیه نباید فقط یک کپشن ساده مانند «یک بطری روی میز» باشد. یک پرامپت حرفه‌ای باید جزئیات لازم برای بازسازی جهت هنری تصویر را نیز در اختیار مدل تولید تصویر قرار دهد.

تفاوت Image to Prompt با کپشن‌نویسی، OCR و جست‌وجوی تصویری

این ابزارها همگی تصویر دریافت می‌کنند، اما هدف یکسانی ندارند.

قابلیتورودیخروجیکاربرد اصلی
Image to Promptتصویرپرامپت تولید تصویرساخت تصویر مشابه
Image Captioningتصویرتوضیح کوتاهتوصیف محتوای عکس
OCRتصویر حاوی نوشتهمتن استخراج‌شدهتبدیل عکس نوشته به متن
Visual Searchتصویرتصاویر یا محصولات مشابهپیدا کردن نمونه مشابه
Image Classificationتصویردسته یا برچسبتشخیص نوع تصویر
Object Detectionتصویراشیا و موقعیت آن‌هاتشخیص اجزای داخل تصویر

برای مثال، کپشن یک تصویر ممکن است چنین باشد:

یک ساعت مچی روی سطح سنگی قرار دارد.

اما پرامپت حرفه‌ای همان تصویر می‌تواند به این شکل نوشته شود:

عکاسی تبلیغاتی لوکس از یک ساعت مچی فلزی نقره‌ای روی سطح سنگ مرمر تیره، نورپردازی جانبی نرم و سینمایی، بازتاب کنترل‌شده روی بدنه، پس‌زمینه مشکی با گرادیان ظریف، عمق میدان کم، نمای نزدیک، جزئیات بسیار بالا و ترکیب‌بندی مینیمال.

کاربردهای تبدیل عکس به پرامپت

یادگیری پرامپت‌نویسی تصویری

با مشاهده پرامپتی که برای یک عکس ساخته شده است، می‌توانید بفهمید چه واژه‌هایی برای توصیف نور، زاویه، سبک، رنگ و ترکیب‌بندی مناسب هستند.

بازسازی سبک بصری

اگر به حال‌وهوای یک تصویر علاقه دارید، می‌توانید ویژگی‌های بصری آن را استخراج کنید و همان سبک کلی را روی سوژه دیگری به کار ببرید.

ساخت تصاویر محصول

یک فروشگاه اینترنتی می‌تواند تصویر تبلیغاتی موفق یک محصول را تحلیل کند و پرامپتی برای ساخت تصاویر هماهنگ از محصولات دیگر به دست آورد.

ایجاد هویت بصری هماهنگ

کسب‌وکارها می‌توانند تصاویر برند خود را تحلیل و عناصر تکرارشونده‌ای مانند پالت رنگ، نور، نوع پس‌زمینه و ترکیب‌بندی را استخراج کنند.

ساخت مودبرد

طراحان می‌توانند مجموعه‌ای از تصاویر مرجع را به توضیحات ساختاریافته تبدیل و از نتیجه برای طراحی مودبرد یا تعیین جهت هنری پروژه استفاده کنند.

تولید نسخه‌های جدید از یک ایده

بعد از استخراج پرامپت، می‌توان سوژه، فصل، رنگ، محیط، زمان روز یا سبک تصویر را تغییر داد و نسخه‌های متنوعی ساخت.

مستندسازی تصاویر

توضیح ساختاریافته تصویر می‌تواند برای مدیریت آرشیو، برچسب‌گذاری محتوا، نوشتن متن جایگزین و جست‌وجوی داخلی نیز استفاده شود.

یک پرامپت تصویری حرفه‌ای چه اجزایی دارد؟

برای استخراج پرامپت دقیق، بهتر است مدل هوش مصنوعی تصویر را در چند لایه تحلیل کند.

۱. سوژه اصلی

ابتدا باید مشخص شود مهم‌ترین موضوع تصویر چیست:

  • انسان
  • محصول
  • ساختمان
  • غذا
  • حیوان
  • خودرو
  • منظره
  • رابط کاربری
  • شیء تزئینی
  • اثر هنری

توصیف سوژه باید شامل ویژگی‌های قابل مشاهده باشد، نه حدس‌های بدون پشتوانه.

۲. محیط و پس‌زمینه

مدل باید مشخص کند سوژه در چه محیطی قرار دارد:

  • استودیوی عکاسی
  • خیابان شهری
  • طبیعت
  • فضای اداری
  • اتاق مینیمال
  • پس‌زمینه ساده
  • محیط صنعتی
  • فضای تاریخی
  • محیط علمی‌تخیلی

۳. ترکیب‌بندی

ترکیب‌بندی تعیین می‌کند عناصر چگونه در قاب قرار گرفته‌اند:

  • سوژه در مرکز
  • قانون یک‌سوم
  • تقارن
  • فضای منفی زیاد
  • ترکیب‌بندی مورب
  • نمای شلوغ
  • قاب‌بندی مینیمال
  • نمای نزدیک
  • نمای باز

۴. زاویه دید

زاویه دید اثر زیادی بر نتیجه دارد:

  • روبه‌رو
  • زاویه سه‌ربع
  • نمای بالا
  • نمای پایین
  • دید از سطح چشم
  • نمای هوایی
  • نمای ماکرو
  • نمای ایزومتریک
  • نمای روی شانه

۵. نورپردازی

عبارت‌هایی مانند «نور خوب» بیش از حد مبهم هستند. بهتر است نوع، جهت و کیفیت نور مشخص شود:

  • نور نرم استودیویی
  • نور جانبی
  • نور پس‌زمینه
  • نور پنجره
  • نور طلوع
  • نور غروب
  • نور نئون
  • نور پرکنتراست
  • نور حجمی
  • سایه‌های نرم
  • سایه‌های عمیق
  • بازتاب کنترل‌شده

۶. پالت رنگ

مدل باید رنگ‌های غالب و رابطه میان آن‌ها را توضیح دهد:

  • رنگ‌های گرم
  • رنگ‌های سرد
  • پالت تک‌رنگ
  • رنگ‌های مکمل
  • رنگ‌های خنثی
  • اشباع کم
  • کنتراست بالا
  • رنگ‌های پاستلی
  • ترکیب مشکی و طلایی

۷. سبک بصری

سبک می‌تواند عکاسی، تصویرسازی یا سه‌بعدی باشد:

  • فوتورئال
  • سینمایی
  • مستند
  • عکاسی تبلیغاتی
  • نقاشی آبرنگ
  • طراحی با مداد
  • تصویرسازی وکتور
  • سه‌بعدی
  • سورئال
  • مینیمال
  • رترو
  • سایبرپانک
  • سبک تحریریه مجله

۸. بافت و جنس

در تصاویر محصول و معماری، جنس سطوح اهمیت زیادی دارد:

  • فلز صیقلی
  • شیشه شفاف
  • چوب طبیعی
  • پارچه مخمل
  • سنگ مرمر
  • بتن خام
  • پلاستیک مات
  • کاغذ بافت‌دار
  • سطح براق
  • سطح زبر

۹. حس و حال

تصویر ممکن است حس خاصی منتقل کند:

  • آرام
  • لوکس
  • پرانرژی
  • مرموز
  • دوستانه
  • حرفه‌ای
  • نوستالژیک
  • آینده‌نگر
  • دراماتیک
  • مینیمال

۱۰. مشخصات فنی احتمالی

مدل می‌تواند بعضی مشخصات فنی را تخمین بزند:

  • نمای نزدیک یا Wide Shot
  • عمق میدان کم
  • بوکه نرم
  • زاویه دید واید
  • لنز تله
  • نوردهی بلند
  • نسبت تصویر
  • وضوح بالا

این موارد معمولاً تخمینی هستند. از مدل بخواهید آن‌ها را به‌عنوان «احتمالی» علامت‌گذاری کند.

فرمول ساده برای ساخت پرامپت از روی عکس

می‌توانید ساختار پرامپت را به این صورت در نظر بگیرید:

سوژه + محیط + ترکیب‌بندی + زاویه دید + نورپردازی +
رنگ‌ها + سبک بصری + جنس و بافت + حال‌وهوا + کیفیت خروجی

نمونه:

یک فنجان سرامیکی سفید روی میز چوبی کنار پنجره،
ترکیب‌بندی مینیمال با فضای منفی، نمای نزدیک از زاویه سه‌ربع،
نور طبیعی نرم صبحگاهی، پالت رنگ گرم و خنثی،
عکاسی سبک زندگی، بافت واقعی چوب و سرامیک،
فضای آرام و صمیمی، جزئیات بالا و عمق میدان کم

این ساختار نقطه شروع مناسبی است، اما برای نتیجه دقیق‌تر باید آن را بر اساس نوع تصویر و مدل مقصد تغییر دهید.

آموزش گام‌به‌گام تبدیل عکس به پرامپت

گام اول: تصویر مرجع مناسبی انتخاب کنید

تصویر مناسب ویژگی‌های زیر را دارد:

  • وضوح قابل قبول
  • نور کافی
  • سوژه مشخص
  • فشرده‌سازی کم
  • نبود واترمارک بزرگ
  • کادر کامل
  • رنگ‌های قابل تشخیص

اگر تصویر تار، بسیار کوچک یا به‌شدت فشرده باشد، مدل ممکن است جزئیات را اشتباه تشخیص دهد.

گام دوم: هدف خود را مشخص کنید

قبل از ارسال تصویر، مشخص کنید با پرامپت چه کاری می‌خواهید انجام دهید:

  • ساخت تصویری بسیار مشابه
  • استخراج سبک
  • حفظ ترکیب‌بندی و تغییر سوژه
  • حفظ سوژه و تغییر محیط
  • ساخت تصویر تبلیغاتی
  • ساخت نسخه سه‌بعدی
  • تبدیل عکس به تصویرسازی
  • تولید چند نسخه خلاقانه

هدف روی نوع خروجی اثر مستقیم دارد.

گام سوم: از مدل تحلیل ساختاریافته بخواهید

به‌جای نوشتن «این عکس را به پرامپت تبدیل کن»، دقیقاً مشخص کنید چه اطلاعاتی نیاز دارید.

پرامپت پیشنهادی:

این تصویر را برای بازسازی با یک مدل تولید تصویر تحلیل کن.

موارد زیر را جداگانه استخراج کن:
1. سوژه اصلی و ویژگی‌های قابل مشاهده
2. محیط و پس‌زمینه
3. ترکیب‌بندی و محل قرارگیری عناصر
4. زاویه دوربین و نوع کادر
5. نورپردازی و جهت نور
6. رنگ‌های غالب
7. سبک بصری
8. جنس، بافت و جزئیات
9. حس و حال تصویر
10. نسبت تصویر احتمالی

مواردی را که مستقیماً دیده می‌شوند از موارد تخمینی جدا کن.
در پایان یک پرامپت فارسی، یک پرامپت انگلیسی و یک Negative Prompt ارائه بده.
هدف، ساخت تصویری با ترکیب‌بندی و فضای بصری مشابه است.

گام چهارم: پرامپت استخراج‌شده را آزمایش کنید

پرامپت را در مدل تولید تصویر اجرا کنید. در اولین تلاش انتظار شباهت کامل نداشته باشید.

نتیجه را با تصویر مرجع از نظر موارد زیر مقایسه کنید:

  • سوژه
  • اندازه سوژه در قاب
  • زاویه دید
  • نور
  • رنگ‌ها
  • پس‌زمینه
  • عمق میدان
  • سبک
  • جزئیات

گام پنجم: تفاوت‌ها را به مدل بدهید

اگر نتیجه مناسب نبود، تفاوت‌ها را به‌صورت مشخص بیان کنید:

نتیجه تولیدشده با تصویر مرجع این تفاوت‌ها را دارد:

- دوربین بیش از حد به سوژه نزدیک است.
- نور مرجع از سمت چپ می‌آید.
- پس‌زمینه باید تیره‌تر باشد.
- سطح زیر محصول باید بازتاب ملایم داشته باشد.
- رنگ‌های تصویر مرجع اشباع کمتری دارند.

پرامپت را با حفظ سایر ویژگی‌ها اصلاح کن.

گام ششم: چند نسخه جایگزین بسازید

به‌جای دریافت یک پرامپت، از مدل بخواهید چند نسخه تولید کند:

  • نسخه کوتاه
  • نسخه جزئی و دقیق
  • نسخه سینمایی
  • نسخه فوتورئال
  • نسخه مناسب تبلیغات
  • نسخه خلاقانه
  • نسخه با حفظ ترکیب‌بندی
  • نسخه با حفظ سبک و تغییر سوژه

مقایسه این نسخه‌ها کمک می‌کند مناسب‌ترین ساختار را برای مدل مقصد پیدا کنید.

پرامپت عمومی تبدیل عکس به Prompt

تصویر پیوست‌شده را مانند یک مدیر هنری و متخصص پرامپت‌نویسی تحلیل کن.

ابتدا فقط ویژگی‌هایی را بنویس که مستقیماً در تصویر دیده می‌شوند:
- سوژه
- محیط
- اجزای مهم
- ترکیب‌بندی
- زاویه دید
- نوع کادر
- نورپردازی
- رنگ‌ها
- سبک
- بافت‌ها
- حال‌وهوا

سپس موارد احتمالی مانند نوع لنز یا تکنیک نورپردازی را در بخشی جداگانه با برچسب «تخمینی» قرار بده.

در پایان ارائه کن:
1. پرامپت کامل فارسی
2. پرامپت کامل انگلیسی
3. پرامپت کوتاه
4. Negative Prompt
5. نسبت تصویر پیشنهادی
6. سه نسخه جایگزین

از نام بردن افراد واقعی یا هنرمندان خودداری کن و سبک را با ویژگی‌های بصری قابل مشاهده توضیح بده.

پرامپت استخراج‌شده از عکس محصول

این تصویر محصول را برای ساخت یک عکس تبلیغاتی مشابه تحلیل کن.

اطلاعات زیر را استخراج کن:
- نوع محصول و شکل ظاهری
- رنگ و جنس بدنه
- زاویه محصول
- موقعیت محصول در قاب
- سطح زیر محصول
- نوع پس‌زمینه
- جهت و شدت نور اصلی
- نورهای مکمل
- بازتاب‌ها و سایه‌ها
- عمق میدان
- پالت رنگ
- حس برند
- فضای خالی مناسب برای متن تبلیغاتی

سپس یک پرامپت فارسی و انگلیسی برای عکاسی تبلیغاتی محصول بنویس.
مشخصات برند، لوگو یا نوشته‌ای را که با اطمینان قابل تشخیص نیست، اختراع نکن.
یک Negative Prompt نیز برای جلوگیری از اعوجاج محصول، نوشته‌های ناخوانا، انعکاس غیرطبیعی و پس‌زمینه شلوغ ارائه بده.

پرامپت استخراج Prompt از عکس پرتره

این تصویر پرتره را بدون حدس زدن هویت فرد تحلیل کن.

توصیف کن:
- نوع کادر
- زاویه صورت
- جهت نگاه
- حالت چهره
- مدل و جهت نور
- شدت سایه‌ها
- رنگ پس‌زمینه
- فاصله احتمالی دوربین
- عمق میدان
- رنگ‌بندی
- سبک عکاسی
- نوع پوشش به‌صورت عمومی
- حس و حال تصویر

در پایان پرامپتی برای ساخت یک پرتره جدید با همین سبک، نور و ترکیب‌بندی ارائه بده.
ویژگی‌های هویتی فرد را بازسازی نکن و روی زبان بصری تصویر تمرکز داشته باش.

پرامپت تبدیل تصویر معماری به پرامپت

این تصویر معماری را تحلیل و آن را به یک پرامپت حرفه‌ای تبدیل کن.

موارد زیر را مشخص کن:
- نوع ساختمان یا فضا
- سبک معماری
- فرم کلی بنا
- مصالح قابل مشاهده
- نسبت حجم‌ها
- زاویه دید
- ارتفاع دوربین
- نوع پرسپکتیو
- محوطه و پوشش گیاهی
- زمان روز
- شرایط آسمان
- نور طبیعی و مصنوعی
- پالت رنگ
- میزان واقع‌گرایی رندر
- حضور یا نبود انسان و وسایل نقلیه

ابتدا یک تحلیل ساختاریافته بنویس و سپس پرامپت فارسی و انگلیسی ارائه بده.
در پایان یک نسخه روز، یک نسخه شب و یک نسخه با آب‌وهوای متفاوت تولید کن.

پرامپت تبدیل تصویر هنری به Prompt

این تصویر را از نظر زبان بصری و تکنیک هنری تحلیل کن.

بررسی کن:
- موضوع اصلی
- شیوه ساده‌سازی فرم‌ها
- نوع خطوط
- بافت قلم یا سطح
- نحوه استفاده از رنگ
- میزان واقع‌گرایی
- ترکیب‌بندی
- کنتراست
- فضای مثبت و منفی
- حس کلی اثر
- رسانه احتمالی مانند آبرنگ، مداد، رنگ روغن، چاپ دستی یا تصویرسازی دیجیتال

به‌جای نسبت دادن اثر به یک هنرمند، ویژگی‌های بصری قابل مشاهده را توصیف کن.
سپس پرامپتی بنویس که همین ویژگی‌های عمومی را برای موضوعی جدید بازسازی کند.

پرامپت تحلیل اسکرین‌شات رابط کاربری

این اسکرین‌شات رابط کاربری را از دید یک طراح UI/UX تحلیل کن.

استخراج کن:
- نوع صفحه
- ساختار کلی
- سلسله‌مراتب بصری
- ستون‌ها و شبکه‌بندی
- فاصله‌گذاری
- نوع کارت‌ها
- جایگاه منوها
- دکمه‌های اصلی
- رنگ‌های غالب
- شکل آیکون‌ها
- سبک تایپوگرافی
- حالت روشن یا تیره
- میزان گردی گوشه‌ها
- استفاده از سایه و حاشیه
- رفتار احتمالی در موبایل

اطلاعات خصوصی، نام‌ها، لوگوها و متن‌های اختصاصی را بازسازی نکن.
در پایان یک پرامپت برای طراحی رابطی جدید با ساختار و زبان بصری مشابه ارائه بده.

حفظ ترکیب‌بندی و تغییر سوژه

یکی از کاربردهای مهم Reverse Prompt این است که چیدمان تصویر حفظ شود، اما سوژه تغییر کند.

برای مثال، اگر تصویر مرجع شامل یک عطر روی سکوی سنگی باشد، می‌توانید همان ترکیب‌بندی را برای یک ساعت یا هدفون استفاده کنید.

ترکیب‌بندی، زاویه دوربین، محل قرارگیری سوژه، نورپردازی،
پالت رنگ، نسبت فضای خالی و عمق میدان تصویر مرجع را حفظ کن.

سوژه اصلی را با یک هدفون بی‌سیم مشکی مات جایگزین کن.
تمام جزئیاتی را که مستقیماً به محصول قبلی مربوط هستند حذف کن.
پرامپت جدید باید مستقل باشد و به تصویر مرجع اشاره نکند.

حفظ سبک و تغییر کامل محتوا

گاهی هدف، حفظ ترکیب‌بندی نیست و فقط سبک تصویر اهمیت دارد.

زبان بصری تصویر مرجع را استخراج کن:
نوع نور، رنگ‌بندی، کنتراست، بافت، میزان واقع‌گرایی،
فضاسازی، کیفیت سایه‌ها و حس کلی.

سپس همان زبان بصری را برای تصویر یک کافه مدرن در یک شب بارانی به کار ببر.
محتوا و ترکیب‌بندی تصویر اصلی را تکرار نکن.

نمونه عملی: تبدیل عکس محصول به پرامپت

فرض کنید تصویر مرجع یک بطری شیشه‌ای روی سطح مشکی براق است. نور باریکی از سمت چپ به محصول می‌تابد و پس‌زمینه دارای گرادیان خاکستری تیره است.

تحلیل ساختاریافته

مشاهده‌شده:

  • بطری شیشه‌ای شفاف در مرکز قاب
  • سطح مشکی با بازتاب ملایم
  • پس‌زمینه تیره
  • نور اصلی از سمت چپ
  • کنتراست بالا
  • فضای خالی در اطراف محصول
  • ترکیب‌بندی متقارن

تخمینی:

  • استفاده از نور Strip Box
  • لنز پرتره یا تله کوتاه
  • عمق میدان متوسط
  • عکاسی استودیویی تبلیغاتی

پرامپت فارسی نهایی

عکاسی تبلیغاتی لوکس از یک بطری شیشه‌ای شفاف و مینیمال،
قرارگرفته در مرکز قاب روی سطح مشکی براق با بازتاب ظریف،
پس‌زمینه خاکستری بسیار تیره با گرادیان نرم،
نور باریک و کنترل‌شده از سمت چپ برای مشخص کردن لبه‌های شیشه،
نور مکمل بسیار ضعیف از راست، سایه‌های عمیق،
ترکیب‌بندی متقارن، نمای روبه‌رو، کنتراست بالا،
فضای خالی کافی در اطراف محصول، جزئیات واقعی شیشه،
حال‌وهوای حرفه‌ای و لوکس، عکاسی استودیویی با کیفیت بالا

پرامپت انگلیسی نهایی

Luxury studio product photography of a transparent minimalist glass bottle,
centered on a glossy black surface with a subtle reflection,
dark charcoal gradient background, narrow controlled rim light from the left,
very soft fill light from the right, deep clean shadows,
symmetrical front-facing composition, high contrast,
generous negative space around the product,
realistic glass material and refined commercial aesthetic,
high-detail professional advertising photography

Negative Prompt پیشنهادی

distorted bottle, asymmetrical shape, duplicate product, warped glass,
unreadable text, random logo, excessive reflections, harsh glare,
cluttered background, tilted composition, low resolution,
plastic appearance, floating object, unrealistic shadow

خروجی فارسی بهتر است یا انگلیسی؟

مدل‌های جدید معمولاً زبان فارسی را درک می‌کنند، اما عملکرد مدل‌های تولید تصویر در پردازش واژه‌های تخصصی انگلیسی ممکن است متفاوت باشد.

روش مناسب این است که هر دو نسخه را تولید و آزمایش کنید:

  • نسخه فارسی برای خوانایی و ویرایش آسان
  • نسخه انگلیسی برای استفاده مستقیم یا مقایسه نتیجه
  • نسخه ترکیبی برای حفظ اصطلاحات تخصصی

نمونه ترکیبی:

عکاسی تبلیغاتی از یک ساعت لوکس،
soft side lighting، dark gradient background،
نمای نزدیک، shallow depth of field،
سطح سنگ مرمر مشکی با بازتاب کنترل‌شده،
minimal luxury composition، جزئیات بالا

بهترین زبان پرامپت به مدل مقصد بستگی دارد. نتیجه واقعی را با چند آزمایش مقایسه کنید.

پرامپت طولانی بهتر است یا کوتاه؟

طولانی‌تر بودن پرامپت همیشه به معنای بهتر بودن آن نیست.

پرامپت بیش از حد طولانی ممکن است:

  • شامل جزئیات متناقض باشد
  • اولویت سوژه اصلی را کاهش دهد
  • مدل را میان چند سبک مختلف سردرگم کند
  • کنترل و ویرایش نتیجه را دشوار کند
  • جزئیات کم‌اهمیت را بیش از حد برجسته کند

برای کار حرفه‌ای، سه نسخه بسازید:

نسخه کوتاه

برای ایده‌پردازی سریع و تولید تنوع زیاد.

نسخه استاندارد

شامل سوژه، محیط، نور، ترکیب‌بندی، رنگ و سبک.

نسخه دقیق

برای پروژه‌هایی که جنس، زاویه، نور و جزئیات فنی اهمیت زیادی دارند.

تفکیک ویژگی‌های مشاهده‌شده و تخمینی

یکی از مشکلات رایج تحلیل تصویر این است که مدل اطلاعاتی مانند نوع دوربین، لنز یا تنظیمات نور را با اطمینان بیان می‌کند؛ درحالی‌که این جزئیات ممکن است از روی تصویر قابل اثبات نباشند.

از مدل بخواهید خروجی را به دو بخش تقسیم کند:

Observed:
مواردی که مستقیماً از تصویر قابل مشاهده هستند.

Estimated:
مواردی که بر اساس ظاهر تصویر تخمین زده شده‌اند و قطعیت ندارند.

برای نمونه:

ویژگیوضعیت
نور از سمت چپمشاهده‌شده
عمق میدان کممشاهده‌شده
استفاده از لنز ۸۵ میلی‌متریتخمینی
استفاده از Softboxتخمینی
پس‌زمینه خاکستریمشاهده‌شده
عکاسی در استودیواحتمالاً تخمینی

این تفکیک باعث می‌شود پرامپت نهایی دقیق‌تر و قابل اعتمادتر باشد.

چگونه پرامپت استخراج‌شده را ارزیابی کنیم؟

فقط خواندن پرامپت کافی نیست. باید تصویر تولیدشده با مرجع مقایسه شود.

معیارپرسش ارزیابی
شباهت محتواییآیا سوژه‌ها و اجزای اصلی درست هستند؟
ترکیب‌بندیآیا محل و اندازه عناصر مشابه است؟
نورپردازیآیا جهت، نرمی و شدت نور نزدیک است؟
پالت رنگآیا رنگ‌های غالب و کنتراست مشابه‌اند؟
زاویه دیدآیا ارتفاع و جهت دوربین درست است؟
سبکآیا زبان بصری خروجی با مرجع هماهنگ است؟
بافتآیا جنس سطوح طبیعی و مشابه دیده می‌شود؟
حال‌وهواآیا خروجی همان حس کلی را منتقل می‌کند؟

می‌توانید برای هر معیار امتیازی بین ۱ تا ۵ تعیین کنید. سپس فقط بخش‌هایی از پرامپت را اصلاح کنید که امتیاز پایینی گرفته‌اند.

چک‌لیست کیفیت پرامپت استخراج‌شده

قبل از استفاده نهایی، بررسی کنید:

  • سوژه اصلی دقیق توصیف شده است.
  • ویژگی‌های نامشخص اختراع نشده‌اند.
  • محیط و پس‌زمینه مشخص هستند.
  • محل سوژه در قاب تعیین شده است.
  • زاویه دید توضیح داده شده است.
  • جهت و کیفیت نور مشخص است.
  • رنگ‌های غالب ذکر شده‌اند.
  • سبک‌های متناقض در پرامپت وجود ندارند.
  • بافت و جنس عناصر مهم بیان شده‌اند.
  • حال‌وهوای تصویر مشخص است.
  • نسبت تصویر پیشنهادی ارائه شده است.
  • موارد تخمینی از مشاهدات جدا شده‌اند.
  • Negative Prompt با نیاز پروژه هماهنگ است.
  • پرامپت به مدل مقصد اشاره مستقیم و ضروری دارد.
  • جزئیات اضافی و بی‌اثر حذف شده‌اند.

اشتباهات رایج در تبدیل عکس به پرامپت

درخواست بیش از حد کوتاه

نوشتن جمله «پرامپت این عکس را بده» معمولاً خروجی عمومی ایجاد می‌کند. معیارهای تحلیل را صریحاً مشخص کنید.

انتظار بازیابی پرامپت اصلی

پرامپت تولیدشده یک بازسازی احتمالی است، نه نسخه اصلی مورد استفاده سازنده تصویر.

مشخص نکردن هدف

پرامپت مناسب برای بازسازی ترکیب‌بندی با پرامپت مناسب استخراج سبک یکسان نیست.

ترکیب چند سبک متناقض

استفاده هم‌زمان از عباراتی مانند فوتورئال، وکتور تخت، نقاشی آبرنگ و رندر سه‌بعدی می‌تواند نتیجه را غیرقابل پیش‌بینی کند.

اعتماد کامل به تنظیمات تخمینی دوربین

نوع دقیق لنز، دیافراگم یا تجهیزات نورپردازی معمولاً از روی یک تصویر قابل اثبات نیست.

نادیده گرفتن نسبت تصویر

نسبت تصویر روی ترکیب‌بندی اثر زیادی دارد. یک تصویر عمودی را نمی‌توان بدون تغییر جدی کادر در خروجی عریض بازسازی کرد.

درخواست بازسازی نوشته و لوگو

مدل‌های تولید تصویر ممکن است متن‌ها و لوگوها را اشتباه بسازند. بهتر است تصویر بدون متن تولید و نوشته نهایی در ابزار طراحی اضافه شود.

استفاده از تصویر بی‌کیفیت

مدل ممکن است نویز، فشرده‌سازی یا تاری تصویر را به‌عنوان ویژگی هنری تفسیر کند.

تولید فقط یک نسخه

همیشه چند نسخه با میزان جزئیات و اولویت‌های مختلف بسازید و نتیجه‌ها را مقایسه کنید.

ساخت ابزار تبدیل عکس به پرامپت با API درواره

اگر توسعه‌دهنده هستید، می‌توانید قابلیت Image to Prompt را به وب‌سایت، اپلیکیشن، سامانه تولید محتوا یا ابزار طراحی خود اضافه کنید.

درواره دسترسی یکپارچه به مدل‌های هوش مصنوعی را از طریق API سازگار با OpenAI فراهم می‌کند. برای این کار باید مدلی را انتخاب کنید که از ورودی تصویر یا قابلیت Vision پشتیبانی کند.

فهرست مدل‌ها، شناسه دقیق هر مدل و قیمت‌های به‌روز در صفحه مدل‌های درواره قابل مشاهده است.

جریان کلی سامانه

فرایند پیشنهادی چنین است:

  1. کاربر تصویر را بارگذاری می‌کند.
  2. نوع و اندازه فایل بررسی می‌شود.
  3. تصویر به URL یا Base64 تبدیل می‌شود.
  4. تصویر همراه با دستور تحلیل برای مدل چندوجهی ارسال می‌شود.
  5. مدل خروجی ساختاریافته تولید می‌کند.
  6. پرامپت فارسی و انگلیسی در ویرایشگر نمایش داده می‌شود.
  7. کاربر پرامپت را اصلاح می‌کند.
  8. پرامپت برای مدل تولید تصویر ارسال می‌شود.
  9. نتیجه با تصویر مرجع مقایسه می‌شود.

نمونه درخواست cURL

در نمونه زیر از یک آدرس عمومی تصویر استفاده شده است:

curl https://api.darvareh.ir/v1/chat/completions \
  -H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_MODEL_ID",
    "messages": [
      {
        "role": "system",
        "content": "You are a visual prompt engineer. Separate directly observed details from estimated details. Never invent names, brands, camera settings, or identities."
      },
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "این تصویر را تحلیل کن. سوژه، محیط، ترکیب‌بندی، زاویه دید، نور، رنگ، سبک، بافت و حال‌وهوا را استخراج کن. سپس یک پرامپت فارسی، یک پرامپت انگلیسی، Negative Prompt، نسبت تصویر احتمالی و سه نسخه جایگزین ارائه بده."
          },
          {
            "type": "image_url",
            "image_url": {
              "url": "https://example.com/reference-image.jpg"
            }
          }
        ]
      }
    ],
    "temperature": 0.2
  }'

مقدار YOUR_MODEL_ID را با شناسه یک مدل دارای قابلیت ورودی تصویر در درواره جایگزین کنید. پشتیبانی دقیق از تصویر، قالب ورودی و محدودیت حجم به مدل انتخاب‌شده بستگی دارد.

ارسال تصویر محلی با Python و Base64

برای ارسال یک فایل محلی می‌توانید آن را به Data URL تبدیل کنید.

ابتدا کتابخانه مورد نیاز را نصب کنید:

pip install requests

سپس کد زیر را اجرا کنید:

import base64
import json
import mimetypes
from pathlib import Path

import requests

API_URL = "https://api.darvareh.ir/v1/chat/completions"
API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"
IMAGE_PATH = Path("reference.jpg")


def image_to_data_url(path: Path) -> str:
    mime_type, _ = mimetypes.guess_type(path.name)

    if mime_type not in {"image/jpeg", "image/png", "image/webp"}:
        raise ValueError("فرمت تصویر باید JPEG، PNG یا WebP باشد.")

    encoded = base64.b64encode(path.read_bytes()).decode("utf-8")
    return f"data:{mime_type};base64,{encoded}"


data_url = image_to_data_url(IMAGE_PATH)

schema_instruction = """
خروجی را فقط به شکل یک JSON معتبر و بدون Markdown برگردان.

ساختار خروجی:
{
  "summary": "خلاصه تصویر",
  "observed_elements": ["ویژگی مشاهده‌شده"],
  "estimated_elements": ["ویژگی تخمینی"],
  "prompt_fa": "پرامپت کامل فارسی",
  "prompt_en": "پرامپت کامل انگلیسی",
  "negative_prompt": "مواردی که نباید تولید شوند",
  "aspect_ratio": "نسبت تصویر احتمالی",
  "variation_prompts": [
    "نسخه جایگزین اول",
    "نسخه جایگزین دوم",
    "نسخه جایگزین سوم"
  ],
  "uncertainties": ["موارد نامطمئن"]
}

ویژگی‌های تصویر را دقیق تحلیل کن.
نام شخص، برند، هنرمند، دوربین یا لنز را بدون شواهد قطعی اختراع نکن.
"""

payload = {
    "model": MODEL_ID,
    "messages": [
        {
            "role": "system",
            "content": (
                "تو متخصص تحلیل بصری و پرامپت‌نویسی تصویر هستی. "
                "میان مشاهدات مستقیم و تخمین‌ها تفاوت قائل شو."
            ),
        },
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": schema_instruction,
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": data_url,
                    },
                },
            ],
        },
    ],
    "temperature": 0.2,
}

response = requests.post(
    API_URL,
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json",
    },
    json=payload,
    timeout=120,
)

response.raise_for_status()

result = response.json()
content = result["choices"][0]["message"]["content"]

try:
    prompt_data = json.loads(content)
except json.JSONDecodeError as exc:
    raise ValueError("پاسخ مدل JSON معتبر نیست.") from exc

required_fields = {
    "summary",
    "observed_elements",
    "estimated_elements",
    "prompt_fa",
    "prompt_en",
    "negative_prompt",
    "aspect_ratio",
    "variation_prompts",
    "uncertainties",
}

missing_fields = required_fields - prompt_data.keys()

if missing_fields:
    raise ValueError(
        f"فیلدهای الزامی در پاسخ وجود ندارند: {sorted(missing_fields)}"
    )

print("پرامپت فارسی:")
print(prompt_data["prompt_fa"])

print("\nپرامپت انگلیسی:")
print(prompt_data["prompt_en"])

print("\nNegative Prompt:")
print(prompt_data["negative_prompt"])

چرا خروجی ساختاریافته بهتر است؟

اگر مدل فقط یک متن طولانی تولید کند، استفاده از نتیجه در نرم‌افزار دشوار می‌شود. خروجی JSON امکان می‌دهد:

  • پرامپت فارسی و انگلیسی جداگانه نمایش داده شوند.
  • مشاهدات از تخمین‌ها تفکیک شوند.
  • نسبت تصویر در یک فیلد مستقل قرار گیرد.
  • نسخه‌های جایگزین در رابط کاربری نمایش داده شوند.
  • نتیجه در پایگاه داده ذخیره شود.
  • پرامپت برای مدل تولید تصویر ارسال شود.
  • اعتبارسنجی خودکار انجام شود.

بااین‌حال، صرف درخواست JSON تضمین نمی‌کند همیشه JSON معتبر دریافت کنید. در برنامه واقعی باید پاسخ را اعتبارسنجی و در صورت نامعتبر بودن، درخواست اصلاح ارسال کنید.

مدیریت خطا در نسخه عملیاتی

سامانه واقعی باید خطاهای زیر را مدیریت کند:

  • فایل انتخاب نشده است.
  • فرمت تصویر پشتیبانی نمی‌شود.
  • فایل بیش از حد بزرگ است.
  • تصویر خراب یا ناقص است.
  • مدل انتخاب‌شده ورودی تصویر ندارد.
  • API در مهلت تعیین‌شده پاسخ نمی‌دهد.
  • پاسخ مدل JSON معتبر نیست.
  • فیلدهای ضروری در خروجی وجود ندارند.
  • تصویر فاقد سوژه یا جزئیات کافی است.

نمونه راهبرد ساده برای پاسخ نامعتبر:

def parse_model_json(content: str) -> dict:
    try:
        data = json.loads(content)
    except json.JSONDecodeError:
        return {
            "ok": False,
            "error": "invalid_json",
            "raw_content": content,
        }

    if not isinstance(data, dict):
        return {
            "ok": False,
            "error": "unexpected_response_type",
            "raw_content": content,
        }

    return {
        "ok": True,
        "data": data,
    }

در یک سرویس جدی بهتر است تلاش مجدد محدود، ثبت خطا و پیام قابل فهم برای کاربر نیز اضافه شود.

نکات بهینه‌سازی هزینه و سرعت

تصویر را بی‌دلیل با وضوح بسیار بالا ارسال نکنید

برای تحلیل سبک و ترکیب‌بندی معمولاً لازم نیست فایل اصلی چند ده مگابایتی ارسال شود. نسخه‌ای با وضوح منطقی تهیه کنید، اما آن‌قدر کوچک نباشد که جزئیات مهم از بین بروند.

تحلیل‌های تکراری را ذخیره کنید

اگر یک تصویر چند بار تحلیل می‌شود، نتیجه را بر اساس هش فایل ذخیره کنید تا درخواست تکراری به API ارسال نشود.

خروجی را مرحله‌بندی کنید

برای کاربردهای ساده، ابتدا تحلیل کوتاه بگیرید. فقط زمانی که کاربر نسخه حرفه‌ای می‌خواهد، تحلیل کامل، Negative Prompt و نسخه‌های جایگزین تولید کنید.

Temperature را پایین نگه دارید

برای استخراج مشخصات تصویر، مقدار پایین‌تر temperature معمولاً خروجی منظم‌تر و کم‌نوسان‌تری ایجاد می‌کند. برای ساخت نسخه‌های خلاقانه می‌توان مقدار را کمی افزایش داد.

فقط اطلاعات ضروری را درخواست کنید

اگر ابزار شما فقط برای عکس محصول ساخته شده است، نیازی نیست هر بار درباره سبک نقاشی یا رابط کاربری سؤال کنید.

ساخت رابط کاربری مناسب برای ابزار Image to Prompt

یک رابط کاربردی می‌تواند بخش‌های زیر را داشته باشد:

  • ناحیه بارگذاری تصویر
  • پیش‌نمایش تصویر
  • انتخاب نوع تصویر
  • انتخاب هدف تحلیل
  • سطح جزئیات
  • زبان خروجی
  • انتخاب مدل
  • دکمه استخراج پرامپت
  • ویرایشگر پرامپت فارسی
  • ویرایشگر پرامپت انگلیسی
  • بخش Negative Prompt
  • نمایش ویژگی‌های مشاهده‌شده
  • نمایش ویژگی‌های تخمینی
  • دکمه کپی
  • دکمه ساخت نسخه جایگزین
  • دکمه ارسال به مدل تولید تصویر

گزینه‌های پیشنهادی هدف

  • بازسازی نزدیک
  • استخراج سبک
  • تغییر سوژه
  • تغییر پس‌زمینه
  • ساخت تبلیغ محصول
  • تبدیل به تصویرسازی
  • تولید نسخه سینمایی
  • ساخت تصویر برای شبکه اجتماعی

این گزینه‌ها می‌توانند به‌صورت خودکار دستور مناسب را به پرامپت سیستمی اضافه کنند.

معماری پیشنهادی یک سرویس تبدیل تصویر به پرامپت

برای یک سرویس ساده می‌توان از ساختار زیر استفاده کرد:

  1. رابط وب تصویر را دریافت می‌کند.
  2. بک‌اند فایل را اعتبارسنجی می‌کند.
  3. نسخه بهینه‌شده‌ای از تصویر ساخته می‌شود.
  4. هش تصویر محاسبه می‌شود.
  5. کش برای نتیجه قبلی بررسی می‌شود.
  6. تصویر برای مدل چندوجهی ارسال می‌شود.
  7. JSON خروجی اعتبارسنجی می‌شود.
  8. نتیجه در پایگاه داده ذخیره می‌شود.
  9. پرامپت در ویرایشگر کاربر نمایش داده می‌شود.
  10. کاربر در صورت نیاز تصویر جدید تولید می‌کند.

برای پروژه‌های بزرگ‌تر می‌توان تحلیل تصویر و تولید تصویر را به دو سرویس جدا تبدیل کرد تا هر بخش مدل، محدودیت و مقیاس‌پذیری مستقل داشته باشد.

آیا می‌توان مدل سازنده تصویر را تشخیص داد؟

معمولاً نمی‌توان با اطمینان گفت یک تصویر دقیقاً با کدام مدل ساخته شده است.

برخی مدل‌ها ممکن است الگوهای بصری شناخته‌شده‌ای داشته باشند، اما عوامل زیادی نتیجه را تغییر می‌دهند:

  • نسخه مدل
  • پرامپت
  • تصویر مرجع
  • تنظیمات تولید
  • ویرایش دستی
  • افزایش وضوح
  • اصلاح رنگ
  • ترکیب چند تصویر
  • فشرده‌سازی نهایی

بنابراین اگر یک ابزار نام مدل را حدس می‌زند، نتیجه باید به‌عنوان احتمال نمایش داده شود، نه واقعیت قطعی.

آیا می‌توان Negative Prompt را از روی تصویر استخراج کرد؟

Negative Prompt اصلی قابل بازیابی نیست؛ زیرا عناصر حذف‌شده در تصویر دیده نمی‌شوند.

اما مدل می‌تواند بر اساس خطاهای رایج، Negative Prompt پیشنهادی بسازد. برای نمونه در عکاسی محصول:

distorted product, incorrect proportions, duplicate object,
random text, unreadable label, excessive glare,
unrealistic reflection, floating object, cluttered background,
low resolution, warped geometry

این بخش در واقع «پیشنهاد برای جلوگیری از خطا» است، نه استخراج دستور منفی اولیه.

ساخت پرامپت‌های مختلف از یک عکس

از یک تصویر مرجع می‌توان چند نوع پرامپت متفاوت استخراج کرد.

پرامپت بازسازی

تمرکز بر شباهت سوژه، کادر، نور، محیط و رنگ‌ها.

پرامپت سبک

تمرکز بر نور، رنگ، بافت، کنتراست و حس کلی بدون تکرار محتوا.

پرامپت ترکیب‌بندی

تمرکز بر محل عناصر، فضای منفی، زاویه دید و نسبت اندازه‌ها.

پرامپت تبلیغاتی

تمرکز بر نمایش محصول، فضای متن، حس برند و نور کنترل‌شده.

پرامپت خلاقانه

الهام از تصویر مرجع و ایجاد تغییرات آزاد در محیط، زمان، فصل یا رسانه هنری.

پرامپت فنی

شامل تخمین کادر، فاصله دوربین، عمق میدان، نسبت تصویر و ساختار نور.

بهتر است کاربر بتواند نوع پرامپت مورد نیازش را قبل از تحلیل انتخاب کند.

پرسش‌های متداول

آیا می‌توان پرامپت دقیق یک عکس را استخراج کرد؟

خیر. مدل هوش مصنوعی می‌تواند بر اساس ویژگی‌های قابل مشاهده، پرامپتی احتمالی تولید کند؛ اما متن اصلی پرامپت، Seed، مدل و تنظیمات تولید معمولاً قابل بازیابی نیستند.

بهترین روش برای تبدیل عکس به پرامپت چیست؟

از یک مدل چندوجهی استفاده کنید و به‌جای درخواست عمومی، از آن بخواهید سوژه، محیط، ترکیب‌بندی، نور، رنگ، سبک، بافت و موارد تخمینی را جداگانه تحلیل کند.

پرامپت فارسی بهتر است یا انگلیسی؟

به مدل مقصد بستگی دارد. بهتر است هر دو نسخه را تولید کنید و نتیجه آن‌ها را در شرایط یکسان مقایسه کنید.

چه عکس‌هایی نتیجه بهتری می‌دهند؟

تصاویر واضح، دارای سوژه مشخص، نور مناسب، فشرده‌سازی کم و کادر کامل معمولاً تحلیل دقیق‌تری دریافت می‌کنند.

آیا می‌توان از روی عکس، پرامپت مخصوص تولید تصویر ساخت؟

بله. می‌توانید از مدل بخواهید پرامپت را بر اساس قواعد و قالب مورد نیاز ابزار تولید تصویر مقصد تنظیم کند.

آیا امکان تشخیص لنز و تنظیمات دوربین وجود دارد؟

مدل می‌تواند برخی ویژگی‌ها را تخمین بزند، اما تشخیص دقیق لنز، دیافراگم یا تجهیزات نورپردازی از یک تصویر قطعی نیست.

آیا هوش مصنوعی می‌تواند Negative Prompt بسازد؟

بله. هوش مصنوعی می‌تواند بر اساس محتوای تصویر و خطاهای رایج، Negative Prompt پیشنهاد دهد؛ اما این خروجی لزوماً همان دستور منفی اولیه نیست.

چگونه عکس را از طریق API ارسال کنیم؟

می‌توانید تصویر را به‌صورت URL عمومی یا Data URL مبتنی بر Base64 در پیام چندوجهی ارسال کنید. مدل انتخاب‌شده باید از ورودی تصویر پشتیبانی کند.

هزینه استفاده از API چقدر است؟

هزینه به مدل انتخاب‌شده، اندازه ورودی، میزان پردازش و حجم خروجی وابسته است. برای مشاهده قیمت‌های جاری و Model ID مدل‌ها، صفحه مدل‌های درواره را بررسی کنید.

جمع‌بندی

تبدیل عکس به پرامپت با هوش مصنوعی راهی کاربردی برای تحلیل تصاویر، یادگیری پرامپت‌نویسی، استخراج سبک بصری و تولید تصاویر جدید است. بااین‌حال، نتیجه این فرایند پرامپت اصلی تصویر نیست؛ بلکه توصیفی دقیق و احتمالی از ویژگی‌های قابل مشاهده آن است.

برای رسیدن به خروجی حرفه‌ای باید:

  • هدف تحلیل را از ابتدا مشخص کنید.
  • مشاهدات را از تخمین‌ها جدا نگه دارید.
  • سوژه، محیط، ترکیب‌بندی، نور و رنگ را مستقل تحلیل کنید.
  • پرامپت فارسی و انگلیسی بسازید.
  • چند نسخه جایگزین آزمایش کنید.
  • خروجی را با تصویر مرجع مقایسه کنید.
  • فقط بخش‌های ضعیف پرامپت را اصلاح کنید.
  • انتظار بازسازی دقیق Seed یا پرامپت اصلی را نداشته باشید.

اگر قصد دارید ابزار تبدیل عکس به پرامپت، دستیار طراحی، سامانه تولید محتوای تصویری یا گردش‌کار خودکار بسازید، می‌توانید از API سازگار با OpenAI در درواره استفاده کنید. برای انتخاب یک مدل چندوجهی دارای قابلیت Vision و مشاهده شناسه و قیمت مدل‌ها، به صفحه مدل‌های درواره مراجعه کنید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.