تبدیل عکس به پرامپت با هوش مصنوعی؛ آموزش استخراج Prompt از روی تصویر
در این راهنمای عملی یاد میگیرید چگونه عکس دلخواه را با هوش مصنوعی تحلیل و به پرامپتی دقیق شامل سوژه، سبک، نور، رنگ، ترکیببندی و جزئیات فنی تبدیل کنید.
گاهی تصویری در اینترنت، شبکههای اجتماعی یا یک مجموعه طراحی میبینید و دوست دارید بدانید برای ساخت تصویری مشابه باید چه پرامپتی بنویسید. تشخیص سوژه آسان است، اما بازسازی دقیق نور، زاویه دوربین، ترکیببندی، رنگها، بافت، سبک هنری و حالوهوای تصویر به تجربه زیادی در پرامپتنویسی نیاز دارد.
ابزارهای تبدیل عکس به پرامپت با استفاده از مدلهای چندوجهی یا Multimodal میتوانند تصویر را تحلیل کنند و توضیحی ساختاریافته از عناصر بصری آن بسازند. این توضیح سپس به یک پرامپت قابل استفاده برای مدلهای تولید تصویر تبدیل میشود.
این فرایند با نامهای مختلفی شناخته میشود:
- تبدیل عکس به پرامپت
- استخراج پرامپت از تصویر
- Image to Prompt
- Reverse Prompt
- Prompt from Image
- تحلیل تصویر برای تولید عکس مشابه
در این راهنما یاد میگیرید چگونه یک تصویر را به پرامپتی حرفهای تبدیل کنید، خروجی را برای کاربردهای مختلف بهینه کنید و با استفاده از API درواره، ابزار خودکار استخراج پرامپت بسازید.
آیا میتوان پرامپت اصلی یک عکس را دقیقاً استخراج کرد؟
خیر. این نکته یکی از مهمترین محدودیتهای تبدیل عکس به پرامپت است.
یک تصویر معمولاً اطلاعات زیر را در خود نگه نمیدارد:
- متن دقیق پرامپت اولیه
- مدل مورد استفاده
- نسخه مدل
- Seed یا بذر تولید
- تنظیمات Sampler
- تعداد مراحل تولید
- مقدار Guidance
- تصویر مرجع اولیه
- ویرایشهای انجامشده پس از تولید
- دستورهای منفی یا Negative Prompt
مدل هوش مصنوعی نمیتواند پرامپت اصلی را از پیکسلهای تصویر بازیابی کند. کاری که انجام میدهد، مشاهده و تحلیل عناصر بصری و ساختن یک پرامپت احتمالی است.
بنابراین عبارت دقیقتر این است:
هوش مصنوعی پرامپت اصلی را بازیابی نمیکند؛ بلکه پرامپتی میسازد که میتواند تصویری با ویژگیهای مشابه تولید کند.
حتی اگر پرامپت، مدل و تنظیمات یکسان باشند، ممکن است تصویر جدید دقیقاً مانند تصویر مرجع نباشد. تولید تصویر ذاتاً فرایندی احتمالاتی است.
تبدیل عکس به پرامپت چگونه کار میکند؟
مدلهای چندوجهی میتوانند همزمان متن و تصویر را پردازش کنند. وقتی یک تصویر برای چنین مدلی ارسال میشود، مدل تلاش میکند ویژگیهای قابل مشاهده را به مفاهیم زبانی تبدیل کند.
یک سامانه مناسب Image to Prompt معمولاً مراحل زیر را طی میکند:
- دریافت تصویر
- تشخیص سوژههای اصلی
- تحلیل محیط و پسزمینه
- تشخیص سبک بصری
- تحلیل نور و رنگ
- بررسی ترکیببندی
- تخمین زاویه دوربین و نوع کادر
- شناسایی بافت و جنس سطوح
- تعیین حالوهوا
- تولید پرامپت فارسی و انگلیسی
- پیشنهاد Negative Prompt
- ساخت چند نسخه جایگزین
خروجی اولیه نباید فقط یک کپشن ساده مانند «یک بطری روی میز» باشد. یک پرامپت حرفهای باید جزئیات لازم برای بازسازی جهت هنری تصویر را نیز در اختیار مدل تولید تصویر قرار دهد.
تفاوت Image to Prompt با کپشننویسی، OCR و جستوجوی تصویری
این ابزارها همگی تصویر دریافت میکنند، اما هدف یکسانی ندارند.
| قابلیت | ورودی | خروجی | کاربرد اصلی |
|---|---|---|---|
| Image to Prompt | تصویر | پرامپت تولید تصویر | ساخت تصویر مشابه |
| Image Captioning | تصویر | توضیح کوتاه | توصیف محتوای عکس |
| OCR | تصویر حاوی نوشته | متن استخراجشده | تبدیل عکس نوشته به متن |
| Visual Search | تصویر | تصاویر یا محصولات مشابه | پیدا کردن نمونه مشابه |
| Image Classification | تصویر | دسته یا برچسب | تشخیص نوع تصویر |
| Object Detection | تصویر | اشیا و موقعیت آنها | تشخیص اجزای داخل تصویر |
برای مثال، کپشن یک تصویر ممکن است چنین باشد:
یک ساعت مچی روی سطح سنگی قرار دارد.
اما پرامپت حرفهای همان تصویر میتواند به این شکل نوشته شود:
عکاسی تبلیغاتی لوکس از یک ساعت مچی فلزی نقرهای روی سطح سنگ مرمر تیره، نورپردازی جانبی نرم و سینمایی، بازتاب کنترلشده روی بدنه، پسزمینه مشکی با گرادیان ظریف، عمق میدان کم، نمای نزدیک، جزئیات بسیار بالا و ترکیببندی مینیمال.
کاربردهای تبدیل عکس به پرامپت
یادگیری پرامپتنویسی تصویری
با مشاهده پرامپتی که برای یک عکس ساخته شده است، میتوانید بفهمید چه واژههایی برای توصیف نور، زاویه، سبک، رنگ و ترکیببندی مناسب هستند.
بازسازی سبک بصری
اگر به حالوهوای یک تصویر علاقه دارید، میتوانید ویژگیهای بصری آن را استخراج کنید و همان سبک کلی را روی سوژه دیگری به کار ببرید.
ساخت تصاویر محصول
یک فروشگاه اینترنتی میتواند تصویر تبلیغاتی موفق یک محصول را تحلیل کند و پرامپتی برای ساخت تصاویر هماهنگ از محصولات دیگر به دست آورد.
ایجاد هویت بصری هماهنگ
کسبوکارها میتوانند تصاویر برند خود را تحلیل و عناصر تکرارشوندهای مانند پالت رنگ، نور، نوع پسزمینه و ترکیببندی را استخراج کنند.
ساخت مودبرد
طراحان میتوانند مجموعهای از تصاویر مرجع را به توضیحات ساختاریافته تبدیل و از نتیجه برای طراحی مودبرد یا تعیین جهت هنری پروژه استفاده کنند.
تولید نسخههای جدید از یک ایده
بعد از استخراج پرامپت، میتوان سوژه، فصل، رنگ، محیط، زمان روز یا سبک تصویر را تغییر داد و نسخههای متنوعی ساخت.
مستندسازی تصاویر
توضیح ساختاریافته تصویر میتواند برای مدیریت آرشیو، برچسبگذاری محتوا، نوشتن متن جایگزین و جستوجوی داخلی نیز استفاده شود.
یک پرامپت تصویری حرفهای چه اجزایی دارد؟
برای استخراج پرامپت دقیق، بهتر است مدل هوش مصنوعی تصویر را در چند لایه تحلیل کند.
۱. سوژه اصلی
ابتدا باید مشخص شود مهمترین موضوع تصویر چیست:
- انسان
- محصول
- ساختمان
- غذا
- حیوان
- خودرو
- منظره
- رابط کاربری
- شیء تزئینی
- اثر هنری
توصیف سوژه باید شامل ویژگیهای قابل مشاهده باشد، نه حدسهای بدون پشتوانه.
۲. محیط و پسزمینه
مدل باید مشخص کند سوژه در چه محیطی قرار دارد:
- استودیوی عکاسی
- خیابان شهری
- طبیعت
- فضای اداری
- اتاق مینیمال
- پسزمینه ساده
- محیط صنعتی
- فضای تاریخی
- محیط علمیتخیلی
۳. ترکیببندی
ترکیببندی تعیین میکند عناصر چگونه در قاب قرار گرفتهاند:
- سوژه در مرکز
- قانون یکسوم
- تقارن
- فضای منفی زیاد
- ترکیببندی مورب
- نمای شلوغ
- قاببندی مینیمال
- نمای نزدیک
- نمای باز
۴. زاویه دید
زاویه دید اثر زیادی بر نتیجه دارد:
- روبهرو
- زاویه سهربع
- نمای بالا
- نمای پایین
- دید از سطح چشم
- نمای هوایی
- نمای ماکرو
- نمای ایزومتریک
- نمای روی شانه
۵. نورپردازی
عبارتهایی مانند «نور خوب» بیش از حد مبهم هستند. بهتر است نوع، جهت و کیفیت نور مشخص شود:
- نور نرم استودیویی
- نور جانبی
- نور پسزمینه
- نور پنجره
- نور طلوع
- نور غروب
- نور نئون
- نور پرکنتراست
- نور حجمی
- سایههای نرم
- سایههای عمیق
- بازتاب کنترلشده
۶. پالت رنگ
مدل باید رنگهای غالب و رابطه میان آنها را توضیح دهد:
- رنگهای گرم
- رنگهای سرد
- پالت تکرنگ
- رنگهای مکمل
- رنگهای خنثی
- اشباع کم
- کنتراست بالا
- رنگهای پاستلی
- ترکیب مشکی و طلایی
۷. سبک بصری
سبک میتواند عکاسی، تصویرسازی یا سهبعدی باشد:
- فوتورئال
- سینمایی
- مستند
- عکاسی تبلیغاتی
- نقاشی آبرنگ
- طراحی با مداد
- تصویرسازی وکتور
- سهبعدی
- سورئال
- مینیمال
- رترو
- سایبرپانک
- سبک تحریریه مجله
۸. بافت و جنس
در تصاویر محصول و معماری، جنس سطوح اهمیت زیادی دارد:
- فلز صیقلی
- شیشه شفاف
- چوب طبیعی
- پارچه مخمل
- سنگ مرمر
- بتن خام
- پلاستیک مات
- کاغذ بافتدار
- سطح براق
- سطح زبر
۹. حس و حال
تصویر ممکن است حس خاصی منتقل کند:
- آرام
- لوکس
- پرانرژی
- مرموز
- دوستانه
- حرفهای
- نوستالژیک
- آیندهنگر
- دراماتیک
- مینیمال
۱۰. مشخصات فنی احتمالی
مدل میتواند بعضی مشخصات فنی را تخمین بزند:
- نمای نزدیک یا Wide Shot
- عمق میدان کم
- بوکه نرم
- زاویه دید واید
- لنز تله
- نوردهی بلند
- نسبت تصویر
- وضوح بالا
این موارد معمولاً تخمینی هستند. از مدل بخواهید آنها را بهعنوان «احتمالی» علامتگذاری کند.
فرمول ساده برای ساخت پرامپت از روی عکس
میتوانید ساختار پرامپت را به این صورت در نظر بگیرید:
سوژه + محیط + ترکیببندی + زاویه دید + نورپردازی +
رنگها + سبک بصری + جنس و بافت + حالوهوا + کیفیت خروجی
نمونه:
یک فنجان سرامیکی سفید روی میز چوبی کنار پنجره،
ترکیببندی مینیمال با فضای منفی، نمای نزدیک از زاویه سهربع،
نور طبیعی نرم صبحگاهی، پالت رنگ گرم و خنثی،
عکاسی سبک زندگی، بافت واقعی چوب و سرامیک،
فضای آرام و صمیمی، جزئیات بالا و عمق میدان کم
این ساختار نقطه شروع مناسبی است، اما برای نتیجه دقیقتر باید آن را بر اساس نوع تصویر و مدل مقصد تغییر دهید.
آموزش گامبهگام تبدیل عکس به پرامپت
گام اول: تصویر مرجع مناسبی انتخاب کنید
تصویر مناسب ویژگیهای زیر را دارد:
- وضوح قابل قبول
- نور کافی
- سوژه مشخص
- فشردهسازی کم
- نبود واترمارک بزرگ
- کادر کامل
- رنگهای قابل تشخیص
اگر تصویر تار، بسیار کوچک یا بهشدت فشرده باشد، مدل ممکن است جزئیات را اشتباه تشخیص دهد.
گام دوم: هدف خود را مشخص کنید
قبل از ارسال تصویر، مشخص کنید با پرامپت چه کاری میخواهید انجام دهید:
- ساخت تصویری بسیار مشابه
- استخراج سبک
- حفظ ترکیببندی و تغییر سوژه
- حفظ سوژه و تغییر محیط
- ساخت تصویر تبلیغاتی
- ساخت نسخه سهبعدی
- تبدیل عکس به تصویرسازی
- تولید چند نسخه خلاقانه
هدف روی نوع خروجی اثر مستقیم دارد.
گام سوم: از مدل تحلیل ساختاریافته بخواهید
بهجای نوشتن «این عکس را به پرامپت تبدیل کن»، دقیقاً مشخص کنید چه اطلاعاتی نیاز دارید.
پرامپت پیشنهادی:
این تصویر را برای بازسازی با یک مدل تولید تصویر تحلیل کن.
موارد زیر را جداگانه استخراج کن:
1. سوژه اصلی و ویژگیهای قابل مشاهده
2. محیط و پسزمینه
3. ترکیببندی و محل قرارگیری عناصر
4. زاویه دوربین و نوع کادر
5. نورپردازی و جهت نور
6. رنگهای غالب
7. سبک بصری
8. جنس، بافت و جزئیات
9. حس و حال تصویر
10. نسبت تصویر احتمالی
مواردی را که مستقیماً دیده میشوند از موارد تخمینی جدا کن.
در پایان یک پرامپت فارسی، یک پرامپت انگلیسی و یک Negative Prompt ارائه بده.
هدف، ساخت تصویری با ترکیببندی و فضای بصری مشابه است.
گام چهارم: پرامپت استخراجشده را آزمایش کنید
پرامپت را در مدل تولید تصویر اجرا کنید. در اولین تلاش انتظار شباهت کامل نداشته باشید.
نتیجه را با تصویر مرجع از نظر موارد زیر مقایسه کنید:
- سوژه
- اندازه سوژه در قاب
- زاویه دید
- نور
- رنگها
- پسزمینه
- عمق میدان
- سبک
- جزئیات
گام پنجم: تفاوتها را به مدل بدهید
اگر نتیجه مناسب نبود، تفاوتها را بهصورت مشخص بیان کنید:
نتیجه تولیدشده با تصویر مرجع این تفاوتها را دارد:
- دوربین بیش از حد به سوژه نزدیک است.
- نور مرجع از سمت چپ میآید.
- پسزمینه باید تیرهتر باشد.
- سطح زیر محصول باید بازتاب ملایم داشته باشد.
- رنگهای تصویر مرجع اشباع کمتری دارند.
پرامپت را با حفظ سایر ویژگیها اصلاح کن.
گام ششم: چند نسخه جایگزین بسازید
بهجای دریافت یک پرامپت، از مدل بخواهید چند نسخه تولید کند:
- نسخه کوتاه
- نسخه جزئی و دقیق
- نسخه سینمایی
- نسخه فوتورئال
- نسخه مناسب تبلیغات
- نسخه خلاقانه
- نسخه با حفظ ترکیببندی
- نسخه با حفظ سبک و تغییر سوژه
مقایسه این نسخهها کمک میکند مناسبترین ساختار را برای مدل مقصد پیدا کنید.
پرامپت عمومی تبدیل عکس به Prompt
تصویر پیوستشده را مانند یک مدیر هنری و متخصص پرامپتنویسی تحلیل کن.
ابتدا فقط ویژگیهایی را بنویس که مستقیماً در تصویر دیده میشوند:
- سوژه
- محیط
- اجزای مهم
- ترکیببندی
- زاویه دید
- نوع کادر
- نورپردازی
- رنگها
- سبک
- بافتها
- حالوهوا
سپس موارد احتمالی مانند نوع لنز یا تکنیک نورپردازی را در بخشی جداگانه با برچسب «تخمینی» قرار بده.
در پایان ارائه کن:
1. پرامپت کامل فارسی
2. پرامپت کامل انگلیسی
3. پرامپت کوتاه
4. Negative Prompt
5. نسبت تصویر پیشنهادی
6. سه نسخه جایگزین
از نام بردن افراد واقعی یا هنرمندان خودداری کن و سبک را با ویژگیهای بصری قابل مشاهده توضیح بده.
پرامپت استخراجشده از عکس محصول
این تصویر محصول را برای ساخت یک عکس تبلیغاتی مشابه تحلیل کن.
اطلاعات زیر را استخراج کن:
- نوع محصول و شکل ظاهری
- رنگ و جنس بدنه
- زاویه محصول
- موقعیت محصول در قاب
- سطح زیر محصول
- نوع پسزمینه
- جهت و شدت نور اصلی
- نورهای مکمل
- بازتابها و سایهها
- عمق میدان
- پالت رنگ
- حس برند
- فضای خالی مناسب برای متن تبلیغاتی
سپس یک پرامپت فارسی و انگلیسی برای عکاسی تبلیغاتی محصول بنویس.
مشخصات برند، لوگو یا نوشتهای را که با اطمینان قابل تشخیص نیست، اختراع نکن.
یک Negative Prompt نیز برای جلوگیری از اعوجاج محصول، نوشتههای ناخوانا، انعکاس غیرطبیعی و پسزمینه شلوغ ارائه بده.
پرامپت استخراج Prompt از عکس پرتره
این تصویر پرتره را بدون حدس زدن هویت فرد تحلیل کن.
توصیف کن:
- نوع کادر
- زاویه صورت
- جهت نگاه
- حالت چهره
- مدل و جهت نور
- شدت سایهها
- رنگ پسزمینه
- فاصله احتمالی دوربین
- عمق میدان
- رنگبندی
- سبک عکاسی
- نوع پوشش بهصورت عمومی
- حس و حال تصویر
در پایان پرامپتی برای ساخت یک پرتره جدید با همین سبک، نور و ترکیببندی ارائه بده.
ویژگیهای هویتی فرد را بازسازی نکن و روی زبان بصری تصویر تمرکز داشته باش.
پرامپت تبدیل تصویر معماری به پرامپت
این تصویر معماری را تحلیل و آن را به یک پرامپت حرفهای تبدیل کن.
موارد زیر را مشخص کن:
- نوع ساختمان یا فضا
- سبک معماری
- فرم کلی بنا
- مصالح قابل مشاهده
- نسبت حجمها
- زاویه دید
- ارتفاع دوربین
- نوع پرسپکتیو
- محوطه و پوشش گیاهی
- زمان روز
- شرایط آسمان
- نور طبیعی و مصنوعی
- پالت رنگ
- میزان واقعگرایی رندر
- حضور یا نبود انسان و وسایل نقلیه
ابتدا یک تحلیل ساختاریافته بنویس و سپس پرامپت فارسی و انگلیسی ارائه بده.
در پایان یک نسخه روز، یک نسخه شب و یک نسخه با آبوهوای متفاوت تولید کن.
پرامپت تبدیل تصویر هنری به Prompt
این تصویر را از نظر زبان بصری و تکنیک هنری تحلیل کن.
بررسی کن:
- موضوع اصلی
- شیوه سادهسازی فرمها
- نوع خطوط
- بافت قلم یا سطح
- نحوه استفاده از رنگ
- میزان واقعگرایی
- ترکیببندی
- کنتراست
- فضای مثبت و منفی
- حس کلی اثر
- رسانه احتمالی مانند آبرنگ، مداد، رنگ روغن، چاپ دستی یا تصویرسازی دیجیتال
بهجای نسبت دادن اثر به یک هنرمند، ویژگیهای بصری قابل مشاهده را توصیف کن.
سپس پرامپتی بنویس که همین ویژگیهای عمومی را برای موضوعی جدید بازسازی کند.
پرامپت تحلیل اسکرینشات رابط کاربری
این اسکرینشات رابط کاربری را از دید یک طراح UI/UX تحلیل کن.
استخراج کن:
- نوع صفحه
- ساختار کلی
- سلسلهمراتب بصری
- ستونها و شبکهبندی
- فاصلهگذاری
- نوع کارتها
- جایگاه منوها
- دکمههای اصلی
- رنگهای غالب
- شکل آیکونها
- سبک تایپوگرافی
- حالت روشن یا تیره
- میزان گردی گوشهها
- استفاده از سایه و حاشیه
- رفتار احتمالی در موبایل
اطلاعات خصوصی، نامها، لوگوها و متنهای اختصاصی را بازسازی نکن.
در پایان یک پرامپت برای طراحی رابطی جدید با ساختار و زبان بصری مشابه ارائه بده.
حفظ ترکیببندی و تغییر سوژه
یکی از کاربردهای مهم Reverse Prompt این است که چیدمان تصویر حفظ شود، اما سوژه تغییر کند.
برای مثال، اگر تصویر مرجع شامل یک عطر روی سکوی سنگی باشد، میتوانید همان ترکیببندی را برای یک ساعت یا هدفون استفاده کنید.
ترکیببندی، زاویه دوربین، محل قرارگیری سوژه، نورپردازی،
پالت رنگ، نسبت فضای خالی و عمق میدان تصویر مرجع را حفظ کن.
سوژه اصلی را با یک هدفون بیسیم مشکی مات جایگزین کن.
تمام جزئیاتی را که مستقیماً به محصول قبلی مربوط هستند حذف کن.
پرامپت جدید باید مستقل باشد و به تصویر مرجع اشاره نکند.
حفظ سبک و تغییر کامل محتوا
گاهی هدف، حفظ ترکیببندی نیست و فقط سبک تصویر اهمیت دارد.
زبان بصری تصویر مرجع را استخراج کن:
نوع نور، رنگبندی، کنتراست، بافت، میزان واقعگرایی،
فضاسازی، کیفیت سایهها و حس کلی.
سپس همان زبان بصری را برای تصویر یک کافه مدرن در یک شب بارانی به کار ببر.
محتوا و ترکیببندی تصویر اصلی را تکرار نکن.
نمونه عملی: تبدیل عکس محصول به پرامپت
فرض کنید تصویر مرجع یک بطری شیشهای روی سطح مشکی براق است. نور باریکی از سمت چپ به محصول میتابد و پسزمینه دارای گرادیان خاکستری تیره است.
تحلیل ساختاریافته
مشاهدهشده:
- بطری شیشهای شفاف در مرکز قاب
- سطح مشکی با بازتاب ملایم
- پسزمینه تیره
- نور اصلی از سمت چپ
- کنتراست بالا
- فضای خالی در اطراف محصول
- ترکیببندی متقارن
تخمینی:
- استفاده از نور Strip Box
- لنز پرتره یا تله کوتاه
- عمق میدان متوسط
- عکاسی استودیویی تبلیغاتی
پرامپت فارسی نهایی
عکاسی تبلیغاتی لوکس از یک بطری شیشهای شفاف و مینیمال،
قرارگرفته در مرکز قاب روی سطح مشکی براق با بازتاب ظریف،
پسزمینه خاکستری بسیار تیره با گرادیان نرم،
نور باریک و کنترلشده از سمت چپ برای مشخص کردن لبههای شیشه،
نور مکمل بسیار ضعیف از راست، سایههای عمیق،
ترکیببندی متقارن، نمای روبهرو، کنتراست بالا،
فضای خالی کافی در اطراف محصول، جزئیات واقعی شیشه،
حالوهوای حرفهای و لوکس، عکاسی استودیویی با کیفیت بالا
پرامپت انگلیسی نهایی
Luxury studio product photography of a transparent minimalist glass bottle,
centered on a glossy black surface with a subtle reflection,
dark charcoal gradient background, narrow controlled rim light from the left,
very soft fill light from the right, deep clean shadows,
symmetrical front-facing composition, high contrast,
generous negative space around the product,
realistic glass material and refined commercial aesthetic,
high-detail professional advertising photography
Negative Prompt پیشنهادی
distorted bottle, asymmetrical shape, duplicate product, warped glass,
unreadable text, random logo, excessive reflections, harsh glare,
cluttered background, tilted composition, low resolution,
plastic appearance, floating object, unrealistic shadow
خروجی فارسی بهتر است یا انگلیسی؟
مدلهای جدید معمولاً زبان فارسی را درک میکنند، اما عملکرد مدلهای تولید تصویر در پردازش واژههای تخصصی انگلیسی ممکن است متفاوت باشد.
روش مناسب این است که هر دو نسخه را تولید و آزمایش کنید:
- نسخه فارسی برای خوانایی و ویرایش آسان
- نسخه انگلیسی برای استفاده مستقیم یا مقایسه نتیجه
- نسخه ترکیبی برای حفظ اصطلاحات تخصصی
نمونه ترکیبی:
عکاسی تبلیغاتی از یک ساعت لوکس،
soft side lighting، dark gradient background،
نمای نزدیک، shallow depth of field،
سطح سنگ مرمر مشکی با بازتاب کنترلشده،
minimal luxury composition، جزئیات بالا
بهترین زبان پرامپت به مدل مقصد بستگی دارد. نتیجه واقعی را با چند آزمایش مقایسه کنید.
پرامپت طولانی بهتر است یا کوتاه؟
طولانیتر بودن پرامپت همیشه به معنای بهتر بودن آن نیست.
پرامپت بیش از حد طولانی ممکن است:
- شامل جزئیات متناقض باشد
- اولویت سوژه اصلی را کاهش دهد
- مدل را میان چند سبک مختلف سردرگم کند
- کنترل و ویرایش نتیجه را دشوار کند
- جزئیات کماهمیت را بیش از حد برجسته کند
برای کار حرفهای، سه نسخه بسازید:
نسخه کوتاه
برای ایدهپردازی سریع و تولید تنوع زیاد.
نسخه استاندارد
شامل سوژه، محیط، نور، ترکیببندی، رنگ و سبک.
نسخه دقیق
برای پروژههایی که جنس، زاویه، نور و جزئیات فنی اهمیت زیادی دارند.
تفکیک ویژگیهای مشاهدهشده و تخمینی
یکی از مشکلات رایج تحلیل تصویر این است که مدل اطلاعاتی مانند نوع دوربین، لنز یا تنظیمات نور را با اطمینان بیان میکند؛ درحالیکه این جزئیات ممکن است از روی تصویر قابل اثبات نباشند.
از مدل بخواهید خروجی را به دو بخش تقسیم کند:
Observed:
مواردی که مستقیماً از تصویر قابل مشاهده هستند.
Estimated:
مواردی که بر اساس ظاهر تصویر تخمین زده شدهاند و قطعیت ندارند.
برای نمونه:
| ویژگی | وضعیت |
|---|---|
| نور از سمت چپ | مشاهدهشده |
| عمق میدان کم | مشاهدهشده |
| استفاده از لنز ۸۵ میلیمتری | تخمینی |
| استفاده از Softbox | تخمینی |
| پسزمینه خاکستری | مشاهدهشده |
| عکاسی در استودیو | احتمالاً تخمینی |
این تفکیک باعث میشود پرامپت نهایی دقیقتر و قابل اعتمادتر باشد.
چگونه پرامپت استخراجشده را ارزیابی کنیم؟
فقط خواندن پرامپت کافی نیست. باید تصویر تولیدشده با مرجع مقایسه شود.
| معیار | پرسش ارزیابی |
|---|---|
| شباهت محتوایی | آیا سوژهها و اجزای اصلی درست هستند؟ |
| ترکیببندی | آیا محل و اندازه عناصر مشابه است؟ |
| نورپردازی | آیا جهت، نرمی و شدت نور نزدیک است؟ |
| پالت رنگ | آیا رنگهای غالب و کنتراست مشابهاند؟ |
| زاویه دید | آیا ارتفاع و جهت دوربین درست است؟ |
| سبک | آیا زبان بصری خروجی با مرجع هماهنگ است؟ |
| بافت | آیا جنس سطوح طبیعی و مشابه دیده میشود؟ |
| حالوهوا | آیا خروجی همان حس کلی را منتقل میکند؟ |
میتوانید برای هر معیار امتیازی بین ۱ تا ۵ تعیین کنید. سپس فقط بخشهایی از پرامپت را اصلاح کنید که امتیاز پایینی گرفتهاند.
چکلیست کیفیت پرامپت استخراجشده
قبل از استفاده نهایی، بررسی کنید:
- سوژه اصلی دقیق توصیف شده است.
- ویژگیهای نامشخص اختراع نشدهاند.
- محیط و پسزمینه مشخص هستند.
- محل سوژه در قاب تعیین شده است.
- زاویه دید توضیح داده شده است.
- جهت و کیفیت نور مشخص است.
- رنگهای غالب ذکر شدهاند.
- سبکهای متناقض در پرامپت وجود ندارند.
- بافت و جنس عناصر مهم بیان شدهاند.
- حالوهوای تصویر مشخص است.
- نسبت تصویر پیشنهادی ارائه شده است.
- موارد تخمینی از مشاهدات جدا شدهاند.
- Negative Prompt با نیاز پروژه هماهنگ است.
- پرامپت به مدل مقصد اشاره مستقیم و ضروری دارد.
- جزئیات اضافی و بیاثر حذف شدهاند.
اشتباهات رایج در تبدیل عکس به پرامپت
درخواست بیش از حد کوتاه
نوشتن جمله «پرامپت این عکس را بده» معمولاً خروجی عمومی ایجاد میکند. معیارهای تحلیل را صریحاً مشخص کنید.
انتظار بازیابی پرامپت اصلی
پرامپت تولیدشده یک بازسازی احتمالی است، نه نسخه اصلی مورد استفاده سازنده تصویر.
مشخص نکردن هدف
پرامپت مناسب برای بازسازی ترکیببندی با پرامپت مناسب استخراج سبک یکسان نیست.
ترکیب چند سبک متناقض
استفاده همزمان از عباراتی مانند فوتورئال، وکتور تخت، نقاشی آبرنگ و رندر سهبعدی میتواند نتیجه را غیرقابل پیشبینی کند.
اعتماد کامل به تنظیمات تخمینی دوربین
نوع دقیق لنز، دیافراگم یا تجهیزات نورپردازی معمولاً از روی یک تصویر قابل اثبات نیست.
نادیده گرفتن نسبت تصویر
نسبت تصویر روی ترکیببندی اثر زیادی دارد. یک تصویر عمودی را نمیتوان بدون تغییر جدی کادر در خروجی عریض بازسازی کرد.
درخواست بازسازی نوشته و لوگو
مدلهای تولید تصویر ممکن است متنها و لوگوها را اشتباه بسازند. بهتر است تصویر بدون متن تولید و نوشته نهایی در ابزار طراحی اضافه شود.
استفاده از تصویر بیکیفیت
مدل ممکن است نویز، فشردهسازی یا تاری تصویر را بهعنوان ویژگی هنری تفسیر کند.
تولید فقط یک نسخه
همیشه چند نسخه با میزان جزئیات و اولویتهای مختلف بسازید و نتیجهها را مقایسه کنید.
ساخت ابزار تبدیل عکس به پرامپت با API درواره
اگر توسعهدهنده هستید، میتوانید قابلیت Image to Prompt را به وبسایت، اپلیکیشن، سامانه تولید محتوا یا ابزار طراحی خود اضافه کنید.
درواره دسترسی یکپارچه به مدلهای هوش مصنوعی را از طریق API سازگار با OpenAI فراهم میکند. برای این کار باید مدلی را انتخاب کنید که از ورودی تصویر یا قابلیت Vision پشتیبانی کند.
فهرست مدلها، شناسه دقیق هر مدل و قیمتهای بهروز در صفحه مدلهای درواره قابل مشاهده است.
جریان کلی سامانه
فرایند پیشنهادی چنین است:
- کاربر تصویر را بارگذاری میکند.
- نوع و اندازه فایل بررسی میشود.
- تصویر به URL یا Base64 تبدیل میشود.
- تصویر همراه با دستور تحلیل برای مدل چندوجهی ارسال میشود.
- مدل خروجی ساختاریافته تولید میکند.
- پرامپت فارسی و انگلیسی در ویرایشگر نمایش داده میشود.
- کاربر پرامپت را اصلاح میکند.
- پرامپت برای مدل تولید تصویر ارسال میشود.
- نتیجه با تصویر مرجع مقایسه میشود.
نمونه درخواست cURL
در نمونه زیر از یک آدرس عمومی تصویر استفاده شده است:
curl https://api.darvareh.ir/v1/chat/completions \
-H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "YOUR_MODEL_ID",
"messages": [
{
"role": "system",
"content": "You are a visual prompt engineer. Separate directly observed details from estimated details. Never invent names, brands, camera settings, or identities."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "این تصویر را تحلیل کن. سوژه، محیط، ترکیببندی، زاویه دید، نور، رنگ، سبک، بافت و حالوهوا را استخراج کن. سپس یک پرامپت فارسی، یک پرامپت انگلیسی، Negative Prompt، نسبت تصویر احتمالی و سه نسخه جایگزین ارائه بده."
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/reference-image.jpg"
}
}
]
}
],
"temperature": 0.2
}'
مقدار YOUR_MODEL_ID را با شناسه یک مدل دارای قابلیت ورودی تصویر در درواره جایگزین کنید. پشتیبانی دقیق از تصویر، قالب ورودی و محدودیت حجم به مدل انتخابشده بستگی دارد.
ارسال تصویر محلی با Python و Base64
برای ارسال یک فایل محلی میتوانید آن را به Data URL تبدیل کنید.
ابتدا کتابخانه مورد نیاز را نصب کنید:
pip install requests
سپس کد زیر را اجرا کنید:
import base64
import json
import mimetypes
from pathlib import Path
import requests
API_URL = "https://api.darvareh.ir/v1/chat/completions"
API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"
IMAGE_PATH = Path("reference.jpg")
def image_to_data_url(path: Path) -> str:
mime_type, _ = mimetypes.guess_type(path.name)
if mime_type not in {"image/jpeg", "image/png", "image/webp"}:
raise ValueError("فرمت تصویر باید JPEG، PNG یا WebP باشد.")
encoded = base64.b64encode(path.read_bytes()).decode("utf-8")
return f"data:{mime_type};base64,{encoded}"
data_url = image_to_data_url(IMAGE_PATH)
schema_instruction = """
خروجی را فقط به شکل یک JSON معتبر و بدون Markdown برگردان.
ساختار خروجی:
{
"summary": "خلاصه تصویر",
"observed_elements": ["ویژگی مشاهدهشده"],
"estimated_elements": ["ویژگی تخمینی"],
"prompt_fa": "پرامپت کامل فارسی",
"prompt_en": "پرامپت کامل انگلیسی",
"negative_prompt": "مواردی که نباید تولید شوند",
"aspect_ratio": "نسبت تصویر احتمالی",
"variation_prompts": [
"نسخه جایگزین اول",
"نسخه جایگزین دوم",
"نسخه جایگزین سوم"
],
"uncertainties": ["موارد نامطمئن"]
}
ویژگیهای تصویر را دقیق تحلیل کن.
نام شخص، برند، هنرمند، دوربین یا لنز را بدون شواهد قطعی اختراع نکن.
"""
payload = {
"model": MODEL_ID,
"messages": [
{
"role": "system",
"content": (
"تو متخصص تحلیل بصری و پرامپتنویسی تصویر هستی. "
"میان مشاهدات مستقیم و تخمینها تفاوت قائل شو."
),
},
{
"role": "user",
"content": [
{
"type": "text",
"text": schema_instruction,
},
{
"type": "image_url",
"image_url": {
"url": data_url,
},
},
],
},
],
"temperature": 0.2,
}
response = requests.post(
API_URL,
headers={
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json",
},
json=payload,
timeout=120,
)
response.raise_for_status()
result = response.json()
content = result["choices"][0]["message"]["content"]
try:
prompt_data = json.loads(content)
except json.JSONDecodeError as exc:
raise ValueError("پاسخ مدل JSON معتبر نیست.") from exc
required_fields = {
"summary",
"observed_elements",
"estimated_elements",
"prompt_fa",
"prompt_en",
"negative_prompt",
"aspect_ratio",
"variation_prompts",
"uncertainties",
}
missing_fields = required_fields - prompt_data.keys()
if missing_fields:
raise ValueError(
f"فیلدهای الزامی در پاسخ وجود ندارند: {sorted(missing_fields)}"
)
print("پرامپت فارسی:")
print(prompt_data["prompt_fa"])
print("\nپرامپت انگلیسی:")
print(prompt_data["prompt_en"])
print("\nNegative Prompt:")
print(prompt_data["negative_prompt"])
چرا خروجی ساختاریافته بهتر است؟
اگر مدل فقط یک متن طولانی تولید کند، استفاده از نتیجه در نرمافزار دشوار میشود. خروجی JSON امکان میدهد:
- پرامپت فارسی و انگلیسی جداگانه نمایش داده شوند.
- مشاهدات از تخمینها تفکیک شوند.
- نسبت تصویر در یک فیلد مستقل قرار گیرد.
- نسخههای جایگزین در رابط کاربری نمایش داده شوند.
- نتیجه در پایگاه داده ذخیره شود.
- پرامپت برای مدل تولید تصویر ارسال شود.
- اعتبارسنجی خودکار انجام شود.
بااینحال، صرف درخواست JSON تضمین نمیکند همیشه JSON معتبر دریافت کنید. در برنامه واقعی باید پاسخ را اعتبارسنجی و در صورت نامعتبر بودن، درخواست اصلاح ارسال کنید.
مدیریت خطا در نسخه عملیاتی
سامانه واقعی باید خطاهای زیر را مدیریت کند:
- فایل انتخاب نشده است.
- فرمت تصویر پشتیبانی نمیشود.
- فایل بیش از حد بزرگ است.
- تصویر خراب یا ناقص است.
- مدل انتخابشده ورودی تصویر ندارد.
- API در مهلت تعیینشده پاسخ نمیدهد.
- پاسخ مدل JSON معتبر نیست.
- فیلدهای ضروری در خروجی وجود ندارند.
- تصویر فاقد سوژه یا جزئیات کافی است.
نمونه راهبرد ساده برای پاسخ نامعتبر:
def parse_model_json(content: str) -> dict:
try:
data = json.loads(content)
except json.JSONDecodeError:
return {
"ok": False,
"error": "invalid_json",
"raw_content": content,
}
if not isinstance(data, dict):
return {
"ok": False,
"error": "unexpected_response_type",
"raw_content": content,
}
return {
"ok": True,
"data": data,
}
در یک سرویس جدی بهتر است تلاش مجدد محدود، ثبت خطا و پیام قابل فهم برای کاربر نیز اضافه شود.
نکات بهینهسازی هزینه و سرعت
تصویر را بیدلیل با وضوح بسیار بالا ارسال نکنید
برای تحلیل سبک و ترکیببندی معمولاً لازم نیست فایل اصلی چند ده مگابایتی ارسال شود. نسخهای با وضوح منطقی تهیه کنید، اما آنقدر کوچک نباشد که جزئیات مهم از بین بروند.
تحلیلهای تکراری را ذخیره کنید
اگر یک تصویر چند بار تحلیل میشود، نتیجه را بر اساس هش فایل ذخیره کنید تا درخواست تکراری به API ارسال نشود.
خروجی را مرحلهبندی کنید
برای کاربردهای ساده، ابتدا تحلیل کوتاه بگیرید. فقط زمانی که کاربر نسخه حرفهای میخواهد، تحلیل کامل، Negative Prompt و نسخههای جایگزین تولید کنید.
Temperature را پایین نگه دارید
برای استخراج مشخصات تصویر، مقدار پایینتر temperature معمولاً خروجی منظمتر و کمنوسانتری ایجاد میکند. برای ساخت نسخههای خلاقانه میتوان مقدار را کمی افزایش داد.
فقط اطلاعات ضروری را درخواست کنید
اگر ابزار شما فقط برای عکس محصول ساخته شده است، نیازی نیست هر بار درباره سبک نقاشی یا رابط کاربری سؤال کنید.
ساخت رابط کاربری مناسب برای ابزار Image to Prompt
یک رابط کاربردی میتواند بخشهای زیر را داشته باشد:
- ناحیه بارگذاری تصویر
- پیشنمایش تصویر
- انتخاب نوع تصویر
- انتخاب هدف تحلیل
- سطح جزئیات
- زبان خروجی
- انتخاب مدل
- دکمه استخراج پرامپت
- ویرایشگر پرامپت فارسی
- ویرایشگر پرامپت انگلیسی
- بخش Negative Prompt
- نمایش ویژگیهای مشاهدهشده
- نمایش ویژگیهای تخمینی
- دکمه کپی
- دکمه ساخت نسخه جایگزین
- دکمه ارسال به مدل تولید تصویر
گزینههای پیشنهادی هدف
- بازسازی نزدیک
- استخراج سبک
- تغییر سوژه
- تغییر پسزمینه
- ساخت تبلیغ محصول
- تبدیل به تصویرسازی
- تولید نسخه سینمایی
- ساخت تصویر برای شبکه اجتماعی
این گزینهها میتوانند بهصورت خودکار دستور مناسب را به پرامپت سیستمی اضافه کنند.
معماری پیشنهادی یک سرویس تبدیل تصویر به پرامپت
برای یک سرویس ساده میتوان از ساختار زیر استفاده کرد:
- رابط وب تصویر را دریافت میکند.
- بکاند فایل را اعتبارسنجی میکند.
- نسخه بهینهشدهای از تصویر ساخته میشود.
- هش تصویر محاسبه میشود.
- کش برای نتیجه قبلی بررسی میشود.
- تصویر برای مدل چندوجهی ارسال میشود.
- JSON خروجی اعتبارسنجی میشود.
- نتیجه در پایگاه داده ذخیره میشود.
- پرامپت در ویرایشگر کاربر نمایش داده میشود.
- کاربر در صورت نیاز تصویر جدید تولید میکند.
برای پروژههای بزرگتر میتوان تحلیل تصویر و تولید تصویر را به دو سرویس جدا تبدیل کرد تا هر بخش مدل، محدودیت و مقیاسپذیری مستقل داشته باشد.
آیا میتوان مدل سازنده تصویر را تشخیص داد؟
معمولاً نمیتوان با اطمینان گفت یک تصویر دقیقاً با کدام مدل ساخته شده است.
برخی مدلها ممکن است الگوهای بصری شناختهشدهای داشته باشند، اما عوامل زیادی نتیجه را تغییر میدهند:
- نسخه مدل
- پرامپت
- تصویر مرجع
- تنظیمات تولید
- ویرایش دستی
- افزایش وضوح
- اصلاح رنگ
- ترکیب چند تصویر
- فشردهسازی نهایی
بنابراین اگر یک ابزار نام مدل را حدس میزند، نتیجه باید بهعنوان احتمال نمایش داده شود، نه واقعیت قطعی.
آیا میتوان Negative Prompt را از روی تصویر استخراج کرد؟
Negative Prompt اصلی قابل بازیابی نیست؛ زیرا عناصر حذفشده در تصویر دیده نمیشوند.
اما مدل میتواند بر اساس خطاهای رایج، Negative Prompt پیشنهادی بسازد. برای نمونه در عکاسی محصول:
distorted product, incorrect proportions, duplicate object,
random text, unreadable label, excessive glare,
unrealistic reflection, floating object, cluttered background,
low resolution, warped geometry
این بخش در واقع «پیشنهاد برای جلوگیری از خطا» است، نه استخراج دستور منفی اولیه.
ساخت پرامپتهای مختلف از یک عکس
از یک تصویر مرجع میتوان چند نوع پرامپت متفاوت استخراج کرد.
پرامپت بازسازی
تمرکز بر شباهت سوژه، کادر، نور، محیط و رنگها.
پرامپت سبک
تمرکز بر نور، رنگ، بافت، کنتراست و حس کلی بدون تکرار محتوا.
پرامپت ترکیببندی
تمرکز بر محل عناصر، فضای منفی، زاویه دید و نسبت اندازهها.
پرامپت تبلیغاتی
تمرکز بر نمایش محصول، فضای متن، حس برند و نور کنترلشده.
پرامپت خلاقانه
الهام از تصویر مرجع و ایجاد تغییرات آزاد در محیط، زمان، فصل یا رسانه هنری.
پرامپت فنی
شامل تخمین کادر، فاصله دوربین، عمق میدان، نسبت تصویر و ساختار نور.
بهتر است کاربر بتواند نوع پرامپت مورد نیازش را قبل از تحلیل انتخاب کند.
پرسشهای متداول
آیا میتوان پرامپت دقیق یک عکس را استخراج کرد؟
خیر. مدل هوش مصنوعی میتواند بر اساس ویژگیهای قابل مشاهده، پرامپتی احتمالی تولید کند؛ اما متن اصلی پرامپت، Seed، مدل و تنظیمات تولید معمولاً قابل بازیابی نیستند.
بهترین روش برای تبدیل عکس به پرامپت چیست؟
از یک مدل چندوجهی استفاده کنید و بهجای درخواست عمومی، از آن بخواهید سوژه، محیط، ترکیببندی، نور، رنگ، سبک، بافت و موارد تخمینی را جداگانه تحلیل کند.
پرامپت فارسی بهتر است یا انگلیسی؟
به مدل مقصد بستگی دارد. بهتر است هر دو نسخه را تولید کنید و نتیجه آنها را در شرایط یکسان مقایسه کنید.
چه عکسهایی نتیجه بهتری میدهند؟
تصاویر واضح، دارای سوژه مشخص، نور مناسب، فشردهسازی کم و کادر کامل معمولاً تحلیل دقیقتری دریافت میکنند.
آیا میتوان از روی عکس، پرامپت مخصوص تولید تصویر ساخت؟
بله. میتوانید از مدل بخواهید پرامپت را بر اساس قواعد و قالب مورد نیاز ابزار تولید تصویر مقصد تنظیم کند.
آیا امکان تشخیص لنز و تنظیمات دوربین وجود دارد؟
مدل میتواند برخی ویژگیها را تخمین بزند، اما تشخیص دقیق لنز، دیافراگم یا تجهیزات نورپردازی از یک تصویر قطعی نیست.
آیا هوش مصنوعی میتواند Negative Prompt بسازد؟
بله. هوش مصنوعی میتواند بر اساس محتوای تصویر و خطاهای رایج، Negative Prompt پیشنهاد دهد؛ اما این خروجی لزوماً همان دستور منفی اولیه نیست.
چگونه عکس را از طریق API ارسال کنیم؟
میتوانید تصویر را بهصورت URL عمومی یا Data URL مبتنی بر Base64 در پیام چندوجهی ارسال کنید. مدل انتخابشده باید از ورودی تصویر پشتیبانی کند.
هزینه استفاده از API چقدر است؟
هزینه به مدل انتخابشده، اندازه ورودی، میزان پردازش و حجم خروجی وابسته است. برای مشاهده قیمتهای جاری و Model ID مدلها، صفحه مدلهای درواره را بررسی کنید.
جمعبندی
تبدیل عکس به پرامپت با هوش مصنوعی راهی کاربردی برای تحلیل تصاویر، یادگیری پرامپتنویسی، استخراج سبک بصری و تولید تصاویر جدید است. بااینحال، نتیجه این فرایند پرامپت اصلی تصویر نیست؛ بلکه توصیفی دقیق و احتمالی از ویژگیهای قابل مشاهده آن است.
برای رسیدن به خروجی حرفهای باید:
- هدف تحلیل را از ابتدا مشخص کنید.
- مشاهدات را از تخمینها جدا نگه دارید.
- سوژه، محیط، ترکیببندی، نور و رنگ را مستقل تحلیل کنید.
- پرامپت فارسی و انگلیسی بسازید.
- چند نسخه جایگزین آزمایش کنید.
- خروجی را با تصویر مرجع مقایسه کنید.
- فقط بخشهای ضعیف پرامپت را اصلاح کنید.
- انتظار بازسازی دقیق Seed یا پرامپت اصلی را نداشته باشید.
اگر قصد دارید ابزار تبدیل عکس به پرامپت، دستیار طراحی، سامانه تولید محتوای تصویری یا گردشکار خودکار بسازید، میتوانید از API سازگار با OpenAI در درواره استفاده کنید. برای انتخاب یک مدل چندوجهی دارای قابلیت Vision و مشاهده شناسه و قیمت مدلها، به صفحه مدلهای درواره مراجعه کنید.
مقالات مرتبط
- آموزش جامع پرامپتنویسی و Prompt Engineering
- بهترین ابزارهای ساخت تصویر با هوش مصنوعی
- آموزش API تولید تصویر در درواره
- آموزش API چندوجهی و ارسال تصویر به مدلهای Vision
- آموزش کامل ویرایش عکس با هوش مصنوعی
- آموزش ساخت کاراکتر ثابت با هوش مصنوعی
- آموزش تولید تصویر با Gemini Nano Banana
- تبدیل عکس به وکتور با هوش مصنوعی
برای مطالعه شرایط استفاده و محدودیتهای مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.