GPT Image 2 چیست؟ آموزش کامل تولید و ویرایش تصویر با API درواره

GPT Image 2 مدل پیشرفته تولید و ویرایش تصویر برای ساخت عکس از متن، بازطراحی تصاویر و حفظ دقیق جزئیات ورودی است. در این راهنما استفاده عملی از API آن در درواره را آموزش می‌دهیم.

Share
GPT Image 2 چیست؟ آموزش کامل تولید و ویرایش تصویر با API درواره

مقدمه

تولید تصویر با هوش مصنوعی از ساخت عکس‌های سرگرم‌کننده فراتر رفته و به یکی از قابلیت‌های اصلی نرم‌افزارهای طراحی، فروشگاه‌های اینترنتی، پلتفرم‌های تولید محتوا و ابزارهای بازاریابی تبدیل شده است.

امروزه کسب‌وکارها می‌خواهند قابلیت‌هایی مانند موارد زیر را مستقیماً داخل محصولات خود قرار دهند:

  • ساخت تصویر از توضیح متنی
  • ویرایش عکس با دستور فارسی
  • تغییر پس‌زمینه محصول
  • تولید چند نسخه تبلیغاتی
  • ساخت تصویر شبکه‌های اجتماعی
  • بازطراحی فضای داخلی
  • ایجاد Mockup محصول
  • تغییر رنگ یا جنس یک شیء
  • حذف یا جایگزینی عناصر تصویر
  • تولید تصویر با نسبت ابعاد مختلف
  • حفظ ظاهر سوژه هنگام ویرایش
  • تولید تصویر دارای نوشته

GPT Image 2 یک مدل تخصصی برای تولید و ویرایش تصویر است که می‌تواند متن و تصویر را به‌عنوان ورودی دریافت کرده و تصویر جدیدی تولید کند. این مدل برای سرعت، کیفیت بالا، پیروی بهتر از دستور و استفاده از ورودی تصویری با Fidelity بالا طراحی شده است.

در این مقاله بررسی می‌کنیم:

  • GPT Image 2 چیست؟
  • چه تفاوتی با مدل‌های متنی دارد؟
  • چه کاربردهایی دارد؟
  • چگونه یک Prompt تصویری حرفه‌ای بنویسیم؟
  • چگونه با API درواره تصویر تولید کنیم؟
  • چگونه یک تصویر موجود را ویرایش کنیم؟
  • چگونه فایل Base64 را ذخیره کنیم؟
  • معماری مناسب یک سرویس تولید تصویر چیست؟
  • چگونه هزینه، کیفیت و زمان تولید را کنترل کنیم؟

GPT Image 2 چیست؟

GPT Image 2 یک مدل تخصصی تولید و ویرایش تصویر است. این مدل می‌تواند از توضیح متنی، تصویر ورودی یا ترکیب هر دو برای ساخت خروجی تصویری استفاده کند.

برخلاف مدل‌های زبانی که پاسخ متنی تولید می‌کنند، خروجی اصلی GPT Image 2 تصویر است. ورودی آن می‌تواند شامل موارد زیر باشد:

  • یک Prompt متنی
  • یک یا چند دستور ویرایشی
  • تصویر مرجع
  • توضیح سبک بصری
  • نسبت و اندازه موردنظر
  • سطح کیفیت
  • جزئیات مربوط به ترکیب‌بندی
  • محدودیت‌های مربوط به عناصر ثابت

طبق مستندات رسمی، GPT Image 2 برای تولید و ویرایش سریع تصاویر باکیفیت طراحی شده و از اندازه‌های انعطاف‌پذیر و ورودی‌های تصویری با حفظ جزئیات بالا پشتیبانی می‌کند. مستندات رسمی GPT Image 2

مشخصات اصلی GPT Image 2

مشخصهتوضیح
نوع مدلتولید و ویرایش تصویر
دسته‌بندیImage Generation و Image Editing
ورودی متنیپشتیبانی می‌شود
ورودی تصویریپشتیبانی می‌شود
خروجی تصویریپشتیبانی می‌شود
ورودی صوتیپشتیبانی نمی‌شود
خروجی ویدئوییپشتیبانی نمی‌شود
تولید تصویر از متنپشتیبانی می‌شود
ویرایش تصویرپشتیبانی می‌شود
اندازه‌های منعطفپشتیبانی می‌شود
حفظ جزئیات تصویر ورودیپشتیبانی می‌شود
Streamingپشتیبانی نمی‌شود
Function Callingپشتیبانی نمی‌شود
Fine-tuningپشتیبانی نمی‌شود
Model ID دروارهدر صفحه مدل‌های درواره بررسی شود

برای دریافت Model ID درواره، قیمت به‌روز، محدودیت‌ها و وضعیت دسترسی مدل به صفحه مدل‌های درواره مراجعه کنید.

GPT Image 2 چه تفاوتی با مدل متنی دارد؟

مدل‌های متنی مانند GPT یا Claude معمولاً متن دریافت می‌کنند و متن تولید می‌کنند. GPT Image 2 برای تولید پیکسل و تصویر طراحی شده است.

قابلیتمدل متنیGPT Image 2
پاسخ متنیقابلیت اصلیقابلیت اصلی نیست
تولید تصویرمعمولاً از طریق ابزار خارجیقابلیت اصلی
ویرایش تصویرمحدود یا غیرمستقیمقابلیت اصلی
ورودی عکسبرای تحلیلبرای تحلیل و بازتولید تصویری
Tool Callingممکن است پشتیبانی شودپشتیبانی نمی‌شود
Structured Outputممکن است پشتیبانی شودپشتیبانی نمی‌شود
خروجی Base64معمولاً خیربله، بسته به API
استفاده اصلیگفت‌وگو و پردازش متنساخت و ویرایش تصویر

در یک محصول کامل می‌توان مدل متنی و تصویری را با یکدیگر ترکیب کرد. مدل متنی درخواست کاربر را تحلیل و Prompt تصویری بهینه تولید می‌کند؛ سپس GPT Image 2 تصویر را می‌سازد.

مهم‌ترین قابلیت‌های GPT Image 2

تولید تصویر از متن

در Text to Image، کاربر یک توضیح متنی می‌نویسد و مدل بر اساس آن تصویر می‌سازد.

مثال:

یک تصویر تبلیغاتی مینیمال از یک فنجان قهوه ایرانی روی میز چوبی تیره،
نور گرم صبحگاهی از سمت چپ، پس‌زمینه محو، عکاسی حرفه‌ای محصول،
فضای خالی کافی در سمت راست برای قرار دادن تیتر تبلیغاتی

هرچه Prompt درباره موضوع، سبک، نور، زاویه دوربین و ترکیب‌بندی دقیق‌تر باشد، کنترل بیشتری روی نتیجه خواهید داشت.

ویرایش تصویر با دستور متنی

می‌توان یک تصویر موجود را همراه دستور متنی ارسال کرد:

پس‌زمینه تصویر را به یک استودیوی مینیمال خاکستری روشن تغییر بده.
محصول، لوگو، رنگ محصول، زاویه دوربین و سایه اصلی بدون تغییر باقی بمانند.

در ویرایش تصویر، مشخص‌کردن عناصر ثابت بسیار مهم است. اگر فقط بنویسید «پس‌زمینه را عوض کن»، ممکن است مدل جزئیات دیگری را نیز بازتولید کند.

حفظ جزئیات تصویر ورودی

High-Fidelity Image Input برای کاربردهایی مهم است که باید جزئیات تصویر مرجع تا حد ممکن حفظ شوند، مانند:

  • ظاهر محصول
  • بسته‌بندی
  • رنگ برند
  • ترکیب‌بندی
  • چهره یا سوژه
  • نورپردازی
  • نوشته‌های روی محصول
  • عناصر ثابت محیط

هیچ مدل مولد تصویری تضمین نمی‌کند تمام جزئیات در همه خروجی‌ها دقیقاً بدون تغییر باقی بمانند. برای کاربردهای حساس باید خروجی‌ها بازبینی و با ورودی مقایسه شوند.

تغییر سبک تصویر

GPT Image 2 می‌تواند یک تصویر را با سبک جدید بازطراحی کند:

  • عکاسی واقع‌گرایانه
  • تصویرسازی Editorial
  • سبک سه‌بعدی
  • مینیمال
  • آبرنگ
  • نقاشی دیجیتال
  • Isometric
  • Line Art
  • پوستر مدرن
  • فضای سینمایی
  • تصویرسازی کودک
  • Collage

مثال:

این تصویر را به یک Illustration سه‌بعدی مینیمال تبدیل کن.
ساختار اصلی صحنه، جای عناصر و رنگ سازمانی بنفش حفظ شوند.
نور نرم استودیویی و پس‌زمینه سرمه‌ای تیره باشد.

تولید تصاویر دارای متن

یکی از کاربردهای مهم مدل‌های جدید تصویر، قراردادن نوشته در تصویر است. برای افزایش دقت، متن باید کاملاً مشخص و کوتاه باشد.

مثال:

یک پوستر مینیمال فارسی طراحی کن.

متن اصلی دقیقاً:
«آینده از اینجا شروع می‌شود»

هیچ متن دیگری در تصویر قرار نده.
متن باید خوانا، راست‌چین و در سمت راست تصویر باشد.

با وجود پیشرفت مدل‌ها، نوشته‌های فارسی باید پس از تولید بررسی شوند. برای پروژه‌هایی که تایپوگرافی کاملاً دقیق لازم دارند، بهتر است مدل پس‌زمینه و عناصر بصری را بسازد و متن نهایی با ابزار طراحی یا برنامه به تصویر اضافه شود.

تغییر نسبت ابعاد و ترکیب‌بندی

یک تصویر مناسب وب‌سایت ممکن است برای Instagram، Story یا بنر تبلیغاتی قابل استفاده نباشد.

با GPT Image 2 می‌توان خروجی‌هایی برای قالب‌های مختلف تولید کرد:

  • مربع برای پست شبکه اجتماعی
  • عمودی برای Story و Reel
  • افقی برای کاور وبلاگ
  • بنر عریض برای وب‌سایت
  • تصویر محصول
  • Thumbnail
  • تبلیغات نمایشی

در Prompt فقط نسبت را مشخص نکنید؛ محل قرارگیری سوژه و فضای خالی را نیز توضیح دهید.

مثال:

تصویر افقی 16:9 برای کاور مقاله تولید کن.
سوژه اصلی در یک‌سوم چپ قرار بگیرد.
سمت راست تصویر حداقل 35 درصد فضای خلوت و تیره برای عنوان فارسی داشته باشد.
هیچ نوشته‌ای داخل تصویر تولید نکن.

کاربردهای GPT Image 2 برای کسب‌وکارها

فروشگاه اینترنتی

فروشگاه‌ها می‌توانند از API تولید تصویر برای این موارد استفاده کنند:

  • تغییر پس‌زمینه محصول
  • ساخت تصویر Lifestyle
  • قرار دادن محصول در محیط‌های مختلف
  • تولید نسخه مناسب شبکه اجتماعی
  • ساخت بنر کمپین
  • تغییر رنگ محصول
  • ایجاد Mockup
  • تولید تصاویر دسته‌بندی

تصویر محصول نباید ویژگی‌ای را نمایش دهد که محصول واقعی فاقد آن است. بهتر است تصاویر مولد تبلیغاتی از تصاویر مستند محصول تفکیک شوند.

پلتفرم تولید محتوا

یک ابزار تولید محتوا می‌تواند به کاربر اجازه دهد:

  1. موضوع را وارد کند.
  2. سبک بصری را انتخاب کند.
  3. نسبت ابعاد را تعیین کند.
  4. رنگ برند را مشخص کند.
  5. چند خروجی دریافت کند.
  6. خروجی موردنظر را ویرایش کند.
  7. فایل نهایی را دانلود کند.

تبلیغات و بازاریابی

برای هر کمپین می‌توان چند Variation ایجاد کرد:

  • زاویه دوربین متفاوت
  • رنگ‌بندی متفاوت
  • سوژه متفاوت
  • نسخه روشن و تیره
  • فضای خالی در سمت چپ یا راست
  • نسخه مناسب موبایل
  • نسخه مناسب Desktop

طراحی داخلی

کاربر می‌تواند تصویر اتاق را ارسال کند و تغییرات موردنظر را توضیح دهد:

چیدمان اصلی اتاق و محل پنجره‌ها حفظ شود.
مبلمان به سبک Modern Minimal تغییر کند.
رنگ دیوارها سفید گرم، کف‌پوش چوب بلوط روشن و نور عصرگاهی باشد.

تولید تصویر مقاله

سیستم مدیریت محتوا می‌تواند بر اساس عنوان و خلاصه مقاله، تصویر کاور پیشنهاد دهد. بهتر است قالب برند به Prompt ثابت تبدیل شود:

  • پالت رنگ
  • محل سوژه
  • فضای عنوان
  • سبک تصویرسازی
  • محدودیت تعداد عناصر
  • نسبت ابعاد
  • Safe Margin
  • محل لوگو

ساخت Avatar و تصویر پروفایل

کاربران می‌توانند عکس خود را ارسال کنند و نسخه‌هایی با سبک‌های مختلف بسازند. برای نتیجه بهتر باید نور، پس‌زمینه، زاویه و میزان تغییر چهره مشخص شوند.

Mockup محصول

مدل می‌تواند محصول، بسته‌بندی یا صفحه اپلیکیشن را در صحنه‌ای تبلیغاتی نمایش دهد. در کاربردهای حرفه‌ای، تصویر مرجع باکیفیت و دستور حفظ جزئیات ضروری است.

مزایای استفاده از API به‌جای ابزار آماده

ابزار آماده برای تولید دستی چند تصویر مناسب است؛ اما API امکان تبدیل تولید تصویر به بخشی از محصول را فراهم می‌کند.

با API می‌توانید:

  • تولید تصویر را داخل سایت قرار دهید.
  • آن را به پنل کاربران متصل کنید.
  • برای هر کاربر سهمیه تعیین کنید.
  • Promptها را بر اساس قالب برند بسازید.
  • تصاویر را در فضای ذخیره‌سازی خودتان نگه دارید.
  • وضعیت هر درخواست را ثبت کنید.
  • تصاویر را به گردش کار محتوا متصل کنید.
  • برای خروجی‌ها صف پردازش بسازید.
  • چند مدل تصویری را مقایسه کنید.
  • هزینه هر تولید را محاسبه کنید.
  • فرایند ویرایش چندمرحله‌ای ایجاد کنید.

درواره سرویس API مدل‌های هوش مصنوعی را ارائه می‌کند. رابط تولید تصویر، گالری، ویرایشگر و تجربه نهایی کاربر توسط شما ساخته می‌شود.

دریافت API Key درواره

برای استفاده از GPT Image 2:

  1. وارد درواره شوید.
  2. ثبت‌نام یا وارد حساب خود شوید.
  3. از بخش API Keys یک کلید بسازید.
  4. وارد صفحه مدل‌ها شوید.
  5. GPT Image 2 را جست‌وجو کنید.
  6. Model ID درواره را کپی کنید.
  7. کلید را در Backend و متغیر محیطی نگه دارید.

نمونه متغیر محیطی:

DARVAREH_API_KEY=your_api_key

کلید API را داخل Frontend، اپلیکیشن موبایل منتشرشده یا Repository عمومی قرار ندهید.

Base URL درواره

آدرس پایه API درواره:

https://api.darvareh.ir/v1

برای تولید تصویر، Endpoint مورد استفاده به شکل زیر است:

https://api.darvareh.ir/v1/images/generations

برای ویرایش تصویر نیز در صورت فعال‌بودن قابلیت مربوط به مدل:

https://api.darvareh.ir/v1/images/edits

وضعیت پشتیبانی Endpoint و پارامترهای هر مدل را پیش از پیاده‌سازی Production در صفحه مدل‌ها و مستندات درواره بررسی کنید.

تولید تصویر با cURL

curl https://api.darvareh.ir/v1/images/generations \
  -H "Authorization: Bearer $DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MODEL_ID_DARVAREH",
    "prompt": "Professional product photography of a premium Persian tea package on a dark wooden table, warm morning light, minimal composition, realistic materials, empty space on the right for Persian advertising text",
    "size": "1536x1024",
    "quality": "high",
    "n": 1
  }'

مقدار MODEL_ID_DARVAREH را با Model ID درواره جایگزین کنید.

نمونه ساختار پاسخ ممکن است شامل تصویر Base64 باشد:

{
  "created": 1784480000,
  "data": [
    {
      "b64_json": "iVBORw0KGgoAAAANSUhEUgAA..."
    }
  ]
}

ساختار دقیق پاسخ را بر اساس Endpoint فعال در درواره بررسی کنید.

تولید تصویر با Python

ابتدا SDK را نصب کنید:

pip install openai

کد تولید تصویر:

import base64
import os
from pathlib import Path

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
    timeout=180.0,
    max_retries=2
)

result = client.images.generate(
    model="MODEL_ID_DARVAREH",
    prompt=(
        "Create a premium horizontal 16:9 blog cover about AI infrastructure. "
        "Dark navy gradient background, elegant purple illumination, "
        "abstract infrastructure gateway on the left, "
        "large clean empty space on the right for Persian title, "
        "minimal composition, no text, no watermark."
    ),
    size="1536x1024",
    quality="high",
    n=1
)

image_base64 = result.data[0].b64_json

if not image_base64:
    raise RuntimeError("Image data was not returned")

output_path = Path("gpt-image-2-output.png")
output_path.write_bytes(base64.b64decode(image_base64))

print(f"Image saved to: {output_path.resolve()}")

پارامترهای قابل استفاده ممکن است به Model ID و پیاده‌سازی Endpoint بستگی داشته باشند. قبل از انتشار، یک درخواست آزمایشی اجرا کنید.

تولید تصویر با Node.js و TypeScript

ابتدا SDK را نصب کنید:

npm install openai

نمونه کد:

import OpenAI from "openai";
import { writeFile } from "node:fs/promises";

const client = new OpenAI({
  apiKey: process.env.DARVAREH_API_KEY,
  baseURL: "https://api.darvareh.ir/v1",
  timeout: 180000,
  maxRetries: 2,
});

async function generateImage() {
  const response = await client.images.generate({
    model: "MODEL_ID_DARVAREH",
    prompt: [
      "A premium product photograph of a modern Persian coffee package.",
      "Dark studio background with warm side lighting.",
      "The package is placed on the left third of the frame.",
      "Keep the right side clean for advertising copy.",
      "Photorealistic, refined materials, minimal composition.",
      "Do not generate any text or watermark.",
    ].join(" "),
    size: "1536x1024",
    quality: "high",
    n: 1,
  });

  const imageBase64 = response.data?.[0]?.b64_json;

  if (!imageBase64) {
    throw new Error("No image data returned");
  }

  await writeFile(
    "generated-image.png",
    Buffer.from(imageBase64, "base64")
  );
}

generateImage().catch(console.error);

این کد باید در Backend اجرا شود، نه در مرورگر.

ویرایش تصویر با API

ویرایش معمولاً با درخواست multipart/form-data انجام می‌شود. تصویر و Prompt در یک درخواست ارسال می‌شوند.

نمونه cURL:

curl https://api.darvareh.ir/v1/images/edits \
  -H "Authorization: Bearer $DARVAREH_API_KEY" \
  -F "model=MODEL_ID_DARVAREH" \
  -F "image=@product.png" \
  -F "prompt=Replace only the background with a premium dark navy studio. Preserve the product, logo, package text, colors, camera angle and original proportions." \
  -F "quality=high"

در دستور بالا، مدل باید فقط پس‌زمینه را تغییر دهد. استفاده از عبارت‌هایی مانند preserve و change only به مشخص‌شدن محدوده ویرایش کمک می‌کند.

ویرایش تصویر با Python

import base64
import os
from pathlib import Path

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
    timeout=180.0
)

with open("product.png", "rb") as image_file:
    result = client.images.edit(
        model="MODEL_ID_DARVAREH",
        image=image_file,
        prompt=(
            "Change only the background to a clean modern kitchen. "
            "Preserve the exact product shape, packaging, logo, text, "
            "colors, proportions, camera angle and lighting direction."
        )
    )

image_base64 = result.data[0].b64_json

Path("edited-product.png").write_bytes(
    base64.b64decode(image_base64)
)

اگر حفظ نوشته روی محصول اهمیت زیادی دارد، خروجی را با تصویر اصلی مقایسه کنید. برای محصولات فروشگاهی بهتر است کنترل انسانی یا مرحله خودکار مقایسه تصویر وجود داشته باشد.

ساخت API تولید تصویر با FastAPI

import base64
import os
import uuid
from pathlib import Path

from fastapi import FastAPI, HTTPException
from openai import OpenAI
from pydantic import BaseModel, Field

app = FastAPI()

OUTPUT_DIRECTORY = Path("generated")
OUTPUT_DIRECTORY.mkdir(exist_ok=True)

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
    timeout=180.0,
    max_retries=2
)


class GenerateRequest(BaseModel):
    prompt: str = Field(min_length=10, max_length=10000)
    size: str = "1536x1024"
    quality: str = "high"


class GenerateResponse(BaseModel):
    image_id: str
    image_path: str


@app.post("/api/images", response_model=GenerateResponse)
def generate_image(payload: GenerateRequest) -> GenerateResponse:
    try:
        result = client.images.generate(
            model="MODEL_ID_DARVAREH",
            prompt=payload.prompt,
            size=payload.size,
            quality=payload.quality,
            n=1
        )

        image_base64 = result.data[0].b64_json

        if not image_base64:
            raise HTTPException(
                status_code=502,
                detail="Image data was not returned"
            )

        image_id = str(uuid.uuid4())
        image_path = OUTPUT_DIRECTORY / f"{image_id}.png"

        image_path.write_bytes(
            base64.b64decode(image_base64)
        )

        return GenerateResponse(
            image_id=image_id,
            image_path=str(image_path)
        )

    except HTTPException:
        raise
    except Exception as exc:
        raise HTTPException(
            status_code=502,
            detail="Image generation failed"
        ) from exc

در محیط Production بهتر است تصویر در Object Storage نگه‌داری شود و مسیر داخلی سرور مستقیماً در اختیار کاربر قرار نگیرد.

معماری Production برای تولید تصویر

تولید تصویر معمولاً از درخواست متنی زمان بیشتری می‌برد. بهتر است آن را به شکل Job پس‌زمینه پیاده‌سازی کنید:

  1. کاربر درخواست تولید تصویر را ثبت می‌کند.
  2. Backend ورودی و سهمیه کاربر را بررسی می‌کند.
  3. یک Job ایجاد می‌شود.
  4. Worker درخواست را به API درواره می‌فرستد.
  5. خروجی دریافت و اعتبارسنجی می‌شود.
  6. تصویر در Object Storage ذخیره می‌شود.
  7. وضعیت Job به completed تغییر می‌کند.
  8. لینک موقت یا کنترل‌شده به کاربر نمایش داده می‌شود.

نمونه ایجاد Job:

{
  "job_id": "img_job_84925",
  "status": "queued",
  "estimated_stage": "waiting"
}

وضعیت در حال پردازش:

{
  "job_id": "img_job_84925",
  "status": "processing",
  "stage": "generating_image"
}

خروجی نهایی:

{
  "job_id": "img_job_84925",
  "status": "completed",
  "image_url": "https://cdn.example.com/images/img_job_84925.png"
}

این روش از بازماندن طولانی اتصال HTTP جلوگیری می‌کند و امکان Retry، صف‌بندی و کنترل هم‌زمانی را می‌دهد.

ساختار پیشنهادی پایگاه داده

برای مدیریت تولید تصاویر می‌توان جدولی مشابه زیر ایجاد کرد:

CREATE TABLE image_jobs (
    id UUID PRIMARY KEY,
    user_id UUID NOT NULL,
    model_id TEXT NOT NULL,
    prompt TEXT NOT NULL,
    size TEXT,
    quality TEXT,
    status TEXT NOT NULL,
    input_image_url TEXT,
    output_image_url TEXT,
    error_code TEXT,
    error_message TEXT,
    created_at TIMESTAMPTZ NOT NULL DEFAULT NOW(),
    started_at TIMESTAMPTZ,
    completed_at TIMESTAMPTZ
);

وضعیت‌های پیشنهادی:

queued
processing
completed
failed
cancelled

Prompt کامل، Model ID و تنظیمات خروجی را ثبت کنید تا قابلیت بازتولید و تحلیل کیفیت وجود داشته باشد.

چگونه برای GPT Image 2 پرامپت بنویسیم؟

یک Prompt تصویری حرفه‌ای می‌تواند از اجزای زیر تشکیل شود:

موضوع اصلی

چه چیزی باید در تصویر باشد؟

یک لپ‌تاپ مدرن روی میز کار

محیط

سوژه کجا قرار گرفته است؟

در یک دفتر مینیمال با پس‌زمینه سرمه‌ای

سبک

عکاسی تبلیغاتی واقع‌گرایانه

ترکیب‌بندی

لپ‌تاپ در سمت چپ و فضای خالی در سمت راست

نورپردازی

نور نرم بنفش از پشت و نور اصلی خنثی از جلو

زاویه دوربین

زاویه سه‌ربع از سطح چشم

رنگ

پالت سرمه‌ای، بنفش و سفید

جزئیات فنی

جزئیات بالا، متریال واقعی، سایه طبیعی و عمق میدان کم

محدودیت‌ها

بدون نوشته، بدون لوگو، بدون Watermark و بدون عناصر شلوغ

Prompt نهایی:

یک لپ‌تاپ مدرن روی میز کار در یک دفتر مینیمال با پس‌زمینه سرمه‌ای،
عکاسی تبلیغاتی واقع‌گرایانه، لپ‌تاپ در یک‌سوم چپ تصویر و حداقل
35 درصد فضای خلوت در سمت راست، نور نرم بنفش از پشت و نور اصلی
خنثی از جلو، زاویه سه‌ربع از سطح چشم، متریال واقعی، سایه طبیعی،
عمق میدان کم، بدون نوشته، بدون لوگو، بدون Watermark و بدون عناصر شلوغ.

الگوی Prompt برای ویرایش تصویر

Prompt ویرایش بهتر است چهار بخش داشته باشد:

  1. چه چیزی تغییر کند؟
  2. چه چیزی ثابت بماند؟
  3. نتیجه نهایی چه سبکی داشته باشد؟
  4. چه چیزهایی نباید اضافه شوند؟

مثال:

فقط پس‌زمینه را به یک استودیوی روشن و مینیمال تغییر بده.

بدون تغییر باقی بمانند:
- خود محصول
- لوگوی محصول
- تمام نوشته‌های بسته‌بندی
- رنگ‌ها
- تناسب ابعاد
- زاویه دوربین
- جهت نور اصلی

نتیجه باید مانند عکاسی حرفه‌ای فروشگاهی باشد.
هیچ شیء، نوشته، لوگو یا تزئین جدیدی اضافه نکن.

الگوی Prompt برای تصویر تبلیغاتی فارسی

یک تصویر تبلیغاتی افقی و حرفه‌ای برای یک سرویس فناوری تولید کن.

موضوع:
یک زیرساخت دیجیتال مدرن که چند مدل هوش مصنوعی را به یک API متصل می‌کند.

ترکیب‌بندی:
- عناصر سه‌بعدی و نمودار اتصال در سمت چپ
- سمت راست خلوت و مناسب قرارگرفتن عنوان فارسی
- حداقل 15 درصد حاشیه امن از چهار طرف

سبک:
- Enterprise
- مینیمال
- آینده‌نگر اما واقع‌گرایانه
- پس‌زمینه سرمه‌ای تیره
- نور بنفش محدود و ظریف

محدودیت‌ها:
- هیچ نوشته‌ای تولید نکن
- هیچ لوگویی تولید نکن
- از ربات، مغز مصنوعی و مدارهای کلیشه‌ای استفاده نکن
- تصویر شلوغ نباشد

حفظ Consistency در چند تصویر

اگر برای یک کمپین چند تصویر می‌سازید، ویژگی‌های ثابت را در یک Brand Prompt ذخیره کنید:

{
  "background": "dark navy gradient",
  "accent_color": "subtle purple",
  "lighting": "soft studio lighting",
  "composition": "subject left, text space right",
  "style": "premium enterprise minimal",
  "forbidden_elements": [
    "robot",
    "brain icon",
    "watermark",
    "generated text",
    "visual clutter"
  ]
}

سپس Brand Prompt را به درخواست هر تصویر اضافه کنید.

برای ثبات بیشتر:

  • از تصویر مرجع استفاده کنید.
  • رنگ‌ها را دقیق تعریف کنید.
  • زاویه دوربین را ثابت نگه دارید.
  • نسبت ابعاد را تغییر ندهید.
  • تغییرات را به‌صورت مرحله‌ای انجام دهید.
  • هر بار فقط یک یا دو ویژگی را تغییر دهید.

ویرایش چندمرحله‌ای یا یک Prompt بزرگ؟

برای ویرایش پیچیده معمولاً چند مرحله کنترل بیشتری ایجاد می‌کند.

مثلاً به‌جای درخواست هم‌زمان این تغییرات:

  • تغییر پس‌زمینه
  • تغییر لباس
  • افزودن محصول
  • تغییر نور
  • افزودن نوشته

می‌توان مراحل را جدا کرد:

  1. اصلاح پس‌زمینه
  2. بررسی خروجی
  3. تغییر نور
  4. بررسی خروجی
  5. افزودن عنصر جدید
  6. افزودن نوشته نهایی با ابزار طراحی

این روش کمک می‌کند اگر یکی از مراحل اشتباه شد، مجبور نباشید تمام فرایند را از ابتدا انجام دهید.

مدیریت کیفیت و هزینه

قیمت تولید تصویر می‌تواند بر اساس مدل، اندازه، کیفیت، تعداد تصاویر و حجم ورودی متفاوت باشد. اعداد ثابت قیمت ممکن است تغییر کنند؛ بنابراین آخرین قیمت را در صفحه مدل‌های درواره مشاهده کنید.

برای کنترل هزینه:

کیفیت را بر اساس مرحله انتخاب کنید

برای ایده‌پردازی اولیه از کیفیت اقتصادی‌تر و برای خروجی نهایی از کیفیت بالاتر استفاده کنید.

تعداد خروجی را محدود کنید

به‌جای تولید تعداد زیادی تصویر، ابتدا Prompt را اصلاح و سپس چند Variation هدفمند بسازید.

اندازه مناسب انتخاب کنید

اگر تصویر فقط Thumbnail است، تولید خروجی بسیار بزرگ ممکن است توجیه نداشته باشد.

ورودی را قبل از ارسال اعتبارسنجی کنید

ابعاد، نوع فایل و حجم تصویر باید کنترل شوند تا درخواست نامعتبر به مدل ارسال نشود.

تصویر تکراری را Cache کنید

اگر Prompt و تنظیمات کاملاً یکسان هستند، می‌توان نتیجه قبلی را مجدداً استفاده کرد.

سهمیه کاربران را مدیریت کنید

برای هر کاربر محدودیت تعریف کنید:

  • تعداد تولید روزانه
  • تعداد درخواست هم‌زمان
  • سطح کیفیت مجاز
  • حداکثر اندازه
  • بودجه مصرف
  • تعداد ویرایش هر تصویر

انتخاب مدل با Routing

همه درخواست‌های تصویری به قوی‌ترین مدل نیاز ندارند.

نوع درخواستمسیر پیشنهادی
Thumbnail سادهمدل اقتصادی تصویری
ایده‌پردازی سریعمدل سریع
تصویر تبلیغاتی نهاییGPT Image 2
ویرایش دقیق محصولGPT Image 2
حفظ جزئیات ورودیGPT Image 2
تولید انبوه نسخه اولیهمدل اقتصادی
خروجی نهایی کمپینGPT Image 2
درخواست ویدئوییمدل تخصصی Video

می‌توانید ابتدا Preview ارزان‌تر بسازید و فقط پس از تأیید کاربر، خروجی نهایی را با کیفیت بالاتر تولید کنید.

مدیریت خطا

خطای Model ID

Model ID را دقیقاً از صفحه مدل‌های درواره کپی کنید.

خطای ورودی تصویر

موارد زیر را بررسی کنید:

  • فرمت فایل
  • حجم فایل
  • سالم‌بودن فایل
  • نوع MIME
  • ابعاد تصویر
  • تعداد ورودی‌های مجاز

Timeout

برای تولید تصویر Timeout بیشتری نسبت به پاسخ متنی در نظر بگیرید. در برنامه‌های Production از Job Queue استفاده کنید.

Rate Limit

از Exponential Backoff، صف پردازش و محدودیت Concurrency استفاده کنید.

خروجی خالی یا ناقص

قبل از ذخیره فایل بررسی کنید:

  • فیلد تصویر وجود دارد.
  • رشته Base64 خالی نیست.
  • Base64 قابل Decode است.
  • نوع واقعی فایل معتبر است.
  • تصویر Decodeشده قابل بازشدن است.

نمونه اعتبارسنجی Python:

import base64
from io import BytesIO

from PIL import Image


def validate_base64_image(value: str) -> bytes:
    image_bytes = base64.b64decode(
        value,
        validate=True
    )

    with Image.open(BytesIO(image_bytes)) as image:
        image.verify()

    return image_bytes

نکات ذخیره‌سازی خروجی

برای ذخیره تصاویر در Production:

  • از نام فایل تصادفی استفاده کنید.
  • فایل را در Object Storage نگه دارید.
  • Metadata را در Database ذخیره کنید.
  • لینک دانلود زمان‌دار بسازید.
  • فایل‌های موقت را پاک کنید.
  • نسخه اصلی و Thumbnail را جدا نگه دارید.
  • فرمت مناسب وب مانند WebP ایجاد کنید.
  • ابعاد تصویر را قبل از نمایش کنترل کنید.

ساختار پیشنهادی مسیر:

users/{user_id}/images/{year}/{month}/{image_id}.webp

بهینه‌سازی تصویر برای وب

خروجی خام ممکن است برای وب بهینه نباشد. پس از تولید:

  1. ابعاد نهایی را تعیین کنید.
  2. تصویر را به WebP یا AVIF تبدیل کنید.
  3. Metadata غیرضروری را حذف کنید.
  4. Thumbnail بسازید.
  5. حجم فایل را اندازه بگیرید.
  6. نسخه اصلی را در صورت نیاز نگه دارید.
  7. از CDN استفاده کنید.

نمونه تبدیل به WebP:

from PIL import Image

with Image.open("generated-image.png") as image:
    image.save(
        "generated-image.webp",
        "WEBP",
        quality=88,
        method=6
    )

ارزیابی کیفیت GPT Image 2

ارزیابی مدل تصویری نباید فقط بر اساس «زیبا بودن» انجام شود.

معیارهای کاربردی:

Prompt Adherence

آیا تصویر دستورهای اصلی Prompt را رعایت کرده است؟

Composition Accuracy

آیا سوژه و فضای خالی در محل تعیین‌شده قرار دارند؟

Text Accuracy

آیا نوشته‌ها صحیح، کامل و خوانا هستند؟

Input Preservation

در ویرایش، چه میزان از جزئیات تصویر اصلی حفظ شده است؟

Brand Consistency

آیا رنگ، نور و سبک با هویت برند هماهنگ است؟

Product Fidelity

آیا محصول واقعی با دقت نمایش داده شده است؟

Visual Quality

آیا نور، سایه، متریال و جزئیات طبیعی هستند؟

Edit Locality

آیا فقط بخش خواسته‌شده تغییر کرده یا قسمت‌های دیگر نیز ناخواسته تغییر کرده‌اند؟

برای مقایسه مدل‌ها یک Dataset واقعی از Promptهای کسب‌وکار خودتان بسازید و خروجی‌ها را با معیارهای ثابت امتیازدهی کنید.

اشتباهات رایج

Prompt بسیار کوتاه

درخواست «یک عکس تبلیغاتی بساز» کنترل کافی روی نتیجه ایجاد نمی‌کند.

درخواست چندین تغییر پیچیده در یک مرحله

تغییر مرحله‌ای معمولاً قابل‌کنترل‌تر است.

مشخص‌نکردن عناصر ثابت

در ویرایش تصویر باید دقیقاً بگویید چه چیزهایی نباید تغییر کنند.

قراردادن API Key در Frontend

کلید API باید فقط روی سرور نگه‌داری شود.

ذخیره مستقیم Base64 در Database

برای اغلب پروژه‌ها بهتر است فایل در Object Storage و فقط URL و Metadata در Database ذخیره شوند.

تولید کیفیت بالا برای Preview

ابتدا Preview بسازید و کیفیت بالا را برای خروجی تأییدشده استفاده کنید.

اعتماد کامل به متن فارسی داخل تصویر

تمام نوشته‌ها را بررسی یا در مرحله نهایی با ابزار طراحی اضافه کنید.

استفاده از مدل تصویر برای تولید ویدئو

GPT Image 2 مدل تولید تصویر است. برای Video باید از مدل تخصصی تولید ویدئو استفاده شود.

ثابت‌کردن قیمت در برنامه

قیمت و دسترسی مدل‌ها ممکن است تغییر کند. همیشه صفحه مدل‌های درواره را بررسی کنید.

پرسش‌های متداول

GPT Image 2 چیست؟

GPT Image 2 یک مدل تخصصی برای تولید و ویرایش تصاویر با استفاده از متن و تصویر ورودی است.

آیا GPT Image 2 عکس را از متن می‌سازد؟

بله. می‌توانید یک Prompt متنی ارسال کنید و تصویر جدید دریافت کنید.

آیا می‌توان با آن عکس موجود را ویرایش کرد؟

بله. مدل از ورودی تصویری و Image Editing پشتیبانی می‌کند.

آیا می‌توان پس‌زمینه عکس محصول را تغییر داد؟

بله. بهتر است در Prompt تأکید کنید که محصول، لوگو، نوشته‌ها، رنگ و زاویه دوربین ثابت بمانند.

آیا GPT Image 2 برای ساخت تصویر تبلیغاتی مناسب است؟

بله. تولید تصویر کمپین، بنر، تصویر محصول، محتوای شبکه اجتماعی و کاور مقاله از کاربردهای آن هستند.

آیا GPT Image 2 می‌تواند متن فارسی داخل تصویر بنویسد؟

می‌تواند نوشته تولید کند، اما متن فارسی باید حتماً بازبینی شود. برای تایپوگرافی کاملاً دقیق بهتر است متن در مرحله طراحی نهایی اضافه شود.

آیا این مدل ویدئو تولید می‌کند؟

خیر. GPT Image 2 برای تولید و ویرایش تصویر است و خروجی ویدئویی ندارد.

آیا Streaming پشتیبانی می‌شود؟

طبق صفحه رسمی مدل، Streaming برای GPT Image 2 پشتیبانی نمی‌شود.

آیا GPT Image 2 از Function Calling پشتیبانی می‌کند؟

خیر. این مدل تخصصی تصویر است و Function Calling قابلیت اصلی آن نیست.

خروجی API چه فرمتی دارد؟

بسته به Endpoint و تنظیمات سرویس، تصویر ممکن است به شکل داده Base64 یا ساختار خروجی تصویری ارائه شود. ساختار دقیق پاسخ درواره را بررسی کنید.

Model ID درواره چیست؟

برای جلوگیری از استفاده از شناسه اشتباه یا قدیمی، GPT Image 2 را در صفحه مدل‌های درواره جست‌وجو کرده و Model ID درواره را مستقیماً کپی کنید.

قیمت GPT Image 2 چقدر است؟

قیمت ممکن است بر اساس کیفیت، اندازه، ورودی و تنظیمات تغییر کند. آخرین قیمت را در صفحه مدل‌های درواره مشاهده کنید.

Base URL درواره چیست؟

https://api.darvareh.ir/v1

چگونه API Key درواره بگیریم؟

در درواره ثبت‌نام کنید و از پنل کاربری یک API Key بسازید.

آیا می‌توان API را مستقیماً در React استفاده کرد؟

خیر. فراخوانی باید از Backend انجام شود تا API Key افشا نشود.

جمع‌بندی

GPT Image 2 یک مدل تخصصی و پیشرفته برای ساخت تصویر از متن، ویرایش عکس، تغییر سبک، بازطراحی صحنه و تولید محتوای بصری در محصولات نرم‌افزاری است.

پشتیبانی از ورودی متنی و تصویری، اندازه‌های انعطاف‌پذیر و حفظ بهتر جزئیات تصویر ورودی باعث می‌شود این مدل برای فروشگاه اینترنتی، ابزارهای طراحی، پلتفرم‌های تولید محتوا، بازاریابی و ساخت تصاویر برند کاربردی باشد.

برای رسیدن به خروجی حرفه‌ای، فقط انتخاب مدل کافی نیست. Prompt باید موضوع، محیط، ترکیب‌بندی، نور، سبک، عناصر ثابت و محدودیت‌ها را دقیق مشخص کند. در Production نیز باید Job Queue، کنترل هزینه، ذخیره‌سازی فایل، اعتبارسنجی خروجی و سهمیه کاربران را در نظر بگیرید.

برای مشاهده قیمت به‌روز، وضعیت دسترسی و Model ID درواره به صفحه مدل‌های درواره مراجعه کنید. سپس در درواره ثبت‌نام کرده، API Key خود را دریافت کنید و با Base URL زیر قابلیت تولید تصویر را به محصول خود اضافه کنید:

https://api.darvareh.ir/v1

مقالات مرتبط

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.