GPT Image 2 چیست؟ آموزش کامل تولید و ویرایش تصویر با API درواره
GPT Image 2 مدل پیشرفته تولید و ویرایش تصویر برای ساخت عکس از متن، بازطراحی تصاویر و حفظ دقیق جزئیات ورودی است. در این راهنما استفاده عملی از API آن در درواره را آموزش میدهیم.
مقدمه
تولید تصویر با هوش مصنوعی از ساخت عکسهای سرگرمکننده فراتر رفته و به یکی از قابلیتهای اصلی نرمافزارهای طراحی، فروشگاههای اینترنتی، پلتفرمهای تولید محتوا و ابزارهای بازاریابی تبدیل شده است.
امروزه کسبوکارها میخواهند قابلیتهایی مانند موارد زیر را مستقیماً داخل محصولات خود قرار دهند:
- ساخت تصویر از توضیح متنی
- ویرایش عکس با دستور فارسی
- تغییر پسزمینه محصول
- تولید چند نسخه تبلیغاتی
- ساخت تصویر شبکههای اجتماعی
- بازطراحی فضای داخلی
- ایجاد Mockup محصول
- تغییر رنگ یا جنس یک شیء
- حذف یا جایگزینی عناصر تصویر
- تولید تصویر با نسبت ابعاد مختلف
- حفظ ظاهر سوژه هنگام ویرایش
- تولید تصویر دارای نوشته
GPT Image 2 یک مدل تخصصی برای تولید و ویرایش تصویر است که میتواند متن و تصویر را بهعنوان ورودی دریافت کرده و تصویر جدیدی تولید کند. این مدل برای سرعت، کیفیت بالا، پیروی بهتر از دستور و استفاده از ورودی تصویری با Fidelity بالا طراحی شده است.
در این مقاله بررسی میکنیم:
- GPT Image 2 چیست؟
- چه تفاوتی با مدلهای متنی دارد؟
- چه کاربردهایی دارد؟
- چگونه یک Prompt تصویری حرفهای بنویسیم؟
- چگونه با API درواره تصویر تولید کنیم؟
- چگونه یک تصویر موجود را ویرایش کنیم؟
- چگونه فایل Base64 را ذخیره کنیم؟
- معماری مناسب یک سرویس تولید تصویر چیست؟
- چگونه هزینه، کیفیت و زمان تولید را کنترل کنیم؟
GPT Image 2 چیست؟
GPT Image 2 یک مدل تخصصی تولید و ویرایش تصویر است. این مدل میتواند از توضیح متنی، تصویر ورودی یا ترکیب هر دو برای ساخت خروجی تصویری استفاده کند.
برخلاف مدلهای زبانی که پاسخ متنی تولید میکنند، خروجی اصلی GPT Image 2 تصویر است. ورودی آن میتواند شامل موارد زیر باشد:
- یک Prompt متنی
- یک یا چند دستور ویرایشی
- تصویر مرجع
- توضیح سبک بصری
- نسبت و اندازه موردنظر
- سطح کیفیت
- جزئیات مربوط به ترکیببندی
- محدودیتهای مربوط به عناصر ثابت
طبق مستندات رسمی، GPT Image 2 برای تولید و ویرایش سریع تصاویر باکیفیت طراحی شده و از اندازههای انعطافپذیر و ورودیهای تصویری با حفظ جزئیات بالا پشتیبانی میکند. مستندات رسمی GPT Image 2
مشخصات اصلی GPT Image 2
| مشخصه | توضیح |
|---|---|
| نوع مدل | تولید و ویرایش تصویر |
| دستهبندی | Image Generation و Image Editing |
| ورودی متنی | پشتیبانی میشود |
| ورودی تصویری | پشتیبانی میشود |
| خروجی تصویری | پشتیبانی میشود |
| ورودی صوتی | پشتیبانی نمیشود |
| خروجی ویدئویی | پشتیبانی نمیشود |
| تولید تصویر از متن | پشتیبانی میشود |
| ویرایش تصویر | پشتیبانی میشود |
| اندازههای منعطف | پشتیبانی میشود |
| حفظ جزئیات تصویر ورودی | پشتیبانی میشود |
| Streaming | پشتیبانی نمیشود |
| Function Calling | پشتیبانی نمیشود |
| Fine-tuning | پشتیبانی نمیشود |
| Model ID درواره | در صفحه مدلهای درواره بررسی شود |
برای دریافت Model ID درواره، قیمت بهروز، محدودیتها و وضعیت دسترسی مدل به صفحه مدلهای درواره مراجعه کنید.
GPT Image 2 چه تفاوتی با مدل متنی دارد؟
مدلهای متنی مانند GPT یا Claude معمولاً متن دریافت میکنند و متن تولید میکنند. GPT Image 2 برای تولید پیکسل و تصویر طراحی شده است.
| قابلیت | مدل متنی | GPT Image 2 |
|---|---|---|
| پاسخ متنی | قابلیت اصلی | قابلیت اصلی نیست |
| تولید تصویر | معمولاً از طریق ابزار خارجی | قابلیت اصلی |
| ویرایش تصویر | محدود یا غیرمستقیم | قابلیت اصلی |
| ورودی عکس | برای تحلیل | برای تحلیل و بازتولید تصویری |
| Tool Calling | ممکن است پشتیبانی شود | پشتیبانی نمیشود |
| Structured Output | ممکن است پشتیبانی شود | پشتیبانی نمیشود |
| خروجی Base64 | معمولاً خیر | بله، بسته به API |
| استفاده اصلی | گفتوگو و پردازش متن | ساخت و ویرایش تصویر |
در یک محصول کامل میتوان مدل متنی و تصویری را با یکدیگر ترکیب کرد. مدل متنی درخواست کاربر را تحلیل و Prompt تصویری بهینه تولید میکند؛ سپس GPT Image 2 تصویر را میسازد.
مهمترین قابلیتهای GPT Image 2
تولید تصویر از متن
در Text to Image، کاربر یک توضیح متنی مینویسد و مدل بر اساس آن تصویر میسازد.
مثال:
یک تصویر تبلیغاتی مینیمال از یک فنجان قهوه ایرانی روی میز چوبی تیره،
نور گرم صبحگاهی از سمت چپ، پسزمینه محو، عکاسی حرفهای محصول،
فضای خالی کافی در سمت راست برای قرار دادن تیتر تبلیغاتی
هرچه Prompt درباره موضوع، سبک، نور، زاویه دوربین و ترکیببندی دقیقتر باشد، کنترل بیشتری روی نتیجه خواهید داشت.
ویرایش تصویر با دستور متنی
میتوان یک تصویر موجود را همراه دستور متنی ارسال کرد:
پسزمینه تصویر را به یک استودیوی مینیمال خاکستری روشن تغییر بده.
محصول، لوگو، رنگ محصول، زاویه دوربین و سایه اصلی بدون تغییر باقی بمانند.
در ویرایش تصویر، مشخصکردن عناصر ثابت بسیار مهم است. اگر فقط بنویسید «پسزمینه را عوض کن»، ممکن است مدل جزئیات دیگری را نیز بازتولید کند.
حفظ جزئیات تصویر ورودی
High-Fidelity Image Input برای کاربردهایی مهم است که باید جزئیات تصویر مرجع تا حد ممکن حفظ شوند، مانند:
- ظاهر محصول
- بستهبندی
- رنگ برند
- ترکیببندی
- چهره یا سوژه
- نورپردازی
- نوشتههای روی محصول
- عناصر ثابت محیط
هیچ مدل مولد تصویری تضمین نمیکند تمام جزئیات در همه خروجیها دقیقاً بدون تغییر باقی بمانند. برای کاربردهای حساس باید خروجیها بازبینی و با ورودی مقایسه شوند.
تغییر سبک تصویر
GPT Image 2 میتواند یک تصویر را با سبک جدید بازطراحی کند:
- عکاسی واقعگرایانه
- تصویرسازی Editorial
- سبک سهبعدی
- مینیمال
- آبرنگ
- نقاشی دیجیتال
- Isometric
- Line Art
- پوستر مدرن
- فضای سینمایی
- تصویرسازی کودک
- Collage
مثال:
این تصویر را به یک Illustration سهبعدی مینیمال تبدیل کن.
ساختار اصلی صحنه، جای عناصر و رنگ سازمانی بنفش حفظ شوند.
نور نرم استودیویی و پسزمینه سرمهای تیره باشد.
تولید تصاویر دارای متن
یکی از کاربردهای مهم مدلهای جدید تصویر، قراردادن نوشته در تصویر است. برای افزایش دقت، متن باید کاملاً مشخص و کوتاه باشد.
مثال:
یک پوستر مینیمال فارسی طراحی کن.
متن اصلی دقیقاً:
«آینده از اینجا شروع میشود»
هیچ متن دیگری در تصویر قرار نده.
متن باید خوانا، راستچین و در سمت راست تصویر باشد.
با وجود پیشرفت مدلها، نوشتههای فارسی باید پس از تولید بررسی شوند. برای پروژههایی که تایپوگرافی کاملاً دقیق لازم دارند، بهتر است مدل پسزمینه و عناصر بصری را بسازد و متن نهایی با ابزار طراحی یا برنامه به تصویر اضافه شود.
تغییر نسبت ابعاد و ترکیببندی
یک تصویر مناسب وبسایت ممکن است برای Instagram، Story یا بنر تبلیغاتی قابل استفاده نباشد.
با GPT Image 2 میتوان خروجیهایی برای قالبهای مختلف تولید کرد:
- مربع برای پست شبکه اجتماعی
- عمودی برای Story و Reel
- افقی برای کاور وبلاگ
- بنر عریض برای وبسایت
- تصویر محصول
- Thumbnail
- تبلیغات نمایشی
در Prompt فقط نسبت را مشخص نکنید؛ محل قرارگیری سوژه و فضای خالی را نیز توضیح دهید.
مثال:
تصویر افقی 16:9 برای کاور مقاله تولید کن.
سوژه اصلی در یکسوم چپ قرار بگیرد.
سمت راست تصویر حداقل 35 درصد فضای خلوت و تیره برای عنوان فارسی داشته باشد.
هیچ نوشتهای داخل تصویر تولید نکن.
کاربردهای GPT Image 2 برای کسبوکارها
فروشگاه اینترنتی
فروشگاهها میتوانند از API تولید تصویر برای این موارد استفاده کنند:
- تغییر پسزمینه محصول
- ساخت تصویر Lifestyle
- قرار دادن محصول در محیطهای مختلف
- تولید نسخه مناسب شبکه اجتماعی
- ساخت بنر کمپین
- تغییر رنگ محصول
- ایجاد Mockup
- تولید تصاویر دستهبندی
تصویر محصول نباید ویژگیای را نمایش دهد که محصول واقعی فاقد آن است. بهتر است تصاویر مولد تبلیغاتی از تصاویر مستند محصول تفکیک شوند.
پلتفرم تولید محتوا
یک ابزار تولید محتوا میتواند به کاربر اجازه دهد:
- موضوع را وارد کند.
- سبک بصری را انتخاب کند.
- نسبت ابعاد را تعیین کند.
- رنگ برند را مشخص کند.
- چند خروجی دریافت کند.
- خروجی موردنظر را ویرایش کند.
- فایل نهایی را دانلود کند.
تبلیغات و بازاریابی
برای هر کمپین میتوان چند Variation ایجاد کرد:
- زاویه دوربین متفاوت
- رنگبندی متفاوت
- سوژه متفاوت
- نسخه روشن و تیره
- فضای خالی در سمت چپ یا راست
- نسخه مناسب موبایل
- نسخه مناسب Desktop
طراحی داخلی
کاربر میتواند تصویر اتاق را ارسال کند و تغییرات موردنظر را توضیح دهد:
چیدمان اصلی اتاق و محل پنجرهها حفظ شود.
مبلمان به سبک Modern Minimal تغییر کند.
رنگ دیوارها سفید گرم، کفپوش چوب بلوط روشن و نور عصرگاهی باشد.
تولید تصویر مقاله
سیستم مدیریت محتوا میتواند بر اساس عنوان و خلاصه مقاله، تصویر کاور پیشنهاد دهد. بهتر است قالب برند به Prompt ثابت تبدیل شود:
- پالت رنگ
- محل سوژه
- فضای عنوان
- سبک تصویرسازی
- محدودیت تعداد عناصر
- نسبت ابعاد
- Safe Margin
- محل لوگو
ساخت Avatar و تصویر پروفایل
کاربران میتوانند عکس خود را ارسال کنند و نسخههایی با سبکهای مختلف بسازند. برای نتیجه بهتر باید نور، پسزمینه، زاویه و میزان تغییر چهره مشخص شوند.
Mockup محصول
مدل میتواند محصول، بستهبندی یا صفحه اپلیکیشن را در صحنهای تبلیغاتی نمایش دهد. در کاربردهای حرفهای، تصویر مرجع باکیفیت و دستور حفظ جزئیات ضروری است.
مزایای استفاده از API بهجای ابزار آماده
ابزار آماده برای تولید دستی چند تصویر مناسب است؛ اما API امکان تبدیل تولید تصویر به بخشی از محصول را فراهم میکند.
با API میتوانید:
- تولید تصویر را داخل سایت قرار دهید.
- آن را به پنل کاربران متصل کنید.
- برای هر کاربر سهمیه تعیین کنید.
- Promptها را بر اساس قالب برند بسازید.
- تصاویر را در فضای ذخیرهسازی خودتان نگه دارید.
- وضعیت هر درخواست را ثبت کنید.
- تصاویر را به گردش کار محتوا متصل کنید.
- برای خروجیها صف پردازش بسازید.
- چند مدل تصویری را مقایسه کنید.
- هزینه هر تولید را محاسبه کنید.
- فرایند ویرایش چندمرحلهای ایجاد کنید.
درواره سرویس API مدلهای هوش مصنوعی را ارائه میکند. رابط تولید تصویر، گالری، ویرایشگر و تجربه نهایی کاربر توسط شما ساخته میشود.
دریافت API Key درواره
برای استفاده از GPT Image 2:
- وارد درواره شوید.
- ثبتنام یا وارد حساب خود شوید.
- از بخش API Keys یک کلید بسازید.
- وارد صفحه مدلها شوید.
- GPT Image 2 را جستوجو کنید.
- Model ID درواره را کپی کنید.
- کلید را در Backend و متغیر محیطی نگه دارید.
نمونه متغیر محیطی:
DARVAREH_API_KEY=your_api_key
کلید API را داخل Frontend، اپلیکیشن موبایل منتشرشده یا Repository عمومی قرار ندهید.
Base URL درواره
آدرس پایه API درواره:
https://api.darvareh.ir/v1
برای تولید تصویر، Endpoint مورد استفاده به شکل زیر است:
https://api.darvareh.ir/v1/images/generations
برای ویرایش تصویر نیز در صورت فعالبودن قابلیت مربوط به مدل:
https://api.darvareh.ir/v1/images/edits
وضعیت پشتیبانی Endpoint و پارامترهای هر مدل را پیش از پیادهسازی Production در صفحه مدلها و مستندات درواره بررسی کنید.
تولید تصویر با cURL
curl https://api.darvareh.ir/v1/images/generations \
-H "Authorization: Bearer $DARVAREH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MODEL_ID_DARVAREH",
"prompt": "Professional product photography of a premium Persian tea package on a dark wooden table, warm morning light, minimal composition, realistic materials, empty space on the right for Persian advertising text",
"size": "1536x1024",
"quality": "high",
"n": 1
}'
مقدار MODEL_ID_DARVAREH را با Model ID درواره جایگزین کنید.
نمونه ساختار پاسخ ممکن است شامل تصویر Base64 باشد:
{
"created": 1784480000,
"data": [
{
"b64_json": "iVBORw0KGgoAAAANSUhEUgAA..."
}
]
}
ساختار دقیق پاسخ را بر اساس Endpoint فعال در درواره بررسی کنید.
تولید تصویر با Python
ابتدا SDK را نصب کنید:
pip install openai
کد تولید تصویر:
import base64
import os
from pathlib import Path
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1",
timeout=180.0,
max_retries=2
)
result = client.images.generate(
model="MODEL_ID_DARVAREH",
prompt=(
"Create a premium horizontal 16:9 blog cover about AI infrastructure. "
"Dark navy gradient background, elegant purple illumination, "
"abstract infrastructure gateway on the left, "
"large clean empty space on the right for Persian title, "
"minimal composition, no text, no watermark."
),
size="1536x1024",
quality="high",
n=1
)
image_base64 = result.data[0].b64_json
if not image_base64:
raise RuntimeError("Image data was not returned")
output_path = Path("gpt-image-2-output.png")
output_path.write_bytes(base64.b64decode(image_base64))
print(f"Image saved to: {output_path.resolve()}")
پارامترهای قابل استفاده ممکن است به Model ID و پیادهسازی Endpoint بستگی داشته باشند. قبل از انتشار، یک درخواست آزمایشی اجرا کنید.
تولید تصویر با Node.js و TypeScript
ابتدا SDK را نصب کنید:
npm install openai
نمونه کد:
import OpenAI from "openai";
import { writeFile } from "node:fs/promises";
const client = new OpenAI({
apiKey: process.env.DARVAREH_API_KEY,
baseURL: "https://api.darvareh.ir/v1",
timeout: 180000,
maxRetries: 2,
});
async function generateImage() {
const response = await client.images.generate({
model: "MODEL_ID_DARVAREH",
prompt: [
"A premium product photograph of a modern Persian coffee package.",
"Dark studio background with warm side lighting.",
"The package is placed on the left third of the frame.",
"Keep the right side clean for advertising copy.",
"Photorealistic, refined materials, minimal composition.",
"Do not generate any text or watermark.",
].join(" "),
size: "1536x1024",
quality: "high",
n: 1,
});
const imageBase64 = response.data?.[0]?.b64_json;
if (!imageBase64) {
throw new Error("No image data returned");
}
await writeFile(
"generated-image.png",
Buffer.from(imageBase64, "base64")
);
}
generateImage().catch(console.error);
این کد باید در Backend اجرا شود، نه در مرورگر.
ویرایش تصویر با API
ویرایش معمولاً با درخواست multipart/form-data انجام میشود. تصویر و Prompt در یک درخواست ارسال میشوند.
نمونه cURL:
curl https://api.darvareh.ir/v1/images/edits \
-H "Authorization: Bearer $DARVAREH_API_KEY" \
-F "model=MODEL_ID_DARVAREH" \
-F "image=@product.png" \
-F "prompt=Replace only the background with a premium dark navy studio. Preserve the product, logo, package text, colors, camera angle and original proportions." \
-F "quality=high"
در دستور بالا، مدل باید فقط پسزمینه را تغییر دهد. استفاده از عبارتهایی مانند preserve و change only به مشخصشدن محدوده ویرایش کمک میکند.
ویرایش تصویر با Python
import base64
import os
from pathlib import Path
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1",
timeout=180.0
)
with open("product.png", "rb") as image_file:
result = client.images.edit(
model="MODEL_ID_DARVAREH",
image=image_file,
prompt=(
"Change only the background to a clean modern kitchen. "
"Preserve the exact product shape, packaging, logo, text, "
"colors, proportions, camera angle and lighting direction."
)
)
image_base64 = result.data[0].b64_json
Path("edited-product.png").write_bytes(
base64.b64decode(image_base64)
)
اگر حفظ نوشته روی محصول اهمیت زیادی دارد، خروجی را با تصویر اصلی مقایسه کنید. برای محصولات فروشگاهی بهتر است کنترل انسانی یا مرحله خودکار مقایسه تصویر وجود داشته باشد.
ساخت API تولید تصویر با FastAPI
import base64
import os
import uuid
from pathlib import Path
from fastapi import FastAPI, HTTPException
from openai import OpenAI
from pydantic import BaseModel, Field
app = FastAPI()
OUTPUT_DIRECTORY = Path("generated")
OUTPUT_DIRECTORY.mkdir(exist_ok=True)
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1",
timeout=180.0,
max_retries=2
)
class GenerateRequest(BaseModel):
prompt: str = Field(min_length=10, max_length=10000)
size: str = "1536x1024"
quality: str = "high"
class GenerateResponse(BaseModel):
image_id: str
image_path: str
@app.post("/api/images", response_model=GenerateResponse)
def generate_image(payload: GenerateRequest) -> GenerateResponse:
try:
result = client.images.generate(
model="MODEL_ID_DARVAREH",
prompt=payload.prompt,
size=payload.size,
quality=payload.quality,
n=1
)
image_base64 = result.data[0].b64_json
if not image_base64:
raise HTTPException(
status_code=502,
detail="Image data was not returned"
)
image_id = str(uuid.uuid4())
image_path = OUTPUT_DIRECTORY / f"{image_id}.png"
image_path.write_bytes(
base64.b64decode(image_base64)
)
return GenerateResponse(
image_id=image_id,
image_path=str(image_path)
)
except HTTPException:
raise
except Exception as exc:
raise HTTPException(
status_code=502,
detail="Image generation failed"
) from exc
در محیط Production بهتر است تصویر در Object Storage نگهداری شود و مسیر داخلی سرور مستقیماً در اختیار کاربر قرار نگیرد.
معماری Production برای تولید تصویر
تولید تصویر معمولاً از درخواست متنی زمان بیشتری میبرد. بهتر است آن را به شکل Job پسزمینه پیادهسازی کنید:
- کاربر درخواست تولید تصویر را ثبت میکند.
- Backend ورودی و سهمیه کاربر را بررسی میکند.
- یک Job ایجاد میشود.
- Worker درخواست را به API درواره میفرستد.
- خروجی دریافت و اعتبارسنجی میشود.
- تصویر در Object Storage ذخیره میشود.
- وضعیت Job به
completedتغییر میکند. - لینک موقت یا کنترلشده به کاربر نمایش داده میشود.
نمونه ایجاد Job:
{
"job_id": "img_job_84925",
"status": "queued",
"estimated_stage": "waiting"
}
وضعیت در حال پردازش:
{
"job_id": "img_job_84925",
"status": "processing",
"stage": "generating_image"
}
خروجی نهایی:
{
"job_id": "img_job_84925",
"status": "completed",
"image_url": "https://cdn.example.com/images/img_job_84925.png"
}
این روش از بازماندن طولانی اتصال HTTP جلوگیری میکند و امکان Retry، صفبندی و کنترل همزمانی را میدهد.
ساختار پیشنهادی پایگاه داده
برای مدیریت تولید تصاویر میتوان جدولی مشابه زیر ایجاد کرد:
CREATE TABLE image_jobs (
id UUID PRIMARY KEY,
user_id UUID NOT NULL,
model_id TEXT NOT NULL,
prompt TEXT NOT NULL,
size TEXT,
quality TEXT,
status TEXT NOT NULL,
input_image_url TEXT,
output_image_url TEXT,
error_code TEXT,
error_message TEXT,
created_at TIMESTAMPTZ NOT NULL DEFAULT NOW(),
started_at TIMESTAMPTZ,
completed_at TIMESTAMPTZ
);
وضعیتهای پیشنهادی:
queued
processing
completed
failed
cancelled
Prompt کامل، Model ID و تنظیمات خروجی را ثبت کنید تا قابلیت بازتولید و تحلیل کیفیت وجود داشته باشد.
چگونه برای GPT Image 2 پرامپت بنویسیم؟
یک Prompt تصویری حرفهای میتواند از اجزای زیر تشکیل شود:
موضوع اصلی
چه چیزی باید در تصویر باشد؟
یک لپتاپ مدرن روی میز کار
محیط
سوژه کجا قرار گرفته است؟
در یک دفتر مینیمال با پسزمینه سرمهای
سبک
عکاسی تبلیغاتی واقعگرایانه
ترکیببندی
لپتاپ در سمت چپ و فضای خالی در سمت راست
نورپردازی
نور نرم بنفش از پشت و نور اصلی خنثی از جلو
زاویه دوربین
زاویه سهربع از سطح چشم
رنگ
پالت سرمهای، بنفش و سفید
جزئیات فنی
جزئیات بالا، متریال واقعی، سایه طبیعی و عمق میدان کم
محدودیتها
بدون نوشته، بدون لوگو، بدون Watermark و بدون عناصر شلوغ
Prompt نهایی:
یک لپتاپ مدرن روی میز کار در یک دفتر مینیمال با پسزمینه سرمهای،
عکاسی تبلیغاتی واقعگرایانه، لپتاپ در یکسوم چپ تصویر و حداقل
35 درصد فضای خلوت در سمت راست، نور نرم بنفش از پشت و نور اصلی
خنثی از جلو، زاویه سهربع از سطح چشم، متریال واقعی، سایه طبیعی،
عمق میدان کم، بدون نوشته، بدون لوگو، بدون Watermark و بدون عناصر شلوغ.
الگوی Prompt برای ویرایش تصویر
Prompt ویرایش بهتر است چهار بخش داشته باشد:
- چه چیزی تغییر کند؟
- چه چیزی ثابت بماند؟
- نتیجه نهایی چه سبکی داشته باشد؟
- چه چیزهایی نباید اضافه شوند؟
مثال:
فقط پسزمینه را به یک استودیوی روشن و مینیمال تغییر بده.
بدون تغییر باقی بمانند:
- خود محصول
- لوگوی محصول
- تمام نوشتههای بستهبندی
- رنگها
- تناسب ابعاد
- زاویه دوربین
- جهت نور اصلی
نتیجه باید مانند عکاسی حرفهای فروشگاهی باشد.
هیچ شیء، نوشته، لوگو یا تزئین جدیدی اضافه نکن.
الگوی Prompt برای تصویر تبلیغاتی فارسی
یک تصویر تبلیغاتی افقی و حرفهای برای یک سرویس فناوری تولید کن.
موضوع:
یک زیرساخت دیجیتال مدرن که چند مدل هوش مصنوعی را به یک API متصل میکند.
ترکیببندی:
- عناصر سهبعدی و نمودار اتصال در سمت چپ
- سمت راست خلوت و مناسب قرارگرفتن عنوان فارسی
- حداقل 15 درصد حاشیه امن از چهار طرف
سبک:
- Enterprise
- مینیمال
- آیندهنگر اما واقعگرایانه
- پسزمینه سرمهای تیره
- نور بنفش محدود و ظریف
محدودیتها:
- هیچ نوشتهای تولید نکن
- هیچ لوگویی تولید نکن
- از ربات، مغز مصنوعی و مدارهای کلیشهای استفاده نکن
- تصویر شلوغ نباشد
حفظ Consistency در چند تصویر
اگر برای یک کمپین چند تصویر میسازید، ویژگیهای ثابت را در یک Brand Prompt ذخیره کنید:
{
"background": "dark navy gradient",
"accent_color": "subtle purple",
"lighting": "soft studio lighting",
"composition": "subject left, text space right",
"style": "premium enterprise minimal",
"forbidden_elements": [
"robot",
"brain icon",
"watermark",
"generated text",
"visual clutter"
]
}
سپس Brand Prompt را به درخواست هر تصویر اضافه کنید.
برای ثبات بیشتر:
- از تصویر مرجع استفاده کنید.
- رنگها را دقیق تعریف کنید.
- زاویه دوربین را ثابت نگه دارید.
- نسبت ابعاد را تغییر ندهید.
- تغییرات را بهصورت مرحلهای انجام دهید.
- هر بار فقط یک یا دو ویژگی را تغییر دهید.
ویرایش چندمرحلهای یا یک Prompt بزرگ؟
برای ویرایش پیچیده معمولاً چند مرحله کنترل بیشتری ایجاد میکند.
مثلاً بهجای درخواست همزمان این تغییرات:
- تغییر پسزمینه
- تغییر لباس
- افزودن محصول
- تغییر نور
- افزودن نوشته
میتوان مراحل را جدا کرد:
- اصلاح پسزمینه
- بررسی خروجی
- تغییر نور
- بررسی خروجی
- افزودن عنصر جدید
- افزودن نوشته نهایی با ابزار طراحی
این روش کمک میکند اگر یکی از مراحل اشتباه شد، مجبور نباشید تمام فرایند را از ابتدا انجام دهید.
مدیریت کیفیت و هزینه
قیمت تولید تصویر میتواند بر اساس مدل، اندازه، کیفیت، تعداد تصاویر و حجم ورودی متفاوت باشد. اعداد ثابت قیمت ممکن است تغییر کنند؛ بنابراین آخرین قیمت را در صفحه مدلهای درواره مشاهده کنید.
برای کنترل هزینه:
کیفیت را بر اساس مرحله انتخاب کنید
برای ایدهپردازی اولیه از کیفیت اقتصادیتر و برای خروجی نهایی از کیفیت بالاتر استفاده کنید.
تعداد خروجی را محدود کنید
بهجای تولید تعداد زیادی تصویر، ابتدا Prompt را اصلاح و سپس چند Variation هدفمند بسازید.
اندازه مناسب انتخاب کنید
اگر تصویر فقط Thumbnail است، تولید خروجی بسیار بزرگ ممکن است توجیه نداشته باشد.
ورودی را قبل از ارسال اعتبارسنجی کنید
ابعاد، نوع فایل و حجم تصویر باید کنترل شوند تا درخواست نامعتبر به مدل ارسال نشود.
تصویر تکراری را Cache کنید
اگر Prompt و تنظیمات کاملاً یکسان هستند، میتوان نتیجه قبلی را مجدداً استفاده کرد.
سهمیه کاربران را مدیریت کنید
برای هر کاربر محدودیت تعریف کنید:
- تعداد تولید روزانه
- تعداد درخواست همزمان
- سطح کیفیت مجاز
- حداکثر اندازه
- بودجه مصرف
- تعداد ویرایش هر تصویر
انتخاب مدل با Routing
همه درخواستهای تصویری به قویترین مدل نیاز ندارند.
| نوع درخواست | مسیر پیشنهادی |
|---|---|
| Thumbnail ساده | مدل اقتصادی تصویری |
| ایدهپردازی سریع | مدل سریع |
| تصویر تبلیغاتی نهایی | GPT Image 2 |
| ویرایش دقیق محصول | GPT Image 2 |
| حفظ جزئیات ورودی | GPT Image 2 |
| تولید انبوه نسخه اولیه | مدل اقتصادی |
| خروجی نهایی کمپین | GPT Image 2 |
| درخواست ویدئویی | مدل تخصصی Video |
میتوانید ابتدا Preview ارزانتر بسازید و فقط پس از تأیید کاربر، خروجی نهایی را با کیفیت بالاتر تولید کنید.
مدیریت خطا
خطای Model ID
Model ID را دقیقاً از صفحه مدلهای درواره کپی کنید.
خطای ورودی تصویر
موارد زیر را بررسی کنید:
- فرمت فایل
- حجم فایل
- سالمبودن فایل
- نوع MIME
- ابعاد تصویر
- تعداد ورودیهای مجاز
Timeout
برای تولید تصویر Timeout بیشتری نسبت به پاسخ متنی در نظر بگیرید. در برنامههای Production از Job Queue استفاده کنید.
Rate Limit
از Exponential Backoff، صف پردازش و محدودیت Concurrency استفاده کنید.
خروجی خالی یا ناقص
قبل از ذخیره فایل بررسی کنید:
- فیلد تصویر وجود دارد.
- رشته Base64 خالی نیست.
- Base64 قابل Decode است.
- نوع واقعی فایل معتبر است.
- تصویر Decodeشده قابل بازشدن است.
نمونه اعتبارسنجی Python:
import base64
from io import BytesIO
from PIL import Image
def validate_base64_image(value: str) -> bytes:
image_bytes = base64.b64decode(
value,
validate=True
)
with Image.open(BytesIO(image_bytes)) as image:
image.verify()
return image_bytes
نکات ذخیرهسازی خروجی
برای ذخیره تصاویر در Production:
- از نام فایل تصادفی استفاده کنید.
- فایل را در Object Storage نگه دارید.
- Metadata را در Database ذخیره کنید.
- لینک دانلود زماندار بسازید.
- فایلهای موقت را پاک کنید.
- نسخه اصلی و Thumbnail را جدا نگه دارید.
- فرمت مناسب وب مانند WebP ایجاد کنید.
- ابعاد تصویر را قبل از نمایش کنترل کنید.
ساختار پیشنهادی مسیر:
users/{user_id}/images/{year}/{month}/{image_id}.webp
بهینهسازی تصویر برای وب
خروجی خام ممکن است برای وب بهینه نباشد. پس از تولید:
- ابعاد نهایی را تعیین کنید.
- تصویر را به WebP یا AVIF تبدیل کنید.
- Metadata غیرضروری را حذف کنید.
- Thumbnail بسازید.
- حجم فایل را اندازه بگیرید.
- نسخه اصلی را در صورت نیاز نگه دارید.
- از CDN استفاده کنید.
نمونه تبدیل به WebP:
from PIL import Image
with Image.open("generated-image.png") as image:
image.save(
"generated-image.webp",
"WEBP",
quality=88,
method=6
)
ارزیابی کیفیت GPT Image 2
ارزیابی مدل تصویری نباید فقط بر اساس «زیبا بودن» انجام شود.
معیارهای کاربردی:
Prompt Adherence
آیا تصویر دستورهای اصلی Prompt را رعایت کرده است؟
Composition Accuracy
آیا سوژه و فضای خالی در محل تعیینشده قرار دارند؟
Text Accuracy
آیا نوشتهها صحیح، کامل و خوانا هستند؟
Input Preservation
در ویرایش، چه میزان از جزئیات تصویر اصلی حفظ شده است؟
Brand Consistency
آیا رنگ، نور و سبک با هویت برند هماهنگ است؟
Product Fidelity
آیا محصول واقعی با دقت نمایش داده شده است؟
Visual Quality
آیا نور، سایه، متریال و جزئیات طبیعی هستند؟
Edit Locality
آیا فقط بخش خواستهشده تغییر کرده یا قسمتهای دیگر نیز ناخواسته تغییر کردهاند؟
برای مقایسه مدلها یک Dataset واقعی از Promptهای کسبوکار خودتان بسازید و خروجیها را با معیارهای ثابت امتیازدهی کنید.
اشتباهات رایج
Prompt بسیار کوتاه
درخواست «یک عکس تبلیغاتی بساز» کنترل کافی روی نتیجه ایجاد نمیکند.
درخواست چندین تغییر پیچیده در یک مرحله
تغییر مرحلهای معمولاً قابلکنترلتر است.
مشخصنکردن عناصر ثابت
در ویرایش تصویر باید دقیقاً بگویید چه چیزهایی نباید تغییر کنند.
قراردادن API Key در Frontend
کلید API باید فقط روی سرور نگهداری شود.
ذخیره مستقیم Base64 در Database
برای اغلب پروژهها بهتر است فایل در Object Storage و فقط URL و Metadata در Database ذخیره شوند.
تولید کیفیت بالا برای Preview
ابتدا Preview بسازید و کیفیت بالا را برای خروجی تأییدشده استفاده کنید.
اعتماد کامل به متن فارسی داخل تصویر
تمام نوشتهها را بررسی یا در مرحله نهایی با ابزار طراحی اضافه کنید.
استفاده از مدل تصویر برای تولید ویدئو
GPT Image 2 مدل تولید تصویر است. برای Video باید از مدل تخصصی تولید ویدئو استفاده شود.
ثابتکردن قیمت در برنامه
قیمت و دسترسی مدلها ممکن است تغییر کند. همیشه صفحه مدلهای درواره را بررسی کنید.
پرسشهای متداول
GPT Image 2 چیست؟
GPT Image 2 یک مدل تخصصی برای تولید و ویرایش تصاویر با استفاده از متن و تصویر ورودی است.
آیا GPT Image 2 عکس را از متن میسازد؟
بله. میتوانید یک Prompt متنی ارسال کنید و تصویر جدید دریافت کنید.
آیا میتوان با آن عکس موجود را ویرایش کرد؟
بله. مدل از ورودی تصویری و Image Editing پشتیبانی میکند.
آیا میتوان پسزمینه عکس محصول را تغییر داد؟
بله. بهتر است در Prompt تأکید کنید که محصول، لوگو، نوشتهها، رنگ و زاویه دوربین ثابت بمانند.
آیا GPT Image 2 برای ساخت تصویر تبلیغاتی مناسب است؟
بله. تولید تصویر کمپین، بنر، تصویر محصول، محتوای شبکه اجتماعی و کاور مقاله از کاربردهای آن هستند.
آیا GPT Image 2 میتواند متن فارسی داخل تصویر بنویسد؟
میتواند نوشته تولید کند، اما متن فارسی باید حتماً بازبینی شود. برای تایپوگرافی کاملاً دقیق بهتر است متن در مرحله طراحی نهایی اضافه شود.
آیا این مدل ویدئو تولید میکند؟
خیر. GPT Image 2 برای تولید و ویرایش تصویر است و خروجی ویدئویی ندارد.
آیا Streaming پشتیبانی میشود؟
طبق صفحه رسمی مدل، Streaming برای GPT Image 2 پشتیبانی نمیشود.
آیا GPT Image 2 از Function Calling پشتیبانی میکند؟
خیر. این مدل تخصصی تصویر است و Function Calling قابلیت اصلی آن نیست.
خروجی API چه فرمتی دارد؟
بسته به Endpoint و تنظیمات سرویس، تصویر ممکن است به شکل داده Base64 یا ساختار خروجی تصویری ارائه شود. ساختار دقیق پاسخ درواره را بررسی کنید.
Model ID درواره چیست؟
برای جلوگیری از استفاده از شناسه اشتباه یا قدیمی، GPT Image 2 را در صفحه مدلهای درواره جستوجو کرده و Model ID درواره را مستقیماً کپی کنید.
قیمت GPT Image 2 چقدر است؟
قیمت ممکن است بر اساس کیفیت، اندازه، ورودی و تنظیمات تغییر کند. آخرین قیمت را در صفحه مدلهای درواره مشاهده کنید.
Base URL درواره چیست؟
https://api.darvareh.ir/v1
چگونه API Key درواره بگیریم؟
در درواره ثبتنام کنید و از پنل کاربری یک API Key بسازید.
آیا میتوان API را مستقیماً در React استفاده کرد؟
خیر. فراخوانی باید از Backend انجام شود تا API Key افشا نشود.
جمعبندی
GPT Image 2 یک مدل تخصصی و پیشرفته برای ساخت تصویر از متن، ویرایش عکس، تغییر سبک، بازطراحی صحنه و تولید محتوای بصری در محصولات نرمافزاری است.
پشتیبانی از ورودی متنی و تصویری، اندازههای انعطافپذیر و حفظ بهتر جزئیات تصویر ورودی باعث میشود این مدل برای فروشگاه اینترنتی، ابزارهای طراحی، پلتفرمهای تولید محتوا، بازاریابی و ساخت تصاویر برند کاربردی باشد.
برای رسیدن به خروجی حرفهای، فقط انتخاب مدل کافی نیست. Prompt باید موضوع، محیط، ترکیببندی، نور، سبک، عناصر ثابت و محدودیتها را دقیق مشخص کند. در Production نیز باید Job Queue، کنترل هزینه، ذخیرهسازی فایل، اعتبارسنجی خروجی و سهمیه کاربران را در نظر بگیرید.
برای مشاهده قیمت بهروز، وضعیت دسترسی و Model ID درواره به صفحه مدلهای درواره مراجعه کنید. سپس در درواره ثبتنام کرده، API Key خود را دریافت کنید و با Base URL زیر قابلیت تولید تصویر را به محصول خود اضافه کنید:
https://api.darvareh.ir/v1
مقالات مرتبط
- بهترین ابزارهای ساخت تصویر با هوش مصنوعی
- راهنمای API تولید تصویر در درواره
- آموزش کامل ویرایش عکس با هوش مصنوعی
- افزایش کیفیت عکس با هوش مصنوعی
- حذف پسزمینه عکس با هوش مصنوعی
- حذف افراد و اشیای اضافی از عکس با هوش مصنوعی
- ساخت عکس محصول با هوش مصنوعی
- ساخت عکس پروفایل با هوش مصنوعی
- ساخت لوگو با هوش مصنوعی
- تبدیل عکس به کارتون با هوش مصنوعی
- بازسازی عکسهای قدیمی با هوش مصنوعی
- تبدیل عکس به ویدئو با هوش مصنوعی