ساخت عکس با Gemini و Nano Banana؛ آموزش کامل تولید و ویرایش تصویر با هوش مصنوعی گوگل

در این راهنمای جامع یاد می‌گیرید چگونه با Gemini و Nano Banana عکس بسازید، تصاویر موجود را ویرایش کنید، پرامپت حرفه‌ای بنویسید و قابلیت تولید تصویر را از طریق API در نرم‌افزار خود به کار ببرید.

Share
ساخت عکس با Gemini و Nano Banana؛ آموزش کامل تولید و ویرایش تصویر با هوش مصنوعی گوگل

ساخت عکس با Gemini و Nano Banana؛ از پرامپت ساده تا تولید تصویر با API

ساخت عکس با هوش مصنوعی دیگر فقط به واردکردن چند کلمه و دریافت یک تصویر تصادفی محدود نیست. ابزارهای جدید می‌توانند دستورهای پیچیده را بفهمند، تصاویر قبلی را ویرایش کنند، سبک بصری یک برند را حفظ کنند و بر اساس چند عکس مرجع، خروجی منسجم بسازند.

Gemini، هوش مصنوعی گوگل، قابلیت تولید و ویرایش تصویر خود را با نام Nano Banana ارائه می‌کند. این نام برخلاف ظاهر غیررسمی آن، به خانواده‌ای از مدل‌های حرفه‌ای تولید تصویر Gemini اشاره دارد.

کاربر عادی می‌تواند از این قابلیت در محیط Gemini استفاده کند و برنامه‌نویسان نیز می‌توانند آن را از طریق API به فروشگاه اینترنتی، سامانه تولید محتوا، ابزار طراحی، اپلیکیشن موبایل یا فرایند اتوماسیون خود متصل کنند.

در این آموزش بررسی می‌کنیم:

  • Nano Banana چیست و چه ارتباطی با Gemini دارد؟
  • چگونه با Gemini عکس بسازیم؟
  • چگونه یک عکس را با دستور متنی ویرایش کنیم؟
  • چطور برای تولید تصویر، پرامپت حرفه‌ای بنویسیم؟
  • چگونه چهره، محصول یا شخصیت را در چند تصویر ثابت نگه داریم؟
  • کدام مدل برای هر پروژه مناسب‌تر است؟
  • چگونه قابلیت تولید تصویر را از طریق API پیاده‌سازی کنیم؟
  • محدودیت‌ها و ملاحظات حقوقی این فناوری چیست؟

Nano Banana چیست؟

Nano Banana نام قابلیت‌ها و مدل‌های بومی تولید و ویرایش تصویر در خانواده Gemini است. این مدل‌ها می‌توانند متن و تصویر را به‌عنوان ورودی دریافت کنند و متن، تصویر یا ترکیبی از هر دو را تحویل دهند.

برخلاف ابزارهای سنتی Text to Image، فرایند کار با Nano Banana حالت مکالمه‌ای دارد. یعنی می‌توانید پس از تولید تصویر، بدون شروع مجدد از مدل بخواهید:

  • رنگ لباس را تغییر دهد؛
  • یک شیء را از تصویر حذف کند؛
  • پس‌زمینه را عوض کند؛
  • زاویه دوربین را اصلاح کند؛
  • فضای خالی برای تیتر ایجاد کند؛
  • متن مشخصی روی پوستر قرار دهد؛
  • سبک همان تصویر را در نسخه‌های بعدی حفظ کند.

بر اساس مستندات فعلی گوگل، خانواده Nano Banana شامل چند مدل با تمرکزهای متفاوت است:

نام تجاریمدلکاربرد اصلی
Nano Banana 2 Litegemini-3.1-flash-lite-imageتولید سریع، ارزان و انبوه
Nano Banana 2gemini-3.1-flash-imageانتخاب عمومی با توازن مناسب کیفیت، سرعت و هزینه
Nano Banana Progemini-3-pro-imageطراحی حرفه‌ای، دستورات پیچیده و کنترل دقیق
Nano Bananagemini-2.5-flash-imageنسل قدیمی‌تر خانواده Nano Banana

گوگل مدل Nano Banana 2 را برای استفاده عمومی و متوازن و Nano Banana Pro را برای تولید دارایی‌های حرفه‌ای پیشنهاد می‌کند. نام مدل‌ها، وضعیت Preview و دسترسی منطقه‌ای ممکن است تغییر کند؛ بنابراین پیش از توسعه محصول، حتماً فهرست مدل‌های حساب یا سرویس API خود را بررسی کنید. جزئیات فنی به‌روز در مستندات رسمی تولید تصویر Gemini و صفحه مدل Gemini 3.1 Flash Image منتشر می‌شود.

تفاوت Gemini و Nano Banana چیست؟

Gemini نام خانواده مدل‌ها و محصولات هوش مصنوعی گوگل است. Nano Banana نام خانواده قابلیت‌های تولید و ویرایش تصویر بومی Gemini محسوب می‌شود.

به زبان ساده:

  • Gemini: اکوسیستم هوش مصنوعی چندوجهی گوگل
  • Nano Banana: مدل‌ها و قابلیت‌های تصویری این اکوسیستم
  • Gemini App: رابط کاربری عمومی برای گفت‌وگو و استفاده از مدل‌ها
  • Gemini API: رابط برنامه‌نویسی برای اتصال مدل‌ها به نرم‌افزار
  • Google AI Studio: محیط آزمایش پرامپت و API برای توسعه‌دهندگان

بنابراین عبارت‌های «ساخت عکس با Gemini»، «ساخت عکس با جمینای» و «ساخت عکس با Nano Banana» معمولاً به یک خانواده از قابلیت‌ها اشاره دارند.

Nano Banana چه کارهایی انجام می‌دهد؟

۱. ساخت عکس از متن

شما صحنه موردنظر را با یک Prompt یا پرامپت توضیح می‌دهید و مدل تصویری متناسب با آن تولید می‌کند.

مثال:

یک عکس تبلیغاتی واقع‌گرایانه از یک فنجان سرامیکی مشکی روی میز چوبی تیره بساز. نور گرم از سمت چپ بتابد، پس‌زمینه محو باشد و در سمت راست فضای خالی کافی برای تیتر تبلیغاتی قرار بگیرد. نسبت تصویر ۱۶:۹.

۲. ویرایش عکس با متن

یک تصویر آپلود می‌کنید و تغییرات موردنظر را توضیح می‌دهید:

پس‌زمینه این عکس محصول را با یک آشپزخانه مدرن و مینیمال جایگزین کن. خود محصول، لوگو، نوشته‌های روی بسته‌بندی و نسبت ابعاد آن کاملاً بدون تغییر باقی بماند.

۳. ترکیب چند عکس مرجع

می‌توانید چند مرجع مانند عکس محصول، رنگ سازمانی، سبک نورپردازی و نمونه ترکیب‌بندی را به مدل بدهید تا خروجی جدیدی بر اساس آن‌ها بسازد.

مدل‌های جدید Gemini Image بسته به مدل و نوع مرجع، از چندین تصویر ورودی پشتیبانی می‌کنند. با این حال، افزایش تعداد منابع همیشه به معنی نتیجه بهتر نیست. هر تصویر باید نقش مشخصی داشته باشد.

۴. حذف یا افزودن اجزای تصویر

برای مثال:

گلدان سمت چپ را حذف کن و با بازسازی طبیعی دیوار و سایه‌ها، فضای خالی ایجادشده را پر کن. هیچ بخش دیگری از تصویر تغییر نکند.

یا:

یک لپ‌تاپ نقره‌ای بسته روی میز اضافه کن. زاویه، پرسپکتیو، بازتاب و جهت نور آن باید با صحنه اصلی هماهنگ باشد.

۵. تغییر سبک تصویر

می‌توانید عکس را به تصویرسازی، نقاشی دیجیتال، سه‌بعدی یا سبک‌های گرافیکی عمومی تبدیل کنید:

این منظره را به یک تصویرسازی سه‌بعدی نرم و رنگارنگ تبدیل کن. ساختمان‌ها و ترکیب‌بندی اصلی حفظ شوند و هیچ متن یا لوگویی به تصویر اضافه نشود.

بهتر است به‌جای درخواست تقلید دقیق از سبک هنرمندان زنده، ویژگی‌های بصری موردنظر مانند نوع رنگ، نور، بافت و شیوه طراحی را توصیف کنید.

۶. قرار دادن متن داخل تصویر

مدل‌های جدید در نمایش متن پیشرفت کرده‌اند و برای پوستر، منو، اینفوگرافیک و بنر مناسب‌تر شده‌اند؛ اما همچنان باید نوشته نهایی را بررسی کنید.

نمونه پرامپت:

یک پوستر مینیمال برای کارگاه برنامه‌نویسی بساز. عبارت «آموزش عملی هوش مصنوعی» دقیقاً با همین املا و فقط یک‌بار در بالای پوستر نوشته شود. زیر آن فضای خالی برای درج تاریخ باقی بگذار. رنگ‌های اصلی سرمه‌ای و فیروزه‌ای باشند. نسبت تصویر ۴:۵.

برای متن فارسی طولانی، روش مطمئن‌تر این است که پس‌زمینه را با هوش مصنوعی بسازید و نوشته نهایی را در Figma، Photoshop یا Canva قرار دهید.

آموزش ساخت عکس با Gemini

رابط و نام گزینه‌ها ممکن است بر اساس نسخه برنامه، نوع حساب و منطقه جغرافیایی متفاوت باشد، اما فرایند کلی به این صورت است:

  1. وارد برنامه یا وب‌سایت Gemini شوید.
  2. یک گفت‌وگوی جدید ایجاد کنید.
  3. درخواست خود را با عبارتی مانند «یک تصویر بساز» شروع کنید.
  4. موضوع، سبک، نور، زاویه و نسبت تصویر را مشخص کنید.
  5. تصویر تولیدشده را بررسی کنید.
  6. اصلاحات را در همان گفت‌وگو مرحله‌به‌مرحله درخواست کنید.
  7. خروجی نهایی را از نظر جزئیات، نوشته‌ها و مجوز استفاده بازبینی کنید.

یک پرامپت اولیه مناسب:

یک تصویر واقع‌گرایانه از میز کار یک برنامه‌نویس ایرانی در یک فضای مدرن بساز. روی میز مانیتور، کیبورد و دفتر یادداشت قرار داشته باشد. نور طبیعی صبح از پنجره وارد شود. تصویر تمیز و حرفه‌ای باشد و هیچ نوشته خوانایی روی مانیتور نمایش داده نشود. نسبت تصویر ۱۶:۹.

سپس می‌توانید ادامه دهید:

ترکیب‌بندی را حفظ کن، اما رنگ نور را کمی گرم‌تر کن و در سمت چپ فضای خالی بیشتری برای عنوان مقاله ایجاد کن.

این روش مکالمه‌ای معمولاً نتیجه دقیق‌تری نسبت به نوشتن یک پرامپت بسیار طولانی و تلاش برای حل تمام مشکلات در یک مرحله ایجاد می‌کند.

فرمول حرفه‌ای پرامپت ساخت عکس

یک پرامپت خوب معمولاً از اجزای زیر تشکیل می‌شود:

سوژه + محیط + ترکیب‌بندی + زاویه دوربین + نور + سبک + رنگ + محدودیت‌ها + نسبت تصویر + کاربرد خروجی

قالب پیشنهادی:

یک [نوع تصویر] از [سوژه اصلی] در [محیط] بساز. سوژه در [محل قرارگیری در کادر] باشد. تصویر از زاویه [زاویه دوربین] ثبت شود و نور [نوع نور] داشته باشد. سبک بصری [سبک] و پالت رنگ [رنگ‌ها] باشد. [مواردی که باید حفظ شوند]. [موارد ممنوع]. نسبت تصویر [نسبت] و کاربرد آن [کاربرد] است.

مثال برای عکس محصول

یک عکس تبلیغاتی استودیویی و کاملاً واقع‌گرایانه از این بطری بساز. بطری در مرکز کادر روی سطح سنگی روشن قرار بگیرد. نورپردازی سه‌نقطه‌ای نرم با بازتاب کنترل‌شده استفاده شود. شکل بطری، رنگ مایع، لوگو و نوشته‌های بسته‌بندی بدون تغییر باقی بمانند. هیچ محصول یا نوشته اضافی ایجاد نشود. نسبت تصویر ۱:۱ و مناسب صفحه محصول فروشگاه اینترنتی باشد.

مثال برای تصویر شاخص مقاله

یک تصویر مفهومی مدرن درباره API هوش مصنوعی بساز. یک هسته نورانی هوش مصنوعی در مرکز قرار داشته باشد و از طریق مسیرهای داده به چند نرم‌افزار متصل شود. پالت سرمه‌ای، بنفش و فیروزه‌ای، نور سینمایی ملایم و طراحی تمیز باشد. در سمت راست فضای منفی کافی برای تیتر فارسی ایجاد کن. هیچ متن، لوگو یا واترمارک بصری اضافه نکن. نسبت ۱۶:۹.

مثال برای پست اینستاگرام

یک تصویر تبلیغاتی مدرن برای معرفی یک دوره Python بساز. لپ‌تاپی با محیط کدنویسی غیرخوانا روی میز قرار داشته باشد و عناصر انتزاعی مرتبط با داده در اطراف آن دیده شوند. پالت سبز تیره و زرد، نورپردازی حرفه‌ای و ترکیب‌بندی مناسب پست اینستاگرام باشد. یک‌سوم بالای تصویر برای اضافه‌کردن تیتر خالی بماند. نسبت ۴:۵.

آیا پرامپت فارسی بهتر است یا انگلیسی؟

Gemini زبان فارسی را درک می‌کند و بسیاری از درخواست‌ها را می‌توان کاملاً فارسی نوشت. بااین‌حال، کیفیت پیروی از دستور در همه زبان‌ها و مدل‌ها الزاماً یکسان نیست.

روش پیشنهادی:

  • ابتدا پرامپت را فارسی و دقیق بنویسید.
  • اگر نتیجه ضعیف بود، نسخه انگلیسی همان دستور را آزمایش کنید.
  • اصطلاحات تخصصی عکاسی را در صورت نیاز انگلیسی بنویسید.
  • نوشته‌ای که باید داخل تصویر باشد، دقیقاً داخل گیومه قرار دهید.
  • در یک پرامپت، دستورهای متناقض فارسی و انگلیسی ننویسید.

اصطلاحات مفید عکاسی:

  • close-up: نمای نزدیک
  • wide shot: نمای باز
  • top-down: نمای کاملاً از بالا
  • 45-degree angle: زاویه ۴۵ درجه
  • shallow depth of field: عمق میدان کم
  • softbox lighting: نور نرم استودیویی
  • golden hour: نور ساعت طلایی
  • bokeh: محوشدگی زیبای پس‌زمینه
  • negative space: فضای خالی برای متن
  • photorealistic: واقع‌گرایانه

چگونه عکس تولیدشده را دقیق‌تر اصلاح کنیم؟

به‌جای گفتن «بهترش کن»، تغییر را قابل‌اندازه‌گیری کنید.

دستور ضعیف:

عکس را حرفه‌ای‌تر کن.

دستور بهتر:

موقعیت محصول و زاویه دوربین را تغییر نده. شدت سایه زیر محصول را ۳۰ درصد کمتر کن، پس‌زمینه را به خاکستری بسیار روشن تغییر بده و بازتاب روی قسمت بالای بسته‌بندی را کاهش بده.

برای اصلاح دقیق، سه بخش را مشخص کنید:

  1. چه چیزی باید تغییر کند؟
  2. چه چیزی نباید تغییر کند؟
  3. نتیجه مطلوب چه ویژگی قابل مشاهده‌ای دارد؟

قالب مناسب:

فقط [بخش موردنظر] را تغییر بده. [اجزای ثابت] بدون تغییر باقی بمانند. خروجی باید [ویژگی نهایی] داشته باشد.

حفظ چهره، شخصیت یا محصول در چند تصویر

یکی از نیازهای مهم تولیدکنندگان محتوا، Character Consistency یا ثبات شخصیت است. برای رسیدن به نتیجه بهتر:

  • از تصاویر مرجع واضح و باکیفیت استفاده کنید.
  • عکس‌هایی با نور و زاویه‌های متفاوت ارائه دهید.
  • نقش هر مرجع را توضیح دهید.
  • ویژگی‌های ثابت را صریحاً فهرست کنید.
  • در هر مرحله فقط یک یا دو تغییر اعمال کنید.
  • بهترین خروجی را مرجع مرحله بعد قرار دهید.

نمونه:

تصویر اول مرجع چهره و تصویر دوم مرجع لباس است. یک عکس جدید از همین شخصیت در کتابخانه بساز. فرم صورت، رنگ چشم، مدل مو و ویژگی‌های چهره تصویر اول حفظ شود. طرح و رنگ لباس مطابق تصویر دوم باشد. حالت چهره طبیعی و نور محیط گرم باشد.

تولید خروجی مشابه از یک فرد واقعی همیشه باید با رضایت او انجام شود. از جعل هویت، تولید محتوای فریبنده یا استفاده آسیب‌زا از چهره دیگران خودداری کنید.

انتخاب نسبت تصویر مناسب

کاربردنسبت پیشنهادی
پست مربعی۱:۱
پست عمودی اینستاگرام۴:۵
استوری و ویدئوی عمودی۹:۱۶
تصویر شاخص وبلاگ۱۶:۹
بنر عریض۲۱:۹
تصویر پرتره۳:۴ یا ۲:۳
عکس محصول فروشگاهی۱:۱ یا ۴:۵

نسبت تصویر را در پرامپت و در تنظیمات API مشخص کنید. صرفاً نوشتن «عکس اینستاگرامی» همیشه ابعاد موردنظر را تضمین نمی‌کند.

چه مدلی را انتخاب کنیم؟

Nano Banana 2 Lite

برای کارهایی مناسب است که سرعت و هزینه مهم‌تر از کنترل پیچیده هستند:

  • تولید انبوه تصاویر ساده
  • ساخت Thumbnailهای اولیه
  • آزمایش چند ایده
  • تولید دارایی‌های تصویری در مقیاس بالا

این مدل برای ویرایش‌های چندمرحله‌ای پیچیده و تعداد زیاد تصاویر مرجع، انتخاب اصلی نیست.

Nano Banana 2

انتخاب عمومی برای اکثر پروژه‌ها:

  • تولید عکس از متن
  • ویرایش مکالمه‌ای تصویر
  • عکس محصول
  • محتوای شبکه اجتماعی
  • چند تصویر مرجع
  • نیاز به توازن کیفیت، سرعت و هزینه

این مدل از خروجی‌های ۰٫۵K، ۱K، ۲K و ۴K پشتیبانی می‌کند و طبق مستندات گوگل، قابلیت‌های بهبود‌یافته‌ای در رعایت نسبت تصویر و نمایش متن دارد.

Nano Banana Pro

برای پروژه‌هایی که کیفیت و کنترل دقیق اهمیت بیشتری دارند:

  • دارایی‌های تبلیغاتی حرفه‌ای
  • طراحی‌هایی با نوشته داخل تصویر
  • ترکیب‌بندی‌های پیچیده
  • حفظ سبک برند
  • اینفوگرافیک و محتوای ساختاریافته
  • خروجی‌هایی که به استدلال بصری بیشتری نیاز دارند

هزینه و زمان پاسخ این مدل می‌تواند بیشتر از مدل‌های Flash باشد.

آموزش استفاده از Nano Banana API با Python

برای اجرای مستقیم نمونه رسمی Gemini API، ابتدا کتابخانه مربوط را نصب کنید:

pip install google-genai pillow

کلید API را در متغیر محیطی قرار دهید. کلید را داخل کد، مخزن Git یا Frontend ذخیره نکنید:

export GEMINI_API_KEY="YOUR_API_KEY"

نمونه تولید تصویر:

from google import genai
from google.genai import types

client = genai.Client()

prompt = """
یک عکس تبلیغاتی واقع‌گرایانه از یک هدفون بی‌سیم مشکی
روی میز چوبی روشن بساز. نور نرم استودیویی، پس‌زمینه
مینیمال و فضای خالی در سمت راست برای تیتر ایجاد کن.
هیچ نوشته یا لوگوی اضافی تولید نکن.
"""

response = client.models.generate_content(
    model="gemini-3.1-flash-image",
    contents=prompt,
    config=types.GenerateContentConfig(
        response_modalities=["IMAGE"],
        image_config=types.ImageConfig(
            aspect_ratio="16:9",
            image_size="2K"
        )
    )
)

for index, part in enumerate(response.parts):
    if part.inline_data is not None:
        image = part.as_image()
        image.save(f"output-{index}.png")

پارامترها و ساختار SDK ممکن است در نسخه‌های بعدی تغییر کنند؛ نسخه نهایی کد را با مستندات رسمی SDK تطبیق دهید.

ویرایش تصویر با Python

from google import genai
from google.genai import types
from PIL import Image

client = genai.Client()

source_image = Image.open("product.png")

prompt = """
پس‌زمینه این تصویر محصول را به یک استودیوی سفید مینیمال
تغییر بده. شکل محصول، ابعاد، رنگ، لوگو و نوشته‌های روی
بسته‌بندی کاملاً ثابت بمانند. یک سایه نرم و طبیعی زیر محصول
ایجاد کن. نسبت تصویر 1:1 باشد.
"""

response = client.models.generate_content(
    model="gemini-3.1-flash-image",
    contents=[prompt, source_image],
    config=types.GenerateContentConfig(
        response_modalities=["IMAGE"],
        image_config=types.ImageConfig(
            aspect_ratio="1:1",
            image_size="2K"
        )
    )
)

for index, part in enumerate(response.parts):
    if part.inline_data is not None:
        part.as_image().save(f"edited-product-{index}.png")

نمونه استفاده با JavaScript

import { GoogleGenAI } from "@google/genai";
import { writeFile } from "node:fs/promises";

const ai = new GoogleGenAI({
  apiKey: process.env.GEMINI_API_KEY,
});

const response = await ai.models.generateContent({
  model: "gemini-3.1-flash-image",
  contents: `
    یک تصویر شاخص مدرن درباره برنامه‌نویسی با هوش مصنوعی بساز.
    پالت سرمه‌ای و فیروزه‌ای، ترکیب‌بندی خلوت و نور نرم باشد.
    در سمت چپ فضای خالی برای تیتر قرار بده.
    هیچ متن یا لوگویی تولید نکن. نسبت تصویر 16:9.
  `,
  config: {
    responseModalities: ["IMAGE"],
    imageConfig: {
      aspectRatio: "16:9",
      imageSize: "2K",
    },
  },
});

for (const [index, part] of response.candidates[0].content.parts.entries()) {
  if (part.inlineData) {
    const buffer = Buffer.from(part.inlineData.data, "base64");
    await writeFile(`image-${index}.png`, buffer);
  }
}

معماری امن برای اضافه‌کردن تولید تصویر به وب‌سایت

کلید API نباید در JavaScript مرورگر، اپلیکیشن قابل مهندسی معکوس یا مخزن عمومی قرار بگیرد.

معماری مناسب:

کاربر
  ↓
Frontend
  ↓
Backend شما
  ↓
سرویس API هوش مصنوعی
  ↓
فضای ذخیره‌سازی تصویر
  ↓
آدرس موقت یا کنترل‌شده برای کاربر

Backend باید این وظایف را انجام دهد:

  • احراز هویت کاربر
  • محدودکردن تعداد درخواست‌ها
  • بررسی حجم و فرمت فایل
  • پاک‌سازی نام فایل
  • کنترل محتوای ورودی
  • ثبت هزینه و مصرف
  • مدیریت Timeout و Retry
  • ذخیره امن خروجی
  • حذف داده‌های موقت
  • جلوگیری از افشای کلید API

اتصال قابلیت تولید تصویر به API درواره

اگر می‌خواهید مدل‌های مختلف هوش مصنوعی را از یک زیرساخت داخلی مدیریت کنید، می‌توانید کاتالوگ مدل‌های موجود در درواره را بررسی کنید.

آدرس پایه API درواره:

https://api.darvareh.ir/v1

از آنجا که موجودی و شناسه مدل‌ها ممکن است تغییر کند، پیش از پیاده‌سازی باید بررسی کنید که مدل تصویری موردنظر در کاتالوگ فعلی درواره ارائه شده باشد. شناسه مدل را حدس نزنید و همان مقداری را استفاده کنید که در مستندات یا پنل اعلام شده است.

الگوی عمومی درخواست در سرویس‌های سازگار با OpenAI معمولاً به این شکل است:

import os
import requests

url = "https://api.darvareh.ir/v1/images/generations"

headers = {
    "Authorization": f"Bearer {os.environ['DARVAREH_API_KEY']}",
    "Content-Type": "application/json",
}

payload = {
    "model": "MODEL_ID_FROM_DARVAREH_CATALOG",
    "prompt": """
    یک عکس محصول واقع‌گرایانه از یک ساعت هوشمند
    روی پس‌زمینه روشن بساز. نور نرم و نسبت تصویر مربع باشد.
    """,
    "size": "1024x1024"
}

response = requests.post(
    url,
    headers=headers,
    json=payload,
    timeout=120
)

response.raise_for_status()
print(response.json())

این کد یک الگوی پیاده‌سازی است. Endpoint، پارامترها، فرمت پاسخ و مدل‌های قابل استفاده را باید با مستندات جاری درواره تطبیق دهید.

درواره یک API ارائه می‌کند؛ بنابراین رابط تولید تصویر، گالری، مدیریت کاربران، صف پردازش و تجربه کاربری اپلیکیشن را خودتان بر اساس نیاز محصول می‌سازید.

مدیریت هزینه در پروژه واقعی

تولید تصویر معمولاً از پردازش متن پرهزینه‌تر است. برای کنترل هزینه:

  • پیش‌نمایش را با وضوح پایین‌تر بسازید.
  • فقط خروجی تأییدشده را در ۲K یا ۴K تولید کنید.
  • تعداد تلاش رایگان هر کاربر را محدود کنید.
  • درخواست‌های تکراری را Cache کنید.
  • برای پردازش انبوه از Batch API استفاده کنید.
  • تصویر ورودی را پیش از ارسال فشرده کنید.
  • مدل Lite یا Flash را برای نسخه اولیه به کار ببرید.
  • مدل Pro را فقط برای خروجی‌های حساس استفاده کنید.
  • مصرف هر کاربر و هر پروژه را ثبت کنید.

یک جریان اقتصادی مناسب:

  1. تولید چهار ایده کم‌هزینه
  2. انتخاب یک ترکیب‌بندی توسط کاربر
  3. ویرایش همان نسخه
  4. تولید خروجی نهایی با وضوح بالا
  5. ذخیره نسخه نهایی و حذف فایل‌های موقت

اشتباهات رایج هنگام ساخت عکس با Gemini

پرامپت بیش‌ازحد کوتاه

عبارت «یک عکس زیبا از قهوه بساز» درباره محیط، زاویه، نور و کاربرد خروجی اطلاعاتی نمی‌دهد.

دستورهای متناقض

برای مثال «تصویر بسیار شلوغ و کاملاً مینیمال» مدل را با دو هدف ناسازگار روبه‌رو می‌کند.

تغییر هم‌زمان همه‌چیز

اگر در هر مرحله سوژه، نور، پس‌زمینه، زاویه و سبک را با هم تغییر دهید، کنترل نتیجه دشوار می‌شود.

اعتماد کامل به نوشته داخل تصویر

نام برند، شماره تماس، قیمت و متن فارسی را همیشه بررسی کنید. برای اطلاعات حساس، نوشته را در نرم‌افزار طراحی اضافه کنید.

نادیده‌گرفتن ابعاد نهایی

تصویر خوب با نسبت ۱:۱ ممکن است برای بنر ۱۶:۹ مناسب نباشد. کاربرد را پیش از تولید مشخص کنید.

استفاده از تصویر بدون کنترل انسانی

تصاویر تولیدشده ممکن است جزئیات غیرمنطقی، نوشته اشتباه، اجزای تکراری یا نشانه‌های تجاری ناخواسته داشته باشند.

محدودیت‌های Nano Banana

با وجود پیشرفت مدل‌ها، محدودیت‌هایی وجود دارد:

  • پیروی کامل از تعداد دقیق اشیا همیشه تضمین نمی‌شود.
  • نوشته‌های طولانی ممکن است اشتباه باشند.
  • حفظ دقیق هویت در همه زاویه‌ها قطعی نیست.
  • جزئیات کوچک محصول ممکن است تغییر کنند.
  • خروجی API به مدل، حساب و منطقه وابسته است.
  • پس‌زمینه شفاف به‌صورت مستقیم در همه مدل‌ها پشتیبانی نمی‌شود.
  • نتیجه یک پرامپت ممکن است در اجرای مجدد متفاوت باشد.
  • خروجی باید پیش از انتشار تجاری بررسی شود.

طبق مستندات گوگل، تصاویر تولیدشده توسط این مدل‌ها دارای SynthID هستند؛ SynthID نوعی نشان‌گذاری نامرئی برای شناسایی محتوای تولیدشده با هوش مصنوعی است.

ملاحظات حقوقی و اخلاقی

برای استفاده حرفه‌ای از تولید تصویر:

  • فقط تصاویری را بارگذاری کنید که حق استفاده از آن‌ها را دارید.
  • برای استفاده از چهره افراد رضایت معتبر بگیرید.
  • از جعل هویت و انتشار تصویر فریبنده خودداری کنید.
  • لوگو و علامت تجاری دیگران را بدون مجوز وارد تبلیغ نکنید.
  • شرایط استفاده سرویس و مدل را بررسی کنید.
  • برای حوزه‌های حساس، تولیدی‌بودن تصویر را شفاف اعلام کنید.
  • خروجی را از نظر شباهت ناخواسته به آثار دارای حق نشر بازبینی کنید.
  • اطلاعات محرمانه مشتریان را بدون مجوز به سرویس خارجی ارسال نکنید.

گوگل نیز در مستندات خود تأکید می‌کند که کاربر باید حق استفاده از تصاویر ورودی را داشته باشد و نباید از قابلیت تولید تصویر برای فریب، آزار یا آسیب‌زدن استفاده کند.

کاربردهای تجاری ساخت عکس با Gemini

فروشگاه اینترنتی

  • ساخت پس‌زمینه محصول
  • تولید بنر دسته‌بندی
  • ایجاد تصاویر مناسب کمپین
  • نمایش محصول در محیط‌های مختلف
  • ساخت نسخه‌های متناسب با شبکه‌های اجتماعی

تولید محتوا

  • تصویر شاخص مقاله
  • کاور ویدئو و پادکست
  • تصویر پست اینستاگرام
  • اینفوگرافیک اولیه
  • تصویرسازی داستان و آموزش

طراحی محصول

  • ساخت Moodboard
  • ایده‌پردازی سریع
  • شبیه‌سازی رابط یا بسته‌بندی
  • آزمایش ترکیب‌های رنگ
  • تولید Concept پیش از طراحی نهایی

تبلیغات

  • ساخت چند نسخه از یک ایده
  • شخصی‌سازی تصویر برای گروه‌های مختلف
  • تولید تصاویر مناسب A/B Test
  • تغییر فصل، محیط یا ترکیب‌بندی کمپین

هوش مصنوعی جایگزین کامل عکاس یا طراح نیست؛ اما زمان رسیدن از ایده به نمونه اولیه را به‌شدت کاهش می‌دهد.

پرسش‌های متداول

Nano Banana چیست؟

Nano Banana نام خانواده مدل‌ها و قابلیت‌های تولید و ویرایش تصویر بومی Gemini است. این مدل‌ها می‌توانند متن و تصویر دریافت کنند و به‌صورت مکالمه‌ای تصویر بسازند یا ویرایش کنند.

آیا ساخت عکس با Gemini رایگان است؟

ممکن است Gemini برای برخی حساب‌ها و قابلیت‌ها سهمیه رایگان داشته باشد، اما دسترسی، محدودیت‌ها و هزینه API بر اساس مدل، کشور، حساب و زمان تغییر می‌کند. اطلاعات قیمت را از صفحه رسمی سرویس بررسی کنید.

آیا Gemini پرامپت فارسی را می‌فهمد؟

بله، بسیاری از دستورهای فارسی را درک می‌کند. برای کنترل بیشتر می‌توانید اصطلاحات فنی عکاسی را نیز به انگلیسی بنویسید یا نسخه انگلیسی پرامپت را آزمایش کنید.

آیا می‌توان با Gemini عکس را ویرایش کرد؟

بله. می‌توانید تصویر را همراه یک دستور متنی ارسال کنید و از مدل بخواهید اجزا، پس‌زمینه، نور، رنگ یا سبک آن را تغییر دهد.

آیا Nano Banana همان Gemini است؟

Nano Banana نام قابلیت‌ها و مدل‌های تصویری در اکوسیستم Gemini است؛ بنابراین یک محصول کاملاً جدا از Gemini محسوب نمی‌شود.

بهترین مدل Nano Banana کدام است؟

برای اغلب کارها Nano Banana 2 یا gemini-3.1-flash-image انتخاب متوازن‌تری است. برای پروژه‌های حرفه‌ای پیچیده، Nano Banana Pro مناسب‌تر است و برای تولید انبوه کم‌هزینه می‌توان Lite را بررسی کرد.

آیا Nano Banana خروجی 4K می‌دهد؟

مدل‌های جدید Gemini Image، بسته به مدل و تنظیمات، می‌توانند از خروجی ۲K و ۴K پشتیبانی کنند. وضوح قابل انتخاب را در صفحه مدل بررسی کنید.

آیا می‌توان متن فارسی داخل عکس قرار داد؟

امکان آن وجود دارد، اما صحت متن فارسی باید بررسی شود. برای پوسترهای حساس، بهتر است هوش مصنوعی پس‌زمینه و ترکیب‌بندی را بسازد و متن نهایی در نرم‌افزار طراحی اضافه شود.

آیا می‌توان از خروجی در تبلیغات استفاده کرد؟

این موضوع به شرایط استفاده سرویس، حقوق تصاویر ورودی، علائم تجاری و قوانین محل فعالیت بستگی دارد. پیش از استفاده تجاری، خروجی و مجوزهای لازم را بررسی کنید.

آیا می‌توان Nano Banana را به سایت متصل کرد؟

بله. برنامه‌نویسان می‌توانند از Gemini API یا ارائه‌دهنده API سازگار استفاده کنند و رابط تولید تصویر را در Backend نرم‌افزار خود بسازند.

جمع‌بندی

ساخت عکس با Gemini و Nano Banana فقط یک قابلیت سرگرم‌کننده نیست. این فناوری می‌تواند بخشی از فرایند تولید محتوای سایت، عکاسی محصول، طراحی تبلیغات، نمونه‌سازی و توسعه نرم‌افزار باشد.

برای رسیدن به نتیجه حرفه‌ای:

  • هدف تصویر را پیش از تولید مشخص کنید.
  • پرامپت را به‌صورت صحنه‌ای و دقیق بنویسید.
  • نور، زاویه، سبک و نسبت تصویر را تعیین کنید.
  • تغییرات را مرحله‌به‌مرحله انجام دهید.
  • بخش‌هایی که نباید تغییر کنند صریحاً مشخص کنید.
  • خروجی را از نظر متن، برند، جزئیات و حقوق استفاده بررسی کنید.
  • در پروژه‌های API، امنیت کلید و کنترل هزینه را جدی بگیرید.

اگر قصد دارید قابلیت‌های هوش مصنوعی را به وب‌سایت، اپلیکیشن یا سرویس خود اضافه کنید، مدل‌های موجود و مستندات API درواره را بررسی کنید. درواره دسترسی API به سرویس‌های هوش مصنوعی را برای توسعه‌دهندگان فراهم می‌کند و پیاده‌سازی محصول نهایی، رابط کاربری و منطق کسب‌وکار بر عهده تیم شما خواهد بود.

مقالات مرتبط

Read more