ساخت عکس با Gemini و Nano Banana؛ آموزش کامل تولید و ویرایش تصویر با هوش مصنوعی گوگل
در این راهنمای جامع یاد میگیرید چگونه با Gemini و Nano Banana عکس بسازید، تصاویر موجود را ویرایش کنید، پرامپت حرفهای بنویسید و قابلیت تولید تصویر را از طریق API در نرمافزار خود به کار ببرید.
ساخت عکس با Gemini و Nano Banana؛ از پرامپت ساده تا تولید تصویر با API
ساخت عکس با هوش مصنوعی دیگر فقط به واردکردن چند کلمه و دریافت یک تصویر تصادفی محدود نیست. ابزارهای جدید میتوانند دستورهای پیچیده را بفهمند، تصاویر قبلی را ویرایش کنند، سبک بصری یک برند را حفظ کنند و بر اساس چند عکس مرجع، خروجی منسجم بسازند.
Gemini، هوش مصنوعی گوگل، قابلیت تولید و ویرایش تصویر خود را با نام Nano Banana ارائه میکند. این نام برخلاف ظاهر غیررسمی آن، به خانوادهای از مدلهای حرفهای تولید تصویر Gemini اشاره دارد.
کاربر عادی میتواند از این قابلیت در محیط Gemini استفاده کند و برنامهنویسان نیز میتوانند آن را از طریق API به فروشگاه اینترنتی، سامانه تولید محتوا، ابزار طراحی، اپلیکیشن موبایل یا فرایند اتوماسیون خود متصل کنند.
در این آموزش بررسی میکنیم:
- Nano Banana چیست و چه ارتباطی با Gemini دارد؟
- چگونه با Gemini عکس بسازیم؟
- چگونه یک عکس را با دستور متنی ویرایش کنیم؟
- چطور برای تولید تصویر، پرامپت حرفهای بنویسیم؟
- چگونه چهره، محصول یا شخصیت را در چند تصویر ثابت نگه داریم؟
- کدام مدل برای هر پروژه مناسبتر است؟
- چگونه قابلیت تولید تصویر را از طریق API پیادهسازی کنیم؟
- محدودیتها و ملاحظات حقوقی این فناوری چیست؟
Nano Banana چیست؟
Nano Banana نام قابلیتها و مدلهای بومی تولید و ویرایش تصویر در خانواده Gemini است. این مدلها میتوانند متن و تصویر را بهعنوان ورودی دریافت کنند و متن، تصویر یا ترکیبی از هر دو را تحویل دهند.
برخلاف ابزارهای سنتی Text to Image، فرایند کار با Nano Banana حالت مکالمهای دارد. یعنی میتوانید پس از تولید تصویر، بدون شروع مجدد از مدل بخواهید:
- رنگ لباس را تغییر دهد؛
- یک شیء را از تصویر حذف کند؛
- پسزمینه را عوض کند؛
- زاویه دوربین را اصلاح کند؛
- فضای خالی برای تیتر ایجاد کند؛
- متن مشخصی روی پوستر قرار دهد؛
- سبک همان تصویر را در نسخههای بعدی حفظ کند.
بر اساس مستندات فعلی گوگل، خانواده Nano Banana شامل چند مدل با تمرکزهای متفاوت است:
| نام تجاری | مدل | کاربرد اصلی |
|---|---|---|
| Nano Banana 2 Lite | gemini-3.1-flash-lite-image | تولید سریع، ارزان و انبوه |
| Nano Banana 2 | gemini-3.1-flash-image | انتخاب عمومی با توازن مناسب کیفیت، سرعت و هزینه |
| Nano Banana Pro | gemini-3-pro-image | طراحی حرفهای، دستورات پیچیده و کنترل دقیق |
| Nano Banana | gemini-2.5-flash-image | نسل قدیمیتر خانواده Nano Banana |
گوگل مدل Nano Banana 2 را برای استفاده عمومی و متوازن و Nano Banana Pro را برای تولید داراییهای حرفهای پیشنهاد میکند. نام مدلها، وضعیت Preview و دسترسی منطقهای ممکن است تغییر کند؛ بنابراین پیش از توسعه محصول، حتماً فهرست مدلهای حساب یا سرویس API خود را بررسی کنید. جزئیات فنی بهروز در مستندات رسمی تولید تصویر Gemini و صفحه مدل Gemini 3.1 Flash Image منتشر میشود.
تفاوت Gemini و Nano Banana چیست؟
Gemini نام خانواده مدلها و محصولات هوش مصنوعی گوگل است. Nano Banana نام خانواده قابلیتهای تولید و ویرایش تصویر بومی Gemini محسوب میشود.
به زبان ساده:
- Gemini: اکوسیستم هوش مصنوعی چندوجهی گوگل
- Nano Banana: مدلها و قابلیتهای تصویری این اکوسیستم
- Gemini App: رابط کاربری عمومی برای گفتوگو و استفاده از مدلها
- Gemini API: رابط برنامهنویسی برای اتصال مدلها به نرمافزار
- Google AI Studio: محیط آزمایش پرامپت و API برای توسعهدهندگان
بنابراین عبارتهای «ساخت عکس با Gemini»، «ساخت عکس با جمینای» و «ساخت عکس با Nano Banana» معمولاً به یک خانواده از قابلیتها اشاره دارند.
Nano Banana چه کارهایی انجام میدهد؟
۱. ساخت عکس از متن
شما صحنه موردنظر را با یک Prompt یا پرامپت توضیح میدهید و مدل تصویری متناسب با آن تولید میکند.
مثال:
یک عکس تبلیغاتی واقعگرایانه از یک فنجان سرامیکی مشکی روی میز چوبی تیره بساز. نور گرم از سمت چپ بتابد، پسزمینه محو باشد و در سمت راست فضای خالی کافی برای تیتر تبلیغاتی قرار بگیرد. نسبت تصویر ۱۶:۹.
۲. ویرایش عکس با متن
یک تصویر آپلود میکنید و تغییرات موردنظر را توضیح میدهید:
پسزمینه این عکس محصول را با یک آشپزخانه مدرن و مینیمال جایگزین کن. خود محصول، لوگو، نوشتههای روی بستهبندی و نسبت ابعاد آن کاملاً بدون تغییر باقی بماند.
۳. ترکیب چند عکس مرجع
میتوانید چند مرجع مانند عکس محصول، رنگ سازمانی، سبک نورپردازی و نمونه ترکیببندی را به مدل بدهید تا خروجی جدیدی بر اساس آنها بسازد.
مدلهای جدید Gemini Image بسته به مدل و نوع مرجع، از چندین تصویر ورودی پشتیبانی میکنند. با این حال، افزایش تعداد منابع همیشه به معنی نتیجه بهتر نیست. هر تصویر باید نقش مشخصی داشته باشد.
۴. حذف یا افزودن اجزای تصویر
برای مثال:
گلدان سمت چپ را حذف کن و با بازسازی طبیعی دیوار و سایهها، فضای خالی ایجادشده را پر کن. هیچ بخش دیگری از تصویر تغییر نکند.
یا:
یک لپتاپ نقرهای بسته روی میز اضافه کن. زاویه، پرسپکتیو، بازتاب و جهت نور آن باید با صحنه اصلی هماهنگ باشد.
۵. تغییر سبک تصویر
میتوانید عکس را به تصویرسازی، نقاشی دیجیتال، سهبعدی یا سبکهای گرافیکی عمومی تبدیل کنید:
این منظره را به یک تصویرسازی سهبعدی نرم و رنگارنگ تبدیل کن. ساختمانها و ترکیببندی اصلی حفظ شوند و هیچ متن یا لوگویی به تصویر اضافه نشود.
بهتر است بهجای درخواست تقلید دقیق از سبک هنرمندان زنده، ویژگیهای بصری موردنظر مانند نوع رنگ، نور، بافت و شیوه طراحی را توصیف کنید.
۶. قرار دادن متن داخل تصویر
مدلهای جدید در نمایش متن پیشرفت کردهاند و برای پوستر، منو، اینفوگرافیک و بنر مناسبتر شدهاند؛ اما همچنان باید نوشته نهایی را بررسی کنید.
نمونه پرامپت:
یک پوستر مینیمال برای کارگاه برنامهنویسی بساز. عبارت «آموزش عملی هوش مصنوعی» دقیقاً با همین املا و فقط یکبار در بالای پوستر نوشته شود. زیر آن فضای خالی برای درج تاریخ باقی بگذار. رنگهای اصلی سرمهای و فیروزهای باشند. نسبت تصویر ۴:۵.
برای متن فارسی طولانی، روش مطمئنتر این است که پسزمینه را با هوش مصنوعی بسازید و نوشته نهایی را در Figma، Photoshop یا Canva قرار دهید.
آموزش ساخت عکس با Gemini
رابط و نام گزینهها ممکن است بر اساس نسخه برنامه، نوع حساب و منطقه جغرافیایی متفاوت باشد، اما فرایند کلی به این صورت است:
- وارد برنامه یا وبسایت Gemini شوید.
- یک گفتوگوی جدید ایجاد کنید.
- درخواست خود را با عبارتی مانند «یک تصویر بساز» شروع کنید.
- موضوع، سبک، نور، زاویه و نسبت تصویر را مشخص کنید.
- تصویر تولیدشده را بررسی کنید.
- اصلاحات را در همان گفتوگو مرحلهبهمرحله درخواست کنید.
- خروجی نهایی را از نظر جزئیات، نوشتهها و مجوز استفاده بازبینی کنید.
یک پرامپت اولیه مناسب:
یک تصویر واقعگرایانه از میز کار یک برنامهنویس ایرانی در یک فضای مدرن بساز. روی میز مانیتور، کیبورد و دفتر یادداشت قرار داشته باشد. نور طبیعی صبح از پنجره وارد شود. تصویر تمیز و حرفهای باشد و هیچ نوشته خوانایی روی مانیتور نمایش داده نشود. نسبت تصویر ۱۶:۹.
سپس میتوانید ادامه دهید:
ترکیببندی را حفظ کن، اما رنگ نور را کمی گرمتر کن و در سمت چپ فضای خالی بیشتری برای عنوان مقاله ایجاد کن.
این روش مکالمهای معمولاً نتیجه دقیقتری نسبت به نوشتن یک پرامپت بسیار طولانی و تلاش برای حل تمام مشکلات در یک مرحله ایجاد میکند.
فرمول حرفهای پرامپت ساخت عکس
یک پرامپت خوب معمولاً از اجزای زیر تشکیل میشود:
سوژه + محیط + ترکیببندی + زاویه دوربین + نور + سبک + رنگ + محدودیتها + نسبت تصویر + کاربرد خروجی
قالب پیشنهادی:
یک [نوع تصویر] از [سوژه اصلی] در [محیط] بساز. سوژه در [محل قرارگیری در کادر] باشد. تصویر از زاویه [زاویه دوربین] ثبت شود و نور [نوع نور] داشته باشد. سبک بصری [سبک] و پالت رنگ [رنگها] باشد. [مواردی که باید حفظ شوند]. [موارد ممنوع]. نسبت تصویر [نسبت] و کاربرد آن [کاربرد] است.
مثال برای عکس محصول
یک عکس تبلیغاتی استودیویی و کاملاً واقعگرایانه از این بطری بساز. بطری در مرکز کادر روی سطح سنگی روشن قرار بگیرد. نورپردازی سهنقطهای نرم با بازتاب کنترلشده استفاده شود. شکل بطری، رنگ مایع، لوگو و نوشتههای بستهبندی بدون تغییر باقی بمانند. هیچ محصول یا نوشته اضافی ایجاد نشود. نسبت تصویر ۱:۱ و مناسب صفحه محصول فروشگاه اینترنتی باشد.
مثال برای تصویر شاخص مقاله
یک تصویر مفهومی مدرن درباره API هوش مصنوعی بساز. یک هسته نورانی هوش مصنوعی در مرکز قرار داشته باشد و از طریق مسیرهای داده به چند نرمافزار متصل شود. پالت سرمهای، بنفش و فیروزهای، نور سینمایی ملایم و طراحی تمیز باشد. در سمت راست فضای منفی کافی برای تیتر فارسی ایجاد کن. هیچ متن، لوگو یا واترمارک بصری اضافه نکن. نسبت ۱۶:۹.
مثال برای پست اینستاگرام
یک تصویر تبلیغاتی مدرن برای معرفی یک دوره Python بساز. لپتاپی با محیط کدنویسی غیرخوانا روی میز قرار داشته باشد و عناصر انتزاعی مرتبط با داده در اطراف آن دیده شوند. پالت سبز تیره و زرد، نورپردازی حرفهای و ترکیببندی مناسب پست اینستاگرام باشد. یکسوم بالای تصویر برای اضافهکردن تیتر خالی بماند. نسبت ۴:۵.
آیا پرامپت فارسی بهتر است یا انگلیسی؟
Gemini زبان فارسی را درک میکند و بسیاری از درخواستها را میتوان کاملاً فارسی نوشت. بااینحال، کیفیت پیروی از دستور در همه زبانها و مدلها الزاماً یکسان نیست.
روش پیشنهادی:
- ابتدا پرامپت را فارسی و دقیق بنویسید.
- اگر نتیجه ضعیف بود، نسخه انگلیسی همان دستور را آزمایش کنید.
- اصطلاحات تخصصی عکاسی را در صورت نیاز انگلیسی بنویسید.
- نوشتهای که باید داخل تصویر باشد، دقیقاً داخل گیومه قرار دهید.
- در یک پرامپت، دستورهای متناقض فارسی و انگلیسی ننویسید.
اصطلاحات مفید عکاسی:
close-up: نمای نزدیکwide shot: نمای بازtop-down: نمای کاملاً از بالا45-degree angle: زاویه ۴۵ درجهshallow depth of field: عمق میدان کمsoftbox lighting: نور نرم استودیوییgolden hour: نور ساعت طلاییbokeh: محوشدگی زیبای پسزمینهnegative space: فضای خالی برای متنphotorealistic: واقعگرایانه
چگونه عکس تولیدشده را دقیقتر اصلاح کنیم؟
بهجای گفتن «بهترش کن»، تغییر را قابلاندازهگیری کنید.
دستور ضعیف:
عکس را حرفهایتر کن.
دستور بهتر:
موقعیت محصول و زاویه دوربین را تغییر نده. شدت سایه زیر محصول را ۳۰ درصد کمتر کن، پسزمینه را به خاکستری بسیار روشن تغییر بده و بازتاب روی قسمت بالای بستهبندی را کاهش بده.
برای اصلاح دقیق، سه بخش را مشخص کنید:
- چه چیزی باید تغییر کند؟
- چه چیزی نباید تغییر کند؟
- نتیجه مطلوب چه ویژگی قابل مشاهدهای دارد؟
قالب مناسب:
فقط [بخش موردنظر] را تغییر بده. [اجزای ثابت] بدون تغییر باقی بمانند. خروجی باید [ویژگی نهایی] داشته باشد.
حفظ چهره، شخصیت یا محصول در چند تصویر
یکی از نیازهای مهم تولیدکنندگان محتوا، Character Consistency یا ثبات شخصیت است. برای رسیدن به نتیجه بهتر:
- از تصاویر مرجع واضح و باکیفیت استفاده کنید.
- عکسهایی با نور و زاویههای متفاوت ارائه دهید.
- نقش هر مرجع را توضیح دهید.
- ویژگیهای ثابت را صریحاً فهرست کنید.
- در هر مرحله فقط یک یا دو تغییر اعمال کنید.
- بهترین خروجی را مرجع مرحله بعد قرار دهید.
نمونه:
تصویر اول مرجع چهره و تصویر دوم مرجع لباس است. یک عکس جدید از همین شخصیت در کتابخانه بساز. فرم صورت، رنگ چشم، مدل مو و ویژگیهای چهره تصویر اول حفظ شود. طرح و رنگ لباس مطابق تصویر دوم باشد. حالت چهره طبیعی و نور محیط گرم باشد.
تولید خروجی مشابه از یک فرد واقعی همیشه باید با رضایت او انجام شود. از جعل هویت، تولید محتوای فریبنده یا استفاده آسیبزا از چهره دیگران خودداری کنید.
انتخاب نسبت تصویر مناسب
| کاربرد | نسبت پیشنهادی |
|---|---|
| پست مربعی | ۱:۱ |
| پست عمودی اینستاگرام | ۴:۵ |
| استوری و ویدئوی عمودی | ۹:۱۶ |
| تصویر شاخص وبلاگ | ۱۶:۹ |
| بنر عریض | ۲۱:۹ |
| تصویر پرتره | ۳:۴ یا ۲:۳ |
| عکس محصول فروشگاهی | ۱:۱ یا ۴:۵ |
نسبت تصویر را در پرامپت و در تنظیمات API مشخص کنید. صرفاً نوشتن «عکس اینستاگرامی» همیشه ابعاد موردنظر را تضمین نمیکند.
چه مدلی را انتخاب کنیم؟
Nano Banana 2 Lite
برای کارهایی مناسب است که سرعت و هزینه مهمتر از کنترل پیچیده هستند:
- تولید انبوه تصاویر ساده
- ساخت Thumbnailهای اولیه
- آزمایش چند ایده
- تولید داراییهای تصویری در مقیاس بالا
این مدل برای ویرایشهای چندمرحلهای پیچیده و تعداد زیاد تصاویر مرجع، انتخاب اصلی نیست.
Nano Banana 2
انتخاب عمومی برای اکثر پروژهها:
- تولید عکس از متن
- ویرایش مکالمهای تصویر
- عکس محصول
- محتوای شبکه اجتماعی
- چند تصویر مرجع
- نیاز به توازن کیفیت، سرعت و هزینه
این مدل از خروجیهای ۰٫۵K، ۱K، ۲K و ۴K پشتیبانی میکند و طبق مستندات گوگل، قابلیتهای بهبودیافتهای در رعایت نسبت تصویر و نمایش متن دارد.
Nano Banana Pro
برای پروژههایی که کیفیت و کنترل دقیق اهمیت بیشتری دارند:
- داراییهای تبلیغاتی حرفهای
- طراحیهایی با نوشته داخل تصویر
- ترکیببندیهای پیچیده
- حفظ سبک برند
- اینفوگرافیک و محتوای ساختاریافته
- خروجیهایی که به استدلال بصری بیشتری نیاز دارند
هزینه و زمان پاسخ این مدل میتواند بیشتر از مدلهای Flash باشد.
آموزش استفاده از Nano Banana API با Python
برای اجرای مستقیم نمونه رسمی Gemini API، ابتدا کتابخانه مربوط را نصب کنید:
pip install google-genai pillow
کلید API را در متغیر محیطی قرار دهید. کلید را داخل کد، مخزن Git یا Frontend ذخیره نکنید:
export GEMINI_API_KEY="YOUR_API_KEY"
نمونه تولید تصویر:
from google import genai
from google.genai import types
client = genai.Client()
prompt = """
یک عکس تبلیغاتی واقعگرایانه از یک هدفون بیسیم مشکی
روی میز چوبی روشن بساز. نور نرم استودیویی، پسزمینه
مینیمال و فضای خالی در سمت راست برای تیتر ایجاد کن.
هیچ نوشته یا لوگوی اضافی تولید نکن.
"""
response = client.models.generate_content(
model="gemini-3.1-flash-image",
contents=prompt,
config=types.GenerateContentConfig(
response_modalities=["IMAGE"],
image_config=types.ImageConfig(
aspect_ratio="16:9",
image_size="2K"
)
)
)
for index, part in enumerate(response.parts):
if part.inline_data is not None:
image = part.as_image()
image.save(f"output-{index}.png")
پارامترها و ساختار SDK ممکن است در نسخههای بعدی تغییر کنند؛ نسخه نهایی کد را با مستندات رسمی SDK تطبیق دهید.
ویرایش تصویر با Python
from google import genai
from google.genai import types
from PIL import Image
client = genai.Client()
source_image = Image.open("product.png")
prompt = """
پسزمینه این تصویر محصول را به یک استودیوی سفید مینیمال
تغییر بده. شکل محصول، ابعاد، رنگ، لوگو و نوشتههای روی
بستهبندی کاملاً ثابت بمانند. یک سایه نرم و طبیعی زیر محصول
ایجاد کن. نسبت تصویر 1:1 باشد.
"""
response = client.models.generate_content(
model="gemini-3.1-flash-image",
contents=[prompt, source_image],
config=types.GenerateContentConfig(
response_modalities=["IMAGE"],
image_config=types.ImageConfig(
aspect_ratio="1:1",
image_size="2K"
)
)
)
for index, part in enumerate(response.parts):
if part.inline_data is not None:
part.as_image().save(f"edited-product-{index}.png")
نمونه استفاده با JavaScript
import { GoogleGenAI } from "@google/genai";
import { writeFile } from "node:fs/promises";
const ai = new GoogleGenAI({
apiKey: process.env.GEMINI_API_KEY,
});
const response = await ai.models.generateContent({
model: "gemini-3.1-flash-image",
contents: `
یک تصویر شاخص مدرن درباره برنامهنویسی با هوش مصنوعی بساز.
پالت سرمهای و فیروزهای، ترکیببندی خلوت و نور نرم باشد.
در سمت چپ فضای خالی برای تیتر قرار بده.
هیچ متن یا لوگویی تولید نکن. نسبت تصویر 16:9.
`,
config: {
responseModalities: ["IMAGE"],
imageConfig: {
aspectRatio: "16:9",
imageSize: "2K",
},
},
});
for (const [index, part] of response.candidates[0].content.parts.entries()) {
if (part.inlineData) {
const buffer = Buffer.from(part.inlineData.data, "base64");
await writeFile(`image-${index}.png`, buffer);
}
}
معماری امن برای اضافهکردن تولید تصویر به وبسایت
کلید API نباید در JavaScript مرورگر، اپلیکیشن قابل مهندسی معکوس یا مخزن عمومی قرار بگیرد.
معماری مناسب:
کاربر
↓
Frontend
↓
Backend شما
↓
سرویس API هوش مصنوعی
↓
فضای ذخیرهسازی تصویر
↓
آدرس موقت یا کنترلشده برای کاربر
Backend باید این وظایف را انجام دهد:
- احراز هویت کاربر
- محدودکردن تعداد درخواستها
- بررسی حجم و فرمت فایل
- پاکسازی نام فایل
- کنترل محتوای ورودی
- ثبت هزینه و مصرف
- مدیریت Timeout و Retry
- ذخیره امن خروجی
- حذف دادههای موقت
- جلوگیری از افشای کلید API
اتصال قابلیت تولید تصویر به API درواره
اگر میخواهید مدلهای مختلف هوش مصنوعی را از یک زیرساخت داخلی مدیریت کنید، میتوانید کاتالوگ مدلهای موجود در درواره را بررسی کنید.
آدرس پایه API درواره:
https://api.darvareh.ir/v1
از آنجا که موجودی و شناسه مدلها ممکن است تغییر کند، پیش از پیادهسازی باید بررسی کنید که مدل تصویری موردنظر در کاتالوگ فعلی درواره ارائه شده باشد. شناسه مدل را حدس نزنید و همان مقداری را استفاده کنید که در مستندات یا پنل اعلام شده است.
الگوی عمومی درخواست در سرویسهای سازگار با OpenAI معمولاً به این شکل است:
import os
import requests
url = "https://api.darvareh.ir/v1/images/generations"
headers = {
"Authorization": f"Bearer {os.environ['DARVAREH_API_KEY']}",
"Content-Type": "application/json",
}
payload = {
"model": "MODEL_ID_FROM_DARVAREH_CATALOG",
"prompt": """
یک عکس محصول واقعگرایانه از یک ساعت هوشمند
روی پسزمینه روشن بساز. نور نرم و نسبت تصویر مربع باشد.
""",
"size": "1024x1024"
}
response = requests.post(
url,
headers=headers,
json=payload,
timeout=120
)
response.raise_for_status()
print(response.json())
این کد یک الگوی پیادهسازی است. Endpoint، پارامترها، فرمت پاسخ و مدلهای قابل استفاده را باید با مستندات جاری درواره تطبیق دهید.
درواره یک API ارائه میکند؛ بنابراین رابط تولید تصویر، گالری، مدیریت کاربران، صف پردازش و تجربه کاربری اپلیکیشن را خودتان بر اساس نیاز محصول میسازید.
مدیریت هزینه در پروژه واقعی
تولید تصویر معمولاً از پردازش متن پرهزینهتر است. برای کنترل هزینه:
- پیشنمایش را با وضوح پایینتر بسازید.
- فقط خروجی تأییدشده را در ۲K یا ۴K تولید کنید.
- تعداد تلاش رایگان هر کاربر را محدود کنید.
- درخواستهای تکراری را Cache کنید.
- برای پردازش انبوه از Batch API استفاده کنید.
- تصویر ورودی را پیش از ارسال فشرده کنید.
- مدل Lite یا Flash را برای نسخه اولیه به کار ببرید.
- مدل Pro را فقط برای خروجیهای حساس استفاده کنید.
- مصرف هر کاربر و هر پروژه را ثبت کنید.
یک جریان اقتصادی مناسب:
- تولید چهار ایده کمهزینه
- انتخاب یک ترکیببندی توسط کاربر
- ویرایش همان نسخه
- تولید خروجی نهایی با وضوح بالا
- ذخیره نسخه نهایی و حذف فایلهای موقت
اشتباهات رایج هنگام ساخت عکس با Gemini
پرامپت بیشازحد کوتاه
عبارت «یک عکس زیبا از قهوه بساز» درباره محیط، زاویه، نور و کاربرد خروجی اطلاعاتی نمیدهد.
دستورهای متناقض
برای مثال «تصویر بسیار شلوغ و کاملاً مینیمال» مدل را با دو هدف ناسازگار روبهرو میکند.
تغییر همزمان همهچیز
اگر در هر مرحله سوژه، نور، پسزمینه، زاویه و سبک را با هم تغییر دهید، کنترل نتیجه دشوار میشود.
اعتماد کامل به نوشته داخل تصویر
نام برند، شماره تماس، قیمت و متن فارسی را همیشه بررسی کنید. برای اطلاعات حساس، نوشته را در نرمافزار طراحی اضافه کنید.
نادیدهگرفتن ابعاد نهایی
تصویر خوب با نسبت ۱:۱ ممکن است برای بنر ۱۶:۹ مناسب نباشد. کاربرد را پیش از تولید مشخص کنید.
استفاده از تصویر بدون کنترل انسانی
تصاویر تولیدشده ممکن است جزئیات غیرمنطقی، نوشته اشتباه، اجزای تکراری یا نشانههای تجاری ناخواسته داشته باشند.
محدودیتهای Nano Banana
با وجود پیشرفت مدلها، محدودیتهایی وجود دارد:
- پیروی کامل از تعداد دقیق اشیا همیشه تضمین نمیشود.
- نوشتههای طولانی ممکن است اشتباه باشند.
- حفظ دقیق هویت در همه زاویهها قطعی نیست.
- جزئیات کوچک محصول ممکن است تغییر کنند.
- خروجی API به مدل، حساب و منطقه وابسته است.
- پسزمینه شفاف بهصورت مستقیم در همه مدلها پشتیبانی نمیشود.
- نتیجه یک پرامپت ممکن است در اجرای مجدد متفاوت باشد.
- خروجی باید پیش از انتشار تجاری بررسی شود.
طبق مستندات گوگل، تصاویر تولیدشده توسط این مدلها دارای SynthID هستند؛ SynthID نوعی نشانگذاری نامرئی برای شناسایی محتوای تولیدشده با هوش مصنوعی است.
ملاحظات حقوقی و اخلاقی
برای استفاده حرفهای از تولید تصویر:
- فقط تصاویری را بارگذاری کنید که حق استفاده از آنها را دارید.
- برای استفاده از چهره افراد رضایت معتبر بگیرید.
- از جعل هویت و انتشار تصویر فریبنده خودداری کنید.
- لوگو و علامت تجاری دیگران را بدون مجوز وارد تبلیغ نکنید.
- شرایط استفاده سرویس و مدل را بررسی کنید.
- برای حوزههای حساس، تولیدیبودن تصویر را شفاف اعلام کنید.
- خروجی را از نظر شباهت ناخواسته به آثار دارای حق نشر بازبینی کنید.
- اطلاعات محرمانه مشتریان را بدون مجوز به سرویس خارجی ارسال نکنید.
گوگل نیز در مستندات خود تأکید میکند که کاربر باید حق استفاده از تصاویر ورودی را داشته باشد و نباید از قابلیت تولید تصویر برای فریب، آزار یا آسیبزدن استفاده کند.
کاربردهای تجاری ساخت عکس با Gemini
فروشگاه اینترنتی
- ساخت پسزمینه محصول
- تولید بنر دستهبندی
- ایجاد تصاویر مناسب کمپین
- نمایش محصول در محیطهای مختلف
- ساخت نسخههای متناسب با شبکههای اجتماعی
تولید محتوا
- تصویر شاخص مقاله
- کاور ویدئو و پادکست
- تصویر پست اینستاگرام
- اینفوگرافیک اولیه
- تصویرسازی داستان و آموزش
طراحی محصول
- ساخت Moodboard
- ایدهپردازی سریع
- شبیهسازی رابط یا بستهبندی
- آزمایش ترکیبهای رنگ
- تولید Concept پیش از طراحی نهایی
تبلیغات
- ساخت چند نسخه از یک ایده
- شخصیسازی تصویر برای گروههای مختلف
- تولید تصاویر مناسب A/B Test
- تغییر فصل، محیط یا ترکیببندی کمپین
هوش مصنوعی جایگزین کامل عکاس یا طراح نیست؛ اما زمان رسیدن از ایده به نمونه اولیه را بهشدت کاهش میدهد.
پرسشهای متداول
Nano Banana چیست؟
Nano Banana نام خانواده مدلها و قابلیتهای تولید و ویرایش تصویر بومی Gemini است. این مدلها میتوانند متن و تصویر دریافت کنند و بهصورت مکالمهای تصویر بسازند یا ویرایش کنند.
آیا ساخت عکس با Gemini رایگان است؟
ممکن است Gemini برای برخی حسابها و قابلیتها سهمیه رایگان داشته باشد، اما دسترسی، محدودیتها و هزینه API بر اساس مدل، کشور، حساب و زمان تغییر میکند. اطلاعات قیمت را از صفحه رسمی سرویس بررسی کنید.
آیا Gemini پرامپت فارسی را میفهمد؟
بله، بسیاری از دستورهای فارسی را درک میکند. برای کنترل بیشتر میتوانید اصطلاحات فنی عکاسی را نیز به انگلیسی بنویسید یا نسخه انگلیسی پرامپت را آزمایش کنید.
آیا میتوان با Gemini عکس را ویرایش کرد؟
بله. میتوانید تصویر را همراه یک دستور متنی ارسال کنید و از مدل بخواهید اجزا، پسزمینه، نور، رنگ یا سبک آن را تغییر دهد.
آیا Nano Banana همان Gemini است؟
Nano Banana نام قابلیتها و مدلهای تصویری در اکوسیستم Gemini است؛ بنابراین یک محصول کاملاً جدا از Gemini محسوب نمیشود.
بهترین مدل Nano Banana کدام است؟
برای اغلب کارها Nano Banana 2 یا gemini-3.1-flash-image انتخاب متوازنتری است. برای پروژههای حرفهای پیچیده، Nano Banana Pro مناسبتر است و برای تولید انبوه کمهزینه میتوان Lite را بررسی کرد.
آیا Nano Banana خروجی 4K میدهد؟
مدلهای جدید Gemini Image، بسته به مدل و تنظیمات، میتوانند از خروجی ۲K و ۴K پشتیبانی کنند. وضوح قابل انتخاب را در صفحه مدل بررسی کنید.
آیا میتوان متن فارسی داخل عکس قرار داد؟
امکان آن وجود دارد، اما صحت متن فارسی باید بررسی شود. برای پوسترهای حساس، بهتر است هوش مصنوعی پسزمینه و ترکیببندی را بسازد و متن نهایی در نرمافزار طراحی اضافه شود.
آیا میتوان از خروجی در تبلیغات استفاده کرد؟
این موضوع به شرایط استفاده سرویس، حقوق تصاویر ورودی، علائم تجاری و قوانین محل فعالیت بستگی دارد. پیش از استفاده تجاری، خروجی و مجوزهای لازم را بررسی کنید.
آیا میتوان Nano Banana را به سایت متصل کرد؟
بله. برنامهنویسان میتوانند از Gemini API یا ارائهدهنده API سازگار استفاده کنند و رابط تولید تصویر را در Backend نرمافزار خود بسازند.
جمعبندی
ساخت عکس با Gemini و Nano Banana فقط یک قابلیت سرگرمکننده نیست. این فناوری میتواند بخشی از فرایند تولید محتوای سایت، عکاسی محصول، طراحی تبلیغات، نمونهسازی و توسعه نرمافزار باشد.
برای رسیدن به نتیجه حرفهای:
- هدف تصویر را پیش از تولید مشخص کنید.
- پرامپت را بهصورت صحنهای و دقیق بنویسید.
- نور، زاویه، سبک و نسبت تصویر را تعیین کنید.
- تغییرات را مرحلهبهمرحله انجام دهید.
- بخشهایی که نباید تغییر کنند صریحاً مشخص کنید.
- خروجی را از نظر متن، برند، جزئیات و حقوق استفاده بررسی کنید.
- در پروژههای API، امنیت کلید و کنترل هزینه را جدی بگیرید.
اگر قصد دارید قابلیتهای هوش مصنوعی را به وبسایت، اپلیکیشن یا سرویس خود اضافه کنید، مدلهای موجود و مستندات API درواره را بررسی کنید. درواره دسترسی API به سرویسهای هوش مصنوعی را برای توسعهدهندگان فراهم میکند و پیادهسازی محصول نهایی، رابط کاربری و منطق کسبوکار بر عهده تیم شما خواهد بود.