Veo چیست؟ معرفی کامل مدل هوش مصنوعی ویدئوساز گوگل و آموزش پرامپت‌نویسی برای Veo 3.1

Veo مدل تولید ویدئوی هوش مصنوعی گوگل است که می‌تواند از متن یا تصویر، ویدئوهای سینمایی همراه صدا و دیالوگ بسازد. در این راهنما با Veo 3.1، نسخه Lite و اصول نوشتن پرامپت حرفه‌ای آشنا می‌شوید.

Share
Veo چیست؟ معرفی کامل مدل هوش مصنوعی ویدئوساز گوگل و آموزش پرامپت‌نویسی برای Veo 3.1

Veo چیست؟

Veo خانواده مدل‌های تولید ویدئو با هوش مصنوعی شرکت Google DeepMind است. این مدل می‌تواند توضیحات متنی یا تصویر را دریافت کند و براساس آن یک ویدئو تولید کند.

نسخه‌های جدید Veo فقط تصویر متحرک بدون صدا نمی‌سازند. آن‌ها می‌توانند عناصر صوتی مانند موارد زیر را نیز همراه ویدئو تولید کنند:

  • صدای محیط
  • افکت صوتی
  • گفت‌وگوی شخصیت‌ها
  • موسیقی پس‌زمینه
  • صدای اشیا
  • صدای طبیعت
  • صداهای هماهنگ با اتفاقات صحنه

Veo برای طیف متنوعی از کاربران قابل استفاده است:

  • تولیدکنندگان محتوا
  • سازندگان تبلیغات
  • فیلم‌سازان
  • طراحان
  • کسب‌وکارهای کوچک
  • مدیران شبکه‌های اجتماعی
  • آژانس‌های تبلیغاتی
  • توسعه‌دهندگان اپلیکیشن
  • فروشگاه‌های اینترنتی
  • مدرس‌ها و تولیدکنندگان محتوای آموزشی

نسخه فعلی این خانواده Veo 3.1 است. گوگل آن را برای تولید ویدئوهای باکیفیت، حرکات پیچیده دوربین، هماهنگی زمانی بهتر و تولید هم‌زمان صدا طراحی کرده است.

در صفحه رسمی Google DeepMind Veo، Veo 3.1 جدیدترین مدل این خانواده معرفی شده و بر واقع‌گرایی، پیروی دقیق‌تر از Prompt و کنترل خلاقانه بیشتر آن تأکید شده است.

Veo چگونه کار می‌کند؟

کاربر صحنه موردنظر خود را با یک Prompt یا پرامپت توضیح می‌دهد. Veo براساس این توضیحات، مجموعه‌ای از فریم‌های مرتبط تولید می‌کند و آن‌ها را به یک ویدئوی پیوسته تبدیل می‌کند.

یک پرامپت ساده ممکن است چنین باشد:

یک فنجان قهوه روی میز چوبی کنار پنجره قرار دارد.
نور صبح وارد اتاق می‌شود و بخار آرامی از فنجان بالا می‌رود.
دوربین به‌آرامی به فنجان نزدیک می‌شود.
صدای باران ملایم در پس‌زمینه شنیده می‌شود.

Veo باید از این متن چند نوع اطلاعات را استخراج کند:

  • سوژه اصلی: فنجان قهوه
  • محیط: میز چوبی کنار پنجره
  • زمان: صبح
  • نور: نور طبیعی
  • حرکت: بالا رفتن بخار
  • حرکت دوربین: نزدیک‌شدن آرام
  • صدا: باران ملایم
  • حس صحنه: آرام و صمیمی

هرچه این اطلاعات روشن‌تر و هماهنگ‌تر باشند، احتمال تولید نتیجه مناسب افزایش پیدا می‌کند.

Veo 3.1 چیست؟

Veo 3.1 مدل پیشرفته تولید ویدئو در خانواده Veo است. این نسخه برای ساخت ویدئوهای سینمایی، خروجی باکیفیت، حرکات پیچیده دوربین و تولید صدای هماهنگ طراحی شده است.

مستندات رسمی Veo 3.1 در Gemini API قابلیت‌های اصلی آن را این‌گونه معرفی می‌کند:

  • دریافت Prompt متنی
  • دریافت تصویر
  • تولید ویدئو
  • تولید صوت هماهنگ با ویدئو
  • مدل استاندارد برای کیفیت بالاتر
  • مدل Fast برای سرعت بیشتر
  • استفاده از طریق Google AI Studio و Gemini API

شناسه‌های معرفی‌شده برای این خانواده عبارت‌اند از:

veo-3.1-generate-preview
veo-3.1-fast-generate-preview

شناسه مدل‌ها و وضعیت Preview ممکن است تغییر کند. برای استفاده در API باید مستندات فعلی بررسی شوند و نباید Model ID را براساس حافظه یا نام عمومی مدل حدس زد.

Veo 3.1 Lite چیست؟

Veo 3.1 Lite نسخه اقتصادی‌تر این خانواده برای تولید ویدئو در مقیاس بالاتر است.

این مدل برای توسعه‌دهندگان و کسب‌وکارهایی طراحی شده است که می‌خواهند تعداد زیادی ویدئو تولید کنند، اما همیشه به حداکثر کیفیت یا امکانات نسخه اصلی نیاز ندارند.

براساس مستندات رسمی Veo 3.1 Lite، این مدل:

  • متن و تصویر دریافت می‌کند.
  • ویدئو همراه صدا تولید می‌کند.
  • برای تولید انبوه و برنامه‌پذیر مناسب‌تر است.
  • خروجی 4K ارائه نمی‌کند.
  • قابلیت Extension نسخه اصلی را ندارد.
  • برای کاهش هزینه تولید ویدئو طراحی شده است.

شناسه معرفی‌شده برای آن:

veo-3.1-lite-generate-preview

گوگل Veo 3.1 Lite را مدل ویدئویی مقرون‌به‌صرفه‌تر خود معرفی کرده است. طبق اعلام رسمی گوگل، این نسخه برای اپلیکیشن‌ها و فرایندهایی مناسب است که تعداد زیادی ویدئو تولید می‌کنند.

تفاوت Veo 3.1، Veo 3.1 Fast و Veo 3.1 Lite

نسخهتمرکز اصلیکیفیتسرعتهزینه نسبیکاربرد پیشنهادی
Veo 3.1بالاترین کیفیت و کنترلبسیار بالاپایین‌تربالاترتبلیغات، فیلم و تولید حرفه‌ای
Veo 3.1 Fastتعادل سرعت و کیفیتبالاسریع‌ترمتوسطتولید محتوا و آزمودن ایده‌ها
Veo 3.1 Liteکارایی و تولید انبوهمناسبسریعپایین‌تراپلیکیشن‌ها و تولید تعداد زیاد

انتخاب نسخه مناسب باید براساس هدف انجام شود.

برای یک تبلیغ مهم که خروجی نهایی اهمیت زیادی دارد، نسخه اصلی ممکن است مناسب‌تر باشد. برای آزمایش چند ایده یا ساخت تعداد زیادی کلیپ شبکه اجتماعی، نسخه Fast یا Lite می‌تواند انتخاب اقتصادی‌تری باشد.

Veo چه قابلیت‌هایی دارد؟

تبدیل متن به ویدئو

در روش Text-to-Video، کاربر فقط با متن صحنه را توصیف می‌کند.

یک کتاب‌فروشی کوچک و گرم در یک عصر بارانی.
زنی جوان کنار قفسه کتاب‌ها قدم می‌زند و یک کتاب قدیمی را برمی‌دارد.
دوربین با حرکت نرم او را دنبال می‌کند.
صدای باران، ورق‌خوردن کتاب و موسیقی آرام پیانو شنیده می‌شود.
سبک واقع‌گرایانه و سینمایی.

تبدیل تصویر به ویدئو

در روش Image-to-Video، یک تصویر به‌عنوان فریم یا مرجع اولیه ارسال می‌شود. سپس Prompt توضیح می‌دهد چه حرکتی در تصویر اتفاق بیفتد.

دوربین به‌آرامی به سمت پنجره حرکت کند.
پرده با وزش ملایم باد تکان بخورد.
نور خورشید به‌تدریج وارد اتاق شود.
بخار فنجان روی میز طبیعی و آرام باشد.
صدای پرندگان و نسیم صبحگاهی شنیده شود.

این روش برای موارد زیر مناسب است:

  • متحرک‌کردن عکس محصول
  • ساخت کلیپ از تصویر تبلیغاتی
  • متحرک‌کردن طراحی مفهومی
  • تبدیل پوستر به تیزر
  • ساخت صحنه از تصویر تولیدشده با AI
  • تولید حرکت کنترل‌شده‌تر شخصیت و محیط

تولید صدا همراه ویدئو

یکی از تفاوت‌های مهم Veo 3 با بسیاری از نسل‌های قدیمی ویدئوسازها، تولید Native Audio است.

به‌جای اضافه‌کردن صدا در مرحله‌ای جداگانه، می‌توان عناصر صوتی را داخل Prompt توضیح داد:

صدای موج آرام دریا
صدای قدم‌زدن روی شن
صدای مرغ‌های دریایی از فاصله دور
موسیقی آکوستیک بسیار ملایم

صدا باید با محیط و اتفاقات صحنه هماهنگ باشد. درخواست چند صدای متناقض ممکن است خروجی را شلوغ یا غیرطبیعی کند.

تولید دیالوگ

می‌توان دیالوگ شخصیت را داخل Prompt نوشت:

مرد مسن به افق نگاه می‌کند و با صدای آرام می‌گوید:
«بعضی مسیرها را باید آهسته رفت.»

پس از جمله، فقط صدای باد و دریا شنیده شود.

برای دیالوگ بهتر باید این موارد مشخص شوند:

  • چه کسی صحبت می‌کند؟
  • لحن او چگونه است؟
  • جمله دقیق چیست؟
  • زبان چیست؟
  • هنگام صحبت چه حرکتی دارد؟
  • پس‌زمینه صوتی چیست؟

کنترل حرکت دوربین

حرکت دوربین نقش مهمی در ظاهر حرفه‌ای ویدئو دارد.

حرکت‌های رایج عبارت‌اند از:

  • Slow push-in: نزدیک‌شدن آرام
  • Pull-back: دورشدن دوربین
  • Pan left/right: چرخش افقی
  • Tilt up/down: حرکت عمودی
  • Tracking shot: دنبال‌کردن سوژه
  • Dolly shot: حرکت نرم دوربین روی مسیر
  • Orbit shot: چرخش دور سوژه
  • Static shot: دوربین ثابت
  • Handheld: حرکت طبیعی دوربین روی دست
  • Aerial shot: نمای هوایی

نمونه:

دوربین از نمای باز خیابان شروع کند.
سپس با یک حرکت آرام Tracking، دوچرخه‌سوار را دنبال کند.
در پایان دوربین کمی بالا برود و شهر را از نمای وسیع نشان دهد.

استفاده از تصاویر مرجع

Veo 3.1 می‌تواند برای تولید ویدئو از چند تصویر مرجع استفاده کند. این تصاویر می‌توانند برای تعریف شخصیت، محصول، لباس، محیط یا سبک بصری استفاده شوند.

گوگل در به‌روزرسانی‌های Veo 3.1 قابلیت استفاده از چند تصویر Reference، تعیین فریم اول و آخر و گسترش ویدئو را معرفی کرده است. جزئیات این قابلیت‌ها در Release Notes رسمی Gemini API ثبت شده است.

تعیین فریم اول و آخر

در این روش، تصویر شروع و پایان مشخص می‌شوند. مدل تلاش می‌کند حرکت میان این دو تصویر را تولید کند.

این قابلیت برای موارد زیر مفید است:

  • تغییر فصل
  • تبدیل روز به شب
  • نمایش قبل و بعد
  • حرکت میان دو موقعیت
  • تبدیل طرح اولیه به نتیجه نهایی
  • نمایش فرایند تغییر یک محصول

ساخت ویدئوی عمودی

ویدئوی عمودی با نسبت ۹:۱۶ برای Instagram Reels، YouTube Shorts و TikTok مناسب است.

بهتر است در Prompt فقط به عبارت «ویدئوی عمودی» اکتفا نکنید. ترکیب‌بندی را نیز توضیح دهید:

ویدئوی عمودی ۹:۱۶ برای Instagram Reels.
شخصیت در مرکز کادر قرار داشته باشد.
فضای خالی مناسب در بالای تصویر برای اضافه‌کردن عنوان در نظر گرفته شود.
سوژه اصلی در محدوده امن مرکز تصویر باقی بماند.

طبق به‌روزرسانی رسمی Veo 3.1، این مدل از تولید Native ویدئوی عمودی و خروجی‌های بهبودیافته 1080p و 4K در قابلیت‌های پشتیبانی‌شده برخوردار است.

چگونه به Veo دسترسی داشته باشیم؟

روش دسترسی به Veo ممکن است براساس کشور، حساب، اشتراک و محصول متفاوت باشد.

Gemini

کاربران می‌توانند در نسخه‌ها و اشتراک‌های پشتیبانی‌شده Gemini از قابلیت تولید ویدئو استفاده کنند. نوع مدل، تعداد تولید و محدودیت‌ها ممکن است براساس اشتراک متفاوت باشد.

Google Flow

Flow ابزار فیلم‌سازی هوش مصنوعی گوگل است. این محیط برای ساخت، مدیریت و ترکیب صحنه‌های تولیدشده با مدل‌های ویدئویی گوگل طراحی شده است.

Flow برای کاربری مناسب است که می‌خواهد:

  • چند Shot تولید کند.
  • صحنه‌ها را مدیریت کند.
  • شخصیت یا محیط را حفظ کند.
  • ویدئو را مرحله‌به‌مرحله بسازد.
  • کنترل خلاقانه بیشتری داشته باشد.

Google AI Studio

Google AI Studio محیطی برای آزمایش مدل‌ها و APIهای هوش مصنوعی گوگل است. توسعه‌دهندگان می‌توانند مدل‌های پشتیبانی‌شده Veo را در آن آزمایش کنند.

Gemini API

توسعه‌دهندگان می‌توانند Veo را به نرم‌افزار، سایت یا فرایند خود متصل کنند. تولید ویدئو معمولاً یک عملیات زمان‌بر و غیرهم‌زمان است؛ برنامه درخواست را ارسال می‌کند و وضعیت آماده‌شدن ویدئو را پیگیری خواهد کرد.

Google Vids

Google Vids ابزار ساخت ویدئو در اکوسیستم Google Workspace است. گوگل در سال ۲۰۲۶ قابلیت‌های تولید ویدئو با Veo 3.1 را نیز به این محصول اضافه کرد.

چگونه برای Veo پرامپت بنویسیم؟

یک Prompt مناسب برای Veo بهتر است این اجزا را داشته باشد:

  1. سوژه
  2. محیط
  3. اتفاق اصلی
  4. حرکت سوژه
  5. حرکت دوربین
  6. نوع کادر
  7. نور
  8. سبک بصری
  9. حس و حال
  10. صدا
  11. دیالوگ
  12. نسبت تصویر

قالب پیشنهادی:

سوژه:
[چه شخص یا شیئی دیده می‌شود؟]

محیط:
[صحنه در کجا اتفاق می‌افتد؟]

اتفاق:
[چه چیزی رخ می‌دهد؟]

حرکت دوربین:
[دوربین چگونه حرکت می‌کند؟]

نور و رنگ:
[نور، زمان و پالت رنگ]

سبک:
[واقع‌گرایانه، سینمایی، تبلیغاتی و ...]

صدا:
[صدای محیط، افکت، موسیقی یا دیالوگ]

فرمت:
[افقی یا عمودی]

نمونه پرامپت تبلیغاتی برای محصول

یک ویدئوی تبلیغاتی سینمایی از یک ساعت مچی لوکس.

ساعت روی یک سطح سنگی مشکی قرار دارد.
قطرات بسیار ریز آب روی بدنه فلزی آن دیده می‌شوند.
نور باریک و سردی از سمت چپ روی ساعت حرکت می‌کند و جزئیات صفحه را آشکار می‌سازد.

دوربین با یک حرکت Macro بسیار آرام به ساعت نزدیک شود و سپس کمی دور آن بچرخد.
پس‌زمینه تیره، مینیمال و بدون عناصر اضافی باشد.

صدای ظریف حرکت فلز و موسیقی الکترونیک مینیمال شنیده شود.
هیچ نوشته یا لوگویی تولید نشود.
ویدئو افقی و مناسب تبلیغات محصول باشد.

نمونه پرامپت برای ویدئوی اینستاگرام

ویدئوی عمودی ۹:۱۶ برای Instagram Reels.

یک باریستای جوان در یک کافه مدرن، قهوه را با حرکت آهسته داخل فنجان می‌ریزد.
بخار قهوه در نور گرم صبح دیده شود.
دوربین ابتدا نمای نزدیک فنجان را نشان دهد و سپس آرام به چهره باریستا حرکت کند.

رنگ‌ها گرم و طبیعی باشند.
حرکت‌ها واقعی و نرم باشند.
صدای ریختن قهوه، صدای آرام کافه و موسیقی Lo-fi ملایم شنیده شود.

در قسمت بالای کادر فضای خالی برای اضافه‌کردن عنوان باقی بماند.

نمونه پرامپت سینمایی

نمای باز سینمایی از مردی تنها که هنگام غروب در یک جاده بیابانی قدم می‌زند.

باد آرام شن‌ها را روی جاده حرکت می‌دهد.
آسمان نارنجی و بنفش است و سایه مرد روی زمین کشیده شده است.

دوربین از پشت سر با یک Tracking Shot نرم او را دنبال کند.
پس از چند ثانیه، مرد توقف کند و به افق نگاه کند.
دوربین به‌آرامی از او فاصله بگیرد و وسعت بیابان را نشان دهد.

صدای باد، قدم‌ها و موسیقی ارکسترال بسیار آرام شنیده شود.
فضا تأمل‌برانگیز، واقع‌گرایانه و سینمایی باشد.

نمونه پرامپت تبدیل عکس محصول به ویدئو

پس از ارسال تصویر محصول:

محصول موجود در تصویر باید بدون تغییر در شکل، رنگ، ابعاد و جزئیات حفظ شود.

دوربین با حرکت آرام از سمت راست به چپ حرکت کند.
نور نرم استودیویی روی سطح محصول جابه‌جا شود.
سایه‌ها طبیعی باشند.
پس‌زمینه ثابت و مینیمال باقی بماند.

هیچ نوشته، لوگو، شیء یا ویژگی جدیدی به محصول اضافه نشود.
ویدئو باید برای صفحه محصول یک فروشگاه اینترنتی مناسب باشد.

نمونه پرامپت برای ویدئوی معماری

یک ویلای مدرن سفید در کنار دریا هنگام طلوع خورشید.

دوربین از نمای هوایی به‌آرامی به ساختمان نزدیک شود.
سپس در امتداد استخر روباز حرکت کند و نمای شیشه‌ای ویلا را نشان دهد.
انعکاس آسمان و نور صبح روی آب طبیعی باشد.

درختان نخل با نسیم ملایم حرکت کنند.
هیچ انسان یا وسیله نقلیه‌ای در تصویر نباشد.

صدای موج دریا و پرندگان از فاصله دور شنیده شود.
سبک واقع‌گرایانه، معماری لوکس و سینمایی.

نمونه پرامپت برای ویدئوی آموزشی

یک انیمیشن آموزشی ساده درباره گردش آب در طبیعت.

ابتدا بخارشدن آب دریا نشان داده شود.
سپس ابرها تشکیل شوند.
بعد باران روی کوه‌ها ببارد و آب از طریق رودخانه به دریا بازگردد.

حرکت‌ها واضح و قابل فهم باشند.
رنگ‌ها روشن و آموزشی باشند.
دوربین ثابت بماند و مراحل به‌ترتیب نمایش داده شوند.

هیچ نوشته‌ای داخل تصویر تولید نشود.
برای دانش‌آموزان ۱۰ تا ۱۴ ساله مناسب باشد.

متن و برچسب‌ها را بهتر است بعداً در نرم‌افزار تدوین اضافه کنید؛ زیرا تولید دقیق متن داخل ویدئو همچنان ممکن است با خطا همراه باشد.

نمونه پرامپت دارای دیالوگ فارسی

یک زن جوان در آشپزخانه‌ای روشن کنار پنجره ایستاده است.
او یک فنجان چای را در دست دارد و به دوربین نگاه می‌کند.

با لحن طبیعی، آرام و دوستانه به فارسی می‌گوید:
«گاهی یک استراحت کوتاه، تمام چیزی است که نیاز داریم.»

حرکت لب‌ها با دیالوگ هماهنگ باشد.
بعد از پایان جمله، زن لبخند کوتاهی بزند و به بیرون پنجره نگاه کند.

صدای محیط آشپزخانه بسیار ملایم و موسیقی پیانو آرام باشد.
دوربین ثابت و در نمای Medium Shot قرار داشته باشد.

تولید گفتار فارسی و هماهنگی لب باید در عمل آزمایش شود. کیفیت آن ممکن است براساس جمله، نوع صدا و نسخه مدل متفاوت باشد.

چگونه یک شخصیت ثابت بسازیم؟

یکی از چالش‌های تولید ویدئو با AI، حفظ ظاهر شخصیت در چند Shot است.

برای افزایش ثبات:

  • از تصویر مرجع یکسان استفاده کنید.
  • ویژگی‌های شخصیت را ثابت بنویسید.
  • لباس را در هر Prompt تکرار کنید.
  • سن، مو، چهره و قد را تغییر ندهید.
  • نور و سبک بصری یکسان باشند.
  • تعداد تغییرات هر Shot را محدود کنید.
  • ابتدا تصاویر مرجع شخصیت را آماده کنید.
  • هر صحنه را جداگانه تولید کنید.
  • خروجی‌ها را در تدوین نهایی ترکیب کنید.

نمونه تعریف ثابت:

شخصیت اصلی:
زن ایرانی ۳۲ ساله
موهای مشکی تا روی شانه
مانتوی سرمه‌ای ساده
شال خاکستری روشن
چهره طبیعی و آرایش بسیار کم

این توضیح را بدون تغییر در تمام Promptهای مربوط به شخصیت استفاده کنید.

چگونه ویدئو تبلیغاتی چندصحنه‌ای بسازیم؟

تلاش برای ساخت یک تبلیغ کامل با یک Prompt معمولاً نتیجه ضعیف‌تری ایجاد می‌کند. بهتر است ویدئو به Shotهای کوتاه تقسیم شود.

برای تبلیغ قهوه:

Shot اول: معرفی فضا

نمای باز یک کافه آرام هنگام صبح.
نور طلایی از پنجره وارد می‌شود.

Shot دوم: محصول

نمای Macro از دانه‌های قهوه که داخل دستگاه ریخته می‌شوند.

Shot سوم: فرایند

قهوه به‌آرامی داخل فنجان سفید ریخته می‌شود.
بخار طبیعی از فنجان بالا می‌رود.

Shot چهارم: تجربه مشتری

مشتری فنجان را برمی‌دارد، عطر قهوه را حس می‌کند و لبخند ملایمی می‌زند.

Shot پنجم: پایان

فنجان روی میز چوبی قرار دارد.
پس‌زمینه محو و نور گرم است.
فضای خالی در سمت راست برای اضافه‌کردن لوگو باقی بماند.

لوگو، نوشته، قیمت و CTA بهتر است در نرم‌افزار تدوین اضافه شوند.

چگونه نتیجه Veo را بهتر کنیم؟

هر Prompt را روی یک Shot متمرکز کنید

یک کلیپ کوتاه نباید شامل تعداد زیادی اتفاق باشد.

ضعیف:

مرد وارد خانه شود، غذا درست کند، تلفن بزند، از خانه خارج شود و سوار ماشین شود.

بهتر:

مرد وارد آشپزخانه می‌شود، کت خود را روی صندلی می‌گذارد و پنجره را باز می‌کند.

حرکت دوربین را محدود کنید

درخواست هم‌زمان Pan، Zoom، Orbit و Tracking می‌تواند خروجی را نامنظم کند. معمولاً یک حرکت اصلی کافی است.

از عبارت‌های دقیق استفاده کنید

به‌جای:

ویدئو زیبا باشد.

بنویسید:

نور گرم غروب، کنتراست ملایم، پس‌زمینه محو و حرکت آرام دوربین.

صدا را جداگانه توضیح دهید

صدای محیط:
باران ملایم و صدای دور خودروها

موسیقی:
پیانوی آرام و مینیمال

دیالوگ:
وجود نداشته باشد

موارد ناخواسته را محدود کنید

هیچ نوشته‌ای در تصویر نباشد.
هیچ لوگویی اضافه نشود.
چهره شخصیت تغییر نکند.
حرکت دوربین لرزان نباشد.
محصول از نظر شکل و رنگ تغییر نکند.

ابتدا نسخه آزمایشی بسازید

برای ایده‌پردازی از مدل سریع‌تر استفاده کنید. پس از انتخاب Prompt و ترکیب‌بندی، نسخه نهایی را با مدل باکیفیت‌تر تولید کنید.

آیا Veo می‌تواند ویدئوی فارسی بسازد؟

Veo می‌تواند Prompt فارسی دریافت کند، اما کیفیت درک Promptهای پیچیده ممکن است با زبان و نسخه مدل متفاوت باشد.

برای کنترل بهتر می‌توانید:

  • Prompt را به فارسی روشن و ساختاریافته بنویسید.
  • از اصطلاحات رایج فیلم‌برداری به انگلیسی استفاده کنید.
  • نسخه فارسی و انگلیسی Prompt را آزمایش کنید.
  • دیالوگ فارسی را کوتاه نگه دارید.
  • تلفظ نام‌ها را جداگانه آزمایش کنید.
  • چند مفهوم پیچیده را در یک جمله قرار ندهید.

برای مثال:

Medium shot, slow push-in.

یک فروشنده ایرانی در فروشگاهی مدرن کنار پیشخوان ایستاده است.
او با لحن طبیعی و دوستانه به فارسی می‌گوید:
«انتخاب خوب، از شناخت نیاز شروع می‌شود.»

نور طبیعی، چهره واقعی و حرکت لب هماهنگ باشد.

Veo برای چه مشاغلی کاربرد دارد؟

فروشگاه‌های اینترنتی

  • متحرک‌کردن عکس محصول
  • ساخت تیزر کوتاه
  • ساخت ویدئوی معرفی ویژگی‌ها
  • تولید محتوای شبکه اجتماعی
  • نمایش محصول در محیط واقعی

مشاوران املاک و معماری

  • متحرک‌کردن Render
  • ساخت نمای هوایی
  • نمایش طراحی داخلی
  • تبدیل تصویر پروژه به کلیپ
  • ساخت ویدئوی Concept

رستوران و کافه

  • معرفی غذا
  • نمایش فرایند آماده‌سازی
  • ساخت ویدئوی فضای رستوران
  • تبلیغات مناسبتی
  • تولید Reels

آموزش

  • ساخت انیمیشن توضیحی
  • بازسازی تاریخی
  • توضیح فرایند علمی
  • ساخت مقدمه ویدئوی آموزشی
  • تولید B-roll

گردشگری

  • ساخت تیزر مقصد
  • بازسازی فضای سفر
  • متحرک‌کردن عکس
  • تولید محتوای الهام‌بخش
  • ساخت کلیپ هتل و اقامتگاه

آژانس تبلیغاتی

  • ساخت Storyboard متحرک
  • آزمایش ایده کمپین
  • تولید نسخه‌های متعدد
  • ساخت تبلیغ کوتاه
  • آماده‌سازی Pitch

محدودیت‌های Veo

نتیجه همیشه دقیقاً مطابق Prompt نیست

مدل ممکن است بعضی جزئیات، حرکت‌ها یا روابط فضایی را اشتباه اجرا کند.

ثبات شخصیت چالش‌برانگیز است

ظاهر شخصیت ممکن است میان چند Shot تغییر کند، به‌خصوص اگر تصاویر مرجع و تعریف ثابتی وجود نداشته باشد.

تولید متن داخل ویدئو ممکن است خطا داشته باشد

عنوان، قیمت، شماره تماس و CTA را بهتر است در مرحله تدوین اضافه کنید.

حرکت‌های پیچیده ممکن است غیرطبیعی شوند

تعامل دست‌ها، اشیای کوچک یا چند شخصیت همچنان ممکن است با خطا همراه باشد.

دیالوگ همیشه بی‌نقص نیست

تلفظ، هماهنگی لب و لحن ممکن است به چند بار تولید نیاز داشته باشد.

دسترسی در همه کشورها و حساب‌ها یکسان نیست

قابلیت‌های Gemini، Flow و API براساس منطقه و اشتراک متفاوت‌اند.

ویدئوی نهایی به تدوین نیاز دارد

خروجی AI معمولاً یکی از مواد اولیه تولید است. برای نتیجه حرفه‌ای ممکن است به موارد زیر نیاز باشد:

  • برش
  • ترکیب Shotها
  • اصلاح رنگ
  • افزودن لوگو
  • اضافه‌کردن متن
  • اصلاح صدا
  • موسیقی
  • زیرنویس

Veo بهتر است یا Kling AI؟

Veo و Kling هر دو مدل‌های قدرتمند تولید ویدئو هستند، اما کیفیت نهایی به نوع صحنه بستگی دارد.

معیارVeoKling AI
تولید صدای Nativeداردوابسته به نسخه
واقع‌گراییبالابالا
Image-to-Videoدارددارد
کنترل دوربینمناسبمناسب
ویدئوی عمودیدارددارد
APIدارددارد
ثبات شخصیتنیازمند آزمایشنیازمند آزمایش
دسترسیوابسته به محصول و منطقهوابسته به سرویس

بهترین روش، تولید یک صحنه یکسان با هر دو مدل و مقایسه خروجی است.

Veo بهتر است یا Seedance؟

Seedance برای Text-to-Video، Image-to-Video و استفاده از تصاویر مرجع گزینه مهمی است. برخی نسخه‌های آن روی سرعت و هزینه تمرکز بیشتری دارند.

Veo 3.1 در تولید صوت Native، کیفیت سینمایی و کنترل صحنه توانمند است. Seedance نیز ممکن است برای حرکت، سبک یا بعضی کاربردهای Image-to-Video نتیجه مناسب‌تری بدهد.

انتخاب باید براساس این معیارها انجام شود:

  • کیفیت صحنه موردنظر
  • ثبات شخصیت
  • کیفیت حرکت
  • صوت
  • زمان تولید
  • هزینه
  • رزولوشن
  • API
  • نسبت تصویر
  • امکان استفاده از Reference

Veo بهتر است یا Sora؟

Sora 2 در زمان عرضه قابلیت تولید ویدئو همراه صدا داشت، اما OpenAI تجربه وب و اپلیکیشن Sora را در ۲۶ آوریل ۲۰۲۶ متوقف کرد و برای پایان API آن در ۲۴ سپتامبر ۲۰۲۶ برنامه‌ریزی کرده است. این اطلاعات در راهنمای رسمی توقف Sora منتشر شده است.

بنابراین برای پروژه جدید و بلندمدت، انتخاب مدلی با مسیر دسترسی پایدارتر اهمیت بیشتری دارد. Veo 3.1 در حال حاضر از طریق محصولات و APIهای گوگل ارائه می‌شود، اما وضعیت مدل‌ها و نسخه‌های Preview آن نیز باید پیش از Production بررسی شود.

استفاده از Veo از طریق API

تولید ویدئو نسبت به پاسخ متنی زمان بیشتری نیاز دارد. ساختار معمول برنامه به این شکل است:

ارسال Prompt یا تصویر
دریافت شناسه عملیات
بررسی دوره‌ای وضعیت
دریافت فایل ویدئو پس از تکمیل
ذخیره خروجی

توسعه‌دهنده باید این موارد را مدیریت کند:

  • صف درخواست‌ها
  • زمان انتظار
  • خطا
  • Retry
  • ذخیره فایل
  • محدودیت تعداد درخواست
  • هزینه هر تولید
  • ثبت Prompt و Model ID
  • مدیریت خروجی ناموفق
  • نمایش وضعیت به کاربر

استفاده از مدل‌های ویدئویی با API درواره

درواره دسترسی API به مجموعه‌ای از مدل‌های هوش مصنوعی متن، تصویر، ویدئو و صوت ارائه می‌کند. برای اطمینان از موجودبودن Veo یا هر نسخه مشخص از آن باید کاتالوگ فعلی مدل‌ها و Model ID درج‌شده در پنل بررسی شود.

Base URL درواره:

https://api.darvareh.ir/v1

وجود نام Veo در این مقاله به معنی فعال‌بودن تمام نسخه‌های آن در درواره نیست. Model ID نباید حدس زده شود و باید دقیقاً از کاتالوگ سرویس برداشته شود.

برای دریافت API Key و مشاهده مدل‌های ویدئویی موجود می‌توانید وارد درواره شوید.

API Key باید فقط در Backend نگهداری شود و نباید در کد Front-end، اپلیکیشن عمومی یا مخزن کد قرار بگیرد.

چک‌لیست تولید ویدئو با Veo

پیش از ارسال Prompt بررسی کنید:

  • هدف ویدئو مشخص است.
  • فقط یک Shot اصلی تعریف شده است.
  • سوژه دقیق توصیف شده است.
  • محیط مشخص است.
  • حرکت شخصیت یا محصول روشن است.
  • حرکت دوربین مشخص شده است.
  • نور و زمان تعیین شده‌اند.
  • سبک بصری نوشته شده است.
  • صدا جداگانه توضیح داده شده است.
  • دیالوگ کوتاه و دقیق است.
  • نسبت تصویر مشخص است.
  • موارد ناخواسته محدود شده‌اند.
  • فضای لازم برای متن یا لوگو در نظر گرفته شده است.
  • تصویر مرجع باکیفیت است.
  • نسخه سریع‌تر برای آزمودن Prompt انتخاب شده است.
  • خروجی قبل از انتشار بازبینی می‌شود.

پرسش‌های متداول

Veo چیست؟

Veo خانواده مدل‌های تولید ویدئو با هوش مصنوعی Google DeepMind است که می‌تواند از متن یا تصویر، ویدئو تولید کند. نسخه‌های جدید آن صوت هماهنگ، افکت صوتی و دیالوگ نیز می‌سازند.

جدیدترین نسخه Veo کدام است؟

در زمان نگارش این مقاله، Veo 3.1 نسخه فعلی خانواده Veo است. نسخه‌های اصلی، Fast و Lite برای نیازهای مختلف ارائه شده‌اند.

آیا Veo رایگان است؟

دسترسی رایگان یا پولی به محصول، کشور، اشتراک و تعداد تولید بستگی دارد. استفاده از API معمولاً براساس میزان تولید و مشخصات خروجی محاسبه می‌شود.

Veo 3.1 Lite چیست؟

Veo 3.1 Lite نسخه اقتصادی‌تر مدل ویدئویی گوگل برای تولید تعداد زیادی ویدئو است. این نسخه بعضی قابلیت‌های پیشرفته مانند 4K و Extension را ندارد.

آیا Veo صدا تولید می‌کند؟

بله، نسخه‌های جدید Veo می‌توانند همراه ویدئو، صدای محیط، افکت صوتی، موسیقی و دیالوگ تولید کنند.

آیا Veo عکس را به ویدئو تبدیل می‌کند؟

بله. با ارسال یک تصویر و توضیح حرکت موردنظر می‌توان از Veo برای Image-to-Video استفاده کرد.

آیا Veo دیالوگ فارسی تولید می‌کند؟

می‌توان دیالوگ فارسی را داخل Prompt قرار داد، اما کیفیت تلفظ و هماهنگی لب باید در عمل آزمایش شود و ممکن است به چند بار تولید نیاز داشته باشد.

Veo برای ساخت کلیپ اینستاگرام مناسب است؟

بله. Veo 3.1 از تولید ویدئوی عمودی پشتیبانی می‌کند و می‌توان برای Reels و Shorts خروجی ۹:۱۶ ساخت.

آیا Veo ویدئوی 4K تولید می‌کند؟

قابلیت‌های پیشرفته Veo 3.1 شامل خروجی 4K در محیط‌ها و نسخه‌های پشتیبانی‌شده است. Veo 3.1 Lite از خروجی 4K پشتیبانی نمی‌کند.

بهترین پرامپت Veo چه ویژگی‌هایی دارد؟

یک Prompt مناسب باید سوژه، محیط، اتفاق، حرکت دوربین، نور، سبک، صدا و نسبت تصویر را مشخص کند و روی یک Shot محدود تمرکز داشته باشد.

آیا Veo می‌تواند یک فیلم کامل بسازد؟

برای ساخت فیلم بهتر است پروژه را به Shotهای کوتاه تقسیم کنید، هر Shot را جداگانه تولید کنید و سپس آن‌ها را در نرم‌افزار تدوین به هم متصل کنید.

آیا Veo API دارد؟

بله، نسخه‌های پشتیبانی‌شده Veo از طریق Gemini API و Google AI Studio در دسترس توسعه‌دهندگان قرار می‌گیرند.

Veo بهتر است یا Kling؟

پاسخ به نوع صحنه بستگی دارد. هر دو مدل باید با Prompt و تصویر مرجع یکسان مقایسه شوند.

آیا Veo جایگزین فیلم‌برداری و تدوین است؟

Veo می‌تواند بخشی از فرایند تولید را سریع‌تر کند، اما برای پروژه حرفه‌ای همچنان به ایده، کارگردانی، انتخاب Shot، بازبینی و تدوین نیاز است.

جمع‌بندی

Veo مدل تولید ویدئوی Google DeepMind است که می‌تواند از متن یا تصویر، ویدئوهای واقع‌گرایانه و سینمایی همراه صدا تولید کند.

Veo 3.1 برای کیفیت و کنترل بیشتر طراحی شده است. نسخه Fast برای آزمایش سریع‌تر و Veo 3.1 Lite برای تولید اقتصادی‌تر و مقیاس بالا کاربرد دارد.

برای رسیدن به نتیجه بهتر:

  1. هر Prompt را روی یک Shot متمرکز کنید.
  2. سوژه و محیط را دقیق توضیح دهید.
  3. فقط یک حرکت اصلی دوربین انتخاب کنید.
  4. نور، رنگ و سبک را مشخص کنید.
  5. صدا و دیالوگ را جداگانه بنویسید.
  6. برای ثبات شخصیت از تصاویر مرجع استفاده کنید.
  7. متن و لوگو را در مرحله تدوین اضافه کنید.
  8. ابتدا با نسخه سریع‌تر Prompt را آزمایش کنید.
  9. خروجی را پیش از انتشار بازبینی کنید.
  10. برای فیلم چندصحنه‌ای، Shotها را جداگانه بسازید.

برای دسترسی به API مدل‌های مختلف تولید ویدئو و اتصال آن‌ها به سایت، اپلیکیشن یا فرایند تولید محتوا، مدل‌های موجود را در درواره بررسی کنید.

مقالات مرتبط

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.