Veo چیست؟ معرفی کامل مدل هوش مصنوعی ویدئوساز گوگل و آموزش پرامپتنویسی برای Veo 3.1
Veo مدل تولید ویدئوی هوش مصنوعی گوگل است که میتواند از متن یا تصویر، ویدئوهای سینمایی همراه صدا و دیالوگ بسازد. در این راهنما با Veo 3.1، نسخه Lite و اصول نوشتن پرامپت حرفهای آشنا میشوید.
Veo چیست؟
Veo خانواده مدلهای تولید ویدئو با هوش مصنوعی شرکت Google DeepMind است. این مدل میتواند توضیحات متنی یا تصویر را دریافت کند و براساس آن یک ویدئو تولید کند.
نسخههای جدید Veo فقط تصویر متحرک بدون صدا نمیسازند. آنها میتوانند عناصر صوتی مانند موارد زیر را نیز همراه ویدئو تولید کنند:
- صدای محیط
- افکت صوتی
- گفتوگوی شخصیتها
- موسیقی پسزمینه
- صدای اشیا
- صدای طبیعت
- صداهای هماهنگ با اتفاقات صحنه
Veo برای طیف متنوعی از کاربران قابل استفاده است:
- تولیدکنندگان محتوا
- سازندگان تبلیغات
- فیلمسازان
- طراحان
- کسبوکارهای کوچک
- مدیران شبکههای اجتماعی
- آژانسهای تبلیغاتی
- توسعهدهندگان اپلیکیشن
- فروشگاههای اینترنتی
- مدرسها و تولیدکنندگان محتوای آموزشی
نسخه فعلی این خانواده Veo 3.1 است. گوگل آن را برای تولید ویدئوهای باکیفیت، حرکات پیچیده دوربین، هماهنگی زمانی بهتر و تولید همزمان صدا طراحی کرده است.
در صفحه رسمی Google DeepMind Veo، Veo 3.1 جدیدترین مدل این خانواده معرفی شده و بر واقعگرایی، پیروی دقیقتر از Prompt و کنترل خلاقانه بیشتر آن تأکید شده است.
Veo چگونه کار میکند؟
کاربر صحنه موردنظر خود را با یک Prompt یا پرامپت توضیح میدهد. Veo براساس این توضیحات، مجموعهای از فریمهای مرتبط تولید میکند و آنها را به یک ویدئوی پیوسته تبدیل میکند.
یک پرامپت ساده ممکن است چنین باشد:
یک فنجان قهوه روی میز چوبی کنار پنجره قرار دارد.
نور صبح وارد اتاق میشود و بخار آرامی از فنجان بالا میرود.
دوربین بهآرامی به فنجان نزدیک میشود.
صدای باران ملایم در پسزمینه شنیده میشود.
Veo باید از این متن چند نوع اطلاعات را استخراج کند:
- سوژه اصلی: فنجان قهوه
- محیط: میز چوبی کنار پنجره
- زمان: صبح
- نور: نور طبیعی
- حرکت: بالا رفتن بخار
- حرکت دوربین: نزدیکشدن آرام
- صدا: باران ملایم
- حس صحنه: آرام و صمیمی
هرچه این اطلاعات روشنتر و هماهنگتر باشند، احتمال تولید نتیجه مناسب افزایش پیدا میکند.
Veo 3.1 چیست؟
Veo 3.1 مدل پیشرفته تولید ویدئو در خانواده Veo است. این نسخه برای ساخت ویدئوهای سینمایی، خروجی باکیفیت، حرکات پیچیده دوربین و تولید صدای هماهنگ طراحی شده است.
مستندات رسمی Veo 3.1 در Gemini API قابلیتهای اصلی آن را اینگونه معرفی میکند:
- دریافت Prompt متنی
- دریافت تصویر
- تولید ویدئو
- تولید صوت هماهنگ با ویدئو
- مدل استاندارد برای کیفیت بالاتر
- مدل Fast برای سرعت بیشتر
- استفاده از طریق Google AI Studio و Gemini API
شناسههای معرفیشده برای این خانواده عبارتاند از:
veo-3.1-generate-preview
veo-3.1-fast-generate-preview
شناسه مدلها و وضعیت Preview ممکن است تغییر کند. برای استفاده در API باید مستندات فعلی بررسی شوند و نباید Model ID را براساس حافظه یا نام عمومی مدل حدس زد.
Veo 3.1 Lite چیست؟
Veo 3.1 Lite نسخه اقتصادیتر این خانواده برای تولید ویدئو در مقیاس بالاتر است.
این مدل برای توسعهدهندگان و کسبوکارهایی طراحی شده است که میخواهند تعداد زیادی ویدئو تولید کنند، اما همیشه به حداکثر کیفیت یا امکانات نسخه اصلی نیاز ندارند.
براساس مستندات رسمی Veo 3.1 Lite، این مدل:
- متن و تصویر دریافت میکند.
- ویدئو همراه صدا تولید میکند.
- برای تولید انبوه و برنامهپذیر مناسبتر است.
- خروجی 4K ارائه نمیکند.
- قابلیت Extension نسخه اصلی را ندارد.
- برای کاهش هزینه تولید ویدئو طراحی شده است.
شناسه معرفیشده برای آن:
veo-3.1-lite-generate-preview
گوگل Veo 3.1 Lite را مدل ویدئویی مقرونبهصرفهتر خود معرفی کرده است. طبق اعلام رسمی گوگل، این نسخه برای اپلیکیشنها و فرایندهایی مناسب است که تعداد زیادی ویدئو تولید میکنند.
تفاوت Veo 3.1، Veo 3.1 Fast و Veo 3.1 Lite
| نسخه | تمرکز اصلی | کیفیت | سرعت | هزینه نسبی | کاربرد پیشنهادی |
|---|---|---|---|---|---|
| Veo 3.1 | بالاترین کیفیت و کنترل | بسیار بالا | پایینتر | بالاتر | تبلیغات، فیلم و تولید حرفهای |
| Veo 3.1 Fast | تعادل سرعت و کیفیت | بالا | سریعتر | متوسط | تولید محتوا و آزمودن ایدهها |
| Veo 3.1 Lite | کارایی و تولید انبوه | مناسب | سریع | پایینتر | اپلیکیشنها و تولید تعداد زیاد |
انتخاب نسخه مناسب باید براساس هدف انجام شود.
برای یک تبلیغ مهم که خروجی نهایی اهمیت زیادی دارد، نسخه اصلی ممکن است مناسبتر باشد. برای آزمایش چند ایده یا ساخت تعداد زیادی کلیپ شبکه اجتماعی، نسخه Fast یا Lite میتواند انتخاب اقتصادیتری باشد.
Veo چه قابلیتهایی دارد؟
تبدیل متن به ویدئو
در روش Text-to-Video، کاربر فقط با متن صحنه را توصیف میکند.
یک کتابفروشی کوچک و گرم در یک عصر بارانی.
زنی جوان کنار قفسه کتابها قدم میزند و یک کتاب قدیمی را برمیدارد.
دوربین با حرکت نرم او را دنبال میکند.
صدای باران، ورقخوردن کتاب و موسیقی آرام پیانو شنیده میشود.
سبک واقعگرایانه و سینمایی.
تبدیل تصویر به ویدئو
در روش Image-to-Video، یک تصویر بهعنوان فریم یا مرجع اولیه ارسال میشود. سپس Prompt توضیح میدهد چه حرکتی در تصویر اتفاق بیفتد.
دوربین بهآرامی به سمت پنجره حرکت کند.
پرده با وزش ملایم باد تکان بخورد.
نور خورشید بهتدریج وارد اتاق شود.
بخار فنجان روی میز طبیعی و آرام باشد.
صدای پرندگان و نسیم صبحگاهی شنیده شود.
این روش برای موارد زیر مناسب است:
- متحرککردن عکس محصول
- ساخت کلیپ از تصویر تبلیغاتی
- متحرککردن طراحی مفهومی
- تبدیل پوستر به تیزر
- ساخت صحنه از تصویر تولیدشده با AI
- تولید حرکت کنترلشدهتر شخصیت و محیط
تولید صدا همراه ویدئو
یکی از تفاوتهای مهم Veo 3 با بسیاری از نسلهای قدیمی ویدئوسازها، تولید Native Audio است.
بهجای اضافهکردن صدا در مرحلهای جداگانه، میتوان عناصر صوتی را داخل Prompt توضیح داد:
صدای موج آرام دریا
صدای قدمزدن روی شن
صدای مرغهای دریایی از فاصله دور
موسیقی آکوستیک بسیار ملایم
صدا باید با محیط و اتفاقات صحنه هماهنگ باشد. درخواست چند صدای متناقض ممکن است خروجی را شلوغ یا غیرطبیعی کند.
تولید دیالوگ
میتوان دیالوگ شخصیت را داخل Prompt نوشت:
مرد مسن به افق نگاه میکند و با صدای آرام میگوید:
«بعضی مسیرها را باید آهسته رفت.»
پس از جمله، فقط صدای باد و دریا شنیده شود.
برای دیالوگ بهتر باید این موارد مشخص شوند:
- چه کسی صحبت میکند؟
- لحن او چگونه است؟
- جمله دقیق چیست؟
- زبان چیست؟
- هنگام صحبت چه حرکتی دارد؟
- پسزمینه صوتی چیست؟
کنترل حرکت دوربین
حرکت دوربین نقش مهمی در ظاهر حرفهای ویدئو دارد.
حرکتهای رایج عبارتاند از:
Slow push-in: نزدیکشدن آرامPull-back: دورشدن دوربینPan left/right: چرخش افقیTilt up/down: حرکت عمودیTracking shot: دنبالکردن سوژهDolly shot: حرکت نرم دوربین روی مسیرOrbit shot: چرخش دور سوژهStatic shot: دوربین ثابتHandheld: حرکت طبیعی دوربین روی دستAerial shot: نمای هوایی
نمونه:
دوربین از نمای باز خیابان شروع کند.
سپس با یک حرکت آرام Tracking، دوچرخهسوار را دنبال کند.
در پایان دوربین کمی بالا برود و شهر را از نمای وسیع نشان دهد.
استفاده از تصاویر مرجع
Veo 3.1 میتواند برای تولید ویدئو از چند تصویر مرجع استفاده کند. این تصاویر میتوانند برای تعریف شخصیت، محصول، لباس، محیط یا سبک بصری استفاده شوند.
گوگل در بهروزرسانیهای Veo 3.1 قابلیت استفاده از چند تصویر Reference، تعیین فریم اول و آخر و گسترش ویدئو را معرفی کرده است. جزئیات این قابلیتها در Release Notes رسمی Gemini API ثبت شده است.
تعیین فریم اول و آخر
در این روش، تصویر شروع و پایان مشخص میشوند. مدل تلاش میکند حرکت میان این دو تصویر را تولید کند.
این قابلیت برای موارد زیر مفید است:
- تغییر فصل
- تبدیل روز به شب
- نمایش قبل و بعد
- حرکت میان دو موقعیت
- تبدیل طرح اولیه به نتیجه نهایی
- نمایش فرایند تغییر یک محصول
ساخت ویدئوی عمودی
ویدئوی عمودی با نسبت ۹:۱۶ برای Instagram Reels، YouTube Shorts و TikTok مناسب است.
بهتر است در Prompt فقط به عبارت «ویدئوی عمودی» اکتفا نکنید. ترکیببندی را نیز توضیح دهید:
ویدئوی عمودی ۹:۱۶ برای Instagram Reels.
شخصیت در مرکز کادر قرار داشته باشد.
فضای خالی مناسب در بالای تصویر برای اضافهکردن عنوان در نظر گرفته شود.
سوژه اصلی در محدوده امن مرکز تصویر باقی بماند.
طبق بهروزرسانی رسمی Veo 3.1، این مدل از تولید Native ویدئوی عمودی و خروجیهای بهبودیافته 1080p و 4K در قابلیتهای پشتیبانیشده برخوردار است.
چگونه به Veo دسترسی داشته باشیم؟
روش دسترسی به Veo ممکن است براساس کشور، حساب، اشتراک و محصول متفاوت باشد.
Gemini
کاربران میتوانند در نسخهها و اشتراکهای پشتیبانیشده Gemini از قابلیت تولید ویدئو استفاده کنند. نوع مدل، تعداد تولید و محدودیتها ممکن است براساس اشتراک متفاوت باشد.
Google Flow
Flow ابزار فیلمسازی هوش مصنوعی گوگل است. این محیط برای ساخت، مدیریت و ترکیب صحنههای تولیدشده با مدلهای ویدئویی گوگل طراحی شده است.
Flow برای کاربری مناسب است که میخواهد:
- چند Shot تولید کند.
- صحنهها را مدیریت کند.
- شخصیت یا محیط را حفظ کند.
- ویدئو را مرحلهبهمرحله بسازد.
- کنترل خلاقانه بیشتری داشته باشد.
Google AI Studio
Google AI Studio محیطی برای آزمایش مدلها و APIهای هوش مصنوعی گوگل است. توسعهدهندگان میتوانند مدلهای پشتیبانیشده Veo را در آن آزمایش کنند.
Gemini API
توسعهدهندگان میتوانند Veo را به نرمافزار، سایت یا فرایند خود متصل کنند. تولید ویدئو معمولاً یک عملیات زمانبر و غیرهمزمان است؛ برنامه درخواست را ارسال میکند و وضعیت آمادهشدن ویدئو را پیگیری خواهد کرد.
Google Vids
Google Vids ابزار ساخت ویدئو در اکوسیستم Google Workspace است. گوگل در سال ۲۰۲۶ قابلیتهای تولید ویدئو با Veo 3.1 را نیز به این محصول اضافه کرد.
چگونه برای Veo پرامپت بنویسیم؟
یک Prompt مناسب برای Veo بهتر است این اجزا را داشته باشد:
- سوژه
- محیط
- اتفاق اصلی
- حرکت سوژه
- حرکت دوربین
- نوع کادر
- نور
- سبک بصری
- حس و حال
- صدا
- دیالوگ
- نسبت تصویر
قالب پیشنهادی:
سوژه:
[چه شخص یا شیئی دیده میشود؟]
محیط:
[صحنه در کجا اتفاق میافتد؟]
اتفاق:
[چه چیزی رخ میدهد؟]
حرکت دوربین:
[دوربین چگونه حرکت میکند؟]
نور و رنگ:
[نور، زمان و پالت رنگ]
سبک:
[واقعگرایانه، سینمایی، تبلیغاتی و ...]
صدا:
[صدای محیط، افکت، موسیقی یا دیالوگ]
فرمت:
[افقی یا عمودی]
نمونه پرامپت تبلیغاتی برای محصول
یک ویدئوی تبلیغاتی سینمایی از یک ساعت مچی لوکس.
ساعت روی یک سطح سنگی مشکی قرار دارد.
قطرات بسیار ریز آب روی بدنه فلزی آن دیده میشوند.
نور باریک و سردی از سمت چپ روی ساعت حرکت میکند و جزئیات صفحه را آشکار میسازد.
دوربین با یک حرکت Macro بسیار آرام به ساعت نزدیک شود و سپس کمی دور آن بچرخد.
پسزمینه تیره، مینیمال و بدون عناصر اضافی باشد.
صدای ظریف حرکت فلز و موسیقی الکترونیک مینیمال شنیده شود.
هیچ نوشته یا لوگویی تولید نشود.
ویدئو افقی و مناسب تبلیغات محصول باشد.
نمونه پرامپت برای ویدئوی اینستاگرام
ویدئوی عمودی ۹:۱۶ برای Instagram Reels.
یک باریستای جوان در یک کافه مدرن، قهوه را با حرکت آهسته داخل فنجان میریزد.
بخار قهوه در نور گرم صبح دیده شود.
دوربین ابتدا نمای نزدیک فنجان را نشان دهد و سپس آرام به چهره باریستا حرکت کند.
رنگها گرم و طبیعی باشند.
حرکتها واقعی و نرم باشند.
صدای ریختن قهوه، صدای آرام کافه و موسیقی Lo-fi ملایم شنیده شود.
در قسمت بالای کادر فضای خالی برای اضافهکردن عنوان باقی بماند.
نمونه پرامپت سینمایی
نمای باز سینمایی از مردی تنها که هنگام غروب در یک جاده بیابانی قدم میزند.
باد آرام شنها را روی جاده حرکت میدهد.
آسمان نارنجی و بنفش است و سایه مرد روی زمین کشیده شده است.
دوربین از پشت سر با یک Tracking Shot نرم او را دنبال کند.
پس از چند ثانیه، مرد توقف کند و به افق نگاه کند.
دوربین بهآرامی از او فاصله بگیرد و وسعت بیابان را نشان دهد.
صدای باد، قدمها و موسیقی ارکسترال بسیار آرام شنیده شود.
فضا تأملبرانگیز، واقعگرایانه و سینمایی باشد.
نمونه پرامپت تبدیل عکس محصول به ویدئو
پس از ارسال تصویر محصول:
محصول موجود در تصویر باید بدون تغییر در شکل، رنگ، ابعاد و جزئیات حفظ شود.
دوربین با حرکت آرام از سمت راست به چپ حرکت کند.
نور نرم استودیویی روی سطح محصول جابهجا شود.
سایهها طبیعی باشند.
پسزمینه ثابت و مینیمال باقی بماند.
هیچ نوشته، لوگو، شیء یا ویژگی جدیدی به محصول اضافه نشود.
ویدئو باید برای صفحه محصول یک فروشگاه اینترنتی مناسب باشد.
نمونه پرامپت برای ویدئوی معماری
یک ویلای مدرن سفید در کنار دریا هنگام طلوع خورشید.
دوربین از نمای هوایی بهآرامی به ساختمان نزدیک شود.
سپس در امتداد استخر روباز حرکت کند و نمای شیشهای ویلا را نشان دهد.
انعکاس آسمان و نور صبح روی آب طبیعی باشد.
درختان نخل با نسیم ملایم حرکت کنند.
هیچ انسان یا وسیله نقلیهای در تصویر نباشد.
صدای موج دریا و پرندگان از فاصله دور شنیده شود.
سبک واقعگرایانه، معماری لوکس و سینمایی.
نمونه پرامپت برای ویدئوی آموزشی
یک انیمیشن آموزشی ساده درباره گردش آب در طبیعت.
ابتدا بخارشدن آب دریا نشان داده شود.
سپس ابرها تشکیل شوند.
بعد باران روی کوهها ببارد و آب از طریق رودخانه به دریا بازگردد.
حرکتها واضح و قابل فهم باشند.
رنگها روشن و آموزشی باشند.
دوربین ثابت بماند و مراحل بهترتیب نمایش داده شوند.
هیچ نوشتهای داخل تصویر تولید نشود.
برای دانشآموزان ۱۰ تا ۱۴ ساله مناسب باشد.
متن و برچسبها را بهتر است بعداً در نرمافزار تدوین اضافه کنید؛ زیرا تولید دقیق متن داخل ویدئو همچنان ممکن است با خطا همراه باشد.
نمونه پرامپت دارای دیالوگ فارسی
یک زن جوان در آشپزخانهای روشن کنار پنجره ایستاده است.
او یک فنجان چای را در دست دارد و به دوربین نگاه میکند.
با لحن طبیعی، آرام و دوستانه به فارسی میگوید:
«گاهی یک استراحت کوتاه، تمام چیزی است که نیاز داریم.»
حرکت لبها با دیالوگ هماهنگ باشد.
بعد از پایان جمله، زن لبخند کوتاهی بزند و به بیرون پنجره نگاه کند.
صدای محیط آشپزخانه بسیار ملایم و موسیقی پیانو آرام باشد.
دوربین ثابت و در نمای Medium Shot قرار داشته باشد.
تولید گفتار فارسی و هماهنگی لب باید در عمل آزمایش شود. کیفیت آن ممکن است براساس جمله، نوع صدا و نسخه مدل متفاوت باشد.
چگونه یک شخصیت ثابت بسازیم؟
یکی از چالشهای تولید ویدئو با AI، حفظ ظاهر شخصیت در چند Shot است.
برای افزایش ثبات:
- از تصویر مرجع یکسان استفاده کنید.
- ویژگیهای شخصیت را ثابت بنویسید.
- لباس را در هر Prompt تکرار کنید.
- سن، مو، چهره و قد را تغییر ندهید.
- نور و سبک بصری یکسان باشند.
- تعداد تغییرات هر Shot را محدود کنید.
- ابتدا تصاویر مرجع شخصیت را آماده کنید.
- هر صحنه را جداگانه تولید کنید.
- خروجیها را در تدوین نهایی ترکیب کنید.
نمونه تعریف ثابت:
شخصیت اصلی:
زن ایرانی ۳۲ ساله
موهای مشکی تا روی شانه
مانتوی سرمهای ساده
شال خاکستری روشن
چهره طبیعی و آرایش بسیار کم
این توضیح را بدون تغییر در تمام Promptهای مربوط به شخصیت استفاده کنید.
چگونه ویدئو تبلیغاتی چندصحنهای بسازیم؟
تلاش برای ساخت یک تبلیغ کامل با یک Prompt معمولاً نتیجه ضعیفتری ایجاد میکند. بهتر است ویدئو به Shotهای کوتاه تقسیم شود.
برای تبلیغ قهوه:
Shot اول: معرفی فضا
نمای باز یک کافه آرام هنگام صبح.
نور طلایی از پنجره وارد میشود.
Shot دوم: محصول
نمای Macro از دانههای قهوه که داخل دستگاه ریخته میشوند.
Shot سوم: فرایند
قهوه بهآرامی داخل فنجان سفید ریخته میشود.
بخار طبیعی از فنجان بالا میرود.
Shot چهارم: تجربه مشتری
مشتری فنجان را برمیدارد، عطر قهوه را حس میکند و لبخند ملایمی میزند.
Shot پنجم: پایان
فنجان روی میز چوبی قرار دارد.
پسزمینه محو و نور گرم است.
فضای خالی در سمت راست برای اضافهکردن لوگو باقی بماند.
لوگو، نوشته، قیمت و CTA بهتر است در نرمافزار تدوین اضافه شوند.
چگونه نتیجه Veo را بهتر کنیم؟
هر Prompt را روی یک Shot متمرکز کنید
یک کلیپ کوتاه نباید شامل تعداد زیادی اتفاق باشد.
ضعیف:
مرد وارد خانه شود، غذا درست کند، تلفن بزند، از خانه خارج شود و سوار ماشین شود.
بهتر:
مرد وارد آشپزخانه میشود، کت خود را روی صندلی میگذارد و پنجره را باز میکند.
حرکت دوربین را محدود کنید
درخواست همزمان Pan، Zoom، Orbit و Tracking میتواند خروجی را نامنظم کند. معمولاً یک حرکت اصلی کافی است.
از عبارتهای دقیق استفاده کنید
بهجای:
ویدئو زیبا باشد.
بنویسید:
نور گرم غروب، کنتراست ملایم، پسزمینه محو و حرکت آرام دوربین.
صدا را جداگانه توضیح دهید
صدای محیط:
باران ملایم و صدای دور خودروها
موسیقی:
پیانوی آرام و مینیمال
دیالوگ:
وجود نداشته باشد
موارد ناخواسته را محدود کنید
هیچ نوشتهای در تصویر نباشد.
هیچ لوگویی اضافه نشود.
چهره شخصیت تغییر نکند.
حرکت دوربین لرزان نباشد.
محصول از نظر شکل و رنگ تغییر نکند.
ابتدا نسخه آزمایشی بسازید
برای ایدهپردازی از مدل سریعتر استفاده کنید. پس از انتخاب Prompt و ترکیببندی، نسخه نهایی را با مدل باکیفیتتر تولید کنید.
آیا Veo میتواند ویدئوی فارسی بسازد؟
Veo میتواند Prompt فارسی دریافت کند، اما کیفیت درک Promptهای پیچیده ممکن است با زبان و نسخه مدل متفاوت باشد.
برای کنترل بهتر میتوانید:
- Prompt را به فارسی روشن و ساختاریافته بنویسید.
- از اصطلاحات رایج فیلمبرداری به انگلیسی استفاده کنید.
- نسخه فارسی و انگلیسی Prompt را آزمایش کنید.
- دیالوگ فارسی را کوتاه نگه دارید.
- تلفظ نامها را جداگانه آزمایش کنید.
- چند مفهوم پیچیده را در یک جمله قرار ندهید.
برای مثال:
Medium shot, slow push-in.
یک فروشنده ایرانی در فروشگاهی مدرن کنار پیشخوان ایستاده است.
او با لحن طبیعی و دوستانه به فارسی میگوید:
«انتخاب خوب، از شناخت نیاز شروع میشود.»
نور طبیعی، چهره واقعی و حرکت لب هماهنگ باشد.
Veo برای چه مشاغلی کاربرد دارد؟
فروشگاههای اینترنتی
- متحرککردن عکس محصول
- ساخت تیزر کوتاه
- ساخت ویدئوی معرفی ویژگیها
- تولید محتوای شبکه اجتماعی
- نمایش محصول در محیط واقعی
مشاوران املاک و معماری
- متحرککردن Render
- ساخت نمای هوایی
- نمایش طراحی داخلی
- تبدیل تصویر پروژه به کلیپ
- ساخت ویدئوی Concept
رستوران و کافه
- معرفی غذا
- نمایش فرایند آمادهسازی
- ساخت ویدئوی فضای رستوران
- تبلیغات مناسبتی
- تولید Reels
آموزش
- ساخت انیمیشن توضیحی
- بازسازی تاریخی
- توضیح فرایند علمی
- ساخت مقدمه ویدئوی آموزشی
- تولید B-roll
گردشگری
- ساخت تیزر مقصد
- بازسازی فضای سفر
- متحرککردن عکس
- تولید محتوای الهامبخش
- ساخت کلیپ هتل و اقامتگاه
آژانس تبلیغاتی
- ساخت Storyboard متحرک
- آزمایش ایده کمپین
- تولید نسخههای متعدد
- ساخت تبلیغ کوتاه
- آمادهسازی Pitch
محدودیتهای Veo
نتیجه همیشه دقیقاً مطابق Prompt نیست
مدل ممکن است بعضی جزئیات، حرکتها یا روابط فضایی را اشتباه اجرا کند.
ثبات شخصیت چالشبرانگیز است
ظاهر شخصیت ممکن است میان چند Shot تغییر کند، بهخصوص اگر تصاویر مرجع و تعریف ثابتی وجود نداشته باشد.
تولید متن داخل ویدئو ممکن است خطا داشته باشد
عنوان، قیمت، شماره تماس و CTA را بهتر است در مرحله تدوین اضافه کنید.
حرکتهای پیچیده ممکن است غیرطبیعی شوند
تعامل دستها، اشیای کوچک یا چند شخصیت همچنان ممکن است با خطا همراه باشد.
دیالوگ همیشه بینقص نیست
تلفظ، هماهنگی لب و لحن ممکن است به چند بار تولید نیاز داشته باشد.
دسترسی در همه کشورها و حسابها یکسان نیست
قابلیتهای Gemini، Flow و API براساس منطقه و اشتراک متفاوتاند.
ویدئوی نهایی به تدوین نیاز دارد
خروجی AI معمولاً یکی از مواد اولیه تولید است. برای نتیجه حرفهای ممکن است به موارد زیر نیاز باشد:
- برش
- ترکیب Shotها
- اصلاح رنگ
- افزودن لوگو
- اضافهکردن متن
- اصلاح صدا
- موسیقی
- زیرنویس
Veo بهتر است یا Kling AI؟
Veo و Kling هر دو مدلهای قدرتمند تولید ویدئو هستند، اما کیفیت نهایی به نوع صحنه بستگی دارد.
| معیار | Veo | Kling AI |
|---|---|---|
| تولید صدای Native | دارد | وابسته به نسخه |
| واقعگرایی | بالا | بالا |
| Image-to-Video | دارد | دارد |
| کنترل دوربین | مناسب | مناسب |
| ویدئوی عمودی | دارد | دارد |
| API | دارد | دارد |
| ثبات شخصیت | نیازمند آزمایش | نیازمند آزمایش |
| دسترسی | وابسته به محصول و منطقه | وابسته به سرویس |
بهترین روش، تولید یک صحنه یکسان با هر دو مدل و مقایسه خروجی است.
Veo بهتر است یا Seedance؟
Seedance برای Text-to-Video، Image-to-Video و استفاده از تصاویر مرجع گزینه مهمی است. برخی نسخههای آن روی سرعت و هزینه تمرکز بیشتری دارند.
Veo 3.1 در تولید صوت Native، کیفیت سینمایی و کنترل صحنه توانمند است. Seedance نیز ممکن است برای حرکت، سبک یا بعضی کاربردهای Image-to-Video نتیجه مناسبتری بدهد.
انتخاب باید براساس این معیارها انجام شود:
- کیفیت صحنه موردنظر
- ثبات شخصیت
- کیفیت حرکت
- صوت
- زمان تولید
- هزینه
- رزولوشن
- API
- نسبت تصویر
- امکان استفاده از Reference
Veo بهتر است یا Sora؟
Sora 2 در زمان عرضه قابلیت تولید ویدئو همراه صدا داشت، اما OpenAI تجربه وب و اپلیکیشن Sora را در ۲۶ آوریل ۲۰۲۶ متوقف کرد و برای پایان API آن در ۲۴ سپتامبر ۲۰۲۶ برنامهریزی کرده است. این اطلاعات در راهنمای رسمی توقف Sora منتشر شده است.
بنابراین برای پروژه جدید و بلندمدت، انتخاب مدلی با مسیر دسترسی پایدارتر اهمیت بیشتری دارد. Veo 3.1 در حال حاضر از طریق محصولات و APIهای گوگل ارائه میشود، اما وضعیت مدلها و نسخههای Preview آن نیز باید پیش از Production بررسی شود.
استفاده از Veo از طریق API
تولید ویدئو نسبت به پاسخ متنی زمان بیشتری نیاز دارد. ساختار معمول برنامه به این شکل است:
ارسال Prompt یا تصویر
دریافت شناسه عملیات
بررسی دورهای وضعیت
دریافت فایل ویدئو پس از تکمیل
ذخیره خروجی
توسعهدهنده باید این موارد را مدیریت کند:
- صف درخواستها
- زمان انتظار
- خطا
- Retry
- ذخیره فایل
- محدودیت تعداد درخواست
- هزینه هر تولید
- ثبت Prompt و Model ID
- مدیریت خروجی ناموفق
- نمایش وضعیت به کاربر
استفاده از مدلهای ویدئویی با API درواره
درواره دسترسی API به مجموعهای از مدلهای هوش مصنوعی متن، تصویر، ویدئو و صوت ارائه میکند. برای اطمینان از موجودبودن Veo یا هر نسخه مشخص از آن باید کاتالوگ فعلی مدلها و Model ID درجشده در پنل بررسی شود.
Base URL درواره:
https://api.darvareh.ir/v1
وجود نام Veo در این مقاله به معنی فعالبودن تمام نسخههای آن در درواره نیست. Model ID نباید حدس زده شود و باید دقیقاً از کاتالوگ سرویس برداشته شود.
برای دریافت API Key و مشاهده مدلهای ویدئویی موجود میتوانید وارد درواره شوید.
API Key باید فقط در Backend نگهداری شود و نباید در کد Front-end، اپلیکیشن عمومی یا مخزن کد قرار بگیرد.
چکلیست تولید ویدئو با Veo
پیش از ارسال Prompt بررسی کنید:
- هدف ویدئو مشخص است.
- فقط یک Shot اصلی تعریف شده است.
- سوژه دقیق توصیف شده است.
- محیط مشخص است.
- حرکت شخصیت یا محصول روشن است.
- حرکت دوربین مشخص شده است.
- نور و زمان تعیین شدهاند.
- سبک بصری نوشته شده است.
- صدا جداگانه توضیح داده شده است.
- دیالوگ کوتاه و دقیق است.
- نسبت تصویر مشخص است.
- موارد ناخواسته محدود شدهاند.
- فضای لازم برای متن یا لوگو در نظر گرفته شده است.
- تصویر مرجع باکیفیت است.
- نسخه سریعتر برای آزمودن Prompt انتخاب شده است.
- خروجی قبل از انتشار بازبینی میشود.
پرسشهای متداول
Veo چیست؟
Veo خانواده مدلهای تولید ویدئو با هوش مصنوعی Google DeepMind است که میتواند از متن یا تصویر، ویدئو تولید کند. نسخههای جدید آن صوت هماهنگ، افکت صوتی و دیالوگ نیز میسازند.
جدیدترین نسخه Veo کدام است؟
در زمان نگارش این مقاله، Veo 3.1 نسخه فعلی خانواده Veo است. نسخههای اصلی، Fast و Lite برای نیازهای مختلف ارائه شدهاند.
آیا Veo رایگان است؟
دسترسی رایگان یا پولی به محصول، کشور، اشتراک و تعداد تولید بستگی دارد. استفاده از API معمولاً براساس میزان تولید و مشخصات خروجی محاسبه میشود.
Veo 3.1 Lite چیست؟
Veo 3.1 Lite نسخه اقتصادیتر مدل ویدئویی گوگل برای تولید تعداد زیادی ویدئو است. این نسخه بعضی قابلیتهای پیشرفته مانند 4K و Extension را ندارد.
آیا Veo صدا تولید میکند؟
بله، نسخههای جدید Veo میتوانند همراه ویدئو، صدای محیط، افکت صوتی، موسیقی و دیالوگ تولید کنند.
آیا Veo عکس را به ویدئو تبدیل میکند؟
بله. با ارسال یک تصویر و توضیح حرکت موردنظر میتوان از Veo برای Image-to-Video استفاده کرد.
آیا Veo دیالوگ فارسی تولید میکند؟
میتوان دیالوگ فارسی را داخل Prompt قرار داد، اما کیفیت تلفظ و هماهنگی لب باید در عمل آزمایش شود و ممکن است به چند بار تولید نیاز داشته باشد.
Veo برای ساخت کلیپ اینستاگرام مناسب است؟
بله. Veo 3.1 از تولید ویدئوی عمودی پشتیبانی میکند و میتوان برای Reels و Shorts خروجی ۹:۱۶ ساخت.
آیا Veo ویدئوی 4K تولید میکند؟
قابلیتهای پیشرفته Veo 3.1 شامل خروجی 4K در محیطها و نسخههای پشتیبانیشده است. Veo 3.1 Lite از خروجی 4K پشتیبانی نمیکند.
بهترین پرامپت Veo چه ویژگیهایی دارد؟
یک Prompt مناسب باید سوژه، محیط، اتفاق، حرکت دوربین، نور، سبک، صدا و نسبت تصویر را مشخص کند و روی یک Shot محدود تمرکز داشته باشد.
آیا Veo میتواند یک فیلم کامل بسازد؟
برای ساخت فیلم بهتر است پروژه را به Shotهای کوتاه تقسیم کنید، هر Shot را جداگانه تولید کنید و سپس آنها را در نرمافزار تدوین به هم متصل کنید.
آیا Veo API دارد؟
بله، نسخههای پشتیبانیشده Veo از طریق Gemini API و Google AI Studio در دسترس توسعهدهندگان قرار میگیرند.
Veo بهتر است یا Kling؟
پاسخ به نوع صحنه بستگی دارد. هر دو مدل باید با Prompt و تصویر مرجع یکسان مقایسه شوند.
آیا Veo جایگزین فیلمبرداری و تدوین است؟
Veo میتواند بخشی از فرایند تولید را سریعتر کند، اما برای پروژه حرفهای همچنان به ایده، کارگردانی، انتخاب Shot، بازبینی و تدوین نیاز است.
جمعبندی
Veo مدل تولید ویدئوی Google DeepMind است که میتواند از متن یا تصویر، ویدئوهای واقعگرایانه و سینمایی همراه صدا تولید کند.
Veo 3.1 برای کیفیت و کنترل بیشتر طراحی شده است. نسخه Fast برای آزمایش سریعتر و Veo 3.1 Lite برای تولید اقتصادیتر و مقیاس بالا کاربرد دارد.
برای رسیدن به نتیجه بهتر:
- هر Prompt را روی یک Shot متمرکز کنید.
- سوژه و محیط را دقیق توضیح دهید.
- فقط یک حرکت اصلی دوربین انتخاب کنید.
- نور، رنگ و سبک را مشخص کنید.
- صدا و دیالوگ را جداگانه بنویسید.
- برای ثبات شخصیت از تصاویر مرجع استفاده کنید.
- متن و لوگو را در مرحله تدوین اضافه کنید.
- ابتدا با نسخه سریعتر Prompt را آزمایش کنید.
- خروجی را پیش از انتشار بازبینی کنید.
- برای فیلم چندصحنهای، Shotها را جداگانه بسازید.
برای دسترسی به API مدلهای مختلف تولید ویدئو و اتصال آنها به سایت، اپلیکیشن یا فرایند تولید محتوا، مدلهای موجود را در درواره بررسی کنید.