تبدیل متن به ویدئو با هوش مصنوعی؛ آموزش کامل ساخت فیلم از روی نوشته
در این راهنمای عملی یاد میگیرید چگونه ایده، متن یا سناریوی خود را با هوش مصنوعی به ویدئو تبدیل کنید؛ از طراحی پلان و نوشتن پرامپت تا تولید تصویر، حرکت، صداگذاری و تدوین نهایی.
تولید ویدئو در گذشته به دوربین، نورپردازی، بازیگر، لوکیشن، تدوینگر و بودجه قابلتوجه نیاز داشت. ابزارهای تبدیل متن به ویدئو یا Text to Video اکنون میتوانند یک توضیح متنی را به کلیپی متحرک تبدیل کنند.
برای مثال، میتوانید بنویسید:
نمای نزدیک از یک فنجان قهوه روی میز چوبی در کنار پنجره.
نور گرم صبحگاهی وارد اتاق میشود و بخار آرام از فنجان بالا میرود.
دوربین بهآرامی به سمت فنجان حرکت میکند.
فضا مینیمال، واقعی و تبلیغاتی است.
مدل ویدئویی تلاش میکند براساس این توضیح، صحنه، نور، سوژه، حرکت و دوربین را تولید کند.
اما ساخت یک ویدئوی حرفهای فقط به نوشتن یک جمله و فشردن دکمه Generate محدود نمیشود. برای رسیدن به خروجی قابل استفاده باید:
- هدف ویدئو را مشخص کنید
- مخاطب را بشناسید
- سناریو را به پلانهای کوتاه تقسیم کنید
- برای هر پلان پرامپت مناسب بنویسید
- مدل درست را انتخاب کنید
- نسبت تصویر را از ابتدا تعیین کنید
- ثبات شخصیت و محیط را حفظ کنید
- خروجیها را بازبینی و اصلاح کنید
- کلیپها را در یک نرمافزار تدوین کنار هم قرار دهید
- صدا، موسیقی، افکت و زیرنویس اضافه کنید
در این مقاله، فرایند کامل تبدیل متن به ویدئو با هوش مصنوعی را بررسی میکنیم. هدف این است که پس از مطالعه راهنما بتوانید یک ایده خام را به سناریو، Storyboard، پلانهای قابل تولید و در نهایت یک ویدئوی منسجم تبدیل کنید.
تبدیل متن به ویدئو چیست؟
Text to Video فرایندی است که در آن یک مدل مولد ویدئو، توضیح زبانی کاربر را به مجموعهای از فریمهای متحرک تبدیل میکند.
ورودی میتواند شامل این موارد باشد:
- توضیح سوژه
- محیط
- سبک بصری
- حرکت شخصیت
- حرکت دوربین
- نورپردازی
- زمان روز
- زاویه دید
- سرعت حرکت
- حالوهوا
- رویدادهای صحنه
- نسبت تصویر
- توضیح صدا یا دیالوگ، در مدلهای پشتیبانیکننده
خروجی معمولاً یک کلیپ کوتاه است. برای ساخت یک ویدئوی طولانیتر، چند کلیپ تولید و سپس در مرحله تدوین به یکدیگر متصل میشوند.
تفاوت Text to Video و Image to Video
تبدیل متن به ویدئو
در Text to Video، همه اجزای صحنه از متن ساخته میشوند.
مزایا:
- برای ایدهپردازی سریع مناسب است
- به تصویر اولیه نیاز ندارد
- تنوع خروجی بالاست
- برای B-roll و صحنههای مفهومی کاربرد دارد
محدودیتها:
- کنترل ظاهر شخصیت دشوارتر است
- خروجیهای مختلف ممکن است ثبات بصری نداشته باشند
- ترکیببندی دقیق همیشه قابل پیشبینی نیست
- جزئیات برند یا محصول ممکن است تغییر کنند
تبدیل عکس به ویدئو
در Image to Video، یک تصویر مرجع به مدل داده میشود و متن بیشتر حرکت موردنظر را توضیح میدهد.
مزایا:
- ترکیببندی اولیه کنترلشدهتر است
- ظاهر شخصیت یا محصول بهتر حفظ میشود
- برای جانبخشی به عکس محصول مناسب است
- تکرار سبک میان پلانها آسانتر است
محدودیتها:
- کیفیت تصویر ورودی اهمیت زیادی دارد
- حرکت شدید ممکن است ساختار تصویر را خراب کند
- زاویههای خارج از تصویر باید توسط مدل حدس زده شوند
قاعده کاربردی:
اگر ظاهر دقیق سوژه مهم است → Image to Video
اگر ایده و فضای کلی مهمتر است → Text to Video
هوش مصنوعی چگونه از متن ویدئو میسازد؟
مدلهای ویدئویی باید همزمان چند مسئله را حل کنند:
- ساخت ظاهر هر فریم
- حفظ ارتباط زمانی بین فریمها
- حرکت طبیعی اشیاء
- ثبات شخصیت و لباس
- رعایت حرکت دوربین
- حفظ نور و فضای صحنه
- اجرای ترتیب اتفاقها
- جلوگیری از تغییر ناگهانی اشیاء
- هماهنگی احتمالی صدا و تصویر
اگر هر فریم مستقل تولید شود، خروجی دچار پرش، تغییر چهره و ناپایداری خواهد شد. مدل ویدئویی باید بداند هر فریم ادامه منطقی فریم قبلی است.
به همین دلیل تولید ویدئو از تولید یک تصویر پیچیدهتر و پرهزینهتر است.
برای چه کارهایی میتوان از Text to Video استفاده کرد؟
تولید محتوای شبکههای اجتماعی
- ریلز اینستاگرام
- YouTube Shorts
- کلیپ لینکدین
- تیزر کوتاه
- ویدئوهای مفهومی
- محتوای مناسبتی
تبلیغات
- نمایش محصول
- معرفی ویژگی
- ساخت B-roll
- ایجاد صحنه Lifestyle
- پیشنمایش ایده کمپین
- ویدئوی تبلیغاتی کوتاه
آموزش
- نمایش یک مفهوم
- بازسازی یک موقعیت
- ساخت تصویر متحرک برای روایت
- نمایش فرایند
- تولید پسزمینه برای ویدئوی آموزشی
معماری و طراحی
- نمایش حرکت در فضای طراحیشده
- ساخت تور مفهومی
- جانبخشی به رندر
- نمایش تغییر نور و زمان
- ارائه ایده پیش از اجرای کامل
داستانگویی
- فیلم کوتاه
- موزیکویدئو
- انیمیشن مفهومی
- پیشنمایش فیلم
- Storyboard متحرک
- صحنههای تخیلی
فروشگاه اینترنتی
- نمایش محصول در محیط
- حرکت دوربین دور محصول
- تبدیل عکس محصول به کلیپ
- ساخت ویدئو برای صفحه محصول
- ایجاد نسخههای مختلف تبلیغ
محدودیتهای فعلی تولید ویدئو با هوش مصنوعی
شناخت محدودیتها باعث میشود سناریوی قابلتولیدتری بنویسید.
کلیپها معمولاً کوتاهاند
مدلهای ویدئویی اغلب برای ساخت Shotهای کوتاه مناسبترند. ساخت فیلم بلند معمولاً با تولید چند پلان و تدوین آنها انجام میشود.
ثبات شخصیت دشوار است
ظاهر چهره، لباس، قد، مو یا وسایل شخصیت ممکن است میان تولیدهای مختلف تغییر کند.
متن داخل تصویر ممکن است خراب شود
اگر صحنه شامل تابلو، بستهبندی یا نوشته فارسی باشد، بهتر است متن نهایی را در مرحله تدوین اضافه کنید.
حرکتهای پیچیده ممکن است نامنظم شوند
تعامل دقیق چند شخصیت، دستها، اشیاء کوچک و حرکات سریع همچنان چالشبرانگیزند.
اجرای چند اتفاق در یک پلان دشوار است
پرامپتی که همزمان چند رویداد، تغییر دوربین و حرکت شخصیت را درخواست کند، ممکن است فقط بخشی از دستور را اجرا کند.
تداوم روایی خودکار نیست
مدل لزوماً نمیداند کلیپ دوم باید ادامه دقیق کلیپ اول باشد. برای ساخت روایت باید مرجع، طراحی شخصیت و برنامه پلانها را حفظ کنید.
بهترین ابزارهای تبدیل متن به ویدئو
مدلها و ابزارهای ویدئویی سریع تغییر میکنند. پیش از انتخاب، کیفیت نمونهها، امکانات کنترلی، مدت خروجی، نسبت تصویر، صدا، هزینه و شرایط استفاده را بررسی کنید.
Google Veo
Veo خانواده مدلهای تولید ویدئوی Google DeepMind است. صفحه رسمی Veo قابلیتهایی مانند Text to Video، Image to Video، استفاده از تصاویر مرجع و تولید صدا را معرفی میکند.
براساس صفحه رسمی Google DeepMind، نسخههای جدید Veo برای کنترل بهتر، رعایت پرامپت، واقعگرایی و تولید ویدئو همراه با صدا توسعه یافتهاند.
کاربردهای مناسب:
- صحنههای سینمایی
- ویدئوهای واقعگرایانه
- تولید همراه با صدای محیط
- دیالوگ و افکت صوتی در مدلهای پشتیبانیکننده
- استفاده از Reference Image
- طراحی چند پلان در محیطهای حرفهای
Runway
Runway مجموعهای از ابزارهای تولید و تدوین ویدئو ارائه میدهد. مدل Gen-4.5 از Text to Video و Image to Video پشتیبانی میکند.
در راهنمای رسمی Runway Gen-4.5 توضیح داده شده است که پرامپت Text to Video باید عناصر بصری و حرکت را توصیف کند، در حالی که پرامپت Image to Video بهتر است روی حرکت صحنه تمرکز داشته باشد.
کاربردهای مناسب:
- ساخت پلانهای سینمایی
- کنترل حرکت دوربین
- ساخت B-roll
- تولید از متن یا تصویر
- آزمایش سریع نسخههای مختلف
- ادامه فرایند در محیط تدوین و Workflow
Adobe Firefly
Adobe Firefly قابلیت تولید ویدئو از متن و تصویر را در کنار ابزارهای تدوین و تولید محتوای Adobe ارائه میدهد.
براساس صفحه رسمی Adobe Firefly Video Generator، کاربر میتواند مدل، نسبت تصویر، زاویه و حرکت دوربین را انتخاب کند، از متن یا تصویر استفاده کند و خروجی را برای تدوین بیشتر وارد Video Editor کند.
کاربردهای مناسب:
- B-roll
- نمایش محصول
- ایدهپردازی تبلیغ
- ساخت صحنههای کوتاه
- ترکیب تولید و تدوین در اکوسیستم Adobe
Kling AI
Kling AI برای تولید ویدئوهای واقعگرایانه، Image to Video، کنترل حرکت و ساخت کلیپ از پرامپت استفاده میشود. پیش از تولید، نسخه مدل و تنظیمات موجود در حساب خود را بررسی کنید؛ زیرا قابلیتها ممکن است تغییر کنند.
Seedance
مدلهای Seedance برای تولید ویدئو از متن، تصویر و ورودیهای مرجع کاربرد دارند. این خانواده برای حرکت، صحنهپردازی و تولید کلیپهای کوتاه قابل استفاده است.
Hailuo AI
Hailuo AI از ابزارهای تولید ویدئو برای ساخت کلیپ براساس متن یا تصویر است. این سرویس برای آزمایش ایده، صحنههای سینمایی و جانبخشی به تصویر استفاده میشود.
کدام مدل ویدئویی را انتخاب کنیم؟
مدلی وجود ندارد که در تمام سبکها بهترین باشد. یک ماتریس آزمایش بسازید.
| معیار | پرسش |
|---|---|
| رعایت پرامپت | آیا سوژه و رویداد درست اجرا شدهاند؟ |
| کیفیت حرکت | آیا حرکت طبیعی و پیوسته است؟ |
| ثبات شخصیت | آیا چهره و لباس تغییر میکنند؟ |
| واقعگرایی | آیا نور، فیزیک و بافتها طبیعیاند؟ |
| کنترل دوربین | آیا زاویه و حرکت دوربین رعایت میشوند؟ |
| نسبت تصویر | آیا خروجی مناسب پلتفرم مقصد است؟ |
| صدا | آیا مدل صدای همزمان تولید میکند؟ |
| زمان تولید | هر خروجی چقدر زمان میبرد؟ |
| هزینه | هزینه هر پلان قابل قبول است؟ |
| قابلیت API | آیا برای تولید گروهی مناسب است؟ |
برای پروژه مهم، یک پلان مشابه را در دو یا سه مدل تولید و مقایسه کنید.
فرایند کامل تبدیل متن به ویدئو
مرحله اول: هدف ویدئو را تعیین کنید
قبل از نوشتن سناریو، هدف اصلی را مشخص کنید.
نمونه اهداف:
- معرفی محصول
- توضیح یک مفهوم
- افزایش آگاهی از برند
- ایجاد ویدئوی سرگرمکننده
- هدایت مخاطب به سایت
- نمایش یک فضای معماری
- ساخت پیشنمایش داستان
- ایجاد B-roll برای تدوین
هدف روی مدت، ریتم، سبک و CTA اثر میگذارد.
مرحله دوم: پلتفرم مقصد را مشخص کنید
نسبت تصویر را بهتر است پیش از تولید انتخاب کنید.
| کاربرد | نسبت تصویر رایج |
|---|---|
| ریلز و Shorts | 9:16 |
| یوتیوب و ویدئوی افقی | 16:9 |
| پست مربعی | 1:1 |
| بعضی پستهای عمودی | 4:5 |
| ارائه سینمایی | 16:9 یا عریضتر |
تبدیل یک کلیپ افقی به عمودی ممکن است بخشهای مهم را حذف کند. اگر خروجی اصلی برای ریلز است، از ابتدا صحنه را برای کادر عمودی طراحی کنید.
مرحله سوم: پیام اصلی را در یک جمله بنویسید
مثال:
این ویدئو نشان میدهد که یک اتصال واحد چگونه دسترسی یک نرمافزار به مدلهای مختلف هوش مصنوعی را ساده میکند.
یا:
این ویدئو باید حس آرامش یک صبح بارانی همراه با قهوه را منتقل کند.
هر پلان باید به این پیام خدمت کند.
مرحله چهارم: سناریو را بنویسید
نمونه سناریوی ۳۰ ثانیهای معرفی محصول:
پلان ۱: نمایش مسئله
کاربر میان چند پنل و تنظیمات مختلف سردرگم است.
پلان ۲: نمایش راهحل
همه اتصالها به یک ورودی واحد هدایت میشوند.
پلان ۳: نمایش کاربرد
یک اپلیکیشن از مدلهای متن، تصویر و کدنویسی استفاده میکند.
پلان ۴: نتیجه
فرایند سادهتر، منظمتر و قابل مدیریت میشود.
پلان ۵: CTA
نام محصول و دعوت به مشاهده اطلاعات بیشتر.
مرحله پنجم: سناریو را به Shot List تبدیل کنید
هر Shot باید تا حد امکان یک اتفاق اصلی داشته باشد.
| شماره | تصویر | حرکت | دوربین | مدت تقریبی |
|---|---|---|---|---|
| ۱ | میز کار شلوغ با چند پنل | کاربر میان صفحات جابهجا میشود | حرکت آرام رو به جلو | کوتاه |
| ۲ | خطوط مختلف به یک مسیر میرسند | اتصالها ادغام میشوند | نمای باز | کوتاه |
| ۳ | داشبورد ساده روی لپتاپ | کارتهای مدل فعال میشوند | نمای متوسط | کوتاه |
| ۴ | محیط کار منظم | کاربر نتیجه را میبیند | حرکت جانبی | کوتاه |
| ۵ | لوگو و پیام نهایی | نور ملایم | دوربین ثابت | کوتاه |
مدل ویدئویی نباید خودش ساختار کامل فیلم را حدس بزند. Shot List کنترل تولید را افزایش میدهد.
فرمول حرفهای پرامپت Text to Video
یک پرامپت ویدئویی میتواند از این ساختار استفاده کند:
نوع پلان
+ سوژه
+ محیط
+ عمل اصلی
+ حرکت دوربین
+ نور
+ سبک بصری
+ حالوهوا
+ جزئیات فنی ضروری
نمونه:
A cinematic medium shot of a young product designer working at a clean desk in a modern studio. She sketches a mobile interface on paper, then looks at the laptop screen. The camera slowly pushes forward. Soft morning light enters from a large window, realistic skin tones, subtle depth of field, calm and focused atmosphere, natural motion.
ترجمه مفهومی:
نمای متوسط سینمایی از یک طراح محصول جوان که پشت میز مینیمال در یک استودیوی مدرن کار میکند. ابتدا رابط موبایل را روی کاغذ طراحی میکند و سپس به صفحه لپتاپ نگاه میکند. دوربین بهآرامی جلو میآید. نور نرم صبحگاهی از پنجره بزرگ وارد میشود. رنگ پوست طبیعی، عمق میدان ملایم، فضای آرام و متمرکز و حرکت طبیعی.
اجزای پرامپت ویدئویی
نوع پلان
- نمای باز یا Wide Shot
- نمای متوسط یا Medium Shot
- نمای نزدیک یا Close-up
- نمای بسیار نزدیک یا Extreme Close-up
- نمای از بالا یا Top-down
- نمای روی شانه یا Over-the-shoulder
- نمای معرفی محیط یا Establishing Shot
سوژه
سوژه را دقیق اما مختصر توصیف کنید:
یک مرد میانسال با کت خاکستری
بهتر از:
یک نفر
اگر شخصیت باید در چند پلان تکرار شود، یک Character Sheet ثابت بسازید.
عمل اصلی
از فعل روشن استفاده کنید:
- راه میرود
- فنجان را برمیدارد
- به پنجره نگاه میکند
- جعبه محصول را باز میکند
- در را بهآرامی باز میکند
- روی صفحه طراحی میکند
- دور خود میچرخد
در یک Shot کوتاه، یک یا دو عمل اصلی کافی است.
حرکت دوربین
- Static
- Pan
- Tilt
- Dolly In
- Dolly Out
- Tracking Shot
- Orbit
- Crane Shot
- Handheld
- Slow Push-in
- Zoom
حرکتهای متعدد و متناقض را در یک پرامپت قرار ندهید.
نور
- نور نرم صبحگاهی
- نور طلایی غروب
- نور سرد اداری
- نور نئون
- نور استودیویی
- نور پنجره
- نور پرکنتراست
- نور ابری و پخششده
سبک
- واقعگرایانه
- سینمایی
- مستند
- تبلیغاتی
- انیمیشن دوبعدی
- سهبعدی
- Stop Motion
- نقاشی دیجیتال
- مینیمال
- Retro
حالوهوا
- آرام
- پرانرژی
- لوکس
- مرموز
- شاد
- نوستالژیک
- حرفهای
- آیندهنگر
- گرم
- جدی
پرامپت فارسی بنویسیم یا انگلیسی؟
بسیاری از مدلها پرامپت فارسی را درک میکنند، اما کیفیت اجرای اصطلاحات سینمایی ممکن است میان مدلها متفاوت باشد.
روش پیشنهادی:
- ایده را به فارسی بنویسید
- ساختار و جزئیات را کامل کنید
- از مدل زبانی بخواهید نسخه انگلیسی حرفهای بسازد
- نسخه فارسی و انگلیسی را آزمایش کنید
- خروجی بهتر را مبنا قرار دهید
پرامپت تبدیل:
این توضیح فارسی را به یک Prompt حرفهای Text to Video انگلیسی تبدیل کن.
شرایط:
- معنای اصلی حفظ شود.
- نوع Shot، حرکت سوژه، حرکت دوربین، نور و سبک مشخص باشند.
- فقط یک اتفاق اصلی در پلان وجود داشته باشد.
- از صفتهای تکراری و متناقض استفاده نشود.
- متن برای مدل تولید ویدئو روشن و مستقیم باشد.
- در پایان نسخه کوتاه و نسخه دقیق ارائه بده.
توضیح:
[متن فارسی]
نمونه پرامپت برای ویدئوی محصول
A premium commercial close-up of a matte black perfume bottle standing on a dark reflective surface. A narrow beam of soft light moves slowly across the glass, revealing subtle texture and condensation. The camera performs a slow controlled orbit around the bottle. Minimal luxury studio environment, deep charcoal background, realistic reflections, precise product proportions, elegant and restrained motion.
نکته: اگر شکل دقیق محصول مهم است، بهتر است عکس واقعی محصول را بهعنوان مرجع وارد Image to Video کنید.
نمونه پرامپت برای ریلز غذا
Top-down close-up of fresh pasta being plated in a ceramic bowl. The sauce is poured slowly, steam rises naturally, and grated cheese falls from above. Warm restaurant lighting, rich natural colors, shallow depth of field, smooth controlled motion, appetizing commercial food video, vertical composition.
نمونه پرامپت معماری
A slow cinematic walkthrough through a modern minimalist living room with warm wooden surfaces, beige furniture and large floor-to-ceiling windows. Soft sunset light moves across the floor. The camera glides forward at eye level with stable motion. Realistic architectural proportions, clean materials, calm premium atmosphere.
نمونه پرامپت آموزشی
A clean 3D animation showing multiple scattered data streams gradually organizing into one structured flow. The camera remains slightly elevated and moves forward slowly. Minimal dark background, blue and purple accent lights, clear visual hierarchy, professional technology explainer style, no readable text.
نمونه پرامپت طبیعت
Wide cinematic shot of a quiet mountain valley just after sunrise. Thin fog moves between pine trees while golden light reaches the valley floor. A small group of birds crosses the distant sky. The camera slowly pans from left to right. Realistic atmosphere, natural wind, subtle movement, documentary style.
استفاده از Negative Prompt
بعضی مدلها فیلد جداگانه Negative Prompt دارند و بعضی ندارند. اگر مدل پشتیبانی میکند، موارد نامطلوب را کوتاه و مشخص بنویسید.
نمونه:
distorted hands, duplicate people, warped objects, unstable face, flickering, unreadable text, sudden camera shake, oversaturated colors
فهرست بسیار طولانی از موارد منفی ممکن است اثر معکوس داشته باشد. ابتدا مشکل واقعی خروجی را پیدا و فقط همان را اصلاح کنید.
چگونه شخصیت ثابت بسازیم؟
ثبات شخصیت از دشوارترین بخشهای ساخت ویدئوی چندپلان است.
Character Sheet بسازید
مشخصات ثابت را تعریف کنید:
نام داخلی: Character A
سن تقریبی: ۳۵ سال
مو: کوتاه و مشکی
لباس: پیراهن آبی تیره و کت خاکستری
ویژگی چهره: صورت کشیده، ریش کوتاه
اکسسوری: ساعت فلزی
سبک: واقعگرایانه و تبلیغاتی
تصویر مرجع تولید کنید
یک تصویر واضح از شخصیت بسازید و در تمام پلانها بهعنوان Reference استفاده کنید.
لباس را تغییر ندهید
اگر داستان نیاز ندارد، رنگ و مدل لباس را میان پلانها ثابت نگه دارید.
توصیف ثابت داشته باشید
بخش اصلی توصیف شخصیت را در همه پرامپتها عیناً تکرار کنید.
از پلانهای کنترلشده استفاده کنید
نمای نزدیک، متوسط و پشت سر را برنامهریزی کنید. درخواست زاویههای بسیار متفاوت ممکن است ظاهر شخصیت را تغییر دهد.
بهترین فریم را به پلان بعدی بدهید
در Workflowهای پشتیبانیکننده، فریم پایانی یک کلیپ میتواند مرجع شروع کلیپ بعدی باشد.
چگونه محصول را ثابت نگه داریم؟
برای تبلیغ محصول، تولید صرفاً متنی میتواند لوگو، نوشته، رنگ یا شکل بستهبندی را تغییر دهد.
روش بهتر:
- عکس واقعی و باکیفیت محصول تهیه کنید
- پسزمینه را تمیز کنید
- نسبت تصویر خروجی را مشخص کنید
- عکس را به Image to Video بدهید
- فقط حرکت دوربین و محیط را توصیف کنید
- متن و لوگوی نهایی را در تدوین اضافه کنید
- شکل محصول را در تمام فریمها بررسی کنید
پرامپت پیشنهادی:
Preserve the exact shape, color and proportions of the product. The camera slowly moves from left to right while soft studio light travels across the surface. The product remains stationary and unchanged. Minimal premium background, realistic reflections, controlled commercial motion.
ساخت ویدئوی طولانیتر از چند پلان
بهجای تولید یک پرامپت پیچیده برای ویدئوی طولانی، آن را به پلانهای مستقل تبدیل کنید.
مثال داستان کوتاه:
پلان ۱: نمای بیرونی کافه در باران
پلان ۲: ورود شخصیت به کافه
پلان ۳: نمای نزدیک از سفارش قهوه
پلان ۴: نشستن کنار پنجره
پلان ۵: بخار فنجان و خیابان بارانی
برای هر پلان یک پرامپت جداگانه بنویسید و موارد زیر را ثابت نگه دارید:
- شخصیت
- لباس
- لوکیشن
- زمان روز
- رنگبندی
- نوع لنز
- سبک نور
- سرعت حرکت
- نسبت تصویر
سپس کلیپها را در تدوین به هم متصل کنید.
تدوین ویدئوهای تولیدشده
خروجی مدل معمولاً Draft تصویری است، نه محصول نهایی.
مراحل تدوین:
- انتخاب بهترین Take
- حذف ابتدا و انتهای نامناسب
- تنظیم ترتیب پلانها
- اصلاح رنگ
- اضافه کردن Transition محدود
- تنظیم سرعت
- صداگذاری
- افزودن موسیقی
- ساخت افکت صوتی
- ضبط یا تولید Voice-over
- افزودن زیرنویس
- اضافه کردن متن و لوگو
- ساخت CTA
- خروجی متناسب با پلتفرم
برای ترکیب کلیپها میتوانید از ابزارهایی مانند Premiere Pro، DaVinci Resolve، CapCut یا ویرایشگرهای آنلاین استفاده کنید.
صداگذاری ویدئوی هوش مصنوعی
ویدئو بدون صدای مناسب ممکن است مصنوعی و ناقص به نظر برسد.
لایههای صوتی ممکن:
- Voice-over
- دیالوگ
- موسیقی
- صدای محیط
- افکت حرکت
- صدای تماس اشیاء
- سکوت هدفمند
نمونه برای صحنه کافه:
صدای باران
+ همهمه آرام کافه
+ صدای قرار گرفتن فنجان
+ موسیقی ملایم
+ نریشن
اگر مدل ویدئو صدا را بهصورت بومی تولید میکند، هماهنگی و کیفیت آن را بررسی کنید. ممکن است برای پروژه حرفهای همچنان به ویرایش یا جایگزینی صدا نیاز باشد.
ساخت سناریو و پرامپت با API درواره
درواره زیرساخت API برای دسترسی به مدلهای مختلف هوش مصنوعی را فراهم میکند. میتوانید از مدلهای زبانی درواره برای تبدیل ایده به سناریو، Shot List و پرامپتهای ویدئویی استفاده کنید.
Workflow پیشنهادی:
ایده کاربر
↓
تولید Creative Brief
↓
ساخت سناریو
↓
تقسیم به Shot List
↓
تولید پرامپت هر پلان
↓
انتخاب مدل ویدئویی
↓
تولید کلیپها
↓
بازبینی و تدوین
برای مدلهای ویدئویی، ساختار درخواست، ورودیها و نحوه تحویل Job ممکن است متفاوت باشد. Model ID و مستندات همان مدل را در درواره بررسی کنید و قیمت را در کد ثابت قرار ندهید.
نمونه تولید Shot List با cURL
curl https://api.darvareh.ir/v1/chat/completions \
-H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "YOUR_MODEL_ID",
"temperature": 0.5,
"messages": [
{
"role": "system",
"content": "تو کارگردان و طراح پرامپت ویدئویی هستی. سناریو را به پلانهای کوتاه، روشن و قابل تولید تبدیل کن."
},
{
"role": "user",
"content": "برای یک ویدئوی عمودی 30 ثانیهای درباره قهوه صبحگاهی، Shot List بساز. ویدئو باید گرم، مینیمال و واقعگرایانه باشد. پنج پلان طراحی کن. برای هر پلان هدف، سوژه، عمل، دوربین، نور، صدا و Prompt انگلیسی Text to Video ارائه بده. در هر پلان فقط یک اتفاق اصلی وجود داشته باشد."
}
]
}'
در این نمونه:
YOUR_DARVAREH_API_KEYبا کلید واقعی جایگزین میشودYOUR_MODEL_IDهمان Model ID انتخابشده از درواره است- مدل زبانی سناریو و پرامپت تولید میکند
- برای تولید ویدئو باید مدل ویدئویی مناسب انتخاب شود
برای مشاهده مدلهای موجود، قابلیتها و قیمت بهروز آنها، صفحه مدلهای درواره را بررسی کنید.
نمونه تولید پرامپتها با Python
import json
import requests
API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"
brief = {
"goal": "معرفی یک عطر مینیمال",
"platform": "Instagram Reels",
"aspect_ratio": "9:16",
"duration": "20 seconds",
"audience": "مخاطبان علاقهمند به محصولات لوکس",
"visual_style": "dark, premium, minimal",
"product": "بطری عطر مشکی مات",
"cta": "مشاهده محصول"
}
prompt = f"""
براساس Creative Brief زیر یک Shot List چهارپلان بساز:
{json.dumps(brief, ensure_ascii=False)}
برای هر پلان این فیلدها را ارائه بده:
- shot_number
- purpose
- duration
- subject
- action
- camera
- lighting
- composition
- sound
- text_to_video_prompt_en
- negative_prompt
- continuity_notes
شرایط:
- هر پلان فقط یک عمل اصلی داشته باشد.
- محصول از نظر شکل و رنگ ثابت بماند.
- متن و لوگو داخل تصویر تولید نشوند.
- خروجی فقط JSON معتبر باشد.
"""
response = requests.post(
"https://api.darvareh.ir/v1/chat/completions",
headers={
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json",
},
json={
"model": MODEL_ID,
"temperature": 0.4,
"messages": [
{
"role": "system",
"content": (
"تو متخصص Storyboard و Prompt Design برای مدلهای "
"تولید ویدئو هستی."
),
},
{
"role": "user",
"content": prompt,
},
],
},
timeout=120,
)
response.raise_for_status()
data = response.json()
content = data["choices"][0]["message"]["content"]
print(content)
در محیط عملیاتی، JSON را پیش از استفاده اعتبارسنجی کنید.
ساخت صف پردازش برای تولید ویدئو
تولید ویدئو معمولاً فوری نیست و ممکن است بهصورت Async انجام شود.
معماری مناسب:
درخواست تولید
↓
ایجاد Job
↓
ارسال به مدل ویدئویی
↓
ذخیره Job ID
↓
بررسی دورهای وضعیت یا دریافت Webhook
↓
دریافت فایل خروجی
↓
ذخیره و نمایش به کاربر
وضعیتهای پیشنهادی:
draft
queued
processing
completed
failed
expired
اطلاعات هر Job:
{
"id": "video_job_123",
"user_id": "user_456",
"model": "YOUR_MODEL_ID",
"prompt": "Prompt text",
"aspect_ratio": "9:16",
"status": "processing",
"created_at": "2026-07-28T10:00:00Z",
"output_url": null,
"error": null
}
جزئیات دقیق Endpoint و پاسخ را باید مطابق مستندات مدل انتخابشده در درواره پیادهسازی کنید.
برآورد هزینه پروژه ویدئویی
هزینه واقعی فقط هزینه یک Generation نیست.
اجزای هزینه:
هزینه کل =
تولید Draftها
+ تولید مجدد
+ افزایش کیفیت
+ ساخت تصویر مرجع
+ صداگذاری
+ موسیقی و افکت
+ تدوین
+ ذخیرهسازی
اگر یک فیلم پنج پلان دارد و برای هر پلان چهار نسخه آزمایش میکنید، تعداد Generationها بهسرعت افزایش مییابد.
راهکار:
- ابتدا Storyboard را نهایی کنید
- پرامپت را با مدل زبانی اصلاح کنید
- پلان مشکلدار را با کیفیت آزمایشی بسازید
- فقط نسخه منتخب را با تنظیمات بهتر تولید کنید
- خروجیهای نامناسب را دوباره با همان پرامپت تکرار نکنید
- دلیل خطا را پیدا و فقط همان بخش را اصلاح کنید
قیمت مدلها متغیر است. برای اطلاعات بهروز به صفحه مدلهای درواره مراجعه کنید.
چگونه هزینه تولید ویدئو را کاهش دهیم؟
پیشتولید را جدی بگیرید
سناریو، Shot List و طراحی شخصیت ارزانتر از تولیدهای تکراری هستند.
پلانها را ساده کنید
یک پلان با یک اتفاق روشن احتمال موفقیت بیشتری دارد.
از تصویر مرجع استفاده کنید
برای محصول و شخصیت، Reference میتواند تعداد تلاشهای ناموفق را کاهش دهد.
Draft ارزانتر بسازید
در صورت وجود نسخه سریع یا اقتصادی مدل، ابتدا ترکیببندی و حرکت را با آن آزمایش کنید.
فقط بخش مشکلدار را بازتولید کنید
اگر چهار پلان خوب و یک پلان ضعیف است، کل ویدئو را از ابتدا نسازید.
خروجیها را آرشیو کنید
یک Shot ردشده ممکن است برای پروژه دیگری مناسب باشد.
پرامپتهای موفق را ثبت کنید
کتابخانهای از سبک، دوربین، نور و ساختارهای موفق بسازید.
خطاهای رایج در Text to Video
پرامپت بسیار کوتاه
یک ویدئوی زیبا از شهر بساز
مدل اطلاعاتی درباره زمان، دوربین، سبک و رویداد ندارد.
پرامپت بیش از حد شلوغ
درخواست ده اتفاق در چند ثانیه باعث میشود مدل بخشی از آنها را حذف یا ترکیب کند.
صفتهای متناقض
نور تاریک و بسیار روشن
حرکت سریع و کاملاً آرام
سبک مستند و فانتزی سورئال واقعگرایانه
اولویت بصری مشخصی ایجاد نمیکند.
نادیده گرفتن حرکت
پرامپت تصویر و پرامپت ویدئو یکسان نیستند. باید توضیح دهید چه چیزی و چگونه حرکت میکند.
درخواست نوشته داخل صحنه
متن فارسی یا نام برند را بهتر است در تدوین اضافه کنید.
نبود حرکت دوربین مشخص
اگر دوربین مهم است، نوع حرکت را بنویسید. اگر نمیخواهید حرکت کند، Static Camera را مشخص کنید.
تغییر مداوم توصیف شخصیت
حتی تغییر کوچک در سن، لباس یا رنگ مو میتواند خروجی متفاوتی ایجاد کند.
تولید مستقیم فیلم طولانی
ابتدا پلانهای کوتاه بسازید و سپس تدوین کنید.
اعتماد به اولین خروجی
Generation اول نقطه شروع است. جزئیات اشتباه و ناپایداری فریمها را بررسی کنید.
روش اصلاح خروجی نامناسب
اگر نتیجه خوب نیست، کل پرامپت را تصادفی تغییر ندهید.
مشکل: دوربین بیش از حد حرکت میکند
اصلاح:
locked-off camera, stable composition, no camera shake
مشکل: شخصیت تغییر میکند
اصلاح:
- تصویر مرجع اضافه کنید
- توصیف ثابت نگه دارید
- حرکت را سادهتر کنید
- نمای کوتاهتر بسازید
مشکل: دستها خراباند
اصلاح:
- دست را از مرکز روایت خارج کنید
- نمای دورتر انتخاب کنید
- تعامل پیچیده با شیء را ساده کنید
- Takeهای مختلف بسازید
مشکل: محصول تغییر شکل میدهد
اصلاح:
- از Image to Video استفاده کنید
- حرکت محصول را حذف کنید
- فقط دوربین یا نور را حرکت دهید
- شکل و تناسب ثابت را در پرامپت تأکید کنید
مشکل: صحنه بیش از حد مصنوعی است
اصلاح:
- نور طبیعی تعریف کنید
- حرکت را محدود کنید
- صفتهای تبلیغاتی زیاد را حذف کنید
- جنس مواد و فیزیک محیط را دقیقتر توضیح دهید
کنترل کیفیت ویدئوی تولیدشده
هر خروجی را فریمبهفریم و در سرعت واقعی بررسی کنید.
تصویر
- چهره ثابت است؟
- تعداد دست و انگشت طبیعی است؟
- محصول تغییر شکل نمیدهد؟
- اشیاء ناگهان ظاهر یا حذف نمیشوند؟
- انعکاسها منطقیاند؟
- نوشته خراب دیده نمیشود؟
- نور بین فریمها نمیپرد؟
حرکت
- حرکت شخصیت طبیعی است؟
- سرعت ناگهان تغییر نمیکند؟
- تماس پا با زمین درست است؟
- حرکت دوربین نرم است؟
- اجسام از یکدیگر عبور نمیکنند؟
روایت
- پلان پیام موردنظر را منتقل میکند؟
- شروع و پایان قابل تدویناند؟
- اتفاق اصلی کامل میشود؟
- پلان با صحنه قبل و بعد هماهنگ است؟
صدا
- دیالوگ قابلفهم است؟
- حرکت لب هماهنگ است؟
- افکت صوتی با تصویر هماهنگ است؟
- صدای محیط ناگهان قطع نمیشود؟
- موسیقی گفتار را نمیپوشاند؟
چکلیست نهایی پیش از انتشار
- هدف ویدئو مشخص است
- مخاطب هدف مشخص است
- نسبت تصویر درست انتخاب شده است
- سناریو به پلانهای کوتاه تقسیم شده است
- هر پلان یک عمل اصلی دارد
- شخصیت و لباس میان پلانها ثابتاند
- محصول تغییر شکل نمیدهد
- نوشته و لوگو در تدوین اضافه شدهاند
- حرکات غیرطبیعی حذف شدهاند
- ابتدا و انتهای هر پلان تمیز است
- تدوین ریتم مناسبی دارد
- صداگذاری با تصویر هماهنگ است
- زیرنویس بازبینی شده است
- CTA روشن است
- خروجی روی تلفن همراه آزمایش شده است
- از تصاویر و فایلهایی استفاده شده که اجازه استفاده از آنها را دارید
پرسشهای متداول
چگونه متن را به ویدئو تبدیل کنیم؟
ابتدا متن را به سناریو و Shot List تبدیل کنید. سپس برای هر پلان یک پرامپت جداگانه بنویسید، مدل ویدئویی را انتخاب کنید، کلیپها را بسازید و در مرحله تدوین کنار هم قرار دهید.
بهترین هوش مصنوعی ساخت ویدئو از متن چیست؟
انتخاب به سبک، بودجه، نسبت تصویر، نیاز به صدا و کنترل شخصیت بستگی دارد. Veo، Runway، Kling، Seedance، Hailuo و Firefly از گزینههای شناختهشدهاند. بهتر است یک پلان مشابه را در چند مدل آزمایش کنید.
آیا میتوان با پرامپت فارسی ویدئو ساخت؟
بله، بسیاری از مدلها فارسی را درک میکنند؛ اما ممکن است اصطلاحات دقیق دوربین و سینما در نسخه انگلیسی بهتر اجرا شوند. هر دو نسخه را آزمایش کنید.
آیا هوش مصنوعی میتواند یک فیلم کامل بسازد؟
ساخت کلیپهای کوتاه بسیار سادهتر از فیلم کامل است. برای فیلم طولانی باید سناریو، شخصیت، پلانها، تداوم، صدا و تدوین را مدیریت کنید.
چگونه شخصیت را در چند ویدئو ثابت نگه داریم؟
Character Sheet، تصویر مرجع، توصیف ثابت، لباس یکسان و استفاده از فریم قبلی بهعنوان مرجع میتوانند کمک کنند؛ اما ثبات کامل همیشه تضمین نمیشود.
چگونه محصول واقعی را بدون تغییر نمایش دهیم؟
از عکس واقعی محصول و روش Image to Video استفاده کنید. حرکت محصول را محدود و بیشتر روی حرکت دوربین، نور یا محیط تمرکز کنید.
آیا مدل ویدئویی صدای همزمان تولید میکند؟
بعضی مدلها امکان تولید صدای محیط، افکت یا دیالوگ را دارند و بعضی فقط ویدئوی بدون صدا میسازند. قابلیت نسخه انتخابشده را بررسی کنید.
چرا متن داخل ویدئو خراب میشود؟
مدلهای ویدئویی ممکن است حروف و لوگو را میان فریمها تغییر دهند. متن، قیمت، CTA و لوگوی نهایی را در نرمافزار تدوین اضافه کنید.
هزینه ساخت ویدئو با هوش مصنوعی چقدر است؟
هزینه به مدل، مدت، کیفیت، تعداد تلاشها و پردازشهای تکمیلی بستگی دارد. قیمت ثابت نیست؛ صفحه مدلهای درواره را برای اطلاعات بهروز بررسی کنید.
آیا درواره یک برنامه آماده تدوین ویدئو است؟
خیر. درواره زیرساخت API هوش مصنوعی است. میتوانید از مدلهای موجود برای ساخت سناریو، پرامپت و در صورت ارائه مدل ویدئویی سازگار، تولید ویدئو در محصول خود استفاده کنید. تدوین نهایی معمولاً در ابزار جداگانه انجام میشود.
جمعبندی
تبدیل متن به ویدئو با هوش مصنوعی، فرایندی چندمرحلهای است. یک پرامپت خوب اهمیت دارد، اما کیفیت نهایی بیشتر به برنامهریزی، Shot List، انتخاب مدل، استفاده از مرجع، کنترل ثبات و تدوین وابسته است.
فرایند پیشنهادی:
- هدف و مخاطب را مشخص کنید
- پلتفرم و نسبت تصویر را انتخاب کنید
- پیام اصلی را در یک جمله بنویسید
- سناریو را طراحی کنید
- سناریو را به پلانهای کوتاه تقسیم کنید
- برای هر پلان پرامپت مستقل بسازید
- شخصیت و محصول را با Reference کنترل کنید
- چند Draft آزمایشی تولید کنید
- بهترین خروجیها را انتخاب کنید
- صدا، زیرنویس، لوگو و CTA را در تدوین اضافه کنید
- نسخه نهایی را روی دستگاه مقصد آزمایش کنید
برای ساخت سیستم تولید سناریو، Storyboard، پرامپت و گردشکار ویدئویی میتوانید از API هوش مصنوعی درواره استفاده کنید. برای مشاهده Model IDها، مدلهای ویدئویی در دسترس و قیمت بهروز، صفحه مدلهای درواره را ببینید.
مقالات مرتبط
- بهترین ابزارهای ساخت ویدئو با هوش مصنوعی
- Google Veo؛ راهنمای کامل مدل تولید ویدئو
- Kling AI؛ آموزش کامل ساخت ویدئو
- Runway؛ آموزش کامل تولید و ویرایش ویدئو
- Seedance 2؛ راهنمای مدل تولید ویدئو
- Hailuo AI؛ آموزش ساخت ویدئو
- تبدیل عکس به ویدئو با هوش مصنوعی
- ویرایش ویدئو با هوش مصنوعی
- نوشتن سناریوی ویدئو با هوش مصنوعی
برای مطالعه شرایط استفاده و محدودیتهای مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.