تبدیل متن به ویدئو با هوش مصنوعی؛ آموزش کامل ساخت فیلم از روی نوشته

در این راهنمای عملی یاد می‌گیرید چگونه ایده، متن یا سناریوی خود را با هوش مصنوعی به ویدئو تبدیل کنید؛ از طراحی پلان و نوشتن پرامپت تا تولید تصویر، حرکت، صداگذاری و تدوین نهایی.

Share
تبدیل متن به ویدئو با هوش مصنوعی؛ آموزش کامل ساخت فیلم از روی نوشته

تولید ویدئو در گذشته به دوربین، نورپردازی، بازیگر، لوکیشن، تدوینگر و بودجه قابل‌توجه نیاز داشت. ابزارهای تبدیل متن به ویدئو یا Text to Video اکنون می‌توانند یک توضیح متنی را به کلیپی متحرک تبدیل کنند.

برای مثال، می‌توانید بنویسید:

نمای نزدیک از یک فنجان قهوه روی میز چوبی در کنار پنجره.
نور گرم صبحگاهی وارد اتاق می‌شود و بخار آرام از فنجان بالا می‌رود.
دوربین به‌آرامی به سمت فنجان حرکت می‌کند.
فضا مینیمال، واقعی و تبلیغاتی است.

مدل ویدئویی تلاش می‌کند براساس این توضیح، صحنه، نور، سوژه، حرکت و دوربین را تولید کند.

اما ساخت یک ویدئوی حرفه‌ای فقط به نوشتن یک جمله و فشردن دکمه Generate محدود نمی‌شود. برای رسیدن به خروجی قابل استفاده باید:

  • هدف ویدئو را مشخص کنید
  • مخاطب را بشناسید
  • سناریو را به پلان‌های کوتاه تقسیم کنید
  • برای هر پلان پرامپت مناسب بنویسید
  • مدل درست را انتخاب کنید
  • نسبت تصویر را از ابتدا تعیین کنید
  • ثبات شخصیت و محیط را حفظ کنید
  • خروجی‌ها را بازبینی و اصلاح کنید
  • کلیپ‌ها را در یک نرم‌افزار تدوین کنار هم قرار دهید
  • صدا، موسیقی، افکت و زیرنویس اضافه کنید

در این مقاله، فرایند کامل تبدیل متن به ویدئو با هوش مصنوعی را بررسی می‌کنیم. هدف این است که پس از مطالعه راهنما بتوانید یک ایده خام را به سناریو، Storyboard، پلان‌های قابل تولید و در نهایت یک ویدئوی منسجم تبدیل کنید.

تبدیل متن به ویدئو چیست؟

Text to Video فرایندی است که در آن یک مدل مولد ویدئو، توضیح زبانی کاربر را به مجموعه‌ای از فریم‌های متحرک تبدیل می‌کند.

ورودی می‌تواند شامل این موارد باشد:

  • توضیح سوژه
  • محیط
  • سبک بصری
  • حرکت شخصیت
  • حرکت دوربین
  • نورپردازی
  • زمان روز
  • زاویه دید
  • سرعت حرکت
  • حال‌وهوا
  • رویدادهای صحنه
  • نسبت تصویر
  • توضیح صدا یا دیالوگ، در مدل‌های پشتیبانی‌کننده

خروجی معمولاً یک کلیپ کوتاه است. برای ساخت یک ویدئوی طولانی‌تر، چند کلیپ تولید و سپس در مرحله تدوین به یکدیگر متصل می‌شوند.

تفاوت Text to Video و Image to Video

تبدیل متن به ویدئو

در Text to Video، همه اجزای صحنه از متن ساخته می‌شوند.

مزایا:

  • برای ایده‌پردازی سریع مناسب است
  • به تصویر اولیه نیاز ندارد
  • تنوع خروجی بالاست
  • برای B-roll و صحنه‌های مفهومی کاربرد دارد

محدودیت‌ها:

  • کنترل ظاهر شخصیت دشوارتر است
  • خروجی‌های مختلف ممکن است ثبات بصری نداشته باشند
  • ترکیب‌بندی دقیق همیشه قابل پیش‌بینی نیست
  • جزئیات برند یا محصول ممکن است تغییر کنند

تبدیل عکس به ویدئو

در Image to Video، یک تصویر مرجع به مدل داده می‌شود و متن بیشتر حرکت موردنظر را توضیح می‌دهد.

مزایا:

  • ترکیب‌بندی اولیه کنترل‌شده‌تر است
  • ظاهر شخصیت یا محصول بهتر حفظ می‌شود
  • برای جان‌بخشی به عکس محصول مناسب است
  • تکرار سبک میان پلان‌ها آسان‌تر است

محدودیت‌ها:

  • کیفیت تصویر ورودی اهمیت زیادی دارد
  • حرکت شدید ممکن است ساختار تصویر را خراب کند
  • زاویه‌های خارج از تصویر باید توسط مدل حدس زده شوند

قاعده کاربردی:

اگر ظاهر دقیق سوژه مهم است → Image to Video
اگر ایده و فضای کلی مهم‌تر است → Text to Video

هوش مصنوعی چگونه از متن ویدئو می‌سازد؟

مدل‌های ویدئویی باید هم‌زمان چند مسئله را حل کنند:

  • ساخت ظاهر هر فریم
  • حفظ ارتباط زمانی بین فریم‌ها
  • حرکت طبیعی اشیاء
  • ثبات شخصیت و لباس
  • رعایت حرکت دوربین
  • حفظ نور و فضای صحنه
  • اجرای ترتیب اتفاق‌ها
  • جلوگیری از تغییر ناگهانی اشیاء
  • هماهنگی احتمالی صدا و تصویر

اگر هر فریم مستقل تولید شود، خروجی دچار پرش، تغییر چهره و ناپایداری خواهد شد. مدل ویدئویی باید بداند هر فریم ادامه منطقی فریم قبلی است.

به همین دلیل تولید ویدئو از تولید یک تصویر پیچیده‌تر و پرهزینه‌تر است.

برای چه کارهایی می‌توان از Text to Video استفاده کرد؟

تولید محتوای شبکه‌های اجتماعی

  • ریلز اینستاگرام
  • YouTube Shorts
  • کلیپ لینکدین
  • تیزر کوتاه
  • ویدئوهای مفهومی
  • محتوای مناسبتی

تبلیغات

  • نمایش محصول
  • معرفی ویژگی
  • ساخت B-roll
  • ایجاد صحنه Lifestyle
  • پیش‌نمایش ایده کمپین
  • ویدئوی تبلیغاتی کوتاه

آموزش

  • نمایش یک مفهوم
  • بازسازی یک موقعیت
  • ساخت تصویر متحرک برای روایت
  • نمایش فرایند
  • تولید پس‌زمینه برای ویدئوی آموزشی

معماری و طراحی

  • نمایش حرکت در فضای طراحی‌شده
  • ساخت تور مفهومی
  • جان‌بخشی به رندر
  • نمایش تغییر نور و زمان
  • ارائه ایده پیش از اجرای کامل

داستان‌گویی

  • فیلم کوتاه
  • موزیک‌ویدئو
  • انیمیشن مفهومی
  • پیش‌نمایش فیلم
  • Storyboard متحرک
  • صحنه‌های تخیلی

فروشگاه اینترنتی

  • نمایش محصول در محیط
  • حرکت دوربین دور محصول
  • تبدیل عکس محصول به کلیپ
  • ساخت ویدئو برای صفحه محصول
  • ایجاد نسخه‌های مختلف تبلیغ

محدودیت‌های فعلی تولید ویدئو با هوش مصنوعی

شناخت محدودیت‌ها باعث می‌شود سناریوی قابل‌تولیدتری بنویسید.

کلیپ‌ها معمولاً کوتاه‌اند

مدل‌های ویدئویی اغلب برای ساخت Shotهای کوتاه مناسب‌ترند. ساخت فیلم بلند معمولاً با تولید چند پلان و تدوین آن‌ها انجام می‌شود.

ثبات شخصیت دشوار است

ظاهر چهره، لباس، قد، مو یا وسایل شخصیت ممکن است میان تولیدهای مختلف تغییر کند.

متن داخل تصویر ممکن است خراب شود

اگر صحنه شامل تابلو، بسته‌بندی یا نوشته فارسی باشد، بهتر است متن نهایی را در مرحله تدوین اضافه کنید.

حرکت‌های پیچیده ممکن است نامنظم شوند

تعامل دقیق چند شخصیت، دست‌ها، اشیاء کوچک و حرکات سریع همچنان چالش‌برانگیزند.

اجرای چند اتفاق در یک پلان دشوار است

پرامپتی که هم‌زمان چند رویداد، تغییر دوربین و حرکت شخصیت را درخواست کند، ممکن است فقط بخشی از دستور را اجرا کند.

تداوم روایی خودکار نیست

مدل لزوماً نمی‌داند کلیپ دوم باید ادامه دقیق کلیپ اول باشد. برای ساخت روایت باید مرجع، طراحی شخصیت و برنامه پلان‌ها را حفظ کنید.

بهترین ابزارهای تبدیل متن به ویدئو

مدل‌ها و ابزارهای ویدئویی سریع تغییر می‌کنند. پیش از انتخاب، کیفیت نمونه‌ها، امکانات کنترلی، مدت خروجی، نسبت تصویر، صدا، هزینه و شرایط استفاده را بررسی کنید.

Google Veo

Veo خانواده مدل‌های تولید ویدئوی Google DeepMind است. صفحه رسمی Veo قابلیت‌هایی مانند Text to Video، Image to Video، استفاده از تصاویر مرجع و تولید صدا را معرفی می‌کند.

براساس صفحه رسمی Google DeepMind، نسخه‌های جدید Veo برای کنترل بهتر، رعایت پرامپت، واقع‌گرایی و تولید ویدئو همراه با صدا توسعه یافته‌اند.

کاربردهای مناسب:

  • صحنه‌های سینمایی
  • ویدئوهای واقع‌گرایانه
  • تولید همراه با صدای محیط
  • دیالوگ و افکت صوتی در مدل‌های پشتیبانی‌کننده
  • استفاده از Reference Image
  • طراحی چند پلان در محیط‌های حرفه‌ای

Runway

Runway مجموعه‌ای از ابزارهای تولید و تدوین ویدئو ارائه می‌دهد. مدل Gen-4.5 از Text to Video و Image to Video پشتیبانی می‌کند.

در راهنمای رسمی Runway Gen-4.5 توضیح داده شده است که پرامپت Text to Video باید عناصر بصری و حرکت را توصیف کند، در حالی که پرامپت Image to Video بهتر است روی حرکت صحنه تمرکز داشته باشد.

کاربردهای مناسب:

  • ساخت پلان‌های سینمایی
  • کنترل حرکت دوربین
  • ساخت B-roll
  • تولید از متن یا تصویر
  • آزمایش سریع نسخه‌های مختلف
  • ادامه فرایند در محیط تدوین و Workflow

Adobe Firefly

Adobe Firefly قابلیت تولید ویدئو از متن و تصویر را در کنار ابزارهای تدوین و تولید محتوای Adobe ارائه می‌دهد.

براساس صفحه رسمی Adobe Firefly Video Generator، کاربر می‌تواند مدل، نسبت تصویر، زاویه و حرکت دوربین را انتخاب کند، از متن یا تصویر استفاده کند و خروجی را برای تدوین بیشتر وارد Video Editor کند.

کاربردهای مناسب:

  • B-roll
  • نمایش محصول
  • ایده‌پردازی تبلیغ
  • ساخت صحنه‌های کوتاه
  • ترکیب تولید و تدوین در اکوسیستم Adobe

Kling AI

Kling AI برای تولید ویدئوهای واقع‌گرایانه، Image to Video، کنترل حرکت و ساخت کلیپ از پرامپت استفاده می‌شود. پیش از تولید، نسخه مدل و تنظیمات موجود در حساب خود را بررسی کنید؛ زیرا قابلیت‌ها ممکن است تغییر کنند.

Seedance

مدل‌های Seedance برای تولید ویدئو از متن، تصویر و ورودی‌های مرجع کاربرد دارند. این خانواده برای حرکت، صحنه‌پردازی و تولید کلیپ‌های کوتاه قابل استفاده است.

Hailuo AI

Hailuo AI از ابزارهای تولید ویدئو برای ساخت کلیپ براساس متن یا تصویر است. این سرویس برای آزمایش ایده، صحنه‌های سینمایی و جان‌بخشی به تصویر استفاده می‌شود.

کدام مدل ویدئویی را انتخاب کنیم؟

مدلی وجود ندارد که در تمام سبک‌ها بهترین باشد. یک ماتریس آزمایش بسازید.

معیارپرسش
رعایت پرامپتآیا سوژه و رویداد درست اجرا شده‌اند؟
کیفیت حرکتآیا حرکت طبیعی و پیوسته است؟
ثبات شخصیتآیا چهره و لباس تغییر می‌کنند؟
واقع‌گراییآیا نور، فیزیک و بافت‌ها طبیعی‌اند؟
کنترل دوربینآیا زاویه و حرکت دوربین رعایت می‌شوند؟
نسبت تصویرآیا خروجی مناسب پلتفرم مقصد است؟
صداآیا مدل صدای هم‌زمان تولید می‌کند؟
زمان تولیدهر خروجی چقدر زمان می‌برد؟
هزینههزینه هر پلان قابل قبول است؟
قابلیت APIآیا برای تولید گروهی مناسب است؟

برای پروژه مهم، یک پلان مشابه را در دو یا سه مدل تولید و مقایسه کنید.

فرایند کامل تبدیل متن به ویدئو

مرحله اول: هدف ویدئو را تعیین کنید

قبل از نوشتن سناریو، هدف اصلی را مشخص کنید.

نمونه اهداف:

  • معرفی محصول
  • توضیح یک مفهوم
  • افزایش آگاهی از برند
  • ایجاد ویدئوی سرگرم‌کننده
  • هدایت مخاطب به سایت
  • نمایش یک فضای معماری
  • ساخت پیش‌نمایش داستان
  • ایجاد B-roll برای تدوین

هدف روی مدت، ریتم، سبک و CTA اثر می‌گذارد.

مرحله دوم: پلتفرم مقصد را مشخص کنید

نسبت تصویر را بهتر است پیش از تولید انتخاب کنید.

کاربردنسبت تصویر رایج
ریلز و Shorts9:16
یوتیوب و ویدئوی افقی16:9
پست مربعی1:1
بعضی پست‌های عمودی4:5
ارائه سینمایی16:9 یا عریض‌تر

تبدیل یک کلیپ افقی به عمودی ممکن است بخش‌های مهم را حذف کند. اگر خروجی اصلی برای ریلز است، از ابتدا صحنه را برای کادر عمودی طراحی کنید.

مرحله سوم: پیام اصلی را در یک جمله بنویسید

مثال:

این ویدئو نشان می‌دهد که یک اتصال واحد چگونه دسترسی یک نرم‌افزار به مدل‌های مختلف هوش مصنوعی را ساده می‌کند.

یا:

این ویدئو باید حس آرامش یک صبح بارانی همراه با قهوه را منتقل کند.

هر پلان باید به این پیام خدمت کند.

مرحله چهارم: سناریو را بنویسید

نمونه سناریوی ۳۰ ثانیه‌ای معرفی محصول:

پلان ۱: نمایش مسئله
کاربر میان چند پنل و تنظیمات مختلف سردرگم است.

پلان ۲: نمایش راه‌حل
همه اتصال‌ها به یک ورودی واحد هدایت می‌شوند.

پلان ۳: نمایش کاربرد
یک اپلیکیشن از مدل‌های متن، تصویر و کدنویسی استفاده می‌کند.

پلان ۴: نتیجه
فرایند ساده‌تر، منظم‌تر و قابل مدیریت می‌شود.

پلان ۵: CTA
نام محصول و دعوت به مشاهده اطلاعات بیشتر.

مرحله پنجم: سناریو را به Shot List تبدیل کنید

هر Shot باید تا حد امکان یک اتفاق اصلی داشته باشد.

شمارهتصویرحرکتدوربینمدت تقریبی
۱میز کار شلوغ با چند پنلکاربر میان صفحات جابه‌جا می‌شودحرکت آرام رو به جلوکوتاه
۲خطوط مختلف به یک مسیر می‌رسنداتصال‌ها ادغام می‌شوندنمای بازکوتاه
۳داشبورد ساده روی لپ‌تاپکارت‌های مدل فعال می‌شوندنمای متوسطکوتاه
۴محیط کار منظمکاربر نتیجه را می‌بیندحرکت جانبیکوتاه
۵لوگو و پیام نهایینور ملایمدوربین ثابتکوتاه

مدل ویدئویی نباید خودش ساختار کامل فیلم را حدس بزند. Shot List کنترل تولید را افزایش می‌دهد.

فرمول حرفه‌ای پرامپت Text to Video

یک پرامپت ویدئویی می‌تواند از این ساختار استفاده کند:

نوع پلان
+ سوژه
+ محیط
+ عمل اصلی
+ حرکت دوربین
+ نور
+ سبک بصری
+ حال‌وهوا
+ جزئیات فنی ضروری

نمونه:

A cinematic medium shot of a young product designer working at a clean desk in a modern studio. She sketches a mobile interface on paper, then looks at the laptop screen. The camera slowly pushes forward. Soft morning light enters from a large window, realistic skin tones, subtle depth of field, calm and focused atmosphere, natural motion.

ترجمه مفهومی:

نمای متوسط سینمایی از یک طراح محصول جوان که پشت میز مینیمال در یک استودیوی مدرن کار می‌کند. ابتدا رابط موبایل را روی کاغذ طراحی می‌کند و سپس به صفحه لپ‌تاپ نگاه می‌کند. دوربین به‌آرامی جلو می‌آید. نور نرم صبحگاهی از پنجره بزرگ وارد می‌شود. رنگ پوست طبیعی، عمق میدان ملایم، فضای آرام و متمرکز و حرکت طبیعی.

اجزای پرامپت ویدئویی

نوع پلان

  • نمای باز یا Wide Shot
  • نمای متوسط یا Medium Shot
  • نمای نزدیک یا Close-up
  • نمای بسیار نزدیک یا Extreme Close-up
  • نمای از بالا یا Top-down
  • نمای روی شانه یا Over-the-shoulder
  • نمای معرفی محیط یا Establishing Shot

سوژه

سوژه را دقیق اما مختصر توصیف کنید:

یک مرد میانسال با کت خاکستری

بهتر از:

یک نفر

اگر شخصیت باید در چند پلان تکرار شود، یک Character Sheet ثابت بسازید.

عمل اصلی

از فعل روشن استفاده کنید:

  • راه می‌رود
  • فنجان را برمی‌دارد
  • به پنجره نگاه می‌کند
  • جعبه محصول را باز می‌کند
  • در را به‌آرامی باز می‌کند
  • روی صفحه طراحی می‌کند
  • دور خود می‌چرخد

در یک Shot کوتاه، یک یا دو عمل اصلی کافی است.

حرکت دوربین

  • Static
  • Pan
  • Tilt
  • Dolly In
  • Dolly Out
  • Tracking Shot
  • Orbit
  • Crane Shot
  • Handheld
  • Slow Push-in
  • Zoom

حرکت‌های متعدد و متناقض را در یک پرامپت قرار ندهید.

نور

  • نور نرم صبحگاهی
  • نور طلایی غروب
  • نور سرد اداری
  • نور نئون
  • نور استودیویی
  • نور پنجره
  • نور پرکنتراست
  • نور ابری و پخش‌شده

سبک

  • واقع‌گرایانه
  • سینمایی
  • مستند
  • تبلیغاتی
  • انیمیشن دوبعدی
  • سه‌بعدی
  • Stop Motion
  • نقاشی دیجیتال
  • مینیمال
  • Retro

حال‌وهوا

  • آرام
  • پرانرژی
  • لوکس
  • مرموز
  • شاد
  • نوستالژیک
  • حرفه‌ای
  • آینده‌نگر
  • گرم
  • جدی

پرامپت فارسی بنویسیم یا انگلیسی؟

بسیاری از مدل‌ها پرامپت فارسی را درک می‌کنند، اما کیفیت اجرای اصطلاحات سینمایی ممکن است میان مدل‌ها متفاوت باشد.

روش پیشنهادی:

  1. ایده را به فارسی بنویسید
  2. ساختار و جزئیات را کامل کنید
  3. از مدل زبانی بخواهید نسخه انگلیسی حرفه‌ای بسازد
  4. نسخه فارسی و انگلیسی را آزمایش کنید
  5. خروجی بهتر را مبنا قرار دهید

پرامپت تبدیل:

این توضیح فارسی را به یک Prompt حرفه‌ای Text to Video انگلیسی تبدیل کن.

شرایط:
- معنای اصلی حفظ شود.
- نوع Shot، حرکت سوژه، حرکت دوربین، نور و سبک مشخص باشند.
- فقط یک اتفاق اصلی در پلان وجود داشته باشد.
- از صفت‌های تکراری و متناقض استفاده نشود.
- متن برای مدل تولید ویدئو روشن و مستقیم باشد.
- در پایان نسخه کوتاه و نسخه دقیق ارائه بده.

توضیح:
[متن فارسی]

نمونه پرامپت برای ویدئوی محصول

A premium commercial close-up of a matte black perfume bottle standing on a dark reflective surface. A narrow beam of soft light moves slowly across the glass, revealing subtle texture and condensation. The camera performs a slow controlled orbit around the bottle. Minimal luxury studio environment, deep charcoal background, realistic reflections, precise product proportions, elegant and restrained motion.

نکته: اگر شکل دقیق محصول مهم است، بهتر است عکس واقعی محصول را به‌عنوان مرجع وارد Image to Video کنید.

نمونه پرامپت برای ریلز غذا

Top-down close-up of fresh pasta being plated in a ceramic bowl. The sauce is poured slowly, steam rises naturally, and grated cheese falls from above. Warm restaurant lighting, rich natural colors, shallow depth of field, smooth controlled motion, appetizing commercial food video, vertical composition.

نمونه پرامپت معماری

A slow cinematic walkthrough through a modern minimalist living room with warm wooden surfaces, beige furniture and large floor-to-ceiling windows. Soft sunset light moves across the floor. The camera glides forward at eye level with stable motion. Realistic architectural proportions, clean materials, calm premium atmosphere.

نمونه پرامپت آموزشی

A clean 3D animation showing multiple scattered data streams gradually organizing into one structured flow. The camera remains slightly elevated and moves forward slowly. Minimal dark background, blue and purple accent lights, clear visual hierarchy, professional technology explainer style, no readable text.

نمونه پرامپت طبیعت

Wide cinematic shot of a quiet mountain valley just after sunrise. Thin fog moves between pine trees while golden light reaches the valley floor. A small group of birds crosses the distant sky. The camera slowly pans from left to right. Realistic atmosphere, natural wind, subtle movement, documentary style.

استفاده از Negative Prompt

بعضی مدل‌ها فیلد جداگانه Negative Prompt دارند و بعضی ندارند. اگر مدل پشتیبانی می‌کند، موارد نامطلوب را کوتاه و مشخص بنویسید.

نمونه:

distorted hands, duplicate people, warped objects, unstable face, flickering, unreadable text, sudden camera shake, oversaturated colors

فهرست بسیار طولانی از موارد منفی ممکن است اثر معکوس داشته باشد. ابتدا مشکل واقعی خروجی را پیدا و فقط همان را اصلاح کنید.

چگونه شخصیت ثابت بسازیم؟

ثبات شخصیت از دشوارترین بخش‌های ساخت ویدئوی چندپلان است.

Character Sheet بسازید

مشخصات ثابت را تعریف کنید:

نام داخلی: Character A
سن تقریبی: ۳۵ سال
مو: کوتاه و مشکی
لباس: پیراهن آبی تیره و کت خاکستری
ویژگی چهره: صورت کشیده، ریش کوتاه
اکسسوری: ساعت فلزی
سبک: واقع‌گرایانه و تبلیغاتی

تصویر مرجع تولید کنید

یک تصویر واضح از شخصیت بسازید و در تمام پلان‌ها به‌عنوان Reference استفاده کنید.

لباس را تغییر ندهید

اگر داستان نیاز ندارد، رنگ و مدل لباس را میان پلان‌ها ثابت نگه دارید.

توصیف ثابت داشته باشید

بخش اصلی توصیف شخصیت را در همه پرامپت‌ها عیناً تکرار کنید.

از پلان‌های کنترل‌شده استفاده کنید

نمای نزدیک، متوسط و پشت سر را برنامه‌ریزی کنید. درخواست زاویه‌های بسیار متفاوت ممکن است ظاهر شخصیت را تغییر دهد.

بهترین فریم را به پلان بعدی بدهید

در Workflowهای پشتیبانی‌کننده، فریم پایانی یک کلیپ می‌تواند مرجع شروع کلیپ بعدی باشد.

چگونه محصول را ثابت نگه داریم؟

برای تبلیغ محصول، تولید صرفاً متنی می‌تواند لوگو، نوشته، رنگ یا شکل بسته‌بندی را تغییر دهد.

روش بهتر:

  1. عکس واقعی و باکیفیت محصول تهیه کنید
  2. پس‌زمینه را تمیز کنید
  3. نسبت تصویر خروجی را مشخص کنید
  4. عکس را به Image to Video بدهید
  5. فقط حرکت دوربین و محیط را توصیف کنید
  6. متن و لوگوی نهایی را در تدوین اضافه کنید
  7. شکل محصول را در تمام فریم‌ها بررسی کنید

پرامپت پیشنهادی:

Preserve the exact shape, color and proportions of the product. The camera slowly moves from left to right while soft studio light travels across the surface. The product remains stationary and unchanged. Minimal premium background, realistic reflections, controlled commercial motion.

ساخت ویدئوی طولانی‌تر از چند پلان

به‌جای تولید یک پرامپت پیچیده برای ویدئوی طولانی، آن را به پلان‌های مستقل تبدیل کنید.

مثال داستان کوتاه:

پلان ۱: نمای بیرونی کافه در باران
پلان ۲: ورود شخصیت به کافه
پلان ۳: نمای نزدیک از سفارش قهوه
پلان ۴: نشستن کنار پنجره
پلان ۵: بخار فنجان و خیابان بارانی

برای هر پلان یک پرامپت جداگانه بنویسید و موارد زیر را ثابت نگه دارید:

  • شخصیت
  • لباس
  • لوکیشن
  • زمان روز
  • رنگ‌بندی
  • نوع لنز
  • سبک نور
  • سرعت حرکت
  • نسبت تصویر

سپس کلیپ‌ها را در تدوین به هم متصل کنید.

تدوین ویدئوهای تولیدشده

خروجی مدل معمولاً Draft تصویری است، نه محصول نهایی.

مراحل تدوین:

  1. انتخاب بهترین Take
  2. حذف ابتدا و انتهای نامناسب
  3. تنظیم ترتیب پلان‌ها
  4. اصلاح رنگ
  5. اضافه کردن Transition محدود
  6. تنظیم سرعت
  7. صداگذاری
  8. افزودن موسیقی
  9. ساخت افکت صوتی
  10. ضبط یا تولید Voice-over
  11. افزودن زیرنویس
  12. اضافه کردن متن و لوگو
  13. ساخت CTA
  14. خروجی متناسب با پلتفرم

برای ترکیب کلیپ‌ها می‌توانید از ابزارهایی مانند Premiere Pro، DaVinci Resolve، CapCut یا ویرایشگرهای آنلاین استفاده کنید.

صداگذاری ویدئوی هوش مصنوعی

ویدئو بدون صدای مناسب ممکن است مصنوعی و ناقص به نظر برسد.

لایه‌های صوتی ممکن:

  • Voice-over
  • دیالوگ
  • موسیقی
  • صدای محیط
  • افکت حرکت
  • صدای تماس اشیاء
  • سکوت هدفمند

نمونه برای صحنه کافه:

صدای باران
+ همهمه آرام کافه
+ صدای قرار گرفتن فنجان
+ موسیقی ملایم
+ نریشن

اگر مدل ویدئو صدا را به‌صورت بومی تولید می‌کند، هماهنگی و کیفیت آن را بررسی کنید. ممکن است برای پروژه حرفه‌ای همچنان به ویرایش یا جایگزینی صدا نیاز باشد.

ساخت سناریو و پرامپت با API درواره

درواره زیرساخت API برای دسترسی به مدل‌های مختلف هوش مصنوعی را فراهم می‌کند. می‌توانید از مدل‌های زبانی درواره برای تبدیل ایده به سناریو، Shot List و پرامپت‌های ویدئویی استفاده کنید.

Workflow پیشنهادی:

ایده کاربر
    ↓
تولید Creative Brief
    ↓
ساخت سناریو
    ↓
تقسیم به Shot List
    ↓
تولید پرامپت هر پلان
    ↓
انتخاب مدل ویدئویی
    ↓
تولید کلیپ‌ها
    ↓
بازبینی و تدوین

برای مدل‌های ویدئویی، ساختار درخواست، ورودی‌ها و نحوه تحویل Job ممکن است متفاوت باشد. Model ID و مستندات همان مدل را در درواره بررسی کنید و قیمت را در کد ثابت قرار ندهید.

نمونه تولید Shot List با cURL

curl https://api.darvareh.ir/v1/chat/completions \
  -H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_MODEL_ID",
    "temperature": 0.5,
    "messages": [
      {
        "role": "system",
        "content": "تو کارگردان و طراح پرامپت ویدئویی هستی. سناریو را به پلان‌های کوتاه، روشن و قابل تولید تبدیل کن."
      },
      {
        "role": "user",
        "content": "برای یک ویدئوی عمودی 30 ثانیه‌ای درباره قهوه صبحگاهی، Shot List بساز. ویدئو باید گرم، مینیمال و واقع‌گرایانه باشد. پنج پلان طراحی کن. برای هر پلان هدف، سوژه، عمل، دوربین، نور، صدا و Prompt انگلیسی Text to Video ارائه بده. در هر پلان فقط یک اتفاق اصلی وجود داشته باشد."
      }
    ]
  }'

در این نمونه:

  • YOUR_DARVAREH_API_KEY با کلید واقعی جایگزین می‌شود
  • YOUR_MODEL_ID همان Model ID انتخاب‌شده از درواره است
  • مدل زبانی سناریو و پرامپت تولید می‌کند
  • برای تولید ویدئو باید مدل ویدئویی مناسب انتخاب شود

برای مشاهده مدل‌های موجود، قابلیت‌ها و قیمت به‌روز آن‌ها، صفحه مدل‌های درواره را بررسی کنید.

نمونه تولید پرامپت‌ها با Python

import json
import requests

API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"

brief = {
    "goal": "معرفی یک عطر مینیمال",
    "platform": "Instagram Reels",
    "aspect_ratio": "9:16",
    "duration": "20 seconds",
    "audience": "مخاطبان علاقه‌مند به محصولات لوکس",
    "visual_style": "dark, premium, minimal",
    "product": "بطری عطر مشکی مات",
    "cta": "مشاهده محصول"
}

prompt = f"""
براساس Creative Brief زیر یک Shot List چهارپلان بساز:

{json.dumps(brief, ensure_ascii=False)}

برای هر پلان این فیلدها را ارائه بده:
- shot_number
- purpose
- duration
- subject
- action
- camera
- lighting
- composition
- sound
- text_to_video_prompt_en
- negative_prompt
- continuity_notes

شرایط:
- هر پلان فقط یک عمل اصلی داشته باشد.
- محصول از نظر شکل و رنگ ثابت بماند.
- متن و لوگو داخل تصویر تولید نشوند.
- خروجی فقط JSON معتبر باشد.
"""

response = requests.post(
    "https://api.darvareh.ir/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json",
    },
    json={
        "model": MODEL_ID,
        "temperature": 0.4,
        "messages": [
            {
                "role": "system",
                "content": (
                    "تو متخصص Storyboard و Prompt Design برای مدل‌های "
                    "تولید ویدئو هستی."
                ),
            },
            {
                "role": "user",
                "content": prompt,
            },
        ],
    },
    timeout=120,
)

response.raise_for_status()
data = response.json()

content = data["choices"][0]["message"]["content"]
print(content)

در محیط عملیاتی، JSON را پیش از استفاده اعتبارسنجی کنید.

ساخت صف پردازش برای تولید ویدئو

تولید ویدئو معمولاً فوری نیست و ممکن است به‌صورت Async انجام شود.

معماری مناسب:

درخواست تولید
    ↓
ایجاد Job
    ↓
ارسال به مدل ویدئویی
    ↓
ذخیره Job ID
    ↓
بررسی دوره‌ای وضعیت یا دریافت Webhook
    ↓
دریافت فایل خروجی
    ↓
ذخیره و نمایش به کاربر

وضعیت‌های پیشنهادی:

draft
queued
processing
completed
failed
expired

اطلاعات هر Job:

{
  "id": "video_job_123",
  "user_id": "user_456",
  "model": "YOUR_MODEL_ID",
  "prompt": "Prompt text",
  "aspect_ratio": "9:16",
  "status": "processing",
  "created_at": "2026-07-28T10:00:00Z",
  "output_url": null,
  "error": null
}

جزئیات دقیق Endpoint و پاسخ را باید مطابق مستندات مدل انتخاب‌شده در درواره پیاده‌سازی کنید.

برآورد هزینه پروژه ویدئویی

هزینه واقعی فقط هزینه یک Generation نیست.

اجزای هزینه:

هزینه کل =
تولید Draftها
+ تولید مجدد
+ افزایش کیفیت
+ ساخت تصویر مرجع
+ صداگذاری
+ موسیقی و افکت
+ تدوین
+ ذخیره‌سازی

اگر یک فیلم پنج پلان دارد و برای هر پلان چهار نسخه آزمایش می‌کنید، تعداد Generationها به‌سرعت افزایش می‌یابد.

راهکار:

  1. ابتدا Storyboard را نهایی کنید
  2. پرامپت را با مدل زبانی اصلاح کنید
  3. پلان مشکل‌دار را با کیفیت آزمایشی بسازید
  4. فقط نسخه منتخب را با تنظیمات بهتر تولید کنید
  5. خروجی‌های نامناسب را دوباره با همان پرامپت تکرار نکنید
  6. دلیل خطا را پیدا و فقط همان بخش را اصلاح کنید

قیمت مدل‌ها متغیر است. برای اطلاعات به‌روز به صفحه مدل‌های درواره مراجعه کنید.

چگونه هزینه تولید ویدئو را کاهش دهیم؟

پیش‌تولید را جدی بگیرید

سناریو، Shot List و طراحی شخصیت ارزان‌تر از تولیدهای تکراری هستند.

پلان‌ها را ساده کنید

یک پلان با یک اتفاق روشن احتمال موفقیت بیشتری دارد.

از تصویر مرجع استفاده کنید

برای محصول و شخصیت، Reference می‌تواند تعداد تلاش‌های ناموفق را کاهش دهد.

Draft ارزان‌تر بسازید

در صورت وجود نسخه سریع یا اقتصادی مدل، ابتدا ترکیب‌بندی و حرکت را با آن آزمایش کنید.

فقط بخش مشکل‌دار را بازتولید کنید

اگر چهار پلان خوب و یک پلان ضعیف است، کل ویدئو را از ابتدا نسازید.

خروجی‌ها را آرشیو کنید

یک Shot ردشده ممکن است برای پروژه دیگری مناسب باشد.

پرامپت‌های موفق را ثبت کنید

کتابخانه‌ای از سبک، دوربین، نور و ساختارهای موفق بسازید.

خطاهای رایج در Text to Video

پرامپت بسیار کوتاه

یک ویدئوی زیبا از شهر بساز

مدل اطلاعاتی درباره زمان، دوربین، سبک و رویداد ندارد.

پرامپت بیش از حد شلوغ

درخواست ده اتفاق در چند ثانیه باعث می‌شود مدل بخشی از آن‌ها را حذف یا ترکیب کند.

صفت‌های متناقض

نور تاریک و بسیار روشن
حرکت سریع و کاملاً آرام
سبک مستند و فانتزی سورئال واقع‌گرایانه

اولویت بصری مشخصی ایجاد نمی‌کند.

نادیده گرفتن حرکت

پرامپت تصویر و پرامپت ویدئو یکسان نیستند. باید توضیح دهید چه چیزی و چگونه حرکت می‌کند.

درخواست نوشته داخل صحنه

متن فارسی یا نام برند را بهتر است در تدوین اضافه کنید.

نبود حرکت دوربین مشخص

اگر دوربین مهم است، نوع حرکت را بنویسید. اگر نمی‌خواهید حرکت کند، Static Camera را مشخص کنید.

تغییر مداوم توصیف شخصیت

حتی تغییر کوچک در سن، لباس یا رنگ مو می‌تواند خروجی متفاوتی ایجاد کند.

تولید مستقیم فیلم طولانی

ابتدا پلان‌های کوتاه بسازید و سپس تدوین کنید.

اعتماد به اولین خروجی

Generation اول نقطه شروع است. جزئیات اشتباه و ناپایداری فریم‌ها را بررسی کنید.

روش اصلاح خروجی نامناسب

اگر نتیجه خوب نیست، کل پرامپت را تصادفی تغییر ندهید.

مشکل: دوربین بیش از حد حرکت می‌کند

اصلاح:

locked-off camera, stable composition, no camera shake

مشکل: شخصیت تغییر می‌کند

اصلاح:

  • تصویر مرجع اضافه کنید
  • توصیف ثابت نگه دارید
  • حرکت را ساده‌تر کنید
  • نمای کوتاه‌تر بسازید

مشکل: دست‌ها خراب‌اند

اصلاح:

  • دست را از مرکز روایت خارج کنید
  • نمای دورتر انتخاب کنید
  • تعامل پیچیده با شیء را ساده کنید
  • Takeهای مختلف بسازید

مشکل: محصول تغییر شکل می‌دهد

اصلاح:

  • از Image to Video استفاده کنید
  • حرکت محصول را حذف کنید
  • فقط دوربین یا نور را حرکت دهید
  • شکل و تناسب ثابت را در پرامپت تأکید کنید

مشکل: صحنه بیش از حد مصنوعی است

اصلاح:

  • نور طبیعی تعریف کنید
  • حرکت را محدود کنید
  • صفت‌های تبلیغاتی زیاد را حذف کنید
  • جنس مواد و فیزیک محیط را دقیق‌تر توضیح دهید

کنترل کیفیت ویدئوی تولیدشده

هر خروجی را فریم‌به‌فریم و در سرعت واقعی بررسی کنید.

تصویر

  • چهره ثابت است؟
  • تعداد دست و انگشت طبیعی است؟
  • محصول تغییر شکل نمی‌دهد؟
  • اشیاء ناگهان ظاهر یا حذف نمی‌شوند؟
  • انعکاس‌ها منطقی‌اند؟
  • نوشته خراب دیده نمی‌شود؟
  • نور بین فریم‌ها نمی‌پرد؟

حرکت

  • حرکت شخصیت طبیعی است؟
  • سرعت ناگهان تغییر نمی‌کند؟
  • تماس پا با زمین درست است؟
  • حرکت دوربین نرم است؟
  • اجسام از یکدیگر عبور نمی‌کنند؟

روایت

  • پلان پیام موردنظر را منتقل می‌کند؟
  • شروع و پایان قابل تدوین‌اند؟
  • اتفاق اصلی کامل می‌شود؟
  • پلان با صحنه قبل و بعد هماهنگ است؟

صدا

  • دیالوگ قابل‌فهم است؟
  • حرکت لب هماهنگ است؟
  • افکت صوتی با تصویر هماهنگ است؟
  • صدای محیط ناگهان قطع نمی‌شود؟
  • موسیقی گفتار را نمی‌پوشاند؟

چک‌لیست نهایی پیش از انتشار

  • هدف ویدئو مشخص است
  • مخاطب هدف مشخص است
  • نسبت تصویر درست انتخاب شده است
  • سناریو به پلان‌های کوتاه تقسیم شده است
  • هر پلان یک عمل اصلی دارد
  • شخصیت و لباس میان پلان‌ها ثابت‌اند
  • محصول تغییر شکل نمی‌دهد
  • نوشته و لوگو در تدوین اضافه شده‌اند
  • حرکات غیرطبیعی حذف شده‌اند
  • ابتدا و انتهای هر پلان تمیز است
  • تدوین ریتم مناسبی دارد
  • صداگذاری با تصویر هماهنگ است
  • زیرنویس بازبینی شده است
  • CTA روشن است
  • خروجی روی تلفن همراه آزمایش شده است
  • از تصاویر و فایل‌هایی استفاده شده که اجازه استفاده از آن‌ها را دارید

پرسش‌های متداول

چگونه متن را به ویدئو تبدیل کنیم؟

ابتدا متن را به سناریو و Shot List تبدیل کنید. سپس برای هر پلان یک پرامپت جداگانه بنویسید، مدل ویدئویی را انتخاب کنید، کلیپ‌ها را بسازید و در مرحله تدوین کنار هم قرار دهید.

بهترین هوش مصنوعی ساخت ویدئو از متن چیست؟

انتخاب به سبک، بودجه، نسبت تصویر، نیاز به صدا و کنترل شخصیت بستگی دارد. Veo، Runway، Kling، Seedance، Hailuo و Firefly از گزینه‌های شناخته‌شده‌اند. بهتر است یک پلان مشابه را در چند مدل آزمایش کنید.

آیا می‌توان با پرامپت فارسی ویدئو ساخت؟

بله، بسیاری از مدل‌ها فارسی را درک می‌کنند؛ اما ممکن است اصطلاحات دقیق دوربین و سینما در نسخه انگلیسی بهتر اجرا شوند. هر دو نسخه را آزمایش کنید.

آیا هوش مصنوعی می‌تواند یک فیلم کامل بسازد؟

ساخت کلیپ‌های کوتاه بسیار ساده‌تر از فیلم کامل است. برای فیلم طولانی باید سناریو، شخصیت، پلان‌ها، تداوم، صدا و تدوین را مدیریت کنید.

چگونه شخصیت را در چند ویدئو ثابت نگه داریم؟

Character Sheet، تصویر مرجع، توصیف ثابت، لباس یکسان و استفاده از فریم قبلی به‌عنوان مرجع می‌توانند کمک کنند؛ اما ثبات کامل همیشه تضمین نمی‌شود.

چگونه محصول واقعی را بدون تغییر نمایش دهیم؟

از عکس واقعی محصول و روش Image to Video استفاده کنید. حرکت محصول را محدود و بیشتر روی حرکت دوربین، نور یا محیط تمرکز کنید.

آیا مدل ویدئویی صدای هم‌زمان تولید می‌کند؟

بعضی مدل‌ها امکان تولید صدای محیط، افکت یا دیالوگ را دارند و بعضی فقط ویدئوی بدون صدا می‌سازند. قابلیت نسخه انتخاب‌شده را بررسی کنید.

چرا متن داخل ویدئو خراب می‌شود؟

مدل‌های ویدئویی ممکن است حروف و لوگو را میان فریم‌ها تغییر دهند. متن، قیمت، CTA و لوگوی نهایی را در نرم‌افزار تدوین اضافه کنید.

هزینه ساخت ویدئو با هوش مصنوعی چقدر است؟

هزینه به مدل، مدت، کیفیت، تعداد تلاش‌ها و پردازش‌های تکمیلی بستگی دارد. قیمت ثابت نیست؛ صفحه مدل‌های درواره را برای اطلاعات به‌روز بررسی کنید.

آیا درواره یک برنامه آماده تدوین ویدئو است؟

خیر. درواره زیرساخت API هوش مصنوعی است. می‌توانید از مدل‌های موجود برای ساخت سناریو، پرامپت و در صورت ارائه مدل ویدئویی سازگار، تولید ویدئو در محصول خود استفاده کنید. تدوین نهایی معمولاً در ابزار جداگانه انجام می‌شود.

جمع‌بندی

تبدیل متن به ویدئو با هوش مصنوعی، فرایندی چندمرحله‌ای است. یک پرامپت خوب اهمیت دارد، اما کیفیت نهایی بیشتر به برنامه‌ریزی، Shot List، انتخاب مدل، استفاده از مرجع، کنترل ثبات و تدوین وابسته است.

فرایند پیشنهادی:

  1. هدف و مخاطب را مشخص کنید
  2. پلتفرم و نسبت تصویر را انتخاب کنید
  3. پیام اصلی را در یک جمله بنویسید
  4. سناریو را طراحی کنید
  5. سناریو را به پلان‌های کوتاه تقسیم کنید
  6. برای هر پلان پرامپت مستقل بسازید
  7. شخصیت و محصول را با Reference کنترل کنید
  8. چند Draft آزمایشی تولید کنید
  9. بهترین خروجی‌ها را انتخاب کنید
  10. صدا، زیرنویس، لوگو و CTA را در تدوین اضافه کنید
  11. نسخه نهایی را روی دستگاه مقصد آزمایش کنید

برای ساخت سیستم تولید سناریو، Storyboard، پرامپت و گردش‌کار ویدئویی می‌توانید از API هوش مصنوعی درواره استفاده کنید. برای مشاهده Model IDها، مدل‌های ویدئویی در دسترس و قیمت به‌روز، صفحه مدل‌های درواره را ببینید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.