ساخت موزیک ویدیو با هوش مصنوعی؛ آموزش کامل از آهنگ تا کلیپ

در این راهنمای جامع یاد می‌گیرید چگونه با هوش مصنوعی یک موزیک ویدیو حرفه‌ای بسازید؛ از تحلیل آهنگ، انتخاب ایده و نوشتن سناریو تا ساخت استوری‌بورد، تولید نماهای هماهنگ، تدوین روی ضرب موسیقی و خودکارسازی مراحل با API درواره. عنوان متا: ساخت موزیک ویدیو با هوش مصنوعی؛ آموزش کامل و عملی

Share
آموزش ساخت موزیک ویدیو با هوش مصنوعی از آهنگ تا تدوین نهایی

ساخت موزیک ویدیو زمانی به فیلم‌برداری، بازیگر، دوربین حرفه‌ای، لوکیشن، نورپردازی و یک تیم تدوین نیاز داشت. ابزارهای هوش مصنوعی این فرایند را تغییر داده‌اند و اکنون می‌توان بخش بزرگی از تولید یک موزیک ویدیو را با کمک مدل‌های تولید متن، تصویر و ویدیو انجام داد.

با این حال، ساخت موزیک ویدیو با هوش مصنوعی فقط به نوشتن یک پرامپت و دریافت یک کلیپ محدود نمی‌شود. نتیجه حرفه‌ای زمانی به دست می‌آید که آهنگ تحلیل شود، برای آن یک مفهوم بصری ساخته شود، نماها از قبل برنامه‌ریزی شوند و تدوین براساس ریتم موسیقی انجام گیرد.

در این مقاله، فرایند کامل ساخت موزیک ویدیو با هوش مصنوعی را بررسی می‌کنیم و در پایان نشان می‌دهیم چگونه می‌توان این فرایند را با API درواره داخل یک وب‌سایت، اپلیکیشن یا سامانه تولید محتوا پیاده‌سازی کرد.

آیا می‌توان با هوش مصنوعی موزیک ویدیو ساخت؟

بله. مدل‌های هوش مصنوعی می‌توانند در مراحل مختلف تولید موزیک ویدیو استفاده شوند:

  • تحلیل متن و مفهوم آهنگ
  • پیشنهاد ایده و سبک بصری
  • نوشتن سناریو
  • ساخت استوری‌بورد
  • تولید تصویر مرجع شخصیت‌ها
  • تبدیل متن به ویدیو
  • تبدیل تصویر به ویدیو
  • ساخت ویدیوی هماهنگ با سبک آهنگ
  • تولید زیرنویس و متن ترانه
  • طراحی کاور و تصویر بندانگشتی
  • برنامه‌ریزی تدوین
  • تولید نسخه افقی و عمودی

هوش مصنوعی الزاماً جای تدوین‌گر یا کارگردان را نمی‌گیرد. نقش اصلی آن کاهش زمان تولید، آزمایش سریع ایده‌ها و ساخت نماهایی است که اجرای آن‌ها با روش سنتی دشوار یا پرهزینه است.

انواع موزیک ویدیویی که می‌توان با هوش مصنوعی ساخت

پیش از انتخاب ابزار باید نوع موزیک ویدیو مشخص شود.

موزیک ویدیوی داستانی

در این روش، آهنگ با یک داستان تصویری همراه می‌شود. شخصیت، اتفاق و مسیر روایی وجود دارد و هر بخش آهنگ بخشی از داستان را پیش می‌برد.

برای حفظ ظاهر ثابت شخصیت‌ها بهتر است ابتدا تصاویر مرجع ساخته شوند و سپس با روش تصویر به ویدیو متحرک شوند.

موزیک ویدیوی اجرایی

خواننده، نوازنده یا یک شخصیت مجازی در حال اجرا نمایش داده می‌شود. هماهنگ‌کردن دقیق حرکت لب با صدای خواننده ممکن است به ابزار تخصصی Lip Sync نیاز داشته باشد.

لیریک ویدیو

در لیریک ویدیو، متن ترانه عنصر اصلی تصویر است. پس‌زمینه می‌تواند ثابت، متحرک، انتزاعی یا داستانی باشد.

از آنجا که مدل‌های تولید تصویر و ویدیو ممکن است متن فارسی را اشتباه نمایش دهند، بهتر است نوشته‌های فارسی در مرحله تدوین اضافه شوند.

موزیک ویژوالایزر

ویژوالایزر موسیقی معمولاً شامل اشکال انتزاعی، نور، ذرات، موج صوتی یا حرکت‌های تکرارشونده است. این روش برای آهنگ‌های الکترونیک، بی‌کلام و نسخه‌های منتشرشده در یوتیوب مناسب است.

موزیک ویدیوی کوتاه برای اینستاگرام

در این روش، فقط جذاب‌ترین قسمت آهنگ به یک ویدیوی ۱۵ تا ۶۰ ثانیه‌ای تبدیل می‌شود. خروجی معمولاً عمودی است و برای ریلز، استوری و ویدیوهای کوتاه استفاده می‌شود.

موزیک ویدیوی انیمیشنی

تمام شخصیت‌ها و محیط‌ها به‌صورت کارتونی، سه‌بعدی، نقاشی، کمیک یا استاپ‌موشن طراحی می‌شوند. این روش وابستگی کمتری به واقع‌گرایی چهره دارد و معمولاً کنترل سبک بصری در آن ساده‌تر است.

ابزارهای موردنیاز برای ساخت موزیک ویدیو با هوش مصنوعی

هر بخش پروژه را می‌توان با ابزار متفاوتی انجام داد.

مرحلهابزارهای پیشنهادیکاربرد
تحلیل آهنگ و ایده‌پردازیمدل‌های زبانی، ChatGPT، Claude، Geminiتحلیل مفهوم، ساخت سناریو و Shot List
ساخت تصویر مرجعFLUX، Midjourney، مدل‌های Gemini Image و GPT Imageطراحی شخصیت، لباس، لوکیشن و قاب اولیه
تولید ویدیوSeedance، Kling، Runway، Google Veo و مدل‌های مشابهتبدیل متن یا تصویر به کلیپ
تحلیل صوتAudacity، librosaبررسی ریتم، ضرب و ساختار آهنگ
تدوینDaVinci Resolve، CapCut، Premiere Proهماهنگ‌کردن تصویر با موسیقی
پردازش خودکارFFmpegاتصال کلیپ‌ها، تغییر اندازه و افزودن صدا
زیرنویسمدل‌های تبدیل گفتار به متن و ابزارهای SRTاستخراج یا زمان‌بندی متن ترانه
اتصال به اپلیکیشنAPI دروارهدسترسی برنامه‌نویسی به مدل‌های هوش مصنوعی

DaVinci Resolve مجموعه‌ای یکپارچه برای تدوین، اصلاح رنگ، جلوه‌های بصری و پردازش صدا ارائه می‌کند. FFmpeg نیز یک ابزار متن‌باز برای تبدیل، فیلتر و ترکیب فایل‌های صوتی و تصویری است. DaVinci Resolve، FFmpeg

مراحل ساخت موزیک ویدیو با هوش مصنوعی

مرحله اول: خروجی نهایی را مشخص کنید

قبل از تولید اولین تصویر، درباره این موارد تصمیم بگیرید:

  • مدت موزیک ویدیو چقدر است؟
  • خروجی افقی، عمودی یا مربعی است؟
  • ویدیو برای یوتیوب ساخته می‌شود یا اینستاگرام؟
  • آیا خواننده در تصویر حضور دارد؟
  • سبک ویدیو واقعی، انیمیشنی یا انتزاعی است؟
  • بودجه تولید چند نما چقدر است؟
  • آیا یک ویدیوی کامل می‌خواهید یا کلیپ تبلیغاتی؟

برای یوتیوب معمولاً نسبت تصویر 16:9 و برای ریلز و ویدیوهای کوتاه نسبت 9:16 انتخاب می‌شود.

اگر به هر دو نسخه نیاز دارید، بهتر است هنگام طراحی قاب فضای کافی اطراف سوژه باقی بگذارید تا ویدیو بعداً بدون حذف قسمت مهم تصویر برش داده شود.

مرحله دوم: ساختار آهنگ را استخراج کنید

آهنگ را به بخش‌های کوچک تقسیم کنید:

  • مقدمه یا Intro
  • بند اول
  • ترجیع‌بند
  • بند دوم
  • بریج
  • ترجیع‌بند نهایی
  • پایان یا Outro

برای نمونه، ساختار یک قطعه ۶۰ ثانیه‌ای می‌تواند چنین باشد:

زمانبخش آهنگاتفاق تصویری
۰ تا ۴ ثانیهمقدمهنمای شهر بارانی
۴ تا ۱۶ ثانیهبند اولشخصیت در اتاق
۱۶ تا ۲۸ ثانیهترجیع‌بندحرکت شخصیت در خیابان
۲۸ تا ۴۰ ثانیهبند دومرسیدن به پشت‌بام
۴۰ تا ۵۲ ثانیهاوج نهاییطلوع خورشید
۵۲ تا ۶۰ ثانیهپایاننمای باز شهر

تقسیم آهنگ به بخش‌های زمانی باعث می‌شود برای هر قسمت، نمای مشخصی تولید کنید. این روش بسیار قابل‌کنترل‌تر از درخواست تولید یک ویدیوی کامل با یک پرامپت است.

مرحله سوم: آهنگ را با مدل زبانی تحلیل کنید

متن ترانه، حال‌وهوای موسیقی و اطلاعاتی مانند ژانر و سرعت تقریبی را به یک مدل زبانی بدهید.

نمونه پرامپت:

شما کارگردان موزیک ویدیو هستید.

مشخصات آهنگ:
ژانر: پاپ احساسی
مدت: ۶۰ ثانیه
فضا: شروع غمگین و پایان امیدوارکننده
موضوع ترانه: عبور از یک جدایی و شروع دوباره

برای این آهنگ موارد زیر را آماده کن:
1. ایده اصلی موزیک ویدیو
2. سبک بصری
3. پالت رنگ
4. مشخصات شخصیت اصلی
5. تقسیم‌بندی زمانی نماها
6. شرح هر نما
7. نوع حرکت دوربین
8. پرامپت انگلیسی تولید هر نما

خروجی را به‌صورت جدول ارائه کن.

اگر متن ترانه را ارسال می‌کنید، فقط بخش‌هایی را وارد کنید که اجازه استفاده و پردازش آن‌ها را دارید.

مرحله چهارم: Treatment یا طرح کلی بنویسید

Treatment توضیح کوتاهی از داستان، حس و ظاهر موزیک ویدیو است.

نمونه:

زنی جوان پس از پایان یک رابطه، شبانه در آپارتمان خود نشسته است. با شروع ترجیع‌بند از خانه خارج می‌شود و در خیابان بارانی حرکت می‌کند. رنگ‌های سرد به‌تدریج جای خود را به نور گرم صبح می‌دهند. در پایان، شخصیت روی پشت‌بام طلوع خورشید را تماشا می‌کند.

این متن مرجع تمام تصاویر و کلیپ‌های بعدی خواهد بود.

مرحله پنجم: راهنمای بصری بسازید

راهنمای بصری یا Visual Bible برای ثابت نگه‌داشتن سبک پروژه استفاده می‌شود. این راهنما باید شامل موارد زیر باشد:

  • مشخصات ظاهری شخصیت
  • لباس و رنگ لباس
  • مدل مو
  • سن تقریبی
  • لوکیشن‌های اصلی
  • رنگ غالب
  • نوع نور
  • سبک فیلم‌برداری
  • نوع لنز
  • بافت تصویر
  • نسبت تصویر

نمونه راهنمای شخصیت:

زن ایرانی ۲۸ ساله، موهای مشکی تا روی شانه، پالتوی بلند خاکستری،
شال زرشکی ساده، چهره آرام، آرایش طبیعی، بدون تغییر لباس،
سبک سینمایی واقع‌گرایانه، نور نرم، بافت فیلم 35mm

این مشخصات را بدون تغییر در پرامپت نماهای مختلف تکرار کنید.

ساخت استوری‌بورد و فهرست نماها

استوری‌بورد لازم نیست از ابتدا بسیار دقیق باشد. حتی چند تصویر ثابت برای تعیین ترکیب‌بندی نماها کافی است.

فهرست هر نما بهتر است این اطلاعات را داشته باشد:

  • شماره نما
  • زمان شروع و پایان
  • مدت
  • شخصیت یا سوژه
  • مکان
  • اتفاق
  • اندازه قاب
  • حرکت دوربین
  • نور
  • پرامپت
  • نام فایل خروجی

نمونه Shot List:

نمامدتشرححرکت دوربین
۱۴ ثانیهخیابان خیس در شبحرکت آرام رو به جلو
۲۶ ثانیهشخصیت کنار پنجرهنزدیک‌شدن تدریجی
۳۴ ثانیهکلوزآپ دست روی شیشهدوربین ثابت
۴۵ ثانیهخروج از ساختماندنبال‌کردن از پشت
۵۶ ثانیهدویدن در خیابانحرکت جانبی
۶۵ ثانیهرسیدن به پشت‌بامحرکت رو به بالا

فرمول نوشتن پرامپت ویدیویی

یک پرامپت مناسب تولید ویدیو را می‌توان با این ساختار نوشت:

سوژه + حرکت سوژه + محیط + اندازه قاب + حرکت دوربین +
نورپردازی + سبک بصری + حس صحنه + محدودیت‌های پیوستگی

نمونه فارسی:

زن جوان با پالتوی خاکستری و شال زرشکی در خیابانی بارانی قدم می‌زند،
نمای متوسط، دوربین به‌آرامی از کنار او حرکت می‌کند، نور نئون آبی و قرمز
روی آسفالت خیس منعکس شده، فضای سینمایی احساسی، بافت فیلم 35mm،
حرکت طبیعی، چهره و لباس ثابت، بدون نوشته و لوگو

نمونه انگلیسی:

A young Iranian woman wearing a long gray coat and a simple burgundy scarf
walks through a rainy city street at night, medium shot, slow lateral tracking
camera, blue and red neon reflections on wet asphalt, emotional cinematic mood,
realistic 35mm film texture, natural motion, consistent face and outfit,
no text, no logo

پرامپت انگلیسی الزاماً همیشه نتیجه بهتری ایجاد نمی‌کند، اما در بعضی مدل‌ها کنترل اصطلاحات سینمایی با عبارت‌های انگلیسی ساده‌تر است.

چند پرامپت آماده برای ساخت موزیک ویدیو

اجرای خواننده روی صحنه

خواننده روی صحنه‌ای کوچک در حال اجرای یک قطعه احساسی است،
نور پشت صحنه طلایی و مه ملایم، نمای نزدیک سینمایی،
حرکت آرام دوربین به دور خواننده، تماشاگران محو در پس‌زمینه،
حرکت طبیعی بدن، بدون نوشته و لوگو

موزیک ویدیوی نئونی

شخصیت اصلی در یک شهر آینده‌نگر با تابلوهای نئونی حرکت می‌کند،
خیابان خیس، رنگ‌های آبی و ارغوانی، دوربین دستی کنترل‌شده،
فضای موزیک ویدیوی الکترونیک، کنتراست بالا، حرکت روان

ویدیوی عاشقانه

دو شخصیت در ساحل هنگام غروب قدم می‌زنند، نور گرم و طبیعی،
نمای باز سینمایی، حرکت آهسته دوربین، باد ملایم در لباس‌ها،
فضای شاعرانه و احساسی، رنگ‌های طلایی

ویدیوی رپ شهری

خواننده در پارکینگ بتنی با نورهای خطی سفید اجرا می‌کند،
دوربین با انرژی به سمت سوژه حرکت می‌کند، برش‌پذیر برای تدوین سریع،
استایل خیابانی، کنتراست شدید، نورپردازی دراماتیک

ویژوالایزر انتزاعی

موج‌های نورانی طلایی و بنفش در فضای تاریک با ریتم موسیقی حرکت می‌کنند،
ذرات معلق، حرکت نرم و تکرارشونده، ترکیب‌بندی متقارن،
فضای رویایی، بدون متن و بدون سوژه انسانی

متن به ویدیو بهتر است یا تصویر به ویدیو؟

انتخاب روش به نوع نما بستگی دارد.

متن به ویدیو

این روش برای ایده‌پردازی سریع، نماهای محیطی و صحنه‌هایی مناسب است که حفظ جزئیات ثابت در آن‌ها اهمیت کمتری دارد.

مزایا:

  • شروع سریع
  • نیاز نداشتن به تصویر اولیه
  • مناسب برای آزمایش چند ایده
  • آزادی بیشتر در طراحی صحنه

محدودیت‌ها:

  • احتمال تغییر ظاهر شخصیت
  • کنترل کمتر روی ترکیب‌بندی دقیق
  • دشواری حفظ لباس و چهره در چند نما

تصویر به ویدیو

در این روش ابتدا قاب اصلی ساخته می‌شود و سپس مدل آن را متحرک می‌کند.

مزایا:

  • کنترل بیشتر روی شخصیت
  • ثبات بهتر رنگ و لباس
  • امکان تعیین ترکیب‌بندی قبل از تولید
  • مناسب برای موزیک ویدیوهای داستانی

برای پروژه‌ای که شخصیت ثابتی دارد، معمولاً تصویر به ویدیو انتخاب قابل‌کنترل‌تری است.

برای آشنایی با این فرایند می‌توانید راهنمای تبدیل عکس به ویدیو با هوش مصنوعی را مطالعه کنید.

چگونه ثبات شخصیت را حفظ کنیم؟

یکی از مشکلات رایج موزیک ویدیوهای هوش مصنوعی، تغییر چهره شخصیت در نماهای مختلف است.

برای کاهش این مشکل:

  1. یک تصویر مرجع واضح از شخصیت بسازید.
  2. از همان تصویر یا تصاویر هم‌سبک برای تمام نماها استفاده کنید.
  3. شرح ظاهری شخصیت را ثابت نگه دارید.
  4. لباس را در میانه پروژه تغییر ندهید.
  5. تعداد شخصیت‌های هر نما را محدود کنید.
  6. هر کلیپ را کوتاه تولید کنید.
  7. حرکت دوربین را بیش از حد پیچیده نکنید.
  8. نماهای نزدیک را با دقت بیشتری بررسی کنید.
  9. مدل و تنظیمات را وسط یک سکانس تغییر ندهید.
  10. در صورت پشتیبانی مدل، از تصویر مرجع، Seed یا تنظیمات ثبات کاراکتر استفاده کنید.

بهتر است قبل از تولید ده‌ها کلیپ، سه نمای آزمایشی شامل نمای باز، متوسط و نزدیک بسازید. اگر شخصیت در همین سه نما ثابت نماند، ابتدا تصویر مرجع یا پرامپت را اصلاح کنید.

تدوین موزیک ویدیو روی ضرب موسیقی

کیفیت نماهای تولیدشده مهم است، اما چیزی که آن‌ها را به موزیک ویدیو تبدیل می‌کند تدوین هماهنگ با آهنگ است.

نقاط مناسب برای برش

برش‌ها می‌توانند روی این نقاط قرار گیرند:

  • ضرب اصلی
  • شروع جمله موسیقی
  • تغییر آکورد
  • ورود ساز جدید
  • پایان یک مصرع
  • شروع ترجیع‌بند
  • سکوت کوتاه
  • اوج موسیقی

یک قانون ثابت برای طول نما وجود ندارد، اما می‌توان از این محدوده‌ها به‌عنوان نقطه شروع استفاده کرد:

نوع آهنگطول تقریبی هر نما
آرام و احساسی۴ تا ۸ ثانیه
پاپ با ریتم متوسط۲ تا ۵ ثانیه
رپ یا الکترونیک سریع۰٫۵ تا ۲ ثانیه
ویدیوی انتزاعیمتناسب با عبارت‌های موسیقی

لازم نیست روی تمام ضرب‌ها برش بزنید. تکرار بیش از حد برش می‌تواند ویدیو را خسته‌کننده کند.

تشخیص ضرب آهنگ با پایتون و librosa

کتابخانه متن‌باز librosa برای تحلیل صوت و موسیقی در پایتون استفاده می‌شود. با آن می‌توان سرعت تقریبی و زمان ضرب‌ها را استخراج کرد.

ابتدا کتابخانه را نصب کنید:

pip install librosa

سپس فایل موسیقی را تحلیل کنید:

import librosa

audio, sample_rate = librosa.load("song.mp3", sr=None)

tempo, beat_frames = librosa.beat.beat_track(
    y=audio,
    sr=sample_rate,
)

beat_times = librosa.frames_to_time(
    beat_frames,
    sr=sample_rate,
)

tempo_value = float(tempo[0] if hasattr(tempo, "__len__") else tempo)

print(f"Estimated tempo: {tempo_value:.2f} BPM")
print("First beat times:")

for beat_time in beat_times[:20]:
    print(f"{beat_time:.3f}")

این خروجی می‌تواند برای پیشنهاد نقاط برش استفاده شود. تشخیص خودکار همیشه با ساختار هنری آهنگ یکسان نیست؛ بنابراین نقاط مهم را با گوش‌دادن به آهنگ نیز بررسی کنید.

مثال عملی: ساخت موزیک ویدیوی ۶۰ ثانیه‌ای

فرض کنیم می‌خواهیم برای یک آهنگ پاپ فارسی با موضوع «شروع دوباره» ویدیویی ۶۰ ثانیه‌ای بسازیم.

مفهوم اصلی

شخصیت اصلی شب را در یک اتاق تاریک آغاز می‌کند، از خانه بیرون می‌رود و هم‌زمان با اوج آهنگ به پشت‌بامی روشن می‌رسد. تغییر رنگ از آبی سرد به طلایی، تغییر وضعیت عاطفی او را نمایش می‌دهد.

سکانس اول؛ مقدمه

نمای باز از شهر در شب بارانی، پنجره‌های روشن، خیابان خلوت،
حرکت بسیار آرام دوربین رو به جلو، رنگ‌های آبی سرد،
فضای سینمایی واقع‌گرایانه، 35mm film look

سکانس دوم؛ بند اول

زن جوان با پالتوی خاکستری کنار پنجره ایستاده است،
شال زرشکی، نور آبی خیابان روی صورت او، نمای متوسط،
دوربین به‌آرامی نزدیک می‌شود، حس تنهایی و سکوت

سکانس سوم؛ شروع ترجیع‌بند

همان زن از ساختمان خارج می‌شود و در خیابان بارانی قدم می‌زند،
دوربین از پشت او را دنبال می‌کند، بازتاب نورهای شهر روی زمین،
حرکت طبیعی، فضای احساسی و امیدوارکننده

سکانس چهارم؛ اوج موسیقی

زن روی پشت‌بام به سمت نور طلوع حرکت می‌کند،
باد ملایم در پالتو و شال، نمای باز، دوربین با حرکت نرم بالا می‌رود،
نور طلایی جای رنگ آبی را می‌گیرد، حس رهایی و شروع دوباره

سکانس پنجم؛ پایان

نمای نزدیک از چهره آرام شخصیت در نور صبح،
لبخند بسیار ملایم، پس‌زمینه محو شهر، دوربین ثابت،
نور طبیعی طلایی، پایان سینمایی

بهتر است از هر نما حداقل دو یا سه نسخه بسازید و فقط بهترین خروجی را وارد تدوین کنید.

ساخت خودکار Shot List با API درواره

یکی از کاربردهای عملی API درواره، تبدیل مشخصات آهنگ به یک Shot List ساختاریافته است. سپس می‌توان پرامپت هر نما را برای مدل تصویری یا ویدیویی ارسال کرد.

API درواره با ساختار OpenAI سازگار است و آدرس پایه آن به‌صورت زیر تنظیم می‌شود:

https://api.darvareh.ir/v1

ابتدا کتابخانه‌های لازم را نصب کنید:

pip install openai pydantic

متغیرهای محیطی را تنظیم کنید:

export DARVAREH_API_KEY="YOUR_API_KEY"
export DARVAREH_MODEL="YOUR_MODEL_ID"

کد پایتون:

import os
from typing import List

from openai import OpenAI
from pydantic import BaseModel, Field


client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)

MODEL_ID = os.environ["DARVAREH_MODEL"]


class Shot(BaseModel):
    number: int
    start_seconds: float
    end_seconds: float
    section: str
    description_fa: str
    prompt_en: str
    camera: str
    transition: str


class MusicVideoPlan(BaseModel):
    title: str
    concept: str
    visual_style: str
    color_palette: List[str]
    character_reference: str
    shots: List[Shot] = Field(min_length=1)


def create_music_video_plan(
    lyrics: str,
    duration_seconds: int,
    genre: str,
    mood: str,
) -> MusicVideoPlan:
    prompt = f"""
برای یک موزیک ویدیوی هوش مصنوعی برنامه تولید بساز.

مشخصات:
- مدت آهنگ: {duration_seconds} ثانیه
- ژانر: {genre}
- حال‌وهوا: {mood}
- متن یا خلاصه ترانه:
{lyrics}

قواعد:
- کل بازه زمانی از صفر تا {duration_seconds} پوشش داده شود.
- بین زمان نماها فاصله یا هم‌پوشانی وجود نداشته باشد.
- ظاهر شخصیت در تمام نماها ثابت باشد.
- هر نمای تولیدی ترجیحاً بین ۳ تا ۶ ثانیه باشد.
- prompt_en برای تولید ویدیو به زبان انگلیسی نوشته شود.
- هیچ نوشته‌ای داخل تصاویر تولیدی درخواست نشود.
- خروجی فقط JSON معتبر باشد.

ساختار JSON:
{{
  "title": "عنوان پیشنهادی",
  "concept": "خلاصه داستان",
  "visual_style": "سبک بصری",
  "color_palette": ["color 1", "color 2"],
  "character_reference": "مشخصات ثابت شخصیت",
  "shots": [
    {{
      "number": 1,
      "start_seconds": 0,
      "end_seconds": 4,
      "section": "intro",
      "description_fa": "شرح فارسی نما",
      "prompt_en": "English video generation prompt",
      "camera": "camera movement",
      "transition": "cut"
    }}
  ]
}}
"""

    response = client.chat.completions.create(
        model=MODEL_ID,
        temperature=0.4,
        messages=[
            {
                "role": "system",
                "content": (
                    "شما کارگردان و طراح استوری‌بورد موزیک ویدیو هستید. "
                    "پاسخ را فقط به‌صورت JSON معتبر تولید می‌کنید."
                ),
            },
            {
                "role": "user",
                "content": prompt,
            },
        ],
    )

    content = response.choices[0].message.content

    if not content:
        raise ValueError("مدل هیچ محتوایی برنگرداند.")

    return MusicVideoPlan.model_validate_json(content)


plan = create_music_video_plan(
    lyrics=(
        "شخصیت پس از یک دوره سخت، گذشته را رها می‌کند "
        "و با امید به سمت یک شروع تازه می‌رود."
    ),
    duration_seconds=60,
    genre="Persian emotional pop",
    mood="melancholic at first, hopeful at the end",
)

print(plan.model_dump_json(indent=2))

در این نمونه، مدل زبانی نقش کارگردان و طراح استوری‌بورد را دارد. خروجی JSON را می‌توان در پنل تولید ویدیو نمایش داد یا به مرحله بعدی خط تولید فرستاد.

شناسه مدل را بهتر است از تنظیمات برنامه یا متغیر محیطی دریافت کنید تا بتوانید بدون تغییر کد، مدل دیگری را آزمایش کنید.

اتصال مدل ویدیویی به سامانه

ساخت ویدیو معمولاً یک عملیات فوری نیست. معماری مناسب باید فرایند تولید را به‌صورت Job مدیریت کند:

  1. کاربر آهنگ و توضیحات را ارسال می‌کند.
  2. سرور درخواست را اعتبارسنجی می‌کند.
  3. مدل زبانی Shot List را می‌سازد.
  4. کاربر یا مدیر پروژه نماها را تأیید می‌کند.
  5. هر نمای تأییدشده برای مدل ویدیویی ارسال می‌شود.
  6. شناسه Job در پایگاه داده ذخیره می‌شود.
  7. وضعیت تولید در بازه‌های زمانی مشخص بررسی می‌شود.
  8. فایل‌های آماده در فضای ذخیره‌سازی قرار می‌گیرند.
  9. کلیپ‌ها با موسیقی ترکیب می‌شوند.
  10. لینک خروجی نهایی به کاربر نمایش داده می‌شود.

مدل‌هایی مانند Seedance، Kling یا سایر مدل‌های ویدیویی ممکن است ساختار درخواست، محدودیت مدت و روش پیگیری متفاوتی داشته باشند. بنابراین نام endpoint، شناسه مدل و پارامترهای تولید را باید از مستندات فعلی API درواره دریافت کنید.

اگر قصد دارید این قابلیت را در سایت خود ارائه کنید، کلید API را هرگز داخل کد مرورگر، React، Flutter یا اپلیکیشن موبایل قرار ندهید. درخواست باید ابتدا به سرور برنامه شما ارسال شود و سرور با API ارتباط برقرار کند.

تدوین خودکار کلیپ‌ها با FFmpeg

پس از تولید نماها، می‌توان آن‌ها را با FFmpeg به یک ویدیو تبدیل کرد.

ابتدا فایل clips.txt را بسازید:

file 'shot-01.mp4'
file 'shot-02.mp4'
file 'shot-03.mp4'
file 'shot-04.mp4'
file 'shot-05.mp4'

سپس کلیپ‌ها را به هم متصل کنید:

ffmpeg \
  -f concat \
  -safe 0 \
  -i clips.txt \
  -i song.mp3 \
  -map 0:v:0 \
  -map 1:a:0 \
  -c:v libx264 \
  -c:a aac \
  -pix_fmt yuv420p \
  -shortest \
  music-video.mp4

اگر کلیپ‌ها ابعاد، نرخ فریم یا کدک یکسان نداشته باشند، ابتدا باید استانداردسازی شوند:

ffmpeg \
  -i shot-original.mp4 \
  -vf "scale=1920:1080:force_original_aspect_ratio=increase,crop=1920:1080,fps=24" \
  -c:v libx264 \
  -pix_fmt yuv420p \
  -an \
  shot-normalized.mp4

براساس مستندات FFmpeg، این ابزار می‌تواند ورودی‌های صوتی و تصویری را انتخاب، تبدیل، فیلتر و در خروجی جدید ترکیب کند. مستندات FFmpeg

ساخت زیرنویس و نمایش متن ترانه

برای نمایش متن ترانه سه روش وجود دارد:

زیرنویس ساده

متن در پایین تصویر نمایش داده می‌شود. این روش خوانا و مناسب یوتیوب است.

نمایش کلمه‌به‌کلمه

کلمات هم‌زمان با اجرا ظاهر می‌شوند. این سبک برای ریلز و ویدیوهای کوتاه جذاب است، اما زمان‌بندی بیشتری می‌خواهد.

تایپوگرافی متحرک

متن بخشی از طراحی موزیک ویدیو می‌شود. این روش برای لیریک ویدیو مناسب است.

بهتر است متن فارسی را در برنامه تدوین اضافه کنید، نه در پرامپت تولید ویدیو. این کار کنترل بیشتری بر فونت، نیم‌فاصله، جهت نوشتار و املای کلمات ایجاد می‌کند.

برای اطلاعات بیشتر می‌توانید راهنمای ساخت زیرنویس فارسی با هوش مصنوعی را مطالعه کنید.

ساخت سایت تولید موزیک ویدیو با هوش مصنوعی

اگر قصد دارید سرویسی بسازید که کاربران در آن آهنگ خود را آپلود کنند و موزیک ویدیو تحویل بگیرند، جریان کار می‌تواند شامل این مراحل باشد:

  • ساخت حساب کاربری
  • آپلود فایل آهنگ
  • انتخاب نوع موزیک ویدیو
  • انتخاب نسبت تصویر
  • واردکردن متن یا مفهوم ترانه
  • انتخاب سبک بصری
  • تولید خودکار سناریو
  • نمایش استوری‌بورد اولیه
  • تأیید یا ویرایش نماها
  • انتخاب مدل ویدیویی
  • تولید نماها
  • تدوین خودکار
  • نمایش پیش‌نمایش
  • دریافت نسخه نهایی

بهتر است پیش از شروع تولید پرهزینه، یک پیش‌نمایش کم‌هزینه شامل Shot List و تصاویر ثابت به کاربر نشان داده شود.

اطلاعاتی که باید از کاربر دریافت شود

{
  "project_name": "شروع دوباره",
  "duration_seconds": 60,
  "aspect_ratio": "9:16",
  "video_type": "narrative",
  "visual_style": "cinematic realistic",
  "mood": "sad to hopeful",
  "has_main_character": true,
  "lyrics": "متن یا خلاصه ترانه",
  "output_quality": "1080p"
}

وضعیت‌های پیشنهادی پروژه

draft
planning
waiting_for_approval
generating
editing
completed
failed

ثبت این وضعیت‌ها باعث می‌شود کاربر بتواند پیشرفت پروژه را مشاهده کند و درخواست‌های طولانی در مرورگر باز نمانند.

چگونه هزینه تولید موزیک ویدیو را کاهش دهیم؟

ابتدا استوری‌بورد بسازید

تولید تصویر ثابت معمولاً برای بررسی ایده سریع‌تر از تولید چندین کلیپ کامل است. ابتدا قاب‌ها را تأیید و سپس آن‌ها را متحرک کنید.

نماها را کوتاه نگه دارید

کلیپ کوتاه‌تر معمولاً کنترل‌پذیرتر است. در مرحله تدوین می‌توان چند کلیپ کوتاه را با هم ترکیب کرد.

پیش‌نمایش کم‌هزینه تولید کنید

ابتدا خروجی را با کیفیت یا تعداد نسخه محدود بررسی کنید. تولید نهایی و افزایش کیفیت را فقط برای نماهای پذیرفته‌شده انجام دهید.

تمام آهنگ را یک‌باره تولید نکنید

تقسیم پروژه به نماهای مستقل باعث می‌شود فقط قسمت‌های ضعیف دوباره تولید شوند.

مدل را متناسب با نما انتخاب کنید

لازم نیست تمام نماها با گران‌ترین مدل تولید شوند. ممکن است یک مدل اقتصادی برای نماهای محیطی مناسب باشد و مدل قوی‌تر فقط برای کلوزآپ شخصیت استفاده شود.

هزینه را به تفکیک پروژه ثبت کنید

در یک سرویس تجاری باید موارد زیر ذخیره شوند:

  • تعداد نماهای درخواست‌شده
  • تعداد تلاش‌های ناموفق
  • مدل استفاده‌شده
  • هزینه هر نما
  • هزینه کل پروژه
  • زمان تولید
  • تعداد بازتولیدها

برای محاسبه بهتر هزینه می‌توانید مقاله محاسبه هزینه API هوش مصنوعی را مطالعه کنید.

اشتباهات رایج در ساخت موزیک ویدیو با هوش مصنوعی

تولید کل موزیک ویدیو با یک پرامپت

یک پرامپت طولانی معمولاً کنترل کافی روی داستان، تدوین و ثبات شخصیت ایجاد نمی‌کند. پروژه را به نماهای کوتاه تقسیم کنید.

نداشتن راهنمای بصری

اگر رنگ، لباس، شخصیت و سبک دوربین تعریف نشده باشند، هر کلیپ ممکن است متعلق به فیلم متفاوتی به نظر برسد.

تغییر مدل در میانه سکانس

مدل‌های مختلف سبک حرکت و تصویر متفاوتی دارند. بهتر است نماهای یک سکانس مرتبط با مدل و تنظیمات مشابه تولید شوند.

استفاده بیش از حد از حرکت دوربین

درخواست هم‌زمان چرخش دوربین، زوم، حرکت سریع شخصیت و تغییر محیط احتمال خطا را افزایش می‌دهد. برای هر نما یک حرکت اصلی انتخاب کنید.

قرار دادن متن فارسی داخل ویدیوی تولیدی

برای جلوگیری از نوشته‌های نادرست، متن ترانه، نام خواننده و لوگو را در مرحله تدوین اضافه کنید.

نادیده‌گرفتن ریتم آهنگ

چند کلیپ زیبا که ارتباطی با ساختار موسیقی ندارند، الزاماً موزیک ویدیوی خوبی نمی‌سازند. محل برش و تغییر صحنه را براساس آهنگ تعیین کنید.

تولید نهایی قبل از آزمایش

ابتدا چند ثانیه آزمایشی تولید کنید. پس از تأیید سبک، سراغ تمام نماها بروید.

چک‌لیست نهایی انتشار موزیک ویدیو

پیش از انتشار این موارد را بررسی کنید:

  • صدا و تصویر از ابتدا تا انتها هماهنگ هستند.
  • هیچ فریم خراب یا تغییر ناگهانی چهره وجود ندارد.
  • نوشته‌های فارسی درست نمایش داده می‌شوند.
  • حجم صدا در تمام ویدیو مناسب است.
  • شروع ویدیو در چند ثانیه اول جذاب است.
  • نسبت تصویر با پلتفرم انتشار هماهنگ است.
  • لوگو و عنوان در ناحیه امن قرار گرفته‌اند.
  • نسخه نهایی روی موبایل نیز بررسی شده است.
  • مجوز استفاده از آهنگ، تصویر و سایر دارایی‌ها مشخص است.
  • فایل اصلی با کیفیت مناسب نگهداری شده است.

پرسش‌های متداول

بهترین هوش مصنوعی برای ساخت موزیک ویدیو چیست؟

یک مدل واحد برای تمام پروژه‌ها بهترین نیست. انتخاب مدل به سبک ویدیو، نیاز به ثبات شخصیت، نوع حرکت، مدت نما، سرعت تولید و بودجه بستگی دارد. بهتر است چند مدل را با یک تصویر و پرامپت یکسان آزمایش کنید.

آیا می‌توان یک آهنگ کامل را به موزیک ویدیو تبدیل کرد؟

بله، اما بهتر است آهنگ به بخش‌های کوچک تقسیم شود. برای هر بخش چند نما تولید کنید و سپس آن‌ها را در برنامه تدوین روی موسیقی قرار دهید.

چگونه چهره خواننده را ثابت نگه داریم؟

از تصویر مرجع ثابت، توضیح ظاهری یکسان، لباس ثابت و روش تصویر به ویدیو استفاده کنید. تولید نماهای کوتاه نیز احتمال تغییر چهره را کاهش می‌دهد.

آیا هوش مصنوعی می‌تواند ویدیو را دقیقاً با ضرب آهنگ هماهنگ کند؟

بعضی ابزارها قابلیت‌های خودکار برای هماهنگی با موسیقی دارند، اما برای نتیجه دقیق‌تر بهتر است زمان ضرب‌ها استخراج و تدوین نهایی در یک نرم‌افزار تدوین انجام شود.

آیا امکان ساخت موزیک ویدیو فارسی وجود دارد؟

بله. متن و مفهوم آهنگ فارسی را می‌توان با مدل زبانی تحلیل کرد و برای آن سناریو، Shot List و پرامپت تولید کرد. نوشته‌های فارسی بهتر است در مرحله تدوین به تصویر اضافه شوند.

آیا می‌توان سایت ساخت موزیک ویدیو راه‌اندازی کرد؟

بله. می‌توان یک رابط کاربری برای دریافت آهنگ و تنظیمات ساخت، سپس فرایند تحلیل، تولید نما و تدوین را در سرور اجرا کرد. API درواره می‌تواند لایه دسترسی برنامه به مدل‌های هوش مصنوعی باشد.

آیا API درواره با OpenAI SDK قابل استفاده است؟

API درواره با ساختار OpenAI سازگار است. در کاربردهای متنی معمولاً می‌توانید با تنظیم base_url، کلید API و شناسه مدل از کتابخانه OpenAI استفاده کنید. برای مدل‌های تصویری و ویدیویی باید ساختار درخواست همان مدل را در مستندات فعلی بررسی کنید.

ساخت یک موزیک ویدیو چقدر زمان می‌برد؟

زمان تولید به مدت آهنگ، تعداد نماها، مدل انتخاب‌شده، تعداد بازتولیدها و میزان تدوین بستگی دارد. ساخت یک پیش‌نمایش ۳۰ تا ۶۰ ثانیه‌ای معمولاً نقطه شروع مناسبی برای ارزیابی ایده است.

جمع‌بندی

ساخت موزیک ویدیو با هوش مصنوعی یک فرایند چندمرحله‌ای است. برای رسیدن به نتیجه حرفه‌ای باید آهنگ را تحلیل، ایده بصری را تعریف، استوری‌بورد را آماده و نماها را به‌صورت جداگانه تولید کنید.

مسیر پیشنهادی چنین است:

  1. هدف و قالب خروجی را مشخص کنید.
  2. آهنگ را به بخش‌های زمانی تقسیم کنید.
  3. مفهوم و سناریوی بصری بسازید.
  4. ظاهر شخصیت و سبک پروژه را ثابت کنید.
  5. برای هر بخش Shot List بنویسید.
  6. قاب‌های مرجع را تولید کنید.
  7. نماهای کوتاه را با مدل ویدیویی بسازید.
  8. کلیپ‌ها را روی ضرب موسیقی تدوین کنید.
  9. متن ترانه و نوشته‌ها را در تدوین اضافه کنید.
  10. فقط نماهای نهایی را با کیفیت بالا خروجی بگیرید.

اگر می‌خواهید تولید موزیک ویدیو را به وب‌سایت، اپلیکیشن یا ابزار داخلی خود اضافه کنید، می‌توانید برای تحلیل آهنگ، ساخت سناریو، تولید Shot List و اتصال به مدل‌های هوش مصنوعی از API درواره استفاده کنید.

برای مشاهده مدل‌ها، ساخت کلید API و بررسی ساختار درخواست‌ها به مستندات API درواره مراجعه کنید.

مقالات مرتبط

منابع

این مقاله صرفاً با هدف آموزش و اطلاع‌رسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویس‌ها و صفحه سلب مسئولیت را مطالعه کنید.

Read more

تبدیل عکس سیاه‌وسفید قدیمی به عکس رنگی با هوش مصنوعی

رنگی کردن عکس سیاه‌وسفید با هوش مصنوعی؛ آموزش کامل و رایگان

در این راهنمای جامع یاد می‌گیرید چگونه عکس‌های سیاه‌وسفید قدیمی را با هوش مصنوعی به تصاویر رنگی طبیعی تبدیل کنید؛ از آماده‌سازی و ترمیم اولیه عکس تا انتخاب ابزار، نوشتن پرامپت، اصلاح رنگ پوست و اجرای خودکار با API درواره.

آموزش پرامپت ساخت عکس با هوش مصنوعی همراه با نمونه‌های آماده

پرامپت ساخت عکس با هوش مصنوعی؛ آموزش کامل و ۵۰ پرامپت آماده

چگونه برای ساخت عکس با هوش مصنوعی پرامپت حرفه‌ای بنویسیم؟ در این راهنما فرمول پرامپت‌نویسی تصویر، تنظیم نور، سبک، زاویه دوربین و ترکیب‌بندی را همراه با ۵۰ پرامپت آماده برای عکس پرتره، محصول، معماری، غذا، تبلیغات و شبکه‌های اجتماعی یاد می‌گیرید.

FLUX AI چیست؟ معرفی FLUX 3 و آموزش ساخت تصویر با API درواره

FLUX AI چیست؟ معرفی FLUX 3 و آموزش ساخت تصویر با API درواره

FLUX خانواده‌ای از مدل‌های مولد تصویر و ویدئو متعلق به Black Forest Labs است که برای تولید تصاویر واقع‌گرایانه، طراحی تبلیغاتی، ویرایش عکس، نمایش دقیق متن و استفاده از تصاویر مرجع کاربرد دارد. در این راهنما با FLUX 3، مدل‌های FLUX.2 و روش ساخت سرویس تولید تصویر با API درواره آشنا می‌شوید.

آموزش نصب OpenHands و اتصال ایجنت برنامه‌نویسی هوش مصنوعی به API درواره

OpenHands چیست؟ آموزش نصب ایجنت برنامه‌نویسی و اتصال به API درواره

OpenHands یک ایجنت برنامه‌نویسی متن‌باز است که می‌تواند مخزن کد را بررسی کند، فایل‌ها را تغییر دهد، فرمان‌های ترمینال را اجرا کند و برای توسعه قابلیت، رفع خطا و نوشتن تست به کار رود. در این آموزش، OpenHands و Agent Canvas را نصب و به مدل‌های هوش مصنوعی از طریق API درواره متصل می‌کنیم.