ساخت موزیک ویدیو با هوش مصنوعی؛ آموزش کامل از آهنگ تا کلیپ
در این راهنمای جامع یاد میگیرید چگونه با هوش مصنوعی یک موزیک ویدیو حرفهای بسازید؛ از تحلیل آهنگ، انتخاب ایده و نوشتن سناریو تا ساخت استوریبورد، تولید نماهای هماهنگ، تدوین روی ضرب موسیقی و خودکارسازی مراحل با API درواره. عنوان متا: ساخت موزیک ویدیو با هوش مصنوعی؛ آموزش کامل و عملی
ساخت موزیک ویدیو زمانی به فیلمبرداری، بازیگر، دوربین حرفهای، لوکیشن، نورپردازی و یک تیم تدوین نیاز داشت. ابزارهای هوش مصنوعی این فرایند را تغییر دادهاند و اکنون میتوان بخش بزرگی از تولید یک موزیک ویدیو را با کمک مدلهای تولید متن، تصویر و ویدیو انجام داد.
با این حال، ساخت موزیک ویدیو با هوش مصنوعی فقط به نوشتن یک پرامپت و دریافت یک کلیپ محدود نمیشود. نتیجه حرفهای زمانی به دست میآید که آهنگ تحلیل شود، برای آن یک مفهوم بصری ساخته شود، نماها از قبل برنامهریزی شوند و تدوین براساس ریتم موسیقی انجام گیرد.
در این مقاله، فرایند کامل ساخت موزیک ویدیو با هوش مصنوعی را بررسی میکنیم و در پایان نشان میدهیم چگونه میتوان این فرایند را با API درواره داخل یک وبسایت، اپلیکیشن یا سامانه تولید محتوا پیادهسازی کرد.
آیا میتوان با هوش مصنوعی موزیک ویدیو ساخت؟
بله. مدلهای هوش مصنوعی میتوانند در مراحل مختلف تولید موزیک ویدیو استفاده شوند:
- تحلیل متن و مفهوم آهنگ
- پیشنهاد ایده و سبک بصری
- نوشتن سناریو
- ساخت استوریبورد
- تولید تصویر مرجع شخصیتها
- تبدیل متن به ویدیو
- تبدیل تصویر به ویدیو
- ساخت ویدیوی هماهنگ با سبک آهنگ
- تولید زیرنویس و متن ترانه
- طراحی کاور و تصویر بندانگشتی
- برنامهریزی تدوین
- تولید نسخه افقی و عمودی
هوش مصنوعی الزاماً جای تدوینگر یا کارگردان را نمیگیرد. نقش اصلی آن کاهش زمان تولید، آزمایش سریع ایدهها و ساخت نماهایی است که اجرای آنها با روش سنتی دشوار یا پرهزینه است.
انواع موزیک ویدیویی که میتوان با هوش مصنوعی ساخت
پیش از انتخاب ابزار باید نوع موزیک ویدیو مشخص شود.
موزیک ویدیوی داستانی
در این روش، آهنگ با یک داستان تصویری همراه میشود. شخصیت، اتفاق و مسیر روایی وجود دارد و هر بخش آهنگ بخشی از داستان را پیش میبرد.
برای حفظ ظاهر ثابت شخصیتها بهتر است ابتدا تصاویر مرجع ساخته شوند و سپس با روش تصویر به ویدیو متحرک شوند.
موزیک ویدیوی اجرایی
خواننده، نوازنده یا یک شخصیت مجازی در حال اجرا نمایش داده میشود. هماهنگکردن دقیق حرکت لب با صدای خواننده ممکن است به ابزار تخصصی Lip Sync نیاز داشته باشد.
لیریک ویدیو
در لیریک ویدیو، متن ترانه عنصر اصلی تصویر است. پسزمینه میتواند ثابت، متحرک، انتزاعی یا داستانی باشد.
از آنجا که مدلهای تولید تصویر و ویدیو ممکن است متن فارسی را اشتباه نمایش دهند، بهتر است نوشتههای فارسی در مرحله تدوین اضافه شوند.
موزیک ویژوالایزر
ویژوالایزر موسیقی معمولاً شامل اشکال انتزاعی، نور، ذرات، موج صوتی یا حرکتهای تکرارشونده است. این روش برای آهنگهای الکترونیک، بیکلام و نسخههای منتشرشده در یوتیوب مناسب است.
موزیک ویدیوی کوتاه برای اینستاگرام
در این روش، فقط جذابترین قسمت آهنگ به یک ویدیوی ۱۵ تا ۶۰ ثانیهای تبدیل میشود. خروجی معمولاً عمودی است و برای ریلز، استوری و ویدیوهای کوتاه استفاده میشود.
موزیک ویدیوی انیمیشنی
تمام شخصیتها و محیطها بهصورت کارتونی، سهبعدی، نقاشی، کمیک یا استاپموشن طراحی میشوند. این روش وابستگی کمتری به واقعگرایی چهره دارد و معمولاً کنترل سبک بصری در آن سادهتر است.
ابزارهای موردنیاز برای ساخت موزیک ویدیو با هوش مصنوعی
هر بخش پروژه را میتوان با ابزار متفاوتی انجام داد.
| مرحله | ابزارهای پیشنهادی | کاربرد |
|---|---|---|
| تحلیل آهنگ و ایدهپردازی | مدلهای زبانی، ChatGPT، Claude، Gemini | تحلیل مفهوم، ساخت سناریو و Shot List |
| ساخت تصویر مرجع | FLUX، Midjourney، مدلهای Gemini Image و GPT Image | طراحی شخصیت، لباس، لوکیشن و قاب اولیه |
| تولید ویدیو | Seedance، Kling، Runway، Google Veo و مدلهای مشابه | تبدیل متن یا تصویر به کلیپ |
| تحلیل صوت | Audacity، librosa | بررسی ریتم، ضرب و ساختار آهنگ |
| تدوین | DaVinci Resolve، CapCut، Premiere Pro | هماهنگکردن تصویر با موسیقی |
| پردازش خودکار | FFmpeg | اتصال کلیپها، تغییر اندازه و افزودن صدا |
| زیرنویس | مدلهای تبدیل گفتار به متن و ابزارهای SRT | استخراج یا زمانبندی متن ترانه |
| اتصال به اپلیکیشن | API درواره | دسترسی برنامهنویسی به مدلهای هوش مصنوعی |
DaVinci Resolve مجموعهای یکپارچه برای تدوین، اصلاح رنگ، جلوههای بصری و پردازش صدا ارائه میکند. FFmpeg نیز یک ابزار متنباز برای تبدیل، فیلتر و ترکیب فایلهای صوتی و تصویری است. DaVinci Resolve، FFmpeg
مراحل ساخت موزیک ویدیو با هوش مصنوعی
مرحله اول: خروجی نهایی را مشخص کنید
قبل از تولید اولین تصویر، درباره این موارد تصمیم بگیرید:
- مدت موزیک ویدیو چقدر است؟
- خروجی افقی، عمودی یا مربعی است؟
- ویدیو برای یوتیوب ساخته میشود یا اینستاگرام؟
- آیا خواننده در تصویر حضور دارد؟
- سبک ویدیو واقعی، انیمیشنی یا انتزاعی است؟
- بودجه تولید چند نما چقدر است؟
- آیا یک ویدیوی کامل میخواهید یا کلیپ تبلیغاتی؟
برای یوتیوب معمولاً نسبت تصویر 16:9 و برای ریلز و ویدیوهای کوتاه نسبت 9:16 انتخاب میشود.
اگر به هر دو نسخه نیاز دارید، بهتر است هنگام طراحی قاب فضای کافی اطراف سوژه باقی بگذارید تا ویدیو بعداً بدون حذف قسمت مهم تصویر برش داده شود.
مرحله دوم: ساختار آهنگ را استخراج کنید
آهنگ را به بخشهای کوچک تقسیم کنید:
- مقدمه یا Intro
- بند اول
- ترجیعبند
- بند دوم
- بریج
- ترجیعبند نهایی
- پایان یا Outro
برای نمونه، ساختار یک قطعه ۶۰ ثانیهای میتواند چنین باشد:
| زمان | بخش آهنگ | اتفاق تصویری |
|---|---|---|
| ۰ تا ۴ ثانیه | مقدمه | نمای شهر بارانی |
| ۴ تا ۱۶ ثانیه | بند اول | شخصیت در اتاق |
| ۱۶ تا ۲۸ ثانیه | ترجیعبند | حرکت شخصیت در خیابان |
| ۲۸ تا ۴۰ ثانیه | بند دوم | رسیدن به پشتبام |
| ۴۰ تا ۵۲ ثانیه | اوج نهایی | طلوع خورشید |
| ۵۲ تا ۶۰ ثانیه | پایان | نمای باز شهر |
تقسیم آهنگ به بخشهای زمانی باعث میشود برای هر قسمت، نمای مشخصی تولید کنید. این روش بسیار قابلکنترلتر از درخواست تولید یک ویدیوی کامل با یک پرامپت است.
مرحله سوم: آهنگ را با مدل زبانی تحلیل کنید
متن ترانه، حالوهوای موسیقی و اطلاعاتی مانند ژانر و سرعت تقریبی را به یک مدل زبانی بدهید.
نمونه پرامپت:
شما کارگردان موزیک ویدیو هستید.
مشخصات آهنگ:
ژانر: پاپ احساسی
مدت: ۶۰ ثانیه
فضا: شروع غمگین و پایان امیدوارکننده
موضوع ترانه: عبور از یک جدایی و شروع دوباره
برای این آهنگ موارد زیر را آماده کن:
1. ایده اصلی موزیک ویدیو
2. سبک بصری
3. پالت رنگ
4. مشخصات شخصیت اصلی
5. تقسیمبندی زمانی نماها
6. شرح هر نما
7. نوع حرکت دوربین
8. پرامپت انگلیسی تولید هر نما
خروجی را بهصورت جدول ارائه کن.
اگر متن ترانه را ارسال میکنید، فقط بخشهایی را وارد کنید که اجازه استفاده و پردازش آنها را دارید.
مرحله چهارم: Treatment یا طرح کلی بنویسید
Treatment توضیح کوتاهی از داستان، حس و ظاهر موزیک ویدیو است.
نمونه:
زنی جوان پس از پایان یک رابطه، شبانه در آپارتمان خود نشسته است. با شروع ترجیعبند از خانه خارج میشود و در خیابان بارانی حرکت میکند. رنگهای سرد بهتدریج جای خود را به نور گرم صبح میدهند. در پایان، شخصیت روی پشتبام طلوع خورشید را تماشا میکند.
این متن مرجع تمام تصاویر و کلیپهای بعدی خواهد بود.
مرحله پنجم: راهنمای بصری بسازید
راهنمای بصری یا Visual Bible برای ثابت نگهداشتن سبک پروژه استفاده میشود. این راهنما باید شامل موارد زیر باشد:
- مشخصات ظاهری شخصیت
- لباس و رنگ لباس
- مدل مو
- سن تقریبی
- لوکیشنهای اصلی
- رنگ غالب
- نوع نور
- سبک فیلمبرداری
- نوع لنز
- بافت تصویر
- نسبت تصویر
نمونه راهنمای شخصیت:
زن ایرانی ۲۸ ساله، موهای مشکی تا روی شانه، پالتوی بلند خاکستری،
شال زرشکی ساده، چهره آرام، آرایش طبیعی، بدون تغییر لباس،
سبک سینمایی واقعگرایانه، نور نرم، بافت فیلم 35mm
این مشخصات را بدون تغییر در پرامپت نماهای مختلف تکرار کنید.
ساخت استوریبورد و فهرست نماها
استوریبورد لازم نیست از ابتدا بسیار دقیق باشد. حتی چند تصویر ثابت برای تعیین ترکیببندی نماها کافی است.
فهرست هر نما بهتر است این اطلاعات را داشته باشد:
- شماره نما
- زمان شروع و پایان
- مدت
- شخصیت یا سوژه
- مکان
- اتفاق
- اندازه قاب
- حرکت دوربین
- نور
- پرامپت
- نام فایل خروجی
نمونه Shot List:
| نما | مدت | شرح | حرکت دوربین |
|---|---|---|---|
| ۱ | ۴ ثانیه | خیابان خیس در شب | حرکت آرام رو به جلو |
| ۲ | ۶ ثانیه | شخصیت کنار پنجره | نزدیکشدن تدریجی |
| ۳ | ۴ ثانیه | کلوزآپ دست روی شیشه | دوربین ثابت |
| ۴ | ۵ ثانیه | خروج از ساختمان | دنبالکردن از پشت |
| ۵ | ۶ ثانیه | دویدن در خیابان | حرکت جانبی |
| ۶ | ۵ ثانیه | رسیدن به پشتبام | حرکت رو به بالا |
فرمول نوشتن پرامپت ویدیویی
یک پرامپت مناسب تولید ویدیو را میتوان با این ساختار نوشت:
سوژه + حرکت سوژه + محیط + اندازه قاب + حرکت دوربین +
نورپردازی + سبک بصری + حس صحنه + محدودیتهای پیوستگی
نمونه فارسی:
زن جوان با پالتوی خاکستری و شال زرشکی در خیابانی بارانی قدم میزند،
نمای متوسط، دوربین بهآرامی از کنار او حرکت میکند، نور نئون آبی و قرمز
روی آسفالت خیس منعکس شده، فضای سینمایی احساسی، بافت فیلم 35mm،
حرکت طبیعی، چهره و لباس ثابت، بدون نوشته و لوگو
نمونه انگلیسی:
A young Iranian woman wearing a long gray coat and a simple burgundy scarf
walks through a rainy city street at night, medium shot, slow lateral tracking
camera, blue and red neon reflections on wet asphalt, emotional cinematic mood,
realistic 35mm film texture, natural motion, consistent face and outfit,
no text, no logo
پرامپت انگلیسی الزاماً همیشه نتیجه بهتری ایجاد نمیکند، اما در بعضی مدلها کنترل اصطلاحات سینمایی با عبارتهای انگلیسی سادهتر است.
چند پرامپت آماده برای ساخت موزیک ویدیو
اجرای خواننده روی صحنه
خواننده روی صحنهای کوچک در حال اجرای یک قطعه احساسی است،
نور پشت صحنه طلایی و مه ملایم، نمای نزدیک سینمایی،
حرکت آرام دوربین به دور خواننده، تماشاگران محو در پسزمینه،
حرکت طبیعی بدن، بدون نوشته و لوگو
موزیک ویدیوی نئونی
شخصیت اصلی در یک شهر آیندهنگر با تابلوهای نئونی حرکت میکند،
خیابان خیس، رنگهای آبی و ارغوانی، دوربین دستی کنترلشده،
فضای موزیک ویدیوی الکترونیک، کنتراست بالا، حرکت روان
ویدیوی عاشقانه
دو شخصیت در ساحل هنگام غروب قدم میزنند، نور گرم و طبیعی،
نمای باز سینمایی، حرکت آهسته دوربین، باد ملایم در لباسها،
فضای شاعرانه و احساسی، رنگهای طلایی
ویدیوی رپ شهری
خواننده در پارکینگ بتنی با نورهای خطی سفید اجرا میکند،
دوربین با انرژی به سمت سوژه حرکت میکند، برشپذیر برای تدوین سریع،
استایل خیابانی، کنتراست شدید، نورپردازی دراماتیک
ویژوالایزر انتزاعی
موجهای نورانی طلایی و بنفش در فضای تاریک با ریتم موسیقی حرکت میکنند،
ذرات معلق، حرکت نرم و تکرارشونده، ترکیببندی متقارن،
فضای رویایی، بدون متن و بدون سوژه انسانی
متن به ویدیو بهتر است یا تصویر به ویدیو؟
انتخاب روش به نوع نما بستگی دارد.
متن به ویدیو
این روش برای ایدهپردازی سریع، نماهای محیطی و صحنههایی مناسب است که حفظ جزئیات ثابت در آنها اهمیت کمتری دارد.
مزایا:
- شروع سریع
- نیاز نداشتن به تصویر اولیه
- مناسب برای آزمایش چند ایده
- آزادی بیشتر در طراحی صحنه
محدودیتها:
- احتمال تغییر ظاهر شخصیت
- کنترل کمتر روی ترکیببندی دقیق
- دشواری حفظ لباس و چهره در چند نما
تصویر به ویدیو
در این روش ابتدا قاب اصلی ساخته میشود و سپس مدل آن را متحرک میکند.
مزایا:
- کنترل بیشتر روی شخصیت
- ثبات بهتر رنگ و لباس
- امکان تعیین ترکیببندی قبل از تولید
- مناسب برای موزیک ویدیوهای داستانی
برای پروژهای که شخصیت ثابتی دارد، معمولاً تصویر به ویدیو انتخاب قابلکنترلتری است.
برای آشنایی با این فرایند میتوانید راهنمای تبدیل عکس به ویدیو با هوش مصنوعی را مطالعه کنید.
چگونه ثبات شخصیت را حفظ کنیم؟
یکی از مشکلات رایج موزیک ویدیوهای هوش مصنوعی، تغییر چهره شخصیت در نماهای مختلف است.
برای کاهش این مشکل:
- یک تصویر مرجع واضح از شخصیت بسازید.
- از همان تصویر یا تصاویر همسبک برای تمام نماها استفاده کنید.
- شرح ظاهری شخصیت را ثابت نگه دارید.
- لباس را در میانه پروژه تغییر ندهید.
- تعداد شخصیتهای هر نما را محدود کنید.
- هر کلیپ را کوتاه تولید کنید.
- حرکت دوربین را بیش از حد پیچیده نکنید.
- نماهای نزدیک را با دقت بیشتری بررسی کنید.
- مدل و تنظیمات را وسط یک سکانس تغییر ندهید.
- در صورت پشتیبانی مدل، از تصویر مرجع، Seed یا تنظیمات ثبات کاراکتر استفاده کنید.
بهتر است قبل از تولید دهها کلیپ، سه نمای آزمایشی شامل نمای باز، متوسط و نزدیک بسازید. اگر شخصیت در همین سه نما ثابت نماند، ابتدا تصویر مرجع یا پرامپت را اصلاح کنید.
تدوین موزیک ویدیو روی ضرب موسیقی
کیفیت نماهای تولیدشده مهم است، اما چیزی که آنها را به موزیک ویدیو تبدیل میکند تدوین هماهنگ با آهنگ است.
نقاط مناسب برای برش
برشها میتوانند روی این نقاط قرار گیرند:
- ضرب اصلی
- شروع جمله موسیقی
- تغییر آکورد
- ورود ساز جدید
- پایان یک مصرع
- شروع ترجیعبند
- سکوت کوتاه
- اوج موسیقی
یک قانون ثابت برای طول نما وجود ندارد، اما میتوان از این محدودهها بهعنوان نقطه شروع استفاده کرد:
| نوع آهنگ | طول تقریبی هر نما |
|---|---|
| آرام و احساسی | ۴ تا ۸ ثانیه |
| پاپ با ریتم متوسط | ۲ تا ۵ ثانیه |
| رپ یا الکترونیک سریع | ۰٫۵ تا ۲ ثانیه |
| ویدیوی انتزاعی | متناسب با عبارتهای موسیقی |
لازم نیست روی تمام ضربها برش بزنید. تکرار بیش از حد برش میتواند ویدیو را خستهکننده کند.
تشخیص ضرب آهنگ با پایتون و librosa
کتابخانه متنباز librosa برای تحلیل صوت و موسیقی در پایتون استفاده میشود. با آن میتوان سرعت تقریبی و زمان ضربها را استخراج کرد.
ابتدا کتابخانه را نصب کنید:
pip install librosa
سپس فایل موسیقی را تحلیل کنید:
import librosa
audio, sample_rate = librosa.load("song.mp3", sr=None)
tempo, beat_frames = librosa.beat.beat_track(
y=audio,
sr=sample_rate,
)
beat_times = librosa.frames_to_time(
beat_frames,
sr=sample_rate,
)
tempo_value = float(tempo[0] if hasattr(tempo, "__len__") else tempo)
print(f"Estimated tempo: {tempo_value:.2f} BPM")
print("First beat times:")
for beat_time in beat_times[:20]:
print(f"{beat_time:.3f}")
این خروجی میتواند برای پیشنهاد نقاط برش استفاده شود. تشخیص خودکار همیشه با ساختار هنری آهنگ یکسان نیست؛ بنابراین نقاط مهم را با گوشدادن به آهنگ نیز بررسی کنید.
مثال عملی: ساخت موزیک ویدیوی ۶۰ ثانیهای
فرض کنیم میخواهیم برای یک آهنگ پاپ فارسی با موضوع «شروع دوباره» ویدیویی ۶۰ ثانیهای بسازیم.
مفهوم اصلی
شخصیت اصلی شب را در یک اتاق تاریک آغاز میکند، از خانه بیرون میرود و همزمان با اوج آهنگ به پشتبامی روشن میرسد. تغییر رنگ از آبی سرد به طلایی، تغییر وضعیت عاطفی او را نمایش میدهد.
سکانس اول؛ مقدمه
نمای باز از شهر در شب بارانی، پنجرههای روشن، خیابان خلوت،
حرکت بسیار آرام دوربین رو به جلو، رنگهای آبی سرد،
فضای سینمایی واقعگرایانه، 35mm film look
سکانس دوم؛ بند اول
زن جوان با پالتوی خاکستری کنار پنجره ایستاده است،
شال زرشکی، نور آبی خیابان روی صورت او، نمای متوسط،
دوربین بهآرامی نزدیک میشود، حس تنهایی و سکوت
سکانس سوم؛ شروع ترجیعبند
همان زن از ساختمان خارج میشود و در خیابان بارانی قدم میزند،
دوربین از پشت او را دنبال میکند، بازتاب نورهای شهر روی زمین،
حرکت طبیعی، فضای احساسی و امیدوارکننده
سکانس چهارم؛ اوج موسیقی
زن روی پشتبام به سمت نور طلوع حرکت میکند،
باد ملایم در پالتو و شال، نمای باز، دوربین با حرکت نرم بالا میرود،
نور طلایی جای رنگ آبی را میگیرد، حس رهایی و شروع دوباره
سکانس پنجم؛ پایان
نمای نزدیک از چهره آرام شخصیت در نور صبح،
لبخند بسیار ملایم، پسزمینه محو شهر، دوربین ثابت،
نور طبیعی طلایی، پایان سینمایی
بهتر است از هر نما حداقل دو یا سه نسخه بسازید و فقط بهترین خروجی را وارد تدوین کنید.
ساخت خودکار Shot List با API درواره
یکی از کاربردهای عملی API درواره، تبدیل مشخصات آهنگ به یک Shot List ساختاریافته است. سپس میتوان پرامپت هر نما را برای مدل تصویری یا ویدیویی ارسال کرد.
API درواره با ساختار OpenAI سازگار است و آدرس پایه آن بهصورت زیر تنظیم میشود:
https://api.darvareh.ir/v1
ابتدا کتابخانههای لازم را نصب کنید:
pip install openai pydantic
متغیرهای محیطی را تنظیم کنید:
export DARVAREH_API_KEY="YOUR_API_KEY"
export DARVAREH_MODEL="YOUR_MODEL_ID"
کد پایتون:
import os
from typing import List
from openai import OpenAI
from pydantic import BaseModel, Field
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1",
)
MODEL_ID = os.environ["DARVAREH_MODEL"]
class Shot(BaseModel):
number: int
start_seconds: float
end_seconds: float
section: str
description_fa: str
prompt_en: str
camera: str
transition: str
class MusicVideoPlan(BaseModel):
title: str
concept: str
visual_style: str
color_palette: List[str]
character_reference: str
shots: List[Shot] = Field(min_length=1)
def create_music_video_plan(
lyrics: str,
duration_seconds: int,
genre: str,
mood: str,
) -> MusicVideoPlan:
prompt = f"""
برای یک موزیک ویدیوی هوش مصنوعی برنامه تولید بساز.
مشخصات:
- مدت آهنگ: {duration_seconds} ثانیه
- ژانر: {genre}
- حالوهوا: {mood}
- متن یا خلاصه ترانه:
{lyrics}
قواعد:
- کل بازه زمانی از صفر تا {duration_seconds} پوشش داده شود.
- بین زمان نماها فاصله یا همپوشانی وجود نداشته باشد.
- ظاهر شخصیت در تمام نماها ثابت باشد.
- هر نمای تولیدی ترجیحاً بین ۳ تا ۶ ثانیه باشد.
- prompt_en برای تولید ویدیو به زبان انگلیسی نوشته شود.
- هیچ نوشتهای داخل تصاویر تولیدی درخواست نشود.
- خروجی فقط JSON معتبر باشد.
ساختار JSON:
{{
"title": "عنوان پیشنهادی",
"concept": "خلاصه داستان",
"visual_style": "سبک بصری",
"color_palette": ["color 1", "color 2"],
"character_reference": "مشخصات ثابت شخصیت",
"shots": [
{{
"number": 1,
"start_seconds": 0,
"end_seconds": 4,
"section": "intro",
"description_fa": "شرح فارسی نما",
"prompt_en": "English video generation prompt",
"camera": "camera movement",
"transition": "cut"
}}
]
}}
"""
response = client.chat.completions.create(
model=MODEL_ID,
temperature=0.4,
messages=[
{
"role": "system",
"content": (
"شما کارگردان و طراح استوریبورد موزیک ویدیو هستید. "
"پاسخ را فقط بهصورت JSON معتبر تولید میکنید."
),
},
{
"role": "user",
"content": prompt,
},
],
)
content = response.choices[0].message.content
if not content:
raise ValueError("مدل هیچ محتوایی برنگرداند.")
return MusicVideoPlan.model_validate_json(content)
plan = create_music_video_plan(
lyrics=(
"شخصیت پس از یک دوره سخت، گذشته را رها میکند "
"و با امید به سمت یک شروع تازه میرود."
),
duration_seconds=60,
genre="Persian emotional pop",
mood="melancholic at first, hopeful at the end",
)
print(plan.model_dump_json(indent=2))
در این نمونه، مدل زبانی نقش کارگردان و طراح استوریبورد را دارد. خروجی JSON را میتوان در پنل تولید ویدیو نمایش داد یا به مرحله بعدی خط تولید فرستاد.
شناسه مدل را بهتر است از تنظیمات برنامه یا متغیر محیطی دریافت کنید تا بتوانید بدون تغییر کد، مدل دیگری را آزمایش کنید.
اتصال مدل ویدیویی به سامانه
ساخت ویدیو معمولاً یک عملیات فوری نیست. معماری مناسب باید فرایند تولید را بهصورت Job مدیریت کند:
- کاربر آهنگ و توضیحات را ارسال میکند.
- سرور درخواست را اعتبارسنجی میکند.
- مدل زبانی Shot List را میسازد.
- کاربر یا مدیر پروژه نماها را تأیید میکند.
- هر نمای تأییدشده برای مدل ویدیویی ارسال میشود.
- شناسه Job در پایگاه داده ذخیره میشود.
- وضعیت تولید در بازههای زمانی مشخص بررسی میشود.
- فایلهای آماده در فضای ذخیرهسازی قرار میگیرند.
- کلیپها با موسیقی ترکیب میشوند.
- لینک خروجی نهایی به کاربر نمایش داده میشود.
مدلهایی مانند Seedance، Kling یا سایر مدلهای ویدیویی ممکن است ساختار درخواست، محدودیت مدت و روش پیگیری متفاوتی داشته باشند. بنابراین نام endpoint، شناسه مدل و پارامترهای تولید را باید از مستندات فعلی API درواره دریافت کنید.
اگر قصد دارید این قابلیت را در سایت خود ارائه کنید، کلید API را هرگز داخل کد مرورگر، React، Flutter یا اپلیکیشن موبایل قرار ندهید. درخواست باید ابتدا به سرور برنامه شما ارسال شود و سرور با API ارتباط برقرار کند.
تدوین خودکار کلیپها با FFmpeg
پس از تولید نماها، میتوان آنها را با FFmpeg به یک ویدیو تبدیل کرد.
ابتدا فایل clips.txt را بسازید:
file 'shot-01.mp4'
file 'shot-02.mp4'
file 'shot-03.mp4'
file 'shot-04.mp4'
file 'shot-05.mp4'
سپس کلیپها را به هم متصل کنید:
ffmpeg \
-f concat \
-safe 0 \
-i clips.txt \
-i song.mp3 \
-map 0:v:0 \
-map 1:a:0 \
-c:v libx264 \
-c:a aac \
-pix_fmt yuv420p \
-shortest \
music-video.mp4
اگر کلیپها ابعاد، نرخ فریم یا کدک یکسان نداشته باشند، ابتدا باید استانداردسازی شوند:
ffmpeg \
-i shot-original.mp4 \
-vf "scale=1920:1080:force_original_aspect_ratio=increase,crop=1920:1080,fps=24" \
-c:v libx264 \
-pix_fmt yuv420p \
-an \
shot-normalized.mp4
براساس مستندات FFmpeg، این ابزار میتواند ورودیهای صوتی و تصویری را انتخاب، تبدیل، فیلتر و در خروجی جدید ترکیب کند. مستندات FFmpeg
ساخت زیرنویس و نمایش متن ترانه
برای نمایش متن ترانه سه روش وجود دارد:
زیرنویس ساده
متن در پایین تصویر نمایش داده میشود. این روش خوانا و مناسب یوتیوب است.
نمایش کلمهبهکلمه
کلمات همزمان با اجرا ظاهر میشوند. این سبک برای ریلز و ویدیوهای کوتاه جذاب است، اما زمانبندی بیشتری میخواهد.
تایپوگرافی متحرک
متن بخشی از طراحی موزیک ویدیو میشود. این روش برای لیریک ویدیو مناسب است.
بهتر است متن فارسی را در برنامه تدوین اضافه کنید، نه در پرامپت تولید ویدیو. این کار کنترل بیشتری بر فونت، نیمفاصله، جهت نوشتار و املای کلمات ایجاد میکند.
برای اطلاعات بیشتر میتوانید راهنمای ساخت زیرنویس فارسی با هوش مصنوعی را مطالعه کنید.
ساخت سایت تولید موزیک ویدیو با هوش مصنوعی
اگر قصد دارید سرویسی بسازید که کاربران در آن آهنگ خود را آپلود کنند و موزیک ویدیو تحویل بگیرند، جریان کار میتواند شامل این مراحل باشد:
- ساخت حساب کاربری
- آپلود فایل آهنگ
- انتخاب نوع موزیک ویدیو
- انتخاب نسبت تصویر
- واردکردن متن یا مفهوم ترانه
- انتخاب سبک بصری
- تولید خودکار سناریو
- نمایش استوریبورد اولیه
- تأیید یا ویرایش نماها
- انتخاب مدل ویدیویی
- تولید نماها
- تدوین خودکار
- نمایش پیشنمایش
- دریافت نسخه نهایی
بهتر است پیش از شروع تولید پرهزینه، یک پیشنمایش کمهزینه شامل Shot List و تصاویر ثابت به کاربر نشان داده شود.
اطلاعاتی که باید از کاربر دریافت شود
{
"project_name": "شروع دوباره",
"duration_seconds": 60,
"aspect_ratio": "9:16",
"video_type": "narrative",
"visual_style": "cinematic realistic",
"mood": "sad to hopeful",
"has_main_character": true,
"lyrics": "متن یا خلاصه ترانه",
"output_quality": "1080p"
}
وضعیتهای پیشنهادی پروژه
draft
planning
waiting_for_approval
generating
editing
completed
failed
ثبت این وضعیتها باعث میشود کاربر بتواند پیشرفت پروژه را مشاهده کند و درخواستهای طولانی در مرورگر باز نمانند.
چگونه هزینه تولید موزیک ویدیو را کاهش دهیم؟
ابتدا استوریبورد بسازید
تولید تصویر ثابت معمولاً برای بررسی ایده سریعتر از تولید چندین کلیپ کامل است. ابتدا قابها را تأیید و سپس آنها را متحرک کنید.
نماها را کوتاه نگه دارید
کلیپ کوتاهتر معمولاً کنترلپذیرتر است. در مرحله تدوین میتوان چند کلیپ کوتاه را با هم ترکیب کرد.
پیشنمایش کمهزینه تولید کنید
ابتدا خروجی را با کیفیت یا تعداد نسخه محدود بررسی کنید. تولید نهایی و افزایش کیفیت را فقط برای نماهای پذیرفتهشده انجام دهید.
تمام آهنگ را یکباره تولید نکنید
تقسیم پروژه به نماهای مستقل باعث میشود فقط قسمتهای ضعیف دوباره تولید شوند.
مدل را متناسب با نما انتخاب کنید
لازم نیست تمام نماها با گرانترین مدل تولید شوند. ممکن است یک مدل اقتصادی برای نماهای محیطی مناسب باشد و مدل قویتر فقط برای کلوزآپ شخصیت استفاده شود.
هزینه را به تفکیک پروژه ثبت کنید
در یک سرویس تجاری باید موارد زیر ذخیره شوند:
- تعداد نماهای درخواستشده
- تعداد تلاشهای ناموفق
- مدل استفادهشده
- هزینه هر نما
- هزینه کل پروژه
- زمان تولید
- تعداد بازتولیدها
برای محاسبه بهتر هزینه میتوانید مقاله محاسبه هزینه API هوش مصنوعی را مطالعه کنید.
اشتباهات رایج در ساخت موزیک ویدیو با هوش مصنوعی
تولید کل موزیک ویدیو با یک پرامپت
یک پرامپت طولانی معمولاً کنترل کافی روی داستان، تدوین و ثبات شخصیت ایجاد نمیکند. پروژه را به نماهای کوتاه تقسیم کنید.
نداشتن راهنمای بصری
اگر رنگ، لباس، شخصیت و سبک دوربین تعریف نشده باشند، هر کلیپ ممکن است متعلق به فیلم متفاوتی به نظر برسد.
تغییر مدل در میانه سکانس
مدلهای مختلف سبک حرکت و تصویر متفاوتی دارند. بهتر است نماهای یک سکانس مرتبط با مدل و تنظیمات مشابه تولید شوند.
استفاده بیش از حد از حرکت دوربین
درخواست همزمان چرخش دوربین، زوم، حرکت سریع شخصیت و تغییر محیط احتمال خطا را افزایش میدهد. برای هر نما یک حرکت اصلی انتخاب کنید.
قرار دادن متن فارسی داخل ویدیوی تولیدی
برای جلوگیری از نوشتههای نادرست، متن ترانه، نام خواننده و لوگو را در مرحله تدوین اضافه کنید.
نادیدهگرفتن ریتم آهنگ
چند کلیپ زیبا که ارتباطی با ساختار موسیقی ندارند، الزاماً موزیک ویدیوی خوبی نمیسازند. محل برش و تغییر صحنه را براساس آهنگ تعیین کنید.
تولید نهایی قبل از آزمایش
ابتدا چند ثانیه آزمایشی تولید کنید. پس از تأیید سبک، سراغ تمام نماها بروید.
چکلیست نهایی انتشار موزیک ویدیو
پیش از انتشار این موارد را بررسی کنید:
- صدا و تصویر از ابتدا تا انتها هماهنگ هستند.
- هیچ فریم خراب یا تغییر ناگهانی چهره وجود ندارد.
- نوشتههای فارسی درست نمایش داده میشوند.
- حجم صدا در تمام ویدیو مناسب است.
- شروع ویدیو در چند ثانیه اول جذاب است.
- نسبت تصویر با پلتفرم انتشار هماهنگ است.
- لوگو و عنوان در ناحیه امن قرار گرفتهاند.
- نسخه نهایی روی موبایل نیز بررسی شده است.
- مجوز استفاده از آهنگ، تصویر و سایر داراییها مشخص است.
- فایل اصلی با کیفیت مناسب نگهداری شده است.
پرسشهای متداول
بهترین هوش مصنوعی برای ساخت موزیک ویدیو چیست؟
یک مدل واحد برای تمام پروژهها بهترین نیست. انتخاب مدل به سبک ویدیو، نیاز به ثبات شخصیت، نوع حرکت، مدت نما، سرعت تولید و بودجه بستگی دارد. بهتر است چند مدل را با یک تصویر و پرامپت یکسان آزمایش کنید.
آیا میتوان یک آهنگ کامل را به موزیک ویدیو تبدیل کرد؟
بله، اما بهتر است آهنگ به بخشهای کوچک تقسیم شود. برای هر بخش چند نما تولید کنید و سپس آنها را در برنامه تدوین روی موسیقی قرار دهید.
چگونه چهره خواننده را ثابت نگه داریم؟
از تصویر مرجع ثابت، توضیح ظاهری یکسان، لباس ثابت و روش تصویر به ویدیو استفاده کنید. تولید نماهای کوتاه نیز احتمال تغییر چهره را کاهش میدهد.
آیا هوش مصنوعی میتواند ویدیو را دقیقاً با ضرب آهنگ هماهنگ کند؟
بعضی ابزارها قابلیتهای خودکار برای هماهنگی با موسیقی دارند، اما برای نتیجه دقیقتر بهتر است زمان ضربها استخراج و تدوین نهایی در یک نرمافزار تدوین انجام شود.
آیا امکان ساخت موزیک ویدیو فارسی وجود دارد؟
بله. متن و مفهوم آهنگ فارسی را میتوان با مدل زبانی تحلیل کرد و برای آن سناریو، Shot List و پرامپت تولید کرد. نوشتههای فارسی بهتر است در مرحله تدوین به تصویر اضافه شوند.
آیا میتوان سایت ساخت موزیک ویدیو راهاندازی کرد؟
بله. میتوان یک رابط کاربری برای دریافت آهنگ و تنظیمات ساخت، سپس فرایند تحلیل، تولید نما و تدوین را در سرور اجرا کرد. API درواره میتواند لایه دسترسی برنامه به مدلهای هوش مصنوعی باشد.
آیا API درواره با OpenAI SDK قابل استفاده است؟
API درواره با ساختار OpenAI سازگار است. در کاربردهای متنی معمولاً میتوانید با تنظیم base_url، کلید API و شناسه مدل از کتابخانه OpenAI استفاده کنید. برای مدلهای تصویری و ویدیویی باید ساختار درخواست همان مدل را در مستندات فعلی بررسی کنید.
ساخت یک موزیک ویدیو چقدر زمان میبرد؟
زمان تولید به مدت آهنگ، تعداد نماها، مدل انتخابشده، تعداد بازتولیدها و میزان تدوین بستگی دارد. ساخت یک پیشنمایش ۳۰ تا ۶۰ ثانیهای معمولاً نقطه شروع مناسبی برای ارزیابی ایده است.
جمعبندی
ساخت موزیک ویدیو با هوش مصنوعی یک فرایند چندمرحلهای است. برای رسیدن به نتیجه حرفهای باید آهنگ را تحلیل، ایده بصری را تعریف، استوریبورد را آماده و نماها را بهصورت جداگانه تولید کنید.
مسیر پیشنهادی چنین است:
- هدف و قالب خروجی را مشخص کنید.
- آهنگ را به بخشهای زمانی تقسیم کنید.
- مفهوم و سناریوی بصری بسازید.
- ظاهر شخصیت و سبک پروژه را ثابت کنید.
- برای هر بخش Shot List بنویسید.
- قابهای مرجع را تولید کنید.
- نماهای کوتاه را با مدل ویدیویی بسازید.
- کلیپها را روی ضرب موسیقی تدوین کنید.
- متن ترانه و نوشتهها را در تدوین اضافه کنید.
- فقط نماهای نهایی را با کیفیت بالا خروجی بگیرید.
اگر میخواهید تولید موزیک ویدیو را به وبسایت، اپلیکیشن یا ابزار داخلی خود اضافه کنید، میتوانید برای تحلیل آهنگ، ساخت سناریو، تولید Shot List و اتصال به مدلهای هوش مصنوعی از API درواره استفاده کنید.
برای مشاهده مدلها، ساخت کلید API و بررسی ساختار درخواستها به مستندات API درواره مراجعه کنید.
مقالات مرتبط
- تبدیل متن به ویدیو با هوش مصنوعی
- تبدیل عکس به ویدیو با هوش مصنوعی
- بهترین ابزارهای ساخت ویدیو با هوش مصنوعی
- آموزش تدوین ویدیو با هوش مصنوعی
- ساخت موسیقی با هوش مصنوعی
- آموزش نوشتن سناریوی ویدیو با هوش مصنوعی
- آموزش Seedance برای تولید ویدیو
- آموزش Kling AI
- آموزش Runway AI
- افزایش کیفیت ویدیو تا 4K با هوش مصنوعی
منابع
- مستندات API درواره
- FFmpeg Documentation
- DaVinci Resolve
- librosa Documentation
- Audacity
- CapCut AI Video Generator
این مقاله صرفاً با هدف آموزش و اطلاعرسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویسها و صفحه سلب مسئولیت را مطالعه کنید.