حذف صدای خواننده از آهنگ با هوش مصنوعی؛ آموزش ساخت نسخه بیکلام و کارائوکه
در این راهنمای عملی یاد میگیرید چگونه با هوش مصنوعی صدای خواننده را از آهنگ جدا کنید، نسخه بیکلام یا کارائوکه بسازید و وکال، درام، بیس و سازها را در فایلهای مستقل تحویل بگیرید
برای حذف صدای خواننده از یک آهنگ، دیگر لازم نیست به فایلهای چندترک استودیویی دسترسی داشته باشید. ابزارهای جدید هوش مصنوعی میتوانند یک فایل نهایی مانند MP3 یا WAV را تحلیل و اجزای آن را به مسیرهای جداگانه تقسیم کنند.
این فرایند معمولاً Stem Separation یا Source Separation نامیده میشود. در سادهترین حالت، آهنگ به دو بخش تقسیم میشود:
- صدای خواننده یا Vocal
- موسیقی بدون خواننده یا Instrumental
ابزارهای پیشرفتهتر میتوانند بخشهای بیشتری را جدا کنند:
- وکال اصلی
- همخوان یا Backing Vocal
- درام
- بیس
- گیتار
- پیانو
- سازهای زهی
- سازهای بادی
- سینتیسایزر
- سایر سازها
خروجی این فرایند برای ساخت نسخه کارائوکه، تمرین خوانندگی، تمرین ساز، تولید محتوای ویدئویی، بازسازی پروژه صوتی، تحلیل تنظیم آهنگ و تهیه نسخه آکاپلا کاربرد دارد.
بااینحال، نتیجه همیشه کاملاً مشابه فایل اصلی استودیویی نیست. کیفیت جداسازی به نوع موسیقی، کیفیت فایل، افکتهای صدا، همپوشانی فرکانسی سازها و مدل هوش مصنوعی وابسته است.
در این مقاله، روش حذف صدای خواننده از آهنگ با ابزارهای آنلاین، موبایل و دسکتاپ را بهصورت مرحلهبهمرحله بررسی میکنیم. همچنین یاد میگیریم چگونه کیفیت خروجی را ارزیابی و خطاهای رایج را اصلاح کنیم.
حذف صدای خواننده چگونه انجام میشود؟
یک فایل موسیقی نهایی معمولاً حاصل ترکیب چندین مسیر صوتی است:
وکال اصلی
+ همخوان
+ درام
+ بیس
+ گیتار
+ پیانو
+ افکتها
+ سایر سازها
= فایل نهایی آهنگ
پس از ترکیب یا Mix، تمام این اجزا در یک فایل استریو ذخیره میشوند. در حالت عادی، جدا کردن کامل آنها دشوار است؛ زیرا اطلاعات هر بخش بهصورت مستقل در فایل نهایی نگهداری نمیشود.
مدلهای جداسازی منبع صوتی با بررسی ویژگیهایی مانند فرکانس، زمان، هارمونیک، ریتم و الگوی صدای انسان تلاش میکنند سهم هر منبع را تخمین بزنند.
فرایند سادهشده چنین است:
فایل آهنگ
↓
تبدیل صدا به نمایش زمان و فرکانس
↓
تحلیل الگوهای وکال و سازها
↓
ساخت Mask برای هر منبع
↓
بازسازی مسیرهای جداگانه
↓
وکال، Instrumental و سایر Stemها
این مدلها صدا را از فایل اصلی «بازیابی کامل» نمیکنند؛ بلکه براساس الگوهای آموختهشده تخمین میزنند کدام قسمت به خواننده و کدام قسمت به سازها تعلق دارد.
به همین دلیل ممکن است در خروجی، بخشی از ساز همراه وکال باقی بماند یا قسمتی از صدای خواننده در نسخه بیکلام شنیده شود.
تفاوت Vocal Remover و Stem Separation چیست؟
این دو اصطلاح نزدیکاند، اما دقیقاً یک معنی ندارند.
Vocal Remover
هدف اصلی آن حذف یا استخراج صدای خواننده است. خروجی معمولاً دو فایل دارد:
Vocals
Instrumental
این حالت برای ساخت کارائوکه، استخراج صدای خواننده یا تمرین مناسب است.
Stem Separation
فرایند کاملتری است که موسیقی را به چند بخش مستقل تقسیم میکند.
نمونه جداسازی چهار Stem:
Vocals
Drums
Bass
Other
نمونه جداسازی پیشرفتهتر:
Lead Vocal
Backing Vocal
Drums
Bass
Guitar
Piano
Synth
Strings
Other
اگر فقط به نسخه بدون خواننده نیاز دارید، جداسازی دو Stem معمولاً کافی است. اگر قصد تمرین ساز، ریمیکس یا تحلیل تنظیم را دارید، جداسازی چند Stem کاربرد بیشتری دارد.
آیا صدای خواننده کاملاً حذف میشود؟
در بعضی آهنگها نتیجه بسیار تمیز است، اما حذف صددرصدی وکال تضمینشده نیست.
کیفیت خروجی تحت تأثیر عوامل مختلف قرار میگیرد:
- نوع میکس و مستر
- کیفیت فایل ورودی
- استفاده از Reverb و Delay روی وکال
- وجود همخوان
- قرار گرفتن وکال در مرکز یا طرفین استریو
- شباهت فرکانسی صدای خواننده و سازها
- استفاده از Distortion
- تعداد خوانندگان
- فشردهسازی شدید فایل
- اجرای زنده یا استودیویی بودن
- سبک موسیقی
- مدل جداسازی انتخابشده
برای مثال، یک وکال واضح در آهنگ پاپ استودیویی ممکن است بهتر از آواز گروهی همراه با Reverb شدید جدا شود.
خروجیهای مختلف جداسازی صدا
قبل از انتخاب تنظیمات ابزار، باید بدانید به چه خروجی نیاز دارید.
| هدف | خروجی مناسب |
|---|---|
| ساخت کارائوکه | Instrumental بدون وکال |
| تمرین خوانندگی | Instrumental |
| استخراج صدای خواننده | Vocal یا Acapella |
| تمرین درام | نسخه بدون Drums |
| تمرین گیتار | نسخه بدون Guitar |
| شنیدن خط بیس | Bass Stem |
| تنظیم مجدد موسیقی | چند Stem جداگانه |
| ساخت زیرنویس ترانه | Vocal Stem تمیز |
| کاهش گفتار روی موسیقی | جداسازی Voice و Music |
| تحلیل آکورد و ریتم | Stemهای سازها |
اگر فقط یک فایل نهایی لازم دارید، تولید Stemهای زیاد ممکن است زمان پردازش و حجم خروجی را بیدلیل افزایش دهد.
بهترین فرمت فایل ورودی چیست؟
برای رسیدن به بهترین کیفیت، از باکیفیتترین نسخهای که در اختیار دارید استفاده کنید.
اولویت پیشنهادی:
- WAV یا FLAC با کیفیت اصلی
- فایل AAC یا M4A با Bitrate مناسب
- فایل MP3 باکیفیت
- صدای استخراجشده از ویدئو
- فایل چندبار فشردهشده شبکههای اجتماعی
هر بار تبدیل و فشردهسازی میتواند جزئیات صوتی را کاهش دهد. مدل جداسازی نیز برای تشخیص دقیق منابع به همین جزئیات نیاز دارد.
اگر فایل اصلی MP3 است، تبدیل آن به WAV کیفیت ازدسترفته را بازنمیگرداند. این تبدیل فقط از فشردهسازی مجدد در مراحل بعدی جلوگیری میکند.
روش اول: حذف وکال با Moises
Moises یک مجموعه ابزار موسیقی مبتنی بر هوش مصنوعی است که میتواند وکال و سازها را جدا کند، صدای بخشهای مختلف را تغییر دهد و نسخه تمرینی بسازد.
براساس وبسایت رسمی Moises، قابلیت Stem Separation این سرویس میتواند وکال، سازها و درام را جدا یا بیصدا کند. نسخههای وب، موبایل و دسکتاپ نیز برای آن ارائه شدهاند.
مراحل استفاده
- وارد وبسایت یا برنامه Moises شوید.
- فایل آهنگ را بارگذاری کنید.
- نوع جداسازی را انتخاب کنید.
- برای ساخت نسخه بیکلام، حالت جداسازی Vocal و Instrumental را انتخاب کنید.
- منتظر پایان پردازش بمانید.
- مسیر Vocal را Mute کنید.
- خروجی Instrumental را گوش دهید.
- در صورت رضایت، فایل را Export کنید.
اگر به سازهای جداگانه نیاز دارید
بهجای حالت دو Stem، یکی از حالتهای چندمسیره را انتخاب کنید:
- Vocals
- Drums
- Bass
- Guitar
- Piano
- Other
تعداد مسیرهای قابل انتخاب ممکن است به نسخه برنامه و نوع حساب بستگی داشته باشد؛ بنابراین تنظیمات موجود در زمان استفاده را بررسی کنید.
کاربردهای مناسب Moises
- ساخت نسخه تمرینی
- کاهش یا حذف وکال
- تمرین خوانندگی
- تمرین ساز
- تغییر سرعت آهنگ
- تغییر Pitch
- تشخیص آکورد
- تنظیم صدای Stemها
- ساخت Backing Track
روش دوم: حذف صدای خواننده با LALAL.AI
LALAL.AI ابزاری تخصصی برای جداسازی وکال و سازها از فایل صوتی یا ویدئویی است.
طبق صفحه رسمی Stem Splitter در LALAL.AI، این سرویس امکان جداسازی وکال، درام، بیس، گیتار، سینتیسایزر، سازهای زهی و بادی را ارائه میدهد و از فرمتهای رایجی مانند MP3، WAV، FLAC، AAC، M4A و MP4 پشتیبانی میکند.
مراحل استفاده
- وارد LALAL.AI شوید.
- نوع Stem موردنظر را انتخاب کنید.
- فایل صوتی یا ویدئویی را بارگذاری کنید.
- منتظر آماده شدن Preview بمانید.
- نسخه Vocal و Instrumental را جداگانه گوش دهید.
- اگر نتیجه مناسب نبود، مدل جداسازی یا تنظیمات را تغییر دهید.
- پردازش کامل را انجام دهید.
- فایلهای موردنیاز را دانلود کنید.
جداسازی وکال اصلی و همخوان
در بعضی آهنگها حذف صدای خواننده اصلی کافی نیست؛ زیرا همخوانها در نسخه Instrumental باقی میمانند. LALAL.AI قابلیت جداسازی Lead Vocal و Backing Vocal را نیز برای برخی حالتها ارائه میدهد.
این ویژگی برای موارد زیر مفید است:
- استخراج آکاپلای خواننده اصلی
- تمرین همخوانی
- ساخت نسخه کارائوکه تمیزتر
- بررسی هارمونیهای صوتی
- تنظیم مجدد وکالها
نسخه دسکتاپ
نسخه دسکتاپ این سرویس نیز برای جداسازی وکال، Instrumental و سازهای مختلف ارائه شده است. اطلاعات قابلیتهای فعلی آن در صفحه رسمی LALAL.AI Desktop قابل مشاهده است.
روش سوم: ساخت نسخه بیکلام با BandLab Splitter
BandLab Splitter امکان تقسیم فایل موسیقی به بخشهای مستقل را فراهم میکند.
براساس آموزش رسمی BandLab، پس از بارگذاری فایل میتوانید Stemهای جداشده را در Player کنترل کنید، مسیر Vocal را بیصدا کنید و خروجی جدید بگیرید.
مراحل استفاده
- ابزار Splitter را باز کنید.
- فایل آهنگ یا ویدئو را وارد کنید.
- منتظر پایان جداسازی بمانید.
- مسیر Vocal را پیدا کنید.
- آن را Mute کنید.
- نسخه بدون خواننده را گوش دهید.
- در صورت نیاز، مسیرها را وارد محیط Studio کنید.
- فایل نهایی را Export کنید.
این روش برای کاربرانی مناسب است که میخواهند بعد از جداسازی، تنظیمات بیشتری روی پروژه انجام دهند یا صدای خود را روی موسیقی ضبط کنند.
روش چهارم: حذف وکال در موبایل
برای حذف صدای خواننده در Android یا iPhone میتوانید از نسخه موبایل ابزارهای جداسازی Stem استفاده کنید.
فرایند عمومی تقریباً در همه برنامهها مشابه است:
- فایل آهنگ را روی تلفن ذخیره کنید.
- برنامه جداسازی صدا را باز کنید.
- فایل را از حافظه انتخاب کنید.
- حالت Vocal/Instrumental را انتخاب کنید.
- پردازش را شروع کنید.
- پیشنمایش را گوش دهید.
- نسخه بدون خواننده را ذخیره کنید.
نکات مهم در موبایل
- فضای ذخیرهسازی کافی داشته باشید
- از فایل ورودی باکیفیت استفاده کنید
- هنگام بارگذاری از اتصال پایدار استفاده کنید
- پیش از خروجی، هدفون بزنید و نتیجه را دقیق بشنوید
- مسیر ذخیره فایل را به خاطر بسپارید
- فرمت خروجی را براساس کاربرد انتخاب کنید
- فایلهای بزرگ را بیدلیل چند بار بارگذاری نکنید
نسخه iOS سرویس LALAL.AI نیز قابلیت جداسازی Vocals، Instrumental، Drums، Bass و سازهای دیگر را ارائه میدهد. جزئیات آن در صفحه رسمی برنامه iOS قابل مشاهده است.
روش پنجم: حذف صدای خواننده از ویدئو
اگر موسیقی داخل یک ویدئو قرار دارد، بعضی ابزارها فایل ویدئویی را مستقیماً میپذیرند. در غیر این صورت ابتدا صدا را استخراج کنید.
استخراج صدا با FFmpeg
ffmpeg -i input-video.mp4 \
-vn \
-c:a pcm_s16le \
output-audio.wav
در این دستور:
input-video.mp4فایل ویدئویی است-vnتصویر را حذف میکندpcm_s16leصدای غیرفشرده WAV ایجاد میکندoutput-audio.wavفایل خروجی است
سپس فایل WAV را به ابزار Vocal Remover بدهید.
بعد از دریافت نسخه بیکلام، میتوانید آن را دوباره روی ویدئو قرار دهید:
ffmpeg -i input-video.mp4 \
-i instrumental.wav \
-map 0:v:0 \
-map 1:a:0 \
-c:v copy \
-c:a aac \
-shortest \
output-video.mp4
در این مثال، تصویر فایل اصلی حفظ و صدای آن با نسخه Instrumental جایگزین میشود.
پیش از اجرای این مرحله، بررسی کنید طول فایل صوتی و ویدئو با یکدیگر هماهنگ باشند.
روش ششم: حذف وکال با ابزارهای آفلاین
اگر نمیخواهید فایل را در یک سرویس آنلاین بارگذاری کنید یا تعداد زیادی فایل دارید، میتوانید از نرمافزارهای آفلاین جداسازی Stem استفاده کنید.
فرایند عمومی:
نصب ابزار جداسازی
↓
انتخاب مدل
↓
انتخاب فایل ورودی
↓
تعیین تعداد Stemها
↓
پردازش با CPU یا GPU
↓
ذخیره فایلهای خروجی
مزایای پردازش آفلاین:
- فایل روی سیستم شما باقی میماند
- امکان پردازش گروهی وجود دارد
- وابستگی کمتری به سرعت بارگذاری دارید
- میتوانید مدلهای مختلف را امتحان کنید
- برای فایلهای متعدد مناسبتر است
محدودیتها:
- نصب و راهاندازی ممکن است دشوارتر باشد
- پردازش با CPU زمان زیادی میبرد
- مدلهای باکیفیت به RAM یا GPU بیشتری نیاز دارند
- مدیریت فرمتها بر عهده کاربر است
- فضای ذخیرهسازی بیشتری مصرف میشود
برای کاربر عمومی، ابزار آنلاین یا برنامه موبایل سادهتر است. برای تولیدکننده حرفهای و پردازش گروهی، روش آفلاین کنترل بیشتری میدهد.
بهترین تنظیمات برای ساخت کارائوکه
نسخه کارائوکه فقط یک آهنگ با وکال Muteشده نیست. برای ساخت خروجی مناسب باید چند مرحله دیگر را نیز بررسی کنید.
وکال اصلی و همخوان را کنترل کنید
ممکن است ابزار وکال اصلی را حذف کند، اما صدای همخوان، Reverb یا Echo باقی بماند. اگر ابزار قابلیت تفکیک Lead و Backing Vocal دارد، هر دو را بررسی کنید.
بلندی خروجی را تنظیم کنید
پس از حذف وکال، ممکن است Instrumental ضعیفتر یا نامتعادل به نظر برسد. بلندی صدا را کنترل کنید، اما از افزایش بیش از حد Gain خودداری کنید.
ابتدا و انتهای آهنگ را نگه دارید
ابزارهای خودکار گاهی سکوت ابتدا یا انتها را تغییر میدهند. خروجی را با فایل اصلی مقایسه کنید.
متن ترانه را جداگانه آماده کنید
اگر نسخه کارائوکه تصویری میسازید:
- متن را به بندهای کوتاه تقسیم کنید
- زمانبندی را با موسیقی هماهنگ کنید
- از فونت فارسی خوانا استفاده کنید
- متن فعلی و بعدی را متمایز نشان دهید
- کلمات را بیش از حد به لبه تصویر نزدیک نکنید
فرمت خروجی را درست انتخاب کنید
برای تمرین عادی، MP3 باکیفیت ممکن است کافی باشد. برای تدوین، میکس یا پردازش بعدی بهتر است از WAV استفاده کنید.
چگونه کیفیت جداسازی را ارزیابی کنیم؟
فقط چند ثانیه اول خروجی را گوش ندهید. بخشهای مختلف آهنگ را بررسی کنید:
- مقدمه
- اولین Verse
- Chorus
- قسمتهای اوج
- بخش دارای همخوان
- قسمتهای آرام
- پایان آهنگ
نسخه Instrumental را بررسی کنید
به این موارد گوش دهید:
- باقی ماندن کلمات خواننده
- صدای فلزی یا رباتیک
- قطع شدن سازها
- نوسان بلندی
- از بین رفتن Reverb طبیعی
- باقی ماندن همخوان
- ایجاد نویز در فرکانسهای بالا
نسخه Vocal را بررسی کنید
موارد مهم:
- باقی ماندن درام یا ساز
- حذف بخشی از حروف و کلمات
- تغییر رنگ صدا
- قطع شدن نفسها
- ایجاد صدای آبمانند
- باقی ماندن افکتهای Stereo
- ترکیب شدن Vocal با Synth یا Guitar
مقایسه مدلها
یک ابزار ممکن است برای آهنگ پاپ بهتر باشد و ابزار دیگر برای موسیقی زنده نتیجه مناسبتری بدهد. از بخش کوتاهی از آهنگ در چند ابزار Preview بگیرید و سپس بهترین گزینه را برای پردازش کامل انتخاب کنید.
چرا بعد از حذف وکال، صدای خواننده هنوز شنیده میشود؟
Reverb و Delay
افکتهای وکال ممکن است در فضای استریو پخش شده باشند و مدل آنها را بخشی از موسیقی تشخیص دهد.
همخوانها
اگر وکال اصلی و Backing Vocal بهصورت جداگانه تشخیص داده نشوند، بخشی از همخوان در Instrumental باقی میماند.
همپوشانی فرکانسی
صدای انسان و برخی سازها در محدوده فرکانسی مشابه قرار دارند. حذف کامل یکی ممکن است به ساز دیگر آسیب بزند.
استفاده از Chorus و Stereo Widening
افکتهای پهنکننده صدا تشخیص مرکز وکال را دشوار میکنند.
میکس زنده یا غیرمعمول
در اجرای زنده، صدای خواننده از بلندگو وارد میکروفونهای دیگر میشود و در تمام میکس پخش میشود.
مدل نامناسب
مدل دو Stem ممکن است برای یک آهنگ خاص مناسب نباشد. امتحان کردن مدل دیگر یا جداسازی چند Stem میتواند نتیجه را بهتر کند.
روشهای بهتر کردن خروجی
از فایل اصلیتر استفاده کنید
فایل دانلودشده از پیامرسان یا شبکه اجتماعی ممکن است چند بار فشرده شده باشد. در صورت امکان نسخه باکیفیتتر را تهیه کنید.
چند مدل را آزمایش کنید
بهترین مدل برای همه سبکها یکسان نیست. Preview چند سرویس را مقایسه کنید.
تعداد Stem مناسب انتخاب کنید
گاهی حالت دو Stem خروجی تمیزتری ایجاد میکند؛ گاهی تقسیم چندمسیره باعث جداسازی دقیقتر میشود.
پردازش بیش از حد انجام ندهید
Noise Reduction، EQ و فشردهسازی شدید میتوانند Artifactهای جداسازی را برجستهتر کنند.
EQ ملایم استفاده کنید
اگر باقیمانده وکال بیشتر در محدوده خاصی شنیده میشود، کاهش بسیار محدود همان محدوده ممکن است کمک کند. کاهش شدید به سازها نیز آسیب میزند.
بخشهای مشکلدار را جداگانه اصلاح کنید
ممکن است فقط Chorus یا پایان آهنگ مشکل داشته باشد. پردازش محلی بهتر از تغییر کل فایل است.
دو خروجی را ترکیب کنید
در پروژه حرفهای میتوان بهترین بخشهای خروجی دو مدل را با Crossfade ترکیب کرد؛ به شرطی که زمانبندی آنها دقیقاً یکسان باشد.
تفاوت حذف وکال سنتی و هوش مصنوعی
روشهای قدیمی معمولاً بر این فرض تکیه داشتند که صدای خواننده در مرکز میدان استریو قرار دارد. با کم کردن کانال چپ و راست از یکدیگر، بخش مرکزی کاهش پیدا میکرد.
این روش محدودیتهای مهمی داشت:
- سازهای مرکزی نیز حذف میشدند
- وکال دارای Reverb باقی میماند
- در فایل Mono کارایی کمی داشت
- نتیجه معمولاً توخالی میشد
- بیس یا Kick ممکن بود آسیب ببیند
هوش مصنوعی فقط به محل قرارگیری صدا در Stereo وابسته نیست و الگوی صوتی خواننده و سازها را نیز تحلیل میکند. به همین دلیل در بسیاری از فایلها نتیجه طبیعیتری ایجاد میکند.
بااینحال، هوش مصنوعی نیز نمیتواند اطلاعاتی را که در فرایند Mix از بین رفتهاند بهطور کامل بازسازی کند.
ساخت نسخه آکاپلا چیست؟
Acapella یا Vocal Stem فایلی است که تا حد امکان فقط صدای خواننده را نگه میدارد و موسیقی حذف میشود.
کاربردها:
- تمرین خوانندگی
- تحلیل تکنیک آواز
- ساخت زیرنویس دقیقتر
- بررسی هارمونیها
- آموزش تلفظ
- میکس پروژهای که اجازه استفاده از آن را دارید
- کاهش موسیقی برای تبدیل گفتار به متن
برای تهیه آکاپلا:
- فایل را وارد ابزار Stem Separation کنید.
- حالت Vocal/Instrumental را انتخاب کنید.
- خروجی Vocal را Preview کنید.
- بخشهای دارای نشت ساز را بررسی کنید.
- در صورت امکان Lead و Backing Vocal را جدا کنید.
- خروجی WAV بگیرید.
- فقط در صورت نیاز پردازش تکمیلی انجام دهید.
حذف یک ساز بهجای صدای خواننده
Stem Separation فقط برای حذف وکال نیست. نوازندگان میتوانند ساز موردنظر خود را حذف و همراه آهنگ تمرین کنند.
تمرین درام
مسیر Drums را Mute کنید و خودتان روی سایر سازها بنوازید.
تمرین بیس
مسیر Bass را حذف کنید تا خط بیس را اجرا یا بازنویسی کنید.
تمرین گیتار
در صورت پشتیبانی ابزار، Guitar Stem را جدا یا بیصدا کنید.
تمرین پیانو
مسیر Piano را حذف کنید و همراه سایر بخشهای موسیقی تمرین کنید.
تمرین خوانندگی
Vocal را حذف و نسخه Instrumental را با سرعت یا Pitch مناسب تنظیم کنید.
این کاربردها باعث شدهاند ابزارهایی مانند Moises علاوه بر Vocal Remover، امکاناتی مانند تغییر Tempo، Pitch و تشخیص آکورد نیز ارائه دهند.
حذف صدای خواننده برای پادکست و ویدئو
در فایلهای ویدئویی همیشه هدف ساخت کارائوکه نیست. گاهی لازم است گفتار از موسیقی پسزمینه جدا شود.
کاربردهای متداول:
- واضح کردن گفتار مصاحبه
- کاهش موسیقی روی دیالوگ
- استخراج صدای گوینده
- آمادهسازی متن و زیرنویس
- اصلاح صدای ویدئوی آموزشی
- تغییر موسیقی پسزمینه
- بازیابی بهتر مکالمه
در این حالت، ابزار باید برای جداسازی Voice و Background Music مناسب باشد. مدل طراحیشده برای آهنگ استودیویی ممکن است روی مکالمه، صدای محیط و افکت نتیجه متفاوتی ایجاد کند.
پس از جداسازی، صدای گوینده را از نظر Artifact و حذف شدن حروف بررسی کنید؛ بهویژه حروف سایشی و بخشهای آرام جمله.
استفاده از API درواره در گردشکار پردازش موسیقی
درواره زیرساخت API برای دسترسی به مدلهای مختلف هوش مصنوعی است. جداسازی Stem باید با یک مدل یا سرویس تخصصی صوتی انجام شود که این قابلیت را ارائه میدهد.
API درواره میتواند در بخشهای مکمل این فرایند استفاده شود:
- ساخت توضیح و عنوان برای فایلها
- تحلیل گزارش جداسازی
- نامگذاری خودکار Stemها
- ساخت Workflow پردازش
- تولید متن کارائوکه از Transcript
- اصلاح متن فارسی ترانه
- ساخت Metadata خروجی
- ایجاد راهنمای تمرین موسیقی
- تولید کپشن برای انتشار محتوای مجاز
- کنترل ساختار Jobهای پردازش
- تبدیل نتیجه فنی به پاسخ قابلفهم فارسی
معماری پیشنهادی:
آپلود فایل
↓
اعتبارسنجی فرمت و اندازه
↓
استخراج صدا از ویدئو
↓
سرویس تخصصی Stem Separation
↓
Vocal و Instrumental
↓
کنترل کیفیت و استخراج Metadata
↓
تحلیل و تولید اطلاعات مکمل با API درواره
↓
تحویل فایلها به کاربر
نمونه درخواست به API درواره برای تحلیل خروجی
فرض کنید سرویس جداسازی، گزارشی از کیفیت خروجی و اطلاعات فایل تولید کرده است. میتوان از مدل زبانی برای ساخت پیشنهادهای قابلفهم استفاده کرد.
curl https://api.darvareh.ir/v1/chat/completions \
-H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "YOUR_MODEL_ID",
"temperature": 0.2,
"messages": [
{
"role": "system",
"content": "تو دستیار فنی پردازش صدا هستی. براساس گزارش واقعی پیشنهاد بده و قابلیت انجامنشده را ادعا نکن."
},
{
"role": "user",
"content": "یک آهنگ به Vocal و Instrumental جدا شده است. در Chorus مقداری از Backing Vocal داخل Instrumental باقی مانده و در ثانیههای 62 تا 78 صدای فلزی شنیده میشود. برای بهبود خروجی، یک برنامه مرحلهای و محافظهکارانه ارائه بده. پیشنهادها نباید باعث تخریب محسوس سازها شوند."
}
]
}'
در این مثال:
YOUR_DARVAREH_API_KEYبا کلید API درواره جایگزین میشودYOUR_MODEL_IDهمان Model ID انتخابشده از درواره است- مدل فایل را مستقیماً جدا نمیکند و براساس گزارش، پیشنهاد فنی میدهد
- تصمیم نهایی باید با شنیدن خروجی انجام شود
برای مشاهده مدلهای در دسترس، قابلیتها و قیمت بهروز آنها، صفحه مدلهای درواره را بررسی کنید.
نمونه ساخت برنامه تمرین با Python
پس از حذف وکال، میتوانید از یک مدل زبانی برای ساخت برنامه تمرین متناسب با اطلاعات آهنگ استفاده کنید.
import requests
API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"
song_info = {
"duration": "03:42",
"tempo_bpm": 92,
"key": "A minor",
"available_stems": [
"instrumental",
"vocals",
"drums",
"bass"
],
"goal": "تمرین خوانندگی",
"level": "مبتدی"
}
prompt = f"""
براساس اطلاعات زیر یک برنامه تمرین خوانندگی طراحی کن:
{song_info}
شرایط:
- برنامه در 5 مرحله باشد.
- استفاده از نسخه Instrumental و Vocal Stem را توضیح بده.
- سرعت تمرین از آسان به اصلی افزایش پیدا کند.
- پیشنهادهای مبهم ارائه نکن.
- خروجی به زبان فارسی و به شکل جدول باشد.
"""
response = requests.post(
"https://api.darvareh.ir/v1/chat/completions",
headers={
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json",
},
json={
"model": MODEL_ID,
"temperature": 0.3,
"messages": [
{
"role": "system",
"content": "تو دستیار طراحی تمرین موسیقی هستی.",
},
{
"role": "user",
"content": prompt,
},
],
},
timeout=120,
)
response.raise_for_status()
data = response.json()
print(data["choices"][0]["message"]["content"])
این نمونه نشان میدهد که چگونه میتوان خروجی ابزار جداسازی صدا را به یک گردشکار هوشمند بزرگتر متصل کرد.
ساخت سامانه پردازش غیرهمزمان
جداسازی فایلهای طولانی ممکن است زمانبر باشد. بنابراین بهتر است پردازش در یک Job Queue انجام شود.
معماری مناسب:
کاربر فایل را بارگذاری میکند
↓
سرور Job ایجاد میکند
↓
Worker فایل را پردازش میکند
↓
وضعیت Job ذخیره میشود
↓
فایلهای خروجی تولید میشوند
↓
کاربر اعلان یا لینک دریافت میکند
وضعیتهای پیشنهادی:
uploaded
queued
processing
separating
quality_check
completed
failed
در رابط کاربری نیز بهجای نگه داشتن درخواست HTTP برای مدت طولانی، وضعیت Job را بهصورت دورهای بررسی کنید یا پس از پایان پردازش از Webhook استفاده کنید.
نکات فنی برای توسعهدهندگان
اعتبارسنجی فایل
فقط پسوند فایل را بررسی نکنید. MIME Type و ساختار واقعی فایل نیز باید کنترل شوند.
نام فایل امن
برای ذخیره فایل از شناسه تصادفی استفاده کنید و نام اصلی کاربر را مستقیماً در مسیر سیستم قرار ندهید.
محدودیت اندازه و مدت
پیش از آپلود، محدودیت حجم و مدت را به کاربر نمایش دهید.
ذخیرهسازی موقت
فایلهای ورودی و خروجی را فقط بهاندازه لازم نگه دارید و سیاست حذف مشخص داشته باشید.
پردازش مجدد
اگر کاربر همان فایل و تنظیمات را دوباره ارسال کرد، در صورت امکان از نتیجه Cacheشده استفاده کنید.
خروجی قابل پیشبینی
ساختار پوشه و نام Stemها را استاندارد کنید:
job-id/
vocals.wav
instrumental.wav
drums.wav
bass.wav
metadata.json
ثبت خطا
موارد زیر را در Log ثبت کنید:
- فرمت ورودی
- مدت فایل
- مدل انتخابشده
- زمان پردازش
- تعداد Stemها
- وضعیت نهایی
- خطای سرویس
- حجم خروجی
اطلاعات محرمانه یا محتوای کامل فایل نباید بیدلیل وارد Log شود.
کاهش هزینه و زمان پردازش
Preview کوتاه بسازید
پیش از پردازش کامل، یک بخش ۲۰ تا ۳۰ ثانیهای از قسمت دشوار آهنگ را آزمایش کنید.
مدل مناسب انتخاب کنید
اگر فقط Instrumental میخواهید، پردازش ده Stem ممکن است غیرضروری باشد.
فرمت میانی را استاندارد کنید
استفاده از Sample Rate و فرمت مشخص میتواند Workflow را سادهتر کند.
فایل تکراری را تشخیص دهید
با ساخت Hash از فایل میتوان از پردازش دوباره ورودی یکسان جلوگیری کرد.
پردازش را در Worker انجام دهید
Jobهای صوتی را از سرور اصلی وب جدا کنید تا پاسخگویی سایت مختل نشود.
خروجیهای ضروری را نگه دارید
اگر کاربر فقط نسخه بدون خواننده را انتخاب کرده است، نگهداری همه Stemها ممکن است فضای زیادی مصرف کند.
اشتباهات رایج هنگام حذف وکال
استفاده از فایل بیکیفیت
فایل ضعیف باعث افزایش صدای فلزی و باقیماندن وکال میشود.
انتخاب اولین خروجی بدون مقایسه
کیفیت مدلها روی آهنگهای مختلف متفاوت است. Preview را جدی بگیرید.
استفاده از جداسازی چند Stem برای هر پروژه
تعداد بیشتر همیشه به معنی کیفیت بهتر نیست.
اعمال Noise Reduction شدید
کاهش نویز شدید میتواند سازها را مصنوعی و ناپایدار کند.
افزایش بیش از حد صدا
پس از جداسازی ممکن است کاربر برای جبران کاهش بلندی، Gain زیادی اضافه کند و باعث Clipping شود.
انتظار فایل استودیویی کامل
Stem استخراجشده از فایل Mixشده با Multitrack اصلی استودیو برابر نیست.
نادیده گرفتن همخوان
ممکن است وکال اصلی حذف شود، اما Backing Vocal باقی بماند.
خروجی گرفتن مکرر با MP3
هر بار فشردهسازی مجدد میتواند کیفیت را کاهش دهد. برای مراحل میانی از WAV استفاده کنید.
چکلیست کنترل کیفیت نهایی
پیش از استفاده از نسخه بیکلام، این موارد را بررسی کنید:
- فایل ورودی بهترین نسخه در دسترس بوده است
- مدل مناسب انتخاب شده است
- مقدمه و پایان آهنگ کاملاند
- وکال اصلی تا حد قابل قبول حذف شده است
- همخوان بررسی شده است
- سازها قطع یا ضعیف نشدهاند
- صدای فلزی شدید وجود ندارد
- سطح صدا Clipping ندارد
- کانالهای چپ و راست درستاند
- مدت خروجی با فایل اصلی یکسان است
- فرمت خروجی با کاربرد بعدی سازگار است
- فایل نهایی با هدفون و بلندگو آزمایش شده است
- فقط از محتوایی استفاده میشود که اجازه پردازش و استفاده از آن را دارید
پرسشهای متداول
بهترین هوش مصنوعی حذف صدای خواننده چیست؟
کیفیت ابزارها به نوع آهنگ وابسته است. Moises، LALAL.AI و BandLab Splitter از گزینههای شناختهشده هستند. بهتر است یک بخش کوتاه را در چند ابزار آزمایش و سپس بهترین نتیجه را انتخاب کنید.
چگونه یک آهنگ را بیکلام کنیم؟
فایل را در یک ابزار Vocal Remover بارگذاری کنید، حالت جداسازی Vocal و Instrumental را انتخاب کنید و پس از پردازش، فایل Instrumental را دریافت کنید.
آیا حذف صدای خواننده رایگان است؟
بعضی ابزارها امکان آزمایش، Preview یا استفاده محدود رایگان ارائه میدهند. محدودیت مدت، تعداد فایل و کیفیت خروجی ممکن است در هر سرویس متفاوت و متغیر باشد.
آیا میتوان صدای خواننده را از ویدئو حذف کرد؟
بله. بعضی ابزارها فایل ویدئویی را مستقیماً میپذیرند. در روش دیگر، ابتدا صدای ویدئو را استخراج، وکال را جدا و فایل Instrumental را دوباره روی ویدئو قرار میدهید.
آیا میتوان فقط صدای خواننده را استخراج کرد؟
بله. بهجای فایل Instrumental، خروجی Vocal یا Acapella را دریافت کنید.
چرا صدای خواننده کامل حذف نشده است؟
Reverb، Delay، همخوان، میکس استریو، کیفیت پایین فایل و همپوشانی فرکانسی وکال و سازها میتوانند مانع حذف کامل شوند.
آیا میتوان صدای یک ساز را نیز حذف کرد؟
اگر ابزار از جداسازی چند Stem پشتیبانی کند، میتوان مسیرهایی مانند Drums، Bass، Guitar یا Piano را جدا یا Mute کرد.
برای خروجی MP3 بهتر است یا WAV؟
برای شنیدن معمولی، MP3 باکیفیت کافی است. برای تدوین، میکس و پردازش بعدی، WAV انتخاب مناسبتری است.
آیا تبدیل MP3 به WAV کیفیت جداسازی را بالا میبرد؟
تبدیل فرمت، کیفیت ازدسترفته MP3 را بازنمیگرداند. بهتر است از ابتدا باکیفیتترین فایل موجود را استفاده کنید.
آیا درواره مستقیماً Vocal را حذف میکند؟
درواره زیرساخت API مدلهای هوش مصنوعی است. حذف Stem به مدل یا سرویس تخصصی پشتیبانیکننده جداسازی صدا نیاز دارد. از API درواره میتوان برای تحلیل نتایج، اصلاح متن، تولید Metadata و ساخت گردشکار هوشمند پیرامون پردازش صوت استفاده کرد.
جمعبندی
حذف صدای خواننده از آهنگ با هوش مصنوعی، فرایندی در دسترس برای ساخت نسخه بیکلام، کارائوکه، آکاپلا و مسیرهای جداگانه سازها است. ابزارهایی مانند Moises، LALAL.AI و BandLab Splitter میتوانند یک فایل نهایی را به Vocal، Instrumental و Stemهای مختلف تقسیم کنند.
برای رسیدن به نتیجه بهتر:
- از فایل ورودی باکیفیت استفاده کنید
- هدف خود را پیش از جداسازی مشخص کنید
- تعداد Stemهای لازم را انتخاب کنید
- Preview چند ابزار را مقایسه کنید
- تمام قسمتهای آهنگ را بررسی کنید
- از پردازش شدید و غیرضروری خودداری کنید
- برای مراحل تدوین از فرمت باکیفیت استفاده کنید
- انتظار خروجی کاملاً برابر با Multitrack استودیویی نداشته باشید
اگر قصد دارید یک سامانه پردازش صوت، مدیریت Job، تحلیل خروجی یا دستیار هوشمند موسیقی بسازید، میتوانید از API هوش مصنوعی درواره در کنار ابزار تخصصی جداسازی Stem استفاده کنید. برای مشاهده Model IDها، قابلیت مدلها و قیمت بهروز آنها، صفحه مدلهای درواره را ببینید.
مقالات مرتبط
- ساخت آهنگ با هوش مصنوعی؛ معرفی ابزارها و آموزش کامل
- حذف نویز پسزمینه صدا با هوش مصنوعی
- ساخت افکت صوتی با هوش مصنوعی
- تغییر صدا و شبیهسازی صوت با هوش مصنوعی
- ساخت پادکست با هوش مصنوعی
- تبدیل صدای فارسی به متن با هوش مصنوعی
- ویرایش ویدئو با هوش مصنوعی
برای مطالعه شرایط استفاده و محدودیتهای مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.