حذف صدای خواننده از آهنگ با هوش مصنوعی؛ آموزش ساخت نسخه بی‌کلام و کارائوکه

در این راهنمای عملی یاد می‌گیرید چگونه با هوش مصنوعی صدای خواننده را از آهنگ جدا کنید، نسخه بی‌کلام یا کارائوکه بسازید و وکال، درام، بیس و سازها را در فایل‌های مستقل تحویل بگیرید

Share
حذف صدای خواننده از آهنگ با هوش مصنوعی؛ آموزش ساخت نسخه بی‌کلام و کارائوکه

برای حذف صدای خواننده از یک آهنگ، دیگر لازم نیست به فایل‌های چندترک استودیویی دسترسی داشته باشید. ابزارهای جدید هوش مصنوعی می‌توانند یک فایل نهایی مانند MP3 یا WAV را تحلیل و اجزای آن را به مسیرهای جداگانه تقسیم کنند.

این فرایند معمولاً Stem Separation یا Source Separation نامیده می‌شود. در ساده‌ترین حالت، آهنگ به دو بخش تقسیم می‌شود:

  • صدای خواننده یا Vocal
  • موسیقی بدون خواننده یا Instrumental

ابزارهای پیشرفته‌تر می‌توانند بخش‌های بیشتری را جدا کنند:

  • وکال اصلی
  • هم‌خوان یا Backing Vocal
  • درام
  • بیس
  • گیتار
  • پیانو
  • سازهای زهی
  • سازهای بادی
  • سینتی‌سایزر
  • سایر سازها

خروجی این فرایند برای ساخت نسخه کارائوکه، تمرین خوانندگی، تمرین ساز، تولید محتوای ویدئویی، بازسازی پروژه صوتی، تحلیل تنظیم آهنگ و تهیه نسخه آکاپلا کاربرد دارد.

بااین‌حال، نتیجه همیشه کاملاً مشابه فایل اصلی استودیویی نیست. کیفیت جداسازی به نوع موسیقی، کیفیت فایل، افکت‌های صدا، هم‌پوشانی فرکانسی سازها و مدل هوش مصنوعی وابسته است.

در این مقاله، روش حذف صدای خواننده از آهنگ با ابزارهای آنلاین، موبایل و دسکتاپ را به‌صورت مرحله‌به‌مرحله بررسی می‌کنیم. همچنین یاد می‌گیریم چگونه کیفیت خروجی را ارزیابی و خطاهای رایج را اصلاح کنیم.

حذف صدای خواننده چگونه انجام می‌شود؟

یک فایل موسیقی نهایی معمولاً حاصل ترکیب چندین مسیر صوتی است:

وکال اصلی
+ هم‌خوان
+ درام
+ بیس
+ گیتار
+ پیانو
+ افکت‌ها
+ سایر سازها
= فایل نهایی آهنگ

پس از ترکیب یا Mix، تمام این اجزا در یک فایل استریو ذخیره می‌شوند. در حالت عادی، جدا کردن کامل آن‌ها دشوار است؛ زیرا اطلاعات هر بخش به‌صورت مستقل در فایل نهایی نگهداری نمی‌شود.

مدل‌های جداسازی منبع صوتی با بررسی ویژگی‌هایی مانند فرکانس، زمان، هارمونیک، ریتم و الگوی صدای انسان تلاش می‌کنند سهم هر منبع را تخمین بزنند.

فرایند ساده‌شده چنین است:

فایل آهنگ
    ↓
تبدیل صدا به نمایش زمان و فرکانس
    ↓
تحلیل الگوهای وکال و سازها
    ↓
ساخت Mask برای هر منبع
    ↓
بازسازی مسیرهای جداگانه
    ↓
وکال، Instrumental و سایر Stemها

این مدل‌ها صدا را از فایل اصلی «بازیابی کامل» نمی‌کنند؛ بلکه براساس الگوهای آموخته‌شده تخمین می‌زنند کدام قسمت به خواننده و کدام قسمت به سازها تعلق دارد.

به همین دلیل ممکن است در خروجی، بخشی از ساز همراه وکال باقی بماند یا قسمتی از صدای خواننده در نسخه بی‌کلام شنیده شود.

تفاوت Vocal Remover و Stem Separation چیست؟

این دو اصطلاح نزدیک‌اند، اما دقیقاً یک معنی ندارند.

Vocal Remover

هدف اصلی آن حذف یا استخراج صدای خواننده است. خروجی معمولاً دو فایل دارد:

Vocals
Instrumental

این حالت برای ساخت کارائوکه، استخراج صدای خواننده یا تمرین مناسب است.

Stem Separation

فرایند کامل‌تری است که موسیقی را به چند بخش مستقل تقسیم می‌کند.

نمونه جداسازی چهار Stem:

Vocals
Drums
Bass
Other

نمونه جداسازی پیشرفته‌تر:

Lead Vocal
Backing Vocal
Drums
Bass
Guitar
Piano
Synth
Strings
Other

اگر فقط به نسخه بدون خواننده نیاز دارید، جداسازی دو Stem معمولاً کافی است. اگر قصد تمرین ساز، ریمیکس یا تحلیل تنظیم را دارید، جداسازی چند Stem کاربرد بیشتری دارد.

آیا صدای خواننده کاملاً حذف می‌شود؟

در بعضی آهنگ‌ها نتیجه بسیار تمیز است، اما حذف صددرصدی وکال تضمین‌شده نیست.

کیفیت خروجی تحت تأثیر عوامل مختلف قرار می‌گیرد:

  • نوع میکس و مستر
  • کیفیت فایل ورودی
  • استفاده از Reverb و Delay روی وکال
  • وجود هم‌خوان
  • قرار گرفتن وکال در مرکز یا طرفین استریو
  • شباهت فرکانسی صدای خواننده و سازها
  • استفاده از Distortion
  • تعداد خوانندگان
  • فشرده‌سازی شدید فایل
  • اجرای زنده یا استودیویی بودن
  • سبک موسیقی
  • مدل جداسازی انتخاب‌شده

برای مثال، یک وکال واضح در آهنگ پاپ استودیویی ممکن است بهتر از آواز گروهی همراه با Reverb شدید جدا شود.

خروجی‌های مختلف جداسازی صدا

قبل از انتخاب تنظیمات ابزار، باید بدانید به چه خروجی نیاز دارید.

هدفخروجی مناسب
ساخت کارائوکهInstrumental بدون وکال
تمرین خوانندگیInstrumental
استخراج صدای خوانندهVocal یا Acapella
تمرین درامنسخه بدون Drums
تمرین گیتارنسخه بدون Guitar
شنیدن خط بیسBass Stem
تنظیم مجدد موسیقیچند Stem جداگانه
ساخت زیرنویس ترانهVocal Stem تمیز
کاهش گفتار روی موسیقیجداسازی Voice و Music
تحلیل آکورد و ریتمStemهای سازها

اگر فقط یک فایل نهایی لازم دارید، تولید Stemهای زیاد ممکن است زمان پردازش و حجم خروجی را بی‌دلیل افزایش دهد.

بهترین فرمت فایل ورودی چیست؟

برای رسیدن به بهترین کیفیت، از باکیفیت‌ترین نسخه‌ای که در اختیار دارید استفاده کنید.

اولویت پیشنهادی:

  1. WAV یا FLAC با کیفیت اصلی
  2. فایل AAC یا M4A با Bitrate مناسب
  3. فایل MP3 باکیفیت
  4. صدای استخراج‌شده از ویدئو
  5. فایل چندبار فشرده‌شده شبکه‌های اجتماعی

هر بار تبدیل و فشرده‌سازی می‌تواند جزئیات صوتی را کاهش دهد. مدل جداسازی نیز برای تشخیص دقیق منابع به همین جزئیات نیاز دارد.

اگر فایل اصلی MP3 است، تبدیل آن به WAV کیفیت ازدست‌رفته را بازنمی‌گرداند. این تبدیل فقط از فشرده‌سازی مجدد در مراحل بعدی جلوگیری می‌کند.

روش اول: حذف وکال با Moises

Moises یک مجموعه ابزار موسیقی مبتنی بر هوش مصنوعی است که می‌تواند وکال و سازها را جدا کند، صدای بخش‌های مختلف را تغییر دهد و نسخه تمرینی بسازد.

براساس وب‌سایت رسمی Moises، قابلیت Stem Separation این سرویس می‌تواند وکال، سازها و درام را جدا یا بی‌صدا کند. نسخه‌های وب، موبایل و دسکتاپ نیز برای آن ارائه شده‌اند.

مراحل استفاده

  1. وارد وب‌سایت یا برنامه Moises شوید.
  2. فایل آهنگ را بارگذاری کنید.
  3. نوع جداسازی را انتخاب کنید.
  4. برای ساخت نسخه بی‌کلام، حالت جداسازی Vocal و Instrumental را انتخاب کنید.
  5. منتظر پایان پردازش بمانید.
  6. مسیر Vocal را Mute کنید.
  7. خروجی Instrumental را گوش دهید.
  8. در صورت رضایت، فایل را Export کنید.

اگر به سازهای جداگانه نیاز دارید

به‌جای حالت دو Stem، یکی از حالت‌های چندمسیره را انتخاب کنید:

  • Vocals
  • Drums
  • Bass
  • Guitar
  • Piano
  • Other

تعداد مسیرهای قابل انتخاب ممکن است به نسخه برنامه و نوع حساب بستگی داشته باشد؛ بنابراین تنظیمات موجود در زمان استفاده را بررسی کنید.

کاربردهای مناسب Moises

  • ساخت نسخه تمرینی
  • کاهش یا حذف وکال
  • تمرین خوانندگی
  • تمرین ساز
  • تغییر سرعت آهنگ
  • تغییر Pitch
  • تشخیص آکورد
  • تنظیم صدای Stemها
  • ساخت Backing Track

روش دوم: حذف صدای خواننده با LALAL.AI

LALAL.AI ابزاری تخصصی برای جداسازی وکال و سازها از فایل صوتی یا ویدئویی است.

طبق صفحه رسمی Stem Splitter در LALAL.AI، این سرویس امکان جداسازی وکال، درام، بیس، گیتار، سینتی‌سایزر، سازهای زهی و بادی را ارائه می‌دهد و از فرمت‌های رایجی مانند MP3، WAV، FLAC، AAC، M4A و MP4 پشتیبانی می‌کند.

مراحل استفاده

  1. وارد LALAL.AI شوید.
  2. نوع Stem موردنظر را انتخاب کنید.
  3. فایل صوتی یا ویدئویی را بارگذاری کنید.
  4. منتظر آماده شدن Preview بمانید.
  5. نسخه Vocal و Instrumental را جداگانه گوش دهید.
  6. اگر نتیجه مناسب نبود، مدل جداسازی یا تنظیمات را تغییر دهید.
  7. پردازش کامل را انجام دهید.
  8. فایل‌های موردنیاز را دانلود کنید.

جداسازی وکال اصلی و هم‌خوان

در بعضی آهنگ‌ها حذف صدای خواننده اصلی کافی نیست؛ زیرا هم‌خوان‌ها در نسخه Instrumental باقی می‌مانند. LALAL.AI قابلیت جداسازی Lead Vocal و Backing Vocal را نیز برای برخی حالت‌ها ارائه می‌دهد.

این ویژگی برای موارد زیر مفید است:

  • استخراج آکاپلای خواننده اصلی
  • تمرین هم‌خوانی
  • ساخت نسخه کارائوکه تمیزتر
  • بررسی هارمونی‌های صوتی
  • تنظیم مجدد وکال‌ها

نسخه دسکتاپ

نسخه دسکتاپ این سرویس نیز برای جداسازی وکال، Instrumental و سازهای مختلف ارائه شده است. اطلاعات قابلیت‌های فعلی آن در صفحه رسمی LALAL.AI Desktop قابل مشاهده است.

روش سوم: ساخت نسخه بی‌کلام با BandLab Splitter

BandLab Splitter امکان تقسیم فایل موسیقی به بخش‌های مستقل را فراهم می‌کند.

براساس آموزش رسمی BandLab، پس از بارگذاری فایل می‌توانید Stemهای جداشده را در Player کنترل کنید، مسیر Vocal را بی‌صدا کنید و خروجی جدید بگیرید.

مراحل استفاده

  1. ابزار Splitter را باز کنید.
  2. فایل آهنگ یا ویدئو را وارد کنید.
  3. منتظر پایان جداسازی بمانید.
  4. مسیر Vocal را پیدا کنید.
  5. آن را Mute کنید.
  6. نسخه بدون خواننده را گوش دهید.
  7. در صورت نیاز، مسیرها را وارد محیط Studio کنید.
  8. فایل نهایی را Export کنید.

این روش برای کاربرانی مناسب است که می‌خواهند بعد از جداسازی، تنظیمات بیشتری روی پروژه انجام دهند یا صدای خود را روی موسیقی ضبط کنند.

روش چهارم: حذف وکال در موبایل

برای حذف صدای خواننده در Android یا iPhone می‌توانید از نسخه موبایل ابزارهای جداسازی Stem استفاده کنید.

فرایند عمومی تقریباً در همه برنامه‌ها مشابه است:

  1. فایل آهنگ را روی تلفن ذخیره کنید.
  2. برنامه جداسازی صدا را باز کنید.
  3. فایل را از حافظه انتخاب کنید.
  4. حالت Vocal/Instrumental را انتخاب کنید.
  5. پردازش را شروع کنید.
  6. پیش‌نمایش را گوش دهید.
  7. نسخه بدون خواننده را ذخیره کنید.

نکات مهم در موبایل

  • فضای ذخیره‌سازی کافی داشته باشید
  • از فایل ورودی باکیفیت استفاده کنید
  • هنگام بارگذاری از اتصال پایدار استفاده کنید
  • پیش از خروجی، هدفون بزنید و نتیجه را دقیق بشنوید
  • مسیر ذخیره فایل را به خاطر بسپارید
  • فرمت خروجی را براساس کاربرد انتخاب کنید
  • فایل‌های بزرگ را بی‌دلیل چند بار بارگذاری نکنید

نسخه iOS سرویس LALAL.AI نیز قابلیت جداسازی Vocals، Instrumental، Drums، Bass و سازهای دیگر را ارائه می‌دهد. جزئیات آن در صفحه رسمی برنامه iOS قابل مشاهده است.

روش پنجم: حذف صدای خواننده از ویدئو

اگر موسیقی داخل یک ویدئو قرار دارد، بعضی ابزارها فایل ویدئویی را مستقیماً می‌پذیرند. در غیر این صورت ابتدا صدا را استخراج کنید.

استخراج صدا با FFmpeg

ffmpeg -i input-video.mp4 \
-vn \
-c:a pcm_s16le \
output-audio.wav

در این دستور:

  • input-video.mp4 فایل ویدئویی است
  • -vn تصویر را حذف می‌کند
  • pcm_s16le صدای غیرفشرده WAV ایجاد می‌کند
  • output-audio.wav فایل خروجی است

سپس فایل WAV را به ابزار Vocal Remover بدهید.

بعد از دریافت نسخه بی‌کلام، می‌توانید آن را دوباره روی ویدئو قرار دهید:

ffmpeg -i input-video.mp4 \
-i instrumental.wav \
-map 0:v:0 \
-map 1:a:0 \
-c:v copy \
-c:a aac \
-shortest \
output-video.mp4

در این مثال، تصویر فایل اصلی حفظ و صدای آن با نسخه Instrumental جایگزین می‌شود.

پیش از اجرای این مرحله، بررسی کنید طول فایل صوتی و ویدئو با یکدیگر هماهنگ باشند.

روش ششم: حذف وکال با ابزارهای آفلاین

اگر نمی‌خواهید فایل را در یک سرویس آنلاین بارگذاری کنید یا تعداد زیادی فایل دارید، می‌توانید از نرم‌افزارهای آفلاین جداسازی Stem استفاده کنید.

فرایند عمومی:

نصب ابزار جداسازی
    ↓
انتخاب مدل
    ↓
انتخاب فایل ورودی
    ↓
تعیین تعداد Stemها
    ↓
پردازش با CPU یا GPU
    ↓
ذخیره فایل‌های خروجی

مزایای پردازش آفلاین:

  • فایل روی سیستم شما باقی می‌ماند
  • امکان پردازش گروهی وجود دارد
  • وابستگی کمتری به سرعت بارگذاری دارید
  • می‌توانید مدل‌های مختلف را امتحان کنید
  • برای فایل‌های متعدد مناسب‌تر است

محدودیت‌ها:

  • نصب و راه‌اندازی ممکن است دشوارتر باشد
  • پردازش با CPU زمان زیادی می‌برد
  • مدل‌های باکیفیت به RAM یا GPU بیشتری نیاز دارند
  • مدیریت فرمت‌ها بر عهده کاربر است
  • فضای ذخیره‌سازی بیشتری مصرف می‌شود

برای کاربر عمومی، ابزار آنلاین یا برنامه موبایل ساده‌تر است. برای تولیدکننده حرفه‌ای و پردازش گروهی، روش آفلاین کنترل بیشتری می‌دهد.

بهترین تنظیمات برای ساخت کارائوکه

نسخه کارائوکه فقط یک آهنگ با وکال Muteشده نیست. برای ساخت خروجی مناسب باید چند مرحله دیگر را نیز بررسی کنید.

وکال اصلی و هم‌خوان را کنترل کنید

ممکن است ابزار وکال اصلی را حذف کند، اما صدای هم‌خوان، Reverb یا Echo باقی بماند. اگر ابزار قابلیت تفکیک Lead و Backing Vocal دارد، هر دو را بررسی کنید.

بلندی خروجی را تنظیم کنید

پس از حذف وکال، ممکن است Instrumental ضعیف‌تر یا نامتعادل به نظر برسد. بلندی صدا را کنترل کنید، اما از افزایش بیش از حد Gain خودداری کنید.

ابتدا و انتهای آهنگ را نگه دارید

ابزارهای خودکار گاهی سکوت ابتدا یا انتها را تغییر می‌دهند. خروجی را با فایل اصلی مقایسه کنید.

متن ترانه را جداگانه آماده کنید

اگر نسخه کارائوکه تصویری می‌سازید:

  • متن را به بندهای کوتاه تقسیم کنید
  • زمان‌بندی را با موسیقی هماهنگ کنید
  • از فونت فارسی خوانا استفاده کنید
  • متن فعلی و بعدی را متمایز نشان دهید
  • کلمات را بیش از حد به لبه تصویر نزدیک نکنید

فرمت خروجی را درست انتخاب کنید

برای تمرین عادی، MP3 باکیفیت ممکن است کافی باشد. برای تدوین، میکس یا پردازش بعدی بهتر است از WAV استفاده کنید.

چگونه کیفیت جداسازی را ارزیابی کنیم؟

فقط چند ثانیه اول خروجی را گوش ندهید. بخش‌های مختلف آهنگ را بررسی کنید:

  • مقدمه
  • اولین Verse
  • Chorus
  • قسمت‌های اوج
  • بخش دارای هم‌خوان
  • قسمت‌های آرام
  • پایان آهنگ

نسخه Instrumental را بررسی کنید

به این موارد گوش دهید:

  • باقی ماندن کلمات خواننده
  • صدای فلزی یا رباتیک
  • قطع شدن سازها
  • نوسان بلندی
  • از بین رفتن Reverb طبیعی
  • باقی ماندن هم‌خوان
  • ایجاد نویز در فرکانس‌های بالا

نسخه Vocal را بررسی کنید

موارد مهم:

  • باقی ماندن درام یا ساز
  • حذف بخشی از حروف و کلمات
  • تغییر رنگ صدا
  • قطع شدن نفس‌ها
  • ایجاد صدای آب‌مانند
  • باقی ماندن افکت‌های Stereo
  • ترکیب شدن Vocal با Synth یا Guitar

مقایسه مدل‌ها

یک ابزار ممکن است برای آهنگ پاپ بهتر باشد و ابزار دیگر برای موسیقی زنده نتیجه مناسب‌تری بدهد. از بخش کوتاهی از آهنگ در چند ابزار Preview بگیرید و سپس بهترین گزینه را برای پردازش کامل انتخاب کنید.

چرا بعد از حذف وکال، صدای خواننده هنوز شنیده می‌شود؟

Reverb و Delay

افکت‌های وکال ممکن است در فضای استریو پخش شده باشند و مدل آن‌ها را بخشی از موسیقی تشخیص دهد.

هم‌خوان‌ها

اگر وکال اصلی و Backing Vocal به‌صورت جداگانه تشخیص داده نشوند، بخشی از هم‌خوان در Instrumental باقی می‌ماند.

هم‌پوشانی فرکانسی

صدای انسان و برخی سازها در محدوده فرکانسی مشابه قرار دارند. حذف کامل یکی ممکن است به ساز دیگر آسیب بزند.

استفاده از Chorus و Stereo Widening

افکت‌های پهن‌کننده صدا تشخیص مرکز وکال را دشوار می‌کنند.

میکس زنده یا غیرمعمول

در اجرای زنده، صدای خواننده از بلندگو وارد میکروفون‌های دیگر می‌شود و در تمام میکس پخش می‌شود.

مدل نامناسب

مدل دو Stem ممکن است برای یک آهنگ خاص مناسب نباشد. امتحان کردن مدل دیگر یا جداسازی چند Stem می‌تواند نتیجه را بهتر کند.

روش‌های بهتر کردن خروجی

از فایل اصلی‌تر استفاده کنید

فایل دانلودشده از پیام‌رسان یا شبکه اجتماعی ممکن است چند بار فشرده شده باشد. در صورت امکان نسخه باکیفیت‌تر را تهیه کنید.

چند مدل را آزمایش کنید

بهترین مدل برای همه سبک‌ها یکسان نیست. Preview چند سرویس را مقایسه کنید.

تعداد Stem مناسب انتخاب کنید

گاهی حالت دو Stem خروجی تمیزتری ایجاد می‌کند؛ گاهی تقسیم چندمسیره باعث جداسازی دقیق‌تر می‌شود.

پردازش بیش از حد انجام ندهید

Noise Reduction، EQ و فشرده‌سازی شدید می‌توانند Artifactهای جداسازی را برجسته‌تر کنند.

EQ ملایم استفاده کنید

اگر باقی‌مانده وکال بیشتر در محدوده خاصی شنیده می‌شود، کاهش بسیار محدود همان محدوده ممکن است کمک کند. کاهش شدید به سازها نیز آسیب می‌زند.

بخش‌های مشکل‌دار را جداگانه اصلاح کنید

ممکن است فقط Chorus یا پایان آهنگ مشکل داشته باشد. پردازش محلی بهتر از تغییر کل فایل است.

دو خروجی را ترکیب کنید

در پروژه حرفه‌ای می‌توان بهترین بخش‌های خروجی دو مدل را با Crossfade ترکیب کرد؛ به شرطی که زمان‌بندی آن‌ها دقیقاً یکسان باشد.

تفاوت حذف وکال سنتی و هوش مصنوعی

روش‌های قدیمی معمولاً بر این فرض تکیه داشتند که صدای خواننده در مرکز میدان استریو قرار دارد. با کم کردن کانال چپ و راست از یکدیگر، بخش مرکزی کاهش پیدا می‌کرد.

این روش محدودیت‌های مهمی داشت:

  • سازهای مرکزی نیز حذف می‌شدند
  • وکال دارای Reverb باقی می‌ماند
  • در فایل Mono کارایی کمی داشت
  • نتیجه معمولاً توخالی می‌شد
  • بیس یا Kick ممکن بود آسیب ببیند

هوش مصنوعی فقط به محل قرارگیری صدا در Stereo وابسته نیست و الگوی صوتی خواننده و سازها را نیز تحلیل می‌کند. به همین دلیل در بسیاری از فایل‌ها نتیجه طبیعی‌تری ایجاد می‌کند.

بااین‌حال، هوش مصنوعی نیز نمی‌تواند اطلاعاتی را که در فرایند Mix از بین رفته‌اند به‌طور کامل بازسازی کند.

ساخت نسخه آکاپلا چیست؟

Acapella یا Vocal Stem فایلی است که تا حد امکان فقط صدای خواننده را نگه می‌دارد و موسیقی حذف می‌شود.

کاربردها:

  • تمرین خوانندگی
  • تحلیل تکنیک آواز
  • ساخت زیرنویس دقیق‌تر
  • بررسی هارمونی‌ها
  • آموزش تلفظ
  • میکس پروژه‌ای که اجازه استفاده از آن را دارید
  • کاهش موسیقی برای تبدیل گفتار به متن

برای تهیه آکاپلا:

  1. فایل را وارد ابزار Stem Separation کنید.
  2. حالت Vocal/Instrumental را انتخاب کنید.
  3. خروجی Vocal را Preview کنید.
  4. بخش‌های دارای نشت ساز را بررسی کنید.
  5. در صورت امکان Lead و Backing Vocal را جدا کنید.
  6. خروجی WAV بگیرید.
  7. فقط در صورت نیاز پردازش تکمیلی انجام دهید.

حذف یک ساز به‌جای صدای خواننده

Stem Separation فقط برای حذف وکال نیست. نوازندگان می‌توانند ساز موردنظر خود را حذف و همراه آهنگ تمرین کنند.

تمرین درام

مسیر Drums را Mute کنید و خودتان روی سایر سازها بنوازید.

تمرین بیس

مسیر Bass را حذف کنید تا خط بیس را اجرا یا بازنویسی کنید.

تمرین گیتار

در صورت پشتیبانی ابزار، Guitar Stem را جدا یا بی‌صدا کنید.

تمرین پیانو

مسیر Piano را حذف کنید و همراه سایر بخش‌های موسیقی تمرین کنید.

تمرین خوانندگی

Vocal را حذف و نسخه Instrumental را با سرعت یا Pitch مناسب تنظیم کنید.

این کاربردها باعث شده‌اند ابزارهایی مانند Moises علاوه بر Vocal Remover، امکاناتی مانند تغییر Tempo، Pitch و تشخیص آکورد نیز ارائه دهند.

حذف صدای خواننده برای پادکست و ویدئو

در فایل‌های ویدئویی همیشه هدف ساخت کارائوکه نیست. گاهی لازم است گفتار از موسیقی پس‌زمینه جدا شود.

کاربردهای متداول:

  • واضح کردن گفتار مصاحبه
  • کاهش موسیقی روی دیالوگ
  • استخراج صدای گوینده
  • آماده‌سازی متن و زیرنویس
  • اصلاح صدای ویدئوی آموزشی
  • تغییر موسیقی پس‌زمینه
  • بازیابی بهتر مکالمه

در این حالت، ابزار باید برای جداسازی Voice و Background Music مناسب باشد. مدل طراحی‌شده برای آهنگ استودیویی ممکن است روی مکالمه، صدای محیط و افکت نتیجه متفاوتی ایجاد کند.

پس از جداسازی، صدای گوینده را از نظر Artifact و حذف شدن حروف بررسی کنید؛ به‌ویژه حروف سایشی و بخش‌های آرام جمله.

استفاده از API درواره در گردش‌کار پردازش موسیقی

درواره زیرساخت API برای دسترسی به مدل‌های مختلف هوش مصنوعی است. جداسازی Stem باید با یک مدل یا سرویس تخصصی صوتی انجام شود که این قابلیت را ارائه می‌دهد.

API درواره می‌تواند در بخش‌های مکمل این فرایند استفاده شود:

  • ساخت توضیح و عنوان برای فایل‌ها
  • تحلیل گزارش جداسازی
  • نام‌گذاری خودکار Stemها
  • ساخت Workflow پردازش
  • تولید متن کارائوکه از Transcript
  • اصلاح متن فارسی ترانه
  • ساخت Metadata خروجی
  • ایجاد راهنمای تمرین موسیقی
  • تولید کپشن برای انتشار محتوای مجاز
  • کنترل ساختار Jobهای پردازش
  • تبدیل نتیجه فنی به پاسخ قابل‌فهم فارسی

معماری پیشنهادی:

آپلود فایل
    ↓
اعتبارسنجی فرمت و اندازه
    ↓
استخراج صدا از ویدئو
    ↓
سرویس تخصصی Stem Separation
    ↓
Vocal و Instrumental
    ↓
کنترل کیفیت و استخراج Metadata
    ↓
تحلیل و تولید اطلاعات مکمل با API درواره
    ↓
تحویل فایل‌ها به کاربر

نمونه درخواست به API درواره برای تحلیل خروجی

فرض کنید سرویس جداسازی، گزارشی از کیفیت خروجی و اطلاعات فایل تولید کرده است. می‌توان از مدل زبانی برای ساخت پیشنهادهای قابل‌فهم استفاده کرد.

curl https://api.darvareh.ir/v1/chat/completions \
  -H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_MODEL_ID",
    "temperature": 0.2,
    "messages": [
      {
        "role": "system",
        "content": "تو دستیار فنی پردازش صدا هستی. براساس گزارش واقعی پیشنهاد بده و قابلیت انجام‌نشده را ادعا نکن."
      },
      {
        "role": "user",
        "content": "یک آهنگ به Vocal و Instrumental جدا شده است. در Chorus مقداری از Backing Vocal داخل Instrumental باقی مانده و در ثانیه‌های 62 تا 78 صدای فلزی شنیده می‌شود. برای بهبود خروجی، یک برنامه مرحله‌ای و محافظه‌کارانه ارائه بده. پیشنهادها نباید باعث تخریب محسوس سازها شوند."
      }
    ]
  }'

در این مثال:

  • YOUR_DARVAREH_API_KEY با کلید API درواره جایگزین می‌شود
  • YOUR_MODEL_ID همان Model ID انتخاب‌شده از درواره است
  • مدل فایل را مستقیماً جدا نمی‌کند و براساس گزارش، پیشنهاد فنی می‌دهد
  • تصمیم نهایی باید با شنیدن خروجی انجام شود

برای مشاهده مدل‌های در دسترس، قابلیت‌ها و قیمت به‌روز آن‌ها، صفحه مدل‌های درواره را بررسی کنید.

نمونه ساخت برنامه تمرین با Python

پس از حذف وکال، می‌توانید از یک مدل زبانی برای ساخت برنامه تمرین متناسب با اطلاعات آهنگ استفاده کنید.

import requests

API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"

song_info = {
    "duration": "03:42",
    "tempo_bpm": 92,
    "key": "A minor",
    "available_stems": [
        "instrumental",
        "vocals",
        "drums",
        "bass"
    ],
    "goal": "تمرین خوانندگی",
    "level": "مبتدی"
}

prompt = f"""
براساس اطلاعات زیر یک برنامه تمرین خوانندگی طراحی کن:

{song_info}

شرایط:
- برنامه در 5 مرحله باشد.
- استفاده از نسخه Instrumental و Vocal Stem را توضیح بده.
- سرعت تمرین از آسان به اصلی افزایش پیدا کند.
- پیشنهادهای مبهم ارائه نکن.
- خروجی به زبان فارسی و به شکل جدول باشد.
"""

response = requests.post(
    "https://api.darvareh.ir/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json",
    },
    json={
        "model": MODEL_ID,
        "temperature": 0.3,
        "messages": [
            {
                "role": "system",
                "content": "تو دستیار طراحی تمرین موسیقی هستی.",
            },
            {
                "role": "user",
                "content": prompt,
            },
        ],
    },
    timeout=120,
)

response.raise_for_status()
data = response.json()

print(data["choices"][0]["message"]["content"])

این نمونه نشان می‌دهد که چگونه می‌توان خروجی ابزار جداسازی صدا را به یک گردش‌کار هوشمند بزرگ‌تر متصل کرد.

ساخت سامانه پردازش غیرهم‌زمان

جداسازی فایل‌های طولانی ممکن است زمان‌بر باشد. بنابراین بهتر است پردازش در یک Job Queue انجام شود.

معماری مناسب:

کاربر فایل را بارگذاری می‌کند
    ↓
سرور Job ایجاد می‌کند
    ↓
Worker فایل را پردازش می‌کند
    ↓
وضعیت Job ذخیره می‌شود
    ↓
فایل‌های خروجی تولید می‌شوند
    ↓
کاربر اعلان یا لینک دریافت می‌کند

وضعیت‌های پیشنهادی:

uploaded
queued
processing
separating
quality_check
completed
failed

در رابط کاربری نیز به‌جای نگه داشتن درخواست HTTP برای مدت طولانی، وضعیت Job را به‌صورت دوره‌ای بررسی کنید یا پس از پایان پردازش از Webhook استفاده کنید.

نکات فنی برای توسعه‌دهندگان

اعتبارسنجی فایل

فقط پسوند فایل را بررسی نکنید. MIME Type و ساختار واقعی فایل نیز باید کنترل شوند.

نام فایل امن

برای ذخیره فایل از شناسه تصادفی استفاده کنید و نام اصلی کاربر را مستقیماً در مسیر سیستم قرار ندهید.

محدودیت اندازه و مدت

پیش از آپلود، محدودیت حجم و مدت را به کاربر نمایش دهید.

ذخیره‌سازی موقت

فایل‌های ورودی و خروجی را فقط به‌اندازه لازم نگه دارید و سیاست حذف مشخص داشته باشید.

پردازش مجدد

اگر کاربر همان فایل و تنظیمات را دوباره ارسال کرد، در صورت امکان از نتیجه Cacheشده استفاده کنید.

خروجی قابل پیش‌بینی

ساختار پوشه و نام Stemها را استاندارد کنید:

job-id/
  vocals.wav
  instrumental.wav
  drums.wav
  bass.wav
  metadata.json

ثبت خطا

موارد زیر را در Log ثبت کنید:

  • فرمت ورودی
  • مدت فایل
  • مدل انتخاب‌شده
  • زمان پردازش
  • تعداد Stemها
  • وضعیت نهایی
  • خطای سرویس
  • حجم خروجی

اطلاعات محرمانه یا محتوای کامل فایل نباید بی‌دلیل وارد Log شود.

کاهش هزینه و زمان پردازش

Preview کوتاه بسازید

پیش از پردازش کامل، یک بخش ۲۰ تا ۳۰ ثانیه‌ای از قسمت دشوار آهنگ را آزمایش کنید.

مدل مناسب انتخاب کنید

اگر فقط Instrumental می‌خواهید، پردازش ده Stem ممکن است غیرضروری باشد.

فرمت میانی را استاندارد کنید

استفاده از Sample Rate و فرمت مشخص می‌تواند Workflow را ساده‌تر کند.

فایل تکراری را تشخیص دهید

با ساخت Hash از فایل می‌توان از پردازش دوباره ورودی یکسان جلوگیری کرد.

پردازش را در Worker انجام دهید

Jobهای صوتی را از سرور اصلی وب جدا کنید تا پاسخ‌گویی سایت مختل نشود.

خروجی‌های ضروری را نگه دارید

اگر کاربر فقط نسخه بدون خواننده را انتخاب کرده است، نگهداری همه Stemها ممکن است فضای زیادی مصرف کند.

اشتباهات رایج هنگام حذف وکال

استفاده از فایل بی‌کیفیت

فایل ضعیف باعث افزایش صدای فلزی و باقی‌ماندن وکال می‌شود.

انتخاب اولین خروجی بدون مقایسه

کیفیت مدل‌ها روی آهنگ‌های مختلف متفاوت است. Preview را جدی بگیرید.

استفاده از جداسازی چند Stem برای هر پروژه

تعداد بیشتر همیشه به معنی کیفیت بهتر نیست.

اعمال Noise Reduction شدید

کاهش نویز شدید می‌تواند سازها را مصنوعی و ناپایدار کند.

افزایش بیش از حد صدا

پس از جداسازی ممکن است کاربر برای جبران کاهش بلندی، Gain زیادی اضافه کند و باعث Clipping شود.

انتظار فایل استودیویی کامل

Stem استخراج‌شده از فایل Mixشده با Multitrack اصلی استودیو برابر نیست.

نادیده گرفتن هم‌خوان

ممکن است وکال اصلی حذف شود، اما Backing Vocal باقی بماند.

خروجی گرفتن مکرر با MP3

هر بار فشرده‌سازی مجدد می‌تواند کیفیت را کاهش دهد. برای مراحل میانی از WAV استفاده کنید.

چک‌لیست کنترل کیفیت نهایی

پیش از استفاده از نسخه بی‌کلام، این موارد را بررسی کنید:

  • فایل ورودی بهترین نسخه در دسترس بوده است
  • مدل مناسب انتخاب شده است
  • مقدمه و پایان آهنگ کامل‌اند
  • وکال اصلی تا حد قابل قبول حذف شده است
  • هم‌خوان بررسی شده است
  • سازها قطع یا ضعیف نشده‌اند
  • صدای فلزی شدید وجود ندارد
  • سطح صدا Clipping ندارد
  • کانال‌های چپ و راست درست‌اند
  • مدت خروجی با فایل اصلی یکسان است
  • فرمت خروجی با کاربرد بعدی سازگار است
  • فایل نهایی با هدفون و بلندگو آزمایش شده است
  • فقط از محتوایی استفاده می‌شود که اجازه پردازش و استفاده از آن را دارید

پرسش‌های متداول

بهترین هوش مصنوعی حذف صدای خواننده چیست؟

کیفیت ابزارها به نوع آهنگ وابسته است. Moises، LALAL.AI و BandLab Splitter از گزینه‌های شناخته‌شده هستند. بهتر است یک بخش کوتاه را در چند ابزار آزمایش و سپس بهترین نتیجه را انتخاب کنید.

چگونه یک آهنگ را بی‌کلام کنیم؟

فایل را در یک ابزار Vocal Remover بارگذاری کنید، حالت جداسازی Vocal و Instrumental را انتخاب کنید و پس از پردازش، فایل Instrumental را دریافت کنید.

آیا حذف صدای خواننده رایگان است؟

بعضی ابزارها امکان آزمایش، Preview یا استفاده محدود رایگان ارائه می‌دهند. محدودیت مدت، تعداد فایل و کیفیت خروجی ممکن است در هر سرویس متفاوت و متغیر باشد.

آیا می‌توان صدای خواننده را از ویدئو حذف کرد؟

بله. بعضی ابزارها فایل ویدئویی را مستقیماً می‌پذیرند. در روش دیگر، ابتدا صدای ویدئو را استخراج، وکال را جدا و فایل Instrumental را دوباره روی ویدئو قرار می‌دهید.

آیا می‌توان فقط صدای خواننده را استخراج کرد؟

بله. به‌جای فایل Instrumental، خروجی Vocal یا Acapella را دریافت کنید.

چرا صدای خواننده کامل حذف نشده است؟

Reverb، Delay، هم‌خوان، میکس استریو، کیفیت پایین فایل و هم‌پوشانی فرکانسی وکال و سازها می‌توانند مانع حذف کامل شوند.

آیا می‌توان صدای یک ساز را نیز حذف کرد؟

اگر ابزار از جداسازی چند Stem پشتیبانی کند، می‌توان مسیرهایی مانند Drums، Bass، Guitar یا Piano را جدا یا Mute کرد.

برای خروجی MP3 بهتر است یا WAV؟

برای شنیدن معمولی، MP3 باکیفیت کافی است. برای تدوین، میکس و پردازش بعدی، WAV انتخاب مناسب‌تری است.

آیا تبدیل MP3 به WAV کیفیت جداسازی را بالا می‌برد؟

تبدیل فرمت، کیفیت ازدست‌رفته MP3 را بازنمی‌گرداند. بهتر است از ابتدا باکیفیت‌ترین فایل موجود را استفاده کنید.

آیا درواره مستقیماً Vocal را حذف می‌کند؟

درواره زیرساخت API مدل‌های هوش مصنوعی است. حذف Stem به مدل یا سرویس تخصصی پشتیبانی‌کننده جداسازی صدا نیاز دارد. از API درواره می‌توان برای تحلیل نتایج، اصلاح متن، تولید Metadata و ساخت گردش‌کار هوشمند پیرامون پردازش صوت استفاده کرد.

جمع‌بندی

حذف صدای خواننده از آهنگ با هوش مصنوعی، فرایندی در دسترس برای ساخت نسخه بی‌کلام، کارائوکه، آکاپلا و مسیرهای جداگانه سازها است. ابزارهایی مانند Moises، LALAL.AI و BandLab Splitter می‌توانند یک فایل نهایی را به Vocal، Instrumental و Stemهای مختلف تقسیم کنند.

برای رسیدن به نتیجه بهتر:

  • از فایل ورودی باکیفیت استفاده کنید
  • هدف خود را پیش از جداسازی مشخص کنید
  • تعداد Stemهای لازم را انتخاب کنید
  • Preview چند ابزار را مقایسه کنید
  • تمام قسمت‌های آهنگ را بررسی کنید
  • از پردازش شدید و غیرضروری خودداری کنید
  • برای مراحل تدوین از فرمت باکیفیت استفاده کنید
  • انتظار خروجی کاملاً برابر با Multitrack استودیویی نداشته باشید

اگر قصد دارید یک سامانه پردازش صوت، مدیریت Job، تحلیل خروجی یا دستیار هوشمند موسیقی بسازید، می‌توانید از API هوش مصنوعی درواره در کنار ابزار تخصصی جداسازی Stem استفاده کنید. برای مشاهده Model IDها، قابلیت مدل‌ها و قیمت به‌روز آن‌ها، صفحه مدل‌های درواره را ببینید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.