تغییر صدا با هوش مصنوعی؛ آموزش کامل AI Voice Changer و شبیه‌سازی صدا

در این راهنمای جامع، تغییر صدا با هوش مصنوعی، Voice Changer، کلون صدا و Speech-to-Speech را یاد می‌گیرید و با ابزارها، تنظیمات حرفه‌ای، ملاحظات امنیتی و روش اتصال آن به API آشنا می‌شوید.

Share
Voice Cloning with Darvareh
Voice Cloning with Darvareh

مقدمه

تغییر صدا با هوش مصنوعی یا AI Voice Changer دیگر فقط یک افکت سرگرم‌کننده برای تغییر صدای مرد به زن یا ساخت صدای رباتی نیست. مدل‌های صوتی جدید می‌توانند لحن، احساس، ریتم، مکث، شدت بیان و حتی بعضی جزئیات اجرای گوینده را حفظ کنند و در همان حال، هویت صوتی او را تغییر دهند.

این فناوری در تولید پادکست، دوبله، بازی‌سازی، آموزش آنلاین، ساخت ویدئو، شخصیت‌پردازی، دسترس‌پذیری و تولید محتوای چندزبانه کاربرد دارد. توسعه‌دهندگان نیز می‌توانند با استفاده از API هوش مصنوعی، قابلیت تغییر صدا را به وب‌سایت، اپلیکیشن، مرکز تماس یا خط تولید محتوای خود اضافه کنند.

بااین‌حال، شبیه‌سازی صدا با مسائل مهمی مانند رضایت صاحب صدا، جعل هویت، کلاهبرداری صوتی و حفاظت از داده‌های بیومتریک همراه است. بنابراین باید هم بخش فنی و هم الزامات امنیتی و اخلاقی آن را جدی گرفت.

در این مقاله، تفاوت Voice Changer با تبدیل متن به گفتار، روش آماده‌سازی صدا، تنظیم مدل، پردازش فایل، معماری API و نکات امنیتی را بررسی می‌کنیم.

تغییر صدا با هوش مصنوعی چیست؟

تغییر صدا با هوش مصنوعی فرایندی است که در آن یک مدل صوتی، گفتار ضبط‌شده یا زنده را دریافت می‌کند و آن را با ویژگی‌های صوتی متفاوت بازسازی می‌کند.

ورودی می‌تواند شامل این موارد باشد:

  • صدای ضبط‌شده با میکروفون
  • فایل پادکست یا مصاحبه
  • صدای استخراج‌شده از ویدئو
  • جریان صوتی زنده یا Live Audio
  • پیام صوتی ضبط‌شده در یک اپلیکیشن

خروجی نیز ممکن است یکی از حالت‌های زیر باشد:

  • همان جمله با صدای شخصیت دیگر
  • صدای مردانه، زنانه، کودکانه یا مسن‌تر
  • صدای کارتونی، رباتی یا فانتزی
  • صدای تمیزتر و استودیویی
  • صدایی نزدیک به نمونه صوتی مجاز
  • نسخه‌ای با لحن، سرعت یا احساس متفاوت

مدل‌های ساده فقط Pitch یا زیر و بمی صدا را تغییر می‌دهند. مدل‌های پیشرفته‌تر، محتوای گفتار و اجرای گوینده را تحلیل می‌کنند و سپس آن را با هویت صوتی جدید می‌سازند.

تفاوت Voice Changer، Voice Cloning و Text-to-Speech

این مفاهیم معمولاً به‌جای یکدیگر استفاده می‌شوند، اما یکسان نیستند.

تغییر صدا یا Voice Changer

در Voice Changer یک فایل صوتی وارد سیستم می‌شود و سیستم آن را با صدای دیگری بازسازی می‌کند. مدل معمولاً تلاش می‌کند اجرای ورودی، از جمله ریتم، هیجان و مکث‌ها را حفظ کند.

ورودی:

امروز می‌خواهیم درباره کاربرد هوش مصنوعی صحبت کنیم.

خروجی همان جمله است، اما با هویت صوتی متفاوت.

این فرایند با نام Speech-to-Speech یا Voice Conversion نیز شناخته می‌شود.

شبیه‌سازی یا کلون صدا

در Voice Cloning، مدل با دریافت نمونه‌هایی از صدای یک شخص، یک پروفایل صوتی ایجاد می‌کند. سپس می‌توان متن جدیدی را با آن صدا تولید کرد یا صدای ورودی را به آن هویت صوتی تبدیل کرد.

کلون صدا فقط باید با رضایت روشن و قابل اثبات صاحب صدا انجام شود.

تبدیل متن به گفتار

در Text-to-Speech یا TTS، ورودی سیستم متن است:

به درواره خوش آمدید.

سیستم متن را با یک صدای آماده یا مجاز به گفتار تبدیل می‌کند. برخلاف Speech-to-Speech، اجرای اولیه‌ای وجود ندارد که مدل بخواهد ریتم و احساس آن را حفظ کند.

بهبود صدا یا Speech Enhancement

Speech Enhancement هویت گوینده را تغییر نمی‌دهد. هدف آن کاهش نویز، حذف پژواک، افزایش وضوح و اصلاح کیفیت ضبط است.

تغییر زیر و بمی صدا

Pitch Shifting یک پردازش صوتی کلاسیک است. در این روش، فرکانس پایه صدا تغییر می‌کند اما الزاماً هویت صوتی جدید و طبیعی ایجاد نمی‌شود. افزایش بیش‌ازحد Pitch معمولاً خروجی کارتونی و غیرطبیعی تولید می‌کند.

هوش مصنوعی چگونه صدا را تغییر می‌دهد؟

یک سامانه Speech-to-Speech معمولاً چند نوع ویژگی را از صوت استخراج می‌کند:

  • محتوای زبانی و کلمات گفته‌شده
  • ویژگی‌های هویتی گوینده
  • زیر و بمی یا Pitch
  • ریتم و سرعت بیان
  • مکث‌ها و تکیه‌ها
  • شدت و انرژی گفتار
  • احساس و سبک اجرا
  • نویز و ویژگی‌های محیط ضبط

مدل سپس محتوای گفتار و ویژگی‌های اجرایی را از هویت صوتی جدا می‌کند. در مرحله تولید، محتوا و سبک اجرای استخراج‌شده با Voice Profile مقصد ترکیب می‌شوند.

نمای ساده این فرایند چنین است:

صدای ورودی
  ↓
پیش‌پردازش و حذف نویز
  ↓
استخراج محتوا، ریتم و احساس
  ↓
اعمال هویت صوتی مقصد
  ↓
تولید Waveform جدید
  ↓
کنترل کیفیت و خروجی

در مدل‌های جدید، این مراحل ممکن است داخل یک معماری یکپارچه انجام شوند. توسعه‌دهنده معمولاً فقط صوت، شناسه مدل، شناسه صدا و چند تنظیم کنترلی را به API ارسال می‌کند.

کاربردهای تغییر صدا با هوش مصنوعی

تولید ویدئو و محتوای شبکه‌های اجتماعی

سازنده محتوا می‌تواند یک اجرای اولیه ضبط کند و آن را به صدایی متناسب با شخصیت ویدئو تبدیل کند. این روش نسبت به TTS ساده، کنترل بیشتری بر احساس و ریتم جمله می‌دهد.

دوبله و بومی‌سازی

در دوبله، Voice Changer می‌تواند به حفظ اجرای بازیگر و هماهنگی بهتر صدا با تصویر کمک کند. برای ترجمه کامل، معمولاً ترکیبی از این فناوری‌ها استفاده می‌شود:

  1. تبدیل گفتار به متن
  2. ترجمه متن
  3. بازنویسی متناسب با طول دیالوگ
  4. تولید یا تبدیل صدا
  5. هماهنگ‌سازی صدا و تصویر

ساخت شخصیت برای بازی

در بازی‌ها می‌توان برای شخصیت‌های مختلف پروفایل صوتی تعریف کرد. یک صداپیشه اجرای پایه را انجام می‌دهد و مدل، نسخه‌هایی با هویت‌های صوتی متفاوت تولید می‌کند.

این روش نباید جایگزین توافق حقوقی با صداپیشه شود. محدوده استفاده از صدا، مدت نگهداری، امکان آموزش مدل و شیوه پرداخت باید در قرارداد مشخص باشد.

پادکست و کتاب صوتی

در تولید پادکست می‌توان از Speech-to-Speech برای اصلاح بخش‌هایی از اجرا، ایجاد صدای شخصیت‌ها و هماهنگ‌کردن اپیزودها استفاده کرد.

برای مثال، اگر تلفظ یک نام در بخشی از پادکست اشتباه باشد، گوینده می‌تواند فقط همان جمله را دوباره اجرا کند و سپس آن را به صدای موردنظر تبدیل کند.

آموزش و دسترس‌پذیری

افرادی که توانایی گفتاری خود را از دست داده‌اند ممکن است با رضایت و نظارت مناسب، از یک صدای شخصی‌سازی‌شده استفاده کنند. همچنین می‌توان محتوای آموزشی را با چند سبک صوتی برای گروه‌های مختلف منتشر کرد.

حفظ حریم خصوصی

در برخی مصاحبه‌ها یا گزارش‌های حساس، می‌توان هویت صوتی فرد را تغییر داد. البته تغییر صدا به‌تنهایی ناشناس‌سازی کامل نیست؛ اطلاعات داخل مکالمه، الگوی بیان و متادیتای فایل نیز ممکن است هویت فرد را آشکار کنند.

بهترین ابزارهای تغییر صدا با هوش مصنوعی

ویژگی‌ها، قیمت‌ها و محدودیت ابزارهای آنلاین مرتب تغییر می‌کنند. پیش از انتخاب نهایی، شرایط استفاده و سیاست حفظ داده هر سرویس را بررسی کنید.

ElevenLabs Voice Changer

Voice Changer در ElevenLabs که قبلاً Speech-to-Speech نامیده می‌شد، می‌تواند صدای ورودی را به صدای دیگری تبدیل کند و در عین حال بخشی از لحن و اجرای ورودی را حفظ کند. مستندات این سرویس به قابلیت‌هایی مانند حفظ آهنگ بیان، تشخیص بهتر احساس و نگه‌داشتن زبان یا لهجه اشاره می‌کند. راهنمای رسمی ElevenLabs Voice Changer

API این سرویس فایل صوتی را به‌صورت Multipart دریافت می‌کند و تنظیماتی مانند مدل، تنظیمات صدا و حذف نویز پس‌زمینه دارد. پشتیبانی هر مدل از Voice Conversion را باید در فهرست مدل‌ها بررسی کرد. مستندات API تبدیل صدا

CapCut Voice Changer

CapCut برای کاربرانی مناسب است که می‌خواهند صدا را هم‌زمان با ویرایش ویدئو تغییر دهند. افکت‌های صوتی، کنترل صدا، کاهش نویز و پردازش مستقیم صدای ویدئو از جمله امکاناتی هستند که در صفحه رسمی ابزار معرفی شده‌اند. ابزار Voice Changer کپ‌کات

این گزینه بیشتر برای تولید محتوا و ویرایش سریع مناسب است تا ساخت زیرساخت اختصاصی مبتنی بر API.

Adobe Podcast Enhance Speech

Adobe Podcast Enhance Speech در اصل Voice Changer نیست. این ابزار برای تمیزکردن گفتار، کاهش نویز و نزدیک‌کردن کیفیت ضبط به صدای استودیویی استفاده می‌شود. می‌توان قبل از ارسال صوت به مدل تغییر صدا، از یک ابزار بهبود صدا استفاده کرد. Adobe Podcast Enhance Speech

ابزارهای Real-Time Voice Changer

برنامه‌هایی مانند Voicemod بیشتر برای تغییر صدای زنده در بازی، استریم و تماس آنلاین استفاده می‌شوند. هنگام انتخاب ابزار Real-Time به این معیارها توجه کنید:

  • میزان تأخیر
  • پشتیبانی از Virtual Microphone
  • سازگاری با سیستم‌عامل
  • مصرف CPU و GPU
  • کیفیت خروجی در زبان فارسی
  • سیاست ذخیره‌سازی صدا
  • امکان استفاده تجاری

آموزش تغییر صدا با هوش مصنوعی

مرحله اول: هدف خروجی را مشخص کنید

قبل از انتخاب ابزار، دقیقاً مشخص کنید چه تغییری لازم است.

به‌جای هدف مبهم «صدا را بهتر کن»، یک تعریف قابل‌اندازه‌گیری داشته باشید:

  • صدای راوی گرم‌تر و آرام‌تر شود.
  • اجرای اصلی و مکث‌ها حفظ شوند.
  • نویز محیط حذف شود.
  • صدای خروجی برای ویدئوی آموزشی مناسب باشد.
  • سرعت نهایی بین ۱۴۰ تا ۱۵۰ کلمه در دقیقه باشد.
  • خروجی با فرمت WAV برای تدوین ذخیره شود.

مرحله دوم: صدای مناسبی ضبط کنید

کیفیت ورودی تأثیر زیادی بر خروجی دارد. حتی مدل قدرتمند نیز نمی‌تواند همیشه صدای بریده، دارای پژواک شدید یا ضبط اشباع‌شده را ترمیم کند.

برای ضبط بهتر:

  • میکروفون را حدود ۱۵ تا ۲۵ سانتی‌متر از دهان قرار دهید.
  • از محیطی با انعکاس کم استفاده کنید.
  • کولر، فن و اعلان موبایل را خاموش کنید.
  • ورودی را آن‌قدر بلند نکنید که Clipping ایجاد شود.
  • سرعت طبیعی و یکنواخت داشته باشید.
  • جمله‌ها را واضح تلفظ کنید.
  • در صورت امکان WAV بدون فشرده‌سازی ضبط کنید.

برای بسیاری از پروژه‌های گفتاری، صدای Mono کافی است. استفاده از Stereo برای یک گوینده معمولاً فقط اندازه فایل را افزایش می‌دهد.

مرحله سوم: فایل را پاک‌سازی کنید

پیش از Voice Conversion این موارد را بررسی کنید:

  • سکوت طولانی ابتدا و انتهای فایل
  • نویز ثابت پس‌زمینه
  • صدای ضربه به میکروفون
  • کلیک دهان
  • پژواک شدید اتاق
  • اختلاف زیاد بلندی بخش‌ها
  • موسیقی مخلوط‌شده با صدای گوینده

اگر مدل گزینه‌ای مانند remove_background_noise دارد، می‌توان آن را آزمایش کرد؛ اما پردازش بیش‌ازحد ممکن است جزئیات طبیعی و تنفس گوینده را از بین ببرد.

مرحله چهارم: صدای مقصد را انتخاب کنید

صدای مقصد را براساس جنسیت به‌تنهایی انتخاب نکنید. مشخصات مهم‌تر عبارت‌اند از:

  • سن ادراک‌شده
  • انرژی
  • صمیمیت یا رسمیت
  • سرعت طبیعی
  • لهجه
  • دامنه احساس
  • تناسب با برند
  • کیفیت تلفظ فارسی
  • مجوز استفاده تجاری

برای یک آموزش فنی، صدایی شفاف، آرام و مطمئن معمولاً بهتر از یک صدای بسیار نمایشی است. برای داستان یا بازی ممکن است دامنه احساس اهمیت بیشتری داشته باشد.

مرحله پنجم: تنظیمات را آزمایش کنید

نام پارامترها در سرویس‌های مختلف متفاوت است، اما معمولاً با تنظیماتی شبیه این موارد روبه‌رو می‌شوید:

Stability

Stability بالاتر معمولاً خروجی باثبات‌تر و قابل‌پیش‌بینی‌تری ایجاد می‌کند، اما ممکن است احساس و تنوع اجرا را کاهش دهد.

Similarity

این گزینه میزان نزدیکی خروجی به Voice Profile مقصد را کنترل می‌کند. افزایش بیش‌ازحد آن ممکن است آرتیفکت یا اجرای غیرطبیعی ایجاد کند.

Style یا Expressiveness

مقدار بیشتر می‌تواند احساس و سبک را برجسته کند، اما همیشه به معنای کیفیت بهتر نیست.

Pitch

Pitch زیر و بمی صدا را تغییر می‌دهد. تغییر شدید Pitch معمولاً طبیعی‌بودن خروجی را کاهش می‌دهد.

Speaking Rate

برای فارسی، افزایش بیش‌ازحد سرعت ممکن است باعث بلعیده‌شدن نیم‌فاصله‌ها، پسوندها و انتهای کلمات شود.

Seed

بعضی APIها پارامتر Seed دارند تا خروجی‌های تکرارشونده‌تری ایجاد کنند. حتی در این حالت نیز ممکن است تولید کاملاً قطعی تضمین نشود.

مرحله ششم: چند نسخه کوتاه بسازید

قبل از پردازش یک فایل ۳۰ دقیقه‌ای، یک بخش ۲۰ تا ۴۰ ثانیه‌ای را با چند تنظیم تولید کنید.

برای مثال:

نسخه A:
Stability = 0.75
Similarity = 0.70
Style = 0.20

نسخه B:
Stability = 0.55
Similarity = 0.80
Style = 0.35

نسخه C:
Stability = 0.65
Similarity = 0.75
Style = 0.10

سپس نسخه‌ها را با هدفون و اسپیکر موبایل مقایسه کنید. بیشتر کاربران محتوای شبکه‌های اجتماعی را با اسپیکر موبایل می‌شنوند، بنابراین کیفیت فقط با هدفون استودیویی سنجیده نشود.

مرحله هفتم: کنترل کیفیت انجام دهید

پس از تولید خروجی، این موارد را گوش کنید:

  • تلفظ حروف «ق»، «غ»، «خ» و «ع»
  • تلفظ اعداد و تاریخ‌ها
  • نام‌های انگلیسی داخل جمله فارسی
  • مکث قبل و بعد از ویرگول
  • کشیده‌شدن غیرعادی مصوت‌ها
  • تغییر ناگهانی هویت صدا
  • صدای فلزی یا رباتی
  • قطع‌شدن ابتدای کلمات
  • حفظ درست احساس
  • هماهنگی بلندی بخش‌ها

تغییر صدای مرد به زن و زن به مرد

عبارت «تغییر صدای مرد به زن با هوش مصنوعی» یکی از جست‌وجوهای رایج این حوزه است؛ اما تبدیل طبیعی فقط با بالا یا پایین‌بردن Pitch انجام نمی‌شود.

برداشت شنونده از جنس و هویت صوتی به مجموعه‌ای از ویژگی‌ها بستگی دارد:

  • فرکانس پایه
  • Formant یا فرکانس‌های تشدید
  • ریتم و آهنگ جمله
  • شدت بیان
  • نحوه ادای واج‌ها
  • دامنه تغییر Pitch
  • کیفیت تنفس
  • ویژگی‌های فیزیکی کانال صوتی

برای نتیجه طبیعی، از مدلی استفاده کنید که Voice Conversion واقعی انجام می‌دهد. Pitch Shifter ساده معمولاً خروجی‌ای شبیه صدای کارتونی ایجاد می‌کند.

همچنین بهتر است هدف را «انتخاب یک شخصیت صوتی مناسب» تعریف کنید، نه صرفاً تغییر جنسیت صدا. این نگاه نتیجه حرفه‌ای‌تر و کنترل‌پذیرتری ایجاد می‌کند.

ساخت Voice Clone به‌صورت اصولی

رضایت را ثبت کنید

پیش از ضبط، رضایت صاحب صدا را به‌صورت روشن دریافت و ثبت کنید. رضایت باید مشخص کند:

  • صدا برای چه کاری استفاده می‌شود؟
  • چه کسانی به مدل دسترسی دارند؟
  • آیا استفاده تجاری مجاز است؟
  • داده تا چه زمانی نگهداری می‌شود؟
  • آیا صاحب صدا می‌تواند رضایت خود را پس بگیرد؟
  • آیا مدل یا نمونه صدا با شخص دیگری به اشتراک گذاشته می‌شود؟

صرف دریافت یک فایل صوتی، به معنای اجازه ساخت کلون صدا نیست.

دیتاست تمیز آماده کنید

برای Instant Voice Cloning معمولاً یک نمونه کوتاه و باکیفیت می‌تواند کافی باشد، اما کیفیت ضبط از طول بی‌هدف مهم‌تر است. راهنمای ElevenLabs حدود یک تا دو دقیقه صدای واضح، بدون نویز، پژواک و آرتیفکت را برای روش Instant پیشنهاد می‌کند. راهنمای Instant Voice Cloning

برای مدل‌های حرفه‌ای‌تر ممکن است به داده بیشتر و مرحله احراز هویت نیاز باشد. قوانین هر سرویس متفاوت است.

تنوع کنترل‌شده ایجاد کنید

نمونه باید حالت طبیعی صدای شخص را نمایش دهد. بااین‌حال، مخلوط‌کردن فایل‌هایی با میکروفون‌ها، اتاق‌ها و فاصله‌های بسیار متفاوت ممکن است مدل را سردرگم کند.

تنوع مفید می‌تواند شامل این موارد باشد:

  • جمله خبری
  • پرسش
  • جمله هیجانی
  • اعداد
  • نام‌های خاص
  • جمله‌های کوتاه و بلند
  • واژه‌های فارسی و انگلیسی موردنیاز پروژه

فایل‌ها را برچسب‌گذاری کنید

برای پروژه حرفه‌ای، همراه هر نمونه اطلاعاتی مانند زبان، گوینده، احساس، میکروفون و شرایط ضبط نگهداری کنید:

{
  "speaker_id": "speaker_001",
  "language": "fa-IR",
  "emotion": "neutral",
  "microphone": "studio_mic_a",
  "consent_record_id": "consent_2026_001",
  "commercial_use": true
}

فایل رضایت و دیتاست صوتی را در فضای عمومی یا مخزن Git قرار ندهید.

نوشتن Prompt برای تغییر صدا

در بسیاری از Voice Changerها، اجرای صوتی ورودی نقش اصلی را دارد و Prompt متنی اهمیت کمتری از TTS دارد. بااین‌حال، بعضی مدل‌ها یا فرایندهای چندمرحله‌ای امکان توصیف سبک خروجی را می‌دهند.

پرامپت راوی آموزشی

صدایی شفاف، حرفه‌ای و مطمئن تولید کن. لحن آموزشی و دوستانه باشد.
سرعت گفتار متوسط و مکث پس از اصطلاحات فنی طبیعی باشد.
تلفظ واژه‌های فارسی حفظ شود و اصطلاحات English واضح ادا شوند.
از اجرای تبلیغاتی و اغراق‌آمیز خودداری کن.

پرامپت پادکست

لحن گرم، صمیمی و محاوره‌ای باشد. ریتم و احساس اجرای ورودی حفظ شود.
صدا بیش‌ازحد پردازش‌شده یا رادیویی نباشد. تنفس‌های طبیعی باقی بمانند،
اما نویز ثابت محیط حذف شود.

پرامپت شخصیت بازی

شخصیتی باتجربه، آرام و مرموز با انرژی کنترل‌شده ایجاد کن.
احساس اجرای ورودی و مکث‌های نمایشی را حفظ کن.
صدا خوانا باشد و افکت فانتزی مانع درک دیالوگ نشود.

پرامپت پشتیبانی مشتری

صدایی محترمانه، آرام و قابل‌اعتماد تولید کن.
سرعت بیان متوسط باشد و شماره‌ها با مکث کوتاه خوانده شوند.
از لحن بیش‌ازحد احساسی، هیجان‌زده یا مصنوعی استفاده نکن.

اگر مدل فقط پارامترهای صوتی دارد، این توصیف‌ها را باید به تنظیماتی مانند Voice ID، Stability، Style و Speed تبدیل کنید.

استفاده از API برای تغییر صدا

برای ساخت محصول واقعی، معمولاً باید یک Backend بین کاربر و سرویس هوش مصنوعی قرار دهید.

معماری پیشنهادی:

کاربر
  ↓
آپلود صوت در وب یا اپلیکیشن
  ↓
Backend امن
  ↓
اعتبارسنجی فایل و مجوز صاحب صدا
  ↓
ذخیره‌سازی موقت
  ↓
API مدل صوتی
  ↓
کنترل کیفیت و ثبت وضعیت
  ↓
دانلود محدود خروجی

چرا نباید API Key را در Frontend قرار دهیم؟

قرار دادن کلید API در JavaScript مرورگر، اپلیکیشن موبایل یا افزونه قابل‌توزیع باعث افشای آن می‌شود. مهاجم می‌تواند کلید را استخراج کرده و از اعتبار حساب شما استفاده کند.

کلید باید فقط در متغیر محیطی Backend نگهداری شود:

DARVAREH_API_KEY=your_api_key

درواره دسترسی API به مدل‌های هوش مصنوعی ارائه می‌کند. برای بررسی مدل‌های صوتی موجود، قابلیت هر مدل و ساخت کلید API می‌توانید وارد درواره شوید.

از آنجا که Endpoint و پارامترهای تغییر صدا به مدل انتخابی وابسته‌اند، کد زیر یک الگوی عمومی است. آدرس دقیق مسیر، نام فیلد صوت و model را باید از مستندات مدل موجود در درواره بردارید.

نمونه Node.js

import fs from "node:fs";
import path from "node:path";
import FormData from "form-data";

async function convertVoice(inputPath) {
  const form = new FormData();

  form.append("audio", fs.createReadStream(inputPath));
  form.append("model", "MODEL_ID_WITH_VOICE_CONVERSION");
  form.append("voice_id", "AUTHORIZED_VOICE_ID");
  form.append(
    "voice_settings",
    JSON.stringify({
      stability: 0.65,
      similarity: 0.75,
      style: 0.2
    })
  );

  const response = await fetch(
    "https://api.darvareh.ir/v1/MODEL_SPECIFIC_AUDIO_ENDPOINT",
    {
      method: "POST",
      headers: {
        Authorization: `Bearer ${process.env.DARVAREH_API_KEY}`,
        ...form.getHeaders()
      },
      body: form
    }
  );

  if (!response.ok) {
    const errorBody = await response.text();
    throw new Error(
      `Voice conversion failed: ${response.status} ${errorBody}`
    );
  }

  const outputBuffer = Buffer.from(await response.arrayBuffer());
  const outputPath = path.resolve("output.wav");

  await fs.promises.writeFile(outputPath, outputBuffer);
  return outputPath;
}

convertVoice("./input.wav")
  .then((file) => console.log(`Saved to ${file}`))
  .catch(console.error);

در این مثال، عبارت MODEL_SPECIFIC_AUDIO_ENDPOINT عمداً Placeholder است و نباید بدون جایگزینی استفاده شود.

نمونه Python

import os
import json
import requests

API_KEY = os.environ["DARVAREH_API_KEY"]

url = (
    "https://api.darvareh.ir/v1/"
    "MODEL_SPECIFIC_AUDIO_ENDPOINT"
)

with open("input.wav", "rb") as audio_file:
    files = {
        "audio": ("input.wav", audio_file, "audio/wav")
    }

    data = {
        "model": "MODEL_ID_WITH_VOICE_CONVERSION",
        "voice_id": "AUTHORIZED_VOICE_ID",
        "voice_settings": json.dumps({
            "stability": 0.65,
            "similarity": 0.75,
            "style": 0.20
        })
    }

    response = requests.post(
        url,
        headers={
            "Authorization": f"Bearer {API_KEY}"
        },
        files=files,
        data=data,
        timeout=180
    )

response.raise_for_status()

with open("output.wav", "wb") as output_file:
    output_file.write(response.content)

print("Voice conversion completed.")

اعتبارسنجی فایل در Backend

قبل از ارسال فایل به مدل، فقط به پسوند اعتماد نکنید. این موارد را بررسی کنید:

  • MIME Type واقعی
  • امضای باینری فایل
  • حداکثر اندازه
  • حداکثر مدت صوت
  • تعداد کانال‌ها
  • Sample Rate
  • وجود بدافزار یا Payload غیرعادی
  • شناسه کاربر و سطح دسترسی
  • رضایت ثبت‌شده برای Voice ID

نمونه محدودیت:

const ALLOWED_MIME_TYPES = new Set([
  "audio/wav",
  "audio/mpeg",
  "audio/mp4",
  "audio/webm"
]);

const MAX_FILE_SIZE = 25 * 1024 * 1024;

function validateUpload(file) {
  if (!ALLOWED_MIME_TYPES.has(file.mimetype)) {
    throw new Error("Unsupported audio format");
  }

  if (file.size > MAX_FILE_SIZE) {
    throw new Error("Audio file is too large");
  }
}

برای امنیت واقعی باید محتوای فایل نیز با ابزار مناسب بررسی شود.

پردازش فایل‌های طولانی

ارسال یک فایل صوتی طولانی در یک Request معمولاً انتخاب مناسبی نیست. محدودیت زمان درخواست، حافظه، اندازه فایل و هزینه پردازش می‌تواند باعث شکست شود.

فرایند بهتر:

  1. فایل را آپلود کنید.
  2. یک Job در صف بسازید.
  3. سکوت‌ها و مرز جمله‌ها را تشخیص دهید.
  4. صوت را با هم‌پوشانی کوتاه تقسیم کنید.
  5. قطعه‌ها را پردازش کنید.
  6. بلندی و رنگ صوتی قطعه‌ها را هماهنگ کنید.
  7. خروجی‌ها را به یکدیگر متصل کنید.
  8. نتیجه را در Object Storage قرار دهید.
  9. لینک کوتاه‌مدت دانلود بسازید.

ساختار Job می‌تواند چنین باشد:

{
  "job_id": "vc_01JXYZ",
  "user_id": "user_1042",
  "status": "processing",
  "model": "selected-model-id",
  "voice_id": "authorized-voice-id",
  "progress": 45,
  "created_at": "2026-07-17T10:30:00Z"
}

وضعیت‌ها:

queued
processing
quality_check
completed
failed
deleted

تغییر صدای زنده یا Real-Time Voice Changer

تغییر صدای زنده با پردازش فایل ضبط‌شده متفاوت است. در حالت Real-Time، تأخیر اهمیت زیادی دارد.

فرایند معمول:

Microphone
  ↓
Audio Capture
  ↓
Voice Activity Detection
  ↓
Streaming Voice Conversion
  ↓
Jitter Buffer
  ↓
Virtual Microphone یا Voice Output

اجزای فنی مهم

Audio Frame

صدا به فریم‌های کوتاه، برای مثال ۲۰ یا ۴۰ میلی‌ثانیه‌ای تقسیم می‌شود. فریم‌های بزرگ‌تر پردازش را آسان‌تر می‌کنند، اما تأخیر را افزایش می‌دهند.

Voice Activity Detection

VAD تشخیص می‌دهد چه زمانی کاربر صحبت می‌کند. این کار پردازش سکوت و هزینه غیرضروری را کاهش می‌دهد.

WebSocket یا WebRTC

برای انتقال پیوسته صوت می‌توان از WebSocket یا WebRTC استفاده کرد. WebRTC برای ارتباط Real-Time امکاناتی مانند مدیریت شبکه، Codec و Jitter دارد.

Jitter Buffer

تفاوت زمان رسیدن بسته‌های صوتی می‌تواند باعث قطع و وصل شود. Jitter Buffer این نوسان را کنترل می‌کند، اما اندازه زیاد آن تأخیر را افزایش می‌دهد.

Latency Budget

تأخیر کل شامل این موارد است:

ضبط فریم
+ کدگذاری
+ انتقال شبکه
+ پردازش مدل
+ انتقال خروجی
+ رمزگشایی
+ پخش

برای تماس و گفت‌وگوی طبیعی، باید تمام زنجیره اندازه‌گیری شود. سریع‌بودن خود مدل کافی نیست.

بهینه‌سازی کیفیت صدای فارسی

مدل‌های صوتی ممکن است روی زبان‌های مختلف کیفیت یکسانی نداشته باشند. برای ارزیابی فارسی یک مجموعه تست ثابت بسازید.

جمله‌های آزمایشی پیشنهادی

اعداد:

مبلغ نهایی یک میلیون و دویست‌وپنجاه هزار تومان است.

تاریخ:

جلسه در بیست‌وپنجم شهریور هزار و چهارصد و پنج برگزار می‌شود.

واژه‌های ترکیبی:

برای دریافت API Key وارد پنل توسعه‌دهندگان شوید.

نام و نشانی:

سفارش به خیابان شهید بهشتی، کوچه دوازدهم ارسال می‌شود.

پرسش:

آیا می‌توان این مدل را از طریق Python فراخوانی کرد؟

نرمال‌سازی متن

اگر سیستم شما ابتدا گفتار را به متن و سپس متن را به گفتار تبدیل می‌کند، نرمال‌سازی متن اهمیت زیادی دارد.

برای مثال:

۱۲۵۰۰۰۰

ممکن است به شکل‌های مختلف خوانده شود. بهتر است پیش از تولید صوت به این حالت تبدیل شود:

یک میلیون و دویست‌وپنجاه هزار

همچنین برای اصطلاحات انگلیسی یک واژه‌نامه تلفظ بسازید:

{
  "API": "اِی پی آی",
  "Python": "پایتون",
  "Token": "توکن",
  "Prompt": "پرامپت"
}

معیارهای ارزیابی خروجی

ارزیابی صرفاً با جمله «این صدا خوب است» کافی نیست.

طبیعی‌بودن

از چند شنونده بخواهید کیفیت را از ۱ تا ۵ ارزیابی کنند. این روش با عنوان Mean Opinion Score یا MOS شناخته می‌شود.

شباهت به صدای مقصد

فقط زمانی این معیار را بسنجید که اجازه استفاده از صدای مقصد را دارید. شباهت زیاد بدون رضایت، یک موفقیت فنی محسوب نمی‌شود؛ بلکه ریسک امنیتی ایجاد می‌کند.

وضوح محتوا

می‌توان صوت خروجی را به یک سیستم Speech-to-Text داد و متن آن را با متن مرجع مقایسه کرد. افزایش خطای رونویسی می‌تواند نشانه افت وضوح باشد.

حفظ احساس

بررسی کنید آیا حالت‌هایی مانند سؤال، تعجب، ناراحتی یا آرامش از ورودی به خروجی منتقل شده‌اند.

ثبات بین قطعه‌ها

در پردازش فایل طولانی، رنگ صدا نباید بین قطعه‌ها تغییر ناگهانی داشته باشد.

تأخیر و هزینه

برای محصول آنلاین، این شاخص‌ها را ثبت کنید:

  • مدت صوت ورودی
  • زمان پردازش
  • نسبت Real-Time Factor
  • تعداد درخواست ناموفق
  • هزینه هر دقیقه
  • اندازه خروجی
  • میزان استفاده هر کاربر

امنیت و جلوگیری از سوءاستفاده

صدا یک داده حساس و در بعضی کاربردها یک مشخصه بیومتریک است. ذخیره و پردازش آن باید با کنترل‌های جدی همراه باشد.

کلون صدای افراد بدون رضایت ممنوع است

از صدای افراد مشهور، مدیران، همکاران، اعضای خانواده یا مشتریان بدون اجازه برای تقلید و جعل استفاده نکنید.

بعضی سرویس‌ها برای کلون حرفه‌ای صدا مرحله احراز هویت دارند. برای نمونه، ElevenLabs اعلام کرده است Professional Voice Clone باید متعلق به خود کاربر باشد و برای اشتراک‌گذاری صدای شخص دیگر، صاحب صدا باید کلون خود را ایجاد و تأیید کند. سیاست Professional Voice Clone

از صدا برای دورزدن احراز هویت استفاده نکنید

استفاده از صدای مصنوعی برای عبور از Voice Authentication، فریب اپراتور بانک یا جعل دستور مالی غیرقانونی و خطرناک است.

سامانه‌های مالی نباید صدای تماس‌گیرنده را به‌تنهایی مبنای تأیید تراکنش قرار دهند. احراز هویت چندمرحله‌ای و تأیید خارج از کانال صوتی ضروری است.

دسترسی را محدود کنید

برای هر Voice Profile مشخص کنید:

  • مالک چه کسی است؟
  • چه کاربرانی اجازه استفاده دارند؟
  • چه نوع محتوایی مجاز است؟
  • سقف مصرف روزانه چقدر است؟
  • آیا دانلود خروجی مجاز است؟
  • چه زمانی پروفایل حذف می‌شود؟

اطلاعات حساس را در Log ذخیره نکنید

توکن دسترسی، فایل خام صدا و URL دائمی خروجی نباید در Log معمولی برنامه ثبت شوند.

نمونه Log مناسب:

{
  "request_id": "req_01JABC",
  "user_id": "user_1042",
  "model": "audio-model-id",
  "duration_seconds": 42,
  "status": "completed",
  "consent_verified": true
}

فایل‌ها را خودکار حذف کنید

اگر نگهداری دائمی لازم نیست، سیاست حذف خودکار داشته باشید:

فایل ورودی: حذف پس از ۲۴ ساعت
فایل میانی: حذف پس از تکمیل Job
فایل خروجی: حذف پس از ۷ روز
متادیتای حسابرسی: مطابق سیاست سازمان

زمان‌ها باید براساس نیاز محصول و الزامات حقوقی تعیین شوند.

محتوای مصنوعی را اعلام کنید

اگر صدا در تبلیغ، خبر، آموزش یا محتوای عمومی استفاده می‌شود، بهتر است مصنوعی یا تغییریافته‌بودن آن به‌صورت شفاف اعلام شود؛ به‌خصوص زمانی که شنونده ممکن است تصور کند یک شخص واقعی آن جملات را گفته است.

اشتباهات رایج در تغییر صدا

انتخاب ابزار فقط براساس رایگان‌بودن

ابزار رایگان ممکن است برای آزمایش مناسب باشد، اما محدودیت مجوز تجاری، کیفیت پایین فارسی یا سیاست نامشخص نگهداری داده داشته باشد.

پردازش فایل همراه با موسیقی

اگر موسیقی و گفتار روی یک Track باشند، مدل ممکن است موسیقی را نیز دچار اعوجاج کند. ابتدا Stem گفتار را جدا کنید و پس از تغییر صدا دوباره میکس انجام دهید.

استفاده از تنظیمات شدید

Similarity یا Style بیشتر همیشه بهتر نیست. تغییرات شدید ممکن است صدا را ناپایدار، فلزی یا نمایشی کند.

بی‌توجهی به Loudness

اگر بلندی قطعه‌های خروجی متفاوت باشد، تجربه شنیدن آزاردهنده می‌شود. پس از تولید، Loudness را برای پلتفرم مقصد هماهنگ کنید.

تبدیل چندباره یک فایل

هر بار کدگذاری MP3 یا تبدیل مجدد صدا می‌تواند کیفیت را کاهش دهد. در مراحل میانی از فرمت بدون اتلاف استفاده کنید و فقط خروجی نهایی را فشرده کنید.

نداشتن رضایت قابل اثبات

یک تیک ساده در فرم همیشه کافی نیست. برای کاربردهای حساس باید هویت، متن رضایت، زمان ثبت و محدوده استفاده نگهداری شود.

چک‌لیست انتخاب سرویس AI Voice Changer

پیش از انتخاب مدل یا API این پرسش‌ها را پاسخ دهید:

  • آیا زبان فارسی را به‌خوبی پشتیبانی می‌کند؟
  • آیا Speech-to-Speech واقعی دارد؟
  • آیا لحن و احساس ورودی حفظ می‌شود؟
  • پردازش فایل است یا Streaming؟
  • حداکثر مدت و اندازه فایل چقدر است؟
  • چه فرمت‌هایی پذیرفته می‌شوند؟
  • مجوز استفاده تجاری چیست؟
  • داده صوتی تا چه زمانی ذخیره می‌شود؟
  • آیا داده برای آموزش مدل استفاده می‌شود؟
  • امکان حذف Voice Profile وجود دارد؟
  • کنترل رضایت و احراز هویت چگونه است؟
  • هزینه براساس دقیقه است یا تعداد کاراکتر؟
  • Latency برای کاربرد شما مناسب است؟
  • آیا API و Webhook دارد؟
  • آیا می‌توان میزان مصرف کاربران را کنترل کرد؟
  • آیا خروجی باید با برچسب محتوای مصنوعی منتشر شود؟

پرسش‌های متداول

آیا تغییر صدا با هوش مصنوعی رایگان است؟

بعضی ابزارها پلن آزمایشی یا امکانات رایگان محدود دارند. برای فایل طولانی، استفاده تجاری، API، خروجی باکیفیت یا Voice Cloning معمولاً به پلن پولی نیاز است.

بهترین هوش مصنوعی برای تغییر صدا چیست؟

بهترین ابزار به کاربرد بستگی دارد. برای ویرایش سریع ویدئو، ابزارهای تدوین دارای Voice Effect مناسب‌اند. برای تبدیل حرفه‌ای Speech-to-Speech باید کیفیت فارسی، حفظ احساس، API، مجوز تجاری و سیاست داده را مقایسه کنید.

آیا می‌توان صدای مرد را به زن تبدیل کرد؟

بله، اما نتیجه طبیعی به مدلی نیاز دارد که هویت صوتی، Formant، ریتم و سبک گفتار را پردازش کند. تغییر ساده Pitch معمولاً کافی نیست.

آیا می‌توان صدای یک فرد مشهور را تقلید کرد؟

ساخت یا استفاده از صدای افراد بدون رضایت می‌تواند باعث نقض حقوق شخصی، فریب مخاطب و مشکلات قانونی شود. برای پروژه‌های واقعی از صداهای مجاز، صدای خودتان یا صداپیشه‌ای با قرارداد روشن استفاده کنید.

Voice Changer با TTS چه تفاوتی دارد؟

در TTS ورودی متن است. در Voice Changer ورودی صداست و مدل می‌تواند ریتم، مکث و احساس اجرای اولیه را حفظ کند.

آیا تغییر صدا به‌صورت زنده امکان‌پذیر است؟

بله. برای این کار به مدل Streaming، اتصال پایدار، پردازش کم‌تأخیر و مدیریت Audio Buffer نیاز دارید. کیفیت مدل و فاصله سرور از کاربر روی تأخیر اثر می‌گذارند.

بهترین فرمت برای ورودی چیست؟

WAV برای پردازش حرفه‌ای معمولاً انتخاب مناسبی است، زیرا فشرده‌سازی مخرب ندارد. بااین‌حال، فرمت و Sample Rate باید با مستندات مدل انتخابی هماهنگ باشد.

آیا می‌توان قابلیت تغییر صدا را به سایت اضافه کرد؟

بله. فایل از Frontend به Backend ارسال می‌شود، Backend آن را اعتبارسنجی کرده و با API مدل صوتی پردازش می‌کند. API Key نباید در مرورگر قرار بگیرد.

برای فارسی چه تنظیماتی بهتر است؟

یک تنظیم واحد برای همه مدل‌ها وجود ندارد. با جمله‌های شامل اعداد، تاریخ، نام خاص و اصطلاحات انگلیسی آزمایش کنید و Stability، Style، سرعت و میزان شباهت را روی نمونه‌های کوتاه تنظیم کنید.

جمع‌بندی

تغییر صدا با هوش مصنوعی از یک افکت ساده فراتر رفته و به فناوری کاربردی برای دوبله، پادکست، بازی، آموزش و تولید محتوای حرفه‌ای تبدیل شده است. مدل‌های Speech-to-Speech می‌توانند محتوای گفتار و اجرای اولیه را حفظ کنند و آن را با هویت صوتی تازه‌ای بازسازی کنند.

برای دستیابی به نتیجه مناسب باید کیفیت ورودی، انتخاب صدای مقصد، تنظیم پارامترها، وضوح فارسی، ثبات خروجی و هزینه پردازش را هم‌زمان در نظر بگیرید. در پروژه‌های واقعی نیز مدیریت صف، اعتبارسنجی فایل، نگهداری موقت داده، کنترل دسترسی و مانیتورینگ ضروری است.

مهم‌تر از تمام جزئیات فنی، استفاده مسئولانه است. Voice Cloning فقط باید با رضایت روشن صاحب صدا انجام شود و مخاطب نباید درباره هویت گوینده فریب بخورد.

اگر می‌خواهید قابلیت‌های صوتی و سایر مدل‌های هوش مصنوعی را از طریق API به محصول خود متصل کنید، مدل‌های موجود و مستندات فنی را در درواره بررسی کرده و کلید API خود را دریافت کنید.

مقالات مرتبط

Read more