تبدیل متن به صدا با هوش مصنوعی؛ بهترین ابزارهای رایگان برای صدای فارسی

راهنمای جامع تبدیل متن فارسی به صدا با هوش مصنوعی؛ معرفی بهترین ابزارهای رایگان، آموزش ساخت گویندگی و پادکست، Voice Cloning، بهبود تلفظ فارسی و پیاده‌سازی فنی Text-to-Speech با API درواره.

Share
Darvareh TTS
Darvareh TTS

تبدیل متن به صدا یا Text-to-Speech دیگر به صداهای خشک و رباتیک قدیمی محدود نیست. مدل‌های جدید هوش مصنوعی می‌توانند یک متن را با صدایی طبیعی، لحن احساسی، مکث‌های مناسب و حتی ویژگی‌های صوتی یک گوینده مشخص اجرا کنند.

با این فناوری می‌توان مقاله را به پادکست، کتاب را به کتاب صوتی، متن ویدئو را به گویندگی، پیام سامانه را به پاسخ صوتی و خروجی چت‌بات را به صدای زنده تبدیل کرد.

چالش اصلی کاربران فارسی‌زبان، فقط پشتیبانی از زبان فارسی نیست. یک مدل مناسب باید نیم‌فاصله، عدد، تاریخ، مخفف، واژه‌های انگلیسی، لحن رسمی و محاوره‌ای و شیوه تلفظ نام‌ها را نیز به‌درستی مدیریت کند.

در این راهنما بهترین ابزارهای تبدیل متن فارسی به صدا را مقایسه می‌کنیم، روش آماده‌سازی متن برای گویندگی طبیعی را آموزش می‌دهیم، Voice Cloning و حقوق استفاده از صدای افراد را بررسی می‌کنیم و در پایان، پیاده‌سازی فنی Text-to-Speech با API درواره را توضیح می‌دهیم.

تبدیل متن به صدا چیست؟

تبدیل متن به گفتار یا TTS فرایندی است که در آن نرم‌افزار، متن نوشته‌شده را به فایل صوتی یا صدای در حال پخش تبدیل می‌کند.

سامانه‌های سنتی TTS معمولاً کلمات و اجزای صوتی از پیش ضبط‌شده را به یکدیگر متصل می‌کردند. مدل‌های جدید با استفاده از شبکه‌های عصبی و مدل‌های مولد صوت می‌توانند ویژگی‌های پیچیده‌تری را تولید کنند:

  • آهنگ و زیر و بمی صدا
  • ریتم گفتار
  • مکث
  • تأکید
  • احساس
  • سرعت خواندن
  • تفاوت لحن سؤال و جمله خبری
  • ویژگی‌های صوتی گوینده
  • تلفظ چندزبانه
  • گفت‌وگو میان چند شخصیت

خروجی ممکن است یک فایل MP3، WAV، PCM، Opus یا یک Stream صوتی برای پخش زنده باشد.

کاربردهای تبدیل متن به صدا با هوش مصنوعی

Text-to-Speech در بسیاری از محصولات و فرایندها قابل استفاده است:

  • ساخت گویندگی ویدئو
  • تولید پادکست
  • ساخت کتاب صوتی
  • خواندن مقاله و خبر
  • دسترس‌پذیری برای کاربران نابینا یا کم‌بینا
  • چت‌بات صوتی
  • Voice Agent
  • دستیار تلفنی
  • سامانه پاسخ‌گویی مشتریان
  • آموزش زبان
  • محتوای آموزشی
  • شخصیت بازی و انیمیشن
  • اعلان صوتی
  • مسیریابی
  • خواندن پیام‌ها
  • تبدیل PDF به فایل صوتی
  • تولید صدای تبلیغاتی
  • دوبله اولیه
  • ساخت نمونه اولیه محصول صوتی

بهترین ابزارهای تبدیل متن به صدا در یک نگاه

ابزارپشتیبانی از فارسیVoice CloningAPIنسخه رایگانمناسب برای
ElevenLabsبله، در مدل‌های مشخصبلهبلهمحدودصدای طبیعی، ویدئو و پادکست
Google Gemini-TTSبله، در وضعیت Previewوابسته به سرویسبلهاعتبار ابری/محدوداپلیکیشن و گفت‌وگوی صوتی
Google Cloud TTSبسته به مدل و Voiceسرویس‌های سفارشیبلهاعتبار محدودزیرساخت سازمانی
Microsoft Azure Speechوابسته به Voice و مدلبلهبلهمحدودمحصولات سازمانی و Real-time
OpenAI TTSچندزبانه، کیفیت وابسته به مدلمحدود به قابلیت مجازبلهAPI مصرفیاپلیکیشن و Agent صوتی
Speechifyقابل استفاده برای چند زباندر طرح‌های مشخصبسته به محصولمحدودمطالعه متن و محتوا
Narakeetبلهمعمولاً خیرامکانات توسعهمحدودگویندگی ویدئو و اسلاید
TTSMakerبلهخیرمحدودبله/محدودتبدیل سریع متن
CapCutقابل استفادهقابلیت‌های محدودخیر/محدودبلهگویندگی ویدئوهای کوتاه
دروارهوابسته به مدل انتخابیوابسته به مدلبلهپرداخت مصرفیساخت محصول و Workflow صوتی

پشتیبانی زبان و قابلیت Voiceها در سرویس‌های صوتی ممکن است در هر مدل متفاوت باشد. وجود زبان فارسی در Speech-to-Text نیز الزاماً به معنی پشتیبانی آن در Text-to-Speech نیست.

۱. ElevenLabs؛ یکی از بهترین ابزارهای گویندگی هوش مصنوعی

ElevenLabs یکی از شناخته‌شده‌ترین سرویس‌های تولید صدای طبیعی است. این سرویس علاوه بر Text-to-Speech، قابلیت‌هایی برای گفت‌وگوی چندشخصیتی، شبیه‌سازی صدا، دوبله و پردازش صوت ارائه می‌دهد.

طبق مستندات رسمی مدل‌های ElevenLabs، مدل Eleven v3 از زبان فارسی پشتیبانی می‌کند. بااین‌حال، فهرست زبان‌های هر مدل ElevenLabs یکسان نیست؛ برای مثال، نباید پشتیبانی فارسی در یک مدل را به تمام مدل‌های سریع یا قدیمی آن تعمیم داد.

مزایای ElevenLabs

  • صدای طبیعی
  • کنترل احساسی مناسب
  • پشتیبانی از چند زبان
  • امکان Voice Cloning
  • API برای توسعه‌دهندگان
  • تولید گفت‌وگوی چندشخصیتی
  • مناسب برای متن طولانی
  • امکان تنظیم ویژگی‌های صدا
  • خروجی مناسب برای پادکست و ویدئو

محدودیت‌ها

  • نسخه رایگان محدود است.
  • کیفیت فارسی میان Voiceها متفاوت است.
  • اعداد و کلمات انگلیسی ممکن است اشتباه تلفظ شوند.
  • Voice Cloning به رضایت و رعایت قوانین نیاز دارد.
  • برخی قابلیت‌های پیشرفته در طرح‌های پولی ارائه می‌شوند.
  • برای متن طولانی باید هزینه و محدودیت تعداد کاراکتر بررسی شود.

آموزش تبدیل متن فارسی به صدا با ElevenLabs

مرحله اول: انتخاب مدل مناسب

مدلی را انتخاب کنید که صراحتاً از زبان فارسی پشتیبانی کند. فقط چندزبانه‌بودن نام مدل برای نتیجه‌گیری کافی نیست.

برای گویندگی با کیفیت، مدل احساسی و باکیفیت مناسب‌تر است. برای Voice Agent زنده، مدلی با Latency کمتر اولویت دارد.

مرحله دوم: انتخاب Voice

Voiceهای مختلف را با یک متن فارسی یکسان آزمایش کنید. ممکن است یک Voice برای انگلیسی بسیار طبیعی باشد اما فارسی را با لهجه یا تلفظ نامناسب بخواند.

متن آزمایشی باید شامل موارد زیر باشد:

  • جمله خبری
  • جمله پرسشی
  • عدد
  • تاریخ
  • نام فارسی
  • واژه انگلیسی
  • کلمات دارای نیم‌فاصله
  • جمله احساسی
  • جمله طولانی

نمونه:

سلام. به درواره خوش آمدید.

امروز، بیست‌وپنجم تیرماه سال هزار و چهارصد و پنج است.
در این راهنما، با API هوش مصنوعی و مدل‌های Text-to-Speech آشنا می‌شویم.

آیا آماده‌اید شروع کنیم؟

مرحله سوم: پاک‌سازی متن

متن مقاله را مستقیماً در ابزار قرار ندهید. عناصر غیرقابل‌خواندن را حذف یا بازنویسی کنید:

  • URLهای طولانی
  • کد برنامه‌نویسی
  • Markdown
  • تگ HTML
  • جدول
  • ایموجی‌های غیرضروری
  • پرانتزهای تو در تو
  • پاورقی
  • شماره ارجاع
  • علامت‌های تکراری

مرحله چهارم: تنظیم سرعت و لحن

سرعت مناسب به کاربرد بستگی دارد:

  • کتاب صوتی: آرام و پایدار
  • پادکست خبری: متوسط و واضح
  • تبلیغ: سریع‌تر و پرانرژی
  • آموزش: کمی آهسته با مکث بیشتر
  • Voice Agent: طبیعی و کوتاه
  • مدیتیشن: بسیار آرام

مرحله پنجم: تولید بخش‌بندی‌شده

برای متن طولانی، کل کتاب یا مقاله را در یک درخواست تولید نکنید. متن را به بخش‌های منطقی تقسیم کنید تا:

  • اصلاح یک بخش آسان باشد.
  • هزینه تولید مجدد کاهش پیدا کند.
  • لحن هر بخش قابل‌کنترل باشد.
  • خطاهای Timeout کمتر شوند.
  • پردازش موازی امکان‌پذیر باشد.

۲. Google Gemini-TTS؛ تولید صدای فارسی با کنترل طبیعی

Google در Gemini-TTS قابلیت تولید گفتار با کنترل طبیعی لحن، احساس، سرعت و نوع اجرا را ارائه کرده است. بر اساس مستندات رسمی، زبان فارسی ایران با کد fa-IR برای Gemini-TTS در وضعیت Preview فهرست شده است.

Preview بودن معمولاً به این معنی است که قابلیت، شرایط دسترسی، پایداری، قیمت‌گذاری یا سطح پشتیبانی آن می‌تواند با یک سرویس کاملاً پایدار عمومی متفاوت باشد.

مزایای Gemini-TTS

  • پشتیبانی اعلام‌شده از فارسی ایران
  • کنترل سبک با دستور طبیعی
  • مناسب برای اجرای احساسی
  • امکان تولید گفت‌وگوی طبیعی
  • قابلیت استفاده در برنامه‌های مبتنی بر Google Cloud
  • کنترل سرعت و تلفظ از طریق دستور

کاربردهای مناسب

  • روایت داستان
  • اجرای شعر
  • پادکست چندشخصیتی
  • گویندگی خبری
  • دستیار صوتی
  • آموزش
  • نمونه اولیه دوبله
  • Voice Agent

پرامپت نمونه:

متن را با صدای فارسی رسمی و گرم اجرا کن.
سرعت متوسط باشد و پس از هر پاراگراف مکث کوتاهی داشته باش.
روی عبارت «زیرساخت هوش مصنوعی» کمی تأکید کن.
لحن تبلیغاتی اغراق‌شده نباشد.

۳. Google Cloud Text-to-Speech؛ مناسب محصولات سازمانی

Google Cloud TTS مجموعه‌ای از Voiceها و فناوری‌های مختلف را ارائه می‌دهد. پشتیبانی زبان و قابلیت‌هایی مانند SSML به Voice انتخاب‌شده وابسته‌اند.

مزایای اصلی:

  • API پایدار
  • فرمت‌های خروجی متنوع
  • امکان پردازش دسته‌ای
  • مناسب برای مقیاس بالا
  • پشتیبانی از SSML در Voiceهای مشخص
  • قابلیت Streaming در مدل‌های واجد شرایط
  • اتصال به اکوسیستم Google Cloud

هنگام استفاده از SSML برای فارسی باید محدودیت‌های هر مدل و تگ را بررسی کنید. برای مثال، مستندات Google درباره SSML محدودیت‌هایی برای استفاده از تگ <lang> با زبان‌هایی از جمله فارسی بیان می‌کند.

۴. Microsoft Azure Speech؛ مناسب سرویس‌های سازمانی

Azure Speech مجموعه‌ای از قابلیت‌ها برای تبدیل متن به گفتار، تشخیص گفتار، Custom Voice، Personal Voice و سرویس‌های مکالمه‌ای ارائه می‌دهد.

قابلیت‌های آن ممکن است شامل موارد زیر باشند:

  • Text-to-Speech
  • Speech-to-Text
  • Streaming
  • SSML
  • Voice Style
  • Custom Neural Voice
  • Personal Voice
  • Speech Avatar
  • Voice Live

اما پشتیبانی فارسی در هر بخش یکسان نیست. برای مثال، یک مدل Real-time ممکن است فارسی را پشتیبانی کند، درحالی‌که Voice پیش‌فرض دیگری برای خروجی فارسی در دسترس نباشد.

پیش از انتخاب Azure، جدول رسمی پشتیبانی زبان و Voice را برای قابلیت، مدل، Region و Locale موردنظر بررسی کنید.

۵. OpenAI Text-to-Speech؛ مناسب اپلیکیشن و Agent صوتی

مدل‌ها و APIهای صوتی OpenAI می‌توانند برای ساخت گفتار، تعامل Real-time و Voice Agent استفاده شوند. کیفیت زبان فارسی، Voiceهای قابل انتخاب و قابلیت هدایت لحن به مدل مورد استفاده وابسته است.

کاربردهای مناسب:

  • خواندن پاسخ چت‌بات
  • دستیار صوتی
  • گویندگی کوتاه
  • پاسخ تلفنی
  • آموزش تعاملی
  • تولید محتوای صوتی
  • رابط صوتی اپلیکیشن

برای محصولات Real-time فقط کیفیت صدا مهم نیست. Latency تولید اولین بخش صوت، امکان لغو پاسخ هنگام صحبت کاربر و Streaming نیز اهمیت دارند.

۶. Narakeet؛ تبدیل متن و اسلاید به گویندگی

Narakeet برای ساخت Voice-over، تبدیل اسلاید به ویدئو و تولید گویندگی چندزبانه مناسب است. این ابزار برای افرادی مفید است که می‌خواهند بدون تدوین پیچیده، از روی PowerPoint یا متن یک ویدئوی گویندگی‌شده بسازند.

کاربردهای مناسب

  • ویدئوی آموزشی
  • معرفی محصول
  • ارائه گویندگی‌شده
  • آموزش کارکنان
  • محتوای شبکه‌های اجتماعی
  • تبدیل متن فارسی به فایل صوتی

مزیت اصلی چنین ابزاری، ترکیب فرایند تولید اسلاید، زمان‌بندی و صدا است؛ اما طبیعی‌بودن فارسی باید با نمونه واقعی آزمایش شود.

۷. Speechify؛ مناسب گوش‌دادن به متن

Speechify بیشتر برای خواندن متن، صفحه وب، سند و کتاب طراحی شده است. این دسته ابزارها برای مصرف محتوا مناسب‌اند، نه لزوماً تولید فایل حرفه‌ای استودیویی.

کاربردها:

  • گوش‌دادن به مقاله
  • مطالعه هنگام رانندگی یا ورزش
  • کمک به افراد دارای اختلال خواندن
  • تبدیل اسناد به تجربه صوتی
  • افزایش سرعت مطالعه
  • مرور محتوای آموزشی

پشتیبانی فارسی، امکان دانلود و مجوز استفاده از خروجی ممکن است به نوع حساب و Voice وابسته باشد.

۸. TTSMaker؛ تبدیل سریع متن به فایل صوتی

TTSMaker و سرویس‌های مشابه برای تبدیل سریع متن به فایل صوتی بدون Workflow پیچیده استفاده می‌شوند.

مزایا:

  • محیط ساده
  • مناسب برای استفاده سریع
  • پشتیبانی از چند زبان
  • امکان انتخاب Voice
  • دریافت فایل خروجی

محدودیت‌ها:

  • کنترل احساسی کمتر
  • کیفیت متفاوت Voiceها
  • محدودیت طول متن
  • ابهام در مجوز برخی Voiceها
  • مناسب‌نبودن برای Voice Agent زنده
  • کنترل فنی کمتر نسبت به APIهای حرفه‌ای

برای استفاده تجاری، شرایط مجوز همان سرویس و Voice انتخاب‌شده را بررسی کنید.

۹. CapCut؛ مناسب گویندگی ویدئوهای کوتاه

CapCut قابلیت Text-to-Speech را در محیط تدوین ویدئو ارائه می‌دهد. مزیت آن این است که صدا مستقیماً روی Timeline قرار می‌گیرد و می‌توان مدت تصاویر، زیرنویس و موسیقی را با آن هماهنگ کرد.

این گزینه برای موارد زیر مناسب است:

  • Instagram Reels
  • YouTube Shorts
  • TikTok
  • ویدئوی معرفی محصول
  • آموزش کوتاه
  • ویدئوی خبری

برای ویدئوهای حرفه‌ای و بلند، کنترل محدود روی تلفظ و کیفیت صدا ممکن است نیاز به ابزار تخصصی‌تر ایجاد کند.

۱۰. API درواره؛ ساخت محصول صوتی اختصاصی

ابزارهای آماده برای تولید چند فایل کافی‌اند، اما اگر بخواهید Text-to-Speech را به محصول خود اضافه کنید، به API نیاز دارید.

با API هوش مصنوعی درواره می‌توان محصولاتی مانند موارد زیر ساخت:

  • چت‌بات سخنگو
  • Voice Agent فارسی
  • خبرخوان هوشمند
  • تبدیل مقاله به پادکست
  • کتاب‌خوان صوتی
  • سامانه آموزش زبان
  • پاسخ‌گوی تلفنی
  • تولید گویندگی ویدئو
  • دستیار دسترس‌پذیری
  • تولید اعلان صوتی شخصی‌سازی‌شده
  • سرویس تبدیل PDF به صدا

درواره یک نقطه اتصال یکپارچه برای دسترسی به مدل‌های مختلف هوش مصنوعی ارائه می‌دهد. قابلیت TTS، شناسه مدل، فرمت‌های صوتی و Endpoint موردنیاز باید بر اساس مدل فعال در کاتالوگ و مستندات همان مدل انتخاب شوند.

بهترین هوش مصنوعی تبدیل متن فارسی به صدا کدام است؟

بهترین گزینه به کاربرد بستگی دارد.

برای طبیعی‌ترین گویندگی فارسی

یک مدل پیشرفته چندزبانه مانند Eleven v3 یا Gemini-TTS را با متن واقعی خود آزمایش کنید. کیفیت فارسی ممکن است میان Voiceها تفاوت زیادی داشته باشد.

برای ساخت ویدئو

ElevenLabs، Narakeet و CapCut Workflow ساده‌تری برای گویندگی محتوا ارائه می‌دهند.

برای کتاب صوتی

مدلی انتخاب کنید که:

  • صدای پایدار در متن طولانی داشته باشد.
  • احساس را کنترل کند.
  • امکان تولید دسته‌ای داشته باشد.
  • Voice در فصل‌های مختلف تغییر نکند.
  • مجوز انتشار تجاری ارائه دهد.

برای Voice Agent

اولویت‌ها متفاوت‌اند:

  • Latency پایین
  • Streaming
  • امکان قطع پاسخ
  • تولید سریع اولین Audio Chunk
  • صدای واضح
  • هزینه مناسب
  • پایداری در بار بالا

برای توسعه‌دهندگان

API، مستندات، قیمت، Rate Limit، فرمت خروجی، Streaming، مجوز و پشتیبانی مدل اهمیت بیشتری از رابط گرافیکی دارند.

چگونه متن فارسی را برای صدای طبیعی آماده کنیم؟

کیفیت صدا فقط به مدل وابسته نیست. نحوه نوشتن متن تأثیر زیادی بر تلفظ و لحن دارد.

۱. متن را برای شنیدن بنویسید، نه خواندن

متن نوشتاری:

در این مقاله، مزایا، معایب، هزینه‌ها، محدودیت‌ها و کاربردهای مدل‌های مختلف بررسی خواهند شد.

نسخه مناسب گفتار:

در این راهنما، مدل‌های مختلف را بررسی می‌کنیم. ابتدا سراغ مزایا و معایب می‌رویم. سپس، هزینه‌ها و محدودیت‌ها را مقایسه می‌کنیم.

جمله کوتاه‌تر به مدل اجازه می‌دهد مکث و تأکید طبیعی‌تری ایجاد کند.

۲. اعداد را به حروف تبدیل کنید

این متن ممکن است مبهم خوانده شود:

در سال 1405، تعداد کاربران 25.7% افزایش یافت.

نسخه مناسب‌تر:

در سال هزار و چهارصد و پنج، تعداد کاربران بیست‌وپنج ممیز هفت دهم درصد افزایش یافت.

یا برای لحن طبیعی:

در سال هزار و چهارصد و پنج، تعداد کاربران حدود بیست‌وشش درصد افزایش پیدا کرد.

اعداد مالی، شماره تلفن، نسخه نرم‌افزار و تاریخ هرکدام قواعد متفاوتی دارند.

۳. تاریخ را بازنویسی کنید

متن نامناسب:

1405/04/25

متن مناسب:

بیست‌وپنجم تیرماه هزار و چهارصد و پنج

برای تاریخ میلادی:

پانزدهم ژوئیه دو هزار و بیست‌وشش

۴. مخفف‌ها را کنترل کنید

عبارت API ممکن است به شکل‌های متفاوت خوانده شود:

  • اِی‌پی‌آی
  • اَپی
  • API به‌عنوان کلمه انگلیسی

برای خروجی فارسی بهتر است تلفظ موردنظر را در متن مشخص کنید:

اِی‌پی‌آی درواره

برای برندهای انگلیسی نیز ممکن است به نوشتن آوایی نیاز داشته باشید:

پایتون
نِکست دات جِی‌اِس
پُستگرس‌کیواِل

در متن نمایشی سایت می‌توانید شکل رسمی انگلیسی را حفظ کنید، اما نسخه‌ای جداگانه و آوایی برای TTS بسازید.

۵. از علائم نگارشی برای مکث استفاده کنید

  • ویرگول: مکث کوتاه
  • نقطه: پایان جمله
  • دونقطه: ورود به توضیح
  • سه‌نقطه: مکث احساسی، در صورت پشتیبانی مناسب
  • علامت سؤال: تغییر آهنگ جمله
  • پاراگراف جدید: مکث بلندتر

استفاده بیش از حد از ویرگول یا سه‌نقطه ممکن است گفتار را مصنوعی کند.

۶. نیم‌فاصله را آزمایش کنید

مدل‌ها ممکن است با نیم‌فاصله رفتار متفاوتی داشته باشند:

می‌شود
می شود
میشه

برای متن رسمی، «می‌شود» مناسب‌تر است؛ اما اگر مدل تلفظ اشتباه دارد، نسخه‌های دیگر را در محیط آزمایشی مقایسه کنید.

۷. کلمات هم‌نویسه را بازنویسی کنید

بعضی واژه‌ها بدون زمینه یا اعراب مبهم‌اند. اگر مدل تلفظ را اشتباه انجام می‌دهد:

  • کلمه را در جمله روشن‌تری قرار دهید.
  • از مترادف استفاده کنید.
  • اعراب محدود اضافه کنید.
  • شکل آوایی بنویسید.
  • متن را به بخش کوچک‌تری تقسیم کنید.

افزودن اعراب به تمام متن معمولاً ضروری نیست و ممکن است نتیجه را بدتر کند.

۸. متن فارسی و انگلیسی را مدیریت کنید

متن زیر ممکن است تغییر لهجه نامناسب ایجاد کند:

با استفاده از OpenAI-compatible API در Next.js می‌توانید Streaming را فعال کنید.

نسخه مناسب گویندگی:

با استفاده از اِی‌پی‌آی سازگار با اُپن اِی‌آی، در فریم‌ورک نِکست دات جِی‌اِس، می‌توانید پاسخ را به‌صورت جریانی دریافت کنید.

نسخه صوتی لازم نیست دقیقاً با نسخه نوشتاری یکسان باشد.

نمونه تابع آماده‌سازی متن فارسی برای TTS

import re

NUMBER_WORDS = {
    "%": " درصد ",
    "&": " و ",
    "@": " اَت ",
}


def normalize_persian_tts(text: str) -> str:
    text = text.replace("\u200c", "\u200c")

    for symbol, replacement in NUMBER_WORDS.items():
        text = text.replace(symbol, replacement)

    text = re.sub(r"https?://\S+", " لینک مربوطه ", text)
    text = re.sub(r"`{1,3}.*?`{1,3}", " ", text, flags=re.DOTALL)
    text = re.sub(r"#{1,6}\s*", "", text)
    text = re.sub(r"\[(.*?)\]\(.*?\)", r"\1", text)

    text = re.sub(r"\s+", " ", text)
    text = re.sub(r"\s*([،؛؟.!])\s*", r"\1 ", text)

    return text.strip()

این تابع فقط پاک‌سازی اولیه انجام می‌دهد. تبدیل عدد به حروف، تاریخ، واحد پول و مخفف‌ها به کتابخانه یا قواعد دقیق‌تری نیاز دارد.

پرامپت‌های آماده برای گویندگی فارسی

در مدل‌هایی که امکان هدایت لحن با متن طبیعی دارند، می‌توانید از دستورهای زیر استفاده کنید.

گویندگی آموزشی

این متن را با صدای فارسی رسمی، گرم و واضح اجرا کن.
سرعت کمی آهسته‌تر از گفت‌وگوی روزمره باشد.
پس از هر مفهوم اصلی مکث کوتاهی داشته باش.
اصطلاحات فنی را شمرده تلفظ کن.
لحن معلم‌گونه باشد، اما خشک و رسمی نباشد.

گویندگی تبلیغاتی

متن را با صدای فارسی مطمئن، مدرن و پرانرژی اجرا کن.
از اغراق رادیویی پرهیز کن.
نام برند را واضح و با تأکید ملایم بخوان.
در جمله پایانی سرعت را کمی کاهش بده و روی دعوت به اقدام تأکید کن.

کتاب صوتی

این بخش را با صدای فارسی آرام و داستان‌گو اجرا کن.
میان روایت و دیالوگ‌ها تفاوت ظریف ایجاد کن.
مکث پاراگراف‌ها را حفظ کن.
لحن طبیعی باشد و از اجرای نمایشی بیش از حد پرهیز شود.

خبرخوان

متن را با لحن فارسی رسمی و خبری اجرا کن.
سرعت متوسط، تلفظ دقیق و احساس کنترل‌شده باشد.
اعداد و نام‌ها را شمرده بخوان.
در پایان هر خبر مکث مشخص ایجاد کن.

پادکست دوستانه

متن را با لحن فارسی صمیمی و طبیعی اجرا کن؛
مانند میزبان یک پادکست فناوری.
سرعت متوسط باشد.
روی پرسش‌ها و مثال‌ها تأکید ملایم داشته باش.
از لحن رسمی و رباتیک پرهیز کن.

سیستم تلفنی

متن را با صدای فارسی بسیار واضح و خنثی اجرا کن.
جمله‌ها کوتاه و سرعت کمی آهسته باشد.
شماره گزینه‌ها را با مکث بخوان.
هیچ موسیقی یا احساس نمایشی اضافه نکن.

تبدیل PDF به صدا با هوش مصنوعی

تبدیل PDF به کتاب صوتی فقط استخراج متن و ارسال آن به TTS نیست. فایل ممکن است شامل جدول، پاورقی، شماره صفحه، سربرگ و عناصر غیرقابل‌خواندن باشد.

مراحل صحیح

  1. تشخیص دهید PDF متنی است یا اسکن‌شده.
  2. برای فایل اسکن‌شده OCR انجام دهید.
  3. سربرگ، پابرگ و شماره صفحه را حذف کنید.
  4. ترتیب ستون‌ها را اصلاح کنید.
  5. جدول و فرمول را به توضیح گفتاری تبدیل کنید.
  6. منابع و URLهای طولانی را حذف یا خلاصه کنید.
  7. عددها و مخفف‌ها را Normalization کنید.
  8. متن را به فصل و بخش تقسیم کنید.
  9. هر بخش را جداگانه به صدا تبدیل کنید.
  10. فایل‌ها را از نظر Volume و کیفیت یکسان کنید.
  11. Metadata و ترتیب فصل‌ها را ثبت کنید.

توضیح جدول در نسخه صوتی

جدول نوشتاری:

طرحقیمتکاربران
پایه۱۰۰۵۰
حرفه‌ای۲۵۰۱۲۰

نسخه صوتی مناسب:

این جدول دو طرح را مقایسه می‌کند. طرح پایه با قیمت صد واحد، برای پنجاه کاربر در نظر گرفته شده است. طرح حرفه‌ای با قیمت دویست‌وپنجاه واحد، از صدوبیست کاربر پشتیبانی می‌کند.

ساخت پادکست با هوش مصنوعی

یک Workflow کامل تولید پادکست می‌تواند شامل این مراحل باشد:

flowchart TD
    A["موضوع و منابع"] --> B["تحقیق و اعتبارسنجی"]
    B --> C["نگارش متن گفتاری"]
    C --> D["تولید صدا با TTS"]
    D --> E["موسیقی و تدوین"]
    E --> F["کنترل کیفیت"]
    F --> G["انتشار پادکست"]

ساختار متن پادکست

  • Hook ابتدایی
  • معرفی مسئله
  • وعده اپیزود
  • بخش‌های اصلی
  • مثال
  • جمع‌بندی
  • دعوت به اقدام
  • Outro

متن پادکست را مانند مقاله ننویسید. شنونده امکان مشاهده عنوان‌ها و برگشت سریع به پاراگراف قبل را ندارد؛ بنابراین باید مسیر بحث را به‌صورت شفاهی یادآوری کنید.

تبدیل مقاله به پادکست

پرامپت پیشنهادی:

مقاله زیر را به متن یک پادکست فارسی ۸ دقیقه‌ای تبدیل کن.

مخاطب: توسعه‌دهندگان نرم‌افزار
لحن: حرفه‌ای، صمیمی و دقیق

قواعد:
- مقاله را کلمه‌به‌کلمه نخوان.
- مقدمه جذاب ۲۰ ثانیه‌ای بنویس.
- اصطلاحات فنی را ساده اما دقیق توضیح بده.
- جمله‌ها برای شنیدن کوتاه باشند.
- برای انتقال میان بخش‌ها جمله رابط بنویس.
- هیچ آمار یا منبع جدیدی اضافه نکن.
- پایان شامل جمع‌بندی و دعوت به اقدام باشد.
- نسخه آوایی اصطلاحات انگلیسی را در پرانتز قرار بده.

Voice Cloning چیست؟

Voice Cloning یا شبیه‌سازی صدا فرایندی است که طی آن یک مدل با استفاده از نمونه صوتی، ویژگی‌های صدای یک شخص را بازسازی می‌کند.

این ویژگی‌ها می‌توانند شامل موارد زیر باشند:

  • رنگ صدا
  • زیر و بمی
  • ریتم گفتار
  • لهجه
  • نحوه مکث
  • انرژی
  • ویژگی‌های تلفظ

در Instant Voice Cloning ممکن است نمونه کوتاه کافی باشد. در Professional Voice Cloning معمولاً داده بیشتر و کنترل‌های هویتی دقیق‌تری نیاز است.

چگونه نمونه مناسب برای شبیه‌سازی صدا ضبط کنیم؟

  • محیط کاملاً آرام انتخاب کنید.
  • از یک میکروفون و فاصله ثابت استفاده کنید.
  • فایل بدون موسیقی و افکت باشد.
  • Echo و Reverb محیط را کاهش دهید.
  • به‌صورت طبیعی صحبت کنید.
  • سرعت گفتار را ثابت نگه دارید.
  • چند نوع جمله و حالت احساسی ضبط کنید.
  • روی فایل Compression شدید اعمال نکنید.
  • از تغییر میکروفون میان نمونه‌ها خودداری کنید.
  • صدای افراد دیگر در فایل وجود نداشته باشد.

اگر هدف تولید فارسی است، نمونه صوتی نیز باید بخش کافی از گفتار فارسی طبیعی داشته باشد.

آیا شبیه‌سازی صدای دیگران قانونی است؟

این موضوع به کشور، رضایت صاحب صدا، هدف استفاده و قوانین پلتفرم بستگی دارد. استفاده بدون رضایت می‌تواند مشکلاتی در حوزه‌های زیر ایجاد کند:

  • حق شخصیت
  • حریم خصوصی
  • جعل هویت
  • حق تبلیغات
  • کلاهبرداری
  • افترا
  • حقوق اجراکننده
  • قراردادهای کاری
  • قوانین پلتفرم

برای استفاده حرفه‌ای باید:

  1. رضایت روشن و قابل اثبات دریافت شود.
  2. کاربردهای مجاز مشخص شوند.
  3. مدت و قلمرو مجوز تعیین شود.
  4. امکان لغو رضایت بررسی شود.
  5. نگهداری نمونه صوتی شفاف باشد.
  6. دسترسی به Voice Model محدود شود.
  7. خروجی در صورت لزوم به‌عنوان صدای مصنوعی معرفی شود.

صدای کارکنان، بازیگران، مشتریان یا اعضای خانواده را صرفاً به دلیل داشتن فایل صوتی آن‌ها شبیه‌سازی نکنید.

آیا می‌توان صدای افراد مشهور را ساخت؟

تقلید صدای خواننده، بازیگر، سیاست‌مدار یا شخصیت عمومی بدون اجازه می‌تواند مخاطب را گمراه کند و خطر حقوقی یا پلتفرمی داشته باشد.

حتی اگر هدف طنز باشد، بهتر است:

  • مصنوعی‌بودن صدا را شفاف کنید.
  • از انتساب گفته دروغین خودداری کنید.
  • برای تبلیغ محصول از صدای جعلی استفاده نکنید.
  • شرایط پلتفرم را بررسی کنید.
  • از Voiceهای دارای مجوز استفاده کنید.

ساخت Text-to-Speech با API درواره

درواره API سازگار با OpenAI و دسترسی یکپارچه به مدل‌های مختلف ارائه می‌کند. اگر مدل صوتی انتخاب‌شده از الگوی OpenAI-compatible Speech پشتیبانی کند، معمولاً می‌توان از SDK رسمی OpenAI با تغییر base_url استفاده کرد.

پیش از اجرا، این موارد را در مستندات مدل بررسی کنید:

  • شناسه دقیق مدل
  • Endpoint
  • Voiceهای قابل استفاده
  • فرمت خروجی
  • حداکثر طول متن
  • پشتیبانی از Streaming
  • زبان‌های پشتیبانی‌شده
  • قیمت
  • Rate Limit

نمونه Python برای تولید صدا

نصب کتابخانه:

pip install openai python-dotenv

فایل .env:

DARVAREH_API_KEY=your_api_key
DARVAREH_TTS_MODEL=your-tts-model-id
DARVAREH_TTS_VOICE=your-supported-voice

کد نمونه برای مدل‌هایی که Endpoint سازگار با OpenAI Speech دارند:

import os
from pathlib import Path

from dotenv import load_dotenv
from openai import OpenAI

load_dotenv()

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)

output_file = Path("speech-fa.mp3")

with client.audio.speech.with_streaming_response.create(
    model=os.environ["DARVAREH_TTS_MODEL"],
    voice=os.environ["DARVAREH_TTS_VOICE"],
    input=(
        "سلام. به درواره خوش آمدید. "
        "با یک اتصال، به مدل‌های مختلف هوش مصنوعی دسترسی دارید."
    ),
) as response:
    response.stream_to_file(output_file)

print(f"Saved to: {output_file}")

نام Voice نباید حدس زده شود. فقط یکی از Voiceهای پشتیبانی‌شده توسط مدل انتخابی را قرار دهید.

نمونه JavaScript

نصب وابستگی:

npm install openai dotenv

کد:

import "dotenv/config";
import fs from "node:fs/promises";
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.DARVAREH_API_KEY,
  baseURL: "https://api.darvareh.ir/v1",
});

const response = await client.audio.speech.create({
  model: process.env.DARVAREH_TTS_MODEL,
  voice: process.env.DARVAREH_TTS_VOICE,
  input:
    "سلام. این فایل صوتی با استفاده از API هوش مصنوعی تولید شده است.",
});

const buffer = Buffer.from(await response.arrayBuffer());

await fs.writeFile("speech-fa.mp3", buffer);

کلید API را هرگز در کد React، اپلیکیشن مرورگر یا مخزن عمومی قرار ندهید. درخواست تولید صدا باید از Backend ارسال شود.

استفاده مستقیم با cURL

برای مدل‌های سازگار با Endpoint استاندارد Speech:

curl https://api.darvareh.ir/v1/audio/speech \
  -H "Authorization: Bearer $DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "your-tts-model-id",
    "voice": "your-supported-voice",
    "input": "سلام. به راهنمای تبدیل متن فارسی به صدا خوش آمدید."
  }' \
  --output speech-fa.mp3

Endpoint و پارامترهای نهایی را با مستندات مدل فعال در درواره تطبیق دهید. همه مدل‌های صوتی الزاماً از یک Schema یکسان استفاده نمی‌کنند.

تولید متن گویندگی قبل از TTS

می‌توان ابتدا با یک مدل زبانی متن را برای اجرا آماده کرد:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)

article = """
هوش مصنوعی مولد به کسب‌وکارها اجازه می‌دهد...
"""

response = client.chat.completions.create(
    model=os.environ["DARVAREH_TEXT_MODEL"],
    temperature=0.3,
    messages=[
        {
            "role": "system",
            "content": """
متن ورودی را برای گویندگی فارسی آماده کن.

قواعد:
- جمله‌ها را کوتاه کن.
- معنای اصلی را تغییر نده.
- عددها را به حروف بنویس.
- URL و Markdown را حذف کن.
- مخفف‌های انگلیسی را به شکل قابل تلفظ بنویس.
- هیچ اطلاعات جدیدی اضافه نکن.
- پاراگراف‌بندی مناسب مکث ایجاد کن.
            """.strip(),
        },
        {
            "role": "user",
            "content": article,
        },
    ],
)

narration_text = response.choices[0].message.content
print(narration_text)

سپس narration_text به مدل TTS ارسال می‌شود.

معماری تبدیل مقاله به صوت

flowchart TD
    A["مقاله، PDF یا متن"] --> B["استخراج و پاک‌سازی"]
    B --> C["بازنویسی برای گفتار"]
    C --> D["تقسیم به بخش‌های کوتاه"]
    D --> E["مدل Text-to-Speech"]
    E --> F["ترکیب و یکسان‌سازی صدا"]
    F --> G["MP3، پادکست یا پخش آنلاین"]

چرا متن را Chunk کنیم؟

مدل‌های TTS محدودیت طول ورودی دارند. حتی اگر محدودیت رسمی بزرگ باشد، تولید بخش‌های کوتاه‌تر کنترل بیشتری ایجاد می‌کند.

Chunk مناسب باید:

  • در مرز جمله یا پاراگراف تمام شود.
  • خیلی کوتاه نباشد.
  • از وسط نقل‌قول قطع نشود.
  • لحن و شخصیت یکسان داشته باشد.
  • ترتیب مشخصی داشته باشد.
  • قابلیت تولید مجدد مستقل داشته باشد.

نمونه ساده:

def split_paragraphs(text: str, max_chars: int = 1800) -> list[str]:
    paragraphs = [
        paragraph.strip()
        for paragraph in text.split("\n")
        if paragraph.strip()
    ]

    chunks = []
    current = ""

    for paragraph in paragraphs:
        candidate = f"{current}\n{paragraph}".strip()

        if len(candidate) <= max_chars:
            current = candidate
        else:
            if current:
                chunks.append(current)
            current = paragraph

    if current:
        chunks.append(current)

    return chunks

برای متن واقعی باید پاراگراف‌های بسیار بلند نیز در سطح جمله تقسیم شوند.

ترکیب فایل‌های صوتی

پس از تولید بخش‌ها می‌توان با FFmpeg آن‌ها را ترکیب کرد. ابتدا یک فایل فهرست بسازید:

file 'part-001.mp3'
file 'part-002.mp3'
file 'part-003.mp3'

سپس:

ffmpeg -f concat -safe 0 -i files.txt -c copy final.mp3

اگر Codec، Sample Rate یا تنظیمات فایل‌ها یکسان نباشند، باید Re-encode انجام شود:

ffmpeg -f concat -safe 0 -i files.txt \
  -ar 44100 -ac 2 -b:a 192k final.mp3

برای کتاب صوتی بهتر است Loudness تمام فصل‌ها نیز یکسان‌سازی شود.

Streaming در Text-to-Speech

در اپلیکیشن مکالمه‌ای نباید تا تولید کامل فایل منتظر بمانید. مدل باید بخش‌های صوتی را به‌صورت Stream ارسال کند.

جریان ساده:

sequenceDiagram
    participant U as کاربر
    participant A as اپلیکیشن
    participant T as مدل TTS
    U->>A: ارسال پیام
    A->>T: درخواست تولید گفتار
    T-->>A: Audio Chunkها
    A-->>U: پخش تدریجی صدا

شاخص‌های مهم:

  • Time to First Byte: زمان دریافت اولین داده
  • Time to First Audio: زمان شروع صدای قابل پخش
  • Real-Time Factor: نسبت زمان پردازش به طول صدا
  • Jitter: نوسان رسیدن Chunkها
  • Interruption Latency: زمان توقف صدا پس از صحبت کاربر

ساخت Voice Agent فارسی

یک Voice Agent کامل معمولاً چهار بخش دارد:

flowchart TD
    A["صدای کاربر"] --> B["Speech-to-Text"]
    B --> C["مدل زبانی و ابزارها"]
    C --> D["Text-to-Speech"]
    D --> E["پخش پاسخ صوتی"]

برای مکالمه طبیعی باید قابلیت‌های بیشتری اضافه شود:

  • Voice Activity Detection
  • تشخیص پایان صحبت
  • Barge-in
  • لغو پاسخ قبلی
  • Streaming
  • مدیریت حافظه مکالمه
  • Tool Calling
  • کنترل Timeout
  • Fallback
  • ثبت هزینه
  • محافظت از اطلاعات شخصی

Barge-in چیست؟

Barge-in یعنی کاربر بتواند هنگام صحبت Agent، حرف آن را قطع کند. در این حالت سامانه باید:

  1. شروع صحبت کاربر را تشخیص دهد.
  2. پخش صوت قبلی را متوقف کند.
  3. درخواست TTS قبلی را لغو کند.
  4. صدای جدید کاربر را به متن تبدیل کند.
  5. پاسخ تازه‌ای بسازد.

بدون Barge-in، دستیار صوتی مانند پیام ضبط‌شده عمل می‌کند و تجربه طبیعی نخواهد داشت.

طراحی Cache برای کاهش هزینه TTS

عبارت‌های ثابت را نباید برای هر درخواست دوباره تولید کرد:

  • سلام و خوشامدگویی
  • پیام انتظار
  • خطای عمومی
  • اعلام ساعات کاری
  • پیام پایان مکالمه
  • منوی تلفنی

کلید Cache می‌تواند از این مقادیر ساخته شود:

hash(
  model_id +
  voice_id +
  normalized_text +
  speed +
  output_format +
  language
)

فایل تولیدشده در Object Storage ذخیره و URL آن در Cache ثبت می‌شود.

اطلاعات حساس یا متن شخصی‌سازی‌شده را بدون سیاست نگهداری مناسب Cache نکنید.

مدل داده پیشنهادی برای درخواست صوتی

CREATE TABLE speech_generations (
    id UUID PRIMARY KEY,
    user_id UUID NOT NULL,
    model_id TEXT NOT NULL,
    voice_id TEXT NOT NULL,
    language TEXT,
    input_text TEXT NOT NULL,
    input_hash TEXT NOT NULL,
    status TEXT NOT NULL DEFAULT 'queued',
    output_format TEXT NOT NULL DEFAULT 'mp3',
    audio_url TEXT,
    duration_ms INTEGER,
    character_count INTEGER,
    estimated_cost BIGINT,
    final_cost BIGINT,
    error_code TEXT,
    error_message TEXT,
    created_at TIMESTAMP NOT NULL,
    completed_at TIMESTAMP
);

اگر متن ممکن است شامل اطلاعات حساس باشد، ذخیره input_text باید اختیاری، رمزگذاری‌شده یا دارای زمان حذف مشخص باشد.

مدیریت خطا در TTS

خطاهای رایج:

  • مدل یا Voice نامعتبر
  • طول متن بیش از محدودیت
  • فرمت خروجی پشتیبانی‌نشده
  • Rate Limit
  • موجودی ناکافی
  • Timeout
  • خطای ارائه‌دهنده
  • محتوای غیرمجاز
  • فایل ناقص
  • قطع اتصال Stream

راهبرد Retry:

  • خطای 429: Retry با Exponential Backoff
  • خطای 5xx: Retry محدود
  • Timeout: Retry با Idempotency
  • مدل نامعتبر: Retry نکنید
  • متن طولانی: ورودی را Chunk کنید
  • محتوای مسدودشده: به کاربر توضیح دهید
  • موجودی ناکافی: درخواست را متوقف کنید

تولید صوت هزینه‌بر است. Retry بدون Idempotency ممکن است چند فایل مشابه بسازد و هزینه چندباره ایجاد کند.

امنیت و حریم خصوصی

در محصولات صوتی این موارد ضروری‌اند:

  • کلید API فقط در Backend
  • محدودیت طول متن
  • Rate Limiting
  • کنترل دسترسی فایل‌ها
  • استفاده از Signed URL
  • حذف دوره‌ای فایل‌های موقت
  • رمزگذاری داده‌های حساس
  • ثبت رضایت Voice Cloning
  • جلوگیری از جعل هویت
  • Watermark در صورت پشتیبانی
  • ثبت مدل، Voice و زمان تولید
  • جلوگیری از دسترسی عمومی به Voice Model خصوصی
  • سیاست مشخص نگهداری نمونه صوتی

معیارهای ارزیابی صدای فارسی

طبیعی‌بودن

آیا صدا شبیه گفتار انسان است یا ریتم رباتیک دارد؟

تلفظ

آیا کلمات فارسی، نام‌ها، اعداد و واژه‌های انگلیسی درست خوانده می‌شوند؟

ثبات Voice

آیا رنگ و شخصیت صدا در متن طولانی ثابت می‌ماند؟

لحن

آیا سؤال، جمله خبری، هشدار و متن احساسی با آهنگ مناسب خوانده می‌شوند؟

کنترل‌پذیری

آیا سرعت، مکث، احساس و تلفظ قابل هدایت‌اند؟

Latency

آیا صدا برای مکالمه زنده به‌اندازه کافی سریع تولید می‌شود؟

هزینه

هزینه بر اساس کاراکتر، توکن صوتی، ثانیه یا درخواست محاسبه می‌شود؟

مجوز

آیا می‌توان خروجی را در تبلیغ، پادکست، YouTube یا محصول تجاری استفاده کرد؟

ساخت Benchmark فارسی برای انتخاب مدل TTS

به‌جای انتخاب مدل بر اساس یک Demo انگلیسی، مجموعه آزمون فارسی بسازید:

متن رسمی

بر اساس گزارش منتشرشده، فرایند ثبت درخواست از ابتدای مردادماه تغییر خواهد کرد.

متن محاوره‌ای

سلام، حالت چطوره؟ امروز می‌خوایم با هم یک قابلیت جدید رو امتحان کنیم.

عدد و تاریخ

مبلغ فاکتور، دو میلیون و چهارصد و پنجاه هزار تومان است و تا سی‌ویکم شهریور اعتبار دارد.

متن فنی

برای اتصال، نشانی بِیس یوآراِل را روی اِی‌پی‌آی نقطه درواره نقطه آی‌آر، اسلش وی یک قرار دهید.

جمله پرسشی

آیا می‌خواهید درخواست قبلی را لغو و فرایند جدیدی آغاز کنید؟

متن احساسی

بعد از سال‌ها، دوباره صدای باران را در حیاط خانه قدیمی شنیدم.

برای هر خروجی امتیاز ۱ تا ۵ ثبت کنید:

  • طبیعی‌بودن
  • تلفظ
  • لحن
  • ثبات
  • سرعت
  • کیفیت صوت
  • هزینه

خطاهای رایج تبدیل متن فارسی به صدا

ارسال مستقیم متن مقاله

متن نوشتاری برای شنیدن طراحی نشده است و معمولاً جمله‌های طولانی دارد.

انتخاب Voice بر اساس نمونه انگلیسی

یک Voice ممکن است در انگلیسی عالی و در فارسی ضعیف باشد.

بی‌توجهی به اعداد

شماره، تاریخ، نسخه نرم‌افزار و درصد باید متناسب با کاربرد بازنویسی شوند.

استفاده از یک فایل بسیار طولانی

تولید بخش‌بندی‌شده اصلاح، Retry و کنترل هزینه را آسان‌تر می‌کند.

نادیده‌گرفتن مجوز تجاری

دانلود فایل به معنی اجازه استفاده در تبلیغات یا محصول نیست.

شبیه‌سازی صدای دیگران بدون رضایت

دسترسی به نمونه صوتی، مجوز ساخت Voice Clone محسوب نمی‌شود.

قراردادن کلید API در Frontend

کاربر می‌تواند کلید را استخراج و از اعتبار حساب سوءاستفاده کند.

ذخیره عمومی فایل‌ها

فایل‌های شخصی یا محرمانه باید با دسترسی محدود و Signed URL ارائه شوند.

چک‌لیست نهایی تولید صدای فارسی

  • مدل انتخابی رسماً از فارسی پشتیبانی می‌کند.
  • Voice با یک متن فارسی متنوع آزمایش شده است.
  • متن برای شنیدن بازنویسی شده است.
  • عددها و تاریخ‌ها به شکل مناسب درآمده‌اند.
  • تلفظ برندها و واژه‌های انگلیسی بررسی شده است.
  • جمله‌های طولانی کوتاه شده‌اند.
  • متن بلند به Chunkهای منطقی تقسیم شده است.
  • Volume بخش‌ها یکسان است.
  • سکوت ابتدا و انتها بررسی شده است.
  • مجوز استفاده تجاری بررسی شده است.
  • برای شبیه‌سازی صدا رضایت معتبر وجود دارد.
  • کلید API فقط در Backend نگهداری می‌شود.
  • فایل‌های حساس عمومی نیستند.
  • هزینه و Rate Limit کنترل شده‌اند.

پرسش‌های متداول

بهترین هوش مصنوعی برای تبدیل متن فارسی به صدا چیست؟

ElevenLabs و Gemini-TTS از گزینه‌های مهم برای صدای فارسی هستند. بهترین انتخاب به طبیعی‌بودن Voice، کاربرد، هزینه، Latency و مجوز استفاده بستگی دارد. هر مدل را با متن واقعی فارسی خود آزمایش کنید.

آیا ElevenLabs از زبان فارسی پشتیبانی می‌کند؟

بله، طبق مستندات رسمی، مدل Eleven v3 فارسی را در فهرست زبان‌های پشتیبانی‌شده دارد. تمام مدل‌های ElevenLabs الزاماً فهرست زبان یکسانی ندارند.

چگونه متن فارسی را رایگان به صدا تبدیل کنیم؟

برخی سرویس‌ها مانند TTSMaker، CapCut یا طرح‌های رایگان محدود ابزارهای حرفه‌ای امکان تولید رایگان دارند. سقف کاراکتر، امکان دانلود و مجوز استفاده تجاری را بررسی کنید.

چگونه صدای هوش مصنوعی فارسی طبیعی‌تر شود؟

جمله‌ها را کوتاه کنید، عددها را به حروف بنویسید، علائم نگارشی مناسب قرار دهید، واژه‌های انگلیسی را آوایی کنید و چند Voice مختلف را با یک متن ثابت آزمایش کنید.

آیا می‌توان PDF فارسی را به صدا تبدیل کرد؟

بله. ابتدا متن PDF استخراج می‌شود؛ اگر فایل اسکن‌شده باشد به OCR نیاز دارد. سپس سربرگ‌ها، شماره صفحات، جدول‌ها و عناصر غیرضروری حذف و متن برای TTS آماده می‌شود.

آیا می‌توان با هوش مصنوعی کتاب صوتی ساخت؟

بله، اما باید مجوز متن و Voice، ثبات صدا، تلفظ، تقسیم فصل‌ها، تدوین، Loudness و مجوز تجاری خروجی بررسی شوند.

Voice Cloning چیست؟

Voice Cloning فناوری ساخت صدایی مصنوعی با ویژگی‌های صوتی یک فرد از روی نمونه ضبط‌شده است. استفاده از صدای دیگران باید با رضایت روشن و رعایت قوانین انجام شود.

آیا می‌توان صدای افراد مشهور را شبیه‌سازی کرد؟

از نظر فنی ممکن است، اما استفاده بدون اجازه می‌تواند موجب جعل هویت، نقض حقوق شخص و حذف محتوا شود. بهتر است از Voiceهای مجاز یا صدای خودتان استفاده کنید.

آیا فایل تولیدشده با TTS قابل استفاده تجاری است؟

به شرایط سرویس، مدل، Voice و نوع اشتراک بستگی دارد. رایگان‌بودن یا امکان دانلود، مجوز تجاری را تضمین نمی‌کند.

چگونه Text-to-Speech را به سایت اضافه کنیم؟

در Backend درخواست را به API مدل صوتی ارسال کنید، فایل یا Stream صوتی را دریافت و برای Frontend پخش کنید. کلید API نباید در مرورگر قرار بگیرد.

آیا API درواره از تبدیل متن به صدا پشتیبانی می‌کند؟

درواره دسترسی یکپارچه به مدل‌های مختلف هوش مصنوعی ارائه می‌دهد. پشتیبانی TTS، Voiceها، Endpoint و فرمت خروجی به مدل فعال انتخاب‌شده بستگی دارد و باید در کاتالوگ و مستندات مدل بررسی شود.

تفاوت Text-to-Speech و Speech-to-Text چیست؟

Text-to-Speech متن را به صدا تبدیل می‌کند. Speech-to-Text یا STT صدای ضبط‌شده را به متن تبدیل می‌کند. Voice Agent معمولاً از هر دو فناوری استفاده می‌کند.

جمع‌بندی

تبدیل متن به صدا با هوش مصنوعی برای ساخت پادکست، کتاب صوتی، ویدئو، دستیار صوتی و محصولات دسترس‌پذیر کاربرد دارد. ابزارهایی مانند ElevenLabs و Gemini-TTS قابلیت‌های مهمی برای تولید صدای فارسی ارائه می‌کنند، اما کیفیت هر Voice باید با متن واقعی آزمایش شود.

برای رسیدن به صدای طبیعی، فقط انتخاب مدل کافی نیست. متن باید برای شنیدن بازنویسی شود، عددها و تاریخ‌ها Normalization شوند، واژه‌های انگلیسی به شکل قابل تلفظ درآیند و محتوای طولانی به بخش‌های منطقی تقسیم شود.

در Voice Cloning نیز رضایت صاحب صدا، امنیت Voice Model و شفافیت استفاده اهمیت اساسی دارند. صدای مصنوعی می‌تواند ابزار قدرتمندی باشد، اما نباید برای جعل هویت یا گمراه‌کردن مخاطب استفاده شود.

اگر می‌خواهید قابلیت تبدیل متن به صدا، ساخت پادکست یا Voice Agent را به محصول خود اضافه کنید، API هوش مصنوعی درواره امکان دسترسی یکپارچه به مدل‌های مختلف را فراهم می‌کند. سازگاری با ساختار OpenAI، پرداخت ریالی و امکان مدیریت مصرف، توسعه محصولات صوتی را برای برنامه‌نویسان ایرانی ساده‌تر می‌کند.

مقالات مرتبط پیشنهادی

Read more