ساخت کتاب صوتی با هوش مصنوعی؛ آموزش کامل از متن تا فایل نهایی

در این راهنمای جامع یاد می‌گیرید چگونه با هوش مصنوعی یک کتاب صوتی فارسی تولید کنید؛ از آماده‌سازی متن و انتخاب صدای راوی تا اصلاح تلفظ، تولید فصل‌ها، ویرایش صوت، ساخت MP3 و M4B و خودکارسازی فرایند با API درواره.

Share
آموزش ساخت کتاب صوتی فارسی با هوش مصنوعی و تبدیل متن به صدا

ساخت کتاب صوتی با هوش مصنوعی فراتر از تبدیل ساده متن به صدا است. برای تولید یک کتاب صوتی قابل‌شنیدن باید متن پاک‌سازی شود، فصل‌ها به بخش‌های مناسب تقسیم شوند، تلفظ نام‌ها و اصطلاحات اصلاح شود، صدای راوی متناسب با محتوای کتاب انتخاب شود و فایل‌های نهایی از نظر مکث، بلندی صدا و پیوستگی کنترل شوند.

ابزارهای تبدیل متن به گفتار می‌توانند زمان و هزینه تولید نسخه اولیه کتاب صوتی را کاهش دهند، اما خروجی مطلوب زمانی به دست می‌آید که فرایند تولید به‌درستی طراحی شده باشد.

در این مقاله، ساخت کتاب صوتی فارسی با هوش مصنوعی را مرحله‌به‌مرحله آموزش می‌دهیم و در پایان نشان می‌دهیم چگونه می‌توان با API درواره یک کتاب را فصل‌به‌فصل به فایل صوتی تبدیل کرد.

ساخت کتاب صوتی با هوش مصنوعی چیست؟

در این روش، متن کتاب به یک مدل تبدیل متن به گفتار یا Text to Speech ارسال می‌شود. مدل متن را تحلیل و آن را با یک صدای مصنوعی به فایل صوتی تبدیل می‌کند.

یک سامانه کامل تولید کتاب صوتی می‌تواند این مراحل را انجام دهد:

  • دریافت فایل کتاب
  • استخراج متن
  • شناسایی فصل‌ها
  • پاک‌سازی متن
  • تبدیل اعداد و علائم به شکل قابل‌خواندن
  • انتخاب صدای راوی
  • تنظیم سرعت و لحن
  • تولید فایل صوتی هر بخش
  • اصلاح تلفظ واژه‌های خاص
  • اتصال بخش‌ها
  • تنظیم بلندی صدا
  • افزودن مقدمه و پایان
  • ساخت فایل MP3 یا M4B
  • افزودن کاور و اطلاعات کتاب

تفاوت کتاب صوتی با تبدیل متن به گفتار چیست؟

تبدیل متن به گفتار فقط یک متن را به فایل صوتی تبدیل می‌کند. کتاب صوتی یک محصول ساختاریافته و ویرایش‌شده است.

تبدیل متن به گفتارکتاب صوتی
یک متن کوتاهمجموعه‌ای از فصل‌ها
خروجی مستقیم مدلخروجی ویرایش‌شده
بدون ساختار خاصدارای عنوان و فصل‌بندی
تلفظ عمومیدارای واژه‌نامه تلفظ
بدون مسترینگبلندی صدای یکپارچه
یک فایل سادهMP3های فصل‌بندی‌شده یا M4B
بدون کنترل رواییلحن متناسب با محتوا

برای آشنایی عمومی با این فناوری می‌توانید مقاله تبدیل متن فارسی به گفتار با هوش مصنوعی را مطالعه کنید.

چه کتاب‌هایی برای تولید صوتی با هوش مصنوعی مناسب‌اند؟

این روش برای محتوای زیر مناسب است:

  • کتاب‌های آموزشی
  • راهنماهای کسب‌وکار
  • کتاب‌های دانشگاهی
  • داستان کوتاه
  • مقاله‌های بلند
  • جزوه‌های آموزشی
  • کتاب کودک
  • محتوای سازمانی
  • گزارش‌های سالانه
  • مستندات محصول
  • کتابچه راهنما
  • نسخه شنیداری خبرنامه

تولید کتاب‌های داستانی دارای چندین شخصیت دشوارتر است؛ زیرا هر شخصیت ممکن است به لحن یا صدای متفاوت نیاز داشته باشد.

کتاب‌های تخصصی نیز به واژه‌نامه تلفظ نیاز دارند تا اصطلاحات، نام‌ها، مخفف‌ها و واژه‌های انگلیسی درست خوانده شوند.

آیا می‌توان هر کتابی را به کتاب صوتی تبدیل کرد؟

برای تولید و انتشار نسخه صوتی باید حق استفاده از متن را داشته باشید. متن مناسب می‌تواند یکی از این موارد باشد:

  • نوشته خودتان
  • کتابی که حق تولید نسخه صوتی آن را دریافت کرده‌اید
  • محتوای سازمان خودتان
  • اثری که در مالکیت عمومی قرار دارد
  • متنی با مجوز مناسب برای بازنشر صوتی

خرید نسخه چاپی یا الکترونیکی یک کتاب الزاماً به معنای داشتن اجازه تولید و انتشار نسخه صوتی آن نیست.

ابزارهای موردنیاز برای ساخت کتاب صوتی

مرحلهابزار پیشنهادیکاربرد
استخراج متنابزار PDF، DOCX و OCRدریافت متن کتاب
پاک‌سازی متنمدل زبانی و ویرایشگر متنحذف موارد غیرقابل‌خواندن
تبدیل متن به صدامدل‌های TTSتولید صدای راوی
اصلاح فایل صوتیAudacityبرش، تنظیم و ویرایش
پردازش دسته‌ایFFmpegتبدیل و اتصال فایل‌ها
اجرای محلیPiperتبدیل متن به گفتار روی سیستم
خودکارسازیPython و API دروارهتولید فصل‌ها به‌صورت برنامه‌نویسی
کاورمدل‌های تولید تصویرطراحی جلد نسخه صوتی

Audacity یک نرم‌افزار رایگان و متن‌باز برای ضبط، ویرایش و تبدیل فایل‌های صوتی است و از فرمت‌هایی مانند WAV، MP3، FLAC و Ogg پشتیبانی می‌کند. وب‌سایت رسمی Audacity

بهترین ابزارهای ساخت کتاب صوتی با هوش مصنوعی

مدل‌های صوتی از طریق API درواره

توسعه‌دهندگان می‌توانند مدل‌های تبدیل متن به گفتار را از طریق API داخل نرم‌افزار خود استفاده کنند.

در یک سامانه کتاب صوتی، API می‌تواند برای این موارد استفاده شود:

  • تولید صدای فصل‌ها
  • آزمایش چند صدای مختلف
  • ساخت پیش‌نمایش
  • تبدیل گروهی متن‌ها
  • تولید نسخه شنیداری مقاله
  • ساخت کتابخانه صوتی
  • افزودن قابلیت «شنیدن این صفحه»
  • ساخت محصول SaaS تولید صوت

ElevenLabs

ElevenLabs یکی از سرویس‌های شناخته‌شده تولید صدای مصنوعی است. امکانات و زبان‌های پشتیبانی‌شده آن ممکن است با نوع مدل و طرح کاربری متفاوت باشند.

قبل از انتخاب، کیفیت تلفظ فارسی، محدودیت طول متن، قیمت و امکان استفاده تجاری را روی نمونه واقعی خود بررسی کنید.

Google Cloud Text-to-Speech

Google Cloud ابزار تبدیل متن به گفتار با API ارائه می‌کند. بعضی صداها و قابلیت‌ها ممکن است از SSML پشتیبانی کنند.

Azure AI Speech

سرویس صوتی Microsoft Azure برای تبدیل متن به گفتار، مدیریت صدا و کنترل بعضی ویژگی‌های گفتار استفاده می‌شود.

Piper

Piper یک موتور تبدیل متن به گفتار عصبی، سریع و قابل‌اجرا روی سیستم محلی است. مخزن جاری آن امکان نصب با pip install piper-tts و استفاده از خط فرمان، وب‌سرور و Python API را مستند کرده است. مخزن Piper

کیفیت و وجود صدای مناسب فارسی باید جداگانه بررسی شود. اجرای محلی زمانی مفید است که تیم فنی بخواهد مدل و زیرساخت را خودش مدیریت کند.

Audacity

Audacity برای تولید صدا از متن استفاده نمی‌شود، اما ابزار مناسبی برای این مراحل است:

  • حذف بخش‌های اضافی
  • تنظیم فاصله میان فصل‌ها
  • اصلاح بلندی صدا
  • افزودن مقدمه
  • بررسی موج صوتی
  • گرفتن خروجی نهایی

FFmpeg

FFmpeg ابزار متن‌باز پردازش صوت و ویدیو است که می‌تواند فایل‌های فصل‌ها را تبدیل، یکپارچه و برای انتشار آماده کند. مستندات FFmpeg

مقایسه روش‌های تولید کتاب صوتی

روشراه‌اندازیکنترلمناسب برای
ابزار آنلاینسادهمتوسطاستفاده شخصی و آزمایش
API تبدیل متن به گفتارمتوسطزیاداپلیکیشن و تولید انبوه
اجرای محلی Piperفنیزیادزیرساخت داخلی
گوینده انسانیزمان‌بربسیار زیادروایت حرفه‌ای و نمایشی
روش ترکیبیمتوسطبسیار زیادمحصول حرفه‌ای با بازبینی انسانی

در روش ترکیبی، مدل هوش مصنوعی نسخه اولیه را می‌سازد و تدوین‌گر یا گوینده بخش‌های ضعیف را اصلاح می‌کند.

مراحل ساخت کتاب صوتی با هوش مصنوعی

مرحله اول: نسخه منبع را آماده کنید

بهترین ورودی برای ساخت کتاب صوتی، فایل متنی مرتب است. فرمت‌های مناسب عبارت‌اند از:

  • DOCX
  • TXT
  • Markdown
  • EPUB
  • PDF متنی

اگر PDF اسکن‌شده باشد، ابتدا باید با OCR به متن تبدیل شود. برای این کار می‌توانید راهنمای تبدیل عکس به متن با هوش مصنوعی را مطالعه کنید.

مرحله دوم: ساختار کتاب را استخراج کنید

کتاب را به بخش‌های مشخص تقسیم کنید:

  • معرفی کتاب
  • یادداشت ناشر
  • مقدمه
  • فصل‌ها
  • بخش‌های فرعی
  • نتیجه‌گیری
  • پیوست
  • منابع

هر فصل بهتر است فایل صوتی مستقل داشته باشد. این کار اصلاح، انتشار و ادامه شنیدن را ساده‌تر می‌کند.

ساختار پیشنهادی پوشه:

audiobook/
├── source/
│   └── book.docx
├── text/
│   ├── 00-intro.txt
│   ├── 01-chapter-one.txt
│   ├── 02-chapter-two.txt
│   └── 03-chapter-three.txt
├── audio/
│   ├── 00-intro.mp3
│   ├── 01-chapter-one.mp3
│   ├── 02-chapter-two.mp3
│   └── 03-chapter-three.mp3
└── final/
    └── audiobook.m4b

مرحله سوم: متن را برای شنیدن بازنویسی کنید

متنی که برای خواندن نوشته شده همیشه برای شنیدن مناسب نیست.

مواردی که باید اصلاح شوند:

  • شماره صفحه
  • سربرگ و پابرگ
  • فهرست مطالب تکراری
  • آدرس اینترنتی طولانی
  • پاورقی
  • شماره ارجاع
  • جدول
  • فرمول
  • نمودار
  • علائم اضافی
  • فاصله‌های نامنظم
  • نیم‌فاصله‌های خراب
  • خطوط شکسته PDF

برای مثال این متن:

طبق جدول ۳-۲، رشد فروش در سال ۱۴۰۵ معادل ۲۵٪ بوده است [۱۲].

می‌تواند برای نسخه صوتی چنین آماده شود:

طبق جدول شماره سه، بخش دوم، رشد فروش در سال هزار و چهارصد و پنج،
معادل بیست‌وپنج درصد بوده است.

شماره مرجع [۱۲] در نسخه صوتی معمولاً نباید به‌صورت «کروشه دوازده» خوانده شود، مگر اینکه برای درک محتوا ضروری باشد.

مرحله چهارم: اعداد و نشانه‌ها را قابل‌خواندن کنید

مدل ممکن است یک عدد را براساس متن اشتباه تلفظ کند.

نمونه‌های مبهم:

1405
10/12
2.5
15%
AI
API
LLM
دکتر
ص
ق.م

نسخه آماده صوت:

هزار و چهارصد و پنج
دهم دسامبر
دو و نیم
پانزده درصد
هوش مصنوعی
اِی پی آی
اِل اِل اِم
دکتر
صفحه
قبل از میلاد

تبدیل شکل نوشتاری به شکل قابل‌گفتار، Text Normalization نام دارد.

مرحله پنجم: واژه‌نامه تلفظ بسازید

یک فایل برای واژه‌هایی که ممکن است اشتباه خوانده شوند ایجاد کنید.

نمونه:

شکل اصلیشکل مناسب برای گفتار
APIاِی پی آی
OpenAIاوپن اِی‌آی
SQLاِس کیو اِل
SaaSسَس
Kubernetesکوبِرنِتیز
Nietzscheنیچه
ابن‌سینااِبنِ سینا
می‌خواهممی‌خواهم

برای نام اشخاص، مکان‌ها و واژه‌های تخصصی چند تلفظ آزمایشی تولید کنید و بهترین نگارش صوتی را در واژه‌نامه قرار دهید.

استفاده از SSML برای کنترل گفتار

SSML یک زبان نشانه‌گذاری استاندارد برای کنترل ویژگی‌هایی مانند مکث، تلفظ، شدت، سرعت و زیر و بمی صدا است. پشتیبانی دقیق از تگ‌ها به مدل یا سرویس صوتی بستگی دارد. استاندارد SSML در W3C

نمونه:

<speak>
  <p>
    فصل اول.
    <break time="1200ms"/>
    آغاز یک مسیر تازه.
  </p>

  <p>
    در این فصل با مفهوم
    <emphasis level="moderate">هوش مصنوعی مولد</emphasis>
    آشنا می‌شویم.
  </p>
</speak>

نمونه کنترل سرعت:

<speak>
  <prosody rate="95%">
    این بخش با سرعت کمی آهسته‌تر خوانده می‌شود.
  </prosody>
</speak>

همه مدل‌ها SSML را به شکل یکسان پشتیبانی نمی‌کنند. اگر مدل انتخابی SSML ندارد، می‌توان با نشانه‌گذاری، تقسیم جمله و افزودن علائم نگارشی مکث را کنترل کرد.

انتخاب صدای مناسب راوی

صدای مناسب به نوع کتاب بستگی دارد.

نوع کتابویژگی پیشنهادی صدا
آموزشیروشن، آرام و دقیق
کسب‌وکارمطمئن و رسمی
داستانیانعطاف‌پذیر و احساسی
کودکگرم، پرانرژی و واضح
دانشگاهیخنثی و شمرده
زندگی‌نامهصمیمی و روایی
مراقبهآهسته و آرام
خبر و گزارشرسمی و منظم

قبل از تولید کامل، بخشی شامل این موارد را آزمایش کنید:

  • جمله کوتاه
  • پاراگراف طولانی
  • عدد
  • نام خارجی
  • گفت‌وگو
  • علامت سؤال
  • تعجب
  • پرانتز
  • مخفف
  • تیتر فصل

با یک نمونه ۲ تا ۵ دقیقه‌ای می‌توان بسیاری از مشکلات را قبل از تولید کل کتاب شناسایی کرد.

سرعت مناسب خواندن کتاب صوتی

سرعت بیش از حد پایین باعث خسته‌کننده‌شدن و سرعت زیاد باعث کاهش درک محتوا می‌شود.

برای شروع می‌توان این محدوده‌ها را آزمایش کرد:

نوع محتواسرعت پیشنهادی اولیه
داستانیطبیعی یا کمی آهسته
آموزشیحدود ۹۰ تا ۱۰۰ درصد
کتاب کودکآهسته‌تر و با مکث بیشتر
خبر و گزارشطبیعی و منظم
محتوای فنیآهسته‌تر در بخش‌های پیچیده
فهرست و تمرینمکث بیشتر میان موارد

این اعداد قانون ثابت نیستند. کیفیت صدا، طول جمله و پیچیدگی متن بر سرعت مناسب تأثیر دارند.

تقسیم متن به بخش‌های کوچک

ارسال یک فصل بسیار طولانی در یک درخواست مناسب نیست. متن را به بخش‌هایی تقسیم کنید که:

  • در میانه جمله قطع نشوند.
  • پاراگراف کامل داشته باشند.
  • از محدودیت مدل کمتر باشند.
  • امکان تولید مجدد بخش اشتباه را فراهم کنند.
  • نام‌گذاری منظم داشته باشند.

ساختار مناسب:

chapter-01-part-001.mp3
chapter-01-part-002.mp3
chapter-01-part-003.mp3
chapter-02-part-001.mp3

اگر بخش ۱۲ فصل اول مشکل داشته باشد، فقط همان فایل دوباره تولید می‌شود.

مثال عملی: تولید یک کتاب صوتی فارسی

فرض کنیم یک کتاب آموزشی ۱۰ فصلی و حدود ۲۰۰ صفحه داریم.

مرحله آماده‌سازی

  • متن از DOCX استخراج می‌شود.
  • هر فصل در فایل جدا قرار می‌گیرد.
  • منابع و شماره صفحات حذف می‌شوند.
  • جدول‌ها به توضیح گفتاری تبدیل می‌شوند.
  • اعداد مبهم بازنویسی می‌شوند.
  • واژه‌نامه تلفظ آماده می‌شود.

نمونه متن اصلی

در سال 1405، بیش از 35% از کاربران از API استفاده کردند.
برای اطلاعات بیشتر به شکل 4-2 مراجعه کنید.

نسخه مناسب گفتار

در سال هزار و چهارصد و پنج، بیش از سی‌وپنج درصد از کاربران
از اِی پی آی استفاده کردند.

در شکل شماره چهار، بخش دوم، جزئیات بیشتری از این فرایند
نمایش داده شده است.

برنامه تولید

مرحلهخروجی
آزمایش صدانمونه ۳ دقیقه‌ای
تولید فصل اولفایل‌های بخش‌بندی‌شده
کنترل تلفظفهرست اصلاحات
تولید کل فصل‌هافایل‌های MP3
ویرایشنسخه یکدست
مسترینگبلندی صدای هماهنگ
بسته‌بندیMP3 فصل‌بندی‌شده و M4B
کنترل نهاییبررسی تصادفی و کامل

ساخت کتاب صوتی با API درواره

API درواره با ساختار OpenAI سازگار است. برای مدل‌هایی که endpoint تبدیل متن به گفتار را پشتیبانی می‌کنند، می‌توان از آدرس پایه زیر استفاده کرد:

https://api.darvareh.ir/v1

ابتدا کتابخانه لازم را نصب کنید:

pip install openai

متغیرهای محیطی را تنظیم کنید:

export DARVAREH_API_KEY="YOUR_API_KEY"
export DARVAREH_TTS_MODEL="YOUR_TTS_MODEL_ID"
export DARVAREH_TTS_VOICE="YOUR_VOICE_ID"

مدل و شناسه صدا را از فهرست فعلی مدل‌ها و مستندات دریافت کنید.

تولید یک فایل صوتی با پایتون

import os
from pathlib import Path

from openai import OpenAI


client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)

MODEL_ID = os.environ["DARVAREH_TTS_MODEL"]
VOICE_ID = os.environ["DARVAREH_TTS_VOICE"]


def text_to_speech(
    text: str,
    output_path: str,
) -> None:
    destination = Path(output_path)
    destination.parent.mkdir(
        parents=True,
        exist_ok=True,
    )

    with client.audio.speech.with_streaming_response.create(
        model=MODEL_ID,
        voice=VOICE_ID,
        input=text,
        response_format="mp3",
    ) as response:
        response.stream_to_file(destination)


text_to_speech(
    text=(
        "فصل اول. آغاز یک مسیر تازه. "
        "در این فصل با کاربردهای هوش مصنوعی آشنا می‌شویم."
    ),
    output_path="audio/chapter-01-part-001.mp3",
)

پارامترهای مدل، صدا، فرمت و قابلیت‌های کنترلی می‌توانند متفاوت باشند. قبل از اجرا، مستندات API درواره و صفحه مدل انتخابی را بررسی کنید.

تقسیم خودکار متن فارسی

نمونه زیر متن را بدون قطع‌کردن جمله‌ها به بخش‌های کوچک‌تر تقسیم می‌کند:

import re


def split_persian_text(
    text: str,
    max_chars: int = 2500,
) -> list[str]:
    normalized = re.sub(
        r"\s+",
        " ",
        text,
    ).strip()

    sentences = re.split(
        r"(?<=[.!؟؛])\s+",
        normalized,
    )

    chunks: list[str] = []
    current: list[str] = []
    current_length = 0

    for sentence in sentences:
        sentence = sentence.strip()

        if not sentence:
            continue

        extra_length = len(sentence) + 1

        if current and current_length + extra_length > max_chars:
            chunks.append(" ".join(current))
            current = [sentence]
            current_length = len(sentence)
        else:
            current.append(sentence)
            current_length += extra_length

    if current:
        chunks.append(" ".join(current))

    return chunks

این تابع نقطه شروع است. برای متن‌های دارای گفت‌وگو، شعر، فرمول یا تیترهای پیچیده باید قواعد بیشتری اضافه شود.

تولید فصل کامل به‌صورت بخش‌بندی‌شده

from pathlib import Path


def generate_chapter(
    chapter_path: str,
    output_directory: str,
    chapter_number: int,
) -> list[Path]:
    text = Path(chapter_path).read_text(
        encoding="utf-8",
    )

    chunks = split_persian_text(
        text,
        max_chars=2500,
    )

    output_dir = Path(output_directory)
    output_dir.mkdir(
        parents=True,
        exist_ok=True,
    )

    generated_files: list[Path] = []

    for index, chunk in enumerate(chunks, start=1):
        output_path = output_dir / (
            f"chapter-{chapter_number:02d}"
            f"-part-{index:03d}.mp3"
        )

        if output_path.exists():
            generated_files.append(output_path)
            continue

        text_to_speech(
            text=chunk,
            output_path=str(output_path),
        )

        generated_files.append(output_path)

    return generated_files

بررسی وجود فایل باعث می‌شود اگر اجرای برنامه متوقف شد، تولید از ابتدا تکرار نشود.

اتصال بخش‌های صوتی با FFmpeg

فایل parts.txt را به این شکل بسازید:

file 'chapter-01-part-001.mp3'
file 'chapter-01-part-002.mp3'
file 'chapter-01-part-003.mp3'

سپس آن‌ها را متصل کنید:

ffmpeg \
  -f concat \
  -safe 0 \
  -i parts.txt \
  -c:a libmp3lame \
  -b:a 128k \
  chapter-01.mp3

بازکدگذاری فایل‌ها باعث می‌شود تفاوت‌های احتمالی میان بخش‌ها مدیریت شوند. اگر تمام فایل‌ها مشخصات کاملاً یکسان دارند، در بعضی شرایط می‌توان از Stream Copy استفاده کرد.

تنظیم بلندی صدای فصل‌ها

برای یکپارچه‌کردن بلندی صدا می‌توان از فیلتر loudnorm در FFmpeg استفاده کرد:

ffmpeg \
  -i chapter-01.mp3 \
  -af "loudnorm=I=-19:LRA=7:TP=-3" \
  -c:a libmp3lame \
  -b:a 128k \
  chapter-01-normalized.mp3

این مقادیر فقط نقطه شروع هستند. استاندارد پلتفرم انتشار و نوع خروجی را بررسی و تمام فصل‌ها را با هدف یکسان پردازش کنید.

افزودن سکوت میان بخش‌ها

نبود مکث میان دو پاراگراف یا فصل باعث مصنوعی‌شدن روایت می‌شود.

مکث‌های پیشنهادی اولیه:

  • میان جمله‌ها: براساس نشانه‌گذاری طبیعی
  • میان پاراگراف‌ها: حدود نیم تا یک ثانیه
  • پس از تیتر: حدود یک تا دو ثانیه
  • میان فصل‌ها: دو تا چهار ثانیه

از افزودن مکث یکسان پس از تمام جمله‌ها خودداری کنید؛ زیرا ریتم روایت مکانیکی می‌شود.

ساخت مقدمه کتاب صوتی

مقدمه می‌تواند شامل این موارد باشد:

شما به نسخه صوتی کتاب «نام کتاب» گوش می‌دهید.
نویسنده: نام نویسنده.
ناشر نسخه صوتی: نام ناشر.
تولیدشده در سال هزار و چهارصد و پنج.
فصل اول: عنوان فصل.

اگر صدا با هوش مصنوعی تولید شده است، می‌توانید این موضوع را براساس سیاست انتشار و نیاز پروژه به‌روشنی اعلام کنید.

ساخت فایل M4B

M4B برای کتاب صوتی مناسب است؛ زیرا می‌تواند اطلاعات کتاب، کاور و فصل‌بندی را در یک فایل نگه دارد.

ابتدا فصل‌ها را در فهرست قرار دهید:

file '00-intro.m4a'
file '01-chapter-one.m4a'
file '02-chapter-two.m4a'
file '03-chapter-three.m4a'

نمونه اتصال اولیه:

ffmpeg \
  -f concat \
  -safe 0 \
  -i chapters.txt \
  -c:a aac \
  -b:a 96k \
  audiobook.m4b

برای افزودن Chapter Marker باید زمان شروع و پایان فصل‌ها در فایل Metadata مشخص شود. ساخت خودکار این فایل را می‌توان با خواندن مدت هر فصل از ffprobe انجام داد.

افزودن کاور و اطلاعات کتاب

برای افزودن کاور به فایل صوتی:

ffmpeg \
  -i audiobook.m4b \
  -i cover.jpg \
  -map 0:a \
  -map 1:v \
  -c:a copy \
  -c:v mjpeg \
  -disposition:v attached_pic \
  -metadata title="نام کتاب" \
  -metadata artist="نام نویسنده" \
  -metadata album="نسخه صوتی نام کتاب" \
  audiobook-with-cover.m4b

برای سازگاری بهتر، کاور را مربعی و با کیفیت مناسب آماده کنید.

ساخت جلد کتاب صوتی با هوش مصنوعی

جلد کتاب صوتی باید در اندازه کوچک نیز خوانا باشد. عناصر مهم عبارت‌اند از:

  • عنوان کوتاه و واضح
  • نام نویسنده
  • کنتراست مناسب
  • تصویر مرکزی ساده
  • حاشیه امن
  • نبود جزئیات ریز
  • نسبت مربعی

مدل هوش مصنوعی می‌تواند تصویر اصلی جلد را بسازد، اما بهتر است متن فارسی در نرم‌افزار طراحی اضافه شود.

نمونه پرامپت:

تصویر جلد مربعی برای یک کتاب صوتی فارسی درباره مدیریت زمان،
سبک مینیمال و حرفه‌ای، ساعت شنی مدرن در مرکز،
پس‌زمینه سرمه‌ای با نور بنفش ملایم،
فضای خالی کافی برای افزودن عنوان فارسی،
بدون نوشته، بدون لوگو و بدون حروف ساختگی

کنترل کیفیت کتاب صوتی

کنترل کیفیت نباید فقط به شنیدن چند دقیقه اول محدود شود.

بررسی متن و صدا

  • آیا هیچ پاراگرافی حذف نشده است؟
  • آیا ترتیب بخش‌ها درست است؟
  • آیا عنوان فصل‌ها خوانده می‌شوند؟
  • آیا شماره صفحه و سربرگ وارد صدا نشده‌اند؟
  • آیا اعداد درست خوانده می‌شوند؟
  • آیا نام‌ها تلفظ صحیح دارند؟
  • آیا واژه‌های انگلیسی قابل‌فهم‌اند؟
  • آیا جمله‌ها در محل نامناسب قطع نشده‌اند؟

بررسی فنی

  • آیا تمام فصل‌ها بلندی صدای مشابه دارند؟
  • آیا ابتدای فایل بریده نشده است؟
  • آیا سکوت‌های طولانی وجود ندارند؟
  • آیا میان قطعه‌ها صدای کلیک شنیده نمی‌شود؟
  • آیا فرمت تمام فصل‌ها یکسان است؟
  • آیا کاور و Metadata درست‌اند؟
  • آیا فایل روی موبایل و رایانه پخش می‌شود؟
  • آیا فصل‌بندی M4B کار می‌کند؟

بررسی روایی

  • آیا صدا با موضوع کتاب هماهنگ است؟
  • آیا سرعت ثابت و مناسب است؟
  • آیا مکث‌ها طبیعی‌اند؟
  • آیا پرسش‌ها لحن پرسشی دارند؟
  • آیا روایت بعد از چند دقیقه خسته‌کننده می‌شود؟
  • آیا گفت‌وگوها از متن توضیحی قابل‌تشخیص‌اند؟

روش کنترل کیفیت سریع

برای هر فصل این بخش‌ها را گوش کنید:

  1. سی ثانیه اول
  2. یک بخش از میانه
  3. قسمتی دارای عدد و اصطلاح
  4. آخرین دقیقه
  5. محل اتصال قطعه‌ها
  6. یک پاراگراف دارای گفت‌وگو

علاوه بر نمونه‌برداری، فایل نهایی باید حداقل یک‌بار به‌طور کامل بررسی شود؛ به‌خصوص اگر برای انتشار عمومی یا فروش آماده می‌شود.

تولید کتاب داستان با چند صدا

برای کتاب‌های داستانی می‌توان نقش‌ها را جدا کرد:

راوی: صدای اصلی و خنثی
شخصیت اول: صدای متفاوت
شخصیت دوم: صدای دوم
نقل‌قول‌ها: لحن متمایز

ابتدا باید گفت‌وگوها از متن جدا و به شخصیت درست نسبت داده شوند. سپس فایل‌های هر نقش تولید و در تدوین کنار هم قرار گیرند.

این روش پیچیده‌تر است و مشکلات احتمالی آن عبارت‌اند از:

  • تغییر ناگهانی شدت صدا
  • تفاوت کیفیت میان صداها
  • مکث نامناسب
  • تشخیص اشتباه گوینده
  • ناهماهنگی احساس و متن
  • طولانی‌شدن فرایند تدوین

برای نسخه اول بهتر است از یک راوی استفاده شود، مگر اینکه ساختار گفت‌وگوها دقیق و قابل‌پردازش باشد.

ساخت سرویس آنلاین تولید کتاب صوتی

یک سرویس SaaS می‌تواند این جریان را ارائه کند:

  1. کاربر فایل کتاب را بارگذاری می‌کند.
  2. متن استخراج می‌شود.
  3. فصل‌ها شناسایی می‌شوند.
  4. پیش‌نمایش متن آماده گفتار نمایش داده می‌شود.
  5. کاربر صدا و سرعت را انتخاب می‌کند.
  6. نمونه کوتاه تولید می‌شود.
  7. کاربر نمونه را تأیید می‌کند.
  8. تولید کامل در صف قرار می‌گیرد.
  9. وضعیت هر فصل ثبت می‌شود.
  10. بخش‌های ناموفق دوباره تولید می‌شوند.
  11. فایل نهایی تدوین می‌شود.
  12. MP3 یا M4B برای دریافت آماده می‌شود.

وضعیت‌های پیشنهادی پروژه

uploaded
extracting_text
preparing_text
waiting_for_voice_selection
sample_generation
waiting_for_approval
generating_audio
quality_check
mastering
completed
failed

اطلاعات پیشنهادی پروژه

{
  "project_id": "book_1024",
  "title": "شروع یک مسیر تازه",
  "language": "fa-IR",
  "voice_id": "VOICE_ID",
  "speed": 0.95,
  "output_format": "m4b",
  "chapters": 10,
  "status": "generating_audio"
}

معماری فنی پیشنهادی

ارتباط مستقیم رابط کاربری با API صوتی مناسب نیست. معماری بهتر:

کاربر
↓
رابط کاربری
↓
سرور اپلیکیشن
↓
استخراج و پاک‌سازی متن
↓
صف تولید فصل‌ها
↓
API درواره
↓
ذخیره فایل‌های صوتی
↓
کنترل کیفیت و اتصال فایل‌ها
↓
دریافت خروجی نهایی

درخواست‌های تولید کتاب ممکن است طولانی باشند. از Job Queue، Worker و فضای ذخیره‌سازی فایل استفاده کنید و وضعیت پردازش را در پایگاه داده نگه دارید.

چگونه هزینه ساخت کتاب صوتی را کاهش دهیم؟

قبل از تولید کامل، نمونه بسازید

ابتدا یک تا سه دقیقه از متن واقعی کتاب را با چند صدا آزمایش کنید.

متن را قبل از ارسال پاک‌سازی کنید

شماره صفحه، منابع غیرضروری، URL و علائم خراب باعث افزایش هزینه و کاهش کیفیت می‌شوند.

بخش‌های موفق را دوباره تولید نکنید

هر قطعه را با شناسه و Hash متن ذخیره کنید. اگر متن تغییر نکرده است، از فایل قبلی استفاده کنید.

واژه‌نامه را زود آماده کنید

اگر تلفظ یک نام پس از تولید کامل اصلاح شود، ممکن است ده‌ها فایل نیاز به تولید مجدد داشته باشند.

فقط بخش مشکل‌دار را اصلاح کنید

فصل را به قطعه‌های کوچک تقسیم کنید تا نیازی به تولید دوباره کل فصل نباشد.

مصرف را ثبت کنید

این موارد را برای هر پروژه ذخیره کنید:

  • تعداد کاراکتر
  • تعداد فصل
  • تعداد درخواست
  • قطعه‌های ناموفق
  • مدل و صدا
  • هزینه هر فصل
  • هزینه کل پروژه
  • زمان تولید

اشتباهات رایج در ساخت کتاب صوتی با هوش مصنوعی

ارسال کل کتاب در یک درخواست

متن را فصل‌به‌فصل و قطعه‌به‌قطعه تولید کنید.

استفاده مستقیم از PDF استخراج‌شده

متن PDF ممکن است دارای شکست خط، شماره صفحه و ترتیب نادرست باشد.

آزمایش‌نکردن صدای فارسی

یک صدا ممکن است در انگلیسی طبیعی باشد، اما در فارسی تلفظ مناسبی نداشته باشد.

نداشتن واژه‌نامه تلفظ

نام اشخاص، برندها و اصطلاحات تخصصی باید پیش از تولید کامل آزمایش شوند.

تغییر صدا در میانه کتاب

مدل، نسخه یا تنظیمات صدا را در کل پروژه ثابت نگه دارید.

اتصال فایل‌ها بدون کنترل مکث

ممکن است دو جمله بدون فاصله به هم متصل شوند یا میان آن‌ها سکوت طولانی ایجاد شود.

انتشار خروجی بدون شنیدن کامل

خطاهای تلفظ، تکرار یا حذف متن ممکن است در بخش‌های تصادفی رخ دهند.

استفاده از صدای سریع برای محتوای پیچیده

سرعت باید متناسب با نوع محتوا باشد، نه فقط کوتاه‌کردن زمان فایل.

پرسش‌های متداول

چگونه کتاب را با هوش مصنوعی صوتی کنیم؟

متن کتاب را استخراج و پاک‌سازی کنید، فصل‌ها را جدا کنید، صدای مناسب را انتخاب و هر فصل را در بخش‌های کوچک به مدل تبدیل متن به گفتار ارسال کنید. سپس فایل‌ها را ویرایش و به MP3 یا M4B تبدیل کنید.

آیا می‌توان PDF را به کتاب صوتی تبدیل کرد؟

بله. اگر PDF متنی باشد، متن مستقیماً استخراج می‌شود. اگر اسکن‌شده باشد، ابتدا باید با OCR به متن تبدیل شود.

بهترین هوش مصنوعی برای ساخت کتاب صوتی فارسی چیست؟

بهترین مدل باید روی متن واقعی کتاب آزمایش شود. معیارهای مهم شامل تلفظ فارسی، طبیعی‌بودن صدا، ثبات، سرعت، هزینه، محدودیت طول متن و امکان استفاده از API هستند.

آیا ساخت کتاب صوتی با هوش مصنوعی رایگان است؟

بعضی ابزارها نسخه محدود یا مدل متن‌باز دارند. تولید یک کتاب کامل معمولاً به پردازش قابل‌توجه نیاز دارد و ممکن است هزینه API یا زیرساخت داشته باشد.

آیا می‌توان لحن و سرعت را تغییر داد؟

بسته به مدل می‌توان سرعت، لحن، مکث یا بعضی ویژگی‌های گفتار را با تنظیمات، دستور متنی یا SSML کنترل کرد.

آیا می‌توان برای شخصیت‌های کتاب صدای متفاوت ساخت؟

بله، اما متن باید به نقش‌ها تقسیم شود و خروجی‌ها در تدوین با یکدیگر ترکیب شوند.

MP3 بهتر است یا M4B؟

MP3 سازگاری گسترده‌ای دارد و برای انتشار فصل‌های جدا مناسب است. M4B می‌تواند کتاب، کاور و فصل‌بندی را در یک فایل نگه دارد.

آیا می‌توان از API درواره برای ساخت کتاب صوتی استفاده کرد؟

در صورت وجود مدل TTS مناسب در فهرست جاری، می‌توانید تولید صدا را از سمت سرور اپلیکیشن انجام دهید. شناسه مدل، صداها، فرمت خروجی و پارامترهای پشتیبانی‌شده را در مستندات فعلی بررسی کنید.

آیا هوش مصنوعی جای گوینده انسانی را می‌گیرد؟

برای بعضی کتاب‌های آموزشی و محتوای انبوه، صدای مصنوعی می‌تواند کاربردی باشد. در آثار نمایشی و احساسی، اجرای انسانی یا روش ترکیبی ممکن است نتیجه بهتری ایجاد کند.

جمع‌بندی

ساخت کتاب صوتی با هوش مصنوعی فقط فشردن یک دکمه نیست. کیفیت محصول نهایی به آماده‌سازی متن، انتخاب صدا، اصلاح تلفظ و تدوین وابسته است.

مسیر پیشنهادی عبارت است از:

  1. حق استفاده از متن را مشخص کنید.
  2. متن را از فایل کتاب استخراج کنید.
  3. فصل‌ها را جدا کنید.
  4. متن را برای شنیدن بازنویسی کنید.
  5. اعداد و علائم را به شکل قابل‌گفتار تبدیل کنید.
  6. واژه‌نامه تلفظ بسازید.
  7. چند صدا را روی نمونه واقعی آزمایش کنید.
  8. متن را به قطعه‌های کوچک تقسیم کنید.
  9. فصل‌ها را با تنظیمات ثابت تولید کنید.
  10. فایل‌ها را ویرایش و یکپارچه کنید.
  11. بلندی صدا و مکث‌ها را کنترل کنید.
  12. خروجی MP3 یا M4B بسازید.
  13. کتاب را پیش از انتشار به‌طور کامل بررسی کنید.

اگر قصد دارید قابلیت تبدیل کتاب، مقاله، محتوای آموزشی یا مستندات را به صدای فارسی داخل سایت و اپلیکیشن خود قرار دهید، می‌توانید از مدل‌های صوتی موجود از طریق API درواره استفاده کنید.

برای مشاهده مدل‌ها، ساخت کلید API و بررسی نمونه درخواست‌ها به مستندات API درواره مراجعه کنید.

مقالات مرتبط

منابع

این مقاله صرفاً با هدف آموزش و اطلاع‌رسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویس‌ها و صفحه سلب مسئولیت را مطالعه کنید.

Read more