ساخت کتاب صوتی با هوش مصنوعی؛ آموزش کامل از متن تا فایل نهایی
در این راهنمای جامع یاد میگیرید چگونه با هوش مصنوعی یک کتاب صوتی فارسی تولید کنید؛ از آمادهسازی متن و انتخاب صدای راوی تا اصلاح تلفظ، تولید فصلها، ویرایش صوت، ساخت MP3 و M4B و خودکارسازی فرایند با API درواره.
ساخت کتاب صوتی با هوش مصنوعی فراتر از تبدیل ساده متن به صدا است. برای تولید یک کتاب صوتی قابلشنیدن باید متن پاکسازی شود، فصلها به بخشهای مناسب تقسیم شوند، تلفظ نامها و اصطلاحات اصلاح شود، صدای راوی متناسب با محتوای کتاب انتخاب شود و فایلهای نهایی از نظر مکث، بلندی صدا و پیوستگی کنترل شوند.
ابزارهای تبدیل متن به گفتار میتوانند زمان و هزینه تولید نسخه اولیه کتاب صوتی را کاهش دهند، اما خروجی مطلوب زمانی به دست میآید که فرایند تولید بهدرستی طراحی شده باشد.
در این مقاله، ساخت کتاب صوتی فارسی با هوش مصنوعی را مرحلهبهمرحله آموزش میدهیم و در پایان نشان میدهیم چگونه میتوان با API درواره یک کتاب را فصلبهفصل به فایل صوتی تبدیل کرد.
ساخت کتاب صوتی با هوش مصنوعی چیست؟
در این روش، متن کتاب به یک مدل تبدیل متن به گفتار یا Text to Speech ارسال میشود. مدل متن را تحلیل و آن را با یک صدای مصنوعی به فایل صوتی تبدیل میکند.
یک سامانه کامل تولید کتاب صوتی میتواند این مراحل را انجام دهد:
- دریافت فایل کتاب
- استخراج متن
- شناسایی فصلها
- پاکسازی متن
- تبدیل اعداد و علائم به شکل قابلخواندن
- انتخاب صدای راوی
- تنظیم سرعت و لحن
- تولید فایل صوتی هر بخش
- اصلاح تلفظ واژههای خاص
- اتصال بخشها
- تنظیم بلندی صدا
- افزودن مقدمه و پایان
- ساخت فایل MP3 یا M4B
- افزودن کاور و اطلاعات کتاب
تفاوت کتاب صوتی با تبدیل متن به گفتار چیست؟
تبدیل متن به گفتار فقط یک متن را به فایل صوتی تبدیل میکند. کتاب صوتی یک محصول ساختاریافته و ویرایششده است.
| تبدیل متن به گفتار | کتاب صوتی |
|---|---|
| یک متن کوتاه | مجموعهای از فصلها |
| خروجی مستقیم مدل | خروجی ویرایششده |
| بدون ساختار خاص | دارای عنوان و فصلبندی |
| تلفظ عمومی | دارای واژهنامه تلفظ |
| بدون مسترینگ | بلندی صدای یکپارچه |
| یک فایل ساده | MP3های فصلبندیشده یا M4B |
| بدون کنترل روایی | لحن متناسب با محتوا |
برای آشنایی عمومی با این فناوری میتوانید مقاله تبدیل متن فارسی به گفتار با هوش مصنوعی را مطالعه کنید.
چه کتابهایی برای تولید صوتی با هوش مصنوعی مناسباند؟
این روش برای محتوای زیر مناسب است:
- کتابهای آموزشی
- راهنماهای کسبوکار
- کتابهای دانشگاهی
- داستان کوتاه
- مقالههای بلند
- جزوههای آموزشی
- کتاب کودک
- محتوای سازمانی
- گزارشهای سالانه
- مستندات محصول
- کتابچه راهنما
- نسخه شنیداری خبرنامه
تولید کتابهای داستانی دارای چندین شخصیت دشوارتر است؛ زیرا هر شخصیت ممکن است به لحن یا صدای متفاوت نیاز داشته باشد.
کتابهای تخصصی نیز به واژهنامه تلفظ نیاز دارند تا اصطلاحات، نامها، مخففها و واژههای انگلیسی درست خوانده شوند.
آیا میتوان هر کتابی را به کتاب صوتی تبدیل کرد؟
برای تولید و انتشار نسخه صوتی باید حق استفاده از متن را داشته باشید. متن مناسب میتواند یکی از این موارد باشد:
- نوشته خودتان
- کتابی که حق تولید نسخه صوتی آن را دریافت کردهاید
- محتوای سازمان خودتان
- اثری که در مالکیت عمومی قرار دارد
- متنی با مجوز مناسب برای بازنشر صوتی
خرید نسخه چاپی یا الکترونیکی یک کتاب الزاماً به معنای داشتن اجازه تولید و انتشار نسخه صوتی آن نیست.
ابزارهای موردنیاز برای ساخت کتاب صوتی
| مرحله | ابزار پیشنهادی | کاربرد |
|---|---|---|
| استخراج متن | ابزار PDF، DOCX و OCR | دریافت متن کتاب |
| پاکسازی متن | مدل زبانی و ویرایشگر متن | حذف موارد غیرقابلخواندن |
| تبدیل متن به صدا | مدلهای TTS | تولید صدای راوی |
| اصلاح فایل صوتی | Audacity | برش، تنظیم و ویرایش |
| پردازش دستهای | FFmpeg | تبدیل و اتصال فایلها |
| اجرای محلی | Piper | تبدیل متن به گفتار روی سیستم |
| خودکارسازی | Python و API درواره | تولید فصلها بهصورت برنامهنویسی |
| کاور | مدلهای تولید تصویر | طراحی جلد نسخه صوتی |
Audacity یک نرمافزار رایگان و متنباز برای ضبط، ویرایش و تبدیل فایلهای صوتی است و از فرمتهایی مانند WAV، MP3، FLAC و Ogg پشتیبانی میکند. وبسایت رسمی Audacity
بهترین ابزارهای ساخت کتاب صوتی با هوش مصنوعی
مدلهای صوتی از طریق API درواره
توسعهدهندگان میتوانند مدلهای تبدیل متن به گفتار را از طریق API داخل نرمافزار خود استفاده کنند.
در یک سامانه کتاب صوتی، API میتواند برای این موارد استفاده شود:
- تولید صدای فصلها
- آزمایش چند صدای مختلف
- ساخت پیشنمایش
- تبدیل گروهی متنها
- تولید نسخه شنیداری مقاله
- ساخت کتابخانه صوتی
- افزودن قابلیت «شنیدن این صفحه»
- ساخت محصول SaaS تولید صوت
ElevenLabs
ElevenLabs یکی از سرویسهای شناختهشده تولید صدای مصنوعی است. امکانات و زبانهای پشتیبانیشده آن ممکن است با نوع مدل و طرح کاربری متفاوت باشند.
قبل از انتخاب، کیفیت تلفظ فارسی، محدودیت طول متن، قیمت و امکان استفاده تجاری را روی نمونه واقعی خود بررسی کنید.
Google Cloud Text-to-Speech
Google Cloud ابزار تبدیل متن به گفتار با API ارائه میکند. بعضی صداها و قابلیتها ممکن است از SSML پشتیبانی کنند.
Azure AI Speech
سرویس صوتی Microsoft Azure برای تبدیل متن به گفتار، مدیریت صدا و کنترل بعضی ویژگیهای گفتار استفاده میشود.
Piper
Piper یک موتور تبدیل متن به گفتار عصبی، سریع و قابلاجرا روی سیستم محلی است. مخزن جاری آن امکان نصب با pip install piper-tts و استفاده از خط فرمان، وبسرور و Python API را مستند کرده است. مخزن Piper
کیفیت و وجود صدای مناسب فارسی باید جداگانه بررسی شود. اجرای محلی زمانی مفید است که تیم فنی بخواهد مدل و زیرساخت را خودش مدیریت کند.
Audacity
Audacity برای تولید صدا از متن استفاده نمیشود، اما ابزار مناسبی برای این مراحل است:
- حذف بخشهای اضافی
- تنظیم فاصله میان فصلها
- اصلاح بلندی صدا
- افزودن مقدمه
- بررسی موج صوتی
- گرفتن خروجی نهایی
FFmpeg
FFmpeg ابزار متنباز پردازش صوت و ویدیو است که میتواند فایلهای فصلها را تبدیل، یکپارچه و برای انتشار آماده کند. مستندات FFmpeg
مقایسه روشهای تولید کتاب صوتی
| روش | راهاندازی | کنترل | مناسب برای |
|---|---|---|---|
| ابزار آنلاین | ساده | متوسط | استفاده شخصی و آزمایش |
| API تبدیل متن به گفتار | متوسط | زیاد | اپلیکیشن و تولید انبوه |
| اجرای محلی Piper | فنی | زیاد | زیرساخت داخلی |
| گوینده انسانی | زمانبر | بسیار زیاد | روایت حرفهای و نمایشی |
| روش ترکیبی | متوسط | بسیار زیاد | محصول حرفهای با بازبینی انسانی |
در روش ترکیبی، مدل هوش مصنوعی نسخه اولیه را میسازد و تدوینگر یا گوینده بخشهای ضعیف را اصلاح میکند.
مراحل ساخت کتاب صوتی با هوش مصنوعی
مرحله اول: نسخه منبع را آماده کنید
بهترین ورودی برای ساخت کتاب صوتی، فایل متنی مرتب است. فرمتهای مناسب عبارتاند از:
- DOCX
- TXT
- Markdown
- EPUB
- PDF متنی
اگر PDF اسکنشده باشد، ابتدا باید با OCR به متن تبدیل شود. برای این کار میتوانید راهنمای تبدیل عکس به متن با هوش مصنوعی را مطالعه کنید.
مرحله دوم: ساختار کتاب را استخراج کنید
کتاب را به بخشهای مشخص تقسیم کنید:
- معرفی کتاب
- یادداشت ناشر
- مقدمه
- فصلها
- بخشهای فرعی
- نتیجهگیری
- پیوست
- منابع
هر فصل بهتر است فایل صوتی مستقل داشته باشد. این کار اصلاح، انتشار و ادامه شنیدن را سادهتر میکند.
ساختار پیشنهادی پوشه:
audiobook/
├── source/
│ └── book.docx
├── text/
│ ├── 00-intro.txt
│ ├── 01-chapter-one.txt
│ ├── 02-chapter-two.txt
│ └── 03-chapter-three.txt
├── audio/
│ ├── 00-intro.mp3
│ ├── 01-chapter-one.mp3
│ ├── 02-chapter-two.mp3
│ └── 03-chapter-three.mp3
└── final/
└── audiobook.m4b
مرحله سوم: متن را برای شنیدن بازنویسی کنید
متنی که برای خواندن نوشته شده همیشه برای شنیدن مناسب نیست.
مواردی که باید اصلاح شوند:
- شماره صفحه
- سربرگ و پابرگ
- فهرست مطالب تکراری
- آدرس اینترنتی طولانی
- پاورقی
- شماره ارجاع
- جدول
- فرمول
- نمودار
- علائم اضافی
- فاصلههای نامنظم
- نیمفاصلههای خراب
- خطوط شکسته PDF
برای مثال این متن:
طبق جدول ۳-۲، رشد فروش در سال ۱۴۰۵ معادل ۲۵٪ بوده است [۱۲].
میتواند برای نسخه صوتی چنین آماده شود:
طبق جدول شماره سه، بخش دوم، رشد فروش در سال هزار و چهارصد و پنج،
معادل بیستوپنج درصد بوده است.
شماره مرجع [۱۲] در نسخه صوتی معمولاً نباید بهصورت «کروشه دوازده» خوانده شود، مگر اینکه برای درک محتوا ضروری باشد.
مرحله چهارم: اعداد و نشانهها را قابلخواندن کنید
مدل ممکن است یک عدد را براساس متن اشتباه تلفظ کند.
نمونههای مبهم:
1405
10/12
2.5
15%
AI
API
LLM
دکتر
ص
ق.م
نسخه آماده صوت:
هزار و چهارصد و پنج
دهم دسامبر
دو و نیم
پانزده درصد
هوش مصنوعی
اِی پی آی
اِل اِل اِم
دکتر
صفحه
قبل از میلاد
تبدیل شکل نوشتاری به شکل قابلگفتار، Text Normalization نام دارد.
مرحله پنجم: واژهنامه تلفظ بسازید
یک فایل برای واژههایی که ممکن است اشتباه خوانده شوند ایجاد کنید.
نمونه:
| شکل اصلی | شکل مناسب برای گفتار |
|---|---|
| API | اِی پی آی |
| OpenAI | اوپن اِیآی |
| SQL | اِس کیو اِل |
| SaaS | سَس |
| Kubernetes | کوبِرنِتیز |
| Nietzsche | نیچه |
| ابنسینا | اِبنِ سینا |
| میخواهم | میخواهم |
برای نام اشخاص، مکانها و واژههای تخصصی چند تلفظ آزمایشی تولید کنید و بهترین نگارش صوتی را در واژهنامه قرار دهید.
استفاده از SSML برای کنترل گفتار
SSML یک زبان نشانهگذاری استاندارد برای کنترل ویژگیهایی مانند مکث، تلفظ، شدت، سرعت و زیر و بمی صدا است. پشتیبانی دقیق از تگها به مدل یا سرویس صوتی بستگی دارد. استاندارد SSML در W3C
نمونه:
<speak>
<p>
فصل اول.
<break time="1200ms"/>
آغاز یک مسیر تازه.
</p>
<p>
در این فصل با مفهوم
<emphasis level="moderate">هوش مصنوعی مولد</emphasis>
آشنا میشویم.
</p>
</speak>
نمونه کنترل سرعت:
<speak>
<prosody rate="95%">
این بخش با سرعت کمی آهستهتر خوانده میشود.
</prosody>
</speak>
همه مدلها SSML را به شکل یکسان پشتیبانی نمیکنند. اگر مدل انتخابی SSML ندارد، میتوان با نشانهگذاری، تقسیم جمله و افزودن علائم نگارشی مکث را کنترل کرد.
انتخاب صدای مناسب راوی
صدای مناسب به نوع کتاب بستگی دارد.
| نوع کتاب | ویژگی پیشنهادی صدا |
|---|---|
| آموزشی | روشن، آرام و دقیق |
| کسبوکار | مطمئن و رسمی |
| داستانی | انعطافپذیر و احساسی |
| کودک | گرم، پرانرژی و واضح |
| دانشگاهی | خنثی و شمرده |
| زندگینامه | صمیمی و روایی |
| مراقبه | آهسته و آرام |
| خبر و گزارش | رسمی و منظم |
قبل از تولید کامل، بخشی شامل این موارد را آزمایش کنید:
- جمله کوتاه
- پاراگراف طولانی
- عدد
- نام خارجی
- گفتوگو
- علامت سؤال
- تعجب
- پرانتز
- مخفف
- تیتر فصل
با یک نمونه ۲ تا ۵ دقیقهای میتوان بسیاری از مشکلات را قبل از تولید کل کتاب شناسایی کرد.
سرعت مناسب خواندن کتاب صوتی
سرعت بیش از حد پایین باعث خستهکنندهشدن و سرعت زیاد باعث کاهش درک محتوا میشود.
برای شروع میتوان این محدودهها را آزمایش کرد:
| نوع محتوا | سرعت پیشنهادی اولیه |
|---|---|
| داستانی | طبیعی یا کمی آهسته |
| آموزشی | حدود ۹۰ تا ۱۰۰ درصد |
| کتاب کودک | آهستهتر و با مکث بیشتر |
| خبر و گزارش | طبیعی و منظم |
| محتوای فنی | آهستهتر در بخشهای پیچیده |
| فهرست و تمرین | مکث بیشتر میان موارد |
این اعداد قانون ثابت نیستند. کیفیت صدا، طول جمله و پیچیدگی متن بر سرعت مناسب تأثیر دارند.
تقسیم متن به بخشهای کوچک
ارسال یک فصل بسیار طولانی در یک درخواست مناسب نیست. متن را به بخشهایی تقسیم کنید که:
- در میانه جمله قطع نشوند.
- پاراگراف کامل داشته باشند.
- از محدودیت مدل کمتر باشند.
- امکان تولید مجدد بخش اشتباه را فراهم کنند.
- نامگذاری منظم داشته باشند.
ساختار مناسب:
chapter-01-part-001.mp3
chapter-01-part-002.mp3
chapter-01-part-003.mp3
chapter-02-part-001.mp3
اگر بخش ۱۲ فصل اول مشکل داشته باشد، فقط همان فایل دوباره تولید میشود.
مثال عملی: تولید یک کتاب صوتی فارسی
فرض کنیم یک کتاب آموزشی ۱۰ فصلی و حدود ۲۰۰ صفحه داریم.
مرحله آمادهسازی
- متن از DOCX استخراج میشود.
- هر فصل در فایل جدا قرار میگیرد.
- منابع و شماره صفحات حذف میشوند.
- جدولها به توضیح گفتاری تبدیل میشوند.
- اعداد مبهم بازنویسی میشوند.
- واژهنامه تلفظ آماده میشود.
نمونه متن اصلی
در سال 1405، بیش از 35% از کاربران از API استفاده کردند.
برای اطلاعات بیشتر به شکل 4-2 مراجعه کنید.
نسخه مناسب گفتار
در سال هزار و چهارصد و پنج، بیش از سیوپنج درصد از کاربران
از اِی پی آی استفاده کردند.
در شکل شماره چهار، بخش دوم، جزئیات بیشتری از این فرایند
نمایش داده شده است.
برنامه تولید
| مرحله | خروجی |
|---|---|
| آزمایش صدا | نمونه ۳ دقیقهای |
| تولید فصل اول | فایلهای بخشبندیشده |
| کنترل تلفظ | فهرست اصلاحات |
| تولید کل فصلها | فایلهای MP3 |
| ویرایش | نسخه یکدست |
| مسترینگ | بلندی صدای هماهنگ |
| بستهبندی | MP3 فصلبندیشده و M4B |
| کنترل نهایی | بررسی تصادفی و کامل |
ساخت کتاب صوتی با API درواره
API درواره با ساختار OpenAI سازگار است. برای مدلهایی که endpoint تبدیل متن به گفتار را پشتیبانی میکنند، میتوان از آدرس پایه زیر استفاده کرد:
https://api.darvareh.ir/v1
ابتدا کتابخانه لازم را نصب کنید:
pip install openai
متغیرهای محیطی را تنظیم کنید:
export DARVAREH_API_KEY="YOUR_API_KEY"
export DARVAREH_TTS_MODEL="YOUR_TTS_MODEL_ID"
export DARVAREH_TTS_VOICE="YOUR_VOICE_ID"
مدل و شناسه صدا را از فهرست فعلی مدلها و مستندات دریافت کنید.
تولید یک فایل صوتی با پایتون
import os
from pathlib import Path
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1",
)
MODEL_ID = os.environ["DARVAREH_TTS_MODEL"]
VOICE_ID = os.environ["DARVAREH_TTS_VOICE"]
def text_to_speech(
text: str,
output_path: str,
) -> None:
destination = Path(output_path)
destination.parent.mkdir(
parents=True,
exist_ok=True,
)
with client.audio.speech.with_streaming_response.create(
model=MODEL_ID,
voice=VOICE_ID,
input=text,
response_format="mp3",
) as response:
response.stream_to_file(destination)
text_to_speech(
text=(
"فصل اول. آغاز یک مسیر تازه. "
"در این فصل با کاربردهای هوش مصنوعی آشنا میشویم."
),
output_path="audio/chapter-01-part-001.mp3",
)
پارامترهای مدل، صدا، فرمت و قابلیتهای کنترلی میتوانند متفاوت باشند. قبل از اجرا، مستندات API درواره و صفحه مدل انتخابی را بررسی کنید.
تقسیم خودکار متن فارسی
نمونه زیر متن را بدون قطعکردن جملهها به بخشهای کوچکتر تقسیم میکند:
import re
def split_persian_text(
text: str,
max_chars: int = 2500,
) -> list[str]:
normalized = re.sub(
r"\s+",
" ",
text,
).strip()
sentences = re.split(
r"(?<=[.!؟؛])\s+",
normalized,
)
chunks: list[str] = []
current: list[str] = []
current_length = 0
for sentence in sentences:
sentence = sentence.strip()
if not sentence:
continue
extra_length = len(sentence) + 1
if current and current_length + extra_length > max_chars:
chunks.append(" ".join(current))
current = [sentence]
current_length = len(sentence)
else:
current.append(sentence)
current_length += extra_length
if current:
chunks.append(" ".join(current))
return chunks
این تابع نقطه شروع است. برای متنهای دارای گفتوگو، شعر، فرمول یا تیترهای پیچیده باید قواعد بیشتری اضافه شود.
تولید فصل کامل بهصورت بخشبندیشده
from pathlib import Path
def generate_chapter(
chapter_path: str,
output_directory: str,
chapter_number: int,
) -> list[Path]:
text = Path(chapter_path).read_text(
encoding="utf-8",
)
chunks = split_persian_text(
text,
max_chars=2500,
)
output_dir = Path(output_directory)
output_dir.mkdir(
parents=True,
exist_ok=True,
)
generated_files: list[Path] = []
for index, chunk in enumerate(chunks, start=1):
output_path = output_dir / (
f"chapter-{chapter_number:02d}"
f"-part-{index:03d}.mp3"
)
if output_path.exists():
generated_files.append(output_path)
continue
text_to_speech(
text=chunk,
output_path=str(output_path),
)
generated_files.append(output_path)
return generated_files
بررسی وجود فایل باعث میشود اگر اجرای برنامه متوقف شد، تولید از ابتدا تکرار نشود.
اتصال بخشهای صوتی با FFmpeg
فایل parts.txt را به این شکل بسازید:
file 'chapter-01-part-001.mp3'
file 'chapter-01-part-002.mp3'
file 'chapter-01-part-003.mp3'
سپس آنها را متصل کنید:
ffmpeg \
-f concat \
-safe 0 \
-i parts.txt \
-c:a libmp3lame \
-b:a 128k \
chapter-01.mp3
بازکدگذاری فایلها باعث میشود تفاوتهای احتمالی میان بخشها مدیریت شوند. اگر تمام فایلها مشخصات کاملاً یکسان دارند، در بعضی شرایط میتوان از Stream Copy استفاده کرد.
تنظیم بلندی صدای فصلها
برای یکپارچهکردن بلندی صدا میتوان از فیلتر loudnorm در FFmpeg استفاده کرد:
ffmpeg \
-i chapter-01.mp3 \
-af "loudnorm=I=-19:LRA=7:TP=-3" \
-c:a libmp3lame \
-b:a 128k \
chapter-01-normalized.mp3
این مقادیر فقط نقطه شروع هستند. استاندارد پلتفرم انتشار و نوع خروجی را بررسی و تمام فصلها را با هدف یکسان پردازش کنید.
افزودن سکوت میان بخشها
نبود مکث میان دو پاراگراف یا فصل باعث مصنوعیشدن روایت میشود.
مکثهای پیشنهادی اولیه:
- میان جملهها: براساس نشانهگذاری طبیعی
- میان پاراگرافها: حدود نیم تا یک ثانیه
- پس از تیتر: حدود یک تا دو ثانیه
- میان فصلها: دو تا چهار ثانیه
از افزودن مکث یکسان پس از تمام جملهها خودداری کنید؛ زیرا ریتم روایت مکانیکی میشود.
ساخت مقدمه کتاب صوتی
مقدمه میتواند شامل این موارد باشد:
شما به نسخه صوتی کتاب «نام کتاب» گوش میدهید.
نویسنده: نام نویسنده.
ناشر نسخه صوتی: نام ناشر.
تولیدشده در سال هزار و چهارصد و پنج.
فصل اول: عنوان فصل.
اگر صدا با هوش مصنوعی تولید شده است، میتوانید این موضوع را براساس سیاست انتشار و نیاز پروژه بهروشنی اعلام کنید.
ساخت فایل M4B
M4B برای کتاب صوتی مناسب است؛ زیرا میتواند اطلاعات کتاب، کاور و فصلبندی را در یک فایل نگه دارد.
ابتدا فصلها را در فهرست قرار دهید:
file '00-intro.m4a'
file '01-chapter-one.m4a'
file '02-chapter-two.m4a'
file '03-chapter-three.m4a'
نمونه اتصال اولیه:
ffmpeg \
-f concat \
-safe 0 \
-i chapters.txt \
-c:a aac \
-b:a 96k \
audiobook.m4b
برای افزودن Chapter Marker باید زمان شروع و پایان فصلها در فایل Metadata مشخص شود. ساخت خودکار این فایل را میتوان با خواندن مدت هر فصل از ffprobe انجام داد.
افزودن کاور و اطلاعات کتاب
برای افزودن کاور به فایل صوتی:
ffmpeg \
-i audiobook.m4b \
-i cover.jpg \
-map 0:a \
-map 1:v \
-c:a copy \
-c:v mjpeg \
-disposition:v attached_pic \
-metadata title="نام کتاب" \
-metadata artist="نام نویسنده" \
-metadata album="نسخه صوتی نام کتاب" \
audiobook-with-cover.m4b
برای سازگاری بهتر، کاور را مربعی و با کیفیت مناسب آماده کنید.
ساخت جلد کتاب صوتی با هوش مصنوعی
جلد کتاب صوتی باید در اندازه کوچک نیز خوانا باشد. عناصر مهم عبارتاند از:
- عنوان کوتاه و واضح
- نام نویسنده
- کنتراست مناسب
- تصویر مرکزی ساده
- حاشیه امن
- نبود جزئیات ریز
- نسبت مربعی
مدل هوش مصنوعی میتواند تصویر اصلی جلد را بسازد، اما بهتر است متن فارسی در نرمافزار طراحی اضافه شود.
نمونه پرامپت:
تصویر جلد مربعی برای یک کتاب صوتی فارسی درباره مدیریت زمان،
سبک مینیمال و حرفهای، ساعت شنی مدرن در مرکز،
پسزمینه سرمهای با نور بنفش ملایم،
فضای خالی کافی برای افزودن عنوان فارسی،
بدون نوشته، بدون لوگو و بدون حروف ساختگی
کنترل کیفیت کتاب صوتی
کنترل کیفیت نباید فقط به شنیدن چند دقیقه اول محدود شود.
بررسی متن و صدا
- آیا هیچ پاراگرافی حذف نشده است؟
- آیا ترتیب بخشها درست است؟
- آیا عنوان فصلها خوانده میشوند؟
- آیا شماره صفحه و سربرگ وارد صدا نشدهاند؟
- آیا اعداد درست خوانده میشوند؟
- آیا نامها تلفظ صحیح دارند؟
- آیا واژههای انگلیسی قابلفهماند؟
- آیا جملهها در محل نامناسب قطع نشدهاند؟
بررسی فنی
- آیا تمام فصلها بلندی صدای مشابه دارند؟
- آیا ابتدای فایل بریده نشده است؟
- آیا سکوتهای طولانی وجود ندارند؟
- آیا میان قطعهها صدای کلیک شنیده نمیشود؟
- آیا فرمت تمام فصلها یکسان است؟
- آیا کاور و Metadata درستاند؟
- آیا فایل روی موبایل و رایانه پخش میشود؟
- آیا فصلبندی M4B کار میکند؟
بررسی روایی
- آیا صدا با موضوع کتاب هماهنگ است؟
- آیا سرعت ثابت و مناسب است؟
- آیا مکثها طبیعیاند؟
- آیا پرسشها لحن پرسشی دارند؟
- آیا روایت بعد از چند دقیقه خستهکننده میشود؟
- آیا گفتوگوها از متن توضیحی قابلتشخیصاند؟
روش کنترل کیفیت سریع
برای هر فصل این بخشها را گوش کنید:
- سی ثانیه اول
- یک بخش از میانه
- قسمتی دارای عدد و اصطلاح
- آخرین دقیقه
- محل اتصال قطعهها
- یک پاراگراف دارای گفتوگو
علاوه بر نمونهبرداری، فایل نهایی باید حداقل یکبار بهطور کامل بررسی شود؛ بهخصوص اگر برای انتشار عمومی یا فروش آماده میشود.
تولید کتاب داستان با چند صدا
برای کتابهای داستانی میتوان نقشها را جدا کرد:
راوی: صدای اصلی و خنثی
شخصیت اول: صدای متفاوت
شخصیت دوم: صدای دوم
نقلقولها: لحن متمایز
ابتدا باید گفتوگوها از متن جدا و به شخصیت درست نسبت داده شوند. سپس فایلهای هر نقش تولید و در تدوین کنار هم قرار گیرند.
این روش پیچیدهتر است و مشکلات احتمالی آن عبارتاند از:
- تغییر ناگهانی شدت صدا
- تفاوت کیفیت میان صداها
- مکث نامناسب
- تشخیص اشتباه گوینده
- ناهماهنگی احساس و متن
- طولانیشدن فرایند تدوین
برای نسخه اول بهتر است از یک راوی استفاده شود، مگر اینکه ساختار گفتوگوها دقیق و قابلپردازش باشد.
ساخت سرویس آنلاین تولید کتاب صوتی
یک سرویس SaaS میتواند این جریان را ارائه کند:
- کاربر فایل کتاب را بارگذاری میکند.
- متن استخراج میشود.
- فصلها شناسایی میشوند.
- پیشنمایش متن آماده گفتار نمایش داده میشود.
- کاربر صدا و سرعت را انتخاب میکند.
- نمونه کوتاه تولید میشود.
- کاربر نمونه را تأیید میکند.
- تولید کامل در صف قرار میگیرد.
- وضعیت هر فصل ثبت میشود.
- بخشهای ناموفق دوباره تولید میشوند.
- فایل نهایی تدوین میشود.
- MP3 یا M4B برای دریافت آماده میشود.
وضعیتهای پیشنهادی پروژه
uploaded
extracting_text
preparing_text
waiting_for_voice_selection
sample_generation
waiting_for_approval
generating_audio
quality_check
mastering
completed
failed
اطلاعات پیشنهادی پروژه
{
"project_id": "book_1024",
"title": "شروع یک مسیر تازه",
"language": "fa-IR",
"voice_id": "VOICE_ID",
"speed": 0.95,
"output_format": "m4b",
"chapters": 10,
"status": "generating_audio"
}
معماری فنی پیشنهادی
ارتباط مستقیم رابط کاربری با API صوتی مناسب نیست. معماری بهتر:
کاربر
↓
رابط کاربری
↓
سرور اپلیکیشن
↓
استخراج و پاکسازی متن
↓
صف تولید فصلها
↓
API درواره
↓
ذخیره فایلهای صوتی
↓
کنترل کیفیت و اتصال فایلها
↓
دریافت خروجی نهایی
درخواستهای تولید کتاب ممکن است طولانی باشند. از Job Queue، Worker و فضای ذخیرهسازی فایل استفاده کنید و وضعیت پردازش را در پایگاه داده نگه دارید.
چگونه هزینه ساخت کتاب صوتی را کاهش دهیم؟
قبل از تولید کامل، نمونه بسازید
ابتدا یک تا سه دقیقه از متن واقعی کتاب را با چند صدا آزمایش کنید.
متن را قبل از ارسال پاکسازی کنید
شماره صفحه، منابع غیرضروری، URL و علائم خراب باعث افزایش هزینه و کاهش کیفیت میشوند.
بخشهای موفق را دوباره تولید نکنید
هر قطعه را با شناسه و Hash متن ذخیره کنید. اگر متن تغییر نکرده است، از فایل قبلی استفاده کنید.
واژهنامه را زود آماده کنید
اگر تلفظ یک نام پس از تولید کامل اصلاح شود، ممکن است دهها فایل نیاز به تولید مجدد داشته باشند.
فقط بخش مشکلدار را اصلاح کنید
فصل را به قطعههای کوچک تقسیم کنید تا نیازی به تولید دوباره کل فصل نباشد.
مصرف را ثبت کنید
این موارد را برای هر پروژه ذخیره کنید:
- تعداد کاراکتر
- تعداد فصل
- تعداد درخواست
- قطعههای ناموفق
- مدل و صدا
- هزینه هر فصل
- هزینه کل پروژه
- زمان تولید
اشتباهات رایج در ساخت کتاب صوتی با هوش مصنوعی
ارسال کل کتاب در یک درخواست
متن را فصلبهفصل و قطعهبهقطعه تولید کنید.
استفاده مستقیم از PDF استخراجشده
متن PDF ممکن است دارای شکست خط، شماره صفحه و ترتیب نادرست باشد.
آزمایشنکردن صدای فارسی
یک صدا ممکن است در انگلیسی طبیعی باشد، اما در فارسی تلفظ مناسبی نداشته باشد.
نداشتن واژهنامه تلفظ
نام اشخاص، برندها و اصطلاحات تخصصی باید پیش از تولید کامل آزمایش شوند.
تغییر صدا در میانه کتاب
مدل، نسخه یا تنظیمات صدا را در کل پروژه ثابت نگه دارید.
اتصال فایلها بدون کنترل مکث
ممکن است دو جمله بدون فاصله به هم متصل شوند یا میان آنها سکوت طولانی ایجاد شود.
انتشار خروجی بدون شنیدن کامل
خطاهای تلفظ، تکرار یا حذف متن ممکن است در بخشهای تصادفی رخ دهند.
استفاده از صدای سریع برای محتوای پیچیده
سرعت باید متناسب با نوع محتوا باشد، نه فقط کوتاهکردن زمان فایل.
پرسشهای متداول
چگونه کتاب را با هوش مصنوعی صوتی کنیم؟
متن کتاب را استخراج و پاکسازی کنید، فصلها را جدا کنید، صدای مناسب را انتخاب و هر فصل را در بخشهای کوچک به مدل تبدیل متن به گفتار ارسال کنید. سپس فایلها را ویرایش و به MP3 یا M4B تبدیل کنید.
آیا میتوان PDF را به کتاب صوتی تبدیل کرد؟
بله. اگر PDF متنی باشد، متن مستقیماً استخراج میشود. اگر اسکنشده باشد، ابتدا باید با OCR به متن تبدیل شود.
بهترین هوش مصنوعی برای ساخت کتاب صوتی فارسی چیست؟
بهترین مدل باید روی متن واقعی کتاب آزمایش شود. معیارهای مهم شامل تلفظ فارسی، طبیعیبودن صدا، ثبات، سرعت، هزینه، محدودیت طول متن و امکان استفاده از API هستند.
آیا ساخت کتاب صوتی با هوش مصنوعی رایگان است؟
بعضی ابزارها نسخه محدود یا مدل متنباز دارند. تولید یک کتاب کامل معمولاً به پردازش قابلتوجه نیاز دارد و ممکن است هزینه API یا زیرساخت داشته باشد.
آیا میتوان لحن و سرعت را تغییر داد؟
بسته به مدل میتوان سرعت، لحن، مکث یا بعضی ویژگیهای گفتار را با تنظیمات، دستور متنی یا SSML کنترل کرد.
آیا میتوان برای شخصیتهای کتاب صدای متفاوت ساخت؟
بله، اما متن باید به نقشها تقسیم شود و خروجیها در تدوین با یکدیگر ترکیب شوند.
MP3 بهتر است یا M4B؟
MP3 سازگاری گستردهای دارد و برای انتشار فصلهای جدا مناسب است. M4B میتواند کتاب، کاور و فصلبندی را در یک فایل نگه دارد.
آیا میتوان از API درواره برای ساخت کتاب صوتی استفاده کرد؟
در صورت وجود مدل TTS مناسب در فهرست جاری، میتوانید تولید صدا را از سمت سرور اپلیکیشن انجام دهید. شناسه مدل، صداها، فرمت خروجی و پارامترهای پشتیبانیشده را در مستندات فعلی بررسی کنید.
آیا هوش مصنوعی جای گوینده انسانی را میگیرد؟
برای بعضی کتابهای آموزشی و محتوای انبوه، صدای مصنوعی میتواند کاربردی باشد. در آثار نمایشی و احساسی، اجرای انسانی یا روش ترکیبی ممکن است نتیجه بهتری ایجاد کند.
جمعبندی
ساخت کتاب صوتی با هوش مصنوعی فقط فشردن یک دکمه نیست. کیفیت محصول نهایی به آمادهسازی متن، انتخاب صدا، اصلاح تلفظ و تدوین وابسته است.
مسیر پیشنهادی عبارت است از:
- حق استفاده از متن را مشخص کنید.
- متن را از فایل کتاب استخراج کنید.
- فصلها را جدا کنید.
- متن را برای شنیدن بازنویسی کنید.
- اعداد و علائم را به شکل قابلگفتار تبدیل کنید.
- واژهنامه تلفظ بسازید.
- چند صدا را روی نمونه واقعی آزمایش کنید.
- متن را به قطعههای کوچک تقسیم کنید.
- فصلها را با تنظیمات ثابت تولید کنید.
- فایلها را ویرایش و یکپارچه کنید.
- بلندی صدا و مکثها را کنترل کنید.
- خروجی MP3 یا M4B بسازید.
- کتاب را پیش از انتشار بهطور کامل بررسی کنید.
اگر قصد دارید قابلیت تبدیل کتاب، مقاله، محتوای آموزشی یا مستندات را به صدای فارسی داخل سایت و اپلیکیشن خود قرار دهید، میتوانید از مدلهای صوتی موجود از طریق API درواره استفاده کنید.
برای مشاهده مدلها، ساخت کلید API و بررسی نمونه درخواستها به مستندات API درواره مراجعه کنید.
مقالات مرتبط
- تبدیل متن فارسی به گفتار با هوش مصنوعی
- ساخت پادکست با هوش مصنوعی
- نوشتن کتاب با هوش مصنوعی
- تبدیل صدا و فایل صوتی به متن فارسی
- حذف نویز صدا با هوش مصنوعی
- تغییر و شبیهسازی صدا با هوش مصنوعی
- آموزش اتصال API هوش مصنوعی به نرمافزار
- محاسبه هزینه API هوش مصنوعی
منابع
این مقاله صرفاً با هدف آموزش و اطلاعرسانی تهیه شده است. پیش از استفاده عملی، مستندات رسمی سرویسها و صفحه سلب مسئولیت را مطالعه کنید.