دوبله فیلم با هوش مصنوعی؛ آموزش کامل ترجمه و دوبله فارسی ویدئو

در این راهنمای عملی یاد می‌گیرید چگونه ویدئو را با هوش مصنوعی به فارسی یا زبان‌های دیگر دوبله کنید؛ از استخراج گفتار و ترجمه تا ساخت صدا، تنظیم زمان‌بندی، لیپ‌سینک و کنترل کیفیت خروجی.

Share
دوبله فیلم با هوش مصنوعی؛ آموزش کامل ترجمه و دوبله فارسی ویدئو

دوبله فیلم با هوش مصنوعی فرایندی است که در آن صدای موجود در یک ویدئو به متن تبدیل می‌شود، متن به زبان مقصد ترجمه می‌شود و سپس یک صدای جدید با زمان‌بندی هماهنگ روی تصویر قرار می‌گیرد. ابزارهای پیشرفته‌تر می‌توانند صدای گوینده را نیز بازسازی کنند یا حرکت لب‌ها را با زبان جدید هماهنگ سازند.

در گذشته، دوبله یک ویدئوی آموزشی یا تبلیغاتی به چند زبان به مترجم، گوینده، صدابردار، تدوینگر و زمان قابل‌توجهی نیاز داشت. امروز هوش مصنوعی می‌تواند بخش بزرگی از این فرایند را خودکار کند؛ اما رسیدن به خروجی طبیعی همچنان به بازبینی ترجمه، اصلاح تلفظ، کنترل زمان‌بندی و میکس مناسب صدا نیاز دارد.

در این مقاله یاد می‌گیرید:

  • دوبله هوش مصنوعی چگونه کار می‌کند
  • تفاوت دوبله، ترجمه صوتی، زیرنویس و لیپ‌سینک چیست
  • چگونه یک ویدئو را مرحله‌به‌مرحله به فارسی دوبله کنید
  • چه ابزارهایی برای دوبله و ترجمه ویدئو مناسب‌اند
  • چگونه ترجمه‌ای طبیعی و متناسب با زمان دیالوگ بسازید
  • چگونه تلفظ فارسی و اصطلاحات تخصصی را اصلاح کنید
  • چگونه با API درواره یک گردش‌کار اختصاصی دوبله طراحی کنید
  • چگونه کیفیت خروجی را قبل از انتشار ارزیابی کنید

دوبله با هوش مصنوعی چیست؟

دوبله با هوش مصنوعی یا AI Dubbing استفاده از مدل‌های تشخیص گفتار، ترجمه، تولید صدا و گاهی همگام‌سازی لب برای جایگزین‌کردن صدای اصلی ویدئو با صدایی به زبان دیگر است.

یک سامانه کامل دوبله معمولاً چند مرحله دارد:

  1. استخراج صدای ویدئو
  2. تشخیص بخش‌های دارای گفتار
  3. تبدیل گفتار به متن
  4. تشخیص گویندگان مختلف
  5. ترجمه و بومی‌سازی متن
  6. تولید صدای زبان مقصد
  7. تنظیم طول هر جمله
  8. ترکیب صدای جدید با موسیقی و افکت‌ها
  9. هماهنگ‌سازی صدا با تصویر
  10. کنترل کیفیت و خروجی نهایی

ابزارهای آنلاین ممکن است همه این مراحل را پشت یک دکمه پنهان کنند، اما شناخت این زنجیره کمک می‌کند خطاهای خروجی را بهتر پیدا و اصلاح کنید.

تفاوت دوبله، زیرنویس، صداگذاری و لیپ‌سینک

این اصطلاحات گاهی به‌جای یکدیگر استفاده می‌شوند، درحالی‌که معنای متفاوتی دارند.

زیرنویس

در زیرنویس، گفتار به متن تبدیل و روی تصویر نمایش داده می‌شود. صدای اصلی تغییر نمی‌کند.

صداگذاری

در صداگذاری یا Voice-over معمولاً صدای جدید روی ویدئو قرار می‌گیرد. لازم نیست حرکت لب گوینده کاملاً با صدای جدید هماهنگ باشد.

دوبله

در دوبله، دیالوگ‌های زبان اصلی با دیالوگ‌های زبان مقصد جایگزین می‌شوند. زمان شروع، پایان، ریتم و حس گفتار باید تا حد ممکن با تصویر سازگار باشد.

لیپ‌سینک

لیپ‌سینک یا Lip Sync به هماهنگی صدا و حرکت لب گفته می‌شود. برخی ابزارهای جدید حرکت لب را نیز بازسازی می‌کنند تا گوینده ظاهراً به زبان مقصد صحبت کند.

ترجمه صوتی

در ترجمه صوتی، هدف اصلی انتقال محتوای گفتار به زبان دیگر است. ممکن است صدای جدید تولید شود، اما کیفیت نمایشی دوبله یا هماهنگی دقیق لب وجود نداشته باشد.

روشتغییر صداترجمههماهنگی لبکاربرد اصلی
زیرنویسخیربلهنیاز نداردآموزش، شبکه اجتماعی، دسترس‌پذیری
صداگذاریبلهاختیاریمعمولاً خیرمستند، آموزش، معرفی محصول
دوبلهبلهبلهنسبیفیلم، دوره، تبلیغات
دوبله با لیپ‌سینکبلهبلهبلهمحتوای حرفه‌ای و بازاریابی
ترجمه صوتیبلهبلهمعمولاً خیرانتقال سریع محتوا

دوبله خودکار برای چه نوع ویدئوهایی مناسب است؟

دوبله هوش مصنوعی برای همه محتواها کیفیت یکسانی ندارد. بهترین نتایج معمولاً در ویدئوهایی دیده می‌شود که گفتار واضح، تعداد گوینده محدود و صدای پس‌زمینه کنترل‌شده دارند.

کاربردهای مناسب عبارت‌اند از:

  • دوره‌های آموزشی
  • ویدئوهای یوتیوب
  • معرفی محصولات
  • آموزش نرم‌افزار
  • وبینار و ارائه
  • ویدئوهای بازاریابی
  • مستندهای کوتاه
  • ویدئوهای شبکه‌های اجتماعی
  • آموزش کارکنان
  • راهنمای استفاده از محصول
  • ویدئوهای پشتیبانی مشتری
  • محتوای چندزبانه وب‌سایت

ویدئوهایی با هم‌پوشانی شدید صداها، موسیقی بلند، لهجه بسیار سنگین، دیالوگ سریع یا بازی احساسی پیچیده ممکن است به ویرایش انسانی بیشتری نیاز داشته باشند.

دوبله خودکار چگونه انجام می‌شود؟

برای درک فرایند، یک ویدئوی انگلیسی را در نظر بگیرید که باید به فارسی دوبله شود.

مرحله اول: جداسازی صدا از ویدئو

ابتدا صدای ویدئو استخراج می‌شود. اگر موسیقی و افکت‌های صوتی در همان ترک گفتار قرار داشته باشند، ممکن است از مدل‌های جداسازی صدا برای تفکیک این اجزا استفاده شود.

خروجی مطلوب این مرحله می‌تواند شامل موارد زیر باشد:

  • صدای گفتار
  • موسیقی پس‌زمینه
  • افکت‌های صوتی
  • صدای محیط

هرچه صدای گوینده تمیزتر باشد، دقت تبدیل گفتار به متن افزایش پیدا می‌کند.

مرحله دوم: تبدیل گفتار به متن

مدل Speech-to-Text یا STT فایل صوتی را دریافت می‌کند و متن گفتار را همراه با زمان‌بندی تولید می‌کند.

خروجی ممکن است به این شکل باشد:

[
  {
    "start": 0.8,
    "end": 4.2,
    "speaker": "SPEAKER_01",
    "text": "Welcome to this complete video editing course."
  },
  {
    "start": 4.5,
    "end": 8.9,
    "speaker": "SPEAKER_01",
    "text": "In this lesson, we will create our first project."
  }
]

ثبت زمان شروع و پایان هر بخش برای تولید دوبله هماهنگ ضروری است.

مرحله سوم: تشخیص گوینده

اگر ویدئو چند گوینده دارد، سامانه باید تشخیص دهد هر جمله متعلق به چه کسی است. این فرایند Speaker Diarization نام دارد.

تشخیص گوینده کمک می‌کند:

  • برای هر شخصیت صدای متفاوتی انتخاب شود
  • دیالوگ‌ها با یکدیگر اشتباه نشوند
  • جنس، لحن و سبک صدا ثابت بماند
  • گفت‌وگوهای چندنفره طبیعی‌تر تولید شوند

مرحله چهارم: ترجمه و بومی‌سازی

ترجمه تحت‌اللفظی برای دوبله کافی نیست. جمله ترجمه‌شده باید علاوه بر حفظ معنا، از نظر طول نیز با زمان دیالوگ سازگار باشد.

برای مثال، ترجمه مستقیم یک جمله ممکن است ۱۲ ثانیه زمان ببرد، درحالی‌که گوینده اصلی آن را در ۷ ثانیه گفته است. در این شرایط متن فارسی باید بدون حذف پیام اصلی، کوتاه‌تر و گفتاری‌تر شود.

مرحله پنجم: تولید صدای فارسی

متن ترجمه‌شده به مدل تبدیل متن به گفتار یا Text-to-Speech داده می‌شود. برای هر گوینده می‌توان صدایی با ویژگی‌های مناسب انتخاب کرد:

  • زن یا مرد
  • رسمی یا صمیمی
  • آرام یا پرانرژی
  • تبلیغاتی یا آموزشی
  • سرعت گفتار
  • شدت بیان
  • مکث‌ها
  • نحوه تلفظ واژه‌های تخصصی

مرحله ششم: تنظیم زمان صدا

مدت صدای تولیدشده باید با بازه زمانی دیالوگ اصلی هماهنگ شود. روش‌های رایج عبارت‌اند از:

  • کوتاه‌کردن متن ترجمه
  • افزایش یا کاهش محدود سرعت گفتار
  • تنظیم مکث‌ها
  • تقسیم جمله بلند
  • ترکیب دو جمله کوتاه
  • تولید مجدد صدا با دستور دقیق‌تر

افزایش بیش‌ازحد سرعت صدا باعث مصنوعی‌شدن خروجی می‌شود. بهتر است ابتدا متن ترجمه اصلاح شود و تغییر سرعت در محدوده‌ای طبیعی باقی بماند.

مرحله هفتم: ترکیب صدا با موسیقی و افکت‌ها

اگر فقط کل صدای ویدئو حذف و صدای جدید جایگزین شود، موسیقی، صدای محیط و افکت‌ها نیز از بین می‌روند. برای نتیجه حرفه‌ای باید تا حد امکان گفتار اصلی حذف شود، اما موسیقی و افکت‌ها حفظ شوند.

مرحله هشتم: لیپ‌سینک

در دوبله معمولی، صدا با زمان کلی دیالوگ هماهنگ است. در دوبله دارای لیپ‌سینک، خود تصویر نیز پردازش می‌شود تا حرکت لب با صوت جدید سازگارتر شود.

HeyGen میان دوبله صوتی و دوبله ویدئویی تفاوت قائل می‌شود: در حالت Audio Dubbing فقط صدا ترجمه می‌شود، اما Video Dubbing شامل هماهنگ‌سازی حرکت لب نیز هست. جزئیات این دو حالت در راهنمای رسمی ترجمه ویدئوی HeyGen توضیح داده شده است.

آموزش سریع دوبله ویدئو به فارسی

اگر نمی‌خواهید گردش‌کار اختصاصی بسازید، می‌توانید از سرویس‌های آماده استفاده کنید.

فرایند عمومی در بیشتر این ابزارها مشابه است:

  1. ویدئوی اصلی را آماده کنید.
  2. فایل را در سرویس بارگذاری کنید.
  3. زبان اصلی را مشخص کنید.
  4. فارسی را به‌عنوان زبان مقصد انتخاب کنید.
  5. تشخیص گفتار را اجرا کنید.
  6. متن استخراج‌شده را بازبینی کنید.
  7. ترجمه فارسی را اصلاح کنید.
  8. صدای مناسب هر گوینده را انتخاب کنید.
  9. تلفظ نام‌ها و اصطلاحات را تنظیم کنید.
  10. دوبله را تولید کنید.
  11. زمان‌بندی جمله‌ها را بررسی کنید.
  12. در صورت نیاز لیپ‌سینک را فعال کنید.
  13. زیرنویس فارسی را نیز خروجی بگیرید.
  14. ویدئوی نهایی را مشاهده و کنترل کنید.
  15. فایل نهایی را با کیفیت مناسب صادر کنید.

دکمه تولید دوبله را قبل از اصلاح متن فشار ندهید. اصلاح متن پیش از تولید صدا، تعداد دفعات بازتولید و هزینه نهایی را کاهش می‌دهد.

آماده‌سازی فایل ویدئو

کیفیت ورودی تأثیر زیادی بر نتیجه دارد.

ویژگی‌های ورودی مناسب

  • گفتار واضح باشد.
  • موسیقی از صدای گوینده بلندتر نباشد.
  • چند نفر هم‌زمان صحبت نکنند.
  • نویز محیطی شدید وجود نداشته باشد.
  • فایل ناقص یا خراب نباشد.
  • نرخ پخش صدا ثابت باشد.
  • تصویر و صدا از ابتدا هماهنگ باشند.

اگر صدا نویز زیادی دارد، ابتدا آن را پاک‌سازی کنید. راهنمای حذف نویز صدا با هوش مصنوعی برای این مرحله مفید است.

قالب پیشنهادی

بیشتر ابزارها فایل MP4 با ویدئوی H.264 و صدای AAC را به‌خوبی می‌پذیرند. اگر سرویس فایل شما را قبول نمی‌کند، می‌توانید با FFmpeg آن را تبدیل کنید:

ffmpeg -i input.mov \
  -c:v libx264 \
  -c:a aac \
  -b:a 192k \
  output.mp4

برای استخراج صدای مناسب تشخیص گفتار:

ffmpeg -i input.mp4 \
  -vn \
  -ac 1 \
  -ar 16000 \
  -c:a pcm_s16le \
  speech.wav

در این دستور:

  • -vn تصویر را حذف می‌کند.
  • -ac 1 صدا را تک‌کاناله می‌کند.
  • -ar 16000 نرخ نمونه‌برداری را روی ۱۶ کیلوهرتز قرار می‌دهد.
  • خروجی WAV برای بسیاری از مدل‌های تشخیص گفتار مناسب است.

نسخه اصلی ویدئو را نگه دارید و عملیات تبدیل را روی یک کپی انجام دهید.

تبدیل گفتار ویدئو به متن

خروجی تبدیل گفتار باید قبل از ترجمه اصلاح شود. خطاهای این مرحله مستقیماً به ترجمه و دوبله منتقل می‌شوند.

موارد زیر را بررسی کنید:

  • نام اشخاص
  • نام شرکت‌ها و محصولات
  • اصطلاحات تخصصی
  • اعداد و تاریخ‌ها
  • مخفف‌ها
  • کلمات انگلیسی داخل گفتار
  • مرزبندی جمله‌ها
  • زمان شروع و پایان
  • تشخیص گوینده

برای آموزش کامل این مرحله می‌توانید مقاله تبدیل صدای فارسی به متن با هوش مصنوعی را مطالعه کنید.

ترجمه مناسب دوبله چه ویژگی‌هایی دارد؟

ترجمه دوبله با ترجمه مقاله یا سند تفاوت دارد. متن قرار است شنیده شود، نه خوانده شود.

یک ترجمه مناسب دوبله باید:

  • محاوره‌ای و شنیدنی باشد
  • پیام اصلی را حفظ کند
  • با شخصیت یا گوینده تناسب داشته باشد
  • بیش‌ازحد طولانی نباشد
  • از جمله‌های پیچیده دوری کند
  • اصطلاحات را درست منتقل کند
  • متناسب با فضای فرهنگی مخاطب باشد
  • ریتم طبیعی داشته باشد
  • در زمان موجود قابل‌بیان باشد

مثال ترجمه تحت‌اللفظی و ترجمه مناسب دوبله

متن انگلیسی:

Before we move forward, let us take a quick look at what we have accomplished so far.

ترجمه تحت‌اللفظی:

پیش از آنکه به جلو حرکت کنیم، اجازه دهید نگاهی سریع به آنچه تاکنون انجام داده‌ایم بیندازیم.

ترجمه مناسب‌تر برای دوبله:

قبل از ادامه، سریع مرور کنیم تا اینجا چه کارهایی انجام داده‌ایم.

نسخه دوم کوتاه‌تر، طبیعی‌تر و برای گفتار مناسب‌تر است.

پرامپت ترجمه متن برای دوبله فارسی

تو یک مترجم و ویراستار حرفه‌ای دوبله فارسی هستی.

دیالوگ زیر را از [زبان مبدأ] به فارسی ترجمه کن.

متن:
[متن اصلی]

زمان قابل استفاده:
[تعداد ثانیه]

نوع ویدئو:
[آموزشی، تبلیغاتی، مصاحبه، مستند یا سرگرمی]

ویژگی گوینده:
[رسمی، صمیمی، آرام، پرانرژی یا تخصصی]

قواعد:
- معنی و هدف جمله حفظ شود.
- ترجمه برای شنیدن طبیعی باشد، نه برای متن رسمی.
- طول جمله با زمان موجود متناسب باشد.
- از ترجمه تحت‌اللفظی خودداری کن.
- نام محصول، برند و اصطلاحات تخصصی تغییر نکنند.
- جمله فارسی روان و قابل‌اجرا باشد.
- توضیح اضافه وارد نکن.

سه خروجی ارائه بده:
1. نسخه دقیق
2. نسخه کوتاه مناسب دوبله
3. نسخه محاوره‌ای طبیعی

ترجمه فایل زیرنویس برای دوبله

اگر فایل SRT دارید، باید شماره‌ها و تایم‌کدها بدون تغییر بمانند.

پرامپت مناسب:

فایل زیرنویس زیر را به فارسی روان و مناسب دوبله ترجمه کن.

قواعد:
- شماره هر قطعه تغییر نکند.
- تایم‌کدها دقیقاً حفظ شوند.
- هیچ قطعه‌ای حذف یا اضافه نشود.
- ترجمه هر قطعه در زمان همان بخش قابل‌بیان باشد.
- اصطلاحات تخصصی به‌درستی حفظ شوند.
- لحن تمام قطعه‌ها یکدست باشد.
- فقط محتوای فایل SRT نهایی را برگردان.

[SRT]

اگر ترجمه طولانی‌تر از بازه زمانی است، بهتر است نسخه کوتاه‌تر جداگانه تولید شود. تغییر خودکار تایم‌کد بدون بررسی تصویر می‌تواند همگام‌سازی را خراب کند.

ساخت واژه‌نامه تلفظ

تلفظ اشتباه نام برندها، اصطلاحات فنی و نام افراد یکی از مشکلات متداول دوبله خودکار است.

پیش از تولید صدا، یک واژه‌نامه بسازید:

عبارت اصلیشکل قابل‌خواندنقاعده
APIاِی‌پی‌آیحرف‌به‌حرف
Pythonپایتونمعادل رایج فارسی
PostgreSQLپُستگرس‌کیواِلتلفظ فنی
Darvarehدروارهتلفظ فارسی برند
Model IDمدل آیدیلحن فنی و طبیعی

برخی موتورهای صوتی از علائم آوایی یا Phoneme پشتیبانی می‌کنند. در سایر ابزارها می‌توان شکل نوشتاری کلمه را برای رسیدن به تلفظ صحیح تغییر داد.

چگونه لحن صدای دوبله را طبیعی کنیم؟

صدای طبیعی فقط به انتخاب مدل وابسته نیست. متن و شیوه نشانه‌گذاری نیز بر خروجی تأثیر می‌گذارند.

جمله‌ها را کوتاه کنید

جمله‌های بسیار بلند معمولاً ریتم یکنواخت و غیرطبیعی ایجاد می‌کنند.

مکث‌ها را مشخص کنید

استفاده درست از نقطه، ویرگول و سه‌نقطه می‌تواند به مکث طبیعی کمک کند. نتیجه در همه مدل‌ها یکسان نیست و باید آزمایش شود.

عددها را به شکل قابل‌خواندن بنویسید

برای مثال، ممکن است نوشتن «۲۵ درصد» نتیجه بهتری از 25% تولید کند.

مخفف‌ها را کنترل کنید

اگر مدل API را به‌صورت یک کلمه تلفظ می‌کند، آن را به شکل «اِی‌پی‌آی» بنویسید.

جهت اجرای جمله را مشخص کنید

برای هر بخش می‌توانید دستورهایی مانند این بدهید:

این جمله را با لحن آموزشی، مطمئن و آرام بخوان.
سرعت گفتار متوسط باشد.
روی عبارت «کنترل کیفیت» تأکید ملایم داشته باش.
در پایان جمله مکث کوتاه ایجاد کن.

احساس را بیش‌ازحد تغییر ندهید

صدای بسیار نمایشی برای یک آموزش نرم‌افزاری مناسب نیست. نوع صدا باید با محتوای ویدئو هماهنگ باشد.

انتخاب صدا برای دوبله فارسی

برای انتخاب صدا این معیارها را در نظر بگیرید:

  • وضوح تلفظ فارسی
  • طبیعی‌بودن مکث‌ها
  • تناسب سن تقریبی صدا با تصویر
  • سرعت گفتار
  • توان بیان اصطلاحات تخصصی
  • حفظ ثبات میان بخش‌ها
  • امکان کنترل لحن
  • کیفیت خروجی در جمله‌های بلند
  • قابلیت تلفظ نام‌های خاص
  • هزینه تولید

پیش از دوبله کامل، یک نمونه ۲۰ تا ۳۰ ثانیه‌ای بسازید. انتخاب صدا براساس یک جمله کوتاه ممکن است گمراه‌کننده باشد؛ بهتر است نمونه شامل عدد، نام خاص، جمله پرسشی و عبارت تخصصی باشد.

کلون صدا در دوبله

Voice Cloning می‌تواند صدای مشابه گوینده اصلی را در زبان مقصد تولید کند. این قابلیت برای تولید نسخه‌های چندزبانه از دوره آموزشی، ویدئوی مدیر یک شرکت یا محتوای شخصی سازنده مفید است.

برای استفاده مسئولانه:

  • فقط صدای خودتان یا صدایی را استفاده کنید که اجازه روشن برای استفاده از آن دارید.
  • مخاطب را درباره مصنوعی‌بودن صدا گمراه نکنید.
  • نمونه صوتی تمیز و بدون موسیقی تهیه کنید.
  • قبل از انتشار، تمام جمله‌ها را گوش دهید.
  • از تولید گفته‌هایی که گوینده تأیید نکرده است خودداری کنید.

برای آشنایی بیشتر، مقاله تغییر صدا و کلون صدا با هوش مصنوعی را بخوانید.

بهترین ابزارهای دوبله و ترجمه ویدئو با هوش مصنوعی

قابلیت‌ها، زبان‌های قابل استفاده، محدودیت‌ها و قیمت سرویس‌ها ممکن است تغییر کنند. قبل از انتخاب نهایی، زبان فارسی و کیفیت آن را با یک نمونه واقعی آزمایش کنید.

ElevenLabs Dubbing Studio

ElevenLabs ابزار تخصصی دوبله برای ترجمه، تولید صدا و مدیریت بخش‌های گفتاری ارائه می‌دهد. صفحه رسمی ElevenLabs Dubbing Studio دوبله خودکار و بومی‌سازی محتوای صوتی را معرفی می‌کند.

این سرویس برای موارد زیر قابل بررسی است:

  • دوبله محتوای آموزشی
  • ترجمه پادکست و مصاحبه
  • حفظ ویژگی‌های صدای گوینده
  • ویرایش بخش‌های ترجمه‌شده
  • تولید نسخه‌های چندزبانه

پیش از انتخاب، پشتیبانی عملی از فارسی و کیفیت تلفظ اصطلاحات پروژه خود را آزمایش کنید.

HeyGen

HeyGen بیشتر برای ویدئوهای دارای گوینده مقابل دوربین شناخته می‌شود. قابلیت Video Translation آن می‌تواند صدا را ترجمه و حرکت لب را نیز هماهنگ کند.

براساس مستندات رسمی، این سرویس دو مسیر اصلی دارد:

  • Audio Dubbing برای ترجمه و جایگزینی صدا
  • Video Dubbing برای ترجمه صدا همراه با لیپ‌سینک

این ابزار برای ویدئوهای آموزشی، معرفی محصول، مصاحبه و محتوای بازاریابی مناسب است.

Rask AI

Rask AI روی بومی‌سازی ویدئو، ترجمه صوتی، زیرنویس، کلون صدا و لیپ‌سینک تمرکز دارد. طبق صفحه رسمی مترجم ویدئوی Rask AI، امکان ویرایش ترجمه و دریافت زیرنویس نیز وجود دارد.

Rask برای پروژه‌هایی مناسب است که:

  • چند زبان خروجی نیاز دارند
  • چند گوینده در ویدئو حضور دارد
  • فایل زیرنویس جداگانه لازم است
  • ترجمه باید قبل از تولید صدا اصلاح شود

Synthesia

Synthesia علاوه بر ساخت ویدئو با آواتار، قابلیت دوبله و ترجمه ویدئو ارائه می‌دهد. صفحه رسمی AI Dubbing در Synthesia بر تولید نسخه‌های چندزبانه و حفظ ویژگی‌های صدا تمرکز دارد.

Canva

Canva نیز قابلیت دوبله را در محیط طراحی و تدوین خود ارائه می‌کند. این گزینه برای کاربرانی مناسب است که طراحی، زیرنویس و تدوین ساده را در یک محیط انجام می‌دهند. در صفحه رسمی دوبله Canva امکان بارگذاری و ترجمه ویدئو توضیح داده شده است.

مقایسه روش یک‌کلیکی و گردش‌کار حرفه‌ای

معیارابزار یک‌کلیکیگردش‌کار چندمرحله‌ای
سرعت شروعبسیار بالامتوسط
کنترل ترجمهمحدود تا متوسطبالا
کنترل تلفظوابسته به ابزاربالا
مدیریت چند گویندهخودکارقابل تنظیم
کنترل زمان‌بندیمحدوددقیق
اتصال به نرم‌افزارمعمولاً محدودمناسب API
هزینه توسعهندارددارد
مناسب تولید انبوهوابسته به سرویسبالا
امکان تعویض مدلمحدودبیشتر

برای چند ویدئوی کوتاه، سرویس آماده معمولاً سریع‌تر است. برای پلتفرم آموزشی، سامانه رسانه‌ای یا تولید مداوم، گردش‌کار اختصاصی می‌تواند کنترل بیشتری ایجاد کند.

ساخت گردش‌کار دوبله با API درواره

درواره یک ابزار آماده تدوین یا دوبله نیست؛ بلکه زیرساخت دسترسی API به مدل‌های هوش مصنوعی است. توسعه‌دهندگان می‌توانند با استفاده از مدل‌های موجود، بخش‌هایی مانند ترجمه، بازنویسی، خلاصه‌سازی، پردازش متن و سایر قابلیت‌های هوش مصنوعی را به سامانه دوبله خود اضافه کنند.

معماری پیشنهادی:

ویدئوی ورودی
    ↓
استخراج صدا
    ↓
تبدیل گفتار به متن و زمان‌بندی
    ↓
اصلاح متن و تشخیص اصطلاحات
    ↓
ترجمه و بومی‌سازی با API درواره
    ↓
کنترل طول هر قطعه
    ↓
تولید صدای زبان مقصد
    ↓
تنظیم زمان و میکس صدا
    ↓
لیپ‌سینک اختیاری
    ↓
کنترل کیفیت
    ↓
ویدئوی نهایی

برای شروع، در درواره ثبت‌نام کنید، کلید API بگیرید و Model ID مناسب را از صفحه مدل‌ها انتخاب کنید.

ترجمه قطعه‌های دوبله با API درواره

در این نمونه، یک مدل متنی وظیفه دارد دیالوگ را به فارسی روان و کوتاه ترجمه کند.

curl https://api.darvareh.ir/v1/chat/completions \
  -H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_MODEL_ID",
    "messages": [
      {
        "role": "system",
        "content": "شما مترجم حرفه‌ای دوبله فارسی هستید. ترجمه باید طبیعی، دقیق، قابل‌شنیدن و متناسب با زمان دیالوگ باشد. اطلاعات جدید اضافه نکنید."
      },
      {
        "role": "user",
        "content": "متن مبدأ: Before we continue, save a copy of your project. زمان موجود: 4.2 ثانیه. نوع محتوا: آموزش نرم‌افزار. سه خروجی بده: ترجمه دقیق، نسخه کوتاه دوبله و نسخه محاوره‌ای."
      }
    ],
    "temperature": 0.3
  }'

مقادیر زیر را جایگزین کنید:

  • YOUR_DARVAREH_API_KEY: کلید API درواره
  • YOUR_MODEL_ID: Model ID انتخاب‌شده در درواره

در برنامه واقعی، کلید API را در متغیر محیطی سمت سرور نگهداری کنید و آن را داخل اپلیکیشن سمت کاربر یا مخزن عمومی قرار ندهید.

ترجمه ساخت‌یافته چند قطعه

برای پردازش خودکار، بهتر است هر قطعه دارای شناسه، زمان و متن باشد:

[
  {
    "id": 1,
    "start": 0.8,
    "end": 4.2,
    "speaker": "SPEAKER_01",
    "source_text": "Welcome to the course."
  },
  {
    "id": 2,
    "start": 4.5,
    "end": 8.9,
    "speaker": "SPEAKER_01",
    "source_text": "Today we will create our first project."
  }
]

پرامپت پیشنهادی:

قطعه‌های زیر را برای دوبله فارسی ترجمه کن.

قواعد:
- id، start، end و speaker تغییر نکنند.
- ترجمه هر قطعه با زمان آن متناسب باشد.
- لحن آموزشی و طبیعی باشد.
- اصطلاحات فنی حفظ شوند.
- هیچ قطعه‌ای حذف یا ادغام نشود.
- فقط JSON معتبر برگردان.

برای هر قطعه این فیلدها را اضافه کن:
- translated_text
- short_dub_text
- pronunciation_notes
- needs_review
- review_reason

[JSON قطعه‌ها]

در برنامه باید پاسخ مدل را اعتبارسنجی کنید. اگر شناسه‌ای حذف شده یا JSON معتبر نیست، آن بخش را برای پردازش مجدد ارسال کنید.

نمونه ساده با Python

import os
import requests

API_KEY = os.environ["DARVAREH_API_KEY"]
MODEL_ID = os.environ["DARVAREH_MODEL_ID"]

segments = [
    {
        "id": 1,
        "start": 0.8,
        "end": 4.2,
        "speaker": "SPEAKER_01",
        "source_text": "Welcome to the course."
    },
    {
        "id": 2,
        "start": 4.5,
        "end": 8.9,
        "speaker": "SPEAKER_01",
        "source_text": "Today we will create our first project."
    }
]

payload = {
    "model": MODEL_ID,
    "messages": [
        {
            "role": "system",
            "content": (
                "شما مترجم حرفه‌ای دوبله فارسی هستید. "
                "زمان‌بندی و شناسه قطعه‌ها را تغییر ندهید. "
                "خروجی فقط JSON معتبر باشد."
            )
        },
        {
            "role": "user",
            "content": f"""
قطعه‌های زیر را به فارسی روان و مناسب دوبله ترجمه کن:
{segments}

برای هر قطعه translated_text و short_dub_text اضافه کن.
"""
        }
    ],
    "temperature": 0.2
}

response = requests.post(
    "https://api.darvareh.ir/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json"
    },
    json=payload,
    timeout=60
)

response.raise_for_status()
result = response.json()
print(result["choices"][0]["message"]["content"])

در محیط عملیاتی باید موارد زیر را نیز اضافه کنید:

  • اعتبارسنجی JSON
  • مدیریت Timeout
  • تلاش مجدد کنترل‌شده
  • ثبت خطا
  • محدودیت اندازه ورودی
  • تقسیم فایل‌های طولانی
  • ذخیره وضعیت هر قطعه
  • جلوگیری از ترجمه دوباره بخش‌های تکمیل‌شده
  • بازبینی انسانی قبل از تولید صدا

تقسیم پروژه‌های طولانی

یک ویدئوی یک‌ساعته را در یک درخواست پردازش نکنید. بهتر است آن را به قطعه‌های کوچک تقسیم کنید.

روش مناسب:

  1. گفتار را براساس سکوت و پایان جمله تقسیم کنید.
  2. قطعه‌های بسیار کوتاه را با هم ادغام کنید.
  3. برای هر قطعه شناسه ثابت بسازید.
  4. تعداد محدودی قطعه را در هر درخواست قرار دهید.
  5. بخشی از متن قبل و بعد را برای حفظ زمینه اضافه کنید.
  6. خروجی هر بخش را فوراً ذخیره کنید.
  7. در پایان، یک مرحله کنترل یکدستی اجرا کنید.

تقسیم صرفاً براساس تعداد کاراکتر ممکن است جمله را از وسط جدا کند. مرز جمله و زمان مکث معیار بهتری است.

حفظ اصطلاحات در تمام ویدئو

برای دوره‌ها و ویدئوهای تخصصی، یک Translation Memory یا حافظه ترجمه بسازید:

{
  "prompt": "پرامپت",
  "token": "توکن",
  "fine-tuning": "فاین‌تیونینگ",
  "API Gateway": "اِی‌پی‌آی گیت‌وی",
  "deployment": "استقرار",
  "Darvareh": "درواره"
}

این واژه‌نامه را به درخواست‌های ترجمه اضافه کنید تا یک اصطلاح در بخش‌های مختلف به شکل‌های متفاوت ترجمه نشود.

کنترل طول ترجمه

می‌توان مدت قطعه را از اختلاف زمان پایان و شروع محاسبه کرد:

مدت قطعه = زمان پایان - زمان شروع

برای مثال:

4.2 - 0.8 = 3.4 ثانیه

تعداد کلمه به‌تنهایی معیار کاملی نیست؛ زیرا سرعت خواندن، طول واژه‌ها و مکث‌ها متفاوت است. روش عملی این است:

  1. نسخه ترجمه‌شده تولید شود.
  2. صدای آزمایشی ساخته شود.
  3. مدت واقعی فایل صوتی اندازه‌گیری شود.
  4. اگر صدا طولانی است، متن کوتاه شود.
  5. اگر صدا کوتاه است، مکث یا توضیح طبیعی تنظیم شود.
  6. نسخه جدید دوباره آزمایش شود.

میکس صدای نهایی با FFmpeg

اگر فایل دوبله نهایی آماده باشد، می‌توانید آن را جایگزین صدای ویدئو کنید:

ffmpeg \
  -i input-video.mp4 \
  -i persian-dub.wav \
  -map 0:v:0 \
  -map 1:a:0 \
  -c:v copy \
  -c:a aac \
  -b:a 192k \
  -shortest \
  dubbed-video.mp4

اگر موسیقی و افکت‌ها در یک فایل جداگانه باشند، می‌توانید آن‌ها را با صدای دوبله ترکیب کنید:

ffmpeg \
  -i dialogue.wav \
  -i background.wav \
  -filter_complex \
  "[0:a]volume=1.0[voice];[1:a]volume=0.28[bg];[voice][bg]amix=inputs=2:duration=longest[aout]" \
  -map "[aout]" \
  mixed-audio.wav

مقدار صدای پس‌زمینه را براساس محتوای واقعی تنظیم کنید. عدد 0.28 فقط یک نقطه شروع است.

کنترل کیفیت دوبله فارسی

قبل از انتشار، ویدئو را حداقل در چند مرحله بررسی کنید.

کنترل ترجمه

  • آیا معنی اصلی حفظ شده است؟
  • آیا جمله فارسی طبیعی است؟
  • آیا اصطلاحات درست ترجمه شده‌اند؟
  • آیا چیزی به متن اضافه شده است؟
  • آیا لحن با ویدئو هماهنگ است؟

کنترل صدا

  • آیا تلفظ درست است؟
  • آیا صدا در تمام ویدئو ثابت می‌ماند؟
  • آیا سرعت گفتار طبیعی است؟
  • آیا مکث‌ها مناسب‌اند؟
  • آیا احساس صدا با تصویر تناسب دارد؟

کنترل زمان‌بندی

  • آیا صدا زودتر از حرکت لب شروع می‌شود؟
  • آیا جمله پس از پایان تصویر ادامه دارد؟
  • آیا بین جمله‌ها سکوت غیرعادی وجود دارد؟
  • آیا دو گوینده روی هم افتاده‌اند؟

کنترل میکس

  • آیا صدای گوینده واضح است؟
  • آیا موسیقی بیش‌ازحد بلند است؟
  • آیا حجم صدا ناگهان تغییر می‌کند؟
  • آیا نویز یا صدای گفتار اصلی باقی مانده است؟
  • آیا ابتدا و انتهای جمله‌ها قطع شده‌اند؟

کنترل تصویر

  • آیا لیپ‌سینک مصنوعی به نظر می‌رسد؟
  • آیا اطراف دهان اعوجاج ایجاد شده است؟
  • آیا در نماهای نیم‌رخ خطا دیده می‌شود؟
  • آیا کیفیت تصویر پس از پردازش کاهش یافته است؟

امتیازدهی ساده به کیفیت

برای مقایسه خروجی ابزارها می‌توانید به هر معیار از ۱ تا ۵ امتیاز بدهید:

معیاروزن پیشنهادی
صحت ترجمه۲۵٪
طبیعی‌بودن صدای فارسی۲۰٪
تلفظ اصطلاحات۱۵٪
هماهنگی زمانی۱۵٪
ثبات صدا۱۰٪
کیفیت میکس۱۰٪
کیفیت لیپ‌سینک۵٪

اگر ویدئو گوینده مقابل دوربین ندارد، وزن لیپ‌سینک را حذف و به صحت ترجمه و کیفیت صدا اضافه کنید.

اشتباهات رایج در دوبله با هوش مصنوعی

تولید مستقیم بدون اصلاح متن

خطای تشخیص گفتار به ترجمه و سپس به صدای نهایی منتقل می‌شود. متن مبدأ را ابتدا اصلاح کنید.

ترجمه کلمه‌به‌کلمه

این روش جمله‌های طولانی، رسمی و غیرطبیعی تولید می‌کند. ترجمه را برای شنیدن و زمان اجرا آماده کنید.

استفاده از یک صدا برای همه شخصیت‌ها

در ویدئوهای چندنفره، برای هر گوینده پروفایل صوتی جداگانه تعریف کنید.

نادیده‌گرفتن اصطلاحات تخصصی

واژه‌نامه ترجمه و تلفظ را پیش از شروع پروژه بسازید.

افزایش شدید سرعت صدا

سرعت بالا ممکن است زمان‌بندی را اصلاح کند، اما طبیعی‌بودن صدا را از بین می‌برد. ابتدا متن را کوتاه کنید.

حذف موسیقی و افکت‌ها

جایگزینی کامل ترک صوتی ممکن است فضای ویدئو را از بین ببرد. در صورت امکان، گفتار را از سایر صداها جدا کنید.

اعتماد کامل به لیپ‌سینک

لیپ‌سینک ممکن است در نیم‌رخ، پوشیده‌شدن دهان، حرکت سریع سر یا کیفیت پایین تصویر خطا داشته باشد. تمام نماها را بررسی کنید.

استفاده از صدای فرد دیگر بدون اجازه

از صدای خودتان، صداهای مجاز سرویس یا صدایی استفاده کنید که اجازه روشن برای استفاده از آن دارید.

نداشتن نسخه پشتیبان

فایل اصلی، صدای استخراج‌شده، متن، ترجمه، زیرنویس و خروجی‌های میانی را نگه دارید.

راه کاهش هزینه دوبله خودکار

برای کنترل هزینه:

  • ابتدا فقط ۳۰ ثانیه از ویدئو را آزمایش کنید.
  • متن را قبل از تولید صدا نهایی کنید.
  • بخش‌های بدون گفتار را پردازش نکنید.
  • خروجی‌های موفق را ذخیره کنید.
  • قطعه‌های اصلاح‌نشده را دوباره تولید نکنید.
  • لیپ‌سینک را فقط برای نماهای ضروری اجرا کنید.
  • برای ترجمه ساده از مدل اقتصادی‌تر استفاده کنید.
  • مدل قوی‌تر را به بخش‌های دشوار اختصاص دهید.
  • درخواست‌ها و نتایج را Cache کنید.
  • دوبله صوتی و لیپ‌سینک را جداگانه قیمت‌گذاری کنید.

برای مشاهده Model IDها و قیمت‌های به‌روز، صفحه مدل‌های درواره را ببینید.

گردش‌کار پیشنهادی برای تولیدکنندگان محتوا

اگر یک ویدئوی ۱۰ دقیقه‌ای دارید، این ترتیب مناسب است:

  1. انتخاب یک دقیقه نماینده از ویدئو
  2. استخراج و پاک‌سازی صدا
  3. تبدیل گفتار به متن
  4. اصلاح متن مبدأ
  5. ساخت واژه‌نامه
  6. ترجمه دقیق
  7. کوتاه‌سازی برای دوبله
  8. آزمایش سه صدای فارسی
  9. انتخاب صدای نهایی
  10. تولید نمونه یک‌دقیقه‌ای
  11. بررسی زمان‌بندی و تلفظ
  12. اصلاح پرامپت و واژه‌نامه
  13. پردازش بقیه ویدئو
  14. میکس موسیقی و افکت‌ها
  15. تولید زیرنویس فارسی
  16. کنترل نهایی با هدفون و بلندگو
  17. خروجی نسخه اصلی و نسخه شبکه اجتماعی

آزمایش روی یک بخش نماینده، از تکرار خطا در کل پروژه جلوگیری می‌کند.

آیا دوبله هوش مصنوعی جایگزین دوبلور می‌شود؟

هوش مصنوعی برای محتوای آموزشی، ویدئوهای پرتعداد، ترجمه سریع و پروژه‌های دارای بودجه محدود بسیار مفید است. بااین‌حال، دوبله حرفه‌ای فیلم، بازی و آثار نمایشی به درک شخصیت، بازی صوتی، هدایت هنری و تصمیم‌های انسانی نیاز دارد.

در بسیاری از پروژه‌ها، بهترین نتیجه از ترکیب این دو به دست می‌آید:

  • هوش مصنوعی برای رونویسی و پیش‌نویس ترجمه
  • مترجم برای بومی‌سازی
  • مدل صوتی یا گوینده برای اجرا
  • تدوینگر برای زمان‌بندی و میکس
  • بازبین انسانی برای کنترل کیفیت

پرسش‌های متداول

آیا می‌توان فیلم انگلیسی را با هوش مصنوعی به فارسی دوبله کرد؟

بله. ابتدا گفتار انگلیسی به متن تبدیل می‌شود، سپس ترجمه فارسی و صدای جدید تولید می‌شود. کیفیت نهایی به وضوح صدا، ترجمه، موتور صوتی و کنترل زمان‌بندی بستگی دارد.

آیا ابزار دوبله رایگان وجود دارد؟

برخی سرویس‌ها آزمایش یا سهمیه محدود ارائه می‌کنند، اما دوبله ویدئوهای طولانی، کلون صدا و لیپ‌سینک معمولاً هزینه‌بر هستند. شرایط سرویس‌ها را پیش از پردازش پروژه کامل بررسی کنید.

بهترین هوش مصنوعی دوبله فارسی کدام است؟

یک پاسخ ثابت وجود ندارد. کیفیت فارسی، نوع ویدئو، تعداد گویندگان، نیاز به لیپ‌سینک و بودجه بر انتخاب اثر می‌گذارند. یک نمونه یکسان را در چند ابزار آزمایش کنید.

آیا می‌توان صدای اصلی گوینده را حفظ کرد؟

برخی ابزارها از Voice Cloning یا Voice Preservation استفاده می‌کنند. نتیجه به کیفیت نمونه، زبان مقصد و توان مدل بستگی دارد. استفاده از صدای اشخاص باید با اجازه آن‌ها انجام شود.

آیا برای دوبله به زیرنویس نیاز داریم؟

الزامی نیست، اما متن زمان‌بندی‌شده یا فایل SRT فرایند ترجمه، اصلاح و کنترل کیفیت را آسان‌تر می‌کند.

چرا صدای فارسی با تصویر هماهنگ نیست؟

ترجمه فارسی ممکن است از جمله اصلی طولانی‌تر باشد. متن را کوتاه کنید، مکث‌ها را تنظیم کنید و فقط در حد طبیعی سرعت صدا را تغییر دهید.

آیا لیپ‌سینک برای همه ویدئوها لازم است؟

خیر. در اسکرین‌کست، ارائه اسلاید، مستند و بسیاری از آموزش‌ها، دوبله صوتی کافی است. لیپ‌سینک بیشتر برای نماهای واضح صورت اهمیت دارد.

آیا می‌توان سامانه دوبله اختصاصی ساخت؟

بله. می‌توانید ماژول‌های تشخیص گفتار، ترجمه، تولید صدا، تنظیم زمان، میکس و کنترل کیفیت را در یک گردش‌کار ترکیب کنید. API درواره می‌تواند دسترسی مدل موردنیاز بخش‌های هوش مصنوعی این سامانه را فراهم کند.

جمع‌بندی

دوبله فیلم با هوش مصنوعی فقط تبدیل یک متن به صدا نیست. یک خروجی حرفه‌ای به تشخیص دقیق گفتار، ترجمه مناسب گفت‌وگو، مدیریت اصطلاحات، تولید صدای طبیعی، هماهنگی زمانی، حفظ موسیقی و کنترل کیفیت نیاز دارد.

برای یک پروژه کوتاه می‌توانید از ابزارهای آماده دوبله و ترجمه ویدئو استفاده کنید. اگر تعداد ویدئوها زیاد است یا به کنترل بیشتری نیاز دارید، ساخت گردش‌کار اختصاصی با API انتخاب مناسب‌تری خواهد بود.

درواره به توسعه‌دهندگان و کسب‌وکارها امکان می‌دهد از طریق یک API یکپارچه به مدل‌های مختلف هوش مصنوعی دسترسی داشته باشند و قابلیت‌هایی مانند ترجمه، پردازش متن، تولید محتوا و سایر مراحل سامانه دوبله را در محصول خود پیاده‌سازی کنند.

برای شروع، در درواره ثبت‌نام کنید و مدل مناسب پروژه را از صفحه مدل‌ها انتخاب کنید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.