ساخت آواتار سخنگو با هوش مصنوعی؛ تبدیل عکس به ویدئوی سخنگو

در این راهنما یاد می‌گیرید چگونه یک عکس را با متن یا صدای فارسی به آواتار سخنگو تبدیل کنید؛ همراه با انتخاب عکس، ساخت صدا، Lip Sync، ابزارهای معتبر و پیاده‌سازی با API درواره.

Share
ساخت آواتار سخنگو با هوش مصنوعی؛ تبدیل عکس به ویدئوی سخنگو

برای ساخت یک ویدئوی آموزشی یا معرفی محصول، همیشه به دوربین، استودیو، مجری و تجهیزات حرفه‌ای نیاز ندارید. ابزارهای ساخت آواتار سخنگو با هوش مصنوعی می‌توانند یک عکس ثابت را دریافت کنند، آن را با صدای ضبط‌شده یا متن هماهنگ کنند و ویدئویی بسازند که در آن شخصیت موجود در تصویر صحبت می‌کند.

این فناوری با نام‌هایی مانند آواتار سخنگو، عکس سخنگو، مجری هوش مصنوعی، Talking Avatar، Talking Photo، Digital Human و AI Presenter شناخته می‌شود. در مدل‌های جدید، فقط لب‌ها حرکت نمی‌کنند؛ بلکه ممکن است حرکت چشم‌ها، ابروها، سر، حالت چهره و حتی دست‌ها نیز متناسب با ریتم و احساس صدا تولید شود.

از آواتار سخنگو می‌توان برای تولید ویدئوهای آموزشی، معرفی خدمات، پاسخ به سؤالات متداول، محتوای شبکه‌های اجتماعی، راهنمای محصول و آموزش کارکنان استفاده کرد.

در این مقاله، تمام مراحل ساخت آواتار سخنگوی فارسی را از انتخاب تصویر و نوشتن متن تا تولید صدا، هماهنگ‌سازی لب‌ها، خروجی‌گرفتن و پیاده‌سازی با API درواره بررسی می‌کنیم.

آواتار سخنگو چیست؟

آواتار سخنگو یک شخصیت دیجیتال است که متن یا فایل صوتی را به‌صورت ویدئویی اجرا می‌کند. این شخصیت می‌تواند یکی از موارد زیر باشد:

  • تصویر واقعی خود کاربر
  • تصویر فردی با رضایت او
  • مجری آماده موجود در یک سرویس
  • شخصیت کاملاً تولیدشده با هوش مصنوعی
  • کاراکتر کارتونی یا سه‌بعدی
  • تصویر حیوان یا شخصیت خیالی
  • آواتار اختصاصی یک برند
  • شخصیت آموزشی ثابت

در ساده‌ترین حالت، سیستم سه ورودی دریافت می‌کند:

تصویر شخصیت + متن یا صدا + تنظیمات حرکت

و خروجی آن یک فایل ویدئویی است:

ویدئوی سخنگو با حرکت هماهنگ لب و صورت

تفاوت آواتار سخنگو، Lip Sync و مجری دیجیتال

این اصطلاحات به یکدیگر نزدیک‌اند، اما دقیقاً یکسان نیستند.

آواتار سخنگو

یک شخصیت ثابت یا تولیدشده است که متن یا صدا را اجرا می‌کند. تمرکز اصلی بر ایجاد یک ارائه‌دهنده دیجیتال است.

Talking Photo

یک عکس ثابت را به ویدئویی کوتاه تبدیل می‌کند. صورت، لب‌ها، چشم‌ها و گاهی سر حرکت می‌کنند.

Lip Sync

Lip Sync یا هماهنگ‌سازی لب، فرایند تطبیق حرکت دهان با صدای گوینده است. ممکن است روی یک ویدئوی موجود یا یک تصویر ثابت انجام شود.

مجری هوش مصنوعی

یک آواتار سخنگوی حرفه‌ای است که معمولاً در مقابل دوربین مجازی قرار می‌گیرد و برای آموزش، تبلیغات، ارائه و ارتباطات سازمانی استفاده می‌شود.

آواتار تعاملی

فقط یک ویدئوی ازپیش‌ساخته‌شده نیست. کاربر با آن صحبت می‌کند و آواتار با کمک مدل زبانی، تبدیل گفتار به متن و تولید صدا، به‌صورت زنده یا نزدیک به زنده پاسخ می‌دهد.

این مقاله بیشتر بر تولید ویدئوی سخنگو از یک عکس، متن یا فایل صوتی متمرکز است.

آواتار سخنگو چگونه کار می‌کند؟

فرایند فنی معمولاً شامل چند مرحله است.

تحلیل تصویر

مدل، موقعیت اجزای چهره را شناسایی می‌کند:

  • چشم‌ها
  • ابروها
  • بینی
  • لب‌ها
  • فک
  • گونه‌ها
  • زاویه سر
  • مرز مو و صورت

تحلیل صدا

فایل صوتی به واحدهای گفتاری کوچک‌تر مانند واج‌ها یا Phonemeها تحلیل می‌شود. مدل بررسی می‌کند که در هر لحظه چه صدایی تلفظ می‌شود.

تولید حالت دهان

برای هر بخش از صدا، شکل متناسب دهان یا Viseme تولید می‌شود. برای مثال، شکل دهان هنگام تلفظ «م» با «آ» یا «او» متفاوت است.

تولید حرکات تکمیلی

مدل ممکن است حرکات زیر را نیز اضافه کند:

  • پلک‌زدن
  • حرکت ابرو
  • تکان‌دادن سر
  • لبخند ملایم
  • تغییر حالت چشم
  • حرکت شانه‌ها
  • حرکت دست‌ها
  • تغییر حالت متناسب با احساس صدا

ترکیب صدا و تصویر

در مرحله پایانی، فریم‌های تولیدشده با فایل صوتی ترکیب و به ویدئو تبدیل می‌شوند.

برای ساخت آواتار سخنگو به چه چیزهایی نیاز داریم؟

حداقل ورودی‌های لازم عبارت‌اند از:

  • یک تصویر واضح از شخصیت
  • متن یا فایل صوتی
  • ابزار یا مدل آواتار
  • تنظیمات خروجی مانند نسبت تصویر
  • چند دقیقه زمان برای تولید و بررسی

برای خروجی حرفه‌ای‌تر ممکن است به این موارد نیز نیاز داشته باشید:

  • میکروفون مناسب
  • ابزار حذف نویز
  • مدل تبدیل متن فارسی به گفتار
  • موسیقی پس‌زمینه
  • زیرنویس
  • لوگو و عناصر برند
  • نرم‌افزار تدوین
  • تصویر یا ویدئوی مکمل
  • پرامپت کنترل رفتار آواتار

انتخاب عکس مناسب

کیفیت تصویر ورودی مستقیماً بر کیفیت ویدئو اثر می‌گذارد.

صورت واضح و روبه‌دوربین باشد

برای اولین آزمایش، تصویری انتخاب کنید که فرد تقریباً مستقیم به دوربین نگاه می‌کند. تصویر نیم‌رخ برای هماهنگی لب‌ها دشوارتر است.

لب‌ها مشخص باشند

دست، مو، ماسک، میکروفون یا اشیای دیگر نباید جلوی دهان را بگیرند.

نور متعادل باشد

نور بسیار شدید یا سایه عمیق ممکن است تشخیص اجزای چهره را دشوار کند.

تصویر وضوح کافی داشته باشد

تصویر بسیار کوچک، تار یا فشرده باعث ایجاد حرکت غیرطبیعی لب و چشم می‌شود. برای بیشتر کاربردها، تصویری با ابعاد حداقل حدود ۱۰۲۴ پیکسل نقطه شروع مناسبی است.

حالت چهره طبیعی باشد

چهره بسیار خندان، دهان کاملاً باز یا حالت اغراق‌آمیز ممکن است هماهنگ‌سازی گفتار را دشوار کند. حالت خنثی یا لبخند ملایم معمولاً مناسب‌تر است.

فقط یک شخصیت اصلی وجود داشته باشد

اگر تصویر شامل چند چهره باشد، مدل ممکن است شخصیت اشتباهی را متحرک کند. بهتر است از پرتره تک‌نفره استفاده کنید.

کادر متناسب با کاربرد انتخاب شود

برای ویدئوی آموزشی، پرتره از سینه به بالا مناسب است. برای شبکه‌های اجتماعی، تصویر عمودی یا مربعی می‌تواند بهتر باشد.

نسبت تصویر مناسب

نسبت تصویر را براساس محل انتشار انتخاب کنید:

  • 16:9 برای یوتیوب، سایت و ارائه
  • 9:16 برای ریلز، استوری و ویدئوی عمودی
  • 1:1 برای بعضی پست‌های شبکه اجتماعی
  • 4:5 برای فید عمودی شبکه‌های اجتماعی
  • 4:3 برای برخی ویدئوهای آموزشی و سازمانی

اگر تصویر ورودی مربع باشد اما خروجی عمودی درخواست کنید، ابزار ممکن است بخش‌های اطراف شخصیت را بسازد. برای جلوگیری از خطا، بهتر است تصویر از ابتدا به نسبت موردنظر نزدیک باشد.

متن بهتر، آواتار طبیعی‌تر

کیفیت ویدئو فقط به تصویر وابسته نیست. متن باید برای گفتار نوشته شده باشد، نه صرفاً برای مطالعه.

متن نوشتاری:

درواره زیرساختی یکپارچه است که امکان اتصال توسعه‌دهندگان و کسب‌وکارها به مجموعه‌ای از مدل‌های هوش مصنوعی را از طریق API فراهم می‌نماید.

نسخه مناسب‌تر برای گفتار:

درواره، یک زیرساخت یکپارچه برای دسترسی به مدل‌های هوش مصنوعی است. توسعه‌دهندگان و کسب‌وکارها می‌توانند از طریق یک API، مدل‌های مختلف را به محصولات خود متصل کنند.

نسخه دوم جمله‌های کوتاه‌تری دارد و مکث‌های آن طبیعی‌تر است.

قواعد نوشتن متن آواتار

برای دریافت گفتار طبیعی:

  • جمله‌ها را کوتاه نگه دارید.
  • در هر جمله یک پیام اصلی بیان کنید.
  • از عبارت‌های بسیار رسمی و سنگین پرهیز کنید.
  • محل مکث‌ها را با نقطه و ویرگول مشخص کنید.
  • عددهای دشوار را به شکل قابل تلفظ بنویسید.
  • مخفف‌های انگلیسی را از نظر تلفظ بررسی کنید.
  • نام برندها را همان‌طور بنویسید که باید خوانده شوند.
  • متن را پیش از تولید، یک بار با صدای بلند بخوانید.
  • مقدمه را کوتاه نگه دارید.
  • از تکرار پیام پرهیز کنید.
  • فراخوان اقدام را روشن بیان کنید.

پرامپت نوشتن متن آواتار

در نقش نویسنده ویدئوی کوتاه فارسی عمل کن.

برای یک آواتار سخنگو، متنی براساس اطلاعات زیر بنویس:

موضوع: [موضوع]
هدف: [هدف]
مخاطب: [مخاطب]
مدت تقریبی: [تعداد ثانیه]
لحن: [حرفه‌ای، دوستانه، آموزشی یا تبلیغاتی]
فراخوان اقدام: [CTA]

قواعد:
- متن برای گفتار نوشته شود، نه برای مقاله.
- جمله‌ها کوتاه و روان باشند.
- هر جمله فقط یک پیام اصلی داشته باشد.
- از عبارت‌های کلیشه‌ای و اغراق‌آمیز استفاده نشود.
- هیچ اطلاعات، آمار یا ادعایی ساخته نشود.
- تلفظ اصطلاحات فنی تا حد امکان روشن باشد.
- متن با یک شروع جذاب آغاز شود.
- در پایان یک فراخوان اقدام مشخص قرار بگیرد.

نمونه متن معرفی محصول

اگر برای پروژه خود به مدل‌های مختلف هوش مصنوعی نیاز دارید، لازم نیست هر سرویس را جداگانه مدیریت کنید.

درواره به شما امکان می‌دهد از طریق یک اتصال، به مدل‌های متنوع هوش مصنوعی دسترسی داشته باشید.

می‌توانید مدل مناسب را انتخاب کنید، مصرف خود را مدیریت کنید و هوش مصنوعی را به نرم‌افزار یا فرایند کسب‌وکار خود متصل کنید.

برای شروع، به وب‌سایت درواره سر بزنید.

نمونه متن آموزشی

در این ویدئو یاد می‌گیریم چگونه یک پرامپت دقیق بنویسیم.

ابتدا هدف خود را روشن کنید. سپس مخاطب، قالب خروجی و محدودیت‌ها را مشخص کنید.

اگر اطلاعات مهمی وجود دارد، آن‌ها را به شکل مرتب در اختیار مدل قرار دهید.

در پایان نیز خروجی را بررسی کنید و در صورت نیاز، پرامپت را اصلاح کنید.

تبدیل متن به صدای فارسی

اگر فایل صوتی آماده ندارید، می‌توانید از تبدیل متن به گفتار یا Text-to-Speech استفاده کنید.

فرایند کلی:

متن فارسی
↓
مدل Text-to-Speech
↓
فایل صوتی
↓
مدل Talking Avatar
↓
ویدئوی سخنگو

هنگام انتخاب صدای فارسی، این موارد را بررسی کنید:

  • تلفظ درست کلمات فارسی
  • تلفظ نام برندها
  • توانایی خواندن اعداد
  • تلفظ اصطلاحات انگلیسی
  • طبیعی‌بودن مکث‌ها
  • سرعت گفتار
  • امکان کنترل احساس
  • کیفیت فایل خروجی
  • شرایط استفاده تجاری

برای آشنایی بیشتر می‌توانید مقاله تبدیل متن فارسی به صدا با هوش مصنوعی را مطالعه کنید.

استفاده از صدای ضبط‌شده

استفاده از صدای واقعی معمولاً کنترل بیشتری بر لحن و احساس ویدئو می‌دهد.

برای ضبط بهتر:

  • در محیط آرام ضبط کنید.
  • میکروفون را بیش از حد به دهان نزدیک نکنید.
  • صدای فن و کولر را کاهش دهید.
  • با سرعت ثابت صحبت کنید.
  • میان جمله‌ها مکث طبیعی داشته باشید.
  • از تغییر ناگهانی بلندی صدا پرهیز کنید.
  • متن را چند بار تمرین کنید.
  • فایل را بدون موسیقی پس‌زمینه به مدل بدهید.
  • نویز شدید را پیش از تولید حذف کنید.
  • ابتدا چند ثانیه نمونه آزمایشی بسازید.

اگر صدا نویز دارد، راهنمای حذف نویز صدا با هوش مصنوعی می‌تواند مفید باشد.

فرمت مناسب صدا

فرمت‌های پشتیبانی‌شده به ابزار و مدل بستگی دارند، اما فرمت‌های زیر رایج‌اند:

  • WAV
  • MP3
  • M4A
  • AAC

برای آرشیو و پردازش حرفه‌ای، WAV کیفیت مناسبی دارد؛ اما حجم آن بیشتر است. MP3 برای انتقال و استفاده عمومی سبک‌تر است.

موسیقی را پیش از تولید آواتار با صدای گوینده ترکیب نکنید. موسیقی ممکن است تشخیص گفتار و Lip Sync را ضعیف کند. بهتر است موسیقی در مرحله تدوین اضافه شود.

بهترین ابزارهای ساخت آواتار سخنگو

HeyGen

HeyGen می‌تواند یک تصویر را به Photo Avatar سخنگو تبدیل کند. طبق صفحه رسمی، کاربر می‌تواند تصویر و متن یا صدا را وارد کند و ویدئویی با هماهنگی لب و حرکات چهره بسازد. صفحه رسمی Talking Photo در HeyGen

این ابزار برای موارد زیر مناسب است:

  • معرفی محصول
  • ویدئوی شبکه اجتماعی
  • آموزش کوتاه
  • بازاریابی
  • محتوای چندزبانه
  • ساخت مجری دیجیتال

Synthesia

Synthesia بیشتر بر ویدئوهای سازمانی، آموزشی و ارائه‌های مبتنی بر آواتار تمرکز دارد. این سرویس مجموعه‌ای از آواتارهای آماده و قابلیت ساخت آواتار شخصی ارائه می‌کند. صفحه رسمی Synthesia

کاربردهای مناسب:

  • آموزش کارکنان
  • معرفی فرایندهای سازمانی
  • ویدئوی راهنما
  • محتوای چندزبانه
  • آموزش محصول
  • ارائه‌های رسمی

D-ID

D-ID قابلیت تبدیل تصویر ثابت یا ویدئو و متن یا صدا به مجری دیجیتال سخنگو را ارائه می‌کند. این سرویس علاوه بر محیط آماده، API نیز دارد. صفحه رسمی API در D-ID

کاربردهای مناسب:

  • عکس سخنگو
  • آواتار تعاملی
  • راهنمای دیجیتال
  • آموزش
  • ارتباط با مشتری
  • ادغام در نرم‌افزار

Hedra

Hedra امکان تبدیل عکس یا کاراکتر به آواتار سخنگو را با استفاده از فایل صوتی یا متن فراهم می‌کند. تمرکز آن بر حرکت چهره، Lip Sync و اجرای احساسی شخصیت است. صفحه رسمی Talking Avatar در Hedra

کاربردهای مناسب:

  • شخصیت‌های خلاقانه
  • روایت داستان
  • ویدئوی شبکه اجتماعی
  • کاراکترهای غیرواقعی
  • محتوای تبلیغاتی
  • اجرای احساسی‌تر

قیمت، محدودیت استفاده رایگان، واترمارک، زبان‌های پشتیبانی‌شده و شرایط تجاری این ابزارها ممکن است تغییر کنند. پیش از انتخاب نهایی، صفحه رسمی هر سرویس را بررسی کنید.

آموزش ساخت آواتار سخنگو با عکس

روند عمومی در بیشتر ابزارها چنین است:

مرحله اول: انتخاب نوع آواتار

مشخص کنید می‌خواهید:

  • عکس خودتان را متحرک کنید.
  • از آواتار آماده استفاده کنید.
  • کاراکتر جدید بسازید.
  • آواتار اختصاصی برند ایجاد کنید.

مرحله دوم: بارگذاری تصویر

تصویر واضحی با چهره روبه‌دوربین بارگذاری کنید. بهتر است برای آزمایش اول، پس‌زمینه ساده باشد.

مرحله سوم: واردکردن متن یا صدا

یکی از این دو روش را انتخاب کنید:

  • نوشتن متن و انتخاب صدای مصنوعی
  • بارگذاری صدای ضبط‌شده

مرحله چهارم: انتخاب زبان و صدا

اگر از Text-to-Speech استفاده می‌کنید، صدای فارسی را انتخاب و تلفظ متن را آزمایش کنید.

مرحله پنجم: تنظیم رفتار

در صورت پشتیبانی ابزار، موارد زیر را تنظیم کنید:

  • شدت حرکت
  • حالت چهره
  • میزان لبخند
  • حرکت سر
  • تماس چشمی
  • احساس
  • کادر
  • نسبت تصویر

مرحله ششم: تولید نمونه کوتاه

ابتدا ویدئویی ۵ تا ۱۰ثانیه‌ای تولید کنید. تولید مستقیم ویدئوی چنددقیقه‌ای ممکن است زمان و هزینه بیشتری ایجاد کند.

مرحله هفتم: کنترل خروجی

لب‌ها، چشم‌ها، حرکت سر، تلفظ و کیفیت صدا را بررسی کنید.

مرحله هشتم: تولید نسخه نهایی

پس از تأیید نمونه، متن کامل را ارسال کنید.

مرحله نهم: تدوین

در مرحله نهایی این موارد را اضافه کنید:

  • زیرنویس
  • موسیقی
  • لوگو
  • عنوان
  • تصویر محصول
  • اسکرین‌ریکورد
  • فراخوان اقدام
  • صفحه پایانی

پرامپت رفتار آواتار

بعضی مدل‌ها امکان ارائه دستور رفتاری یا Motion Prompt دارند:

شخصیت مستقیم به دوربین نگاه کند و با لحنی حرفه‌ای و دوستانه صحبت کند. حرکات سر محدود و طبیعی باشند. هنگام بیان نکات مهم، ابروها کمی حرکت کنند. لبخند ملایم حفظ شود. از حرکات شدید، چرخش ناگهانی سر و اغراق در حالت صورت پرهیز شود.

پرامپت مجری آموزشی

شخصیت مانند یک مدرس حرفه‌ای صحبت کند. تماس چشمی با دوربین حفظ شود. حرکات صورت آرام و متناسب با توضیح آموزشی باشند. در پایان جمله‌ها مکث کوتاه ایجاد شود. حالت چهره مطمئن، آرام و دوستانه باشد.

پرامپت معرفی محصول

شخصیت با انرژی کنترل‌شده و لحنی حرفه‌ای محصول را معرفی کند. در شروع لبخند ملایمی داشته باشد. هنگام بیان مزیت اصلی، کمی بر کلمات تأکید کند. حرکات صورت طبیعی باشند و شخصیت در تمام ویدئو مستقیم به دوربین نگاه کند.

پرامپت ویدئوی شبکه اجتماعی

اجرای شخصیت پرانرژی، کوتاه و طبیعی باشد. جمله اول با حالت کنجکاوی بیان شود. حرکات سر و ابرو با ریتم گفتار هماهنگ باشند، اما اغراق‌آمیز نشوند. تماس چشمی با دوربین حفظ شود.

Negative Prompt پیشنهادی

اگر مدل از Negative Prompt پشتیبانی می‌کند:

poor lip sync, distorted mouth, extra teeth, frozen eyes,
excessive blinking, unnatural head movement, face deformation,
identity change, blurry face, robotic expression, jitter,
background distortion, camera movement, duplicated features

معادل مفهومی فارسی:

هماهنگی ضعیف لب، دهان تغییرشکل‌یافته، دندان اضافه، چشم‌های ثابت، پلک‌زدن بیش از حد، حرکت غیرطبیعی سر، تغییر هویت، صورت تار، حالت رباتیک، لرزش تصویر، تغییر پس‌زمینه

خطاهای رایج آواتارهای سخنگو

حرکت نادرست لب‌ها

دلایل احتمالی:

  • صدای دارای نویز
  • موسیقی داخل فایل صوتی
  • تلفظ سریع
  • کیفیت پایین مدل
  • پوشیده‌بودن دهان
  • زاویه نامناسب صورت

دندان‌های غیرطبیعی

مدل ممکن است هنگام بازکردن دهان، دندان‌های نامنظم یا اضافه تولید کند. استفاده از تصویر واضح و مدل مناسب می‌تواند این خطا را کاهش دهد.

پلک‌زدن بیش از حد

Motion Prompt را محدود کنید:

پلک‌زدن طبیعی و کم باشد.

حرکت شدید سر

برای ویدئوی آموزشی یا رسمی، حرکت زیاد سر آزاردهنده است:

سر تقریباً ثابت باشد و فقط حرکات ملایم و طبیعی داشته باشد.

تغییر هویت

اگر چهره در طول ویدئو تغییر می‌کند:

  • تصویر ورودی واضح‌تری انتخاب کنید.
  • مدت کلیپ را کاهش دهید.
  • حرکت را محدود کنید.
  • از مدل تخصصی آواتار استفاده کنید.
  • تولید را به چند بخش کوتاه تقسیم کنید.

تلفظ نادرست کلمات فارسی

کلمه را به شکل تلفظی بنویسید یا در صورت امکان از فایل صوتی واقعی استفاده کنید.

حرکت پس‌زمینه

از پس‌زمینه ساده استفاده کنید و در پرامپت بنویسید:

پس‌زمینه کاملاً ثابت باقی بماند.

ساخت آواتار فارسی حرفه‌ای

ساخت آواتار فارسی سه بخش مستقل دارد:

متن فارسی
+
صدای فارسی طبیعی
+
مدل هماهنگ‌سازی تصویر و صدا

مدل آواتار لزوماً نباید زبان فارسی را «درک» کند؛ اگر فایل صوتی فارسی باکیفیت دریافت کند، ممکن است حرکات لب را براساس ویژگی‌های صوتی بسازد. بااین‌حال، کیفیت Lip Sync فارسی میان مدل‌ها متفاوت است و باید آزمایش شود.

برای نتیجه بهتر:

  • جمله‌ها را کوتاه کنید.
  • سرعت گفتار را متعادل نگه دارید.
  • از فایل صوتی تمیز استفاده کنید.
  • نام انگلیسی را جداگانه آزمایش کنید.
  • ویدئو را به بخش‌های کوتاه تقسیم کنید.
  • زیرنویس فارسی اضافه کنید.
  • خروجی را با چند صدای مختلف مقایسه کنید.

مدت مناسب هر کلیپ

برای شروع:

  • ۵ تا ۱۰ ثانیه برای آزمایش
  • ۱۵ تا ۳۰ ثانیه برای شبکه اجتماعی
  • ۳۰ تا ۹۰ ثانیه برای معرفی کوتاه
  • چند کلیپ جداگانه برای آموزش طولانی

تولید یک ویدئوی طولانی در یک مرحله ممکن است باعث افت هماهنگی، تغییر چهره یا افزایش هزینه شود. بهتر است متن طولانی به چند بخش تقسیم و سپس در تدوین به یکدیگر متصل شود.

کاربردهای تجاری آواتار سخنگو

معرفی محصول

آواتار می‌تواند ویژگی‌ها و کاربرد محصول را توضیح دهد و در کنار آن تصاویر واقعی محصول نمایش داده شوند.

آموزش کاربران

برای هر قابلیت نرم‌افزار، یک ویدئوی کوتاه ساخته شود که آواتار در ابتدای آن توضیح می‌دهد و سپس اسکرین‌ریکورد نمایش داده می‌شود.

پاسخ به سؤالات متداول

می‌توان برای هر سؤال یک ویدئوی کوتاه تولید کرد:

چگونه ثبت‌نام کنیم؟
چگونه رمز عبور را تغییر دهیم؟
چگونه اشتراک را فعال کنیم؟
چگونه از قابلیت موردنظر استفاده کنیم؟

آموزش کارکنان

آواتار ثابت سازمان می‌تواند فرایندها، قوانین داخلی، راهنمای استفاده از سامانه‌ها و محتوای آموزشی را ارائه کند.

بازاریابی شخصی‌سازی‌شده

در مقیاس بالا می‌توان متن را براساس نام مشتری، صنعت یا محصول تغییر داد. این فرایند باید با کنترل انسانی و رعایت رضایت مخاطب انجام شود.

تولید محتوای چندزبانه

یک ویدئو را می‌توان با صدا و متن زبان‌های مختلف تولید کرد، بدون اینکه تمام نسخه‌ها دوباره فیلم‌برداری شوند.

استفاده از API درواره

اگر قصد دارید فرایند تولید آواتار را داخل نرم‌افزار، سایت یا سیستم تولید محتوای خود قرار دهید، می‌توانید از مدل‌های متنی، صوتی و ویدئویی قابل دسترسی از طریق درواره استفاده کنید.

درواره یک ویرایشگر آماده ساخت آواتار نیست؛ بلکه زیرساخت API هوش مصنوعی است. شما رابط کاربری و گردش کار محصول را می‌سازید و مدل‌های مناسب را از طریق API به آن متصل می‌کنید.

یک خط تولید کامل می‌تواند شامل این مراحل باشد:

موضوع ویدئو
↓
تولید متن با مدل زبانی
↓
بازبینی انسانی
↓
تبدیل متن به صدای فارسی
↓
ارسال تصویر و صدا به مدل Talking Avatar
↓
دریافت Job ID
↓
بررسی وضعیت تولید
↓
دریافت ویدئو
↓
افزودن زیرنویس و برند
↓
تأیید و انتشار

برای مشاهده مدل‌های موجود و قیمت‌های به‌روز، صفحه مدل‌های درواره را بررسی کنید.

تولید متن آواتار با API درواره

ابتدا کلید API را در متغیر محیطی ذخیره کنید:

export DARVAREH_API_KEY="YOUR_API_KEY"

سپس متن ویدئو را تولید کنید:

curl https://api.darvareh.ir/v1/chat/completions \
  -H "Authorization: Bearer $DARVAREH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_MODEL_ID",
    "temperature": 0.4,
    "messages": [
      {
        "role": "system",
        "content": "شما نویسنده حرفه‌ای متن ویدئوی فارسی هستید. متن باید برای گفتار نوشته شود، جمله‌های کوتاه داشته باشد و هیچ اطلاعاتی را حدس نزند."
      },
      {
        "role": "user",
        "content": "یک متن ۴۵ثانیه‌ای برای آواتار سخنگو بنویس که API هوش مصنوعی درواره را به توسعه‌دهندگان معرفی کند. لحن حرفه‌ای و روان باشد، از اغراق استفاده نشود و در پایان کاربر به darvareh.ir دعوت شود."
      }
    ]
  }'

مقدار YOUR_MODEL_ID باید با Model ID مدل متنی انتخاب‌شده در درواره جایگزین شود.

نمونه Python برای تولید سناریو

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1"
)

response = client.chat.completions.create(
    model="YOUR_MODEL_ID",
    temperature=0.4,
    messages=[
        {
            "role": "system",
            "content": """
شما نویسنده متن ویدئوی فارسی هستید.

قواعد:
- متن برای گفتار نوشته شود.
- جمله‌ها کوتاه باشند.
- هیچ ادعای تأییدنشده‌ای تولید نشود.
- شروع ویدئو جذاب اما غیراغراق‌آمیز باشد.
- فراخوان اقدام روشن باشد.
"""
        },
        {
            "role": "user",
            "content": """
موضوع: معرفی API هوش مصنوعی درواره
مخاطب: توسعه‌دهندگان و مدیران محصول
مدت: ۴۵ ثانیه
لحن: حرفه‌ای و روان
CTA: مراجعه به darvareh.ir
"""
        }
    ]
)

script = response.choices[0].message.content
print(script)

درخواست تولید ویدئو چگونه ارسال می‌شود؟

برخلاف Chat Completions، ساختار API مدل‌های ویدئویی هنوز کاملاً یکسان نیست. بعضی مدل‌ها این ورودی‌ها را می‌خواهند:

{
  "model": "YOUR_VIDEO_MODEL_ID",
  "image_url": "https://example.com/avatar.jpg",
  "audio_url": "https://example.com/speech.wav",
  "prompt": "حرکت صورت طبیعی و تماس چشمی مستقیم باشد.",
  "aspect_ratio": "9:16",
  "resolution": "1080p"
}

برخی مدل‌ها فایل را مستقیماً دریافت می‌کنند و برخی فقط URL عمومی یا موقت می‌پذیرند. مسیر درخواست، نام پارامترها، محدودیت مدت و ساختار خروجی به مدل انتخابی وابسته است.

بنابراین:

  1. در صفحه مدل‌های درواره یک مدل مناسب Talking Avatar یا Audio-driven Video انتخاب کنید.
  2. قابلیت دریافت تصویر و صدا را بررسی کنید.
  3. Model ID درواره را بردارید.
  4. نمونه درخواست همان مدل را مبنا قرار دهید.
  5. قیمت و محدودیت مدت را بررسی کنید.
  6. ابتدا یک کلیپ کوتاه آزمایشی بسازید.

طراحی Backend مناسب

کلید API نباید در فرانت‌اند قرار بگیرد. معماری مناسب:

مرورگر کاربر
↓
Backend شما
↓
ذخیره موقت تصویر و صدا
↓
API درواره
↓
مدل تولید ویدئو
↓
Job ID
↓
بررسی وضعیت
↓
ذخیره خروجی
↓
ارسال لینک امن به کاربر

Backend باید وظایف زیر را انجام دهد:

  • اعتبارسنجی فایل‌ها
  • کنترل نوع و حجم فایل
  • ساخت پرامپت
  • ارسال درخواست
  • ذخیره Job ID
  • مدیریت خطا
  • بررسی وضعیت تولید
  • دریافت خروجی
  • محاسبه مصرف
  • حذف فایل‌های موقت
  • ثبت رضایت صاحب چهره و صدا، در صورت نیاز

مدیریت پردازش غیرهم‌زمان

تولید ویدئو معمولاً آنی نیست. پاسخ اولیه ممکن است شبیه این باشد:

{
  "id": "video_task_123",
  "status": "queued"
}

وضعیت‌های رایج:

queued
processing
completed
failed

برنامه نباید در یک حلقه سریع و مداوم وضعیت را بررسی کند. فاصله زمانی منطقی تعیین کنید و برای این موارد آماده باشید:

  • Timeout
  • خطای موقت
  • ناموفق‌بودن تولید
  • محدودیت نرخ درخواست
  • فایل ورودی نامعتبر
  • پایان اعتبار URL فایل
  • تولید تکراری
  • لغو درخواست توسط کاربر

ساخت زیرنویس

زیرنویس باعث می‌شود ویدئو بدون صدا نیز قابل فهم باشد.

روش پیشنهادی:

  1. متن نهایی آواتار را نگه دارید.
  2. زمان‌بندی جمله‌ها را از فایل صوتی یا مدل تبدیل گفتار به متن بگیرید.
  3. فایل SRT یا VTT بسازید.
  4. زیرنویس را به‌صورت جدا یا Burned-in به ویدئو اضافه کنید.
  5. محل نمایش را بررسی کنید تا روی دهان یا عناصر مهم قرار نگیرد.

برای ویدئوهای فارسی، راست‌به‌چپ‌بودن متن، فونت، نیم‌فاصله و ترتیب اعداد را در خروجی نهایی کنترل کنید.

سنجش کیفیت آواتار

برای مقایسه چند مدل، معیارهای زیر را بررسی کنید:

  • دقت Lip Sync
  • طبیعی‌بودن پلک‌زدن
  • ثبات هویت
  • کیفیت حرکت سر
  • هماهنگی احساس با صدا
  • وضوح ویدئو
  • تلفظ فارسی
  • زمان تولید
  • هزینه هر ثانیه
  • حداکثر مدت ویدئو
  • وجود واترمارک
  • شرایط استفاده تجاری
  • خروجی عمودی و افقی
  • کیفیت حرکت دست
  • قابلیت استفاده از صدای سفارشی

بهترین مدل برای یک ویدئوی تبلیغاتی ممکن است برای آموزش طولانی بهترین انتخاب نباشد.

کاهش هزینه تولید

برای مدیریت هزینه:

  • ابتدا نمونه ۵ثانیه‌ای تولید کنید.
  • متن را پیش از ساخت ویدئو نهایی کنید.
  • صدا را قبل از ارسال کامل بررسی کنید.
  • کلیپ‌های طولانی را به بخش‌های کوچک‌تر تقسیم کنید.
  • نتیجه‌های موفق را دوباره تولید نکنید.
  • فایل‌های تکراری را با Hash شناسایی کنید.
  • وضوح را متناسب با محل انتشار انتخاب کنید.
  • تعداد تلاش مجدد را محدود کنید.
  • وضعیت Job را با فاصله مناسب بررسی کنید.
  • مدل‌ها را از نظر کیفیت و هزینه مقایسه کنید.

قیمت مدل‌های ویدئویی ممکن است براساس مدت، وضوح، کیفیت یا نوع ورودی محاسبه شود. صفحه مدل‌های درواره مرجع بررسی قیمت به‌روز است.

ملاحظات استفاده مسئولانه

آواتار یک فرد واقعی را فقط با رضایت او ایجاد کنید. از تصویر یا صدای اشخاص برای جعل پیام، فریب مخاطب یا القای تأیید محصول استفاده نکنید.

بهتر است:

  • مصنوعی‌بودن ویدئو را شفاف اعلام کنید.
  • رضایت صاحب چهره و صدا را دریافت کنید.
  • تصاویر و صداهای خصوصی را محافظت کنید.
  • فایل‌ها را بیش از مدت لازم نگه ندارید.
  • دسترسی به خروجی‌ها را محدود کنید.
  • برای حساب‌های حساس، تأیید انسانی داشته باشید.
  • از آواتار شخصیت‌های واقعی بدون مجوز استفاده نکنید.
  • شرایط سرویس و مدل انتخابی را بررسی کنید.

چک‌لیست ساخت آواتار حرفه‌ای

پیش از تولید:

  • هدف ویدئو مشخص است.
  • مخاطب تعیین شده است.
  • متن برای گفتار نوشته شده است.
  • متن از نظر اطلاعات واقعی تأیید شده است.
  • تصویر واضح و مناسب است.
  • اجازه استفاده از تصویر وجود دارد.
  • فایل صوتی بدون نویز است.
  • تلفظ نام‌ها بررسی شده است.
  • نسبت تصویر مشخص است.
  • مدل مناسب انتخاب شده است.

پس از تولید:

  • لب‌ها با صدا هماهنگ‌اند.
  • چشم‌ها طبیعی حرکت می‌کنند.
  • چهره تغییر هویت نداده است.
  • دندان یا دهان غیرطبیعی نیست.
  • حرکت سر بیش از حد نیست.
  • پس‌زمینه ثابت است.
  • صدا واضح است.
  • زیرنویس صحیح است.
  • لوگو و CTA درست قرار گرفته‌اند.
  • مصنوعی‌بودن محتوا در صورت نیاز مشخص شده است.
  • نسخه نهایی تأیید انسانی دارد.

پرسش‌های متداول

چگونه یک عکس را سخنگو کنیم؟

یک تصویر واضح را در ابزار Talking Photo بارگذاری کنید، متن یا فایل صوتی را اضافه کنید، زبان و صدا را انتخاب کنید و ویدئو را تولید کنید. برای نتیجه بهتر، صورت باید مستقیم و دهان کاملاً مشخص باشد.

آیا می‌توان آواتار سخنگوی فارسی ساخت؟

بله. می‌توانید از صدای فارسی تولیدشده یا فایل صوتی ضبط‌شده استفاده کنید. کیفیت هماهنگی لب فارسی باید برای مدل انتخابی آزمایش شود.

بهترین ابزار ساخت آواتار سخنگو چیست؟

انتخاب مناسب به کاربرد بستگی دارد. HeyGen، Synthesia، D-ID و Hedra از ابزارهای شناخته‌شده این حوزه هستند. برای استفاده برنامه‌نویسی باید کیفیت، API، هزینه، زبان، Lip Sync و شرایط تجاری را مقایسه کنید.

آیا ساخت آواتار سخنگو رایگان است؟

بعضی ابزارها طرح آزمایشی یا استفاده محدود رایگان ارائه می‌کنند، اما محدودیت مدت، تعداد تولید، کیفیت یا واترمارک ممکن است وجود داشته باشد. شرایط هر سرویس ممکن است تغییر کند.

آیا می‌توان از صدای خودمان استفاده کرد؟

بله. بسیاری از ابزارها امکان بارگذاری فایل صوتی را دارند. این روش معمولاً کنترل بیشتری روی تلفظ و احساس گفتار فارسی ایجاد می‌کند.

آیا می‌توان شخصیت کارتونی را سخنگو کرد؟

بله، برخی مدل‌ها از کاراکتر کارتونی، سه‌بعدی، حیوان یا شخصیت تولیدشده پشتیبانی می‌کنند. نتیجه به طراحی چهره و قابلیت مدل بستگی دارد.

چرا Lip Sync فارسی دقیق نیست؟

کیفیت صدا، سرعت گفتار، نویز، زاویه چهره و توانایی مدل بر نتیجه اثر می‌گذارند. فایل صوتی تمیز، صورت روبه‌دوربین و جملات کوتاه معمولاً نتیجه بهتری ایجاد می‌کنند.

آیا درواره ابزار آماده ساخت آواتار دارد؟

درواره یک زیرساخت API هوش مصنوعی است، نه ویرایشگر آماده آواتار. توسعه‌دهندگان می‌توانند مدل‌های متنی، صوتی و ویدئویی را از طریق API درواره به محصول خود متصل کنند.

ساخت آواتار با API چه مزیتی دارد؟

API امکان تولید گروهی، اتصال به CMS، شخصی‌سازی متن، ساخت ویدئو از داده‌های محصول، مدیریت فرایند و ایجاد ابزار اختصاصی را فراهم می‌کند.

جمع‌بندی

ساخت آواتار سخنگو با هوش مصنوعی می‌تواند فرایند تولید ویدئو را برای آموزش، معرفی محصول، بازاریابی و شبکه‌های اجتماعی سریع‌تر کند. برای رسیدن به نتیجه حرفه‌ای، انتخاب تصویر مناسب به‌تنهایی کافی نیست؛ متن گفتاری، صدای تمیز، Lip Sync دقیق، رفتار طبیعی شخصیت و تدوین نهایی هم اهمیت دارند.

فرایند پیشنهادی:

  1. هدف و مخاطب را مشخص کنید.
  2. متن کوتاه و گفتاری بنویسید.
  3. تصویر واضحی انتخاب کنید.
  4. صدای فارسی را تولید یا ضبط کنید.
  5. نمونه کوتاهی بسازید.
  6. حرکت لب، چشم و سر را بررسی کنید.
  7. نسخه کامل را تولید کنید.
  8. زیرنویس، برند و CTA را اضافه کنید.
  9. پیش از انتشار، خروجی را تأیید کنید.

اگر می‌خواهید تولید آواتار، صدا و ویدئو را در محصول یا فرایند کسب‌وکار خود خودکار کنید، می‌توانید از API هوش مصنوعی درواره استفاده کنید. برای انتخاب مدل و مشاهده قیمت‌های به‌روز نیز صفحه مدل‌های درواره را ببینید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.