ساخت آواتار سخنگو با هوش مصنوعی؛ تبدیل عکس به ویدئوی سخنگو
در این راهنما یاد میگیرید چگونه یک عکس را با متن یا صدای فارسی به آواتار سخنگو تبدیل کنید؛ همراه با انتخاب عکس، ساخت صدا، Lip Sync، ابزارهای معتبر و پیادهسازی با API درواره.
برای ساخت یک ویدئوی آموزشی یا معرفی محصول، همیشه به دوربین، استودیو، مجری و تجهیزات حرفهای نیاز ندارید. ابزارهای ساخت آواتار سخنگو با هوش مصنوعی میتوانند یک عکس ثابت را دریافت کنند، آن را با صدای ضبطشده یا متن هماهنگ کنند و ویدئویی بسازند که در آن شخصیت موجود در تصویر صحبت میکند.
این فناوری با نامهایی مانند آواتار سخنگو، عکس سخنگو، مجری هوش مصنوعی، Talking Avatar، Talking Photo، Digital Human و AI Presenter شناخته میشود. در مدلهای جدید، فقط لبها حرکت نمیکنند؛ بلکه ممکن است حرکت چشمها، ابروها، سر، حالت چهره و حتی دستها نیز متناسب با ریتم و احساس صدا تولید شود.
از آواتار سخنگو میتوان برای تولید ویدئوهای آموزشی، معرفی خدمات، پاسخ به سؤالات متداول، محتوای شبکههای اجتماعی، راهنمای محصول و آموزش کارکنان استفاده کرد.
در این مقاله، تمام مراحل ساخت آواتار سخنگوی فارسی را از انتخاب تصویر و نوشتن متن تا تولید صدا، هماهنگسازی لبها، خروجیگرفتن و پیادهسازی با API درواره بررسی میکنیم.
آواتار سخنگو چیست؟
آواتار سخنگو یک شخصیت دیجیتال است که متن یا فایل صوتی را بهصورت ویدئویی اجرا میکند. این شخصیت میتواند یکی از موارد زیر باشد:
- تصویر واقعی خود کاربر
- تصویر فردی با رضایت او
- مجری آماده موجود در یک سرویس
- شخصیت کاملاً تولیدشده با هوش مصنوعی
- کاراکتر کارتونی یا سهبعدی
- تصویر حیوان یا شخصیت خیالی
- آواتار اختصاصی یک برند
- شخصیت آموزشی ثابت
در سادهترین حالت، سیستم سه ورودی دریافت میکند:
تصویر شخصیت + متن یا صدا + تنظیمات حرکت
و خروجی آن یک فایل ویدئویی است:
ویدئوی سخنگو با حرکت هماهنگ لب و صورت
تفاوت آواتار سخنگو، Lip Sync و مجری دیجیتال
این اصطلاحات به یکدیگر نزدیکاند، اما دقیقاً یکسان نیستند.
آواتار سخنگو
یک شخصیت ثابت یا تولیدشده است که متن یا صدا را اجرا میکند. تمرکز اصلی بر ایجاد یک ارائهدهنده دیجیتال است.
Talking Photo
یک عکس ثابت را به ویدئویی کوتاه تبدیل میکند. صورت، لبها، چشمها و گاهی سر حرکت میکنند.
Lip Sync
Lip Sync یا هماهنگسازی لب، فرایند تطبیق حرکت دهان با صدای گوینده است. ممکن است روی یک ویدئوی موجود یا یک تصویر ثابت انجام شود.
مجری هوش مصنوعی
یک آواتار سخنگوی حرفهای است که معمولاً در مقابل دوربین مجازی قرار میگیرد و برای آموزش، تبلیغات، ارائه و ارتباطات سازمانی استفاده میشود.
آواتار تعاملی
فقط یک ویدئوی ازپیشساختهشده نیست. کاربر با آن صحبت میکند و آواتار با کمک مدل زبانی، تبدیل گفتار به متن و تولید صدا، بهصورت زنده یا نزدیک به زنده پاسخ میدهد.
این مقاله بیشتر بر تولید ویدئوی سخنگو از یک عکس، متن یا فایل صوتی متمرکز است.
آواتار سخنگو چگونه کار میکند؟
فرایند فنی معمولاً شامل چند مرحله است.
تحلیل تصویر
مدل، موقعیت اجزای چهره را شناسایی میکند:
- چشمها
- ابروها
- بینی
- لبها
- فک
- گونهها
- زاویه سر
- مرز مو و صورت
تحلیل صدا
فایل صوتی به واحدهای گفتاری کوچکتر مانند واجها یا Phonemeها تحلیل میشود. مدل بررسی میکند که در هر لحظه چه صدایی تلفظ میشود.
تولید حالت دهان
برای هر بخش از صدا، شکل متناسب دهان یا Viseme تولید میشود. برای مثال، شکل دهان هنگام تلفظ «م» با «آ» یا «او» متفاوت است.
تولید حرکات تکمیلی
مدل ممکن است حرکات زیر را نیز اضافه کند:
- پلکزدن
- حرکت ابرو
- تکاندادن سر
- لبخند ملایم
- تغییر حالت چشم
- حرکت شانهها
- حرکت دستها
- تغییر حالت متناسب با احساس صدا
ترکیب صدا و تصویر
در مرحله پایانی، فریمهای تولیدشده با فایل صوتی ترکیب و به ویدئو تبدیل میشوند.
برای ساخت آواتار سخنگو به چه چیزهایی نیاز داریم؟
حداقل ورودیهای لازم عبارتاند از:
- یک تصویر واضح از شخصیت
- متن یا فایل صوتی
- ابزار یا مدل آواتار
- تنظیمات خروجی مانند نسبت تصویر
- چند دقیقه زمان برای تولید و بررسی
برای خروجی حرفهایتر ممکن است به این موارد نیز نیاز داشته باشید:
- میکروفون مناسب
- ابزار حذف نویز
- مدل تبدیل متن فارسی به گفتار
- موسیقی پسزمینه
- زیرنویس
- لوگو و عناصر برند
- نرمافزار تدوین
- تصویر یا ویدئوی مکمل
- پرامپت کنترل رفتار آواتار
انتخاب عکس مناسب
کیفیت تصویر ورودی مستقیماً بر کیفیت ویدئو اثر میگذارد.
صورت واضح و روبهدوربین باشد
برای اولین آزمایش، تصویری انتخاب کنید که فرد تقریباً مستقیم به دوربین نگاه میکند. تصویر نیمرخ برای هماهنگی لبها دشوارتر است.
لبها مشخص باشند
دست، مو، ماسک، میکروفون یا اشیای دیگر نباید جلوی دهان را بگیرند.
نور متعادل باشد
نور بسیار شدید یا سایه عمیق ممکن است تشخیص اجزای چهره را دشوار کند.
تصویر وضوح کافی داشته باشد
تصویر بسیار کوچک، تار یا فشرده باعث ایجاد حرکت غیرطبیعی لب و چشم میشود. برای بیشتر کاربردها، تصویری با ابعاد حداقل حدود ۱۰۲۴ پیکسل نقطه شروع مناسبی است.
حالت چهره طبیعی باشد
چهره بسیار خندان، دهان کاملاً باز یا حالت اغراقآمیز ممکن است هماهنگسازی گفتار را دشوار کند. حالت خنثی یا لبخند ملایم معمولاً مناسبتر است.
فقط یک شخصیت اصلی وجود داشته باشد
اگر تصویر شامل چند چهره باشد، مدل ممکن است شخصیت اشتباهی را متحرک کند. بهتر است از پرتره تکنفره استفاده کنید.
کادر متناسب با کاربرد انتخاب شود
برای ویدئوی آموزشی، پرتره از سینه به بالا مناسب است. برای شبکههای اجتماعی، تصویر عمودی یا مربعی میتواند بهتر باشد.
نسبت تصویر مناسب
نسبت تصویر را براساس محل انتشار انتخاب کنید:
16:9برای یوتیوب، سایت و ارائه9:16برای ریلز، استوری و ویدئوی عمودی1:1برای بعضی پستهای شبکه اجتماعی4:5برای فید عمودی شبکههای اجتماعی4:3برای برخی ویدئوهای آموزشی و سازمانی
اگر تصویر ورودی مربع باشد اما خروجی عمودی درخواست کنید، ابزار ممکن است بخشهای اطراف شخصیت را بسازد. برای جلوگیری از خطا، بهتر است تصویر از ابتدا به نسبت موردنظر نزدیک باشد.
متن بهتر، آواتار طبیعیتر
کیفیت ویدئو فقط به تصویر وابسته نیست. متن باید برای گفتار نوشته شده باشد، نه صرفاً برای مطالعه.
متن نوشتاری:
درواره زیرساختی یکپارچه است که امکان اتصال توسعهدهندگان و کسبوکارها به مجموعهای از مدلهای هوش مصنوعی را از طریق API فراهم مینماید.
نسخه مناسبتر برای گفتار:
درواره، یک زیرساخت یکپارچه برای دسترسی به مدلهای هوش مصنوعی است. توسعهدهندگان و کسبوکارها میتوانند از طریق یک API، مدلهای مختلف را به محصولات خود متصل کنند.
نسخه دوم جملههای کوتاهتری دارد و مکثهای آن طبیعیتر است.
قواعد نوشتن متن آواتار
برای دریافت گفتار طبیعی:
- جملهها را کوتاه نگه دارید.
- در هر جمله یک پیام اصلی بیان کنید.
- از عبارتهای بسیار رسمی و سنگین پرهیز کنید.
- محل مکثها را با نقطه و ویرگول مشخص کنید.
- عددهای دشوار را به شکل قابل تلفظ بنویسید.
- مخففهای انگلیسی را از نظر تلفظ بررسی کنید.
- نام برندها را همانطور بنویسید که باید خوانده شوند.
- متن را پیش از تولید، یک بار با صدای بلند بخوانید.
- مقدمه را کوتاه نگه دارید.
- از تکرار پیام پرهیز کنید.
- فراخوان اقدام را روشن بیان کنید.
پرامپت نوشتن متن آواتار
در نقش نویسنده ویدئوی کوتاه فارسی عمل کن.
برای یک آواتار سخنگو، متنی براساس اطلاعات زیر بنویس:
موضوع: [موضوع]
هدف: [هدف]
مخاطب: [مخاطب]
مدت تقریبی: [تعداد ثانیه]
لحن: [حرفهای، دوستانه، آموزشی یا تبلیغاتی]
فراخوان اقدام: [CTA]
قواعد:
- متن برای گفتار نوشته شود، نه برای مقاله.
- جملهها کوتاه و روان باشند.
- هر جمله فقط یک پیام اصلی داشته باشد.
- از عبارتهای کلیشهای و اغراقآمیز استفاده نشود.
- هیچ اطلاعات، آمار یا ادعایی ساخته نشود.
- تلفظ اصطلاحات فنی تا حد امکان روشن باشد.
- متن با یک شروع جذاب آغاز شود.
- در پایان یک فراخوان اقدام مشخص قرار بگیرد.
نمونه متن معرفی محصول
اگر برای پروژه خود به مدلهای مختلف هوش مصنوعی نیاز دارید، لازم نیست هر سرویس را جداگانه مدیریت کنید.
درواره به شما امکان میدهد از طریق یک اتصال، به مدلهای متنوع هوش مصنوعی دسترسی داشته باشید.
میتوانید مدل مناسب را انتخاب کنید، مصرف خود را مدیریت کنید و هوش مصنوعی را به نرمافزار یا فرایند کسبوکار خود متصل کنید.
برای شروع، به وبسایت درواره سر بزنید.
نمونه متن آموزشی
در این ویدئو یاد میگیریم چگونه یک پرامپت دقیق بنویسیم.
ابتدا هدف خود را روشن کنید. سپس مخاطب، قالب خروجی و محدودیتها را مشخص کنید.
اگر اطلاعات مهمی وجود دارد، آنها را به شکل مرتب در اختیار مدل قرار دهید.
در پایان نیز خروجی را بررسی کنید و در صورت نیاز، پرامپت را اصلاح کنید.
تبدیل متن به صدای فارسی
اگر فایل صوتی آماده ندارید، میتوانید از تبدیل متن به گفتار یا Text-to-Speech استفاده کنید.
فرایند کلی:
متن فارسی
↓
مدل Text-to-Speech
↓
فایل صوتی
↓
مدل Talking Avatar
↓
ویدئوی سخنگو
هنگام انتخاب صدای فارسی، این موارد را بررسی کنید:
- تلفظ درست کلمات فارسی
- تلفظ نام برندها
- توانایی خواندن اعداد
- تلفظ اصطلاحات انگلیسی
- طبیعیبودن مکثها
- سرعت گفتار
- امکان کنترل احساس
- کیفیت فایل خروجی
- شرایط استفاده تجاری
برای آشنایی بیشتر میتوانید مقاله تبدیل متن فارسی به صدا با هوش مصنوعی را مطالعه کنید.
استفاده از صدای ضبطشده
استفاده از صدای واقعی معمولاً کنترل بیشتری بر لحن و احساس ویدئو میدهد.
برای ضبط بهتر:
- در محیط آرام ضبط کنید.
- میکروفون را بیش از حد به دهان نزدیک نکنید.
- صدای فن و کولر را کاهش دهید.
- با سرعت ثابت صحبت کنید.
- میان جملهها مکث طبیعی داشته باشید.
- از تغییر ناگهانی بلندی صدا پرهیز کنید.
- متن را چند بار تمرین کنید.
- فایل را بدون موسیقی پسزمینه به مدل بدهید.
- نویز شدید را پیش از تولید حذف کنید.
- ابتدا چند ثانیه نمونه آزمایشی بسازید.
اگر صدا نویز دارد، راهنمای حذف نویز صدا با هوش مصنوعی میتواند مفید باشد.
فرمت مناسب صدا
فرمتهای پشتیبانیشده به ابزار و مدل بستگی دارند، اما فرمتهای زیر رایجاند:
- WAV
- MP3
- M4A
- AAC
برای آرشیو و پردازش حرفهای، WAV کیفیت مناسبی دارد؛ اما حجم آن بیشتر است. MP3 برای انتقال و استفاده عمومی سبکتر است.
موسیقی را پیش از تولید آواتار با صدای گوینده ترکیب نکنید. موسیقی ممکن است تشخیص گفتار و Lip Sync را ضعیف کند. بهتر است موسیقی در مرحله تدوین اضافه شود.
بهترین ابزارهای ساخت آواتار سخنگو
HeyGen
HeyGen میتواند یک تصویر را به Photo Avatar سخنگو تبدیل کند. طبق صفحه رسمی، کاربر میتواند تصویر و متن یا صدا را وارد کند و ویدئویی با هماهنگی لب و حرکات چهره بسازد. صفحه رسمی Talking Photo در HeyGen
این ابزار برای موارد زیر مناسب است:
- معرفی محصول
- ویدئوی شبکه اجتماعی
- آموزش کوتاه
- بازاریابی
- محتوای چندزبانه
- ساخت مجری دیجیتال
Synthesia
Synthesia بیشتر بر ویدئوهای سازمانی، آموزشی و ارائههای مبتنی بر آواتار تمرکز دارد. این سرویس مجموعهای از آواتارهای آماده و قابلیت ساخت آواتار شخصی ارائه میکند. صفحه رسمی Synthesia
کاربردهای مناسب:
- آموزش کارکنان
- معرفی فرایندهای سازمانی
- ویدئوی راهنما
- محتوای چندزبانه
- آموزش محصول
- ارائههای رسمی
D-ID
D-ID قابلیت تبدیل تصویر ثابت یا ویدئو و متن یا صدا به مجری دیجیتال سخنگو را ارائه میکند. این سرویس علاوه بر محیط آماده، API نیز دارد. صفحه رسمی API در D-ID
کاربردهای مناسب:
- عکس سخنگو
- آواتار تعاملی
- راهنمای دیجیتال
- آموزش
- ارتباط با مشتری
- ادغام در نرمافزار
Hedra
Hedra امکان تبدیل عکس یا کاراکتر به آواتار سخنگو را با استفاده از فایل صوتی یا متن فراهم میکند. تمرکز آن بر حرکت چهره، Lip Sync و اجرای احساسی شخصیت است. صفحه رسمی Talking Avatar در Hedra
کاربردهای مناسب:
- شخصیتهای خلاقانه
- روایت داستان
- ویدئوی شبکه اجتماعی
- کاراکترهای غیرواقعی
- محتوای تبلیغاتی
- اجرای احساسیتر
قیمت، محدودیت استفاده رایگان، واترمارک، زبانهای پشتیبانیشده و شرایط تجاری این ابزارها ممکن است تغییر کنند. پیش از انتخاب نهایی، صفحه رسمی هر سرویس را بررسی کنید.
آموزش ساخت آواتار سخنگو با عکس
روند عمومی در بیشتر ابزارها چنین است:
مرحله اول: انتخاب نوع آواتار
مشخص کنید میخواهید:
- عکس خودتان را متحرک کنید.
- از آواتار آماده استفاده کنید.
- کاراکتر جدید بسازید.
- آواتار اختصاصی برند ایجاد کنید.
مرحله دوم: بارگذاری تصویر
تصویر واضحی با چهره روبهدوربین بارگذاری کنید. بهتر است برای آزمایش اول، پسزمینه ساده باشد.
مرحله سوم: واردکردن متن یا صدا
یکی از این دو روش را انتخاب کنید:
- نوشتن متن و انتخاب صدای مصنوعی
- بارگذاری صدای ضبطشده
مرحله چهارم: انتخاب زبان و صدا
اگر از Text-to-Speech استفاده میکنید، صدای فارسی را انتخاب و تلفظ متن را آزمایش کنید.
مرحله پنجم: تنظیم رفتار
در صورت پشتیبانی ابزار، موارد زیر را تنظیم کنید:
- شدت حرکت
- حالت چهره
- میزان لبخند
- حرکت سر
- تماس چشمی
- احساس
- کادر
- نسبت تصویر
مرحله ششم: تولید نمونه کوتاه
ابتدا ویدئویی ۵ تا ۱۰ثانیهای تولید کنید. تولید مستقیم ویدئوی چنددقیقهای ممکن است زمان و هزینه بیشتری ایجاد کند.
مرحله هفتم: کنترل خروجی
لبها، چشمها، حرکت سر، تلفظ و کیفیت صدا را بررسی کنید.
مرحله هشتم: تولید نسخه نهایی
پس از تأیید نمونه، متن کامل را ارسال کنید.
مرحله نهم: تدوین
در مرحله نهایی این موارد را اضافه کنید:
- زیرنویس
- موسیقی
- لوگو
- عنوان
- تصویر محصول
- اسکرینریکورد
- فراخوان اقدام
- صفحه پایانی
پرامپت رفتار آواتار
بعضی مدلها امکان ارائه دستور رفتاری یا Motion Prompt دارند:
شخصیت مستقیم به دوربین نگاه کند و با لحنی حرفهای و دوستانه صحبت کند. حرکات سر محدود و طبیعی باشند. هنگام بیان نکات مهم، ابروها کمی حرکت کنند. لبخند ملایم حفظ شود. از حرکات شدید، چرخش ناگهانی سر و اغراق در حالت صورت پرهیز شود.
پرامپت مجری آموزشی
شخصیت مانند یک مدرس حرفهای صحبت کند. تماس چشمی با دوربین حفظ شود. حرکات صورت آرام و متناسب با توضیح آموزشی باشند. در پایان جملهها مکث کوتاه ایجاد شود. حالت چهره مطمئن، آرام و دوستانه باشد.
پرامپت معرفی محصول
شخصیت با انرژی کنترلشده و لحنی حرفهای محصول را معرفی کند. در شروع لبخند ملایمی داشته باشد. هنگام بیان مزیت اصلی، کمی بر کلمات تأکید کند. حرکات صورت طبیعی باشند و شخصیت در تمام ویدئو مستقیم به دوربین نگاه کند.
پرامپت ویدئوی شبکه اجتماعی
اجرای شخصیت پرانرژی، کوتاه و طبیعی باشد. جمله اول با حالت کنجکاوی بیان شود. حرکات سر و ابرو با ریتم گفتار هماهنگ باشند، اما اغراقآمیز نشوند. تماس چشمی با دوربین حفظ شود.
Negative Prompt پیشنهادی
اگر مدل از Negative Prompt پشتیبانی میکند:
poor lip sync, distorted mouth, extra teeth, frozen eyes,
excessive blinking, unnatural head movement, face deformation,
identity change, blurry face, robotic expression, jitter,
background distortion, camera movement, duplicated features
معادل مفهومی فارسی:
هماهنگی ضعیف لب، دهان تغییرشکلیافته، دندان اضافه، چشمهای ثابت، پلکزدن بیش از حد، حرکت غیرطبیعی سر، تغییر هویت، صورت تار، حالت رباتیک، لرزش تصویر، تغییر پسزمینه
خطاهای رایج آواتارهای سخنگو
حرکت نادرست لبها
دلایل احتمالی:
- صدای دارای نویز
- موسیقی داخل فایل صوتی
- تلفظ سریع
- کیفیت پایین مدل
- پوشیدهبودن دهان
- زاویه نامناسب صورت
دندانهای غیرطبیعی
مدل ممکن است هنگام بازکردن دهان، دندانهای نامنظم یا اضافه تولید کند. استفاده از تصویر واضح و مدل مناسب میتواند این خطا را کاهش دهد.
پلکزدن بیش از حد
Motion Prompt را محدود کنید:
پلکزدن طبیعی و کم باشد.
حرکت شدید سر
برای ویدئوی آموزشی یا رسمی، حرکت زیاد سر آزاردهنده است:
سر تقریباً ثابت باشد و فقط حرکات ملایم و طبیعی داشته باشد.
تغییر هویت
اگر چهره در طول ویدئو تغییر میکند:
- تصویر ورودی واضحتری انتخاب کنید.
- مدت کلیپ را کاهش دهید.
- حرکت را محدود کنید.
- از مدل تخصصی آواتار استفاده کنید.
- تولید را به چند بخش کوتاه تقسیم کنید.
تلفظ نادرست کلمات فارسی
کلمه را به شکل تلفظی بنویسید یا در صورت امکان از فایل صوتی واقعی استفاده کنید.
حرکت پسزمینه
از پسزمینه ساده استفاده کنید و در پرامپت بنویسید:
پسزمینه کاملاً ثابت باقی بماند.
ساخت آواتار فارسی حرفهای
ساخت آواتار فارسی سه بخش مستقل دارد:
متن فارسی
+
صدای فارسی طبیعی
+
مدل هماهنگسازی تصویر و صدا
مدل آواتار لزوماً نباید زبان فارسی را «درک» کند؛ اگر فایل صوتی فارسی باکیفیت دریافت کند، ممکن است حرکات لب را براساس ویژگیهای صوتی بسازد. بااینحال، کیفیت Lip Sync فارسی میان مدلها متفاوت است و باید آزمایش شود.
برای نتیجه بهتر:
- جملهها را کوتاه کنید.
- سرعت گفتار را متعادل نگه دارید.
- از فایل صوتی تمیز استفاده کنید.
- نام انگلیسی را جداگانه آزمایش کنید.
- ویدئو را به بخشهای کوتاه تقسیم کنید.
- زیرنویس فارسی اضافه کنید.
- خروجی را با چند صدای مختلف مقایسه کنید.
مدت مناسب هر کلیپ
برای شروع:
- ۵ تا ۱۰ ثانیه برای آزمایش
- ۱۵ تا ۳۰ ثانیه برای شبکه اجتماعی
- ۳۰ تا ۹۰ ثانیه برای معرفی کوتاه
- چند کلیپ جداگانه برای آموزش طولانی
تولید یک ویدئوی طولانی در یک مرحله ممکن است باعث افت هماهنگی، تغییر چهره یا افزایش هزینه شود. بهتر است متن طولانی به چند بخش تقسیم و سپس در تدوین به یکدیگر متصل شود.
کاربردهای تجاری آواتار سخنگو
معرفی محصول
آواتار میتواند ویژگیها و کاربرد محصول را توضیح دهد و در کنار آن تصاویر واقعی محصول نمایش داده شوند.
آموزش کاربران
برای هر قابلیت نرمافزار، یک ویدئوی کوتاه ساخته شود که آواتار در ابتدای آن توضیح میدهد و سپس اسکرینریکورد نمایش داده میشود.
پاسخ به سؤالات متداول
میتوان برای هر سؤال یک ویدئوی کوتاه تولید کرد:
چگونه ثبتنام کنیم؟
چگونه رمز عبور را تغییر دهیم؟
چگونه اشتراک را فعال کنیم؟
چگونه از قابلیت موردنظر استفاده کنیم؟
آموزش کارکنان
آواتار ثابت سازمان میتواند فرایندها، قوانین داخلی، راهنمای استفاده از سامانهها و محتوای آموزشی را ارائه کند.
بازاریابی شخصیسازیشده
در مقیاس بالا میتوان متن را براساس نام مشتری، صنعت یا محصول تغییر داد. این فرایند باید با کنترل انسانی و رعایت رضایت مخاطب انجام شود.
تولید محتوای چندزبانه
یک ویدئو را میتوان با صدا و متن زبانهای مختلف تولید کرد، بدون اینکه تمام نسخهها دوباره فیلمبرداری شوند.
استفاده از API درواره
اگر قصد دارید فرایند تولید آواتار را داخل نرمافزار، سایت یا سیستم تولید محتوای خود قرار دهید، میتوانید از مدلهای متنی، صوتی و ویدئویی قابل دسترسی از طریق درواره استفاده کنید.
درواره یک ویرایشگر آماده ساخت آواتار نیست؛ بلکه زیرساخت API هوش مصنوعی است. شما رابط کاربری و گردش کار محصول را میسازید و مدلهای مناسب را از طریق API به آن متصل میکنید.
یک خط تولید کامل میتواند شامل این مراحل باشد:
موضوع ویدئو
↓
تولید متن با مدل زبانی
↓
بازبینی انسانی
↓
تبدیل متن به صدای فارسی
↓
ارسال تصویر و صدا به مدل Talking Avatar
↓
دریافت Job ID
↓
بررسی وضعیت تولید
↓
دریافت ویدئو
↓
افزودن زیرنویس و برند
↓
تأیید و انتشار
برای مشاهده مدلهای موجود و قیمتهای بهروز، صفحه مدلهای درواره را بررسی کنید.
تولید متن آواتار با API درواره
ابتدا کلید API را در متغیر محیطی ذخیره کنید:
export DARVAREH_API_KEY="YOUR_API_KEY"
سپس متن ویدئو را تولید کنید:
curl https://api.darvareh.ir/v1/chat/completions \
-H "Authorization: Bearer $DARVAREH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "YOUR_MODEL_ID",
"temperature": 0.4,
"messages": [
{
"role": "system",
"content": "شما نویسنده حرفهای متن ویدئوی فارسی هستید. متن باید برای گفتار نوشته شود، جملههای کوتاه داشته باشد و هیچ اطلاعاتی را حدس نزند."
},
{
"role": "user",
"content": "یک متن ۴۵ثانیهای برای آواتار سخنگو بنویس که API هوش مصنوعی درواره را به توسعهدهندگان معرفی کند. لحن حرفهای و روان باشد، از اغراق استفاده نشود و در پایان کاربر به darvareh.ir دعوت شود."
}
]
}'
مقدار YOUR_MODEL_ID باید با Model ID مدل متنی انتخابشده در درواره جایگزین شود.
نمونه Python برای تولید سناریو
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1"
)
response = client.chat.completions.create(
model="YOUR_MODEL_ID",
temperature=0.4,
messages=[
{
"role": "system",
"content": """
شما نویسنده متن ویدئوی فارسی هستید.
قواعد:
- متن برای گفتار نوشته شود.
- جملهها کوتاه باشند.
- هیچ ادعای تأییدنشدهای تولید نشود.
- شروع ویدئو جذاب اما غیراغراقآمیز باشد.
- فراخوان اقدام روشن باشد.
"""
},
{
"role": "user",
"content": """
موضوع: معرفی API هوش مصنوعی درواره
مخاطب: توسعهدهندگان و مدیران محصول
مدت: ۴۵ ثانیه
لحن: حرفهای و روان
CTA: مراجعه به darvareh.ir
"""
}
]
)
script = response.choices[0].message.content
print(script)
درخواست تولید ویدئو چگونه ارسال میشود؟
برخلاف Chat Completions، ساختار API مدلهای ویدئویی هنوز کاملاً یکسان نیست. بعضی مدلها این ورودیها را میخواهند:
{
"model": "YOUR_VIDEO_MODEL_ID",
"image_url": "https://example.com/avatar.jpg",
"audio_url": "https://example.com/speech.wav",
"prompt": "حرکت صورت طبیعی و تماس چشمی مستقیم باشد.",
"aspect_ratio": "9:16",
"resolution": "1080p"
}
برخی مدلها فایل را مستقیماً دریافت میکنند و برخی فقط URL عمومی یا موقت میپذیرند. مسیر درخواست، نام پارامترها، محدودیت مدت و ساختار خروجی به مدل انتخابی وابسته است.
بنابراین:
- در صفحه مدلهای درواره یک مدل مناسب Talking Avatar یا Audio-driven Video انتخاب کنید.
- قابلیت دریافت تصویر و صدا را بررسی کنید.
- Model ID درواره را بردارید.
- نمونه درخواست همان مدل را مبنا قرار دهید.
- قیمت و محدودیت مدت را بررسی کنید.
- ابتدا یک کلیپ کوتاه آزمایشی بسازید.
طراحی Backend مناسب
کلید API نباید در فرانتاند قرار بگیرد. معماری مناسب:
مرورگر کاربر
↓
Backend شما
↓
ذخیره موقت تصویر و صدا
↓
API درواره
↓
مدل تولید ویدئو
↓
Job ID
↓
بررسی وضعیت
↓
ذخیره خروجی
↓
ارسال لینک امن به کاربر
Backend باید وظایف زیر را انجام دهد:
- اعتبارسنجی فایلها
- کنترل نوع و حجم فایل
- ساخت پرامپت
- ارسال درخواست
- ذخیره Job ID
- مدیریت خطا
- بررسی وضعیت تولید
- دریافت خروجی
- محاسبه مصرف
- حذف فایلهای موقت
- ثبت رضایت صاحب چهره و صدا، در صورت نیاز
مدیریت پردازش غیرهمزمان
تولید ویدئو معمولاً آنی نیست. پاسخ اولیه ممکن است شبیه این باشد:
{
"id": "video_task_123",
"status": "queued"
}
وضعیتهای رایج:
queued
processing
completed
failed
برنامه نباید در یک حلقه سریع و مداوم وضعیت را بررسی کند. فاصله زمانی منطقی تعیین کنید و برای این موارد آماده باشید:
- Timeout
- خطای موقت
- ناموفقبودن تولید
- محدودیت نرخ درخواست
- فایل ورودی نامعتبر
- پایان اعتبار URL فایل
- تولید تکراری
- لغو درخواست توسط کاربر
ساخت زیرنویس
زیرنویس باعث میشود ویدئو بدون صدا نیز قابل فهم باشد.
روش پیشنهادی:
- متن نهایی آواتار را نگه دارید.
- زمانبندی جملهها را از فایل صوتی یا مدل تبدیل گفتار به متن بگیرید.
- فایل SRT یا VTT بسازید.
- زیرنویس را بهصورت جدا یا Burned-in به ویدئو اضافه کنید.
- محل نمایش را بررسی کنید تا روی دهان یا عناصر مهم قرار نگیرد.
برای ویدئوهای فارسی، راستبهچپبودن متن، فونت، نیمفاصله و ترتیب اعداد را در خروجی نهایی کنترل کنید.
سنجش کیفیت آواتار
برای مقایسه چند مدل، معیارهای زیر را بررسی کنید:
- دقت Lip Sync
- طبیعیبودن پلکزدن
- ثبات هویت
- کیفیت حرکت سر
- هماهنگی احساس با صدا
- وضوح ویدئو
- تلفظ فارسی
- زمان تولید
- هزینه هر ثانیه
- حداکثر مدت ویدئو
- وجود واترمارک
- شرایط استفاده تجاری
- خروجی عمودی و افقی
- کیفیت حرکت دست
- قابلیت استفاده از صدای سفارشی
بهترین مدل برای یک ویدئوی تبلیغاتی ممکن است برای آموزش طولانی بهترین انتخاب نباشد.
کاهش هزینه تولید
برای مدیریت هزینه:
- ابتدا نمونه ۵ثانیهای تولید کنید.
- متن را پیش از ساخت ویدئو نهایی کنید.
- صدا را قبل از ارسال کامل بررسی کنید.
- کلیپهای طولانی را به بخشهای کوچکتر تقسیم کنید.
- نتیجههای موفق را دوباره تولید نکنید.
- فایلهای تکراری را با Hash شناسایی کنید.
- وضوح را متناسب با محل انتشار انتخاب کنید.
- تعداد تلاش مجدد را محدود کنید.
- وضعیت Job را با فاصله مناسب بررسی کنید.
- مدلها را از نظر کیفیت و هزینه مقایسه کنید.
قیمت مدلهای ویدئویی ممکن است براساس مدت، وضوح، کیفیت یا نوع ورودی محاسبه شود. صفحه مدلهای درواره مرجع بررسی قیمت بهروز است.
ملاحظات استفاده مسئولانه
آواتار یک فرد واقعی را فقط با رضایت او ایجاد کنید. از تصویر یا صدای اشخاص برای جعل پیام، فریب مخاطب یا القای تأیید محصول استفاده نکنید.
بهتر است:
- مصنوعیبودن ویدئو را شفاف اعلام کنید.
- رضایت صاحب چهره و صدا را دریافت کنید.
- تصاویر و صداهای خصوصی را محافظت کنید.
- فایلها را بیش از مدت لازم نگه ندارید.
- دسترسی به خروجیها را محدود کنید.
- برای حسابهای حساس، تأیید انسانی داشته باشید.
- از آواتار شخصیتهای واقعی بدون مجوز استفاده نکنید.
- شرایط سرویس و مدل انتخابی را بررسی کنید.
چکلیست ساخت آواتار حرفهای
پیش از تولید:
- هدف ویدئو مشخص است.
- مخاطب تعیین شده است.
- متن برای گفتار نوشته شده است.
- متن از نظر اطلاعات واقعی تأیید شده است.
- تصویر واضح و مناسب است.
- اجازه استفاده از تصویر وجود دارد.
- فایل صوتی بدون نویز است.
- تلفظ نامها بررسی شده است.
- نسبت تصویر مشخص است.
- مدل مناسب انتخاب شده است.
پس از تولید:
- لبها با صدا هماهنگاند.
- چشمها طبیعی حرکت میکنند.
- چهره تغییر هویت نداده است.
- دندان یا دهان غیرطبیعی نیست.
- حرکت سر بیش از حد نیست.
- پسزمینه ثابت است.
- صدا واضح است.
- زیرنویس صحیح است.
- لوگو و CTA درست قرار گرفتهاند.
- مصنوعیبودن محتوا در صورت نیاز مشخص شده است.
- نسخه نهایی تأیید انسانی دارد.
پرسشهای متداول
چگونه یک عکس را سخنگو کنیم؟
یک تصویر واضح را در ابزار Talking Photo بارگذاری کنید، متن یا فایل صوتی را اضافه کنید، زبان و صدا را انتخاب کنید و ویدئو را تولید کنید. برای نتیجه بهتر، صورت باید مستقیم و دهان کاملاً مشخص باشد.
آیا میتوان آواتار سخنگوی فارسی ساخت؟
بله. میتوانید از صدای فارسی تولیدشده یا فایل صوتی ضبطشده استفاده کنید. کیفیت هماهنگی لب فارسی باید برای مدل انتخابی آزمایش شود.
بهترین ابزار ساخت آواتار سخنگو چیست؟
انتخاب مناسب به کاربرد بستگی دارد. HeyGen، Synthesia، D-ID و Hedra از ابزارهای شناختهشده این حوزه هستند. برای استفاده برنامهنویسی باید کیفیت، API، هزینه، زبان، Lip Sync و شرایط تجاری را مقایسه کنید.
آیا ساخت آواتار سخنگو رایگان است؟
بعضی ابزارها طرح آزمایشی یا استفاده محدود رایگان ارائه میکنند، اما محدودیت مدت، تعداد تولید، کیفیت یا واترمارک ممکن است وجود داشته باشد. شرایط هر سرویس ممکن است تغییر کند.
آیا میتوان از صدای خودمان استفاده کرد؟
بله. بسیاری از ابزارها امکان بارگذاری فایل صوتی را دارند. این روش معمولاً کنترل بیشتری روی تلفظ و احساس گفتار فارسی ایجاد میکند.
آیا میتوان شخصیت کارتونی را سخنگو کرد؟
بله، برخی مدلها از کاراکتر کارتونی، سهبعدی، حیوان یا شخصیت تولیدشده پشتیبانی میکنند. نتیجه به طراحی چهره و قابلیت مدل بستگی دارد.
چرا Lip Sync فارسی دقیق نیست؟
کیفیت صدا، سرعت گفتار، نویز، زاویه چهره و توانایی مدل بر نتیجه اثر میگذارند. فایل صوتی تمیز، صورت روبهدوربین و جملات کوتاه معمولاً نتیجه بهتری ایجاد میکنند.
آیا درواره ابزار آماده ساخت آواتار دارد؟
درواره یک زیرساخت API هوش مصنوعی است، نه ویرایشگر آماده آواتار. توسعهدهندگان میتوانند مدلهای متنی، صوتی و ویدئویی را از طریق API درواره به محصول خود متصل کنند.
ساخت آواتار با API چه مزیتی دارد؟
API امکان تولید گروهی، اتصال به CMS، شخصیسازی متن، ساخت ویدئو از دادههای محصول، مدیریت فرایند و ایجاد ابزار اختصاصی را فراهم میکند.
جمعبندی
ساخت آواتار سخنگو با هوش مصنوعی میتواند فرایند تولید ویدئو را برای آموزش، معرفی محصول، بازاریابی و شبکههای اجتماعی سریعتر کند. برای رسیدن به نتیجه حرفهای، انتخاب تصویر مناسب بهتنهایی کافی نیست؛ متن گفتاری، صدای تمیز، Lip Sync دقیق، رفتار طبیعی شخصیت و تدوین نهایی هم اهمیت دارند.
فرایند پیشنهادی:
- هدف و مخاطب را مشخص کنید.
- متن کوتاه و گفتاری بنویسید.
- تصویر واضحی انتخاب کنید.
- صدای فارسی را تولید یا ضبط کنید.
- نمونه کوتاهی بسازید.
- حرکت لب، چشم و سر را بررسی کنید.
- نسخه کامل را تولید کنید.
- زیرنویس، برند و CTA را اضافه کنید.
- پیش از انتشار، خروجی را تأیید کنید.
اگر میخواهید تولید آواتار، صدا و ویدئو را در محصول یا فرایند کسبوکار خود خودکار کنید، میتوانید از API هوش مصنوعی درواره استفاده کنید. برای انتخاب مدل و مشاهده قیمتهای بهروز نیز صفحه مدلهای درواره را ببینید.
مقالات مرتبط
- تبدیل عکس به ویدئو با هوش مصنوعی
- بهترین ابزارهای تولید ویدئو با هوش مصنوعی
- تبدیل متن فارسی به صدا با هوش مصنوعی
- حذف نویز صدا با هوش مصنوعی
- تغییر صدا و شبیهسازی صدا با هوش مصنوعی
- نوشتن سناریوی ویدئو با هوش مصنوعی
- ساخت ویدئوی تبلیغاتی با هوش مصنوعی
برای مطالعه شرایط استفاده و محدودیتهای مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.