تبدیل عکس به ویدئو با هوش مصنوعی؛ معرفی ابزارهای رایگان و آموزش کامل Image-to-Video
در این آموزش یاد میگیرید چگونه با ابزارهای هوش مصنوعی، عکس چهره، محصول یا تصاویر قدیمی را به ویدئو تبدیل کنید؛ همراه با معرفی مدلها، پرامپتهای آماده، رفع خطا، Lip Sync و اتصال Image-to-Video به API درواره.
تبدیل عکس به ویدئو با هوش مصنوعی چیست؟
تبدیل عکس به ویدئو با هوش مصنوعی یا Image-to-Video فرایندی است که در آن یک یا چند تصویر ثابت به مدل هوش مصنوعی داده میشود و مدل براساس تصویر و دستور متنی کاربر، فریمهای متحرک جدیدی میسازد.
در سادهترین حالت، یک عکس وارد میکنید و مینویسید:
دوربین بهآرامی به سوژه نزدیک شود. موهای شخصیت با نسیم ملایم
حرکت کنند و نور غروب بهتدریج گرمتر شود.
مدل تلاش میکند:
- سوژه اصلی را تشخیص دهد.
- عمق تقریبی صحنه را تخمین بزند.
- حرکت دوربین را شبیهسازی کند.
- حرکت طبیعی اجزای تصویر را بسازد.
- فریمهای میانی را تولید کند.
- ظاهر و ترکیببندی تصویر مرجع را حفظ کند.
Image-to-Video با روشهای قدیمی ساخت اسلایدشو تفاوت دارد. در اسلایدشو فقط روی عکس ثابت حرکت Zoom یا Pan انجام میشود؛ اما مدل هوش مصنوعی میتواند حرکت جدیدی داخل صحنه ایجاد کند.
برای مثال:
- شخصیت پلک بزند.
- سر خود را حرکت دهد.
- لباس با باد تکان بخورد.
- آب جریان پیدا کند.
- ابرها حرکت کنند.
- محصول بچرخد.
- نور محیط تغییر کند.
- دوربین دور سوژه حرکت کند.
- شخص شروع به صحبت کند.
- محیط اطراف تصویر زنده شود.
بهترین ابزار تبدیل عکس به ویدئو کدام است؟
انتخاب بهترین ابزار به نوع عکس و خروجی موردنظر بستگی دارد.
پاسخ سریع:
- برای ویدئوی سینمایی از عکس: Kling AI
- برای استفاده از چند تصویر و مرجع مختلف: Seedance 2.0
- برای کیفیت واقعگرایانه و صدای بومی: Google Veo
- برای Workflow حرفهای و ویرایش: Runway
- برای حرکت نرم و سینمایی: Luma Dream Machine
- برای افکتهای سریع شبکه اجتماعی: Pika
- برای طراحان و Creative Cloud: Adobe Firefly
- برای حرفزدن عکس و آواتار: HeyGen
- برای Talking Portrait: D-ID
- برای اتصال به سایت و نرمافزار: API مدلهای Image-to-Video
مقایسه ابزارهای تبدیل عکس به ویدئو
| ابزار | مناسب برای | قابلیت مهم | دسترسی رایگان |
|---|---|---|---|
| Kling AI | تبلیغ، فیلم کوتاه و محصول | حرکت سینمایی و فریم اول و آخر | معمولاً اعتبار محدود |
| Seedance 2.0 | پروژههای چندمرجعی | ورودی تصویر، صوت و ویدئو | وابسته به پلتفرم |
| Google Veo | ویدئوی واقعگرایانه | تصویر به ویدئو همراه صدا | محدود یا وابسته به پلن |
| Runway | تولید و ویرایش حرفهای | Reference و کنترل حرکت | پلن محدود رایگان |
| Luma Dream Machine | حرکت نرم دوربین | Image-to-Video و Modify | امکان آزمایش محدود |
| Pika | محتوای شبکه اجتماعی | افکت و انیمیشن سریع | Credit محدود |
| Adobe Firefly | طراحی و تبلیغات | تولید و تدوین یکپارچه | استفاده محدود |
| Hailuo AI | کلیپ کوتاه | حرکت چهره و صحنه | اعتبار محدود |
| HeyGen | حرفزدن عکس | Avatar و Lip Sync | آزمایش محدود |
| D-ID | Talking Portrait | عکس و متن یا فایل صوتی | آزمایش یا پلن محدود |
| API درواره | محصول و اتوماسیون | دسترسی برنامهنویسی | Pay-as-you-go |
شرایط Credit، رزولوشن، واترمارک، مدت ویدئو و استفاده تجاری ممکن است تغییر کند؛ بنابراین صفحه Pricing هر ابزار را پیش از استفاده بررسی کنید.
تفاوت Image-to-Video با Text-to-Video
در Text-to-Video فقط توضیح متنی ارسال میکنید:
یک اسب سفید در ساحل هنگام غروب میدود.
مدل باید همه عناصر را از ابتدا بسازد:
- ظاهر اسب
- ساحل
- نور
- رنگ
- زاویه دوربین
- ترکیببندی
- حرکت
اما در Image-to-Video، تصویر مرجع بسیاری از این تصمیمها را از قبل مشخص میکند:
- ظاهر سوژه
- لباس
- رنگ
- محیط
- ترکیببندی
- زاویه اولیه
- سبک بصری
به همین دلیل Image-to-Video معمولاً برای این کاربردها کنترل بیشتری ایجاد میکند:
- تبلیغ محصول
- حفظ کاراکتر
- متحرکسازی طراحی
- زندهکردن عکس قدیمی
- ساخت حرکت از Concept Art
- انیمیشن تصویر تولیدشده
- ویدئوی معماری
- حرکتدادن لوگو یا پوستر
- ساخت آواتار سخنگو
Kling AI برای تبدیل عکس به ویدئو
Kling AI یکی از ابزارهای قدرتمند Image-to-Video است و قابلیتهایی برای حرکت دوربین، حرکت سوژه، Storyboard و استفاده از فریم اول و آخر ارائه میدهد.
در حالت ساده:
- تصویر را آپلود میکنید.
- مدل و مدت را انتخاب میکنید.
- Prompt حرکت را مینویسید.
- نسبت تصویر و کیفیت را تنظیم میکنید.
- ویدئو را تولید میکنید.
Prompt نمونه:
دوربین با یک حرکت بسیار آرام و سینمایی به سمت شخصیت نزدیک شود.
شخصیت یک بار پلک بزند و نگاه خود را کمی به سمت چپ ببرد.
مو و لباس با نسیم بسیار ملایم حرکت کنند. هویت چهره، لباس،
پسزمینه و ترکیببندی ثابت بمانند. حرکت طبیعی و بدون اعوجاج.
Kling همچنین از تعیین فریم شروع و پایان در برخی Workflowها پشتیبانی میکند. براساس راهنمای رسمی Start and End Frames در Kling، کاربر میتواند دو تصویر را بهعنوان فریم اول و آخر وارد کند تا مدل انتقال میان آنها را تولید کند.
مناسب برای:
- تصویر چهره
- عکس محصول
- صحنه سینمایی
- معماری
- تبلیغات
- تبدیل Concept Art به ویدئو
- انتقال میان دو تصویر
مزایا:
- حرکت مناسب دوربین
- کنترل فریم اول و آخر
- قابلیتهای چندنمایی در مدلهای جدید
- تولید صوت و تصویر در برخی مدلها
- خروجی مناسب تبلیغات
محدودیتها:
- تغییر چهره در حرکتهای شدید
- مصرف Credit بیشتر در کیفیتهای بالا
- انتظار در صف کاربران رایگان
- نیاز به چند بار تولید برای Action پیچیده
Seedance برای تبدیل تصویر به ویدئو
Seedance مدل تولید ویدئو ByteDance است و نسخههای جدید آن میتوانند از چند نوع ورودی استفاده کنند:
- متن
- تصویر
- ویدئو
- صوت
در Seedance 2.0 میتوان از چند تصویر برای تعریف شخصیت، محصول، محیط و سبک استفاده کرد.
براساس اعلام رسمی Seedance 2.0، این مدل از ورودیهای ترکیبی پشتیبانی میکند و میتواند همزمان چند تصویر، کلیپ و فایل صوتی را بهعنوان Reference دریافت کند. تعداد دقیق ورودیهای قابل استفاده به رابط یا API ارائهدهنده نیز بستگی دارد.
سناریوی نمونه تبلیغ محصول:
- تصویر اول: نمای جلو محصول
- تصویر دوم: نمای جانبی
- تصویر سوم: بستهبندی
- تصویر چهارم: محیط مطلوب
- ویدئوی مرجع: حرکت دوربین
- فایل صوتی: ریتم و فضای تبلیغ
- Prompt: دستور نهایی
پرامپت:
از تصاویر اول تا سوم برای حفظ دقیق شکل، رنگ، لوگو و بستهبندی
محصول استفاده کن. تصویر چهارم مرجع محیط باشد. حرکت دوربین
مشابه ویدئوی مرجع، نرم و نیمدایرهای باشد. محصول روی سطح
مشکی براق قرار بگیرد و نورهای بنفش و طلایی بهآرامی روی لبههای
آن حرکت کنند. هیچ نوشته یا جزئیات محصول تغییر نکند.
Seedance 2.0 از تصویر، صوت و ویدئو بهعنوان مرجع استفاده میکند و امکان کنترل اجرا، نور، سایه و حرکت دوربین را فراهم میکند. جزئیات کلی در صفحه رسمی Seedance 2.0 منتشر شده است.
مناسب برای:
- محصول
- تبلیغات
- پروژههای چندمرجعی
- تولید صوت و تصویر
- ویرایش ویدئو
- ادامه کلیپ
- ساخت ویدئوی چندنمایی
Google Veo برای Image-to-Video
Google Veo میتواند تصویر را همراه یک Prompt دریافت و ویدئو تولید کند. خانواده Veo روی کیفیت بصری، فیزیک حرکت، پیروی از Prompt و تولید صوت و تصویر تمرکز دارد.
برای متحرککردن تصویر طبیعت:
رودخانه بهآرامی جریان داشته باشد، برگهای درختان با باد ملایم
حرکت کنند و مه صبحگاهی بهتدریج از سطح آب کنار برود.
دوربین ثابت باشد و فقط یک حرکت بسیار ظریف push-in داشته باشد.
صدای آب، پرندگان و باد جنگل طبیعی و هماهنگ تولید شود.
مناسب برای:
- طبیعت
- تبلیغات
- B-roll
- ویدئوی واقعگرایانه
- تولید صدا همراه تصویر
- حرکت سینمایی
محدودیتها:
- دسترسی به مدل ممکن است به سرویس، پلن یا منطقه وابسته باشد.
- دیالوگ فارسی باید کنترل شود.
- برای حفظ نوشتههای محصول باید حرکت محدود و Reference واضح باشد.
Runway برای تبدیل عکس به ویدئوی حرفهای
Runway علاوه بر Image-to-Video، مجموعهای از ابزارهای ویرایش و مدیریت Asset ارائه میدهد.
در Runway میتوانید:
- عکس را متحرک کنید.
- حرکت دوربین تعریف کنید.
- سوژه را با Reference حفظ کنید.
- کلیپ را ادامه دهید.
- بخشهایی از ویدئو را ویرایش کنید.
- Video-to-Video انجام دهید.
- چند Shot را مدیریت کنید.
- Lip Sync اضافه کنید.
- خروجی را با پروژه تدوین ترکیب کنید.
در Runway Gen-4، ورودی تصویر برای تولید کلیپهای کوتاه کنترلشده استفاده میشود. راهنمای رسمی Gen-4 Video توضیح میدهد که این مدل از تصویر و Prompt متنی برای ساخت کلیپ استفاده میکند.
پرامپت Image-to-Video بهتر است روی حرکت تمرکز داشته باشد:
The camera slowly orbits clockwise around the product.
Soft reflections move across the glass surface. Background lights
pulse subtly. The product remains completely rigid and unchanged.
No new objects, no text changes, no deformation.
مناسب برای:
- کاربران حرفهای
- فیلمسازان
- آژانسهای تبلیغاتی
- B-roll
- تصویر محصول
- طراحی Storyboard
- جلوههای بصری
Luma Dream Machine برای حرکت طبیعی و سینمایی
Luma Dream Machine امکان تولید ویدئو از متن و تصویر را فراهم میکند و ابزارهایی برای Reframe، Extend، Modify و تغییر سبک دارد.
Prompt نمونه معماری:
دوربین با حرکت slow dolly-in وارد فضای داخلی ساختمان شود.
پردهها و گیاهان با نسیم بسیار ملایم حرکت کنند. نور آفتاب روی
کف بهآرامی جابهجا شود. معماری، مبلمان، رنگها و هندسه فضا
کاملاً مطابق تصویر مرجع باقی بمانند.
مناسب برای:
- معماری
- طراحی داخلی
- Concept Art
- تصویر محصول
- صحنه سینمایی
- تصاویر طبیعت
مدلهای خانواده Ray برای تولید و ویرایش ویدئو استفاده میشوند و پلتفرم Luma ابزارهایی مانند Extend، Reframe و Modify ارائه میدهد.
Pika برای افکت و ویدئوی کوتاه
Pika بیشتر برای محتوای Social-first، افکتهای خلاقانه و متحرکسازی سریع تصاویر مناسب است.
کاربردها:
- متحرککردن عکس
- حرکت چهره
- ساخت کلیپ ترند
- تغییر اشیا
- اضافهکردن عناصر
- افکتهای آماده
- هماهنگسازی تصویر با صدا
Pikaformance میتواند تصویر چهره را با فایل صوتی هماهنگ کند و حالت صورت و حرکت لب بسازد. اطلاعات این قابلیت در سایت رسمی Pika آمده است.
مناسب برای:
- Reels
- کلیپ کوتاه
- سرگرمی
- عکس سخنگو
- محتوای وایرال
- افکت بصری
محدودیتها:
- برخی خروجیهای پلن پایه رزولوشن محدود دارند.
- Credit رایگان محدود است.
- مجوز تجاری و نبود واترمارک به پلن وابسته است.
Adobe Firefly برای تبدیل عکس به ویدئو
Adobe Firefly امکان Image-to-Video را در یک محیط طراحی و تدوین ارائه میدهد.
میتوانید:
- تصویر را آپلود کنید.
- حرکت دوربین را مشخص کنید.
- انیمیشن محیطی بسازید.
- Variation تولید کنید.
- کلیپ را داخل Timeline قرار دهید.
- ویدئو را با ابزارهای Adobe ویرایش کنید.
- از مدل Firefly یا مدلهای شریک استفاده کنید.
طبق راهنمای رسمی Image-to-Video در Adobe Firefly، این ابزار میتواند عکس، تصویرسازی، Render دوبعدی یا سهبعدی و Concept Art را به ویدئو تبدیل کند.
مناسب برای:
- طراحان
- تدوینگران
- B-roll
- Product Shot
- Concept Visualization
- محتوای تجاری
- کاربران Creative Cloud
Hailuo AI برای جانبخشی به تصویر
Hailuo AI برای ساخت کلیپ از عکس و Prompt استفاده میشود و در حرکت چهره، Action و صحنههای کوتاه کاربرد دارد.
پرامپت مناسب:
شخصیت بهآرامی سر خود را به سمت دوربین برگرداند و لبخند طبیعی
بزند. حرکت چشم، صورت و شانهها ظریف باشد. دوربین ثابت بماند.
هویت چهره، مو، لباس و محیط تغییر نکنند.
برای کاربران رایگان ممکن است صف انتظار، واترمارک، رزولوشن محدود یا Credit روزانه وجود داشته باشد.
حرفزدن عکس با HeyGen
اگر هدفتان فقط حرکت سینمایی نیست و میخواهید یک عکس صحبت کند، ابزارهای Talking Avatar مناسبتر از مدل عمومی Image-to-Video هستند.
HeyGen میتواند یک تصویر چهره را دریافت و براساس متن یا صدا، ویدئوی سخنگو تولید کند.
فرایند معمول:
- عکس واضح چهره را آپلود کنید.
- متن را وارد یا فایل صوتی را بارگذاری کنید.
- صدا و زبان را انتخاب کنید.
- حالت و سبک را تنظیم کنید.
- ویدئو را تولید کنید.
طبق صفحه رسمی Talking Photo در HeyGen، ابزار Avatar IV میتواند یک تصویر را همراه با همگامسازی صدا، حالت چهره و حرکات طبیعی به ویدئو تبدیل کند.
HeyGen همچنین ابزار Face Talking دارد که براساس متن یا صدای ورودی، حرکت لب، پلک و حالت صورت تولید میکند. جزئیات در صفحه رسمی Face Talking ارائه شده است.
مناسب برای:
- آموزش
- معرفی محصول
- نریشن تصویری
- آواتار
- شبکه اجتماعی
- محتوای چندزبانه
- سخنگوی مجازی
نکات مهم:
- عکس باید واضح و ترجیحاً روبهدوربین باشد.
- دهان و صورت نباید پوشیده باشند.
- برای استفاده از چهره افراد رضایت بگیرید.
- صدای شبیهسازیشده نباید برای جعل هویت استفاده شود.
- تلفظ فارسی را پیش از انتشار بررسی کنید.
حرفزدن عکس با D-ID
D-ID نیز ابزار Talking Portrait و Avatar ارائه میدهد. کاربر میتواند یک تصویر همراه متن یا فایل صوتی ارسال و ویدئوی سخنگو دریافت کند.
طبق صفحه رسمی D-ID Speaking Portrait، یک تصویر به همراه متن یا صدا برای ساخت ویدئوی ارائهدهنده استفاده میشود.
D-ID همچنین API ارائه میکند که با یک تصویر چهره، ویدئوی Talking Head تولید میکند. جزئیات کلی در صفحه رسمی D-ID API موجود است.
مناسب برای:
- آواتار سخنگو
- آموزش سازمانی
- ارائه
- پشتیبانی تصویری
- معرفی خدمات
- محتوای چندزبانه
چگونه عکس چهره را متحرک کنیم؟
برای نتیجه بهتر، تصویر ورودی باید این ویژگیها را داشته باشد:
- صورت واضح
- رزولوشن مناسب
- نور متعادل
- نبود Motion Blur
- نبود دست روی صورت
- مشخصبودن چشمها
- ترجیحاً زاویه روبهرو یا سهربع
- پسزمینه ساده
- نبود افراد متعدد
پرامپت حرکت طبیعی چهره
شخصیت یک بار بهآرامی پلک بزند، نفس طبیعی بکشد و نگاه خود را
کمی به سمت نور بچرخاند. لبخند بسیار ظریفی شکل بگیرد.
حرکت صورت، شانه و مو طبیعی و محدود باشد. هویت، سن، فرم صورت،
چشمها، مو و لباس ثابت بمانند. دوربین حرکت بسیار آرام push-in
داشته باشد. بدون صحبت و بدون تغییر پسزمینه.
پرامپت پرتره سینمایی
Slow cinematic push-in toward the subject. Subtle natural blinking,
gentle breathing, slight hair movement caused by a soft breeze.
Warm sunset light gradually shifts across the face. Preserve facial
identity, age, clothing, background and composition. Realistic motion,
no morphing, no exaggerated expression.
خطاهای رایج چهره
- تغییر فرم صورت
- تغییر رنگ چشم
- تغییر مدل مو
- دندان غیرطبیعی
- حرکت شدید ابرو
- Lip Sync ضعیف
- چرخش غیرممکن سر
- تغییر سن
- ایجاد اکسسوری جدید
برای کاهش خطا:
- حرکت را محدود کنید.
- ویدئو را کوتاهتر کنید.
- از عکس واضحتر استفاده کنید.
- شدت Expression را کاهش دهید.
- از مدل Talking Avatar برای صحبت استفاده کنید.
- چند حرکت پیچیده را همزمان درخواست نکنید.
جانبخشی به عکسهای قدیمی
برای متحرککردن عکس قدیمی بهتر است ابتدا تصویر را ترمیم کنید.
فرایند پیشنهادی:
- اسکن عکس با کیفیت مناسب
- حذف گردوغبار و خطوخش
- اصلاح نور و Contrast
- ترمیم بخشهای آسیبدیده
- Upscale کنترلشده
- متحرکسازی محدود
- افزودن موسیقی یا صدای محیط
- Export و نگهداری نسخه اصلی
پرامپت:
این عکس تاریخی را با حفظ کامل هویت افراد و فضای زمانی آن
بهآرامی متحرک کن. افراد پلک بزنند و حرکات بسیار ظریف سر و
بدن داشته باشند. هیچ لباس، شیء، مدل مو یا جزئیات تاریخی تغییر
نکند. دوربین ثابت باشد و حرکتها طبیعی و محترمانه باشند.
بدون رنگیکردن تصویر و بدون اضافهکردن عناصر جدید.
اگر عکس مربوط به شخص درگذشته است، استفاده از Talking Photo یا ساخت دیالوگ جعلی میتواند برای خانواده حساس یا ناراحتکننده باشد. رضایت و زمینه انتشار را در نظر بگیرید.
تبدیل عکس محصول به ویدئوی تبلیغاتی
Image-to-Video یکی از کاربردیترین روشها برای فروشگاهها و برندهاست.
میتوان از یک عکس محصول برای ساخت موارد زیر استفاده کرد:
- Product Reveal
- حرکت Orbit
- Dolly-in
- نمایش نور
- تغییر پسزمینه
- ویدئوی شبکه اجتماعی
- تبلیغ کوتاه
- B-roll
- معرفی بستهبندی
آمادهسازی عکس محصول
- محصول واضح باشد.
- پسزمینه ساده باشد.
- لوگو و نوشتهها خوانا باشند.
- لبهها مشخص باشند.
- انعکاس کنترلشده باشد.
- تصویر فشرده یا تار نباشد.
- زاویه برای حرکت موردنظر مناسب باشد.
پرامپت ساعت هوشمند
یک ویدئوی تبلیغاتی حرفهای از ساعت هوشمند موجود در تصویر.
دوربین با حرکت orbit بسیار آرام از راست به چپ حرکت کند.
نور بنفش و فیروزهای روی لبههای فلزی جابهجا شود. صفحه،
دکمهها، بند، لوگو و شکل ساعت کاملاً ثابت بمانند.
پسزمینه سرمهای تیره با مه بسیار ظریف، حرکت نرم و سینمایی،
بدون متن، محصول اضافی یا تغییر طراحی.
پرامپت بستهبندی
دوربین با slow dolly-in به بستهبندی محصول نزدیک شود.
یک نور طلایی نرم از بالا روشن شود و انعکاس آن روی سطح حرکت کند.
تمام نوشتهها، لوگو، رنگ، نسبتها و لبههای بستهبندی دقیقاً
مطابق تصویر مرجع باقی بمانند. هیچ متن یا نماد جدید ایجاد نشود.
نکته مهم درباره لوگو و نوشته
مدل ویدئویی ممکن است متن یا لوگوی روی محصول را بین فریمها تغییر دهد. برای پروژه حرفهای:
- محصول را با حرکت محدود تولید کنید.
- نوشته را در Post-production جایگزین کنید.
- از Motion Tracking استفاده کنید.
- لوگوی اصلی را در تدوین اضافه کنید.
- فریمها را قبل از انتشار بررسی کنید.
تبدیل تصویر معماری به ویدئو
برای طراحی داخلی یا معماری:
دوربین با حرکت slow dolly-forward وارد فضای نشیمن شود.
نور طبیعی صبح از پنجرهها وارد شود و سایه درختان روی کف
حرکت بسیار ظریفی داشته باشد. پرده و گیاهان با نسیم ملایم
حرکت کنند. معماری، مبلمان، متریال، ابعاد و چیدمان تصویر مرجع
کاملاً ثابت باقی بمانند. بدون اضافهکردن انسان یا وسایل جدید.
حرکت دوربین پیچیده میتواند هندسه معماری را تغییر دهد. برای حفظ طراحی:
- حرکت کوتاه باشد.
- زاویه تغییر زیادی نکند.
- از مدل دارای Reference قوی استفاده کنید.
- نماهای مختلف را جداگانه Render کنید.
- نتیجه را با مدل سهبعدی اصلی مقایسه کنید.
متحرککردن نقاشی و تصویرسازی
برای Illustration و Concept Art:
ابرهای پسزمینه بهآرامی حرکت کنند، نورهای شهر سوسو بزنند
و شنل شخصیت با باد ملایم تکان بخورد. شخصیت در جای خود ثابت
بماند و فقط نفسکشیدن و حرکت ظریف سر داشته باشد.
سبک تصویرسازی، خطوط، رنگها و بافت نقاشی کاملاً حفظ شوند.
اگر حرکت بسیار زیاد باشد، مدل ممکن است سبک اثر را تغییر دهد. بهتر است حرکت را به چند ناحیه محدود کنید.
استفاده از فریم اول و آخر
First and Last Frame Control برای ساخت انتقال میان دو تصویر استفاده میشود.
کاربردها:
- تبدیل روز به شب
- تغییر فصل
- تغییر لباس
- ورود یا خروج محصول
- تغییر محیط
- Morphing کنترلشده
- ساخت Loop
- حرکت میان دو زاویه
مثال:
فریم اول:
یک خیابان در روز.
فریم آخر:
همان خیابان در شب.
Prompt:
زمان بهتدریج از عصر به شب تغییر کند. آسمان تاریک شود و
چراغهای ساختمانها و خودروها بهآرامی روشن شوند. معماری و
زاویه دوربین ثابت بمانند. هیچ ساختمان یا شیء جدیدی اضافه نشود.
برای Loop:
- فریم اول و آخر یکسان یا بسیار نزدیک باشند.
- حرکت وسط کلیپ نرم باشد.
- Action پایان مشخصی نداشته باشد.
- نور در ابتدا و پایان مشابه باشد.
فرمول پرامپت حرفهای Image-to-Video
در Text-to-Video باید کل صحنه را توصیف کنید؛ اما در Image-to-Video بهتر است بیشتر روی حرکت تمرکز کنید.
قالب پیشنهادی:
[حرکت سوژه]
+ [حرکت اجزای محیط]
+ [حرکت دوربین]
+ [تغییر نور]
+ [سرعت]
+ [مواردی که باید ثابت بمانند]
+ [موارد ممنوع]
مثال:
شخصیت بهآرامی سر خود را بالا بیاورد و به دوربین نگاه کند.
موها با نسیم ملایم حرکت کنند و نور پنجره کمی گرمتر شود.
دوربین با slow push-in نزدیک شود. حرکت طبیعی و ظریف باشد.
هویت چهره، لباس، پسزمینه و ترکیببندی ثابت بمانند.
بدون تغییر صورت، بدون اضافهشدن شخص و بدون لرزش دوربین.
کلمات مهم حرکت دوربین
| اصطلاح | مفهوم |
|---|---|
dolly-in | حرکت دوربین به سمت سوژه |
dolly-out | دورشدن دوربین |
pan left | چرخش افقی به چپ |
pan right | چرخش افقی به راست |
tilt up | چرخش عمودی رو به بالا |
tilt down | چرخش رو به پایین |
orbit | حرکت دور سوژه |
tracking shot | دنبالکردن سوژه |
crane shot | حرکت عمودی یا قوسی |
drone shot | نمای هوایی |
static camera | دوربین ثابت |
handheld | حرکت دوربین روی دست |
rack focus | انتقال فوکوس میان دو سوژه |
push-in | نزدیکشدن تدریجی |
pull-out | دورشدن تدریجی |
برای Image-to-Video معمولاً حرکتهای آرام مانند slow dolly-in، subtle orbit و gentle pan نتیجه باثباتتری دارند.
Negative Prompt مناسب
اگر مدل Negative Prompt دارد:
face distortion, identity change, extra fingers,
warped hands, flickering, jitter, morphing,
duplicate objects, text changes, logo changes,
camera shake, unnatural motion, new characters
اگر ندارد، محدودیتها را داخل Prompt اصلی بنویسید:
چهره، دستها، لباس، لوگو و نوشتهها تغییر نکنند.
هیچ شخص یا شیء جدیدی اضافه نشود. تصویر Flicker، Morph و
لرزش دوربین نداشته باشد.
رفع تغییر چهره در ویدئو
دلایل تغییر چهره:
- عکس بیکیفیت
- چرخش شدید سر
- حرکت طولانی
- نور بسیار متغیر
- Occlusion
- چند چهره در تصویر
- انتخاب مدل نامناسب
- Prompt متناقض
راهکارها:
- استفاده از پرتره واضح
- محدودکردن حرکت سر
- کوتاهکردن کلیپ
- انتخاب مدل دارای Character Reference
- استفاده از چند تصویر مرجع
- ثابتکردن نور
- تولید جداگانه نماها
- استفاده از Talking Avatar برای سخنگفتن
- ویرایش نهایی چهره در ابزار تخصصی
رفع Flicker و لرزش
Flicker یعنی تغییر ناخواسته بافت، نور یا جزئیات میان فریمها.
راهکارها:
- Action سادهتر
- دوربین آرامتر
- Prompt کوتاهتر و دقیقتر
- کاهش مدت کلیپ
- استفاده از تصویر تمیز
- حذف جزئیات ریز غیرضروری
- مدل با Temporal Consistency بهتر
- استفاده از ابزار Deflicker
- تولید خروجی با نرخ فریم مناسب
- انتخاب بهترین Take
رفع حرکت غیرطبیعی
حرکت غیرطبیعی معمولاً زمانی رخ میدهد که مدل باید همزمان چند تعامل فیزیکی پیچیده ایجاد کند.
مثال دشوار:
شخصیت بدود، بپرد، یک لیوان بردارد، دور خود بچرخد و با فرد
دیگری دست بدهد.
آن را به Shotهای جدا تقسیم کنید:
- شخصیت وارد صحنه میشود.
- به سمت میز حرکت میکند.
- لیوان را برمیدارد.
- نمای نزدیک از چهره.
- نمای جداگانه دستدادن.
هر Shot باید یک Action اصلی داشته باشد.
تبدیل عکس به ویدئو رایگان است؟
بسیاری از ابزارها اعتبار آزمایشی یا پلن رایگان محدود دارند. محدودیتها میتوانند شامل موارد زیر باشند:
- تعداد کم ویدئو
- مدت کوتاه
- رزولوشن پایین
- واترمارک
- صف انتظار
- مدل Fast
- عدم استفاده تجاری
- محدودیت دانلود
- نبود فریم آخر
- نبود صدای بومی
- نبود Private Mode
«رایگان» به معنی تولید نامحدود نیست؛ زیرا ساخت ویدئو به پردازش GPU زیادی نیاز دارد.
آیا تبدیل عکس قدیمی به ویدئو خطر دارد؟
خود متحرکسازی لزوماً خطرناک نیست، اما باید به این موارد توجه کرد:
- رضایت صاحب تصویر
- حریم خصوصی خانواده
- جعل گفتار فرد
- انتشار بدون زمینه
- ساخت محتوای گمراهکننده
- استفاده از عکس افراد درگذشته
- بازنمایی نادرست وقایع تاریخی
اگر ویدئو ممکن است واقعی تصور شود، مشخص کنید که با هوش مصنوعی ساخته شده است.
قوانین استفاده از چهره افراد
پیش از ساخت Talking Photo یا Avatar:
- رضایت فرد را دریافت کنید.
- هدف استفاده را توضیح دهید.
- از جعل گفتار خودداری کنید.
- محتوای سیاسی، مالی یا پزشکی جعلی تولید نکنید.
- از شبیهسازی افراد مشهور برای تبلیغ بدون مجوز پرهیز کنید.
- فایلها را امن نگهداری کنید.
- امکان حذف داده را فراهم کنید.
- خروجی AI را در کاربردهای حساس برچسبگذاری کنید.
صدای فرد نیز داده هویتی محسوب میشود و نباید بدون اجازه Clone شود.
API تبدیل عکس به ویدئو چیست؟
API Image-to-Video به یک سایت یا نرمافزار اجازه میدهد تصویر و Prompt را به مدل ارسال و ویدئوی نهایی را دریافت کند.
کاربردها:
- ساخت ویدئوی محصول برای فروشگاه
- متحرکسازی عکس کاربران
- ایجاد Avatar
- ساخت تبلیغ خودکار
- تولید کلیپ شبکه اجتماعی
- ویدئوی شخصیسازیشده
- انیمیشن Concept Art
- ابزار ساخت محتوا
- SaaS تولید ویدئو
- اتوماسیون کمپین تبلیغاتی
معماری پیشنهادی:
کاربر
↓
آپلود تصویر
↓
اعتبارسنجی و ذخیره امن
↓
ساخت Job
↓
API مدل Image-to-Video
↓
Polling یا Webhook
↓
ذخیره ویدئو در Object Storage
↓
تحویل نتیجه به کاربر
چرا تولید ویدئو Asynchronous است؟
ساخت ویدئو ممکن است چند ده ثانیه یا چند دقیقه طول بکشد. نگهداشتن یک درخواست HTTP تا پایان پردازش همیشه مناسب نیست.
بنابراین معمولاً ابتدا Job ساخته میشود:
{
"id": "job_123",
"status": "queued"
}
سپس وضعیت بررسی میشود:
GET /video-jobs/job_123
و در پایان:
{
"id": "job_123",
"status": "completed",
"output_url": "https://cdn.example.com/videos/job_123.mp4"
}
Endpoint و ساختار دقیق پاسخ به مدل و ارائهدهنده بستگی دارند.
اتصال Python به API درواره
ابتدا SDK را نصب کنید:
pip install openai
ساخت Client:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1",
)
ساختار عمومی درخواست برای مدلهای چندوجهی سازگار:
response = client.chat.completions.create(
model=os.environ["DARVAREH_VIDEO_MODEL"],
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"تصویر را به ویدئو تبدیل کن. دوربین با "
"حرکت بسیار آرام به محصول نزدیک شود. "
"شکل، لوگو و متن محصول تغییر نکنند."
),
},
{
"type": "image_url",
"image_url": {
"url": (
"https://example.com/product.jpg"
)
},
},
],
}
],
)
print(response)
ساختار دقیق درخواست، پارامترهای ویدئو و خروجی به مدل انتخابی بستگی دارند. برخی مدلها از Endpoint اختصاصی Asynchronous استفاده میکنند.
پارامترهای احتمالی:
{
"duration": 5,
"aspect_ratio": "16:9",
"resolution": "1080p",
"generate_audio": false
}
این فیلدها برای همه مدلها یکسان یا تضمینشده نیستند. مشخصات همان مدل را در فهرست و مستندات درواره بررسی کنید.
ارسال تصویر با Base64
برای تصویر خصوصی میتوان در صورت پشتیبانی مدل از Base64 استفاده کرد:
import base64
from pathlib import Path
image_bytes = Path("product.jpg").read_bytes()
image_base64 = base64.b64encode(
image_bytes
).decode("utf-8")
data_url = f"data:image/jpeg;base64,{image_base64}"
سپس:
{
"type": "image_url",
"image_url": {
"url": data_url
}
}
برای فایلهای بزرگ، Base64 حجم درخواست را حدوداً افزایش میدهد. استفاده از URL امضاشده کوتاهمدت معمولاً کارآمدتر است.
اتصال JavaScript و Node.js
نصب SDK:
npm install openai
ساخت Client:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.DARVAREH_API_KEY,
baseURL: "https://api.darvareh.ir/v1",
});
درخواست مفهومی:
const response =
await client.chat.completions.create({
model: process.env.DARVAREH_VIDEO_MODEL!,
messages: [
{
role: "user",
content: [
{
type: "text",
text: [
"این تصویر را به ویدئو تبدیل کن.",
"دوربین با slow orbit دور محصول حرکت کند.",
"لوگو، متن، رنگ و شکل محصول ثابت بمانند.",
].join(" "),
},
{
type: "image_url",
image_url: {
url: "https://example.com/product.jpg",
},
},
],
},
],
});
console.log(response);
کلید API را در مرورگر، React Client Component یا متغیرهای NEXT_PUBLIC_ قرار ندهید. درخواست باید از Backend ارسال شود.
مدل داده پیشنهادی
CREATE TABLE image_to_video_jobs (
id UUID PRIMARY KEY,
user_id UUID NOT NULL,
model VARCHAR(255) NOT NULL,
prompt TEXT NOT NULL,
input_image_url TEXT NOT NULL,
input_image_storage_key TEXT,
end_frame_url TEXT,
status VARCHAR(30) NOT NULL,
provider_job_id VARCHAR(255),
progress INTEGER,
duration_seconds NUMERIC(8, 2),
aspect_ratio VARCHAR(20),
resolution VARCHAR(30),
generate_audio BOOLEAN NOT NULL DEFAULT FALSE,
output_url TEXT,
output_storage_key TEXT,
thumbnail_url TEXT,
cost_amount NUMERIC(18, 8),
error_code VARCHAR(100),
error_message TEXT,
metadata JSONB NOT NULL DEFAULT '{}'::jsonb,
idempotency_key VARCHAR(255),
created_at TIMESTAMPTZ NOT NULL DEFAULT NOW(),
started_at TIMESTAMPTZ,
completed_at TIMESTAMPTZ,
expires_at TIMESTAMPTZ
);
ایندکس جلوگیری از Job تکراری:
CREATE UNIQUE INDEX image_video_idempotency_idx
ON image_to_video_jobs (user_id, idempotency_key)
WHERE idempotency_key IS NOT NULL;
امنیت فایل آپلودشده
پیش از ارسال تصویر:
- MIME Type واقعی را بررسی کنید.
- فقط فرمتهای مجاز را بپذیرید.
- حجم فایل را محدود کنید.
- ابعاد تصویر را بررسی کنید.
- Metadata حساس را حذف کنید.
- Malware Scan انجام دهید.
- نام فایل را تصادفی کنید.
- فایل را خارج از مسیر اجرایی ذخیره کنید.
- URL کوتاهمدت بسازید.
- مالکیت فایل را بررسی کنید.
فرمتهای متداول:
JPEG
PNG
WebP
پذیرفتن SVG خام از کاربر میتواند ریسک امنیتی داشته باشد و نیازمند Sanitization تخصصی است.
جلوگیری از SSRF
اگر کاربر URL تصویر وارد میکند، نباید هر URL را مستقیماً از سرور دانلود کنید.
موارد مسدود:
localhost127.0.0.1- IPهای خصوصی
- Cloud Metadata
- شبکه داخلی
- پروتکلهای غیر HTTP/HTTPS
- Redirect به مقصد داخلی
- فایل بسیار بزرگ
بهتر است تصویر ابتدا از طریق Upload امن وارد Storage برنامه شود.
کاهش هزینه Image-to-Video
- ابتدا تصویر مرجع را دقیق آماده کنید.
- از Preview کمهزینه استفاده کنید.
- ویدئو را کوتاه بسازید.
- Action را ساده نگه دارید.
- چند Variation محدود تولید کنید.
- از مدل Fast برای آزمایش استفاده کنید.
- رزولوشن نهایی را در مرحله آخر بسازید.
- نتیجه موفق را ذخیره کنید.
- Idempotency Key داشته باشید.
- برای هر کاربر سقف مصرف تعیین کنید.
- همزمانی Jobها را محدود کنید.
- پیش از تولید هزینه تقریبی را نمایش دهید.
چکلیست انتخاب عکس مناسب
- سوژه واضح است.
- عکس تار نیست.
- رزولوشن کافی دارد.
- نور متعادل است.
- چهره پوشیده نیست.
- محصول کامل دیده میشود.
- متنهای محصول خوانا هستند.
- پسزمینه بیش از حد شلوغ نیست.
- نسبت تصویر به خروجی نزدیک است.
- مجوز استفاده از تصویر وجود دارد.
- اطلاعات حساس داخل Metadata نیست.
- حرکت موردنظر با زاویه عکس سازگار است.
مثلاً نمیتوان از یک عکس کاملاً روبهرو انتظار داشت مدل بدون تخمین و ساخت جزئیات جدید، دوربین را ۱۸۰ درجه پشت سوژه ببرد.
چکلیست کنترل خروجی
- چهره تغییر نکرده است.
- چشم و دهان طبیعی هستند.
- دستها سالماند.
- محصول تغییر شکل نداده است.
- لوگو و متن ثابتاند.
- شیء تکراری وجود ندارد.
- نور Flicker ندارد.
- حرکت دوربین نرم است.
- فریمها Morph نمیشوند.
- صدای تولیدشده هماهنگ است.
- Lip Sync بررسی شده است.
- واترمارک وجود ندارد یا مطابق مجوز است.
- شرایط استفاده تجاری رعایت شده است.
- خروجی AI در کاربردهای حساس مشخص شده است.
پرسشهای متداول
بهترین هوش مصنوعی تبدیل عکس به ویدئو چیست؟
Kling AI، Seedance، Veo، Runway، Luma Dream Machine، Pika، Adobe Firefly و Hailuo از گزینههای مهماند. برای Talking Photo نیز HeyGen و D-ID مناسبتر هستند.
چگونه عکس را رایگان به ویدئو تبدیل کنیم؟
یکی از ابزارهای دارای Credit رایگان را انتخاب، تصویر را آپلود و حرکت موردنظر را با Prompt تعریف کنید. پلن رایگان معمولاً محدودیت تعداد، رزولوشن، مدت یا واترمارک دارد.
چگونه عکس قدیمی را زنده کنیم؟
ابتدا تصویر را ترمیم و Upscale کنید، سپس حرکات محدود مانند پلکزدن، نفسکشیدن و حرکت ظریف سر را درخواست کنید. از Action پیچیده خودداری کنید.
چگونه عکس را به ویدئوی حرفزن تبدیل کنیم؟
از ابزار Talking Avatar مانند HeyGen یا D-ID استفاده کنید. عکس چهره را وارد و متن یا فایل صوتی را انتخاب کنید تا حرکت لب و صورت تولید شود.
چگونه چهره را در ویدئو ثابت نگه داریم؟
از عکس واضح، Character Reference، حرکت کوتاه، نور ثابت و Prompt محدود استفاده کنید. چرخش شدید سر و Action پیچیده احتمال تغییر چهره را افزایش میدهند.
چگونه عکس محصول را به تبلیغ تبدیل کنیم؟
از عکس تمیز محصول، حرکت آرام دوربین و Prompt دقیق استفاده کنید. لوگو و متنهای مهم را در Post-production اضافه یا کنترل کنید.
First Frame و Last Frame چیست؟
دو تصویر، نقطه شروع و پایان ویدئو را مشخص میکنند و مدل انتقال میان آنها را تولید میکند. این قابلیت برای تغییر زمان، محیط، زاویه یا ساخت Loop کاربرد دارد.
آیا میتوان با یک عکس ویدئوی طولانی ساخت؟
امکان تولید یا Extend وجود دارد، اما کلیپ طولانی احتمال تغییر سوژه و محیط را افزایش میدهد. نتیجه بهتر معمولاً از چند Shot کوتاه و تدوین آنها ساخته میشود.
آیا استفاده تجاری از ویدئو مجاز است؟
به ابزار، مدل، پلن و حقوق تصویر ورودی بستگی دارد. شرایط استفاده تجاری و رضایت صاحب چهره را بررسی کنید.
API تبدیل عکس به ویدئو چیست؟
API Image-to-Video به نرمافزار اجازه میدهد تصویر و Prompt را به مدل ارسال و خروجی ویدئویی دریافت کند.
چگونه API تبدیل عکس به ویدئو دریافت کنیم؟
در درواره ثبتنام کنید، کلید API بسازید و مدل ویدئویی موردنظر را از طریق آدرس پایه زیر فراخوانی کنید:
https://api.darvareh.ir/v1
جمعبندی
تبدیل عکس به ویدئو با هوش مصنوعی راهی سریع برای ساخت محتوای متحرک از عکس چهره، محصول، معماری، تصویرسازی یا عکسهای قدیمی است.
برای انتخاب ابزار:
- Kling AI برای حرکت سینمایی و فریم اول و آخر
- Seedance برای ورودی چندمرجعی و کنترل حرفهای
- Veo برای حرکت واقعگرایانه و صدای هماهنگ
- Runway برای Workflow حرفهای و ویرایش
- Luma برای حرکت نرم و سینمایی
- Pika برای کلیپ کوتاه و افکت
- Firefly برای کاربران Adobe
- HeyGen برای آواتار سخنگو
- D-ID برای Talking Portrait
- API درواره برای اتصال به نرمافزار
برای رسیدن به نتیجه خوب:
- عکس باکیفیت انتخاب کنید.
- حرکت را ساده و دقیق تعریف کنید.
- مشخص کنید چه چیزهایی باید ثابت بمانند.
- از کلیپهای کوتاه استفاده کنید.
- خروجی را از نظر چهره، دست، لوگو و Flicker بررسی کنید.
- متن و برند را در تدوین نهایی اضافه کنید.
- حقوق تصویر و رضایت افراد را رعایت کنید.
دسترسی به مدلهای Image-to-Video با API درواره
درواره دسترسی API به مدلهای مختلف هوش مصنوعی را برای توسعهدهندگان و کسبوکارهای ایرانی فراهم میکند.
با API درواره میتوانید:
- تبدیل عکس به ویدئو را به سایت اضافه کنید.
- ویدئوی محصول تولید کنید.
- Workflow تولید محتوا بسازید.
- مدلهای مختلف را مقایسه کنید.
- مدل Fast یا Pro را براساس نیاز انتخاب کنید.
- هزینه را بهصورت ریالی پرداخت کنید.
- کلید و مصرف API را مدیریت کنید.
- معماری Multi-Model بسازید.
- در صورت توقف یک مدل، به مدل دیگری مهاجرت کنید.
آدرس پایه:
https://api.darvareh.ir/v1
نمونه Client:
from openai import OpenAI
client = OpenAI(
api_key="DARVAREH_API_KEY",
base_url="https://api.darvareh.ir/v1",
)
شناسه مدل، Endpoint، ورودیهای مرجع، مدت، رزولوشن و ساختار خروجی را براساس مشخصات مدل انتخابی در درواره تنظیم کنید.