تبدیل عکس به ویدئو با هوش مصنوعی؛ معرفی ابزارهای رایگان و آموزش کامل Image-to-Video

در این آموزش یاد می‌گیرید چگونه با ابزارهای هوش مصنوعی، عکس چهره، محصول یا تصاویر قدیمی را به ویدئو تبدیل کنید؛ همراه با معرفی مدل‌ها، پرامپت‌های آماده، رفع خطا، Lip Sync و اتصال Image-to-Video به API درواره.

Share
Darvareh Image-to-Video
Darvareh Image-to-Video

تبدیل عکس به ویدئو با هوش مصنوعی چیست؟

تبدیل عکس به ویدئو با هوش مصنوعی یا Image-to-Video فرایندی است که در آن یک یا چند تصویر ثابت به مدل هوش مصنوعی داده می‌شود و مدل براساس تصویر و دستور متنی کاربر، فریم‌های متحرک جدیدی می‌سازد.

در ساده‌ترین حالت، یک عکس وارد می‌کنید و می‌نویسید:

دوربین به‌آرامی به سوژه نزدیک شود. موهای شخصیت با نسیم ملایم
حرکت کنند و نور غروب به‌تدریج گرم‌تر شود.

مدل تلاش می‌کند:

  • سوژه اصلی را تشخیص دهد.
  • عمق تقریبی صحنه را تخمین بزند.
  • حرکت دوربین را شبیه‌سازی کند.
  • حرکت طبیعی اجزای تصویر را بسازد.
  • فریم‌های میانی را تولید کند.
  • ظاهر و ترکیب‌بندی تصویر مرجع را حفظ کند.

Image-to-Video با روش‌های قدیمی ساخت اسلایدشو تفاوت دارد. در اسلایدشو فقط روی عکس ثابت حرکت Zoom یا Pan انجام می‌شود؛ اما مدل هوش مصنوعی می‌تواند حرکت جدیدی داخل صحنه ایجاد کند.

برای مثال:

  • شخصیت پلک بزند.
  • سر خود را حرکت دهد.
  • لباس با باد تکان بخورد.
  • آب جریان پیدا کند.
  • ابرها حرکت کنند.
  • محصول بچرخد.
  • نور محیط تغییر کند.
  • دوربین دور سوژه حرکت کند.
  • شخص شروع به صحبت کند.
  • محیط اطراف تصویر زنده شود.

بهترین ابزار تبدیل عکس به ویدئو کدام است؟

انتخاب بهترین ابزار به نوع عکس و خروجی موردنظر بستگی دارد.

پاسخ سریع:

  • برای ویدئوی سینمایی از عکس: Kling AI
  • برای استفاده از چند تصویر و مرجع مختلف: Seedance 2.0
  • برای کیفیت واقع‌گرایانه و صدای بومی: Google Veo
  • برای Workflow حرفه‌ای و ویرایش: Runway
  • برای حرکت نرم و سینمایی: Luma Dream Machine
  • برای افکت‌های سریع شبکه اجتماعی: Pika
  • برای طراحان و Creative Cloud: Adobe Firefly
  • برای حرف‌زدن عکس و آواتار: HeyGen
  • برای Talking Portrait: D-ID
  • برای اتصال به سایت و نرم‌افزار: API مدل‌های Image-to-Video

مقایسه ابزارهای تبدیل عکس به ویدئو

ابزارمناسب برایقابلیت مهمدسترسی رایگان
Kling AIتبلیغ، فیلم کوتاه و محصولحرکت سینمایی و فریم اول و آخرمعمولاً اعتبار محدود
Seedance 2.0پروژه‌های چندمرجعیورودی تصویر، صوت و ویدئووابسته به پلتفرم
Google Veoویدئوی واقع‌گرایانهتصویر به ویدئو همراه صدامحدود یا وابسته به پلن
Runwayتولید و ویرایش حرفه‌ایReference و کنترل حرکتپلن محدود رایگان
Luma Dream Machineحرکت نرم دوربینImage-to-Video و Modifyامکان آزمایش محدود
Pikaمحتوای شبکه اجتماعیافکت و انیمیشن سریعCredit محدود
Adobe Fireflyطراحی و تبلیغاتتولید و تدوین یکپارچهاستفاده محدود
Hailuo AIکلیپ کوتاهحرکت چهره و صحنهاعتبار محدود
HeyGenحرف‌زدن عکسAvatar و Lip Syncآزمایش محدود
D-IDTalking Portraitعکس و متن یا فایل صوتیآزمایش یا پلن محدود
API دروارهمحصول و اتوماسیوندسترسی برنامه‌نویسیPay-as-you-go

شرایط Credit، رزولوشن، واترمارک، مدت ویدئو و استفاده تجاری ممکن است تغییر کند؛ بنابراین صفحه Pricing هر ابزار را پیش از استفاده بررسی کنید.

تفاوت Image-to-Video با Text-to-Video

در Text-to-Video فقط توضیح متنی ارسال می‌کنید:

یک اسب سفید در ساحل هنگام غروب می‌دود.

مدل باید همه عناصر را از ابتدا بسازد:

  • ظاهر اسب
  • ساحل
  • نور
  • رنگ
  • زاویه دوربین
  • ترکیب‌بندی
  • حرکت

اما در Image-to-Video، تصویر مرجع بسیاری از این تصمیم‌ها را از قبل مشخص می‌کند:

  • ظاهر سوژه
  • لباس
  • رنگ
  • محیط
  • ترکیب‌بندی
  • زاویه اولیه
  • سبک بصری

به همین دلیل Image-to-Video معمولاً برای این کاربردها کنترل بیشتری ایجاد می‌کند:

  • تبلیغ محصول
  • حفظ کاراکتر
  • متحرک‌سازی طراحی
  • زنده‌کردن عکس قدیمی
  • ساخت حرکت از Concept Art
  • انیمیشن تصویر تولیدشده
  • ویدئوی معماری
  • حرکت‌دادن لوگو یا پوستر
  • ساخت آواتار سخنگو

Kling AI برای تبدیل عکس به ویدئو

Kling AI یکی از ابزارهای قدرتمند Image-to-Video است و قابلیت‌هایی برای حرکت دوربین، حرکت سوژه، Storyboard و استفاده از فریم اول و آخر ارائه می‌دهد.

در حالت ساده:

  1. تصویر را آپلود می‌کنید.
  2. مدل و مدت را انتخاب می‌کنید.
  3. Prompt حرکت را می‌نویسید.
  4. نسبت تصویر و کیفیت را تنظیم می‌کنید.
  5. ویدئو را تولید می‌کنید.

Prompt نمونه:

دوربین با یک حرکت بسیار آرام و سینمایی به سمت شخصیت نزدیک شود.
شخصیت یک بار پلک بزند و نگاه خود را کمی به سمت چپ ببرد.
مو و لباس با نسیم بسیار ملایم حرکت کنند. هویت چهره، لباس،
پس‌زمینه و ترکیب‌بندی ثابت بمانند. حرکت طبیعی و بدون اعوجاج.

Kling همچنین از تعیین فریم شروع و پایان در برخی Workflowها پشتیبانی می‌کند. براساس راهنمای رسمی Start and End Frames در Kling، کاربر می‌تواند دو تصویر را به‌عنوان فریم اول و آخر وارد کند تا مدل انتقال میان آن‌ها را تولید کند.

مناسب برای:

  • تصویر چهره
  • عکس محصول
  • صحنه سینمایی
  • معماری
  • تبلیغات
  • تبدیل Concept Art به ویدئو
  • انتقال میان دو تصویر

مزایا:

  • حرکت مناسب دوربین
  • کنترل فریم اول و آخر
  • قابلیت‌های چندنمایی در مدل‌های جدید
  • تولید صوت و تصویر در برخی مدل‌ها
  • خروجی مناسب تبلیغات

محدودیت‌ها:

  • تغییر چهره در حرکت‌های شدید
  • مصرف Credit بیشتر در کیفیت‌های بالا
  • انتظار در صف کاربران رایگان
  • نیاز به چند بار تولید برای Action پیچیده

Seedance برای تبدیل تصویر به ویدئو

Seedance مدل تولید ویدئو ByteDance است و نسخه‌های جدید آن می‌توانند از چند نوع ورودی استفاده کنند:

  • متن
  • تصویر
  • ویدئو
  • صوت

در Seedance 2.0 می‌توان از چند تصویر برای تعریف شخصیت، محصول، محیط و سبک استفاده کرد.

براساس اعلام رسمی Seedance 2.0، این مدل از ورودی‌های ترکیبی پشتیبانی می‌کند و می‌تواند هم‌زمان چند تصویر، کلیپ و فایل صوتی را به‌عنوان Reference دریافت کند. تعداد دقیق ورودی‌های قابل استفاده به رابط یا API ارائه‌دهنده نیز بستگی دارد.

سناریوی نمونه تبلیغ محصول:

  • تصویر اول: نمای جلو محصول
  • تصویر دوم: نمای جانبی
  • تصویر سوم: بسته‌بندی
  • تصویر چهارم: محیط مطلوب
  • ویدئوی مرجع: حرکت دوربین
  • فایل صوتی: ریتم و فضای تبلیغ
  • Prompt: دستور نهایی

پرامپت:

از تصاویر اول تا سوم برای حفظ دقیق شکل، رنگ، لوگو و بسته‌بندی
محصول استفاده کن. تصویر چهارم مرجع محیط باشد. حرکت دوربین
مشابه ویدئوی مرجع، نرم و نیم‌دایره‌ای باشد. محصول روی سطح
مشکی براق قرار بگیرد و نورهای بنفش و طلایی به‌آرامی روی لبه‌های
آن حرکت کنند. هیچ نوشته یا جزئیات محصول تغییر نکند.

Seedance 2.0 از تصویر، صوت و ویدئو به‌عنوان مرجع استفاده می‌کند و امکان کنترل اجرا، نور، سایه و حرکت دوربین را فراهم می‌کند. جزئیات کلی در صفحه رسمی Seedance 2.0 منتشر شده است.

مناسب برای:

  • محصول
  • تبلیغات
  • پروژه‌های چندمرجعی
  • تولید صوت و تصویر
  • ویرایش ویدئو
  • ادامه کلیپ
  • ساخت ویدئوی چندنمایی

Google Veo برای Image-to-Video

Google Veo می‌تواند تصویر را همراه یک Prompt دریافت و ویدئو تولید کند. خانواده Veo روی کیفیت بصری، فیزیک حرکت، پیروی از Prompt و تولید صوت و تصویر تمرکز دارد.

برای متحرک‌کردن تصویر طبیعت:

رودخانه به‌آرامی جریان داشته باشد، برگ‌های درختان با باد ملایم
حرکت کنند و مه صبحگاهی به‌تدریج از سطح آب کنار برود.
دوربین ثابت باشد و فقط یک حرکت بسیار ظریف push-in داشته باشد.
صدای آب، پرندگان و باد جنگل طبیعی و هماهنگ تولید شود.

مناسب برای:

  • طبیعت
  • تبلیغات
  • B-roll
  • ویدئوی واقع‌گرایانه
  • تولید صدا همراه تصویر
  • حرکت سینمایی

محدودیت‌ها:

  • دسترسی به مدل ممکن است به سرویس، پلن یا منطقه وابسته باشد.
  • دیالوگ فارسی باید کنترل شود.
  • برای حفظ نوشته‌های محصول باید حرکت محدود و Reference واضح باشد.

Runway برای تبدیل عکس به ویدئوی حرفه‌ای

Runway علاوه بر Image-to-Video، مجموعه‌ای از ابزارهای ویرایش و مدیریت Asset ارائه می‌دهد.

در Runway می‌توانید:

  • عکس را متحرک کنید.
  • حرکت دوربین تعریف کنید.
  • سوژه را با Reference حفظ کنید.
  • کلیپ را ادامه دهید.
  • بخش‌هایی از ویدئو را ویرایش کنید.
  • Video-to-Video انجام دهید.
  • چند Shot را مدیریت کنید.
  • Lip Sync اضافه کنید.
  • خروجی را با پروژه تدوین ترکیب کنید.

در Runway Gen-4، ورودی تصویر برای تولید کلیپ‌های کوتاه کنترل‌شده استفاده می‌شود. راهنمای رسمی Gen-4 Video توضیح می‌دهد که این مدل از تصویر و Prompt متنی برای ساخت کلیپ استفاده می‌کند.

پرامپت Image-to-Video بهتر است روی حرکت تمرکز داشته باشد:

The camera slowly orbits clockwise around the product.
Soft reflections move across the glass surface. Background lights
pulse subtly. The product remains completely rigid and unchanged.
No new objects, no text changes, no deformation.

مناسب برای:

  • کاربران حرفه‌ای
  • فیلم‌سازان
  • آژانس‌های تبلیغاتی
  • B-roll
  • تصویر محصول
  • طراحی Storyboard
  • جلوه‌های بصری

Luma Dream Machine برای حرکت طبیعی و سینمایی

Luma Dream Machine امکان تولید ویدئو از متن و تصویر را فراهم می‌کند و ابزارهایی برای Reframe، Extend، Modify و تغییر سبک دارد.

Prompt نمونه معماری:

دوربین با حرکت slow dolly-in وارد فضای داخلی ساختمان شود.
پرده‌ها و گیاهان با نسیم بسیار ملایم حرکت کنند. نور آفتاب روی
کف به‌آرامی جابه‌جا شود. معماری، مبلمان، رنگ‌ها و هندسه فضا
کاملاً مطابق تصویر مرجع باقی بمانند.

مناسب برای:

  • معماری
  • طراحی داخلی
  • Concept Art
  • تصویر محصول
  • صحنه سینمایی
  • تصاویر طبیعت

مدل‌های خانواده Ray برای تولید و ویرایش ویدئو استفاده می‌شوند و پلتفرم Luma ابزارهایی مانند Extend، Reframe و Modify ارائه می‌دهد.

Pika برای افکت و ویدئوی کوتاه

Pika بیشتر برای محتوای Social-first، افکت‌های خلاقانه و متحرک‌سازی سریع تصاویر مناسب است.

کاربردها:

  • متحرک‌کردن عکس
  • حرکت چهره
  • ساخت کلیپ ترند
  • تغییر اشیا
  • اضافه‌کردن عناصر
  • افکت‌های آماده
  • هماهنگ‌سازی تصویر با صدا

Pikaformance می‌تواند تصویر چهره را با فایل صوتی هماهنگ کند و حالت صورت و حرکت لب بسازد. اطلاعات این قابلیت در سایت رسمی Pika آمده است.

مناسب برای:

  • Reels
  • کلیپ کوتاه
  • سرگرمی
  • عکس سخنگو
  • محتوای وایرال
  • افکت بصری

محدودیت‌ها:

  • برخی خروجی‌های پلن پایه رزولوشن محدود دارند.
  • Credit رایگان محدود است.
  • مجوز تجاری و نبود واترمارک به پلن وابسته است.

Adobe Firefly برای تبدیل عکس به ویدئو

Adobe Firefly امکان Image-to-Video را در یک محیط طراحی و تدوین ارائه می‌دهد.

می‌توانید:

  • تصویر را آپلود کنید.
  • حرکت دوربین را مشخص کنید.
  • انیمیشن محیطی بسازید.
  • Variation تولید کنید.
  • کلیپ را داخل Timeline قرار دهید.
  • ویدئو را با ابزارهای Adobe ویرایش کنید.
  • از مدل Firefly یا مدل‌های شریک استفاده کنید.

طبق راهنمای رسمی Image-to-Video در Adobe Firefly، این ابزار می‌تواند عکس، تصویرسازی، Render دوبعدی یا سه‌بعدی و Concept Art را به ویدئو تبدیل کند.

مناسب برای:

  • طراحان
  • تدوینگران
  • B-roll
  • Product Shot
  • Concept Visualization
  • محتوای تجاری
  • کاربران Creative Cloud

Hailuo AI برای جان‌بخشی به تصویر

Hailuo AI برای ساخت کلیپ از عکس و Prompt استفاده می‌شود و در حرکت چهره، Action و صحنه‌های کوتاه کاربرد دارد.

پرامپت مناسب:

شخصیت به‌آرامی سر خود را به سمت دوربین برگرداند و لبخند طبیعی
بزند. حرکت چشم، صورت و شانه‌ها ظریف باشد. دوربین ثابت بماند.
هویت چهره، مو، لباس و محیط تغییر نکنند.

برای کاربران رایگان ممکن است صف انتظار، واترمارک، رزولوشن محدود یا Credit روزانه وجود داشته باشد.

حرف‌زدن عکس با HeyGen

اگر هدفتان فقط حرکت سینمایی نیست و می‌خواهید یک عکس صحبت کند، ابزارهای Talking Avatar مناسب‌تر از مدل عمومی Image-to-Video هستند.

HeyGen می‌تواند یک تصویر چهره را دریافت و براساس متن یا صدا، ویدئوی سخنگو تولید کند.

فرایند معمول:

  1. عکس واضح چهره را آپلود کنید.
  2. متن را وارد یا فایل صوتی را بارگذاری کنید.
  3. صدا و زبان را انتخاب کنید.
  4. حالت و سبک را تنظیم کنید.
  5. ویدئو را تولید کنید.

طبق صفحه رسمی Talking Photo در HeyGen، ابزار Avatar IV می‌تواند یک تصویر را همراه با همگام‌سازی صدا، حالت چهره و حرکات طبیعی به ویدئو تبدیل کند.

HeyGen همچنین ابزار Face Talking دارد که براساس متن یا صدای ورودی، حرکت لب، پلک و حالت صورت تولید می‌کند. جزئیات در صفحه رسمی Face Talking ارائه شده است.

مناسب برای:

  • آموزش
  • معرفی محصول
  • نریشن تصویری
  • آواتار
  • شبکه اجتماعی
  • محتوای چندزبانه
  • سخنگوی مجازی

نکات مهم:

  • عکس باید واضح و ترجیحاً روبه‌دوربین باشد.
  • دهان و صورت نباید پوشیده باشند.
  • برای استفاده از چهره افراد رضایت بگیرید.
  • صدای شبیه‌سازی‌شده نباید برای جعل هویت استفاده شود.
  • تلفظ فارسی را پیش از انتشار بررسی کنید.

حرف‌زدن عکس با D-ID

D-ID نیز ابزار Talking Portrait و Avatar ارائه می‌دهد. کاربر می‌تواند یک تصویر همراه متن یا فایل صوتی ارسال و ویدئوی سخنگو دریافت کند.

طبق صفحه رسمی D-ID Speaking Portrait، یک تصویر به همراه متن یا صدا برای ساخت ویدئوی ارائه‌دهنده استفاده می‌شود.

D-ID همچنین API ارائه می‌کند که با یک تصویر چهره، ویدئوی Talking Head تولید می‌کند. جزئیات کلی در صفحه رسمی D-ID API موجود است.

مناسب برای:

  • آواتار سخنگو
  • آموزش سازمانی
  • ارائه
  • پشتیبانی تصویری
  • معرفی خدمات
  • محتوای چندزبانه

چگونه عکس چهره را متحرک کنیم؟

برای نتیجه بهتر، تصویر ورودی باید این ویژگی‌ها را داشته باشد:

  • صورت واضح
  • رزولوشن مناسب
  • نور متعادل
  • نبود Motion Blur
  • نبود دست روی صورت
  • مشخص‌بودن چشم‌ها
  • ترجیحاً زاویه روبه‌رو یا سه‌ربع
  • پس‌زمینه ساده
  • نبود افراد متعدد

پرامپت حرکت طبیعی چهره

شخصیت یک بار به‌آرامی پلک بزند، نفس طبیعی بکشد و نگاه خود را
کمی به سمت نور بچرخاند. لبخند بسیار ظریفی شکل بگیرد.
حرکت صورت، شانه و مو طبیعی و محدود باشد. هویت، سن، فرم صورت،
چشم‌ها، مو و لباس ثابت بمانند. دوربین حرکت بسیار آرام push-in
داشته باشد. بدون صحبت و بدون تغییر پس‌زمینه.

پرامپت پرتره سینمایی

Slow cinematic push-in toward the subject. Subtle natural blinking,
gentle breathing, slight hair movement caused by a soft breeze.
Warm sunset light gradually shifts across the face. Preserve facial
identity, age, clothing, background and composition. Realistic motion,
no morphing, no exaggerated expression.

خطاهای رایج چهره

  • تغییر فرم صورت
  • تغییر رنگ چشم
  • تغییر مدل مو
  • دندان غیرطبیعی
  • حرکت شدید ابرو
  • Lip Sync ضعیف
  • چرخش غیرممکن سر
  • تغییر سن
  • ایجاد اکسسوری جدید

برای کاهش خطا:

  • حرکت را محدود کنید.
  • ویدئو را کوتاه‌تر کنید.
  • از عکس واضح‌تر استفاده کنید.
  • شدت Expression را کاهش دهید.
  • از مدل Talking Avatar برای صحبت استفاده کنید.
  • چند حرکت پیچیده را هم‌زمان درخواست نکنید.

جان‌بخشی به عکس‌های قدیمی

برای متحرک‌کردن عکس قدیمی بهتر است ابتدا تصویر را ترمیم کنید.

فرایند پیشنهادی:

  1. اسکن عکس با کیفیت مناسب
  2. حذف گردوغبار و خط‌وخش
  3. اصلاح نور و Contrast
  4. ترمیم بخش‌های آسیب‌دیده
  5. Upscale کنترل‌شده
  6. متحرک‌سازی محدود
  7. افزودن موسیقی یا صدای محیط
  8. Export و نگهداری نسخه اصلی

پرامپت:

این عکس تاریخی را با حفظ کامل هویت افراد و فضای زمانی آن
به‌آرامی متحرک کن. افراد پلک بزنند و حرکات بسیار ظریف سر و
بدن داشته باشند. هیچ لباس، شیء، مدل مو یا جزئیات تاریخی تغییر
نکند. دوربین ثابت باشد و حرکت‌ها طبیعی و محترمانه باشند.
بدون رنگی‌کردن تصویر و بدون اضافه‌کردن عناصر جدید.

اگر عکس مربوط به شخص درگذشته است، استفاده از Talking Photo یا ساخت دیالوگ جعلی می‌تواند برای خانواده حساس یا ناراحت‌کننده باشد. رضایت و زمینه انتشار را در نظر بگیرید.

تبدیل عکس محصول به ویدئوی تبلیغاتی

Image-to-Video یکی از کاربردی‌ترین روش‌ها برای فروشگاه‌ها و برندهاست.

می‌توان از یک عکس محصول برای ساخت موارد زیر استفاده کرد:

  • Product Reveal
  • حرکت Orbit
  • Dolly-in
  • نمایش نور
  • تغییر پس‌زمینه
  • ویدئوی شبکه اجتماعی
  • تبلیغ کوتاه
  • B-roll
  • معرفی بسته‌بندی

آماده‌سازی عکس محصول

  • محصول واضح باشد.
  • پس‌زمینه ساده باشد.
  • لوگو و نوشته‌ها خوانا باشند.
  • لبه‌ها مشخص باشند.
  • انعکاس کنترل‌شده باشد.
  • تصویر فشرده یا تار نباشد.
  • زاویه برای حرکت موردنظر مناسب باشد.

پرامپت ساعت هوشمند

یک ویدئوی تبلیغاتی حرفه‌ای از ساعت هوشمند موجود در تصویر.
دوربین با حرکت orbit بسیار آرام از راست به چپ حرکت کند.
نور بنفش و فیروزه‌ای روی لبه‌های فلزی جابه‌جا شود. صفحه،
دکمه‌ها، بند، لوگو و شکل ساعت کاملاً ثابت بمانند.
پس‌زمینه سرمه‌ای تیره با مه بسیار ظریف، حرکت نرم و سینمایی،
بدون متن، محصول اضافی یا تغییر طراحی.

پرامپت بسته‌بندی

دوربین با slow dolly-in به بسته‌بندی محصول نزدیک شود.
یک نور طلایی نرم از بالا روشن شود و انعکاس آن روی سطح حرکت کند.
تمام نوشته‌ها، لوگو، رنگ، نسبت‌ها و لبه‌های بسته‌بندی دقیقاً
مطابق تصویر مرجع باقی بمانند. هیچ متن یا نماد جدید ایجاد نشود.

نکته مهم درباره لوگو و نوشته

مدل ویدئویی ممکن است متن یا لوگوی روی محصول را بین فریم‌ها تغییر دهد. برای پروژه حرفه‌ای:

  • محصول را با حرکت محدود تولید کنید.
  • نوشته را در Post-production جایگزین کنید.
  • از Motion Tracking استفاده کنید.
  • لوگوی اصلی را در تدوین اضافه کنید.
  • فریم‌ها را قبل از انتشار بررسی کنید.

تبدیل تصویر معماری به ویدئو

برای طراحی داخلی یا معماری:

دوربین با حرکت slow dolly-forward وارد فضای نشیمن شود.
نور طبیعی صبح از پنجره‌ها وارد شود و سایه درختان روی کف
حرکت بسیار ظریفی داشته باشد. پرده و گیاهان با نسیم ملایم
حرکت کنند. معماری، مبلمان، متریال، ابعاد و چیدمان تصویر مرجع
کاملاً ثابت باقی بمانند. بدون اضافه‌کردن انسان یا وسایل جدید.

حرکت دوربین پیچیده می‌تواند هندسه معماری را تغییر دهد. برای حفظ طراحی:

  • حرکت کوتاه باشد.
  • زاویه تغییر زیادی نکند.
  • از مدل دارای Reference قوی استفاده کنید.
  • نماهای مختلف را جداگانه Render کنید.
  • نتیجه را با مدل سه‌بعدی اصلی مقایسه کنید.

متحرک‌کردن نقاشی و تصویرسازی

برای Illustration و Concept Art:

ابرهای پس‌زمینه به‌آرامی حرکت کنند، نورهای شهر سوسو بزنند
و شنل شخصیت با باد ملایم تکان بخورد. شخصیت در جای خود ثابت
بماند و فقط نفس‌کشیدن و حرکت ظریف سر داشته باشد.
سبک تصویرسازی، خطوط، رنگ‌ها و بافت نقاشی کاملاً حفظ شوند.

اگر حرکت بسیار زیاد باشد، مدل ممکن است سبک اثر را تغییر دهد. بهتر است حرکت را به چند ناحیه محدود کنید.

استفاده از فریم اول و آخر

First and Last Frame Control برای ساخت انتقال میان دو تصویر استفاده می‌شود.

کاربردها:

  • تبدیل روز به شب
  • تغییر فصل
  • تغییر لباس
  • ورود یا خروج محصول
  • تغییر محیط
  • Morphing کنترل‌شده
  • ساخت Loop
  • حرکت میان دو زاویه

مثال:

فریم اول:
یک خیابان در روز.

فریم آخر:
همان خیابان در شب.

Prompt:
زمان به‌تدریج از عصر به شب تغییر کند. آسمان تاریک شود و
چراغ‌های ساختمان‌ها و خودروها به‌آرامی روشن شوند. معماری و
زاویه دوربین ثابت بمانند. هیچ ساختمان یا شیء جدیدی اضافه نشود.

برای Loop:

  • فریم اول و آخر یکسان یا بسیار نزدیک باشند.
  • حرکت وسط کلیپ نرم باشد.
  • Action پایان مشخصی نداشته باشد.
  • نور در ابتدا و پایان مشابه باشد.

فرمول پرامپت حرفه‌ای Image-to-Video

در Text-to-Video باید کل صحنه را توصیف کنید؛ اما در Image-to-Video بهتر است بیشتر روی حرکت تمرکز کنید.

قالب پیشنهادی:

[حرکت سوژه]
+ [حرکت اجزای محیط]
+ [حرکت دوربین]
+ [تغییر نور]
+ [سرعت]
+ [مواردی که باید ثابت بمانند]
+ [موارد ممنوع]

مثال:

شخصیت به‌آرامی سر خود را بالا بیاورد و به دوربین نگاه کند.
موها با نسیم ملایم حرکت کنند و نور پنجره کمی گرم‌تر شود.
دوربین با slow push-in نزدیک شود. حرکت طبیعی و ظریف باشد.
هویت چهره، لباس، پس‌زمینه و ترکیب‌بندی ثابت بمانند.
بدون تغییر صورت، بدون اضافه‌شدن شخص و بدون لرزش دوربین.

کلمات مهم حرکت دوربین

اصطلاحمفهوم
dolly-inحرکت دوربین به سمت سوژه
dolly-outدورشدن دوربین
pan leftچرخش افقی به چپ
pan rightچرخش افقی به راست
tilt upچرخش عمودی رو به بالا
tilt downچرخش رو به پایین
orbitحرکت دور سوژه
tracking shotدنبال‌کردن سوژه
crane shotحرکت عمودی یا قوسی
drone shotنمای هوایی
static cameraدوربین ثابت
handheldحرکت دوربین روی دست
rack focusانتقال فوکوس میان دو سوژه
push-inنزدیک‌شدن تدریجی
pull-outدورشدن تدریجی

برای Image-to-Video معمولاً حرکت‌های آرام مانند slow dolly-in، subtle orbit و gentle pan نتیجه باثبات‌تری دارند.

Negative Prompt مناسب

اگر مدل Negative Prompt دارد:

face distortion, identity change, extra fingers,
warped hands, flickering, jitter, morphing,
duplicate objects, text changes, logo changes,
camera shake, unnatural motion, new characters

اگر ندارد، محدودیت‌ها را داخل Prompt اصلی بنویسید:

چهره، دست‌ها، لباس، لوگو و نوشته‌ها تغییر نکنند.
هیچ شخص یا شیء جدیدی اضافه نشود. تصویر Flicker، Morph و
لرزش دوربین نداشته باشد.

رفع تغییر چهره در ویدئو

دلایل تغییر چهره:

  • عکس بی‌کیفیت
  • چرخش شدید سر
  • حرکت طولانی
  • نور بسیار متغیر
  • Occlusion
  • چند چهره در تصویر
  • انتخاب مدل نامناسب
  • Prompt متناقض

راهکارها:

  • استفاده از پرتره واضح
  • محدودکردن حرکت سر
  • کوتاه‌کردن کلیپ
  • انتخاب مدل دارای Character Reference
  • استفاده از چند تصویر مرجع
  • ثابت‌کردن نور
  • تولید جداگانه نماها
  • استفاده از Talking Avatar برای سخن‌گفتن
  • ویرایش نهایی چهره در ابزار تخصصی

رفع Flicker و لرزش

Flicker یعنی تغییر ناخواسته بافت، نور یا جزئیات میان فریم‌ها.

راهکارها:

  • Action ساده‌تر
  • دوربین آرام‌تر
  • Prompt کوتاه‌تر و دقیق‌تر
  • کاهش مدت کلیپ
  • استفاده از تصویر تمیز
  • حذف جزئیات ریز غیرضروری
  • مدل با Temporal Consistency بهتر
  • استفاده از ابزار Deflicker
  • تولید خروجی با نرخ فریم مناسب
  • انتخاب بهترین Take

رفع حرکت غیرطبیعی

حرکت غیرطبیعی معمولاً زمانی رخ می‌دهد که مدل باید هم‌زمان چند تعامل فیزیکی پیچیده ایجاد کند.

مثال دشوار:

شخصیت بدود، بپرد، یک لیوان بردارد، دور خود بچرخد و با فرد
دیگری دست بدهد.

آن را به Shotهای جدا تقسیم کنید:

  1. شخصیت وارد صحنه می‌شود.
  2. به سمت میز حرکت می‌کند.
  3. لیوان را برمی‌دارد.
  4. نمای نزدیک از چهره.
  5. نمای جداگانه دست‌دادن.

هر Shot باید یک Action اصلی داشته باشد.

تبدیل عکس به ویدئو رایگان است؟

بسیاری از ابزارها اعتبار آزمایشی یا پلن رایگان محدود دارند. محدودیت‌ها می‌توانند شامل موارد زیر باشند:

  • تعداد کم ویدئو
  • مدت کوتاه
  • رزولوشن پایین
  • واترمارک
  • صف انتظار
  • مدل Fast
  • عدم استفاده تجاری
  • محدودیت دانلود
  • نبود فریم آخر
  • نبود صدای بومی
  • نبود Private Mode

«رایگان» به معنی تولید نامحدود نیست؛ زیرا ساخت ویدئو به پردازش GPU زیادی نیاز دارد.

آیا تبدیل عکس قدیمی به ویدئو خطر دارد؟

خود متحرک‌سازی لزوماً خطرناک نیست، اما باید به این موارد توجه کرد:

  • رضایت صاحب تصویر
  • حریم خصوصی خانواده
  • جعل گفتار فرد
  • انتشار بدون زمینه
  • ساخت محتوای گمراه‌کننده
  • استفاده از عکس افراد درگذشته
  • بازنمایی نادرست وقایع تاریخی

اگر ویدئو ممکن است واقعی تصور شود، مشخص کنید که با هوش مصنوعی ساخته شده است.

قوانین استفاده از چهره افراد

پیش از ساخت Talking Photo یا Avatar:

  • رضایت فرد را دریافت کنید.
  • هدف استفاده را توضیح دهید.
  • از جعل گفتار خودداری کنید.
  • محتوای سیاسی، مالی یا پزشکی جعلی تولید نکنید.
  • از شبیه‌سازی افراد مشهور برای تبلیغ بدون مجوز پرهیز کنید.
  • فایل‌ها را امن نگهداری کنید.
  • امکان حذف داده را فراهم کنید.
  • خروجی AI را در کاربردهای حساس برچسب‌گذاری کنید.

صدای فرد نیز داده هویتی محسوب می‌شود و نباید بدون اجازه Clone شود.

API تبدیل عکس به ویدئو چیست؟

API Image-to-Video به یک سایت یا نرم‌افزار اجازه می‌دهد تصویر و Prompt را به مدل ارسال و ویدئوی نهایی را دریافت کند.

کاربردها:

  • ساخت ویدئوی محصول برای فروشگاه
  • متحرک‌سازی عکس کاربران
  • ایجاد Avatar
  • ساخت تبلیغ خودکار
  • تولید کلیپ شبکه اجتماعی
  • ویدئوی شخصی‌سازی‌شده
  • انیمیشن Concept Art
  • ابزار ساخت محتوا
  • SaaS تولید ویدئو
  • اتوماسیون کمپین تبلیغاتی

معماری پیشنهادی:

کاربر
    ↓
آپلود تصویر
    ↓
اعتبارسنجی و ذخیره امن
    ↓
ساخت Job
    ↓
API مدل Image-to-Video
    ↓
Polling یا Webhook
    ↓
ذخیره ویدئو در Object Storage
    ↓
تحویل نتیجه به کاربر

چرا تولید ویدئو Asynchronous است؟

ساخت ویدئو ممکن است چند ده ثانیه یا چند دقیقه طول بکشد. نگه‌داشتن یک درخواست HTTP تا پایان پردازش همیشه مناسب نیست.

بنابراین معمولاً ابتدا Job ساخته می‌شود:

{
  "id": "job_123",
  "status": "queued"
}

سپس وضعیت بررسی می‌شود:

GET /video-jobs/job_123

و در پایان:

{
  "id": "job_123",
  "status": "completed",
  "output_url": "https://cdn.example.com/videos/job_123.mp4"
}

Endpoint و ساختار دقیق پاسخ به مدل و ارائه‌دهنده بستگی دارند.

اتصال Python به API درواره

ابتدا SDK را نصب کنید:

pip install openai

ساخت Client:

import os

from openai import OpenAI


client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)

ساختار عمومی درخواست برای مدل‌های چندوجهی سازگار:

response = client.chat.completions.create(
    model=os.environ["DARVAREH_VIDEO_MODEL"],
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": (
                        "تصویر را به ویدئو تبدیل کن. دوربین با "
                        "حرکت بسیار آرام به محصول نزدیک شود. "
                        "شکل، لوگو و متن محصول تغییر نکنند."
                    ),
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": (
                            "https://example.com/product.jpg"
                        )
                    },
                },
            ],
        }
    ],
)

print(response)

ساختار دقیق درخواست، پارامترهای ویدئو و خروجی به مدل انتخابی بستگی دارند. برخی مدل‌ها از Endpoint اختصاصی Asynchronous استفاده می‌کنند.

پارامترهای احتمالی:

{
  "duration": 5,
  "aspect_ratio": "16:9",
  "resolution": "1080p",
  "generate_audio": false
}

این فیلدها برای همه مدل‌ها یکسان یا تضمین‌شده نیستند. مشخصات همان مدل را در فهرست و مستندات درواره بررسی کنید.

ارسال تصویر با Base64

برای تصویر خصوصی می‌توان در صورت پشتیبانی مدل از Base64 استفاده کرد:

import base64
from pathlib import Path


image_bytes = Path("product.jpg").read_bytes()
image_base64 = base64.b64encode(
    image_bytes
).decode("utf-8")

data_url = f"data:image/jpeg;base64,{image_base64}"

سپس:

{
    "type": "image_url",
    "image_url": {
        "url": data_url
    }
}

برای فایل‌های بزرگ، Base64 حجم درخواست را حدوداً افزایش می‌دهد. استفاده از URL امضاشده کوتاه‌مدت معمولاً کارآمدتر است.

اتصال JavaScript و Node.js

نصب SDK:

npm install openai

ساخت Client:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.DARVAREH_API_KEY,
  baseURL: "https://api.darvareh.ir/v1",
});

درخواست مفهومی:

const response =
  await client.chat.completions.create({
    model: process.env.DARVAREH_VIDEO_MODEL!,
    messages: [
      {
        role: "user",
        content: [
          {
            type: "text",
            text: [
              "این تصویر را به ویدئو تبدیل کن.",
              "دوربین با slow orbit دور محصول حرکت کند.",
              "لوگو، متن، رنگ و شکل محصول ثابت بمانند.",
            ].join(" "),
          },
          {
            type: "image_url",
            image_url: {
              url: "https://example.com/product.jpg",
            },
          },
        ],
      },
    ],
  });

console.log(response);

کلید API را در مرورگر، React Client Component یا متغیرهای NEXT_PUBLIC_ قرار ندهید. درخواست باید از Backend ارسال شود.

مدل داده پیشنهادی

CREATE TABLE image_to_video_jobs (
    id UUID PRIMARY KEY,
    user_id UUID NOT NULL,
    model VARCHAR(255) NOT NULL,
    prompt TEXT NOT NULL,

    input_image_url TEXT NOT NULL,
    input_image_storage_key TEXT,
    end_frame_url TEXT,

    status VARCHAR(30) NOT NULL,
    provider_job_id VARCHAR(255),
    progress INTEGER,

    duration_seconds NUMERIC(8, 2),
    aspect_ratio VARCHAR(20),
    resolution VARCHAR(30),
    generate_audio BOOLEAN NOT NULL DEFAULT FALSE,

    output_url TEXT,
    output_storage_key TEXT,
    thumbnail_url TEXT,

    cost_amount NUMERIC(18, 8),
    error_code VARCHAR(100),
    error_message TEXT,
    metadata JSONB NOT NULL DEFAULT '{}'::jsonb,

    idempotency_key VARCHAR(255),

    created_at TIMESTAMPTZ NOT NULL DEFAULT NOW(),
    started_at TIMESTAMPTZ,
    completed_at TIMESTAMPTZ,
    expires_at TIMESTAMPTZ
);

ایندکس جلوگیری از Job تکراری:

CREATE UNIQUE INDEX image_video_idempotency_idx
ON image_to_video_jobs (user_id, idempotency_key)
WHERE idempotency_key IS NOT NULL;

امنیت فایل آپلودشده

پیش از ارسال تصویر:

  • MIME Type واقعی را بررسی کنید.
  • فقط فرمت‌های مجاز را بپذیرید.
  • حجم فایل را محدود کنید.
  • ابعاد تصویر را بررسی کنید.
  • Metadata حساس را حذف کنید.
  • Malware Scan انجام دهید.
  • نام فایل را تصادفی کنید.
  • فایل را خارج از مسیر اجرایی ذخیره کنید.
  • URL کوتاه‌مدت بسازید.
  • مالکیت فایل را بررسی کنید.

فرمت‌های متداول:

JPEG
PNG
WebP

پذیرفتن SVG خام از کاربر می‌تواند ریسک امنیتی داشته باشد و نیازمند Sanitization تخصصی است.

جلوگیری از SSRF

اگر کاربر URL تصویر وارد می‌کند، نباید هر URL را مستقیماً از سرور دانلود کنید.

موارد مسدود:

  • localhost
  • 127.0.0.1
  • IPهای خصوصی
  • Cloud Metadata
  • شبکه داخلی
  • پروتکل‌های غیر HTTP/HTTPS
  • Redirect به مقصد داخلی
  • فایل بسیار بزرگ

بهتر است تصویر ابتدا از طریق Upload امن وارد Storage برنامه شود.

کاهش هزینه Image-to-Video

  • ابتدا تصویر مرجع را دقیق آماده کنید.
  • از Preview کم‌هزینه استفاده کنید.
  • ویدئو را کوتاه بسازید.
  • Action را ساده نگه دارید.
  • چند Variation محدود تولید کنید.
  • از مدل Fast برای آزمایش استفاده کنید.
  • رزولوشن نهایی را در مرحله آخر بسازید.
  • نتیجه موفق را ذخیره کنید.
  • Idempotency Key داشته باشید.
  • برای هر کاربر سقف مصرف تعیین کنید.
  • هم‌زمانی Jobها را محدود کنید.
  • پیش از تولید هزینه تقریبی را نمایش دهید.

چک‌لیست انتخاب عکس مناسب

  • سوژه واضح است.
  • عکس تار نیست.
  • رزولوشن کافی دارد.
  • نور متعادل است.
  • چهره پوشیده نیست.
  • محصول کامل دیده می‌شود.
  • متن‌های محصول خوانا هستند.
  • پس‌زمینه بیش از حد شلوغ نیست.
  • نسبت تصویر به خروجی نزدیک است.
  • مجوز استفاده از تصویر وجود دارد.
  • اطلاعات حساس داخل Metadata نیست.
  • حرکت موردنظر با زاویه عکس سازگار است.

مثلاً نمی‌توان از یک عکس کاملاً روبه‌رو انتظار داشت مدل بدون تخمین و ساخت جزئیات جدید، دوربین را ۱۸۰ درجه پشت سوژه ببرد.

چک‌لیست کنترل خروجی

  • چهره تغییر نکرده است.
  • چشم و دهان طبیعی هستند.
  • دست‌ها سالم‌اند.
  • محصول تغییر شکل نداده است.
  • لوگو و متن ثابت‌اند.
  • شیء تکراری وجود ندارد.
  • نور Flicker ندارد.
  • حرکت دوربین نرم است.
  • فریم‌ها Morph نمی‌شوند.
  • صدای تولیدشده هماهنگ است.
  • Lip Sync بررسی شده است.
  • واترمارک وجود ندارد یا مطابق مجوز است.
  • شرایط استفاده تجاری رعایت شده است.
  • خروجی AI در کاربردهای حساس مشخص شده است.

پرسش‌های متداول

بهترین هوش مصنوعی تبدیل عکس به ویدئو چیست؟

Kling AI، Seedance، Veo، Runway، Luma Dream Machine، Pika، Adobe Firefly و Hailuo از گزینه‌های مهم‌اند. برای Talking Photo نیز HeyGen و D-ID مناسب‌تر هستند.

چگونه عکس را رایگان به ویدئو تبدیل کنیم؟

یکی از ابزارهای دارای Credit رایگان را انتخاب، تصویر را آپلود و حرکت موردنظر را با Prompt تعریف کنید. پلن رایگان معمولاً محدودیت تعداد، رزولوشن، مدت یا واترمارک دارد.

چگونه عکس قدیمی را زنده کنیم؟

ابتدا تصویر را ترمیم و Upscale کنید، سپس حرکات محدود مانند پلک‌زدن، نفس‌کشیدن و حرکت ظریف سر را درخواست کنید. از Action پیچیده خودداری کنید.

چگونه عکس را به ویدئوی حرف‌زن تبدیل کنیم؟

از ابزار Talking Avatar مانند HeyGen یا D-ID استفاده کنید. عکس چهره را وارد و متن یا فایل صوتی را انتخاب کنید تا حرکت لب و صورت تولید شود.

چگونه چهره را در ویدئو ثابت نگه داریم؟

از عکس واضح، Character Reference، حرکت کوتاه، نور ثابت و Prompt محدود استفاده کنید. چرخش شدید سر و Action پیچیده احتمال تغییر چهره را افزایش می‌دهند.

چگونه عکس محصول را به تبلیغ تبدیل کنیم؟

از عکس تمیز محصول، حرکت آرام دوربین و Prompt دقیق استفاده کنید. لوگو و متن‌های مهم را در Post-production اضافه یا کنترل کنید.

First Frame و Last Frame چیست؟

دو تصویر، نقطه شروع و پایان ویدئو را مشخص می‌کنند و مدل انتقال میان آن‌ها را تولید می‌کند. این قابلیت برای تغییر زمان، محیط، زاویه یا ساخت Loop کاربرد دارد.

آیا می‌توان با یک عکس ویدئوی طولانی ساخت؟

امکان تولید یا Extend وجود دارد، اما کلیپ طولانی احتمال تغییر سوژه و محیط را افزایش می‌دهد. نتیجه بهتر معمولاً از چند Shot کوتاه و تدوین آن‌ها ساخته می‌شود.

آیا استفاده تجاری از ویدئو مجاز است؟

به ابزار، مدل، پلن و حقوق تصویر ورودی بستگی دارد. شرایط استفاده تجاری و رضایت صاحب چهره را بررسی کنید.

API تبدیل عکس به ویدئو چیست؟

API Image-to-Video به نرم‌افزار اجازه می‌دهد تصویر و Prompt را به مدل ارسال و خروجی ویدئویی دریافت کند.

چگونه API تبدیل عکس به ویدئو دریافت کنیم؟

در درواره ثبت‌نام کنید، کلید API بسازید و مدل ویدئویی موردنظر را از طریق آدرس پایه زیر فراخوانی کنید:

https://api.darvareh.ir/v1

جمع‌بندی

تبدیل عکس به ویدئو با هوش مصنوعی راهی سریع برای ساخت محتوای متحرک از عکس چهره، محصول، معماری، تصویرسازی یا عکس‌های قدیمی است.

برای انتخاب ابزار:

  • Kling AI برای حرکت سینمایی و فریم اول و آخر
  • Seedance برای ورودی چندمرجعی و کنترل حرفه‌ای
  • Veo برای حرکت واقع‌گرایانه و صدای هماهنگ
  • Runway برای Workflow حرفه‌ای و ویرایش
  • Luma برای حرکت نرم و سینمایی
  • Pika برای کلیپ کوتاه و افکت
  • Firefly برای کاربران Adobe
  • HeyGen برای آواتار سخنگو
  • D-ID برای Talking Portrait
  • API درواره برای اتصال به نرم‌افزار

برای رسیدن به نتیجه خوب:

  1. عکس باکیفیت انتخاب کنید.
  2. حرکت را ساده و دقیق تعریف کنید.
  3. مشخص کنید چه چیزهایی باید ثابت بمانند.
  4. از کلیپ‌های کوتاه استفاده کنید.
  5. خروجی را از نظر چهره، دست، لوگو و Flicker بررسی کنید.
  6. متن و برند را در تدوین نهایی اضافه کنید.
  7. حقوق تصویر و رضایت افراد را رعایت کنید.

دسترسی به مدل‌های Image-to-Video با API درواره

درواره دسترسی API به مدل‌های مختلف هوش مصنوعی را برای توسعه‌دهندگان و کسب‌وکارهای ایرانی فراهم می‌کند.

با API درواره می‌توانید:

  • تبدیل عکس به ویدئو را به سایت اضافه کنید.
  • ویدئوی محصول تولید کنید.
  • Workflow تولید محتوا بسازید.
  • مدل‌های مختلف را مقایسه کنید.
  • مدل Fast یا Pro را براساس نیاز انتخاب کنید.
  • هزینه را به‌صورت ریالی پرداخت کنید.
  • کلید و مصرف API را مدیریت کنید.
  • معماری Multi-Model بسازید.
  • در صورت توقف یک مدل، به مدل دیگری مهاجرت کنید.

آدرس پایه:

https://api.darvareh.ir/v1

نمونه Client:

from openai import OpenAI

client = OpenAI(
    api_key="DARVAREH_API_KEY",
    base_url="https://api.darvareh.ir/v1",
)

شناسه مدل، Endpoint، ورودی‌های مرجع، مدت، رزولوشن و ساختار خروجی را براساس مشخصات مدل انتخابی در درواره تنظیم کنید.

مقالات مرتبط

Read more