Kling AI چیست؟ آموزش کامل ساخت ویدئو با هوش مصنوعی Kling 3.0

Kling AI ابزار قدرتمند ساخت ویدئو با هوش مصنوعی است. در این راهنما با Kling 3.0، تبدیل متن و عکس به ویدئو، تولید صدا، ثبات شخصیت و اصول پرامپت‌نویسی حرفه‌ای آشنا می‌شوید.

Share
Kling AI چیست؟ آموزش کامل ساخت ویدئو با هوش مصنوعی Kling 3.0

تا چند سال قبل برای ساخت یک ویدئوی تبلیغاتی کوتاه به دوربین، نورپردازی، بازیگر، لوکیشن، تدوینگر و بودجه قابل‌توجهی نیاز داشتیم. اکنون مدل‌های تولید ویدئو با هوش مصنوعی می‌توانند فقط با یک توضیح متنی یا تصویر ثابت، نماهای متحرک و نسبتاً واقع‌گرایانه تولید کنند.

یکی از شناخته‌شده‌ترین مدل‌های این حوزه Kling AI یا هوش مصنوعی کلینگ است. Kling ابتدا به‌عنوان یک مدل تبدیل متن و عکس به ویدئو مطرح شد، اما نسل جدید آن مجموعه‌ای از قابلیت‌های تولید، درک و ویرایش ویدئو را در یک محیط چندوجهی ارائه می‌کند.

Kling AI 3.0 می‌تواند از متن، تصویر، ویدئو و صدا استفاده کند، کلیپ‌های چندنمایی بسازد، شخصیت‌ها و محصولات را میان نماها ثابت نگه دارد و در برخی حالت‌ها صدا و تصویر را هم‌زمان تولید کند.

در این راهنما به‌صورت عملی بررسی می‌کنیم:

  • Kling AI چیست؟
  • Kling 3.0 چه قابلیت‌هایی دارد؟
  • چگونه با متن یا عکس ویدئو بسازیم؟
  • تفاوت حالت‌های Video 3.0 و Video 3.0 Omni چیست؟
  • چگونه پرامپت حرفه‌ای بنویسیم؟
  • چطور حرکت دوربین و ثبات شخصیت را کنترل کنیم؟
  • Kling برای تولید محتوا، تبلیغات و فروشگاه اینترنتی چه کاربردی دارد؟
  • برای دریافت خروجی بهتر باید از چه گردش کاری استفاده کنیم؟
  • توسعه‌دهندگان چگونه یک سرویس تولید ویدئو مبتنی بر API می‌سازند؟

Kling AI چیست؟

Kling AI یک پلتفرم و خانواده مدل‌های مولد تصویر و ویدئو است که توسط شرکت چینی Kuaishou Technology توسعه پیدا کرده است.

این پلتفرم در ژوئن ۲۰۲۴ عرضه شد و در ابتدا به دلیل کیفیت حرکت، تبدیل عکس به ویدئو و تولید صحنه‌های واقع‌گرایانه مورد توجه قرار گرفت. Kling پس از عرضه اولیه، نسخه‌ها و قابلیت‌های متعددی برای تولید و ویرایش محتوا دریافت کرد.

نسخه‌های جدید Kling فقط یک تصویر متحرک تولید نمی‌کنند. این مدل‌ها می‌توانند موارد زیر را مدیریت کنند:

  • تبدیل متن به ویدئو
  • تبدیل عکس به ویدئو
  • استفاده از تصویر مرجع
  • استفاده از ویدئوی مرجع
  • تولید چند نمای متوالی
  • کنترل شخصیت و سوژه
  • ویرایش عناصر داخل ویدئو
  • تولید هم‌زمان صوت و تصویر
  • ساخت تصویر با هوش مصنوعی
  • تولید محتوای مناسب تبلیغات و شبکه‌های اجتماعی

نسخه فعلی این خانواده Kling AI 3.0 است که در فوریه ۲۰۲۶ معرفی شد. شرکت Kuaishou اعلام کرده است که خانواده Kling 3.0 شامل مدل‌های Video 3.0، Video 3.0 Omni، Image 3.0 و Image 3.0 Omni می‌شود. این مجموعه از ورودی و خروجی چندوجهی شامل متن، تصویر، صدا و ویدئو پشتیبانی می‌کند. جزئیات آن در اطلاعیه رسمی Kling AI 3.0 منتشر شده است.

Kling AI متعلق به کدام شرکت است؟

Kling AI محصول شرکت Kuaishou Technology است. Kuaishou یکی از شرکت‌های بزرگ فعال در حوزه ویدئوی کوتاه، شبکه‌های اجتماعی، تجارت الکترونیک و هوش مصنوعی محسوب می‌شود.

نام چینی Kling به‌شکل 可灵 نوشته می‌شود و ممکن است در برخی منابع فارسی با عنوان‌های «کلینگ»، «کلینگ ای‌آی» یا «هوش مصنوعی Kling» دیده شود.

Kling با تکیه بر تجربه Kuaishou در پردازش ویدئو و محتوای کاربرمحور توسعه یافته و کاربردهای آن از ساخت کلیپ شخصی تا تولید محتوای تبلیغاتی، انیمیشن، بازی و فیلم گسترش پیدا کرده است.

براساس گزارش رسمی Kuaishou، Kling AI در سه‌ماهه اول ۲۰۲۶ بیش از ۶۵۰ میلیون یوان درآمد کسب کرده و رشد سالانه درآمد آن از ۳۰۰ درصد عبور کرده است. این آمار نشان می‌دهد Kling از یک نمایش فنی فراتر رفته و به یک محصول تجاری جدی در بازار تولید محتوای هوش مصنوعی تبدیل شده است. اطلاعات بیشتر در گزارش سه‌ماهه اول ۲۰۲۶ Kuaishou در دسترس است.

تاریخچه نسخه‌های Kling AI

شناخت نسخه‌ها کمک می‌کند هنگام استفاده از Kling بدانیم هر قابلیت از کدام نسل مدل ارائه شده است.

Kling 1.x

نسخه‌های اولیه Kling بیشتر روی موارد زیر تمرکز داشتند:

  • تبدیل متن به ویدئو
  • تبدیل تصویر به ویدئو
  • حرکت طبیعی سوژه
  • کنترل ابتدایی دوربین
  • افزایش وضوح خروجی
  • ساخت کلیپ‌های کوتاه واقع‌گرایانه

یکی از نقاط قوت Kling در نسل اول، حرکت‌های بزرگ‌تر و پویاتر در مقایسه با بسیاری از مدل‌های ویدئوساز آن زمان بود.

Kling 2.0

Kling 2.0 در آوریل ۲۰۲۵ معرفی شد و کیفیت حرکت، زیبایی بصری و درک دستور را بهبود داد.

در این نسل، کاربر می‌توانست با دقت بیشتری مشخص کند:

  • سوژه چه حرکتی انجام دهد؟
  • دوربین چگونه جابه‌جا شود؟
  • فضای بصری چه سبکی داشته باشد؟
  • تصویر مرجع چگونه متحرک شود؟
  • عناصر صحنه چه ارتباطی با یکدیگر داشته باشند؟

Kling 2.1

نسخه 2.1 حالت‌های Standard و High Quality را ارائه کرد. حالت Standard برای تولید اقتصادی‌تر و سریع‌تر و حالت High Quality برای خروجی با جزئیات بیشتر طراحی شده بود.

Kuaishou همچنین نسخه Master را برای کیفیت حرکت و پیروی بهتر از دستور ارائه کرد. طبق گزارش اولین سال فعالیت Kling AI، نسخه Kling 2.1 در حالت استاندارد خروجی 720p و در حالت باکیفیت خروجی 1080p ارائه می‌کرد.

Kling Video 2.6

Kling 2.6 قابلیت Native Audio-Visual Generation را اضافه کرد. در این روش، مدل می‌توانست صدا و تصویر را در یک فرایند هماهنگ تولید کند.

این قابلیت برای موارد زیر اهمیت داشت:

  • دیالوگ شخصیت‌ها
  • هماهنگی لب با گفتار
  • صدای محیط
  • افکت‌های صوتی
  • موسیقی
  • هماهنگی صدا با رویدادهای تصویری

Kling Video O1

مدل Kling Video O1 در دسامبر ۲۰۲۵ معرفی شد. هدف آن یکپارچه‌کردن تولید و ویرایش ویدئو در یک معماری چندوجهی بود.

Kling O1 می‌توانست متن، تصویر، ویدئو و سوژه مرجع را در یک گردش کار واحد ترکیب کند. طبق معرفی رسمی Kling O1، این مدل برای بهبود ثبات شخصیت، صحنه و عناصر بصری طراحی شده است.

Kling AI 3.0

Kling 3.0 در فوریه ۲۰۲۶ به‌صورت جهانی عرضه شد. این خانواده چهار مدل اصلی دارد:

  • Kling Video 3.0
  • Kling Video 3.0 Omni
  • Kling Image 3.0
  • Kling Image 3.0 Omni

نسخه 3.0 روی روایت چندنمایی، تولید صدای بومی، ثبات عناصر، کنترل نما و ترکیب ورودی‌های مختلف تمرکز دارد.

قابلیت‌های اصلی Kling Video 3.0

تبدیل متن به ویدئو

در حالت Text to Video فقط یک توضیح متنی وارد می‌کنید و مدل کل صحنه را می‌سازد.

مدل باید از Prompt متوجه شود:

  • شخصیت یا سوژه چیست؟
  • چه اتفاقی می‌افتد؟
  • محیط کجاست؟
  • دوربین چگونه حرکت می‌کند؟
  • نورپردازی چگونه است؟
  • خروجی چه سبک بصری دارد؟
  • چه صدایی شنیده می‌شود؟
  • کدام اجزا باید ثابت بمانند؟

نمونه ساده:

A cinematic shot of a small red vintage car driving through a quiet
mountain road at sunrise. The camera follows the car from a low rear angle.
Soft morning fog, golden sunlight, realistic motion and natural road ambience.

تبدیل عکس به ویدئو

Image to Video یکی از پرکاربردترین قابلیت‌های Kling AI است. در این حالت، تصویر آغازین را وارد و حرکت موردنظر را توصیف می‌کنید.

برای مثال:

Preserve the exact appearance of the supplied portrait.
The character slowly turns toward the camera and smiles naturally.
A gentle breeze moves her hair. The camera performs a subtle dolly-in.
Soft daylight, realistic facial movement, no scene transition.

مدل از تصویر برای ظاهر سوژه، ترکیب‌بندی و فضای صحنه استفاده می‌کند و Prompt مشخص می‌کند چه چیزی باید تغییر کند.

ساخت ویدئو با سوژه مرجع

در Kling 3.0 می‌توان یک Element یا Subject مرجع تعریف کرد. هدف این قابلیت، ثابت نگه‌داشتن شخصیت یا شیء در نماهای مختلف است.

این قابلیت برای موارد زیر مفید است:

  • شخصیت ثابت یک مجموعه ویدئویی
  • سفیر مجازی برند
  • محصول مشخص
  • کاراکتر انیمیشنی
  • حیوان یا موجود خیالی
  • وسیله نقلیه
  • محیط ثابت

در راهنمای رسمی Kling 3.0 توضیح داده شده است که اتصال Subject به ویدئو می‌تواند ظاهر و حتی صدای مرتبط با آن را در طول تولید ثابت‌تر نگه دارد. راهنمای Kling Video 3.0 جزئیات این قابلیت را شرح می‌دهد.

تولید ویدئوی چندنمایی

Kling Video 3.0 از Multi-Shot Generation پشتیبانی می‌کند. کاربر می‌تواند اجازه دهد مدل نماها را به‌صورت خودکار برنامه‌ریزی کند یا در حالت Custom Multi-Shot جزئیات هر نما را بنویسد.

برای مثال:

Create a coherent four-shot commercial sequence.

Shot 1: Wide shot of a modern kitchen in soft morning light.
Shot 2: Medium shot of a woman placing a coffee capsule into the machine.
Shot 3: Extreme close-up of coffee pouring into a glass cup.
Shot 4: Product hero shot with the machine and cup centered on the counter.

Maintain the same woman, outfit, kitchen layout, coffee machine and lighting
across all shots. Use smooth cuts and realistic synchronized sound.

اگر مدل یا رابط اجازه تعیین زمان هر نما را بدهد، می‌توان Shot List را دقیق‌تر نوشت:

Shot 1 — 0 to 3 seconds
Shot 2 — 3 to 7 seconds
Shot 3 — 7 to 11 seconds
Shot 4 — 11 to 15 seconds

تولید ویدئو تا ۱۵ ثانیه

Kling Video 3.0 می‌تواند ویدئوهایی با مدت انعطاف‌پذیر بین ۳ تا ۱۵ ثانیه تولید کند.

افزایش مدت به ۱۵ ثانیه به معنای امکان اجرای روایت پیچیده‌تر است، اما همیشه نباید حداکثر زمان را انتخاب کرد. برای یک حرکت ساده محصول، کلیپ ۵ ثانیه‌ای ممکن است نتیجه پایدارتر و اقتصادی‌تری ایجاد کند.

زمان طولانی‌تر زمانی مفید است که:

  • چند حرکت پشت سر هم دارید.
  • دیالوگ کوتاه وجود دارد.
  • نماهای متعدد نیاز دارید.
  • تغییر تدریجی صحنه مهم است.
  • داستان کوچک و مشخصی روایت می‌کنید.

تولید هم‌زمان صدا و تصویر

Native Audio یکی از قابلیت‌های مهم Kling 3.0 است. مدل می‌تواند همراه با تصویر، موارد زیر را نیز تولید کند:

  • دیالوگ
  • صدای محیط
  • افکت صوتی
  • موسیقی پس‌زمینه
  • صدای حرکت
  • واکنش‌های صوتی
  • صدای متناسب با فضای صحنه

نمونه:

A quiet bakery early in the morning. The baker places a tray of fresh bread
on the wooden counter. Warm sunlight enters through the window.

Audio: gentle bakery ambience, subtle tray movement, soft crackling from
fresh bread and distant morning street sounds. No music and no narration.

تولید مشترک صدا و تصویر می‌تواند هماهنگی زمانی را بهتر کند؛ برای مثال صدای بسته‌شدن در دقیقاً با حرکت آن هم‌زمان شود.

دیالوگ چند شخصیت

Kling 3.0 می‌تواند دیالوگ را به شخصیت‌های مختلف نسبت دهد. برای کاهش جابه‌جایی گوینده‌ها، نام یا مشخصات هر شخصیت را به‌وضوح بنویسید.

Two colleagues are standing beside a whiteboard in a modern office.

Sara, the woman wearing a blue jacket, says in a calm tone:
"We should simplify the onboarding process."

Amir, the man wearing a gray shirt, responds:
"I agree. Let's begin with the registration form."

Maintain the identity and voice of each character.
Only the specified character should speak each line.

طبق اعلام رسمی، تولید صدای بومی Kling 3.0 از زبان‌های چینی، انگلیسی، ژاپنی، کره‌ای و اسپانیایی و چند لهجه پشتیبانی می‌کند. فارسی در فهرست رسمی اعلام‌شده قرار ندارد؛ بنابراین برای دیالوگ فارسی باید خروجی را آزمایش یا صدا را جداگانه تولید و در مرحله تدوین اضافه کنید.

کنترل صدا و لحن شخصیت

در صورت پشتیبانی رابط مورد استفاده، می‌توان Subject را به صدای مشخصی متصل کرد. این ویژگی برای حفظ Voice Consistency در مجموعه‌ای از ویدئوها کاربرد دارد.

اگر صدا از قبل به شخصیت متصل شده باشد، بهتر است Prompt جدید ویژگی‌های صوتی متناقضی تعریف نکند.

حفظ نوشته و لوگو

Kling 3.0 برای تشخیص و حفظ نوشته‌های موجود در تصویر مرجع بهبود یافته است. این قابلیت برای تبلیغات محصول، بسته‌بندی، تابلو و محتوای فروشگاهی مهم است.

بااین‌حال، هیچ مدل مولدی را نباید برای حفظ صددرصدی نوشته، لوگو یا اطلاعات حساس محصول بدون کنترل انسانی قابل‌اعتماد دانست. پس از تولید، موارد زیر را فریم‌به‌فریم بررسی کنید:

  • املای نام برند
  • لوگو
  • متن بسته‌بندی
  • قیمت
  • اعداد
  • علائم نگارشی
  • اطلاعات تماس
  • تناسب محصول

برای اطمینان بیشتر، متن و CTA را در نرم‌افزار تدوین اضافه کنید.

ویرایش ویدئو

مدل‌های Omni و O1 مفهوم تولید و ویرایش را به یک گردش کار نزدیک کرده‌اند. به‌جای تولید همه‌چیز از ابتدا می‌توان یک ویدئوی موجود را وارد و تغییر مشخصی درخواست کرد.

نمونه دستورات ویرایشی:

Replace the red car with the supplied black electric car.
Preserve the original camera movement, road, lighting and timing.
Change the scene from daytime to a rainy evening.
Keep the actor, performance and camera motion unchanged.
Remove the chair from the background.
Preserve the person and all foreground elements.

کیفیت و در دسترس بودن هر نوع ویرایش به مدل، حساب و رابطی که استفاده می‌کنید بستگی دارد.

تفاوت Kling Video 3.0 و Kling Video 3.0 Omni

Kling Video 3.0 برای تولید ویدئو با تمرکز بر روایت، ثبات عنصر، تصویر مرجع، صدای بومی و کنترل چندنما طراحی شده است.

نسخه Omni دامنه گسترده‌تری از ورودی‌ها و وظایف را در یک معماری یکپارچه ترکیب می‌کند. در کاربردهای پیچیده‌تر، Omni می‌تواند برای گردش کاری شامل درک، تولید و ویرایش مناسب‌تر باشد.

به‌طور ساده:

نیازانتخاب احتمالی
تبدیل متن به ویدئوVideo 3.0
تبدیل عکس به ویدئوVideo 3.0
کلیپ چندنماییVideo 3.0
ثبات شخصیت مرجعVideo 3.0 یا Omni
ترکیب چند نوع ورودیOmni
ویرایش ویدئوی موجودOmni
گردش کار چندمرحله‌ای تولید و اصلاحOmni

این انتخاب قطعی نیست. گزینه‌ها، قیمت و قابلیت‌های فعال ممکن است در نسخه‌های مختلف محصول تغییر کنند.

آموزش ساخت ویدئو با Kling AI

مرحله اول: حساب کاربری بسازید

وارد وب‌سایت یا اپلیکیشن رسمی Kling AI شوید و حساب کاربری ایجاد کنید. روش ثبت‌نام و دسترسی ممکن است براساس کشور، نسخه محصول و سیاست‌های سرویس متفاوت باشد.

از وب‌سایت‌ها و اپلیکیشن‌های غیررسمی که نام Kling را استفاده می‌کنند با احتیاط استفاده کنید.

مرحله دوم: بخش AI Videos را انتخاب کنید

در محیط تولید ویدئو معمولاً گزینه‌هایی مانند این موارد دیده می‌شوند:

  • Text to Video
  • Image to Video
  • Multi-Shot
  • Elements
  • Native Audio
  • Video Editing
  • Model Version
  • Aspect Ratio
  • Duration
  • Resolution

مرحله سوم: نسخه مدل را تعیین کنید

در صورت دسترسی، Kling Video 3.0 یا مدل متناسب با نیازتان را انتخاب کنید.

برای آزمون‌های اولیه، حالت سریع یا وضوح پایین‌تر می‌تواند هزینه کمتری داشته باشد. بعد از نهایی‌شدن Prompt، خروجی باکیفیت‌تر را تولید کنید.

مرحله چهارم: روش تولید را انتخاب کنید

اگر ظاهر صحنه هنوز مشخص نیست، Text to Video مناسب است.

اگر چهره، محصول یا ترکیب‌بندی مشخصی دارید، از Image to Video استفاده کنید.

اگر چند شخصیت و فایل مرجع دارید یا قصد ویرایش ویدئو را دارید، قابلیت‌های Element Reference یا Omni مناسب‌ترند.

مرحله پنجم: Prompt را وارد کنید

Prompt باید حرکت، دوربین و محدودیت‌ها را توضیح دهد؛ نه اینکه فقط محتوای تصویر را تکرار کند.

مرحله ششم: نسبت تصویر را انتخاب کنید

نسبت تصویر باید براساس محل انتشار باشد:

  • 9:16 برای Reels، Shorts و استوری
  • 16:9 برای یوتیوب، وب‌سایت و نمایشگر
  • 1:1 برای پست مربعی
  • 4:5 برای برخی پست‌های شبکه‌های اجتماعی
  • 21:9 برای نمای سینمایی عریض

اگر نسبت تصویر را بعداً با Crop تغییر دهید، ممکن است بخشی از سوژه حذف شود. بهتر است از ابتدا خروجی مناسب پلتفرم تولید شود.

مرحله هفتم: مدت و کیفیت را تنظیم کنید

برای آزمون Prompt، از مدت کوتاه و تنظیمات اقتصادی‌تر شروع کنید. پس از رسیدن به نتیجه مناسب، نسخه نهایی را با کیفیت بیشتر بسازید.

مرحله هشتم: خروجی را بررسی کنید

فقط فریم اول و آخر را نبینید. کل ویدئو را چند بار پخش و این موارد را بررسی کنید:

  • تغییر چهره
  • دست و انگشت
  • شکل اشیا
  • جهت حرکت
  • پرش دوربین
  • نوشته‌ها
  • هماهنگی لب و صدا
  • ناپدیدشدن عناصر
  • نور و سایه
  • پیوستگی نماها
  • کیفیت صوت

ساختار استاندارد Prompt برای Kling AI

یک Prompt حرفه‌ای می‌تواند از این ساختار پیروی کند:

Subject
+ Environment
+ Action
+ Camera
+ Lighting
+ Visual Style
+ Audio
+ Continuity
+ Constraints

معادل فارسی:

سوژه
+ محیط
+ حرکت
+ دوربین
+ نورپردازی
+ سبک بصری
+ صدا
+ پیوستگی
+ محدودیت‌ها

بخش اول پرامپت: سوژه

سوژه را واضح، کوتاه و قابل‌تشخیص معرفی کنید.

ضعیف:

یک مرد در دفتر

بهتر:

A young product designer with short dark hair, wearing a navy shirt,
sitting at a clean wooden desk

اگر از تصویر مرجع استفاده می‌کنید، لازم نیست ویژگی‌هایی را بنویسید که با تصویر تناقض دارند. بیشتر روی ثبات هویت تأکید کنید:

Preserve the exact identity, face, hairstyle and clothing of the reference person.

بخش دوم: محیط

محیط فقط نام مکان نیست. زمان، هوا، بافت، پس‌زمینه و عناصر مهم را نیز مشخص کنید.

A quiet modern office at sunset, warm light entering through large windows,
subtle city lights in the background, clean minimalist interior

بخش سوم: حرکت

حرکت را به ترتیب زمانی بنویسید:

She closes the laptop, stands up slowly, picks up the notebook
and walks toward the window.

حرکت‌های بیش از حد زیاد را به چند نما تقسیم کنید.

بخش چهارم: دوربین

حرکت دوربین نقش مهمی در کیفیت خروجی دارد.

اصطلاحات کاربردی:

  • Static shot: دوربین ثابت
  • Dolly in: نزدیک‌شدن دوربین
  • Dolly out: دورشدن
  • Tracking shot: دنبال‌کردن سوژه
  • Pan: چرخش افقی دوربین
  • Tilt: چرخش عمودی
  • Orbit: حرکت دور سوژه
  • Crane shot: حرکت عمودی گسترده
  • Handheld: دوربین روی دست
  • Gimbal shot: حرکت نرم و پایدار
  • Close-up: نمای نزدیک
  • Medium shot: نمای متوسط
  • Wide shot: نمای باز
  • Macro shot: نمای بسیار نزدیک
  • Over-the-shoulder: پشت شانه
  • POV: زاویه دید شخصیت
  • Rack focus: جابه‌جایی نقطه فوکوس

نمونه:

The camera begins with a macro shot of the watch face,
then slowly pulls back and performs a controlled 30-degree orbit.

بخش پنجم: نورپردازی

به‌جای نوشتن «نور زیبا»، نوع نور را تعیین کنید:

Soft diffused studio lighting with a narrow rim light behind the product
Warm golden-hour sunlight with long soft shadows
Low-key cinematic lighting with subtle blue practical lights

بخش ششم: سبک بصری

سبک باید با هدف ویدئو مرتبط باشد:

  • Cinematic
  • Photorealistic
  • Documentary
  • Luxury commercial
  • UGC
  • Stop motion
  • Anime
  • 3D animation
  • Hand-drawn illustration
  • Retro film
  • Minimal product photography
  • Fantasy
  • Cyberpunk

از ترکیب چند سبک متناقض خودداری کنید.

بخش هفتم: صدا

صدا را به اجزای جداگانه تقسیم کنید:

Ambient sound: quiet morning street and distant birds.
Sound effects: natural footsteps and door opening.
Music: soft minimal piano.
Dialogue: none.

برای جلوگیری از تولید گفتار ناخواسته بنویسید:

No dialogue, no narration and no vocals.

بخش هشتم: محدودیت‌ها

محدودیت‌های مهم را صریح بیان کنید:

Keep the product shape, label and logo unchanged.
Maintain the same character throughout all shots.
No duplicated objects.
No sudden camera shake.
No generated captions or subtitles.

برخی نسخه‌ها ممکن است بخش Negative Prompt جداگانه داشته باشند، اما محدودیت‌های حیاتی را در Prompt اصلی نیز ذکر کنید.

نمونه پرامپت کامل برای ویدئوی تبلیغاتی ساعت

Create a premium cinematic commercial for the supplied wristwatch.

Shot 1:
Extreme macro shot of the watch hands moving across the textured black dial.

Shot 2:
The camera slowly pulls back as a narrow beam of light reveals the metal case
and leather strap.

Shot 3:
A controlled orbit shot around the watch placed on dark polished stone.

Black and silver color palette, luxury product cinematography,
shallow depth of field, realistic metal reflections and precise focus.

Audio: subtle mechanical ticking, soft atmospheric bass and no narration.

Preserve the exact watch design, brand logo, dial markings, strap and proportions.
No extra products, no hands, no distorted text and no sudden camera movement.

نمونه پرامپت تبدیل عکس لباس به ویدئو

Animate the supplied fashion image while preserving the model's identity,
face, body proportions and exact outfit.

The model takes two slow steps forward, pauses and turns slightly to the left.
The fabric moves naturally with her body. The camera tracks backward smoothly
in a medium full-body shot.

Minimal studio background, soft diffused light, realistic fashion campaign,
natural motion and accurate fabric physics.

No outfit transformation, no face change, no extra accessories,
no scene transition and no generated text.

نمونه پرامپت برای تبلیغ رستوران

Create a 10-second cinematic food commercial.

Shot 1:
Macro close-up of saffron rice with natural steam rising from the plate.

Shot 2:
A chef's hand places grilled chicken beside the rice.

Shot 3:
Slow overhead shot revealing the complete Persian table setting.

Warm restaurant lighting, rich realistic food textures,
premium commercial look and smooth controlled motion.

Audio: subtle restaurant ambience, natural serving sounds and gentle music.
Do not change the food between shots. No text, no logo and no distorted hands.

نمونه پرامپت برای فروشگاه اینترنتی

Create a vertical 9:16 social media advertisement using the supplied product image.

Shot 1:
The skincare bottle stands on a clean white platform as soft light moves across it.

Shot 2:
Water droplets float briefly around the bottle and settle naturally on the surface.

Shot 3:
Final centered hero shot with empty space above and below for adding Persian text.

Bright minimal commercial style, white and light-blue palette,
realistic glass and liquid, smooth camera motion.

Keep the bottle, cap, label, logo, colors and proportions exactly unchanged.
No generated text, no hands and no additional products.

نمونه پرامپت برای معماری

Transform the supplied interior render into a realistic architectural walkthrough.

The camera begins at the entrance and moves slowly into the living room,
then pans gently toward the floor-to-ceiling windows.

Preserve the exact room dimensions, furniture placement, materials,
windows and architectural layout.

Late-afternoon natural light, realistic global illumination,
soft shadows, stable gimbal movement and premium architectural visualization.

No people, no furniture changes, no fisheye distortion and no scene transition.

نمونه پرامپت برای ویدئوی UGC

UGC یا User-Generated Content باید طبیعی‌تر از تبلیغ استودیویی به نظر برسد.

A realistic vertical UGC video recorded in a bright home office.

A young woman holds the supplied product near the camera, points to its packaging
and reacts with a natural smile. Slight handheld smartphone movement,
authentic room lighting and casual social media style.

She does not speak. Include only subtle room ambience.
Keep the product packaging, logo and colors unchanged.
Leave space at the bottom for adding Persian subtitles later.

نمونه پرامپت برای ویدئوی داستانی چندنما

Create a coherent 15-second cinematic sequence.

Shot 1 — 0 to 4 seconds:
Wide shot of a nearly empty train station on a rainy night.
A man in a dark green coat waits alone under the station clock.

Shot 2 — 4 to 8 seconds:
Medium tracking shot as he notices a red suitcase on an empty bench.

Shot 3 — 8 to 12 seconds:
Close-up of his hand slowly opening the suitcase.

Shot 4 — 12 to 15 seconds:
Close-up reaction as warm golden light shines from inside.

Maintain the same man, green coat, suitcase, station layout,
rain and blue nighttime lighting across all shots.
Cinematic suspense, realistic motion and smooth continuity.

Audio: rain, distant train sounds, footsteps and a subtle rising tone.
No dialogue and no generated text.

نمونه پرامپت برای گفت‌وگوی دو شخصیت

A realistic medium two-shot inside a quiet modern café.

Nima, the man wearing a gray jacket, looks at Sara and says in English:
"The presentation starts in ten minutes."

Sara, the woman wearing a blue scarf, closes her laptop and replies:
"Then we should leave now."

Only the specified character speaks each line.
Maintain distinct voices, accurate lip sync and natural facial expressions.
Soft café ambience, no background music and no subtitles.

برای گفت‌وگوی فارسی، ممکن است بهتر باشد ویدئو را بدون دیالوگ تولید کنید و صدای فارسی را جداگانه بسازید؛ مگر اینکه نسخه مورد استفاده شما پشتیبانی مناسب از فارسی را در آزمایش عملی نشان دهد.

چگونه ثبات چهره را در Kling بهتر کنیم؟

تصویر مرجع باکیفیت انتخاب کنید

چهره باید واضح و بدون پوشش غیرضروری باشد. نور بسیار شدید، زاویه غیرعادی و وضوح پایین می‌تواند ثبات را کاهش دهد.

Subject یا Element بسازید

اگر Kling امکان تعریف عنصر مرجع را ارائه می‌کند، شخصیت را به‌عنوان Subject ذخیره یا متصل کنید.

ویژگی‌های شخصیت را تغییر ندهید

اگر تصویر مرجع لباس قرمز دارد، در Prompt لباس آبی درخواست نکنید؛ مگر اینکه هدف شما عمداً تعویض لباس باشد.

نماهای خیلی پیچیده را کاهش دهید

حرکت سریع سر، چرخش کامل بدن، نمای بسیار دور و بازگشت ناگهانی به نمای نزدیک می‌تواند چهره را تغییر دهد.

ثبات را صریح درخواست کنید

Maintain the exact same identity, facial structure, hairstyle,
age, clothing and body proportions throughout the entire video.

از تعداد شخصیت‌های کمتر شروع کنید

ابتدا ثبات یک شخصیت را آزمایش کنید. سپس شخصیت دوم و دیالوگ را اضافه کنید.

چگونه حرکت طبیعی‌تری بگیریم؟

برای حرکت بهتر:

  • فقط حرکت‌های ضروری را توضیح دهید.
  • ترتیب حرکت‌ها را مشخص کنید.
  • از افعال دقیق استفاده کنید.
  • شدت و سرعت را بنویسید.
  • حرکت دوربین را با حرکت سوژه هماهنگ کنید.
  • از درخواست چند حرکت پیچیده در زمان کوتاه خودداری کنید.

ضعیف:

The man moves in the room.

بهتر:

The man walks slowly toward the window, pauses,
places his right hand on the curtain and looks outside.

برای حرکات ظریف:

Subtle breathing, natural blinking, slight head movement and relaxed posture.

چگونه از Kling برای تولید محتوای اینستاگرام استفاده کنیم؟

یک گردش کار مناسب برای Reels می‌تواند چنین باشد:

  1. موضوع و Hook را تعیین کنید.
  2. سناریوی ۱۵ تا ۳۰ ثانیه‌ای بنویسید.
  3. آن را به نماهای ۳ تا ۵ ثانیه‌ای تقسیم کنید.
  4. هر نما را جداگانه تولید کنید.
  5. خروجی‌ها را در تدوین کنار یکدیگر بگذارید.
  6. گویندگی یا موسیقی را اضافه کنید.
  7. زیرنویس فارسی را جداگانه بسازید.
  8. لوگو و CTA را در تدوین قرار دهید.
  9. خروجی نهایی را با نسبت 9:16 بگیرید.

به‌جای ساخت کل ویدئو در یک درخواست، تولید چند نمای کوتاه کنترل بیشتری روی ریتم و کیفیت می‌دهد.

Kling برای تولید ویدئو محصول

برای فروشگاه اینترنتی بهتر است تصاویر زیر را آماده کنید:

  • نمای مستقیم محصول
  • نمای سه‌ربع
  • نمای جانبی
  • نمای بسته‌بندی
  • نمای نزدیک از بافت
  • لوگوی جداگانه
  • تصویر سبک بصری موردنظر

سپس نقش هر تصویر را مشخص کنید:

Use image 1 for the exact product shape and front label.
Use image 2 for the side view and packaging depth.
Use image 3 only as a lighting and color-style reference.

مدل نباید مجبور شود ظاهر پشت محصول را از روی یک تصویر روبه‌رو حدس بزند.

Kling AI رایگان است؟

Kling معمولاً ممکن است مقدار محدودی اعتبار، طرح آزمایشی یا امکانات پایه در اختیار کاربران قرار دهد، اما تولید بیشتر و استفاده از مدل‌های پیشرفته‌تر به اعتبار یا اشتراک نیاز دارد.

قیمت به عوامل زیر وابسته است:

  • نسخه مدل
  • مدت ویدئو
  • وضوح 720p یا 1080p
  • تولید صدا
  • کنترل صدا
  • حالت استاندارد یا حرفه‌ای
  • تعداد خروجی
  • امکانات ویرایش

طبق راهنمای رسمی منتشرشده برای Kling Video 3.0، هزینه در رابط Kling براساس تعداد ثانیه ویدئو و فعال‌بودن Native Audio محاسبه می‌شود. قیمت‌ها ممکن است تغییر کنند؛ بنابراین پیش از خرید، صفحه قیمت فعلی سرویس را بررسی کنید.

کاهش هزینه تولید ویدئو با Kling

ابتدا Prompt را با تنظیمات اقتصادی آزمایش کنید

تا زمانی که حرکت و ترکیب‌بندی درست نشده، خروجی نهایی 1080p نگیرید.

ویدئو را کوتاه نگه دارید

اگر هدف در ۵ ثانیه قابل اجراست، تولید ۱۵ ثانیه هزینه و احتمال خطا را افزایش می‌دهد.

تعداد خروجی را کنترل کنید

برای هر Prompt تعداد زیادی خروجی هم‌زمان نسازید. ابتدا یک یا دو نمونه بگیرید.

پرامپت‌ها را نسخه‌بندی کنید

برای مثال:

watch-commercial-v1
watch-commercial-v2-camera
watch-commercial-v3-lighting

با این روش متوجه می‌شوید کدام تغییر نتیجه را بهتر کرده است.

نرخ خروجی قابل‌استفاده را اندازه بگیرید

هزینه واقعی فقط هزینه یک Generation نیست.

هزینه واقعی هر کلیپ قابل‌استفاده =
کل هزینه تولیدها ÷ تعداد خروجی‌های پذیرفته‌شده

اگر از ۱۰ خروجی فقط ۲ مورد قابل‌استفاده باشند، هزینه واقعی هر کلیپ پنج برابر قیمت یک تولید است.

Kling AI برای چه کسانی مناسب است؟

تولیدکنندگان محتوا

برای B-roll، کلیپ کوتاه، محتوای شبکه اجتماعی و متحرک‌سازی تصاویر.

فروشگاه‌های اینترنتی

برای ساخت ویدئو محصول از تصاویر کاتالوگ و تولید نسخه‌های متعدد تبلیغاتی.

آژانس‌های تبلیغاتی

برای ساخت Concept، Storyboard متحرک و Creativeهای گوناگون.

فیلم‌سازان

برای Previsualization، آزمایش قاب، طراحی حرکت دوربین و تولید نماهای مکمل.

طراحان

برای متحرک‌سازی پوستر، تصویرسازی، کاراکتر و آثار مفهومی.

معماران

برای تبدیل رندر به ویدئو و ساخت گردش مجازی در فضا.

بازی‌سازان

برای Concept Video، Cutscene اولیه، تریلر مفهومی و نمایش فضای بازی.

توسعه‌دهندگان

برای ساخت اپلیکیشن‌های تولید ویدئو، ابزارهای تبلیغاتی و خطوط تولید خودکار محتوا.

Kling AI یا Seedance؟

هر دو مدل در تولید ویدئوی چندوجهی، صدا، تصویر مرجع و روایت چندنما پیشرفت کرده‌اند.

Kling 3.0 بر این قابلیت‌ها تأکید دارد:

  • کنترل عنصر یا Subject
  • روایت چندنمایی
  • تولید صدای بومی
  • تبدیل تصویر به ویدئو
  • حفظ نوشته موجود در تصویر
  • گردش کار تولید و ویرایش

Seedance 2.0 نیز روی ورودی ترکیبی متن، تصویر، ویدئو و صدا و کنترل مرجع‌های متعدد تمرکز دارد.

برای انتخاب، یک آزمون ثابت طراحی کنید:

  • یک Prompt متن به ویدئو
  • یک عکس محصول
  • یک شخصیت مرجع
  • یک صحنه با حرکت پیچیده
  • یک سکانس چندنما
  • یک صحنه دارای صدا

سپس خروجی‌ها را براساس کیفیت، ثبات، هزینه، زمان و نرخ موفقیت مقایسه کنید.

Kling AI یا Veo؟

Kling و Veo هر دو برای تولید ویدئوی پیشرفته استفاده می‌شوند، اما انتخاب به پروژه بستگی دارد.

معیارهای مهم:

  • کیفیت Image to Video
  • پیروی از Prompt
  • کنترل شخصیت
  • کیفیت صدا
  • پشتیبانی زبان
  • مدت ویدئو
  • وضوح
  • حرکت دوربین
  • قیمت
  • سرعت
  • دسترسی API
  • شرایط تجاری
  • محدودیت‌های منطقه‌ای

رتبه‌بندی عمومی نمی‌تواند جای آزمون با تصاویر و سناریوهای واقعی کسب‌وکار شما را بگیرد.

معماری یک اپلیکیشن تولید ویدئو با Kling API

Kling برای مشتریان سازمانی و توسعه‌دهندگان نیز API ارائه کرده است، اما Endpointها، شناسه مدل‌ها، قیمت و شرایط دسترسی باید از مستندات فعلی ارائه‌دهنده بررسی شوند.

تولید ویدئو معمولاً به‌صورت Asynchronous انجام می‌شود:

کاربر
→ Frontend
→ Backend
→ API تولید ویدئو
→ صف پردازش
→ Job ID
→ بررسی وضعیت
→ دریافت خروجی
→ ذخیره‌سازی

درخواست تولید

Backend اطلاعات زیر را دریافت می‌کند:

{
  "prompt": "A cinematic product video...",
  "duration": 5,
  "aspect_ratio": "9:16",
  "resolution": "1080p",
  "generate_audio": false
}

این فقط یک نمونه مفهومی است و ساختار واقعی درخواست به API مورد استفاده بستگی دارد.

پاسخ اولیه

{
  "id": "job_8f1a2",
  "status": "queued"
}

بررسی وضعیت

{
  "id": "job_8f1a2",
  "status": "processing",
  "progress": 60
}

نتیجه نهایی

{
  "id": "job_8f1a2",
  "status": "completed",
  "output": {
    "video_url": "https://storage.example.com/output.mp4"
  }
}

نکات فنی برای API ویدئو

کلید API را در Backend نگه دارید

کلید را در کد Frontend، اپ موبایل یا مخزن عمومی قرار ندهید.

DARVAREH_API_KEY=your_api_key

فایل ورودی را اعتبارسنجی کنید

موارد زیر باید کنترل شوند:

  • MIME Type
  • اندازه فایل
  • وضوح
  • مدت ویدئو
  • نرخ فریم
  • تعداد فایل‌های مرجع
  • نسبت تصویر
  • سلامت فایل

از صف استفاده کنید

تولید ویدئو زمان‌بر است. درخواست‌ها را با Queue مدیریت کنید و تعداد Jobهای هم‌زمان را محدود نگه دارید.

وضعیت را با Polling یا Webhook دریافت کنید

اتصال HTTP کاربر را تا پایان تولید باز نگه ندارید. Job ID را به کاربر بدهید و وضعیت را جداگانه نمایش دهید.

Retry کنترل‌شده داشته باشید

هر خطا نباید باعث ارسال دوباره درخواست پولی شود. قبل از Retry مشخص کنید آیا Job قبلی ساخته شده است یا خیر.

Idempotency تعریف کنید

اگر شبکه قطع شد، درخواست تکراری نباید دو ویدئو و دو هزینه ایجاد کند. برای هر عملیات یک شناسه یکتا داشته باشید.

خروجی را در Storage خودتان ذخیره کنید

لینک خروجی ممکن است موقت باشد. پس از پایان Job، فایل را به فضای ذخیره‌سازی تحت کنترل پروژه منتقل کنید.

محدودیت هزینه قرار دهید

برای هر کاربر یا سازمان موارد زیر را تعریف کنید:

  • حداکثر مدت
  • حداکثر وضوح
  • تعداد Job روزانه
  • تعداد تولید هم‌زمان
  • سقف هزینه
  • مدل‌های مجاز

استفاده از مدل‌های ویدئویی از طریق درواره

اگر می‌خواهید قابلیت تولید محتوای هوش مصنوعی را به نرم‌افزار یا کسب‌وکار خود اضافه کنید، درواره دسترسی APIمحور به مدل‌های مختلف را ساده‌تر می‌کند.

از طریق یک لایه یکپارچه می‌توانید:

  • مدل‌های مختلف را ارزیابی کنید.
  • وابستگی به یک ارائه‌دهنده را کاهش دهید.
  • قابلیت Fallback بسازید.
  • مدل را متناسب با هزینه و کیفیت انتخاب کنید.
  • مصرف API را بهتر مدیریت کنید.
  • فرایند توسعه محصول AI را سریع‌تر آغاز کنید.

درواره یک برنامه آماده ساخت ویدئو نیست؛ زیرساخت API برای توسعه‌دهندگان و کسب‌وکارهایی است که می‌خواهند قابلیت‌های هوش مصنوعی را در محصول خود پیاده‌سازی کنند.

موجودبودن Kling یا هر مدل خاص، شناسه دقیق مدل و ویژگی‌های آن ممکن است تغییر کند. پیش از پیاده‌سازی، فهرست مدل‌ها و مستندات فعلی درواره را بررسی کنید.

برای ثبت‌نام، دریافت API Key و مشاهده سرویس‌های موجود به وب‌سایت درواره مراجعه کنید.

نکات استفاده مسئولانه

هنگام ساخت و انتشار ویدئو با هوش مصنوعی:

  • برای استفاده از چهره یا صدای افراد رضایت مناسب داشته باشید.
  • محتوای واقع‌گرایانه را به‌عنوان رویداد واقعی معرفی نکنید.
  • فایل‌های مرجع متعلق به دیگران را بدون مجوز استفاده نکنید.
  • ادعاهای تبلیغاتی را بازبینی کنید.
  • نوشته و لوگو را فریم‌به‌فریم کنترل کنید.
  • خروجی مربوط به افراد واقعی را پیش از انتشار دقیق بررسی کنید.
  • محتوای تولیدشده را در کاربردهای حساس بدون نظارت انسانی منتشر نکنید.

پرسش‌های متداول

Kling AI چیست؟

Kling AI پلتفرم و خانواده مدل‌های تولید تصویر و ویدئو متعلق به شرکت Kuaishou است. این ابزار می‌تواند از متن، عکس و سایر فایل‌های مرجع برای ساخت یا ویرایش ویدئو استفاده کند.

آخرین نسخه Kling چیست؟

در زمان نگارش این مقاله، Kling AI 3.0 جدیدترین خانواده اصلی اعلام‌شده است و شامل مدل‌های Video 3.0، Video 3.0 Omni، Image 3.0 و Image 3.0 Omni می‌شود.

آیا Kling AI عکس را به ویدئو تبدیل می‌کند؟

بله. Image to Video یکی از قابلیت‌های اصلی Kling است. می‌توانید تصویر را وارد و حرکت سوژه، دوربین، نور و صدا را در Prompt تعیین کنید.

آیا Kling AI رایگان است؟

ممکن است اعتبار محدود یا امکانات آزمایشی ارائه شود، اما تولید حرفه‌ای، وضوح بیشتر و مدل‌های جدید معمولاً نیازمند اعتبار یا اشتراک هستند.

Kling 3.0 چند ثانیه ویدئو می‌سازد؟

طبق راهنمای رسمی، Kling Video 3.0 از مدت انعطاف‌پذیر ۳ تا ۱۵ ثانیه پشتیبانی می‌کند. محدودیت رابط‌ها یا حساب‌های مختلف ممکن است متفاوت باشد.

آیا Kling صدا هم تولید می‌کند؟

بله. حالت Native Audio می‌تواند همراه با تصویر، دیالوگ، صدای محیط و افکت صوتی ایجاد کند.

آیا Kling از فارسی پشتیبانی می‌کند؟

می‌توان Prompt فارسی را آزمایش کرد، اما فارسی در فهرست رسمی زبان‌های Native Audio نسخه 3.0 ذکر نشده است. برای گفتار فارسی، تولید جداگانه صدا و ترکیب آن در تدوین می‌تواند نتیجه مطمئن‌تری ایجاد کند.

چگونه چهره را در Kling ثابت نگه داریم؟

از تصویر مرجع واضح، قابلیت Subject یا Element Reference، حرکت‌های کنترل‌شده و دستور صریح حفظ هویت استفاده کنید.

آیا Kling برای تبلیغات محصول مناسب است؟

بله، اما شکل محصول، بسته‌بندی، لوگو و نوشته‌ها باید پس از تولید دقیق بررسی شوند.

Kling AI بهتر است یا Veo؟

پاسخ به نوع پروژه بستگی دارد. بهترین روش، آزمایش هر دو مدل با Prompt و فایل‌های مرجع یکسان و مقایسه کیفیت، هزینه و نرخ خروجی قابل‌استفاده است.

Kling بهتر است یا Seedance؟

هر دو مدل قابلیت‌های پیشرفته تولید ویدئو دارند. Kling در Element Reference و گردش کار تولید و ویرایش امکانات مهمی دارد و Seedance نیز از ترکیب گسترده ورودی‌های چندوجهی پشتیبانی می‌کند. نتیجه باید با سناریوی واقعی ارزیابی شود.

آیا Kling API دارد؟

Kling برای توسعه‌دهندگان و مشتریان سازمانی API ارائه کرده است. شرایط دسترسی، مدل‌ها، قیمت و Endpointها باید از مستندات به‌روز سرویس بررسی شوند.

جمع‌بندی

Kling AI یکی از مهم‌ترین پلتفرم‌های ساخت ویدئو با هوش مصنوعی است. Kling Video 3.0 قابلیت‌هایی مانند تبدیل متن و عکس به ویدئو، تولید کلیپ چندنمایی، حفظ شخصیت مرجع، کنترل نما، تولید صدای بومی و ویرایش چندوجهی را در اختیار تولیدکنندگان محتوا و توسعه‌دهندگان قرار می‌دهد.

بااین‌حال، کیفیت خروجی فقط به قدرت مدل بستگی ندارد. یک نتیجه حرفه‌ای به عوامل زیر نیاز دارد:

  • سناریوی روشن
  • تصویر مرجع مناسب
  • Prompt ساختاریافته
  • حرکت محدود و دقیق
  • Shot List
  • کنترل ثبات شخصیت
  • چند مرحله آزمون
  • انتخاب انسانی
  • تدوین نهایی

برای تولید ویدئوی حرفه‌ای، هوش مصنوعی را باید بخشی از خط تولید محتوا دانست، نه جایگزین کامل سناریونویسی، کارگردانی و تدوین.

اگر قصد دارید مدل‌های هوش مصنوعی را از طریق API به وب‌سایت، اپلیکیشن یا گردش کار سازمانی خود متصل کنید، برای مشاهده سرویس‌ها، ثبت‌نام و دریافت API Key به درواره مراجعه کنید.

مقالات مرتبط

Read more