Kling AI چیست؟ آموزش کامل ساخت ویدئو با هوش مصنوعی Kling 3.0
Kling AI ابزار قدرتمند ساخت ویدئو با هوش مصنوعی است. در این راهنما با Kling 3.0، تبدیل متن و عکس به ویدئو، تولید صدا، ثبات شخصیت و اصول پرامپتنویسی حرفهای آشنا میشوید.
تا چند سال قبل برای ساخت یک ویدئوی تبلیغاتی کوتاه به دوربین، نورپردازی، بازیگر، لوکیشن، تدوینگر و بودجه قابلتوجهی نیاز داشتیم. اکنون مدلهای تولید ویدئو با هوش مصنوعی میتوانند فقط با یک توضیح متنی یا تصویر ثابت، نماهای متحرک و نسبتاً واقعگرایانه تولید کنند.
یکی از شناختهشدهترین مدلهای این حوزه Kling AI یا هوش مصنوعی کلینگ است. Kling ابتدا بهعنوان یک مدل تبدیل متن و عکس به ویدئو مطرح شد، اما نسل جدید آن مجموعهای از قابلیتهای تولید، درک و ویرایش ویدئو را در یک محیط چندوجهی ارائه میکند.
Kling AI 3.0 میتواند از متن، تصویر، ویدئو و صدا استفاده کند، کلیپهای چندنمایی بسازد، شخصیتها و محصولات را میان نماها ثابت نگه دارد و در برخی حالتها صدا و تصویر را همزمان تولید کند.
در این راهنما بهصورت عملی بررسی میکنیم:
- Kling AI چیست؟
- Kling 3.0 چه قابلیتهایی دارد؟
- چگونه با متن یا عکس ویدئو بسازیم؟
- تفاوت حالتهای Video 3.0 و Video 3.0 Omni چیست؟
- چگونه پرامپت حرفهای بنویسیم؟
- چطور حرکت دوربین و ثبات شخصیت را کنترل کنیم؟
- Kling برای تولید محتوا، تبلیغات و فروشگاه اینترنتی چه کاربردی دارد؟
- برای دریافت خروجی بهتر باید از چه گردش کاری استفاده کنیم؟
- توسعهدهندگان چگونه یک سرویس تولید ویدئو مبتنی بر API میسازند؟
Kling AI چیست؟
Kling AI یک پلتفرم و خانواده مدلهای مولد تصویر و ویدئو است که توسط شرکت چینی Kuaishou Technology توسعه پیدا کرده است.
این پلتفرم در ژوئن ۲۰۲۴ عرضه شد و در ابتدا به دلیل کیفیت حرکت، تبدیل عکس به ویدئو و تولید صحنههای واقعگرایانه مورد توجه قرار گرفت. Kling پس از عرضه اولیه، نسخهها و قابلیتهای متعددی برای تولید و ویرایش محتوا دریافت کرد.
نسخههای جدید Kling فقط یک تصویر متحرک تولید نمیکنند. این مدلها میتوانند موارد زیر را مدیریت کنند:
- تبدیل متن به ویدئو
- تبدیل عکس به ویدئو
- استفاده از تصویر مرجع
- استفاده از ویدئوی مرجع
- تولید چند نمای متوالی
- کنترل شخصیت و سوژه
- ویرایش عناصر داخل ویدئو
- تولید همزمان صوت و تصویر
- ساخت تصویر با هوش مصنوعی
- تولید محتوای مناسب تبلیغات و شبکههای اجتماعی
نسخه فعلی این خانواده Kling AI 3.0 است که در فوریه ۲۰۲۶ معرفی شد. شرکت Kuaishou اعلام کرده است که خانواده Kling 3.0 شامل مدلهای Video 3.0، Video 3.0 Omni، Image 3.0 و Image 3.0 Omni میشود. این مجموعه از ورودی و خروجی چندوجهی شامل متن، تصویر، صدا و ویدئو پشتیبانی میکند. جزئیات آن در اطلاعیه رسمی Kling AI 3.0 منتشر شده است.
Kling AI متعلق به کدام شرکت است؟
Kling AI محصول شرکت Kuaishou Technology است. Kuaishou یکی از شرکتهای بزرگ فعال در حوزه ویدئوی کوتاه، شبکههای اجتماعی، تجارت الکترونیک و هوش مصنوعی محسوب میشود.
نام چینی Kling بهشکل 可灵 نوشته میشود و ممکن است در برخی منابع فارسی با عنوانهای «کلینگ»، «کلینگ ایآی» یا «هوش مصنوعی Kling» دیده شود.
Kling با تکیه بر تجربه Kuaishou در پردازش ویدئو و محتوای کاربرمحور توسعه یافته و کاربردهای آن از ساخت کلیپ شخصی تا تولید محتوای تبلیغاتی، انیمیشن، بازی و فیلم گسترش پیدا کرده است.
براساس گزارش رسمی Kuaishou، Kling AI در سهماهه اول ۲۰۲۶ بیش از ۶۵۰ میلیون یوان درآمد کسب کرده و رشد سالانه درآمد آن از ۳۰۰ درصد عبور کرده است. این آمار نشان میدهد Kling از یک نمایش فنی فراتر رفته و به یک محصول تجاری جدی در بازار تولید محتوای هوش مصنوعی تبدیل شده است. اطلاعات بیشتر در گزارش سهماهه اول ۲۰۲۶ Kuaishou در دسترس است.
تاریخچه نسخههای Kling AI
شناخت نسخهها کمک میکند هنگام استفاده از Kling بدانیم هر قابلیت از کدام نسل مدل ارائه شده است.
Kling 1.x
نسخههای اولیه Kling بیشتر روی موارد زیر تمرکز داشتند:
- تبدیل متن به ویدئو
- تبدیل تصویر به ویدئو
- حرکت طبیعی سوژه
- کنترل ابتدایی دوربین
- افزایش وضوح خروجی
- ساخت کلیپهای کوتاه واقعگرایانه
یکی از نقاط قوت Kling در نسل اول، حرکتهای بزرگتر و پویاتر در مقایسه با بسیاری از مدلهای ویدئوساز آن زمان بود.
Kling 2.0
Kling 2.0 در آوریل ۲۰۲۵ معرفی شد و کیفیت حرکت، زیبایی بصری و درک دستور را بهبود داد.
در این نسل، کاربر میتوانست با دقت بیشتری مشخص کند:
- سوژه چه حرکتی انجام دهد؟
- دوربین چگونه جابهجا شود؟
- فضای بصری چه سبکی داشته باشد؟
- تصویر مرجع چگونه متحرک شود؟
- عناصر صحنه چه ارتباطی با یکدیگر داشته باشند؟
Kling 2.1
نسخه 2.1 حالتهای Standard و High Quality را ارائه کرد. حالت Standard برای تولید اقتصادیتر و سریعتر و حالت High Quality برای خروجی با جزئیات بیشتر طراحی شده بود.
Kuaishou همچنین نسخه Master را برای کیفیت حرکت و پیروی بهتر از دستور ارائه کرد. طبق گزارش اولین سال فعالیت Kling AI، نسخه Kling 2.1 در حالت استاندارد خروجی 720p و در حالت باکیفیت خروجی 1080p ارائه میکرد.
Kling Video 2.6
Kling 2.6 قابلیت Native Audio-Visual Generation را اضافه کرد. در این روش، مدل میتوانست صدا و تصویر را در یک فرایند هماهنگ تولید کند.
این قابلیت برای موارد زیر اهمیت داشت:
- دیالوگ شخصیتها
- هماهنگی لب با گفتار
- صدای محیط
- افکتهای صوتی
- موسیقی
- هماهنگی صدا با رویدادهای تصویری
Kling Video O1
مدل Kling Video O1 در دسامبر ۲۰۲۵ معرفی شد. هدف آن یکپارچهکردن تولید و ویرایش ویدئو در یک معماری چندوجهی بود.
Kling O1 میتوانست متن، تصویر، ویدئو و سوژه مرجع را در یک گردش کار واحد ترکیب کند. طبق معرفی رسمی Kling O1، این مدل برای بهبود ثبات شخصیت، صحنه و عناصر بصری طراحی شده است.
Kling AI 3.0
Kling 3.0 در فوریه ۲۰۲۶ بهصورت جهانی عرضه شد. این خانواده چهار مدل اصلی دارد:
- Kling Video 3.0
- Kling Video 3.0 Omni
- Kling Image 3.0
- Kling Image 3.0 Omni
نسخه 3.0 روی روایت چندنمایی، تولید صدای بومی، ثبات عناصر، کنترل نما و ترکیب ورودیهای مختلف تمرکز دارد.
قابلیتهای اصلی Kling Video 3.0
تبدیل متن به ویدئو
در حالت Text to Video فقط یک توضیح متنی وارد میکنید و مدل کل صحنه را میسازد.
مدل باید از Prompt متوجه شود:
- شخصیت یا سوژه چیست؟
- چه اتفاقی میافتد؟
- محیط کجاست؟
- دوربین چگونه حرکت میکند؟
- نورپردازی چگونه است؟
- خروجی چه سبک بصری دارد؟
- چه صدایی شنیده میشود؟
- کدام اجزا باید ثابت بمانند؟
نمونه ساده:
A cinematic shot of a small red vintage car driving through a quiet
mountain road at sunrise. The camera follows the car from a low rear angle.
Soft morning fog, golden sunlight, realistic motion and natural road ambience.
تبدیل عکس به ویدئو
Image to Video یکی از پرکاربردترین قابلیتهای Kling AI است. در این حالت، تصویر آغازین را وارد و حرکت موردنظر را توصیف میکنید.
برای مثال:
Preserve the exact appearance of the supplied portrait.
The character slowly turns toward the camera and smiles naturally.
A gentle breeze moves her hair. The camera performs a subtle dolly-in.
Soft daylight, realistic facial movement, no scene transition.
مدل از تصویر برای ظاهر سوژه، ترکیببندی و فضای صحنه استفاده میکند و Prompt مشخص میکند چه چیزی باید تغییر کند.
ساخت ویدئو با سوژه مرجع
در Kling 3.0 میتوان یک Element یا Subject مرجع تعریف کرد. هدف این قابلیت، ثابت نگهداشتن شخصیت یا شیء در نماهای مختلف است.
این قابلیت برای موارد زیر مفید است:
- شخصیت ثابت یک مجموعه ویدئویی
- سفیر مجازی برند
- محصول مشخص
- کاراکتر انیمیشنی
- حیوان یا موجود خیالی
- وسیله نقلیه
- محیط ثابت
در راهنمای رسمی Kling 3.0 توضیح داده شده است که اتصال Subject به ویدئو میتواند ظاهر و حتی صدای مرتبط با آن را در طول تولید ثابتتر نگه دارد. راهنمای Kling Video 3.0 جزئیات این قابلیت را شرح میدهد.
تولید ویدئوی چندنمایی
Kling Video 3.0 از Multi-Shot Generation پشتیبانی میکند. کاربر میتواند اجازه دهد مدل نماها را بهصورت خودکار برنامهریزی کند یا در حالت Custom Multi-Shot جزئیات هر نما را بنویسد.
برای مثال:
Create a coherent four-shot commercial sequence.
Shot 1: Wide shot of a modern kitchen in soft morning light.
Shot 2: Medium shot of a woman placing a coffee capsule into the machine.
Shot 3: Extreme close-up of coffee pouring into a glass cup.
Shot 4: Product hero shot with the machine and cup centered on the counter.
Maintain the same woman, outfit, kitchen layout, coffee machine and lighting
across all shots. Use smooth cuts and realistic synchronized sound.
اگر مدل یا رابط اجازه تعیین زمان هر نما را بدهد، میتوان Shot List را دقیقتر نوشت:
Shot 1 — 0 to 3 seconds
Shot 2 — 3 to 7 seconds
Shot 3 — 7 to 11 seconds
Shot 4 — 11 to 15 seconds
تولید ویدئو تا ۱۵ ثانیه
Kling Video 3.0 میتواند ویدئوهایی با مدت انعطافپذیر بین ۳ تا ۱۵ ثانیه تولید کند.
افزایش مدت به ۱۵ ثانیه به معنای امکان اجرای روایت پیچیدهتر است، اما همیشه نباید حداکثر زمان را انتخاب کرد. برای یک حرکت ساده محصول، کلیپ ۵ ثانیهای ممکن است نتیجه پایدارتر و اقتصادیتری ایجاد کند.
زمان طولانیتر زمانی مفید است که:
- چند حرکت پشت سر هم دارید.
- دیالوگ کوتاه وجود دارد.
- نماهای متعدد نیاز دارید.
- تغییر تدریجی صحنه مهم است.
- داستان کوچک و مشخصی روایت میکنید.
تولید همزمان صدا و تصویر
Native Audio یکی از قابلیتهای مهم Kling 3.0 است. مدل میتواند همراه با تصویر، موارد زیر را نیز تولید کند:
- دیالوگ
- صدای محیط
- افکت صوتی
- موسیقی پسزمینه
- صدای حرکت
- واکنشهای صوتی
- صدای متناسب با فضای صحنه
نمونه:
A quiet bakery early in the morning. The baker places a tray of fresh bread
on the wooden counter. Warm sunlight enters through the window.
Audio: gentle bakery ambience, subtle tray movement, soft crackling from
fresh bread and distant morning street sounds. No music and no narration.
تولید مشترک صدا و تصویر میتواند هماهنگی زمانی را بهتر کند؛ برای مثال صدای بستهشدن در دقیقاً با حرکت آن همزمان شود.
دیالوگ چند شخصیت
Kling 3.0 میتواند دیالوگ را به شخصیتهای مختلف نسبت دهد. برای کاهش جابهجایی گویندهها، نام یا مشخصات هر شخصیت را بهوضوح بنویسید.
Two colleagues are standing beside a whiteboard in a modern office.
Sara, the woman wearing a blue jacket, says in a calm tone:
"We should simplify the onboarding process."
Amir, the man wearing a gray shirt, responds:
"I agree. Let's begin with the registration form."
Maintain the identity and voice of each character.
Only the specified character should speak each line.
طبق اعلام رسمی، تولید صدای بومی Kling 3.0 از زبانهای چینی، انگلیسی، ژاپنی، کرهای و اسپانیایی و چند لهجه پشتیبانی میکند. فارسی در فهرست رسمی اعلامشده قرار ندارد؛ بنابراین برای دیالوگ فارسی باید خروجی را آزمایش یا صدا را جداگانه تولید و در مرحله تدوین اضافه کنید.
کنترل صدا و لحن شخصیت
در صورت پشتیبانی رابط مورد استفاده، میتوان Subject را به صدای مشخصی متصل کرد. این ویژگی برای حفظ Voice Consistency در مجموعهای از ویدئوها کاربرد دارد.
اگر صدا از قبل به شخصیت متصل شده باشد، بهتر است Prompt جدید ویژگیهای صوتی متناقضی تعریف نکند.
حفظ نوشته و لوگو
Kling 3.0 برای تشخیص و حفظ نوشتههای موجود در تصویر مرجع بهبود یافته است. این قابلیت برای تبلیغات محصول، بستهبندی، تابلو و محتوای فروشگاهی مهم است.
بااینحال، هیچ مدل مولدی را نباید برای حفظ صددرصدی نوشته، لوگو یا اطلاعات حساس محصول بدون کنترل انسانی قابلاعتماد دانست. پس از تولید، موارد زیر را فریمبهفریم بررسی کنید:
- املای نام برند
- لوگو
- متن بستهبندی
- قیمت
- اعداد
- علائم نگارشی
- اطلاعات تماس
- تناسب محصول
برای اطمینان بیشتر، متن و CTA را در نرمافزار تدوین اضافه کنید.
ویرایش ویدئو
مدلهای Omni و O1 مفهوم تولید و ویرایش را به یک گردش کار نزدیک کردهاند. بهجای تولید همهچیز از ابتدا میتوان یک ویدئوی موجود را وارد و تغییر مشخصی درخواست کرد.
نمونه دستورات ویرایشی:
Replace the red car with the supplied black electric car.
Preserve the original camera movement, road, lighting and timing.
Change the scene from daytime to a rainy evening.
Keep the actor, performance and camera motion unchanged.
Remove the chair from the background.
Preserve the person and all foreground elements.
کیفیت و در دسترس بودن هر نوع ویرایش به مدل، حساب و رابطی که استفاده میکنید بستگی دارد.
تفاوت Kling Video 3.0 و Kling Video 3.0 Omni
Kling Video 3.0 برای تولید ویدئو با تمرکز بر روایت، ثبات عنصر، تصویر مرجع، صدای بومی و کنترل چندنما طراحی شده است.
نسخه Omni دامنه گستردهتری از ورودیها و وظایف را در یک معماری یکپارچه ترکیب میکند. در کاربردهای پیچیدهتر، Omni میتواند برای گردش کاری شامل درک، تولید و ویرایش مناسبتر باشد.
بهطور ساده:
| نیاز | انتخاب احتمالی |
|---|---|
| تبدیل متن به ویدئو | Video 3.0 |
| تبدیل عکس به ویدئو | Video 3.0 |
| کلیپ چندنمایی | Video 3.0 |
| ثبات شخصیت مرجع | Video 3.0 یا Omni |
| ترکیب چند نوع ورودی | Omni |
| ویرایش ویدئوی موجود | Omni |
| گردش کار چندمرحلهای تولید و اصلاح | Omni |
این انتخاب قطعی نیست. گزینهها، قیمت و قابلیتهای فعال ممکن است در نسخههای مختلف محصول تغییر کنند.
آموزش ساخت ویدئو با Kling AI
مرحله اول: حساب کاربری بسازید
وارد وبسایت یا اپلیکیشن رسمی Kling AI شوید و حساب کاربری ایجاد کنید. روش ثبتنام و دسترسی ممکن است براساس کشور، نسخه محصول و سیاستهای سرویس متفاوت باشد.
از وبسایتها و اپلیکیشنهای غیررسمی که نام Kling را استفاده میکنند با احتیاط استفاده کنید.
مرحله دوم: بخش AI Videos را انتخاب کنید
در محیط تولید ویدئو معمولاً گزینههایی مانند این موارد دیده میشوند:
- Text to Video
- Image to Video
- Multi-Shot
- Elements
- Native Audio
- Video Editing
- Model Version
- Aspect Ratio
- Duration
- Resolution
مرحله سوم: نسخه مدل را تعیین کنید
در صورت دسترسی، Kling Video 3.0 یا مدل متناسب با نیازتان را انتخاب کنید.
برای آزمونهای اولیه، حالت سریع یا وضوح پایینتر میتواند هزینه کمتری داشته باشد. بعد از نهاییشدن Prompt، خروجی باکیفیتتر را تولید کنید.
مرحله چهارم: روش تولید را انتخاب کنید
اگر ظاهر صحنه هنوز مشخص نیست، Text to Video مناسب است.
اگر چهره، محصول یا ترکیببندی مشخصی دارید، از Image to Video استفاده کنید.
اگر چند شخصیت و فایل مرجع دارید یا قصد ویرایش ویدئو را دارید، قابلیتهای Element Reference یا Omni مناسبترند.
مرحله پنجم: Prompt را وارد کنید
Prompt باید حرکت، دوربین و محدودیتها را توضیح دهد؛ نه اینکه فقط محتوای تصویر را تکرار کند.
مرحله ششم: نسبت تصویر را انتخاب کنید
نسبت تصویر باید براساس محل انتشار باشد:
9:16برای Reels، Shorts و استوری16:9برای یوتیوب، وبسایت و نمایشگر1:1برای پست مربعی4:5برای برخی پستهای شبکههای اجتماعی21:9برای نمای سینمایی عریض
اگر نسبت تصویر را بعداً با Crop تغییر دهید، ممکن است بخشی از سوژه حذف شود. بهتر است از ابتدا خروجی مناسب پلتفرم تولید شود.
مرحله هفتم: مدت و کیفیت را تنظیم کنید
برای آزمون Prompt، از مدت کوتاه و تنظیمات اقتصادیتر شروع کنید. پس از رسیدن به نتیجه مناسب، نسخه نهایی را با کیفیت بیشتر بسازید.
مرحله هشتم: خروجی را بررسی کنید
فقط فریم اول و آخر را نبینید. کل ویدئو را چند بار پخش و این موارد را بررسی کنید:
- تغییر چهره
- دست و انگشت
- شکل اشیا
- جهت حرکت
- پرش دوربین
- نوشتهها
- هماهنگی لب و صدا
- ناپدیدشدن عناصر
- نور و سایه
- پیوستگی نماها
- کیفیت صوت
ساختار استاندارد Prompt برای Kling AI
یک Prompt حرفهای میتواند از این ساختار پیروی کند:
Subject
+ Environment
+ Action
+ Camera
+ Lighting
+ Visual Style
+ Audio
+ Continuity
+ Constraints
معادل فارسی:
سوژه
+ محیط
+ حرکت
+ دوربین
+ نورپردازی
+ سبک بصری
+ صدا
+ پیوستگی
+ محدودیتها
بخش اول پرامپت: سوژه
سوژه را واضح، کوتاه و قابلتشخیص معرفی کنید.
ضعیف:
یک مرد در دفتر
بهتر:
A young product designer with short dark hair, wearing a navy shirt,
sitting at a clean wooden desk
اگر از تصویر مرجع استفاده میکنید، لازم نیست ویژگیهایی را بنویسید که با تصویر تناقض دارند. بیشتر روی ثبات هویت تأکید کنید:
Preserve the exact identity, face, hairstyle and clothing of the reference person.
بخش دوم: محیط
محیط فقط نام مکان نیست. زمان، هوا، بافت، پسزمینه و عناصر مهم را نیز مشخص کنید.
A quiet modern office at sunset, warm light entering through large windows,
subtle city lights in the background, clean minimalist interior
بخش سوم: حرکت
حرکت را به ترتیب زمانی بنویسید:
She closes the laptop, stands up slowly, picks up the notebook
and walks toward the window.
حرکتهای بیش از حد زیاد را به چند نما تقسیم کنید.
بخش چهارم: دوربین
حرکت دوربین نقش مهمی در کیفیت خروجی دارد.
اصطلاحات کاربردی:
Static shot: دوربین ثابتDolly in: نزدیکشدن دوربینDolly out: دورشدنTracking shot: دنبالکردن سوژهPan: چرخش افقی دوربینTilt: چرخش عمودیOrbit: حرکت دور سوژهCrane shot: حرکت عمودی گستردهHandheld: دوربین روی دستGimbal shot: حرکت نرم و پایدارClose-up: نمای نزدیکMedium shot: نمای متوسطWide shot: نمای بازMacro shot: نمای بسیار نزدیکOver-the-shoulder: پشت شانهPOV: زاویه دید شخصیتRack focus: جابهجایی نقطه فوکوس
نمونه:
The camera begins with a macro shot of the watch face,
then slowly pulls back and performs a controlled 30-degree orbit.
بخش پنجم: نورپردازی
بهجای نوشتن «نور زیبا»، نوع نور را تعیین کنید:
Soft diffused studio lighting with a narrow rim light behind the product
Warm golden-hour sunlight with long soft shadows
Low-key cinematic lighting with subtle blue practical lights
بخش ششم: سبک بصری
سبک باید با هدف ویدئو مرتبط باشد:
- Cinematic
- Photorealistic
- Documentary
- Luxury commercial
- UGC
- Stop motion
- Anime
- 3D animation
- Hand-drawn illustration
- Retro film
- Minimal product photography
- Fantasy
- Cyberpunk
از ترکیب چند سبک متناقض خودداری کنید.
بخش هفتم: صدا
صدا را به اجزای جداگانه تقسیم کنید:
Ambient sound: quiet morning street and distant birds.
Sound effects: natural footsteps and door opening.
Music: soft minimal piano.
Dialogue: none.
برای جلوگیری از تولید گفتار ناخواسته بنویسید:
No dialogue, no narration and no vocals.
بخش هشتم: محدودیتها
محدودیتهای مهم را صریح بیان کنید:
Keep the product shape, label and logo unchanged.
Maintain the same character throughout all shots.
No duplicated objects.
No sudden camera shake.
No generated captions or subtitles.
برخی نسخهها ممکن است بخش Negative Prompt جداگانه داشته باشند، اما محدودیتهای حیاتی را در Prompt اصلی نیز ذکر کنید.
نمونه پرامپت کامل برای ویدئوی تبلیغاتی ساعت
Create a premium cinematic commercial for the supplied wristwatch.
Shot 1:
Extreme macro shot of the watch hands moving across the textured black dial.
Shot 2:
The camera slowly pulls back as a narrow beam of light reveals the metal case
and leather strap.
Shot 3:
A controlled orbit shot around the watch placed on dark polished stone.
Black and silver color palette, luxury product cinematography,
shallow depth of field, realistic metal reflections and precise focus.
Audio: subtle mechanical ticking, soft atmospheric bass and no narration.
Preserve the exact watch design, brand logo, dial markings, strap and proportions.
No extra products, no hands, no distorted text and no sudden camera movement.
نمونه پرامپت تبدیل عکس لباس به ویدئو
Animate the supplied fashion image while preserving the model's identity,
face, body proportions and exact outfit.
The model takes two slow steps forward, pauses and turns slightly to the left.
The fabric moves naturally with her body. The camera tracks backward smoothly
in a medium full-body shot.
Minimal studio background, soft diffused light, realistic fashion campaign,
natural motion and accurate fabric physics.
No outfit transformation, no face change, no extra accessories,
no scene transition and no generated text.
نمونه پرامپت برای تبلیغ رستوران
Create a 10-second cinematic food commercial.
Shot 1:
Macro close-up of saffron rice with natural steam rising from the plate.
Shot 2:
A chef's hand places grilled chicken beside the rice.
Shot 3:
Slow overhead shot revealing the complete Persian table setting.
Warm restaurant lighting, rich realistic food textures,
premium commercial look and smooth controlled motion.
Audio: subtle restaurant ambience, natural serving sounds and gentle music.
Do not change the food between shots. No text, no logo and no distorted hands.
نمونه پرامپت برای فروشگاه اینترنتی
Create a vertical 9:16 social media advertisement using the supplied product image.
Shot 1:
The skincare bottle stands on a clean white platform as soft light moves across it.
Shot 2:
Water droplets float briefly around the bottle and settle naturally on the surface.
Shot 3:
Final centered hero shot with empty space above and below for adding Persian text.
Bright minimal commercial style, white and light-blue palette,
realistic glass and liquid, smooth camera motion.
Keep the bottle, cap, label, logo, colors and proportions exactly unchanged.
No generated text, no hands and no additional products.
نمونه پرامپت برای معماری
Transform the supplied interior render into a realistic architectural walkthrough.
The camera begins at the entrance and moves slowly into the living room,
then pans gently toward the floor-to-ceiling windows.
Preserve the exact room dimensions, furniture placement, materials,
windows and architectural layout.
Late-afternoon natural light, realistic global illumination,
soft shadows, stable gimbal movement and premium architectural visualization.
No people, no furniture changes, no fisheye distortion and no scene transition.
نمونه پرامپت برای ویدئوی UGC
UGC یا User-Generated Content باید طبیعیتر از تبلیغ استودیویی به نظر برسد.
A realistic vertical UGC video recorded in a bright home office.
A young woman holds the supplied product near the camera, points to its packaging
and reacts with a natural smile. Slight handheld smartphone movement,
authentic room lighting and casual social media style.
She does not speak. Include only subtle room ambience.
Keep the product packaging, logo and colors unchanged.
Leave space at the bottom for adding Persian subtitles later.
نمونه پرامپت برای ویدئوی داستانی چندنما
Create a coherent 15-second cinematic sequence.
Shot 1 — 0 to 4 seconds:
Wide shot of a nearly empty train station on a rainy night.
A man in a dark green coat waits alone under the station clock.
Shot 2 — 4 to 8 seconds:
Medium tracking shot as he notices a red suitcase on an empty bench.
Shot 3 — 8 to 12 seconds:
Close-up of his hand slowly opening the suitcase.
Shot 4 — 12 to 15 seconds:
Close-up reaction as warm golden light shines from inside.
Maintain the same man, green coat, suitcase, station layout,
rain and blue nighttime lighting across all shots.
Cinematic suspense, realistic motion and smooth continuity.
Audio: rain, distant train sounds, footsteps and a subtle rising tone.
No dialogue and no generated text.
نمونه پرامپت برای گفتوگوی دو شخصیت
A realistic medium two-shot inside a quiet modern café.
Nima, the man wearing a gray jacket, looks at Sara and says in English:
"The presentation starts in ten minutes."
Sara, the woman wearing a blue scarf, closes her laptop and replies:
"Then we should leave now."
Only the specified character speaks each line.
Maintain distinct voices, accurate lip sync and natural facial expressions.
Soft café ambience, no background music and no subtitles.
برای گفتوگوی فارسی، ممکن است بهتر باشد ویدئو را بدون دیالوگ تولید کنید و صدای فارسی را جداگانه بسازید؛ مگر اینکه نسخه مورد استفاده شما پشتیبانی مناسب از فارسی را در آزمایش عملی نشان دهد.
چگونه ثبات چهره را در Kling بهتر کنیم؟
تصویر مرجع باکیفیت انتخاب کنید
چهره باید واضح و بدون پوشش غیرضروری باشد. نور بسیار شدید، زاویه غیرعادی و وضوح پایین میتواند ثبات را کاهش دهد.
Subject یا Element بسازید
اگر Kling امکان تعریف عنصر مرجع را ارائه میکند، شخصیت را بهعنوان Subject ذخیره یا متصل کنید.
ویژگیهای شخصیت را تغییر ندهید
اگر تصویر مرجع لباس قرمز دارد، در Prompt لباس آبی درخواست نکنید؛ مگر اینکه هدف شما عمداً تعویض لباس باشد.
نماهای خیلی پیچیده را کاهش دهید
حرکت سریع سر، چرخش کامل بدن، نمای بسیار دور و بازگشت ناگهانی به نمای نزدیک میتواند چهره را تغییر دهد.
ثبات را صریح درخواست کنید
Maintain the exact same identity, facial structure, hairstyle,
age, clothing and body proportions throughout the entire video.
از تعداد شخصیتهای کمتر شروع کنید
ابتدا ثبات یک شخصیت را آزمایش کنید. سپس شخصیت دوم و دیالوگ را اضافه کنید.
چگونه حرکت طبیعیتری بگیریم؟
برای حرکت بهتر:
- فقط حرکتهای ضروری را توضیح دهید.
- ترتیب حرکتها را مشخص کنید.
- از افعال دقیق استفاده کنید.
- شدت و سرعت را بنویسید.
- حرکت دوربین را با حرکت سوژه هماهنگ کنید.
- از درخواست چند حرکت پیچیده در زمان کوتاه خودداری کنید.
ضعیف:
The man moves in the room.
بهتر:
The man walks slowly toward the window, pauses,
places his right hand on the curtain and looks outside.
برای حرکات ظریف:
Subtle breathing, natural blinking, slight head movement and relaxed posture.
چگونه از Kling برای تولید محتوای اینستاگرام استفاده کنیم؟
یک گردش کار مناسب برای Reels میتواند چنین باشد:
- موضوع و Hook را تعیین کنید.
- سناریوی ۱۵ تا ۳۰ ثانیهای بنویسید.
- آن را به نماهای ۳ تا ۵ ثانیهای تقسیم کنید.
- هر نما را جداگانه تولید کنید.
- خروجیها را در تدوین کنار یکدیگر بگذارید.
- گویندگی یا موسیقی را اضافه کنید.
- زیرنویس فارسی را جداگانه بسازید.
- لوگو و CTA را در تدوین قرار دهید.
- خروجی نهایی را با نسبت
9:16بگیرید.
بهجای ساخت کل ویدئو در یک درخواست، تولید چند نمای کوتاه کنترل بیشتری روی ریتم و کیفیت میدهد.
Kling برای تولید ویدئو محصول
برای فروشگاه اینترنتی بهتر است تصاویر زیر را آماده کنید:
- نمای مستقیم محصول
- نمای سهربع
- نمای جانبی
- نمای بستهبندی
- نمای نزدیک از بافت
- لوگوی جداگانه
- تصویر سبک بصری موردنظر
سپس نقش هر تصویر را مشخص کنید:
Use image 1 for the exact product shape and front label.
Use image 2 for the side view and packaging depth.
Use image 3 only as a lighting and color-style reference.
مدل نباید مجبور شود ظاهر پشت محصول را از روی یک تصویر روبهرو حدس بزند.
Kling AI رایگان است؟
Kling معمولاً ممکن است مقدار محدودی اعتبار، طرح آزمایشی یا امکانات پایه در اختیار کاربران قرار دهد، اما تولید بیشتر و استفاده از مدلهای پیشرفتهتر به اعتبار یا اشتراک نیاز دارد.
قیمت به عوامل زیر وابسته است:
- نسخه مدل
- مدت ویدئو
- وضوح 720p یا 1080p
- تولید صدا
- کنترل صدا
- حالت استاندارد یا حرفهای
- تعداد خروجی
- امکانات ویرایش
طبق راهنمای رسمی منتشرشده برای Kling Video 3.0، هزینه در رابط Kling براساس تعداد ثانیه ویدئو و فعالبودن Native Audio محاسبه میشود. قیمتها ممکن است تغییر کنند؛ بنابراین پیش از خرید، صفحه قیمت فعلی سرویس را بررسی کنید.
کاهش هزینه تولید ویدئو با Kling
ابتدا Prompt را با تنظیمات اقتصادی آزمایش کنید
تا زمانی که حرکت و ترکیببندی درست نشده، خروجی نهایی 1080p نگیرید.
ویدئو را کوتاه نگه دارید
اگر هدف در ۵ ثانیه قابل اجراست، تولید ۱۵ ثانیه هزینه و احتمال خطا را افزایش میدهد.
تعداد خروجی را کنترل کنید
برای هر Prompt تعداد زیادی خروجی همزمان نسازید. ابتدا یک یا دو نمونه بگیرید.
پرامپتها را نسخهبندی کنید
برای مثال:
watch-commercial-v1
watch-commercial-v2-camera
watch-commercial-v3-lighting
با این روش متوجه میشوید کدام تغییر نتیجه را بهتر کرده است.
نرخ خروجی قابلاستفاده را اندازه بگیرید
هزینه واقعی فقط هزینه یک Generation نیست.
هزینه واقعی هر کلیپ قابلاستفاده =
کل هزینه تولیدها ÷ تعداد خروجیهای پذیرفتهشده
اگر از ۱۰ خروجی فقط ۲ مورد قابلاستفاده باشند، هزینه واقعی هر کلیپ پنج برابر قیمت یک تولید است.
Kling AI برای چه کسانی مناسب است؟
تولیدکنندگان محتوا
برای B-roll، کلیپ کوتاه، محتوای شبکه اجتماعی و متحرکسازی تصاویر.
فروشگاههای اینترنتی
برای ساخت ویدئو محصول از تصاویر کاتالوگ و تولید نسخههای متعدد تبلیغاتی.
آژانسهای تبلیغاتی
برای ساخت Concept، Storyboard متحرک و Creativeهای گوناگون.
فیلمسازان
برای Previsualization، آزمایش قاب، طراحی حرکت دوربین و تولید نماهای مکمل.
طراحان
برای متحرکسازی پوستر، تصویرسازی، کاراکتر و آثار مفهومی.
معماران
برای تبدیل رندر به ویدئو و ساخت گردش مجازی در فضا.
بازیسازان
برای Concept Video، Cutscene اولیه، تریلر مفهومی و نمایش فضای بازی.
توسعهدهندگان
برای ساخت اپلیکیشنهای تولید ویدئو، ابزارهای تبلیغاتی و خطوط تولید خودکار محتوا.
Kling AI یا Seedance؟
هر دو مدل در تولید ویدئوی چندوجهی، صدا، تصویر مرجع و روایت چندنما پیشرفت کردهاند.
Kling 3.0 بر این قابلیتها تأکید دارد:
- کنترل عنصر یا Subject
- روایت چندنمایی
- تولید صدای بومی
- تبدیل تصویر به ویدئو
- حفظ نوشته موجود در تصویر
- گردش کار تولید و ویرایش
Seedance 2.0 نیز روی ورودی ترکیبی متن، تصویر، ویدئو و صدا و کنترل مرجعهای متعدد تمرکز دارد.
برای انتخاب، یک آزمون ثابت طراحی کنید:
- یک Prompt متن به ویدئو
- یک عکس محصول
- یک شخصیت مرجع
- یک صحنه با حرکت پیچیده
- یک سکانس چندنما
- یک صحنه دارای صدا
سپس خروجیها را براساس کیفیت، ثبات، هزینه، زمان و نرخ موفقیت مقایسه کنید.
Kling AI یا Veo؟
Kling و Veo هر دو برای تولید ویدئوی پیشرفته استفاده میشوند، اما انتخاب به پروژه بستگی دارد.
معیارهای مهم:
- کیفیت Image to Video
- پیروی از Prompt
- کنترل شخصیت
- کیفیت صدا
- پشتیبانی زبان
- مدت ویدئو
- وضوح
- حرکت دوربین
- قیمت
- سرعت
- دسترسی API
- شرایط تجاری
- محدودیتهای منطقهای
رتبهبندی عمومی نمیتواند جای آزمون با تصاویر و سناریوهای واقعی کسبوکار شما را بگیرد.
معماری یک اپلیکیشن تولید ویدئو با Kling API
Kling برای مشتریان سازمانی و توسعهدهندگان نیز API ارائه کرده است، اما Endpointها، شناسه مدلها، قیمت و شرایط دسترسی باید از مستندات فعلی ارائهدهنده بررسی شوند.
تولید ویدئو معمولاً بهصورت Asynchronous انجام میشود:
کاربر
→ Frontend
→ Backend
→ API تولید ویدئو
→ صف پردازش
→ Job ID
→ بررسی وضعیت
→ دریافت خروجی
→ ذخیرهسازی
درخواست تولید
Backend اطلاعات زیر را دریافت میکند:
{
"prompt": "A cinematic product video...",
"duration": 5,
"aspect_ratio": "9:16",
"resolution": "1080p",
"generate_audio": false
}
این فقط یک نمونه مفهومی است و ساختار واقعی درخواست به API مورد استفاده بستگی دارد.
پاسخ اولیه
{
"id": "job_8f1a2",
"status": "queued"
}
بررسی وضعیت
{
"id": "job_8f1a2",
"status": "processing",
"progress": 60
}
نتیجه نهایی
{
"id": "job_8f1a2",
"status": "completed",
"output": {
"video_url": "https://storage.example.com/output.mp4"
}
}
نکات فنی برای API ویدئو
کلید API را در Backend نگه دارید
کلید را در کد Frontend، اپ موبایل یا مخزن عمومی قرار ندهید.
DARVAREH_API_KEY=your_api_key
فایل ورودی را اعتبارسنجی کنید
موارد زیر باید کنترل شوند:
- MIME Type
- اندازه فایل
- وضوح
- مدت ویدئو
- نرخ فریم
- تعداد فایلهای مرجع
- نسبت تصویر
- سلامت فایل
از صف استفاده کنید
تولید ویدئو زمانبر است. درخواستها را با Queue مدیریت کنید و تعداد Jobهای همزمان را محدود نگه دارید.
وضعیت را با Polling یا Webhook دریافت کنید
اتصال HTTP کاربر را تا پایان تولید باز نگه ندارید. Job ID را به کاربر بدهید و وضعیت را جداگانه نمایش دهید.
Retry کنترلشده داشته باشید
هر خطا نباید باعث ارسال دوباره درخواست پولی شود. قبل از Retry مشخص کنید آیا Job قبلی ساخته شده است یا خیر.
Idempotency تعریف کنید
اگر شبکه قطع شد، درخواست تکراری نباید دو ویدئو و دو هزینه ایجاد کند. برای هر عملیات یک شناسه یکتا داشته باشید.
خروجی را در Storage خودتان ذخیره کنید
لینک خروجی ممکن است موقت باشد. پس از پایان Job، فایل را به فضای ذخیرهسازی تحت کنترل پروژه منتقل کنید.
محدودیت هزینه قرار دهید
برای هر کاربر یا سازمان موارد زیر را تعریف کنید:
- حداکثر مدت
- حداکثر وضوح
- تعداد Job روزانه
- تعداد تولید همزمان
- سقف هزینه
- مدلهای مجاز
استفاده از مدلهای ویدئویی از طریق درواره
اگر میخواهید قابلیت تولید محتوای هوش مصنوعی را به نرمافزار یا کسبوکار خود اضافه کنید، درواره دسترسی APIمحور به مدلهای مختلف را سادهتر میکند.
از طریق یک لایه یکپارچه میتوانید:
- مدلهای مختلف را ارزیابی کنید.
- وابستگی به یک ارائهدهنده را کاهش دهید.
- قابلیت Fallback بسازید.
- مدل را متناسب با هزینه و کیفیت انتخاب کنید.
- مصرف API را بهتر مدیریت کنید.
- فرایند توسعه محصول AI را سریعتر آغاز کنید.
درواره یک برنامه آماده ساخت ویدئو نیست؛ زیرساخت API برای توسعهدهندگان و کسبوکارهایی است که میخواهند قابلیتهای هوش مصنوعی را در محصول خود پیادهسازی کنند.
موجودبودن Kling یا هر مدل خاص، شناسه دقیق مدل و ویژگیهای آن ممکن است تغییر کند. پیش از پیادهسازی، فهرست مدلها و مستندات فعلی درواره را بررسی کنید.
برای ثبتنام، دریافت API Key و مشاهده سرویسهای موجود به وبسایت درواره مراجعه کنید.
نکات استفاده مسئولانه
هنگام ساخت و انتشار ویدئو با هوش مصنوعی:
- برای استفاده از چهره یا صدای افراد رضایت مناسب داشته باشید.
- محتوای واقعگرایانه را بهعنوان رویداد واقعی معرفی نکنید.
- فایلهای مرجع متعلق به دیگران را بدون مجوز استفاده نکنید.
- ادعاهای تبلیغاتی را بازبینی کنید.
- نوشته و لوگو را فریمبهفریم کنترل کنید.
- خروجی مربوط به افراد واقعی را پیش از انتشار دقیق بررسی کنید.
- محتوای تولیدشده را در کاربردهای حساس بدون نظارت انسانی منتشر نکنید.
پرسشهای متداول
Kling AI چیست؟
Kling AI پلتفرم و خانواده مدلهای تولید تصویر و ویدئو متعلق به شرکت Kuaishou است. این ابزار میتواند از متن، عکس و سایر فایلهای مرجع برای ساخت یا ویرایش ویدئو استفاده کند.
آخرین نسخه Kling چیست؟
در زمان نگارش این مقاله، Kling AI 3.0 جدیدترین خانواده اصلی اعلامشده است و شامل مدلهای Video 3.0، Video 3.0 Omni، Image 3.0 و Image 3.0 Omni میشود.
آیا Kling AI عکس را به ویدئو تبدیل میکند؟
بله. Image to Video یکی از قابلیتهای اصلی Kling است. میتوانید تصویر را وارد و حرکت سوژه، دوربین، نور و صدا را در Prompt تعیین کنید.
آیا Kling AI رایگان است؟
ممکن است اعتبار محدود یا امکانات آزمایشی ارائه شود، اما تولید حرفهای، وضوح بیشتر و مدلهای جدید معمولاً نیازمند اعتبار یا اشتراک هستند.
Kling 3.0 چند ثانیه ویدئو میسازد؟
طبق راهنمای رسمی، Kling Video 3.0 از مدت انعطافپذیر ۳ تا ۱۵ ثانیه پشتیبانی میکند. محدودیت رابطها یا حسابهای مختلف ممکن است متفاوت باشد.
آیا Kling صدا هم تولید میکند؟
بله. حالت Native Audio میتواند همراه با تصویر، دیالوگ، صدای محیط و افکت صوتی ایجاد کند.
آیا Kling از فارسی پشتیبانی میکند؟
میتوان Prompt فارسی را آزمایش کرد، اما فارسی در فهرست رسمی زبانهای Native Audio نسخه 3.0 ذکر نشده است. برای گفتار فارسی، تولید جداگانه صدا و ترکیب آن در تدوین میتواند نتیجه مطمئنتری ایجاد کند.
چگونه چهره را در Kling ثابت نگه داریم؟
از تصویر مرجع واضح، قابلیت Subject یا Element Reference، حرکتهای کنترلشده و دستور صریح حفظ هویت استفاده کنید.
آیا Kling برای تبلیغات محصول مناسب است؟
بله، اما شکل محصول، بستهبندی، لوگو و نوشتهها باید پس از تولید دقیق بررسی شوند.
Kling AI بهتر است یا Veo؟
پاسخ به نوع پروژه بستگی دارد. بهترین روش، آزمایش هر دو مدل با Prompt و فایلهای مرجع یکسان و مقایسه کیفیت، هزینه و نرخ خروجی قابلاستفاده است.
Kling بهتر است یا Seedance؟
هر دو مدل قابلیتهای پیشرفته تولید ویدئو دارند. Kling در Element Reference و گردش کار تولید و ویرایش امکانات مهمی دارد و Seedance نیز از ترکیب گسترده ورودیهای چندوجهی پشتیبانی میکند. نتیجه باید با سناریوی واقعی ارزیابی شود.
آیا Kling API دارد؟
Kling برای توسعهدهندگان و مشتریان سازمانی API ارائه کرده است. شرایط دسترسی، مدلها، قیمت و Endpointها باید از مستندات بهروز سرویس بررسی شوند.
جمعبندی
Kling AI یکی از مهمترین پلتفرمهای ساخت ویدئو با هوش مصنوعی است. Kling Video 3.0 قابلیتهایی مانند تبدیل متن و عکس به ویدئو، تولید کلیپ چندنمایی، حفظ شخصیت مرجع، کنترل نما، تولید صدای بومی و ویرایش چندوجهی را در اختیار تولیدکنندگان محتوا و توسعهدهندگان قرار میدهد.
بااینحال، کیفیت خروجی فقط به قدرت مدل بستگی ندارد. یک نتیجه حرفهای به عوامل زیر نیاز دارد:
- سناریوی روشن
- تصویر مرجع مناسب
- Prompt ساختاریافته
- حرکت محدود و دقیق
- Shot List
- کنترل ثبات شخصیت
- چند مرحله آزمون
- انتخاب انسانی
- تدوین نهایی
برای تولید ویدئوی حرفهای، هوش مصنوعی را باید بخشی از خط تولید محتوا دانست، نه جایگزین کامل سناریونویسی، کارگردانی و تدوین.
اگر قصد دارید مدلهای هوش مصنوعی را از طریق API به وبسایت، اپلیکیشن یا گردش کار سازمانی خود متصل کنید، برای مشاهده سرویسها، ثبتنام و دریافت API Key به درواره مراجعه کنید.
مقالات مرتبط
- بهترین ابزارهای ساخت ویدئو با هوش مصنوعی
- آموزش تبدیل عکس به ویدئو با هوش مصنوعی
- افزایش کیفیت ویدئو با هوش مصنوعی تا 4K
- ساخت محتوا برای اینستاگرام با هوش مصنوعی
- بهترین ابزارهای ساخت تصویر با هوش مصنوعی
- راهنمای جامع مدلهای هوش مصنوعی
- پرامپتنویسی چیست؟ راهنمای جامع Prompt Engineering
- API هوش مصنوعی چیست؟
- راهنمای قیمتگذاری و محاسبه هزینه API هوش مصنوعی