تبدیل ویدئو طولانی به کلیپ کوتاه با هوش مصنوعی؛ آموزش ساخت ریلز و Shorts
در این راهنمای عملی یاد میگیرید چگونه ویدئوهای طولانی، پادکستها و وبینارها را با هوش مصنوعی تحلیل و به کلیپهای کوتاه مناسب اینستاگرام و آپارات شورتس تبدیل کنید.
تولید یک ویدئوی طولانی مانند پادکست، مصاحبه، وبینار، آموزش یا جلسه آنلاین معمولاً به زمان، تجهیزات و برنامهریزی زیادی نیاز دارد. بااینحال، بسیاری از تولیدکنندگان محتوا پس از انتشار نسخه اصلی، استفاده دیگری از آن نمیکنند؛ در حالی که یک ویدئوی یکساعته ممکن است دهها نکته، جمله کلیدی، پاسخ کوتاه و بخش جذاب داشته باشد که میتوان آنها را به ریلز اینستاگرام، YouTube Shorts، کلیپ لینکدین، آپارات شورتس یا ویدئوی کوتاه تبلیغاتی تبدیل کرد.
پیدا کردن این قسمتها بهصورت دستی زمانبر است. باید کل ویدئو را مشاهده کنید، زمان شروع و پایان هر بخش را یادداشت کنید، قاب را از افقی به عمودی تغییر دهید، زیرنویس بسازید و خروجی نهایی را ویرایش کنید.
هوش مصنوعی میتواند بخش بزرگی از این فرایند را سریعتر کند. ابزارهای جدید قادرند ویدئو را رونویسی کنند، موضوعات آن را تشخیص دهند، لحظات مهم را پیشنهاد دهند، تصویر را بهصورت خودکار برای قالب عمودی تنظیم کنند و زیرنویس بسازند.
اما خروجی خوب فقط با فشردن یک دکمه ایجاد نمیشود. برای ساخت کلیپی که واقعاً قابل انتشار و مفید باشد، باید انتخاب نهایی، اصلاح متن، کنترل برش تصویر و بازبینی زیرنویس را جدی بگیرید.
در این مقاله، یک فرایند عملی برای تبدیل ویدئوهای طولانی به کلیپهای کوتاه ارائه میکنیم. همچنین با ابزارهای مناسب، پرامپتهای فارسی و روش استفاده از API هوش مصنوعی درواره برای تحلیل خودکار متن ویدئو آشنا میشویم.
تبدیل ویدئو طولانی به کلیپ کوتاه با هوش مصنوعی چیست؟
تبدیل ویدئو طولانی به کلیپ کوتاه یا AI Video Clipping فرایندی است که در آن، هوش مصنوعی محتوای صوتی و تصویری یک ویدئو را بررسی میکند و بخشهایی را که ظرفیت تبدیل شدن به ویدئوی مستقل دارند، پیشنهاد میدهد.
این فرایند ممکن است شامل مراحل زیر باشد:
- تبدیل گفتار ویدئو به متن
- تشخیص گویندگان
- تقسیم متن به موضوعات مختلف
- پیدا کردن نکات مهم و جملههای قابل نقل
- تعیین زمان شروع و پایان کلیپها
- امتیازدهی به بخشهای پیشنهادی
- حذف مکثها و قسمتهای کماهمیت
- تبدیل کادر افقی به عمودی
- دنبال کردن چهره یا سوژه اصلی
- ساخت زیرنویس خودکار
- تولید عنوان، کپشن و توضیحات انتشار
- اضافه کردن قالب گرافیکی و هویت بصری
ابزارهای مختلف همه این امکانات را با کیفیت یکسان ارائه نمیکنند. بعضی از آنها بیشتر روی انتخاب لحظههای مناسب تمرکز دارند، برخی برای ویرایش مبتنی بر متن ساخته شدهاند و بعضی دیگر در ساخت زیرنویس و تغییر قاب عملکرد بهتری دارند.
چه ویدئوهایی برای تبدیل به کلیپ کوتاه مناسباند؟
تقریباً هر ویدئوی طولانی را میتوان به کلیپهای کوتاهتر تبدیل کرد، اما محتوای گفتوگومحور معمولاً نتیجه بهتری میدهد.
مناسبترین منابع عبارتاند از:
- پادکستهای ویدئویی
- مصاحبههای تخصصی
- وبینارها
- جلسات پرسشوپاسخ
- ویدئوهای آموزشی
- معرفی و بررسی محصول
- کلاسهای ضبطشده
- سخنرانیها
- نشستهای آنلاین
- ویدئوهای یوتیوب
- لایوهای ذخیرهشده
- گزارش رویدادها
- آموزش نرمافزار
- ویدئوهای پشتصحنه
- جلسات داخلی قابل انتشار
بهترین ویدئو برای این کار، ویدئویی است که در آن موضوعات مشخص، پاسخهای مستقل، مثالهای واقعی و جملههای روشن وجود داشته باشد.
برای مثال، یک پادکست ۶۰ دقیقهای درباره بازاریابی ممکن است شامل این بخشها باشد:
- سه اشتباه رایج در تبلیغات
- روش محاسبه هزینه جذب مشتری
- یک تجربه شکست واقعی
- پاسخ به یک تصور اشتباه
- معرفی یک ابزار کاربردی
- ارائه یک چکلیست کوتاه
هرکدام از این بخشها میتواند به یک کلیپ مستقل تبدیل شود.
تفاوت کلیپسازی با خلاصهسازی ویدئو چیست؟
خلاصهسازی ویدئو و ساخت کلیپ کوتاه به هم مرتبطاند، اما هدف یکسانی ندارند.
در خلاصهسازی، هدف این است که مهمترین نکات کل ویدئو در قالب متن یا یک ویدئوی فشرده ارائه شود. ممکن است خلاصه نهایی از چند بخش جداگانه تشکیل شده باشد.
در کلیپسازی، هر خروجی باید تا حد امکان یک واحد محتوایی مستقل باشد. مخاطب نباید برای درک آن مجبور باشد قسمت قبلی پادکست یا مصاحبه را دیده باشد.
یک کلیپ خوب معمولاً:
- یک سؤال یا مسئله مشخص دارد
- بدون مقدمه طولانی شروع میشود
- اطلاعات لازم برای درک موضوع را ارائه میدهد
- به یک نتیجه یا پاسخ قابلفهم میرسد
- در انتها ناقص یا ناگهانی قطع نمیشود
بنابراین ممکن است بخشی برای خلاصه ویدئو مهم باشد، اما بهتنهایی کلیپ مناسبی نباشد.
هوش مصنوعی چگونه بخشهای مناسب را پیدا میکند؟
ابزارهای تبدیل ویدئو به کلیپ معمولاً از ترکیبی از تحلیل متن، صدا و تصویر استفاده میکنند.
۱. رونویسی گفتار
ابتدا صدای ویدئو به متن تبدیل میشود. هر جمله همراه با زمان شروع و پایان آن ثبت میشود.
نمونه ساده:
00:12:08 --> 00:12:14
بزرگترین اشتباه در تولید محتوا این است که بدون شناخت مخاطب شروع کنیم.
00:12:14 --> 00:12:22
قبل از ساخت محتوا باید بدانیم مخاطب چه مسئلهای دارد و چگونه آن را جستوجو میکند.
وجود زمانبندی دقیق به سیستم اجازه میدهد بعد از انتخاب یک قسمت، همان محدوده را از فایل ویدئویی جدا کند.
۲. تقسیمبندی موضوعی
مدل زبانی متن را به بخشهایی با موضوع مشترک تقسیم میکند. برای مثال، یک مصاحبه ممکن است به بخشهای «شروع کسبوکار»، «بازاریابی»، «استخدام» و «مدیریت هزینه» تقسیم شود.
این مرحله مانع از آن میشود که کلیپ از وسط یک بحث شروع یا پیش از کامل شدن پاسخ متوقف شود.
۳. تشخیص جمله آغازین جذاب
سیستم بررسی میکند کدام جمله میتواند در چند ثانیه اول توجه مخاطب را جلب کند.
نمونههای مناسب:
- «بیشتر کسبوکارها در این مرحله یک اشتباه مهم انجام میدهند.»
- «اگر فقط یک شاخص را بررسی میکنید، این شاخص باید نرخ تبدیل باشد.»
- «ما این روش را سه ماه آزمایش کردیم و نتیجه برخلاف انتظارمان بود.»
البته جذاب بودن به معنی اغراق یا ایجاد عنوان گمراهکننده نیست. شروع کلیپ باید با محتوای واقعی آن ارتباط مستقیم داشته باشد.
۴. تشخیص نقطه پایان
کلیپ باید در جایی تمام شود که پاسخ، مثال یا استدلال کامل شده است. برش خودکار گاهی ویدئو را چند ثانیه زودتر قطع میکند؛ بنابراین بررسی انسانی نقطه پایان ضروری است.
۵. تحلیل تصویر و صدا
بعضی ابزارها علاوه بر متن، موارد زیر را هم بررسی میکنند:
- تغییر گوینده
- شدت و انرژی صدا
- مکثها
- تغییر صحنه
- حالت چهره
- حرکت سوژه
- وجود متن یا اسلاید
- لحظات واکنش افراد
این اطلاعات برای ویدئوهای گفتوگومحور، ورزشی، ولاگ و محتوای دارای چند دوربین مفید است.
یک کلیپ کوتاه خوب چه ویژگیهایی دارد؟
هوش مصنوعی میتواند دهها بخش پیشنهاد دهد، اما همه آنها ارزش انتشار ندارند. بهتر است هر کلیپ را بر اساس معیارهای مشخص بررسی کنید.
| معیار | امتیاز پیشنهادی | پرسش کنترل کیفیت |
|---|---|---|
| قابلفهم بودن مستقل | ۲۵ | آیا مخاطب بدون دیدن ویدئوی اصلی موضوع را متوجه میشود؟ |
| قدرت شروع | ۲۰ | آیا چند ثانیه اول باعث ادامه مشاهده میشود؟ |
| نتیجه یا نکته کاربردی | ۲۰ | آیا کلیپ یک پاسخ، تجربه یا نتیجه روشن دارد؟ |
| ارزش آموزشی یا احساسی | ۱۵ | آیا مخاطب چیزی یاد میگیرد یا واکنش معناداری نشان میدهد؟ |
| مناسب بودن تصویر | ۱۰ | آیا برش عمودی، چهره و عناصر مهم را درست نمایش میدهد؟ |
| اقدام بعدی | ۱۰ | آیا کلیپ مخاطب را به تعامل یا مشاهده محتوای بیشتر هدایت میکند؟ |
کلیپهایی که امتیاز بیشتری میگیرند، گزینههای مناسبتری برای انتشار اولیه هستند.
امتیاز هوش مصنوعی را نباید معیار قطعی موفقیت در نظر گرفت. شناخت مخاطب، موضوع صفحه، کیفیت ارائه و زمان انتشار نیز روی نتیجه اثر میگذارند.
آموزش گامبهگام تبدیل ویدئو طولانی به کلیپ کوتاه
مرحله اول: هدف کلیپها را مشخص کنید
قبل از بارگذاری ویدئو، مشخص کنید کلیپها برای چه منظوری ساخته میشوند.
هدف میتواند یکی از موارد زیر باشد:
- افزایش بازدید ویدئوی اصلی
- جذب دنبالکننده
- آموزش یک نکته کوتاه
- معرفی محصول یا خدمت
- پاسخ به سؤالات متداول
- نمایش تخصص فرد یا برند
- هدایت مخاطب به مقاله یا صفحه محصول
- انتشار نکات یک وبینار
- بازنشر بخشهای مهم پادکست
اگر هدف مشخص نباشد، هوش مصنوعی معمولاً بخشهایی را انتخاب میکند که از نظر زبانی جذاباند، اما ممکن است با برنامه محتوایی شما هماهنگ نباشند.
مرحله دوم: ویدئوی منبع را آماده کنید
کیفیت فایل اصلی روی خروجی اثر مستقیم دارد. پیش از پردازش، موارد زیر را بررسی کنید:
- صدای گوینده واضح باشد
- موسیقی پسزمینه از صدای گفتگو بلندتر نباشد
- ابتدا و انتهای ضبط اضافی حذف شود
- نسبت تصویر و رزولوشن مناسب باشد
- فایل دچار قطعی صدا یا فریمهای خراب نباشد
- در صورت وجود چند گوینده، صدای آنها قابل تشخیص باشد
- محتوای اصلی پراکنده و بدون ساختار نباشد
لازم نیست ویدئو کاملاً حرفهای باشد، اما صدای نامفهوم باعث ایجاد رونویسی اشتباه و در نتیجه انتخاب کلیپهای ضعیف میشود.
مرحله سوم: گفتار را به متن تبدیل کنید
در این مرحله باید یک Transcript زمانبندیشده یا فایل زیرنویس مانند SRT ایجاد شود.
نمونه ساختار SRT:
1
00:00:04,200 --> 00:00:08,700
امروز میخواهیم درباره روش ساخت تقویم محتوایی صحبت کنیم.
2
00:00:08,700 --> 00:00:14,300
اولین اشتباه این است که موضوعات را بدون بررسی نیاز مخاطب انتخاب کنیم.
برای محتوای فارسی، متن رونویسیشده را از نظر موارد زیر بازبینی کنید:
- نام افراد و برندها
- کلمات تخصصی انگلیسی
- اعداد
- نیمفاصله
- نشانهگذاری
- کلمات مشابه از نظر تلفظ
- جملههایی که چند گوینده همزمان بیان کردهاند
اگر ابزار رونویسی از زبان فارسی پشتیبانی مناسبی ندارد، میتوانید ابتدا صدا را با یک سرویس تبدیل گفتار به متن پردازش کرده و سپس Transcript را وارد فرایند انتخاب کلیپ کنید.
مرحله چهارم: متن را به بخشهای موضوعی تقسیم کنید
برای ویدئوهای کوتاه، میتوان کل Transcript را یکجا تحلیل کرد. برای ویدئوهای طولانیتر بهتر است متن را به بخشهای کوچکتر تقسیم کنید.
تقسیمبندی صرفاً بر اساس تعداد کاراکتر ممکن است جمله یا بحث را از وسط جدا کند. روش مناسبتر این است که متن را بر اساس یکی از موارد زیر تقسیم کنید:
- تغییر موضوع
- تغییر گوینده
- سؤال و پاسخ
- فصلهای ویدئو
- بازههای زمانی پنج تا ده دقیقهای
- سکوت یا تغییر صحنه
هر بخش باید زمان شروع و پایان خود را حفظ کند.
مرحله پنجم: از هوش مصنوعی بخواهید کلیپهای پیشنهادی را پیدا کند
میتوانید Transcript را در اختیار یک مدل زبانی قرار دهید و از آن بخواهید قسمتهای مستقل و قابل انتشار را مشخص کند.
پرامپت پیشنهادی:
نقش تو ویراستار حرفهای ویدئوهای کوتاه فارسی است.
متن زمانبندیشده یک ویدئوی طولانی را بررسی کن و 10 بخش مناسب برای تبدیل شدن به کلیپ کوتاه پیشنهاد بده.
شرایط:
- هر کلیپ باید بدون مشاهده قسمتهای قبلی قابلفهم باشد.
- شروع و پایان بحث کامل باشد.
- کلیپ باید یک نکته آموزشی، تجربه، پاسخ یا نتیجه روشن داشته باشد.
- از بخشهای دارای مقدمه طولانی، تکرار، تبلیغ مستقیم یا جمله ناقص استفاده نکن.
- زمان شروع و پایان دقیق را از متن استخراج کن.
- برای هر کلیپ یک عنوان فارسی کوتاه بنویس.
- یک جمله پیشنهادی برای متن روی کاور ارائه بده.
- دلیل انتخاب را در یک جمله توضیح بده.
- به هر کلیپ از 100 امتیاز بده.
- متن یا منظور گوینده را تغییر نده.
خروجی را بهصورت JSON ارائه بده.
ساختار خروجی پیشنهادی:
{
"clips": [
{
"start": "00:12:08",
"end": "00:13:02",
"title": "اشتباه اصلی در تولید محتوا",
"cover_text": "قبل از تولید محتوا این کار را انجام بده",
"reason": "بخش مستقل است و یک اشتباه رایج را همراه با راهحل توضیح میدهد.",
"score": 91
}
]
}
دریافت خروجی ساختیافته باعث میشود بتوانید مرحله انتخاب و برش را بهصورت خودکار ادامه دهید.
مرحله ششم: پیشنهادهای هوش مصنوعی را بازبینی کنید
قبل از برش فایل، هر قسمت را در ویدئوی اصلی مشاهده کنید.
موارد زیر را کنترل کنید:
- جمله اول از وسط یک بحث شروع نشده باشد
- ضمیرهایی مانند «این»، «آنها» یا «همان روش» بدون مرجع نباشند
- پاسخ گوینده کامل شده باشد
- مکث طولانی در ابتدا وجود نداشته باشد
- مثال یا نتیجه اصلی حذف نشده باشد
- تصویر گوینده یا اسلاید مرتبط در دسترس باشد
- برش باعث تغییر معنای صحبت نشده باشد
گاهی کافی است شروع کلیپ را پنج ثانیه عقبتر یا پایان آن را چند ثانیه جلوتر ببرید تا بخش انتخابشده مستقل و قابلفهم شود.
مرحله هفتم: ویدئو را برش دهید
برای این کار میتوانید از ویرایشگرهای ویدئویی یا FFmpeg استفاده کنید.
نمونه استخراج یک بخش با FFmpeg:
ffmpeg -ss 00:12:08 -to 00:13:02 -i input.mp4 \
-c:v libx264 -c:a aac -movflags +faststart clip-01.mp4
در این دستور:
-ssزمان شروع است-toزمان پایان استinput.mp4فایل اصلی استclip-01.mp4فایل خروجی است
اگر کیفیت و سرعت برش برایتان اهمیت دارد، تنظیمات کدک، نرخ بیت و روش Seek را متناسب با فرایند تولید خود تغییر دهید.
مرحله هشتم: قاب افقی را به عمودی تبدیل کنید
بیشتر ویدئوهای طولانی با نسبت 16:9 ضبط میشوند، اما قالب رایج کلیپهای کوتاه عمودی 9:16 است.
تبدیل ساده 16:9 به 9:16 ممکن است قسمتهای مهم تصویر را حذف کند. برای جلوگیری از این مشکل میتوان از روشهای زیر استفاده کرد:
- دنبال کردن خودکار چهره
- قرار دادن دو گوینده در بالا و پایین قاب
- قراردادن ویدئوی اصلی در مرکز و استفاده از پسزمینه محو
- تغییر قاب هنگام عوض شدن گوینده
- نمایش اسلاید در بالا و گوینده در پایین
- بزرگنمایی بخش فعال در ویدئوهای آموزشی
- استفاده از نسخه ضبطشده جداگانه هر دوربین
در CapCut قابلیتهای برش خودکار، تغییر اندازه و دنبال کردن سوژه برای تبدیل ویدئوی طولانی به قالب عمودی ارائه شده است. صفحه رسمی این ابزار، تبدیل قالب 16:9 به 9:16 و تشخیص خودکار بخشهای مهم را از امکانات AI Clip Maker معرفی میکند. برای مشاهده جزئیات به صفحه رسمی ابزار Long Video to Shorts در CapCut مراجعه کنید.
در یوتیوب نیز قابلیت Auto Layout برای دنبال کردن سوژه و تنظیم خودکار قاب هنگام تبدیل محتوای طولانی به Shorts معرفی شده است. توضیحات این قابلیت در وبلاگ رسمی یوتیوب منتشر شده است.
مرحله نهم: زیرنویس فارسی اضافه کنید
بخش قابلتوجهی از کاربران، ویدئوهای شبکههای اجتماعی را ابتدا بدون صدا مشاهده میکنند. زیرنویس باید حتی در صفحه کوچک تلفن همراه خوانا باشد.
برای زیرنویس فارسی این نکات را رعایت کنید:
- متن را بیش از حد به لبههای تصویر نزدیک نکنید
- در هر قاب از عبارتهای کوتاه استفاده کنید
- فونت فارسی خوانا انتخاب کنید
- کلمات کلیدی را با رنگ محدود برجسته کنید
- از نمایش چند خط بلند بهصورت همزمان خودداری کنید
- نیمفاصله و علائم نگارشی را اصلاح کنید
- جهت راستبهچپ را بررسی کنید
- ترکیب کلمات فارسی و انگلیسی را در خروجی نهایی کنترل کنید
- زمان ورود و خروج زیرنویس با صدا هماهنگ باشد
زیرنویس خودکار را بدون بازبینی منتشر نکنید. اشتباه در نام برند، اصطلاح تخصصی یا عدد میتواند معنای صحبت را تغییر دهد.
مرحله دهم: عنوان و Hook را تنظیم کنید
گاهی جمله آغازین کلیپ برای حفظ مخاطب کافی نیست. در این حالت میتوانید یک متن کوتاه روی تصویر قرار دهید؛ بدون اینکه سخنان گوینده را تغییر دهید.
مثال:
گفتار اصلی:
وقتی دادههای سه ماه گذشته را بررسی کردیم، متوجه شدیم کانالی که کمترین بودجه را داشت بیشترین مشتری را ایجاد کرده است.
متن پیشنهادی روی تصویر:
بیشترین فروش از کمهزینهترین کانال آمد
عنوان روی تصویر باید:
- کوتاه باشد
- به نتیجه واقعی کلیپ اشاره کند
- وعده گمراهکننده ندهد
- در چند ثانیه قابل خواندن باشد
- با نیاز مخاطب ارتباط داشته باشد
مرحله یازدهم: صدا را اصلاح کنید
کیفیت صدا معمولاً از جلوههای تصویری مهمتر است. حداقل این موارد را بررسی کنید:
- حذف نویز یکنواخت
- کاهش صدای محیط
- تنظیم بلندی صدای گویندگان
- حذف مکثهای غیرضروری
- کاهش صداهای تنفسی شدید
- کنترل موسیقی پسزمینه
- جلوگیری از اعوجاج صدا
- ایجاد شروع و پایان نرم
اگر دو نفر با شدت صدای متفاوت صحبت میکنند، بلندی صدای آنها را تا حد ممکن یکدست کنید.
مرحله دوازدهم: هویت بصری و CTA اضافه کنید
برای ایجاد انسجام بین کلیپها میتوانید یک قالب ثابت بسازید که شامل این موارد باشد:
- فونت مشخص
- رنگ برند
- لوگوی کوچک
- جایگاه ثابت زیرنویس
- سبک یکسان عنوان
- پایانبندی کوتاه
- دعوت به اقدام متناسب با هدف
نمونه CTA:
- نسخه کامل را در کانال مشاهده کنید
- برای آموزشهای بیشتر صفحه را دنبال کنید
- راهنمای کامل در وبسایت منتشر شده است
- نظر شما درباره این روش چیست؟
- برای دریافت قسمت بعدی ذخیره کنید
CTA باید کوتاه و مرتبط با کلیپ باشد. قرار دادن چند دعوت به اقدام مختلف در یک ویدئوی کوتاه معمولاً باعث سردرگمی میشود.
بهترین ابزارهای تبدیل ویدئو طولانی به کلیپ کوتاه
OpusClip
OpusClip یک ابزار تخصصی برای تبدیل ویدئوهای طولانی به کلیپهای کوتاه است. این سرویس میتواند بخشهای پیشنهادی را پیدا کند، زیرنویس بسازد، کادر را تغییر دهد و خروجی مناسب شبکههای اجتماعی ایجاد کند.
طبق وبسایت رسمی OpusClip، این ابزار امکاناتی مانند AI Clipping، زیرنویس خودکار، بازتنظیم قاب، بهبود صدا، B-roll و قالبهای برند را ارائه میدهد.
روش کلی استفاده:
- فایل ویدئو یا لینک منبع را وارد کنید.
- موضوع یا نوع کلیپ موردنظر را مشخص کنید.
- اجازه دهید ابزار بخشهای پیشنهادی را ایجاد کند.
- کلیپها و امتیازهای پیشنهادی را بررسی کنید.
- زیرنویس و کادر را اصلاح کنید.
- قالب برند را اعمال کنید.
- خروجی بگیرید.
این ابزار برای پادکست، مصاحبه، وبینار و ویدئوهای گفتوگومحور مناسب است؛ اما کیفیت پشتیبانی از زبان فارسی و زیرنویس فارسی باید روی نمونه واقعی خودتان آزمایش شود.
Descript
Descript یک ویرایشگر صوت و ویدئو مبتنی بر متن است. بعد از رونویسی ویدئو، میتوانید با ویرایش متن، قسمتهای ویدئو را حذف یا جابهجا کنید.
قابلیت Create Clips در Descript محتوای طولانی را تحلیل میکند و نسخههای کوتاه قابل ویرایش میسازد. براساس مستندات رسمی Descript، کاربر میتواند تعداد کلیپ، مدت تقریبی، قالب عمودی یا مربعی و معیار انتخاب موضوع را تعیین کند.
مزیت مهم Descript این است که پس از تولید خودکار، هر کلیپ بهصورت یک Composition مستقل قابل ویرایش باقی میماند. این ویژگی برای تیمهایی که میخواهند انتخاب هوش مصنوعی را با ویرایش انسانی ترکیب کنند مفید است.
CapCut
CapCut برای ویرایش سریع در تلفن همراه و دسکتاپ مناسب است و ابزارهایی برای برش خودکار، زیرنویس، تغییر نسبت تصویر، دنبال کردن سوژه و ساخت قالبهای شبکه اجتماعی دارد.
اگر هوش مصنوعی بخشهای مناسب را انتخاب کرده باشد، میتوانید مرحله تدوین نهایی، زیرنویس و خروجی عمودی را در CapCut انجام دهید.
Adobe Express Clip Maker
Adobe Express نیز قابلیت Clip Maker را برای استخراج کلیپ از ویدئوهای طولانی ارائه میکند. بااینحال، براساس راهنمای رسمی Adobe Express، زبان پشتیبانیشده این قابلیت در زمان نگارش مقاله انگلیسی اعلام شده است. بنابراین برای ویدئوهای فارسی، پیش از انتخاب این ابزار حتماً یک نمونه واقعی را آزمایش کنید.
ویرایشگرهای حرفهای
اگر کنترل دقیقتری لازم دارید، میتوانید تحلیل و انتخاب زمانها را با هوش مصنوعی انجام دهید و تدوین نهایی را در یکی از این ابزارها ادامه دهید:
- Adobe Premiere Pro
- DaVinci Resolve
- Final Cut Pro
- CapCut Desktop
در این روش، هوش مصنوعی جای تدوینگر را نمیگیرد؛ بلکه مرحله زمانبر مشاهده کامل ویدئو و پیدا کردن قسمتهای مناسب را کوتاه میکند.
انتخاب مدت مناسب برای کلیپ
یک مدت ثابت برای همه محتواها وجود ندارد. طول مناسب به موضوع، ریتم صحبت، پلتفرم و میزان اطلاعات لازم بستگی دارد.
برای مثال:
- یک پاسخ مستقیم ممکن است در ۲۰ تا ۴۰ ثانیه کامل شود
- یک نکته آموزشی ممکن است ۴۰ تا ۹۰ ثانیه زمان نیاز داشته باشد
- یک داستان یا تحلیل کوتاه ممکن است بیش از یک دقیقه طول بکشد
یوتیوب در حال حاضر امکان انتشار Shorts تا سه دقیقه را برای ویدئوهای واجد شرایط فراهم کرده است. براساس راهنمای رسمی YouTube، ویدئوهای عمودی یا مربعی تا سه دقیقه میتوانند در دسته Shorts قرار بگیرند.
آپارات شورتس هم امکان انتشار ویدئوهای کوتاه را برای ویدئوهای واجد شرایط فراهم کرده است.
با وجود این، نباید صرفاً به دلیل وجود سقف سهدقیقهای، همه کلیپها را طولانی کرد. هر کلیپ باید فقط به اندازهای ادامه پیدا کند که وعده آغازین آن کامل شود.
روش عملی تبدیل یک پادکست ۶۰ دقیقهای به ۱۲ کلیپ
فرض کنید یک پادکست ویدئویی ۶۰ دقیقهای در اختیار دارید.
فرایند پیشنهادی:
مرحله تحلیل اولیه
- استخراج صدای ویدئو
- ساخت Transcript زمانبندیشده
- اصلاح خطاهای مهم متن
- تقسیم محتوا به شش بخش دهدقیقهای
مرحله استخراج نامزدها
از هر بخش بخواهید سه کلیپ پیشنهادی استخراج شود. در پایان ۱۸ نامزد خواهید داشت.
مرحله امتیازدهی
هر نامزد را بر اساس جدول ارزیابی مقاله امتیازدهی کنید.
برای نمونه:
وضوح مستقل: 23 از 25
قدرت شروع: 17 از 20
نتیجه کاربردی: 19 از 20
ارزش آموزشی: 14 از 15
کیفیت تصویر: 8 از 10
CTA: 7 از 10
امتیاز نهایی: 88 از 100
مرحله انتخاب
از میان ۱۸ نامزد، ۱۲ کلیپ را انتخاب کنید. بهتر است موضوعات کلیپها تکراری نباشند.
مرحله تدوین
برای هر کلیپ:
- نقطه شروع و پایان را اصلاح کنید
- قاب عمودی بسازید
- زیرنویس اضافه کنید
- عنوان روی تصویر بنویسید
- صدای گوینده را تنظیم کنید
- خروجی آزمایشی بگیرید
مرحله انتشار
همه کلیپها را در یک روز منتشر نکنید. آنها را در یک برنامه محتوایی قرار دهید و براساس عملکرد کلیپهای اول، نحوه تدوین یا انتخاب قسمتهای بعدی را اصلاح کنید.
استفاده از API درواره برای تحلیل Transcript و انتخاب کلیپ
اگر بهصورت مداوم پادکست، وبینار، دوره یا ویدئوی آموزشی تولید میکنید، میتوانید فرایند تحلیل متن و انتخاب کلیپها را با API خودکار کنید.
درواره زیرساخت دسترسی به مدلهای هوش مصنوعی را از طریق API فراهم میکند. در این معماری، ابزار شما Transcript را آماده میکند و مدل زبانی از طریق API درواره، بخشهای مناسب، عنوانها و امتیازها را استخراج میکند.
درواره یک ویرایشگر نهایی ویدئو نیست. وظیفه برش فیزیکی فایل، تغییر قاب و رندر باید توسط ابزار ویدئویی، FFmpeg یا سرویس تدوین انجام شود.
معماری ساده سیستم:
ویدئوی اصلی
↓
تبدیل گفتار به متن همراه با زمانبندی
↓
تقسیم Transcript به بخشهای کوچک
↓
تحلیل بخشها با API درواره
↓
دریافت زمان شروع، پایان، عنوان و امتیاز
↓
بازبینی انسانی
↓
برش ویدئو و ساخت خروجی عمودی
↓
زیرنویس، برندینگ و انتشار
نمونه درخواست با cURL
ابتدا از درواره API Key دریافت کنید. سپس Model ID مناسب را از فهرست مدلهای درواره انتخاب کنید.
curl https://api.darvareh.ir/v1/chat/completions \
-H "Authorization: Bearer YOUR_DARVAREH_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "YOUR_MODEL_ID",
"temperature": 0.2,
"messages": [
{
"role": "system",
"content": "تو یک ویراستار حرفهای ویدئوهای کوتاه فارسی هستی. خروجی را فقط بهصورت JSON معتبر ارائه کن."
},
{
"role": "user",
"content": "متن زمانبندیشده زیر را تحلیل کن و حداکثر 5 کلیپ مستقل پیشنهاد بده. برای هر کلیپ start، end، title، cover_text، reason و score را برگردان. کلیپ نباید از وسط جمله یا بحث شروع شود و باید نتیجه روشن داشته باشد.\n\n00:12:08 --> 00:12:14\nبزرگترین اشتباه در تولید محتوا این است که بدون شناخت مخاطب شروع کنیم.\n\n00:12:14 --> 00:12:22\nقبل از ساخت محتوا باید بدانیم مخاطب چه مسئلهای دارد و چگونه آن را جستوجو میکند."
}
]
}'
در کد بالا:
YOUR_DARVAREH_API_KEYبا کلید API درواره جایگزین میشودYOUR_MODEL_IDهمان Model ID انتخابشده از درواره است- مقدار پایین
temperatureبه خروجی باثباتتر کمک میکند - زمان شروع و پایان باید در متن ورودی حفظ شود
- خروجی JSON برای پردازش برنامهنویسی مناسبتر است
برای مشاهده مدلهای در دسترس و قیمت بهروز آنها، صفحه مدلهای درواره را بررسی کنید.
نمونه پیادهسازی با Python
import json
import requests
API_KEY = "YOUR_DARVAREH_API_KEY"
MODEL_ID = "YOUR_MODEL_ID"
transcript = """
00:12:08 --> 00:12:14
بزرگترین اشتباه در تولید محتوا این است که بدون شناخت مخاطب شروع کنیم.
00:12:14 --> 00:12:22
قبل از ساخت محتوا باید بدانیم مخاطب چه مسئلهای دارد و چگونه آن را جستوجو میکند.
"""
prompt = f"""
متن زمانبندیشده زیر را تحلیل کن و بخشهای مناسب برای کلیپ کوتاه را پیدا کن.
شرایط:
- هر کلیپ مستقل و قابلفهم باشد.
- شروع و پایان آن کامل باشد.
- زمانها فقط از Transcript استخراج شوند.
- برای هر کلیپ عنوان، متن کاور، دلیل انتخاب و امتیاز ارائه شود.
- خروجی فقط JSON معتبر باشد.
Transcript:
{transcript}
"""
response = requests.post(
"https://api.darvareh.ir/v1/chat/completions",
headers={
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json",
},
json={
"model": MODEL_ID,
"temperature": 0.2,
"messages": [
{
"role": "system",
"content": "تو ویراستار حرفهای ویدئوهای کوتاه فارسی هستی.",
},
{
"role": "user",
"content": prompt,
},
],
},
timeout=120,
)
response.raise_for_status()
data = response.json()
content = data["choices"][0]["message"]["content"]
clips = json.loads(content)
print(json.dumps(clips, ensure_ascii=False, indent=2))
در محیط عملیاتی باید موارد زیر را نیز اضافه کنید:
- مدیریت خطاهای شبکه
- محدودیت زمان درخواست
- تلاش مجدد با فاصله زمانی
- اعتبارسنجی JSON
- بررسی ترتیب زمان شروع و پایان
- جلوگیری از کلیپهای همپوشان
- ثبت لاگ
- ذخیره نتایج برای استفاده مجدد
جلوگیری از پیشنهاد کلیپهای همپوشان
ممکن است مدل چند کلیپ با محدوده زمانی مشابه پیشنهاد دهد. برای مثال:
کلیپ اول: 00:12:08 تا 00:13:02
کلیپ دوم: 00:12:35 تا 00:13:20
اگر محتوای این دو کلیپ بسیار مشابه است، بهتر است فقط گزینه قویتر را نگه دارید.
فرایند پیشنهادی:
- کلیپها را براساس زمان شروع مرتب کنید.
- درصد همپوشانی زمانی را محاسبه کنید.
- اگر همپوشانی از حد موردنظر بیشتر بود، امتیازها را مقایسه کنید.
- کلیپ ضعیفتر را حذف یا محدوده آن را اصلاح کنید.
- نتیجه نهایی را بهصورت انسانی بازبینی کنید.
پرامپتهای کاربردی برای ساخت کلیپ
پرامپت پیدا کردن لحظات آموزشی
این Transcript را بررسی کن و بخشهایی را پیدا کن که یک آموزش، روش اجرایی، چکلیست یا پاسخ روشن ارائه میدهند.
بخشهای انگیزشی کلی، مقدمههای طولانی و تبلیغات را انتخاب نکن.
برای هر بخش:
- زمان شروع
- زمان پایان
- نکته اصلی
- عنوان پیشنهادی
- دلیل مفید بودن برای مخاطب
- امتیاز از 100
را ارائه بده.
پرامپت پیدا کردن جملههای قابل نقل
از متن زیر جملههایی را پیدا کن که کوتاه، دقیق، قابل نقل و بدون نیاز به توضیح قبلی باشند.
برای هر جمله، 15 ثانیه قبل و بعد آن را نیز بررسی کن و یک محدوده زمانی کامل برای ساخت کلیپ پیشنهاد بده.
پرامپت انتخاب کلیپ برای اینستاگرام
از این Transcript پنج کلیپ مناسب ریلز اینستاگرام انتخاب کن.
مخاطب هدف:
[توضیح مخاطب]
هدف صفحه:
[هدف صفحه]
هر کلیپ باید:
- شروع سریع داشته باشد
- فقط یک ایده اصلی را بیان کند
- برای مخاطب عمومی قابلفهم باشد
- نتیجه یا توصیه مشخص داشته باشد
- بدون مقدمه پادکست قابل انتشار باشد
پرامپت ساخت عنوان و کپشن
برای کلیپ زیر موارد زیر را تولید کن:
1. پنج عنوان کوتاه برای متن روی ویدئو
2. یک کپشن فارسی طبیعی
3. یک سؤال برای افزایش تعامل
4. یک CTA کوتاه
5. پنج کلیدواژه مرتبط
از عنوان اغراقآمیز یا وعدهای که در کلیپ پاسخ داده نمیشود استفاده نکن.
پرامپت کنترل کیفیت
این کلیپ و Transcript آن را مانند ویراستار ارشد بررسی کن.
مشخص کن:
- آیا شروع کلیپ مستقل و قابلفهم است؟
- آیا ضمیر یا اشاره مبهم وجود دارد؟
- آیا پایان کلیپ کامل است؟
- آیا عنوان با محتوای واقعی تطابق دارد؟
- آیا جملهای خارج از بافت به نظر میرسد؟
- آیا بخش اضافی قابل حذف وجود دارد؟
- نقطه شروع و پایان بهتر چیست؟
در پایان یکی از وضعیتهای «آماده انتشار»، «نیازمند ویرایش» یا «نامناسب برای انتشار» را انتخاب کن.
کاهش هزینه پردازش با API
ارسال کل Transcript یک ویدئوی چندساعته در هر درخواست ممکن است غیرضروری و پرهزینه باشد.
برای بهینهسازی:
Transcript را یکبار تولید کنید
متن و زمانبندی را ذخیره کنید تا برای تولید عنوان، کپشن و تحلیلهای بعدی دوباره نیازی به رونویسی نباشد.
تحلیل را مرحلهای انجام دهید
ابتدا با یک مدل اقتصادی، بخشهای اولیه را استخراج کنید. سپس فقط نامزدهای برتر را با مدل قویتر ارزیابی کنید.
متن را به قطعات منطقی تقسیم کنید
بهجای ارسال کل فایل، هر موضوع یا بازه زمانی را جداگانه پردازش کنید. چند جمله قبل و بعد از مرز هر بخش را نیز نگه دارید تا بافت از بین نرود.
خروجیهای قبلی را ذخیره کنید
اگر کاربر همان ویدئو را با معیار مشابه تحلیل کرد، نتیجه قبلی را از حافظه یا پایگاه داده بازیابی کنید.
فقط نامزدهای نهایی را بازنویسی کنید
برای همه قسمتهای پیشنهادی، عنوان و کپشنهای متعدد نسازید. ابتدا کلیپها را انتخاب کرده و سپس محتوای انتشار را فقط برای گزینههای نهایی تولید کنید.
اشتباهات رایج در ساخت کلیپ با هوش مصنوعی
شروع از وسط جمله
کلیپ ممکن است با عبارتهایی مانند «همانطور که گفتم» یا «این روش» شروع شود. مخاطب جدید نمیداند منظور گوینده چیست.
اعتماد کامل به امتیاز وایرال شدن
امتیاز ابزار فقط یک تخمین است و موفقیت قطعی را تضمین نمیکند. ارتباط موضوع با مخاطب مهمتر است.
حذف بخش نتیجه
گاهی ابزار جمله جذاب را انتخاب میکند، اما قبل از ارائه نتیجه کلیپ را پایان میدهد. چند ثانیه بعد از زمان پیشنهادی را نیز بررسی کنید.
قاببندی اشتباه
در تبدیل افقی به عمودی ممکن است چهره مهمان، اسلاید یا محصول از قاب خارج شود. تمام کلیپ را یکبار در اندازه تلفن همراه مشاهده کنید.
زیرنویس اشتباه فارسی
خطا در کلمه تخصصی، عدد یا نام میتواند اعتبار محتوا را کاهش دهد. زیرنویس را جملهبهجمله بررسی کنید.
استفاده بیش از حد از افکت
زوم مداوم، زیرنویس شلوغ و تغییر سریع تصویر ممکن است تمرکز مخاطب را از محتوای اصلی بگیرد.
انتشار یک نسخه کاملاً یکسان در همه پلتفرمها
موضوع، طول مناسب، متن توضیحات و رفتار مخاطب در هر پلتفرم متفاوت است. میتوانید هسته کلیپ را ثابت نگه دارید، اما بستهبندی آن را متناسب با کانال تغییر دهید.
نبود بازبینی انسانی
مدل نمیتواند همیشه حساسیتهای زبانی، بافت صحبت، شوخی، کنایه یا پیام برند را درست تشخیص دهد. خروجی نهایی باید توسط انسان بررسی شود.
چه شاخصهایی را بعد از انتشار بررسی کنیم؟
برای بهتر کردن فرایند انتخاب کلیپ، فقط تعداد بازدید را بررسی نکنید.
شاخصهای مفید شامل این موارد هستند:
- نگهداشت مخاطب در ثانیههای ابتدایی
- میانگین زمان مشاهده
- درصد تکمیل ویدئو
- تعداد بازپخش
- ذخیرهسازی
- اشتراکگذاری
- نظرها
- بازدید پروفایل
- کلیک روی لینک
- مشاهده نسخه کامل
- دنبالکردن صفحه پس از مشاهده کلیپ
پس از انتشار چند کلیپ، ویژگیهای نمونههای موفق را ثبت کنید:
- موضوع
- جمله آغازین
- طول
- نوع زیرنویس
- وجود چهره یا اسلاید
- زمان انتشار
- نوع CTA
- میزان تخصصی بودن محتوا
این دادهها را میتوان در تحلیلهای بعدی به مدل داد تا کلیپهای پیشنهادی به رفتار واقعی مخاطبان شما نزدیکتر شوند.
چکلیست نهایی پیش از انتشار
پیش از انتشار هر کلیپ، این موارد را بررسی کنید:
- موضوع بدون مشاهده ویدئوی اصلی قابلفهم است
- جمله اول ناقص نیست
- شروع کلیپ سریع است
- عنوان با محتوای واقعی تطابق دارد
- نتیجه یا پاسخ کامل ارائه میشود
- برش تصویر درست است
- چهره و عناصر مهم دیده میشوند
- زیرنویس فارسی اصلاح شده است
- صدا واضح و متعادل است
- موسیقی مزاحم گفتار نیست
- لوگو و قالب بصری بیش از حد بزرگ نیست
- CTA کوتاه و مرتبط است
- نسخه نهایی روی تلفن همراه بررسی شده است
- نام فایل و اطلاعات انتشار مشخص است
- از محتوایی استفاده شده که اجازه انتشار آن را دارید
پرسشهای متداول
آیا هوش مصنوعی میتواند خودش بهترین قسمت ویدئو را پیدا کند؟
بله، ابزارهای جدید میتوانند با تحلیل متن، صدا و تصویر بخشهای مناسب را پیشنهاد دهند. بااینحال، بهترین قسمت همیشه به هدف صفحه و مخاطب بستگی دارد؛ بنابراین انتخاب نهایی باید بازبینی شود.
آیا میتوان ویدئوی فارسی را بهصورت خودکار به ریلز تبدیل کرد؟
بله، اما کیفیت تشخیص گفتار فارسی، زیرنویس و راستبهچپ در ابزارهای مختلف یکسان نیست. پیش از خرید یا پردازش تعداد زیادی ویدئو، یک نمونه واقعی را آزمایش کنید.
برای تبدیل پادکست به کلیپ به تدوینگر نیاز داریم؟
برای حجم کم میتوان با ابزارهای خودکار کار را انجام داد. برای تولید حرفهای، اصلاح قاب، زیرنویس، ریتم و هویت بصری همچنان به بازبینی فردی آشنا با تدوین نیاز است.
آیا میتوان فقط با Transcript کلیپها را پیدا کرد؟
بله. Transcript زمانبندیشده برای پیدا کردن بخشهای گفتاری مناسب کافی است. اما برای بررسی کیفیت تصویر، واکنش چهره، اسلایدها و تغییر صحنه باید ویدئو نیز مشاهده شود.
بهترین قالب برای کلیپ کوتاه چیست؟
برای شبکههای اجتماعی و Shorts معمولاً قالب عمودی 9:16 انتخاب مناسبی است. بااینحال، بهتر است مشخصات بهروز هر پلتفرم را پیش از خروجی نهایی بررسی کنید.
آیا درواره خودش ویدئو را برش میدهد؟
درواره زیرساخت API مدلهای هوش مصنوعی را فراهم میکند. میتوانید از مدلها برای تحلیل Transcript، امتیازدهی کلیپها، ساخت عنوان، کپشن و خروجی JSON استفاده کنید. برش، تغییر قاب و رندر فایل باید با ابزارهای ویدئویی انجام شود.
آیا میتوان این فرایند را کاملاً خودکار کرد؟
از نظر فنی میتوان یک خط پردازش خودکار ساخت، اما بهتر است پیش از انتشار مرحله تأیید انسانی وجود داشته باشد. انتخاب نامناسب زمانها، خطای زیرنویس یا قاببندی ناقص ممکن است کیفیت خروجی را کاهش دهد.
جمعبندی
تبدیل ویدئوهای طولانی به کلیپهای کوتاه یکی از کاربردیترین روشهای بازاستفاده از محتوا است. یک پادکست، وبینار یا آموزش طولانی میتواند به مجموعهای از ریلزها و Shorts تبدیل شود و برای مدت بیشتری در برنامه محتوایی مورد استفاده قرار بگیرد.
هوش مصنوعی میتواند رونویسی، تقسیمبندی موضوعی، پیدا کردن لحظههای مناسب، امتیازدهی، ساخت عنوان و تولید زیرنویس را سریعتر کند. بااینحال، کیفیت نهایی به بازبینی انسانی، انتخاب درست نقطه شروع و پایان، اصلاح زیرنویس فارسی، قاببندی مناسب و شناخت مخاطب وابسته است.
اگر قصد دارید یک سامانه خودکار برای تحلیل Transcript، انتخاب کلیپ، تولید عنوان و آمادهسازی اطلاعات تدوین بسازید، میتوانید از API هوش مصنوعی درواره استفاده کنید. درواره امکان دسترسی برنامهنویسی به مدلهای مختلف را از یک API یکپارچه فراهم میکند و میتواند هسته هوش مصنوعی فرایند بازتولید محتوای ویدئویی شما باشد.
مقالات مرتبط
- آموزش ویرایش ویدئو با هوش مصنوعی
- آموزش تولید محتوا برای یوتیوب با هوش مصنوعی
- خلاصه کردن ویدئوی یوتیوب با هوش مصنوعی
- ساخت زیرنویس خودکار فارسی و فایل SRT با هوش مصنوعی
- آموزش نوشتن سناریوی ویدئو با هوش مصنوعی
- تولید محتوای اینستاگرام با هوش مصنوعی
- حذف نویز صدا با هوش مصنوعی
- افزایش کیفیت ویدئو تا 4K با هوش مصنوعی
- بهترین ابزارهای ساخت ویدئو با هوش مصنوعی
برای مطالعه شرایط استفاده و محدودیتهای مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.