خلاصه کردن ویدیو با هوش مصنوعی؛ آموزش خلاصه یوتیوب و فایل ویدیویی فارسی
در این آموزش یاد میگیرید ویدیوهای یوتیوب، کلاس، وبینار و فایلهای فارسی را با هوش مصنوعی به متن، خلاصه، نکات کلیدی و یادداشتهای دارای تایمکد تبدیل کنید.
تماشای یک ویدیوی آموزشی یکساعته، وبینار دوساعته یا مصاحبه طولانی همیشه امکانپذیر نیست. در بسیاری از مواقع فقط میخواهیم بدانیم ویدیو درباره چیست، چه نکات مهمی دارد و کدام بخشهای آن ارزش تماشاکردن دارند.
هوش مصنوعی میتواند محتوای ویدیو را به شکلهای مختلف پردازش کند:
- خلاصه کوتاه؛
- خلاصه فصلبهفصل؛
- نکات کلیدی؛
- یادداشت آموزشی؛
- فهرست اقدامات؛
- سؤال و جواب؛
- جدول موضوعات؛
- خلاصه دارای تایمکد؛
- فلشکارت؛
- کوئیز؛
- متن مناسب مقاله یا پست؛
- ترجمه و خلاصه فارسی ویدیوهای انگلیسی.
اما بیشتر سیستمهای خلاصهسازی، خود فایل ویدیویی را مانند انسان تماشا نمیکنند. فرایند رایج این است که ابتدا گفتار ویدیو به Transcript تبدیل شود و سپس یک مدل زبانی متن را خلاصه کند.
بنابراین کیفیت نتیجه به دو مرحله وابسته است:
- دقت تبدیل صدا به متن؛
- کیفیت خلاصهسازی Transcript.
اگر متن استخراجشده نامها، اعداد، اصطلاحات یا مرزبندی گویندگان را اشتباه تشخیص دهد، این خطا ممکن است وارد خلاصه نهایی شود.
در این مقاله روش خلاصه کردن ویدیوهای یوتیوب، فایلهای محلی، کلاسها، جلسات، مصاحبهها و محتوای فارسی را بهصورت عملی بررسی میکنیم.
خلاصهساز ویدیو با هوش مصنوعی چیست؟
خلاصهساز ویدیو یا AI Video Summarizer ابزاری است که محتوای یک ویدیو را تحلیل و نسخه کوتاهتر و ساختاریافتهای از اطلاعات آن تولید میکند.
ورودی ممکن است یکی از موارد زیر باشد:
- لینک YouTube؛
- فایل MP4؛
- فایل صوتی استخراجشده از ویدیو؛
- Transcript؛
- فایل زیرنویس SRT یا VTT؛
- ویدیوی جلسه آنلاین؛
- فایل ضبطشده کلاس؛
- پادکست ویدیویی.
خروجی نیز میتواند متناسب با هدف کاربر تغییر کند. برای مثال، خلاصه مناسب یک دانشجو با خلاصه مناسب مدیر یا تولیدکننده محتوا یکسان نیست.
هوش مصنوعی چگونه ویدیو را خلاصه میکند؟
فرایند متداول شامل چهار مرحله است.
استخراج صدا
صدای ویدیو از تصویر جدا میشود. برای خلاصهسازی محتوای گفتاری، معمولاً نیازی نیست تمام فریمهای ویدیو پردازش شوند.
تبدیل گفتار به متن
یک مدل Speech-to-Text یا تبدیل گفتار به متن، صدای گویندگان را به Transcript تبدیل میکند.
در این مرحله ممکن است اطلاعات زیر نیز تولید شوند:
- زمان شروع و پایان جمله؛
- تشخیص زبان؛
- جداسازی گویندگان؛
- بخشبندی متن؛
- میزان اطمینان؛
- نشانهگذاری اولیه.
پاکسازی Transcript
متن خام ممکن است دارای مشکلات زیر باشد:
- تکرار کلمات؛
- جملههای نیمهکاره؛
- نامگذاری اشتباه؛
- نبود علائم نگارشی؛
- شکستن نامناسب جملهها؛
- تشخیص اشتباه اصطلاحات انگلیسی؛
- ترکیب صحبت گویندگان؛
- حذف اعداد یا واحدها.
پیش از خلاصهسازی حرفهای، بهتر است Transcript پاکسازی شود.
خلاصهسازی با مدل زبانی
متن کامل یا بخشهای آن برای مدل زبانی ارسال میشود. مدل میتواند براساس هدف، خلاصه کوتاه، فصلبندی، نکات کلیدی یا گزارش تولید کند.
تفاوت خلاصه ویدیو با Transcript
Transcript متن تقریباً کامل گفتار ویدیو است، اما خلاصه فقط اطلاعات مهم را نگه میدارد.
| خروجی | کاربرد |
|---|---|
| Transcript کامل | جستوجو، زیرنویس، آرشیو و نقل دقیق |
| خلاصه کوتاه | درک سریع موضوع |
| خلاصه تفصیلی | مطالعه بدون تماشای کامل |
| نکات کلیدی | مرور سریع |
| خلاصه دارای تایمکد | رفتن به بخشهای مهم |
| فهرست اقدامات | جلسه و وبینار کاری |
| یادداشت آموزشی | کلاس، دوره و سخنرانی |
| سؤال و جواب | یادگیری و مرور |
| مقاله | بازآفرینی محتوای ویدیویی |
یک خلاصه خوب جای Transcript را نمیگیرد. اگر به نقلقول، عدد یا جزئیات دقیق نیاز دارید، باید متن کامل یا خود ویدیو را بررسی کنید.
روش اول: خلاصه کردن ویدیو یوتیوب با Transcript
یکی از سادهترین روشها استفاده از Transcript خود YouTube است.
طبق راهنمای رسمی YouTube، اگر Transcript برای ویدیو در دسترس باشد، میتوان از بخش توضیحات ویدیو گزینه Show transcript را انتخاب کرد. متن همزمان با پخش ویدیو حرکت میکند و با انتخاب هر بخش میتوان به همان قسمت رفت. راهنمای رسمی مشاهده Transcript در YouTube
مراحل استخراج متن از یوتیوب
- ویدیوی موردنظر را باز کنید.
- بخش توضیحات ویدیو را باز کنید.
- گزینه Show transcript را انتخاب کنید.
- زبان Transcript را بررسی کنید.
- متن را همراه با تایمکدها کپی کنید.
- آن را در یک فایل متنی یا ابزار هوش مصنوعی قرار دهید.
- نوع خلاصه را با پرامپت مشخص کنید.
ممکن است برای بعضی ویدیوها Transcript در دسترس نباشد؛ برای مثال:
- ویدیو زیرنویس ندارد؛
- سازنده قابلیتهای مرتبط را محدود کرده است؛
- صدا برای تشخیص خودکار مناسب نیست؛
- ویدیو خصوصی یا محدود است؛
- محتوای اصلی شامل موسیقی یا تصویر بدون گفتار است.
پرامپت خلاصهکردن Transcript یوتیوب
Transcript زیر مربوط به یک ویدیوی یوتیوب است.
آن را به فارسی روان خلاصه کن.
خروجی شامل این بخشها باشد:
1. موضوع اصلی ویدیو در یک پاراگراف
2. پنج تا ده نکته کلیدی
3. خلاصه بخشبهبخش
4. نامها، اعداد و اصطلاحات مهم
5. نتیجهگیری گوینده
6. مواردی که برای اطمینان باید در ویدیو بررسی شوند
قوانین:
- فقط از اطلاعات موجود در Transcript استفاده کن.
- اطلاعات جدید اضافه نکن.
- اگر بخشی مبهم است، آن را با برچسب «نامشخص» مشخص کن.
- تایمکدهای موجود را حفظ کن.
- بین گفته گوینده و نتیجهگیری خودت تفاوت قائل شو.
Transcript:
[متن ویدیو]
روش دوم: خلاصه یوتیوب با لینک مستقیم
بعضی ابزارها فقط با دریافت URL ویدیو، Transcript را استخراج و خلاصه تولید میکنند.
نمونههای شناختهشده:
- Glasp YouTube Summary؛
- Notta YouTube Video Summarizer؛
- NoteGPT؛
- افزونههای خلاصهساز مرورگر؛
- ابزارهای یادداشتبرداری ویدیویی؛
- سرویسهای مبتنی بر Transcript.
Glasp امکان دریافت Transcript، نکات کلیدی و خلاصههای دارای زمان را برای ویدیوهای واجد شرایط معرفی میکند. خلاصهساز یوتیوب Glasp
Notta نیز ابزار خلاصهسازی ویدیوی YouTube و تولید خلاصه از Transcript ارائه میدهد. خلاصهساز یوتیوب Notta
روش کلی استفاده:
- لینک ویدیوی عمومی را کپی کنید.
- وارد ابزار خلاصهساز شوید.
- URL را قرار دهید.
- زبان ویدیو را انتخاب کنید.
- نوع خلاصه را مشخص کنید.
- Transcript و خلاصه را دریافت کنید.
- نکات مهم را با ویدیو تطبیق دهید.
مزایای روش لینک مستقیم
- سریع و ساده است؛
- نیازی به دانلود ویدیو ندارد؛
- بعضی ابزارها تایمکد تولید میکنند؛
- برای مرور سریع مناسب است؛
- گاهی امکان پرسش از محتوای ویدیو وجود دارد.
محدودیتهای روش لینک مستقیم
- همه ویدیوها قابل پردازش نیستند؛
- کیفیت به زیرنویس و Transcript وابسته است؛
- محدودیت طول یا تعداد استفاده وجود دارد؛
- پشتیبانی فارسی ممکن است متفاوت باشد؛
- ویدیوهای خصوصی یا محدود پردازش نمیشوند؛
- کنترل کاربر روی مراحل پردازش کمتر است؛
- ممکن است اطلاعات فایل در یک سرویس بیرونی پردازش شود.
برای محتوای شخصی یا سازمانی بهتر است شرایط نگهداری و پردازش داده ابزار را بررسی کنید.
روش سوم: خلاصه ویدیو با Gemini Notebook
Gemini Notebook که پیشتر با نام NotebookLM شناخته میشد، برای مطالعه و تحلیل محتوای مبتنی بر منبع مناسب است. در صورت پشتیبانی منبع، میتوان لینک ویدیوی YouTube را به Notebook اضافه کرد و سپس درباره محتوای آن سؤال پرسید.
این روش برای موارد زیر کاربرد دارد:
- خلاصه یک ویدیو؛
- مقایسه چند ویدیو؛
- ساخت راهنمای مطالعه؛
- استخراج مفاهیم مشترک؛
- طراحی سؤال و کوئیز؛
- ساخت فلشکارت؛
- تهیه یادداشت آموزشی؛
- پرسش از Transcript.
مراحل کلی:
- یک Notebook جدید بسازید.
- لینک ویدیوی YouTube را به منابع اضافه کنید.
- منتظر بمانید منبع پردازش شود.
- از بخش Chat درباره ویدیو سؤال کنید.
- از بخش Studio خروجیهای آموزشی بسازید.
- پاسخها را با بخشهای مرتبط منبع بررسی کنید.
پرامپت پیشنهادی برای چند ویدیو
ویدیوهای موجود در این Notebook را مقایسه کن.
خروجی شامل این موارد باشد:
- موضوع مشترک
- دیدگاه هر ویدیو
- نقاط توافق
- نقاط اختلاف
- مثالهای مهم
- مواردی که فقط در یک ویدیو مطرح شدهاند
- نتیجهگیری مقایسهای
برای هر ادعا مشخص کن مربوط به کدام منبع است.
این روش برای ساخت یک مسیر یادگیری از چند ویدیوی آموزشی مفید است.
روش چهارم: خلاصه کردن فایل MP4 با هوش مصنوعی
اگر ویدیو روی سیستم شما قرار دارد، ابتدا باید صدای آن یا Transcript استخراج شود.
فرایند پیشنهادی:
- فایل ویدیو را بررسی کنید.
- زبان اصلی را مشخص کنید.
- صدا را استخراج کنید.
- گفتار را به متن تبدیل کنید.
- Transcript را پاکسازی کنید.
- متن را بخشبندی کنید.
- هر بخش را خلاصه کنید.
- خلاصههای بخشها را ادغام کنید.
- خروجی را با ویدیو تطبیق دهید.
استخراج صدا با FFmpeg
اگر FFmpeg نصب است، دستور زیر صدای ویدیو را به فایل MP3 تبدیل میکند:
ffmpeg -i video.mp4 -vn -ac 1 -ar 16000 -b:a 64k audio.mp3
توضیح گزینهها:
-i video.mp4: فایل ورودی؛-vn: حذف جریان تصویر؛-ac 1: تبدیل صدا به Mono؛-ar 16000: نرخ نمونهبرداری ۱۶ کیلوهرتز؛-b:a 64k: نرخ بیت صدا؛audio.mp3: فایل خروجی.
برای تبدیل گفتار به متن، همیشه لازم نیست صدای بسیار باکیفیت تولید کنید. اما فشردهسازی شدید، نویز و صدای ضعیف میتوانند دقت تشخیص را کاهش دهند.
روش پنجم: خلاصه ویدیو با زیرنویس SRT
اگر فایل SRT یا VTT دارید، معمولاً استفاده از آن بهتر از اجرای دوباره Speech-to-Text است؛ بهخصوص اگر زیرنویس قبلاً بازبینی شده باشد.
نمونه SRT:
1
00:00:02,000 --> 00:00:06,500
در این ویدیو درباره روشهای کاهش هزینه API صحبت میکنیم.
2
00:00:06,500 --> 00:00:12,000
اولین روش، انتخاب مدل متناسب با پیچیدگی درخواست است.
برای خلاصهسازی، تایمکدها را حذف نکنید. وجود آنها کمک میکند خلاصه به بخشهای ویدیو متصل باقی بماند.
پرامپت پیشنهادی:
فایل SRT زیر را به یک خلاصه فارسی دارای تایمکد تبدیل کن.
قواعد:
- بلوکهای زیرنویس را براساس موضوع گروهبندی کن.
- برای هر بخش، زمان شروع را بنویس.
- تکرارهای گفتاری را حذف کن.
- نام مدلها، ابزارها و اصطلاحات فنی را حفظ کن.
- هیچ عدد یا ادعایی را تغییر نده.
- اگر زیرنویس مبهم است، آن را حدس نزن.
- در پایان پنج نکته اصلی و سه اقدام پیشنهادی گوینده را بنویس.
SRT:
[محتوای فایل]
انواع خلاصه ویدیو
درخواست «این ویدیو را خلاصه کن» بیش از حد کلی است. بهتر است نوع خروجی را مشخص کنید.
خلاصه بسیار کوتاه
مناسب زمانی است که فقط میخواهید بدانید آیا ویدیو ارزش تماشا دارد.
این Transcript را در حداکثر ۱۵۰ کلمه خلاصه کن.
موضوع، ادعای اصلی و نتیجه نهایی را بنویس.
خلاصه نکتهای
مهمترین نکات ویدیو را در ۱۰ Bullet استخراج کن.
هر Bullet باید یک مفهوم مستقل داشته باشد.
از تکرار جلوگیری کن.
خلاصه فصلبهفصل
برای ویدیوهای بلند و آموزشی:
Transcript را براساس تغییر موضوع به فصلهای منطقی تقسیم کن.
برای هر فصل عنوان، تایمکد شروع و خلاصه ۳ تا ۵ جملهای بنویس.
خلاصه آموزشی
از این ویدیو یک جزوه آموزشی بساز.
ساختار:
- هدف درس
- مفاهیم اصلی
- تعریف اصطلاحات
- مراحل انجام کار
- مثالها
- اشتباهات رایج
- نکات مرور
- پنج سؤال خودآزمایی
خلاصه برای مدیر
این ویدیو را برای یک مدیر پرمشغله خلاصه کن.
خروجی:
- خلاصه اجرایی در ۵ جمله
- نکات مهم برای تصمیمگیری
- فرصتها
- محدودیتها
- اقدامات پیشنهادی
- موارد نیازمند بررسی
خلاصه جلسه
Transcript جلسه را به صورت صورتجلسه ساختاریافته خلاصه کن.
بخشها:
- موضوع جلسه
- حاضران، فقط اگر در متن مشخص هستند
- مباحث اصلی
- تصمیمهای گرفتهشده
- وظایف
- مسئول هر وظیفه
- مهلت انجام
- موضوعات حلنشده
اگر مسئول یا مهلت مشخص نیست، عبارت «مشخص نشده» بنویس.
خلاصه مصاحبه
این مصاحبه را خلاصه کن.
برای هر موضوع مشخص کن:
- سؤال یا موضوع مطرحشده
- دیدگاه مصاحبهشونده
- دلیل یا استدلال
- مثال
- نتیجه
- تایمکد
گفتههای مصاحبهشونده را با واقعیت تأییدشده اشتباه نگیر.
خلاصه پادکست ویدیویی
از این پادکست یک خلاصه خواندنی فارسی بساز.
خروجی:
- معرفی موضوع
- دیدگاه هر گوینده
- بحثهای اصلی
- مثالهای مهم
- اختلافنظرها
- نتیجهگیری
- تایمکد پنج بخش مهم
پرامپت جامع خلاصه کردن ویدیو یوتیوب
نقش تو:
ویراستار و تحلیلگر محتوای ویدیویی هستی.
هدف:
Transcript ویدیوی زیر را به یک خلاصه دقیق، ساختاریافته و قابل مراجعه تبدیل کن.
مخاطب:
[دانشجو/مدیر/توسعهدهنده/مخاطب عمومی]
زبان خروجی:
فارسی روان
سطح جزئیات:
[کوتاه/متوسط/کامل]
قواعد:
1. فقط از Transcript استفاده کن.
2. ادعا یا مثال جدید اضافه نکن.
3. تایمکدهای اصلی را حفظ کن.
4. تکرارها و مکثهای گفتاری را حذف کن.
5. نام اشخاص، محصولات، مدلها و اعداد را تغییر نده.
6. اصطلاحات فنی را با شکل فارسی و انگلیسی بنویس.
7. بخشهای مبهم را مشخص کن و حدس نزن.
8. گفته گوینده را بهعنوان واقعیت قطعی بازنویسی نکن.
9. میان نظر، مثال و نتیجهگیری تفاوت قائل شو.
10. اگر Transcript ناقص است، محدودیت را اعلام کن.
ساختار خروجی:
- خلاصه یکپاراگرافی
- فصلهای ویدیو همراه با تایمکد
- نکات کلیدی
- اصطلاحات مهم
- مثالها
- نتیجهگیری گوینده
- موارد نیازمند بررسی
- سه سؤال برای مرور
Transcript:
[متن ویدیو]
خلاصه ویدیوی انگلیسی به فارسی
برای ویدیوهای انگلیسی، دو روش وجود دارد:
روش اول: ترجمه کامل و سپس خلاصهسازی
مزیت:
- Transcript فارسی کامل در اختیار دارید؛
- امکان استفاده برای زیرنویس وجود دارد.
عیب:
- زمان و هزینه پردازش بیشتر است؛
- خطای ترجمه میتواند وارد خلاصه شود.
روش دوم: خلاصه مستقیم به فارسی
در این روش، Transcript انگلیسی مستقیماً به یک خلاصه فارسی تبدیل میشود.
مزیت:
- سریعتر است؛
- خروجی کوتاهتر است؛
- برای مرور محتوا مناسبتر است.
پرامپت:
Transcript انگلیسی زیر را مستقیماً به فارسی خلاصه کن.
ترجمه خطبهخط انجام نده.
معنی، استدلال، مثالها و نتیجه اصلی را حفظ کن.
اصطلاحات تخصصی را به شکل فارسی و انگلیسی بنویس.
نام مدل، محصول، شرکت، عدد و نسخه را تغییر نده.
تایمکدها را حفظ کن.
اگر ویدیو فنی، دانشگاهی یا دارای اصطلاحات زیاد است، یک واژهنامه کوتاه در پایان اضافه کنید.
خلاصه ویدیوهای طولانی
ارسال Transcript یک ویدیوی چندساعته در یک درخواست ممکن است مشکلاتی ایجاد کند:
- عبور از Context Window؛
- حذف بخشهای میانی؛
- تمرکز بیش از حد روی ابتدا یا انتهای متن؛
- خلاصه عمومی و کمجزئیات؛
- از دست رفتن تایمکدها؛
- افزایش هزینه؛
- دشوارشدن کنترل خروجی.
روش بهتر، خلاصهسازی سلسلهمراتبی است.
مرحله اول: بخشبندی
Transcript را براساس یکی از این معیارها تقسیم کنید:
- فصلهای ویدیو؛
- تغییر موضوع؛
- تایمکد؛
- هر ۵ تا ۱۰ دقیقه؛
- تعداد مشخصی کلمه یا توکن؛
- تغییر گوینده.
تقسیم براساس موضوع معمولاً بهتر از بریدن متن در اندازه ثابت است.
مرحله دوم: خلاصه هر بخش
برای هر بخش خروجی ثابتی تولید کنید:
- عنوان؛
- تایمکد؛
- خلاصه؛
- نکات اصلی؛
- اعداد و نامها؛
- ابهامها.
مرحله سوم: ادغام خلاصهها
خلاصه بخشها را به مدل بدهید و درخواست کنید:
- تکرارها حذف شوند؛
- ترتیب ویدیو حفظ شود؛
- اختلاف دیدگاهها باقی بماند؛
- هیچ اطلاعات تازهای اضافه نشود؛
- نتیجه نهایی با تایمکد ساخته شود.
مرحله چهارم: کنترل پوشش
بررسی کنید هر فصل مهم حداقل در یک بخش از خلاصه آمده باشد.
پرامپت کنترل پوشش:
فهرست فصلهای ویدیو و خلاصه نهایی را مقایسه کن.
مشخص کن:
- کدام فصلها پوشش داده شدهاند؟
- کدام فصلها حذف شدهاند؟
- کدام بخشها بیش از حد خلاصه شدهاند؟
- کدام نکات بدون تایمکد هستند؟
- کدام اطلاعات فقط در خلاصه آمده و در منبع وجود ندارد؟
چگونه خلاصه دارای تایمکد بسازیم؟
اگر Transcript شامل زمان باشد، از مدل بخواهید تایمکد را به اولین لحظه شروع هر موضوع متصل کند.
نمونه خروجی:
00:00 مقدمه و تعریف مسئله
03:25 معرفی روش اول
08:40 مثال عملی
15:10 مقایسه ابزارها
22:35 اشتباهات رایج
28:50 جمعبندی
برای افزایش دقت:
- تایمکدها را از ورودی حذف نکنید؛
- از مدل نخواهید زمان را حدس بزند؛
- تایمکد هر بخش را از نزدیکترین بلوک Transcript بردارد؛
- چند زمان مهم را با ویدیو کنترل کنید.
ساخت جزوه از ویدیوی آموزشی
هوش مصنوعی میتواند یک کلاس ضبطشده را به جزوه تبدیل کند.
پرامپت:
از Transcript این کلاس یک جزوه آموزشی کامل بساز.
قواعد:
- ساختار درس را حفظ کن.
- توضیحات تکراری مدرس را ادغام کن.
- تعریفها را دقیق بنویس.
- مثالهای مدرس را جدا نمایش بده.
- نکات مهم را برجسته کن.
- مطالب خارج از Transcript اضافه نکن.
- برای هر بخش تایمکد شروع بنویس.
- در پایان، خلاصه مرور و ۱۰ سؤال تمرینی بساز.
- پاسخ سؤالها را در بخش جداگانه قرار بده.
خروجی را پیش از استفاده آموزشی بررسی کنید؛ بهخصوص در بخش اعداد، فرمولها، نامها و اصطلاحات تخصصی.
تبدیل خلاصه ویدیو به محتوای دیگر
یک Transcript میتواند ورودی چند نوع محتوا باشد.
تبدیل به مقاله
براساس Transcript ویدیو، یک مقاله ساختاریافته بنویس.
از کپیکردن لحن گفتاری خودداری کن.
تکرارها را حذف کن.
هیچ ادعا یا منبع جدیدی اضافه نکن.
مطالب را با تیترهای منطقی مرتب کن.
تبدیل به پست شبکه اجتماعی
از این خلاصه، پنج پست کوتاه مستقل بساز.
هر پست فقط یک نکته داشته باشد.
لحن ساده و آموزشی باشد.
ادعایی فراتر از ویدیو اضافه نکن.
تبدیل به سؤال و جواب
از محتوای ویدیو ۱۵ سؤال و جواب برای مرور بساز.
هر پاسخ حداکثر سه جمله باشد.
برای هر سؤال تایمکد بخش مرتبط را بنویس.
تبدیل به فلشکارت
از این ویدیو فلشکارت بساز.
هر کارت فقط یک مفهوم را بسنجد.
خروجی شامل Front، Back، Tag و Timestamp باشد.
تبدیل به توضیحات یوتیوب
از Transcript این ویدیو، توضیحات مناسب صفحه YouTube تولید کن.
شامل:
- معرفی کوتاه
- موضوعات اصلی
- فصلها و تایمکدها
- سه نکته مهم
اطلاعاتی که در Transcript وجود ندارد اضافه نکن.
ساخت سیستم خلاصهساز ویدیو با API درواره
توسعهدهندگان میتوانند یک سامانه خلاصهسازی ویدیو با این معماری بسازند:
آپلود ویدیو
↓
استخراج صدا
↓
تبدیل گفتار به متن
↓
پاکسازی Transcript
↓
بخشبندی
↓
خلاصه هر بخش
↓
ادغام خلاصهها
↓
کنترل پوشش
↓
خروجی نهایی
درواره زیرساخت دسترسی به مدلهای هوش مصنوعی را فراهم میکند. برای هر مرحله باید مدلی متناسب با قابلیت موردنظر انتخاب شود:
- مدل Speech-to-Text برای Transcript؛
- مدل زبانی برای پاکسازی و خلاصهسازی؛
- مدل دارای Context Window بزرگ برای محتوای طولانی؛
- مدل سریعتر برای پردازش تعداد زیاد فایل.
آدرس پایه API درواره:
https://api.darvareh.ir/v1
برای مشاهده مدلهای موجود و اطلاعات قیمت به صفحه مدلهای درواره مراجعه کنید.
نمونه پایتون برای خلاصهسازی Transcript طولانی
در این مثال فرض میکنیم Transcript قبلاً ساخته شده و در فایل transcript.txt قرار دارد.
ابتدا کتابخانه را نصب کنید:
pip install openai
سپس:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DARVAREH_API_KEY"],
base_url="https://api.darvareh.ir/v1",
)
MODEL_ID = "YOUR_MODEL_ID"
CHUNK_SIZE = 12000
with open("transcript.txt", "r", encoding="utf-8") as file:
transcript = file.read()
def split_text(text, size):
paragraphs = text.split("\n")
chunks = []
current = []
for paragraph in paragraphs:
candidate = "\n".join(current + [paragraph])
if len(candidate) > size and current:
chunks.append("\n".join(current))
current = [paragraph]
else:
current.append(paragraph)
if current:
chunks.append("\n".join(current))
return chunks
def summarize_chunk(chunk, index):
prompt = f"""
این بخش شماره {index} از Transcript یک ویدیو است.
آن را به فارسی خلاصه کن.
خروجی:
- عنوان بخش
- خلاصه
- نکات کلیدی
- نامها و اعداد مهم
- تایمکدهای موجود
- بخشهای مبهم
فقط از متن استفاده کن و اطلاعات جدید اضافه نکن.
Transcript:
{chunk}
"""
response = client.chat.completions.create(
model=MODEL_ID,
messages=[
{
"role": "system",
"content": "تو ویراستار و خلاصهساز دقیق محتوای ویدیویی هستی."
},
{
"role": "user",
"content": prompt
}
],
temperature=0.1,
)
return response.choices[0].message.content
chunks = split_text(transcript, CHUNK_SIZE)
partial_summaries = []
for index, chunk in enumerate(chunks, start=1):
summary = summarize_chunk(chunk, index)
partial_summaries.append(summary)
combined = "\n\n".join(partial_summaries)
final_prompt = f"""
خلاصههای بخشهای یک ویدیو در ادامه آمدهاند.
از آنها یک خلاصه نهایی فارسی بساز.
ساختار:
1. خلاصه اجرایی
2. فصلهای اصلی با تایمکد
3. نکات کلیدی
4. نامها، اعداد و اصطلاحات مهم
5. نتیجهگیری گوینده
6. موارد نیازمند بررسی در ویدیوی اصلی
قواعد:
- ترتیب بخشها حفظ شود.
- تکرارها حذف شوند.
- هیچ اطلاعات جدیدی اضافه نشود.
- تایمکدها تغییر نکنند.
- اختلاف دیدگاهها حذف نشوند.
خلاصههای میانی:
{combined}
"""
response = client.chat.completions.create(
model=MODEL_ID,
messages=[
{
"role": "system",
"content": "تو خلاصههای چندبخشی را بدون حذف نکات مهم ادغام میکنی."
},
{
"role": "user",
"content": final_prompt
}
],
temperature=0.1,
)
final_summary = response.choices[0].message.content
with open("video-summary.md", "w", encoding="utf-8") as file:
file.write(final_summary)
print("Summary saved to video-summary.md")
به جای YOUR_MODEL_ID، شناسه مدل درواره را قرار دهید.
در پروژه عملی بهتر است به جای تقسیم صرفاً براساس تعداد نویسه، از توکنشماری، مرز موضوع و تایمکد استفاده شود.
انتخاب مدل مناسب برای خلاصهسازی ویدیو
هنگام انتخاب مدل به این موارد توجه کنید:
Context Window
اگر Transcript طولانی است، مدل باید ظرفیت کافی داشته باشد. با این حال، حتی مدل دارای Context بزرگ نیز ممکن است در خلاصهسازی مرحلهای نتیجه دقیقتری ارائه دهد.
کیفیت فارسی
مدل باید بتواند متن فارسی روان تولید و اصطلاحات انگلیسی را درست حفظ کند.
هزینه
برای فایلهای طولانی، تعداد توکن ورودی زیاد میشود. میتوان از مدل سریع و اقتصادی برای خلاصه بخشها و مدل قویتر برای ادغام نهایی استفاده کرد.
خروجی ساختاریافته
اگر نتیجه وارد نرمافزار میشود، خروجی JSON میتواند پردازش را سادهتر کند.
سرعت
برای پردازش تعاملی، زمان پاسخ مهم است. در پردازش دستهای میتوان اولویت بیشتری به هزینه یا کیفیت داد.
قالب JSON برای خلاصه ویدیو
{
"title": "عنوان ویدیو",
"language": "fa",
"summary": "خلاصه کلی",
"chapters": [
{
"start": "00:03:20",
"title": "عنوان بخش",
"summary": "خلاصه بخش",
"key_points": [
"نکته اول",
"نکته دوم"
]
}
],
"important_terms": [
{
"term": "Context Window",
"definition": "تعریف براساس ویدیو"
}
],
"action_items": [],
"uncertain_segments": [
{
"timestamp": "00:17:40",
"reason": "نام ابزار در Transcript واضح نیست"
}
]
}
در سامانه عملی، این ساختار باید با JSON Schema اعتبارسنجی شود.
مشکلات رایج در خلاصه کردن ویدیو
اشتباه در نامها و اصطلاحات
Speech-to-Text ممکن است نام مدل، شرکت، شخص یا اصطلاح فنی را اشتباه بنویسد.
راهحل:
- واژهنامه تخصصی ارائه کنید؛
- نامهای احتمالی را پیش از پردازش مشخص کنید؛
- Transcript را برای کلمات کلیدی بررسی کنید؛
- نامها را با منابع معتبر تطبیق دهید.
خلاصه بیش از حد کوتاه
اگر فقط بگویید «خلاصه کن»، مدل ممکن است جزئیات مهم را حذف کند.
نوع خروجی، طول و بخشهای ضروری را مشخص کنید.
تولید اطلاعات خارج از ویدیو
مدل ممکن است برای تکمیل توضیح از دانش عمومی خود استفاده کند.
در پرامپت بنویسید:
فقط از Transcript استفاده کن. اگر اطلاعات کافی وجود ندارد، عبارت «در ویدیو مشخص نشده است» را بنویس.
حذف اختلافنظر گویندگان
در مصاحبه و پادکست، ادغام بیش از حد ممکن است تفاوت دیدگاهها را از بین ببرد.
از مدل بخواهید نظر هر گوینده را جدا نگه دارد.
تایمکدهای نادرست
اگر Transcript بدون زمان باشد، مدل نمیتواند زمان واقعی را بداند. از آن نخواهید تایمکد را حدس بزند.
کیفیت ضعیف صدا
نویز، موسیقی بلند، همزمانی گویندگان و میکروفون ضعیف باعث افت دقت Transcript میشوند.
خلاصهکردن محتوای بصری فقط از روی صدا
اگر ویدیو شامل نمودار، کد، اسلاید یا آموزش تصویری است، Transcript تمام اطلاعات را منتقل نمیکند.
برای چنین محتوایی ممکن است به این موارد نیاز باشد:
- استخراج فریمهای مهم؛
- OCR اسلایدها؛
- مدل چندوجهی؛
- توضیح دستی عناصر بصری؛
- دریافت فایل اسلاید در کنار Transcript.
خلاصهسازی ویدیوی آموزشی برنامهنویسی
در آموزش برنامهنویسی، فقط گفتار کافی نیست. کد نمایشدادهشده روی صفحه ممکن است در Transcript وجود نداشته باشد.
فرایند بهتر:
- Transcript را استخراج کنید.
- مخزن یا کدهای همراه ویدیو را دریافت کنید.
- فریمهای مربوط به کد را جدا کنید.
- اصطلاحات و نام کتابخانهها را اصلاح کنید.
- مراحل اجرا را به ترتیب بنویسید.
- دستورات را در بلوک کد قرار دهید.
- خطاهای مطرحشده را جدا کنید.
- نسخه ابزارها را ثبت کنید.
پرامپت:
این Transcript مربوط به آموزش برنامهنویسی است.
خلاصه را به شکل Tutorial تولید کن:
- پیشنیازها
- ابزارها و نسخهها
- مراحل نصب
- دستورات
- توضیح کد
- خروجی مورد انتظار
- خطاهای مطرحشده
- جمعبندی
هیچ کدی را از خودت تولید نکن.
اگر کد در Transcript کامل نیست، آن را با برچسب «کد ناقص» مشخص کن.
چگونه دقت خلاصه را بررسی کنیم؟
نمونهبرداری زمانی
چند بخش از خلاصه را انتخاب و به تایمکد مربوطه مراجعه کنید.
کنترل اعداد
تمام اعداد، تاریخها، نسخهها، قیمتها و درصدها را با ویدیو تطبیق دهید.
کنترل نامها
نام اشخاص، شرکتها، مدلها و ابزارها را بررسی کنید.
کنترل پوشش
فصلهای ویدیو را با خلاصه مقایسه کنید تا موضوع مهمی حذف نشده باشد.
کنترل انتساب
مطمئن شوید هر دیدگاه به گوینده درست نسبت داده شده است.
کنترل اطلاعات افزوده
جملههایی را که در Transcript پشتوانه ندارند حذف یا مشخص کنید.
چکلیست نهایی
- زبان ویدیو درست انتخاب شده است؟
- Transcript کامل است؟
- تایمکدها حفظ شدهاند؟
- نامها و اصطلاحات اصلاح شدهاند؟
- نوع خلاصه متناسب با هدف است؟
- مدل فقط از منبع استفاده کرده است؟
- دیدگاه گویندگان با هم ترکیب نشده است؟
- اعداد و نسخهها بررسی شدهاند؟
- فصلهای مهم پوشش داده شدهاند؟
- بخشهای مبهم مشخص شدهاند؟
- محتوای بصری مهم نادیده گرفته نشده است؟
- فایل خصوصی بدون بررسی شرایط سرویس بارگذاری نشده است؟
- خلاصه جایگزین بررسی منبع در تصمیمهای مهم نشده است؟
پرسشهای متداول
چگونه ویدیو یوتیوب را با هوش مصنوعی خلاصه کنیم؟
سادهترین روش این است که Transcript ویدیو را از YouTube دریافت و آن را با یک پرامپت دقیق به مدل زبانی بدهید. همچنین میتوانید از ابزارهای لینکمحور مانند Glasp یا Notta استفاده کنید.
آیا میتوان لینک یوتیوب را مستقیم به هوش مصنوعی داد؟
بعضی ابزارها و سرویسها میتوانند لینک عمومی YouTube را پردازش کنند، اما همه مدلهای چت مستقیماً به ویدیو یا Transcript آن دسترسی ندارند. اگر پردازش لینک ممکن نبود، Transcript را استخراج کنید.
بهترین هوش مصنوعی خلاصه ویدیو چیست؟
برای استفاده سریع، ابزارهای تخصصی YouTube Summarizer مناسباند. برای تحلیل چند منبع، Gemini Notebook کاربردی است. برای ساخت محصول اختصاصی و پردازش کنترلشده نیز میتوان از مدلهای Speech-to-Text و مدلهای زبانی از طریق API درواره استفاده کرد.
آیا میتوان ویدیوی فارسی را خلاصه کرد؟
بله. ابتدا باید گفتار فارسی با دقت مناسب به متن تبدیل شود. سپس مدل زبانی میتواند Transcript را به خلاصه، جزوه یا نکات کلیدی فارسی تبدیل کند.
آیا خلاصهکردن ویدیو رایگان است؟
بعضی ابزارها استفاده محدود رایگان دارند، اما محدودیت طول، تعداد ویدیو یا مدل ممکن است تغییر کند. شرایط فعلی هر سرویس را در صفحه رسمی آن بررسی کنید.
چگونه ویدیوی بدون زیرنویس را خلاصه کنیم؟
فایل ویدیو یا صدای آن را با یک مدل Speech-to-Text به Transcript تبدیل کنید و سپس متن را خلاصه کنید.
آیا هوش مصنوعی محتوای تصویری ویدیو را هم میفهمد؟
مدل چندوجهی میتواند فریمها و عناصر بصری را تحلیل کند، اما بسیاری از خلاصهسازهای لینکمحور فقط از Transcript استفاده میکنند. برای ویدیوهای دارای اسلاید، کد یا نمودار باید محتوای تصویری نیز پردازش شود.
چگونه خلاصه دارای تایمکد بسازیم؟
Transcript را همراه با زمان به مدل بدهید و بخواهید هر فصل یا نکته را به نزدیکترین زمان موجود متصل کند. اگر ورودی زمان ندارد، نباید از مدل بخواهید تایمکد را حدس بزند.
آیا میتوان از یک ویدیو مقاله ساخت؟
بله. پس از تولید Transcript و خلاصه، میتوان محتوا را به مقاله تبدیل کرد. متن نهایی باید بازنویسی، ساختاربندی، کنترل و از نظر منابع و صحت اطلاعات بررسی شود.
آیا درواره یک سایت آماده خلاصهکردن یوتیوب است؟
درواره ابزار مصرفی آماده برای قراردادن لینک YouTube نیست؛ بلکه زیرساخت دسترسی به مدلهای هوش مصنوعی را فراهم میکند. توسعهدهندگان میتوانند با API درواره سامانه خلاصهسازی ویدیو، کلاس، جلسه یا پادکست بسازند.
جمعبندی
خلاصه کردن ویدیو با هوش مصنوعی میتواند فرایند مرور کلاس، وبینار، مصاحبه، پادکست و ویدیوی یوتیوب را بسیار سادهتر کند. با این حال، یک خلاصه دقیق از یک Transcript دقیق آغاز میشود.
فرایند پیشنهادی عبارت است از:
- هدف خلاصه را مشخص کنید.
- Transcript یا زیرنویس را دریافت کنید.
- متن خام را پاکسازی کنید.
- نامها و اصطلاحات را اصلاح کنید.
- ویدیوهای طولانی را بخشبندی کنید.
- هر بخش را جداگانه خلاصه کنید.
- خلاصهها را در یک مرحله نهایی ادغام کنید.
- تایمکدها را حفظ کنید.
- اعداد و ادعاهای مهم را با ویدیو تطبیق دهید.
- برای محتوای بصری، فریمها یا اسلایدها را نیز بررسی کنید.
- بخشهای مبهم را بهجای حدسزدن مشخص کنید.
- خلاصه را متناسب با کاربرد نهایی بازطراحی کنید.
اگر میخواهید یک سامانه خلاصهسازی برای ویدیو، کلاس، جلسه یا محتوای آموزشی بسازید، میتوانید در درواره ثبتنام کنید و از مدلهای مختلف تبدیل گفتار به متن و مدلهای زبانی از طریق یک API یکپارچه استفاده کنید. مدلهای موجود و اطلاعات قیمت در صفحه مدلهای درواره ارائه شدهاند.
مقالات مرتبط
- خلاصه کردن متن و PDF با هوش مصنوعی
- تبدیل صدا و ویدیو به متن فارسی با هوش مصنوعی
- ساخت زیرنویس فارسی خودکار و فایل SRT با هوش مصنوعی
- آموزش کامل Gemini Notebook و NotebookLM
- ساخت سیستم خلاصهسازی جلسه با هوش مصنوعی
- ساخت پادکست با هوش مصنوعی
- بهترین ابزارهای هوش مصنوعی برای دانشجویان
- تحقیق و یافتن منابع علمی با هوش مصنوعی
برای مطالعه شرایط استفاده و محدودیتهای مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.