خلاصه کردن ویدیو با هوش مصنوعی؛ آموزش خلاصه یوتیوب و فایل ویدیویی فارسی

در این آموزش یاد می‌گیرید ویدیوهای یوتیوب، کلاس، وبینار و فایل‌های فارسی را با هوش مصنوعی به متن، خلاصه، نکات کلیدی و یادداشت‌های دارای تایم‌کد تبدیل کنید.

Share
خلاصه کردن ویدیو با هوش مصنوعی؛ آموزش خلاصه یوتیوب و فایل ویدیویی فارسی


تماشای یک ویدیوی آموزشی یک‌ساعته، وبینار دو‌ساعته یا مصاحبه طولانی همیشه امکان‌پذیر نیست. در بسیاری از مواقع فقط می‌خواهیم بدانیم ویدیو درباره چیست، چه نکات مهمی دارد و کدام بخش‌های آن ارزش تماشاکردن دارند.

هوش مصنوعی می‌تواند محتوای ویدیو را به شکل‌های مختلف پردازش کند:

  • خلاصه کوتاه؛
  • خلاصه فصل‌به‌فصل؛
  • نکات کلیدی؛
  • یادداشت آموزشی؛
  • فهرست اقدامات؛
  • سؤال و جواب؛
  • جدول موضوعات؛
  • خلاصه دارای تایم‌کد؛
  • فلش‌کارت؛
  • کوئیز؛
  • متن مناسب مقاله یا پست؛
  • ترجمه و خلاصه فارسی ویدیوهای انگلیسی.

اما بیشتر سیستم‌های خلاصه‌سازی، خود فایل ویدیویی را مانند انسان تماشا نمی‌کنند. فرایند رایج این است که ابتدا گفتار ویدیو به Transcript تبدیل شود و سپس یک مدل زبانی متن را خلاصه کند.

بنابراین کیفیت نتیجه به دو مرحله وابسته است:

  1. دقت تبدیل صدا به متن؛
  2. کیفیت خلاصه‌سازی Transcript.

اگر متن استخراج‌شده نام‌ها، اعداد، اصطلاحات یا مرزبندی گویندگان را اشتباه تشخیص دهد، این خطا ممکن است وارد خلاصه نهایی شود.

در این مقاله روش خلاصه کردن ویدیوهای یوتیوب، فایل‌های محلی، کلاس‌ها، جلسات، مصاحبه‌ها و محتوای فارسی را به‌صورت عملی بررسی می‌کنیم.

خلاصه‌ساز ویدیو با هوش مصنوعی چیست؟

خلاصه‌ساز ویدیو یا AI Video Summarizer ابزاری است که محتوای یک ویدیو را تحلیل و نسخه کوتاه‌تر و ساختاریافته‌ای از اطلاعات آن تولید می‌کند.

ورودی ممکن است یکی از موارد زیر باشد:

  • لینک YouTube؛
  • فایل MP4؛
  • فایل صوتی استخراج‌شده از ویدیو؛
  • Transcript؛
  • فایل زیرنویس SRT یا VTT؛
  • ویدیوی جلسه آنلاین؛
  • فایل ضبط‌شده کلاس؛
  • پادکست ویدیویی.

خروجی نیز می‌تواند متناسب با هدف کاربر تغییر کند. برای مثال، خلاصه مناسب یک دانشجو با خلاصه مناسب مدیر یا تولیدکننده محتوا یکسان نیست.

هوش مصنوعی چگونه ویدیو را خلاصه می‌کند؟

فرایند متداول شامل چهار مرحله است.

استخراج صدا

صدای ویدیو از تصویر جدا می‌شود. برای خلاصه‌سازی محتوای گفتاری، معمولاً نیازی نیست تمام فریم‌های ویدیو پردازش شوند.

تبدیل گفتار به متن

یک مدل Speech-to-Text یا تبدیل گفتار به متن، صدای گویندگان را به Transcript تبدیل می‌کند.

در این مرحله ممکن است اطلاعات زیر نیز تولید شوند:

  • زمان شروع و پایان جمله؛
  • تشخیص زبان؛
  • جداسازی گویندگان؛
  • بخش‌بندی متن؛
  • میزان اطمینان؛
  • نشانه‌گذاری اولیه.

پاک‌سازی Transcript

متن خام ممکن است دارای مشکلات زیر باشد:

  • تکرار کلمات؛
  • جمله‌های نیمه‌کاره؛
  • نام‌گذاری اشتباه؛
  • نبود علائم نگارشی؛
  • شکستن نامناسب جمله‌ها؛
  • تشخیص اشتباه اصطلاحات انگلیسی؛
  • ترکیب صحبت گویندگان؛
  • حذف اعداد یا واحدها.

پیش از خلاصه‌سازی حرفه‌ای، بهتر است Transcript پاک‌سازی شود.

خلاصه‌سازی با مدل زبانی

متن کامل یا بخش‌های آن برای مدل زبانی ارسال می‌شود. مدل می‌تواند براساس هدف، خلاصه کوتاه، فصل‌بندی، نکات کلیدی یا گزارش تولید کند.

تفاوت خلاصه ویدیو با Transcript

Transcript متن تقریباً کامل گفتار ویدیو است، اما خلاصه فقط اطلاعات مهم را نگه می‌دارد.

خروجیکاربرد
Transcript کاملجست‌وجو، زیرنویس، آرشیو و نقل دقیق
خلاصه کوتاهدرک سریع موضوع
خلاصه تفصیلیمطالعه بدون تماشای کامل
نکات کلیدیمرور سریع
خلاصه دارای تایم‌کدرفتن به بخش‌های مهم
فهرست اقداماتجلسه و وبینار کاری
یادداشت آموزشیکلاس، دوره و سخنرانی
سؤال و جوابیادگیری و مرور
مقالهبازآفرینی محتوای ویدیویی

یک خلاصه خوب جای Transcript را نمی‌گیرد. اگر به نقل‌قول، عدد یا جزئیات دقیق نیاز دارید، باید متن کامل یا خود ویدیو را بررسی کنید.

روش اول: خلاصه کردن ویدیو یوتیوب با Transcript

یکی از ساده‌ترین روش‌ها استفاده از Transcript خود YouTube است.

طبق راهنمای رسمی YouTube، اگر Transcript برای ویدیو در دسترس باشد، می‌توان از بخش توضیحات ویدیو گزینه Show transcript را انتخاب کرد. متن هم‌زمان با پخش ویدیو حرکت می‌کند و با انتخاب هر بخش می‌توان به همان قسمت رفت. راهنمای رسمی مشاهده Transcript در YouTube

مراحل استخراج متن از یوتیوب

  1. ویدیوی موردنظر را باز کنید.
  2. بخش توضیحات ویدیو را باز کنید.
  3. گزینه Show transcript را انتخاب کنید.
  4. زبان Transcript را بررسی کنید.
  5. متن را همراه با تایم‌کدها کپی کنید.
  6. آن را در یک فایل متنی یا ابزار هوش مصنوعی قرار دهید.
  7. نوع خلاصه را با پرامپت مشخص کنید.

ممکن است برای بعضی ویدیوها Transcript در دسترس نباشد؛ برای مثال:

  • ویدیو زیرنویس ندارد؛
  • سازنده قابلیت‌های مرتبط را محدود کرده است؛
  • صدا برای تشخیص خودکار مناسب نیست؛
  • ویدیو خصوصی یا محدود است؛
  • محتوای اصلی شامل موسیقی یا تصویر بدون گفتار است.

پرامپت خلاصه‌کردن Transcript یوتیوب

Transcript زیر مربوط به یک ویدیوی یوتیوب است.

آن را به فارسی روان خلاصه کن.

خروجی شامل این بخش‌ها باشد:
1. موضوع اصلی ویدیو در یک پاراگراف
2. پنج تا ده نکته کلیدی
3. خلاصه بخش‌به‌بخش
4. نام‌ها، اعداد و اصطلاحات مهم
5. نتیجه‌گیری گوینده
6. مواردی که برای اطمینان باید در ویدیو بررسی شوند

قوانین:
- فقط از اطلاعات موجود در Transcript استفاده کن.
- اطلاعات جدید اضافه نکن.
- اگر بخشی مبهم است، آن را با برچسب «نامشخص» مشخص کن.
- تایم‌کدهای موجود را حفظ کن.
- بین گفته گوینده و نتیجه‌گیری خودت تفاوت قائل شو.

Transcript:
[متن ویدیو]

روش دوم: خلاصه یوتیوب با لینک مستقیم

بعضی ابزارها فقط با دریافت URL ویدیو، Transcript را استخراج و خلاصه تولید می‌کنند.

نمونه‌های شناخته‌شده:

  • Glasp YouTube Summary؛
  • Notta YouTube Video Summarizer؛
  • NoteGPT؛
  • افزونه‌های خلاصه‌ساز مرورگر؛
  • ابزارهای یادداشت‌برداری ویدیویی؛
  • سرویس‌های مبتنی بر Transcript.

Glasp امکان دریافت Transcript، نکات کلیدی و خلاصه‌های دارای زمان را برای ویدیوهای واجد شرایط معرفی می‌کند. خلاصه‌ساز یوتیوب Glasp

Notta نیز ابزار خلاصه‌سازی ویدیوی YouTube و تولید خلاصه از Transcript ارائه می‌دهد. خلاصه‌ساز یوتیوب Notta

روش کلی استفاده:

  1. لینک ویدیوی عمومی را کپی کنید.
  2. وارد ابزار خلاصه‌ساز شوید.
  3. URL را قرار دهید.
  4. زبان ویدیو را انتخاب کنید.
  5. نوع خلاصه را مشخص کنید.
  6. Transcript و خلاصه را دریافت کنید.
  7. نکات مهم را با ویدیو تطبیق دهید.

مزایای روش لینک مستقیم

  • سریع و ساده است؛
  • نیازی به دانلود ویدیو ندارد؛
  • بعضی ابزارها تایم‌کد تولید می‌کنند؛
  • برای مرور سریع مناسب است؛
  • گاهی امکان پرسش از محتوای ویدیو وجود دارد.

محدودیت‌های روش لینک مستقیم

  • همه ویدیوها قابل پردازش نیستند؛
  • کیفیت به زیرنویس و Transcript وابسته است؛
  • محدودیت طول یا تعداد استفاده وجود دارد؛
  • پشتیبانی فارسی ممکن است متفاوت باشد؛
  • ویدیوهای خصوصی یا محدود پردازش نمی‌شوند؛
  • کنترل کاربر روی مراحل پردازش کمتر است؛
  • ممکن است اطلاعات فایل در یک سرویس بیرونی پردازش شود.

برای محتوای شخصی یا سازمانی بهتر است شرایط نگهداری و پردازش داده ابزار را بررسی کنید.

روش سوم: خلاصه ویدیو با Gemini Notebook

Gemini Notebook که پیش‌تر با نام NotebookLM شناخته می‌شد، برای مطالعه و تحلیل محتوای مبتنی بر منبع مناسب است. در صورت پشتیبانی منبع، می‌توان لینک ویدیوی YouTube را به Notebook اضافه کرد و سپس درباره محتوای آن سؤال پرسید.

این روش برای موارد زیر کاربرد دارد:

  • خلاصه یک ویدیو؛
  • مقایسه چند ویدیو؛
  • ساخت راهنمای مطالعه؛
  • استخراج مفاهیم مشترک؛
  • طراحی سؤال و کوئیز؛
  • ساخت فلش‌کارت؛
  • تهیه یادداشت آموزشی؛
  • پرسش از Transcript.

مراحل کلی:

  1. یک Notebook جدید بسازید.
  2. لینک ویدیوی YouTube را به منابع اضافه کنید.
  3. منتظر بمانید منبع پردازش شود.
  4. از بخش Chat درباره ویدیو سؤال کنید.
  5. از بخش Studio خروجی‌های آموزشی بسازید.
  6. پاسخ‌ها را با بخش‌های مرتبط منبع بررسی کنید.

پرامپت پیشنهادی برای چند ویدیو

ویدیوهای موجود در این Notebook را مقایسه کن.

خروجی شامل این موارد باشد:
- موضوع مشترک
- دیدگاه هر ویدیو
- نقاط توافق
- نقاط اختلاف
- مثال‌های مهم
- مواردی که فقط در یک ویدیو مطرح شده‌اند
- نتیجه‌گیری مقایسه‌ای

برای هر ادعا مشخص کن مربوط به کدام منبع است.

این روش برای ساخت یک مسیر یادگیری از چند ویدیوی آموزشی مفید است.

روش چهارم: خلاصه کردن فایل MP4 با هوش مصنوعی

اگر ویدیو روی سیستم شما قرار دارد، ابتدا باید صدای آن یا Transcript استخراج شود.

فرایند پیشنهادی:

  1. فایل ویدیو را بررسی کنید.
  2. زبان اصلی را مشخص کنید.
  3. صدا را استخراج کنید.
  4. گفتار را به متن تبدیل کنید.
  5. Transcript را پاک‌سازی کنید.
  6. متن را بخش‌بندی کنید.
  7. هر بخش را خلاصه کنید.
  8. خلاصه‌های بخش‌ها را ادغام کنید.
  9. خروجی را با ویدیو تطبیق دهید.

استخراج صدا با FFmpeg

اگر FFmpeg نصب است، دستور زیر صدای ویدیو را به فایل MP3 تبدیل می‌کند:

ffmpeg -i video.mp4 -vn -ac 1 -ar 16000 -b:a 64k audio.mp3

توضیح گزینه‌ها:

  • -i video.mp4: فایل ورودی؛
  • -vn: حذف جریان تصویر؛
  • -ac 1: تبدیل صدا به Mono؛
  • -ar 16000: نرخ نمونه‌برداری ۱۶ کیلوهرتز؛
  • -b:a 64k: نرخ بیت صدا؛
  • audio.mp3: فایل خروجی.

برای تبدیل گفتار به متن، همیشه لازم نیست صدای بسیار باکیفیت تولید کنید. اما فشرده‌سازی شدید، نویز و صدای ضعیف می‌توانند دقت تشخیص را کاهش دهند.

روش پنجم: خلاصه ویدیو با زیرنویس SRT

اگر فایل SRT یا VTT دارید، معمولاً استفاده از آن بهتر از اجرای دوباره Speech-to-Text است؛ به‌خصوص اگر زیرنویس قبلاً بازبینی شده باشد.

نمونه SRT:

1
00:00:02,000 --> 00:00:06,500
در این ویدیو درباره روش‌های کاهش هزینه API صحبت می‌کنیم.

2
00:00:06,500 --> 00:00:12,000
اولین روش، انتخاب مدل متناسب با پیچیدگی درخواست است.

برای خلاصه‌سازی، تایم‌کدها را حذف نکنید. وجود آن‌ها کمک می‌کند خلاصه به بخش‌های ویدیو متصل باقی بماند.

پرامپت پیشنهادی:

فایل SRT زیر را به یک خلاصه فارسی دارای تایم‌کد تبدیل کن.

قواعد:
- بلوک‌های زیرنویس را براساس موضوع گروه‌بندی کن.
- برای هر بخش، زمان شروع را بنویس.
- تکرارهای گفتاری را حذف کن.
- نام مدل‌ها، ابزارها و اصطلاحات فنی را حفظ کن.
- هیچ عدد یا ادعایی را تغییر نده.
- اگر زیرنویس مبهم است، آن را حدس نزن.
- در پایان پنج نکته اصلی و سه اقدام پیشنهادی گوینده را بنویس.

SRT:
[محتوای فایل]

انواع خلاصه ویدیو

درخواست «این ویدیو را خلاصه کن» بیش از حد کلی است. بهتر است نوع خروجی را مشخص کنید.

خلاصه بسیار کوتاه

مناسب زمانی است که فقط می‌خواهید بدانید آیا ویدیو ارزش تماشا دارد.

این Transcript را در حداکثر ۱۵۰ کلمه خلاصه کن.
موضوع، ادعای اصلی و نتیجه نهایی را بنویس.

خلاصه نکته‌ای

مهم‌ترین نکات ویدیو را در ۱۰ Bullet استخراج کن.
هر Bullet باید یک مفهوم مستقل داشته باشد.
از تکرار جلوگیری کن.

خلاصه فصل‌به‌فصل

برای ویدیوهای بلند و آموزشی:

Transcript را براساس تغییر موضوع به فصل‌های منطقی تقسیم کن.
برای هر فصل عنوان، تایم‌کد شروع و خلاصه ۳ تا ۵ جمله‌ای بنویس.

خلاصه آموزشی

از این ویدیو یک جزوه آموزشی بساز.

ساختار:
- هدف درس
- مفاهیم اصلی
- تعریف اصطلاحات
- مراحل انجام کار
- مثال‌ها
- اشتباهات رایج
- نکات مرور
- پنج سؤال خودآزمایی

خلاصه برای مدیر

این ویدیو را برای یک مدیر پرمشغله خلاصه کن.

خروجی:
- خلاصه اجرایی در ۵ جمله
- نکات مهم برای تصمیم‌گیری
- فرصت‌ها
- محدودیت‌ها
- اقدامات پیشنهادی
- موارد نیازمند بررسی

خلاصه جلسه

Transcript جلسه را به صورت صورت‌جلسه ساختاریافته خلاصه کن.

بخش‌ها:
- موضوع جلسه
- حاضران، فقط اگر در متن مشخص هستند
- مباحث اصلی
- تصمیم‌های گرفته‌شده
- وظایف
- مسئول هر وظیفه
- مهلت انجام
- موضوعات حل‌نشده

اگر مسئول یا مهلت مشخص نیست، عبارت «مشخص نشده» بنویس.

خلاصه مصاحبه

این مصاحبه را خلاصه کن.

برای هر موضوع مشخص کن:
- سؤال یا موضوع مطرح‌شده
- دیدگاه مصاحبه‌شونده
- دلیل یا استدلال
- مثال
- نتیجه
- تایم‌کد

گفته‌های مصاحبه‌شونده را با واقعیت تأییدشده اشتباه نگیر.

خلاصه پادکست ویدیویی

از این پادکست یک خلاصه خواندنی فارسی بساز.

خروجی:
- معرفی موضوع
- دیدگاه هر گوینده
- بحث‌های اصلی
- مثال‌های مهم
- اختلاف‌نظرها
- نتیجه‌گیری
- تایم‌کد پنج بخش مهم

پرامپت جامع خلاصه کردن ویدیو یوتیوب

نقش تو:
ویراستار و تحلیلگر محتوای ویدیویی هستی.

هدف:
Transcript ویدیوی زیر را به یک خلاصه دقیق، ساختاریافته و قابل مراجعه تبدیل کن.

مخاطب:
[دانشجو/مدیر/توسعه‌دهنده/مخاطب عمومی]

زبان خروجی:
فارسی روان

سطح جزئیات:
[کوتاه/متوسط/کامل]

قواعد:
1. فقط از Transcript استفاده کن.
2. ادعا یا مثال جدید اضافه نکن.
3. تایم‌کدهای اصلی را حفظ کن.
4. تکرارها و مکث‌های گفتاری را حذف کن.
5. نام اشخاص، محصولات، مدل‌ها و اعداد را تغییر نده.
6. اصطلاحات فنی را با شکل فارسی و انگلیسی بنویس.
7. بخش‌های مبهم را مشخص کن و حدس نزن.
8. گفته گوینده را به‌عنوان واقعیت قطعی بازنویسی نکن.
9. میان نظر، مثال و نتیجه‌گیری تفاوت قائل شو.
10. اگر Transcript ناقص است، محدودیت را اعلام کن.

ساختار خروجی:
- خلاصه یک‌پاراگرافی
- فصل‌های ویدیو همراه با تایم‌کد
- نکات کلیدی
- اصطلاحات مهم
- مثال‌ها
- نتیجه‌گیری گوینده
- موارد نیازمند بررسی
- سه سؤال برای مرور

Transcript:
[متن ویدیو]

خلاصه ویدیوی انگلیسی به فارسی

برای ویدیوهای انگلیسی، دو روش وجود دارد:

روش اول: ترجمه کامل و سپس خلاصه‌سازی

مزیت:

  • Transcript فارسی کامل در اختیار دارید؛
  • امکان استفاده برای زیرنویس وجود دارد.

عیب:

  • زمان و هزینه پردازش بیشتر است؛
  • خطای ترجمه می‌تواند وارد خلاصه شود.

روش دوم: خلاصه مستقیم به فارسی

در این روش، Transcript انگلیسی مستقیماً به یک خلاصه فارسی تبدیل می‌شود.

مزیت:

  • سریع‌تر است؛
  • خروجی کوتاه‌تر است؛
  • برای مرور محتوا مناسب‌تر است.

پرامپت:

Transcript انگلیسی زیر را مستقیماً به فارسی خلاصه کن.

ترجمه خط‌به‌خط انجام نده.
معنی، استدلال، مثال‌ها و نتیجه اصلی را حفظ کن.
اصطلاحات تخصصی را به شکل فارسی و انگلیسی بنویس.
نام مدل، محصول، شرکت، عدد و نسخه را تغییر نده.
تایم‌کدها را حفظ کن.

اگر ویدیو فنی، دانشگاهی یا دارای اصطلاحات زیاد است، یک واژه‌نامه کوتاه در پایان اضافه کنید.

خلاصه ویدیوهای طولانی

ارسال Transcript یک ویدیوی چندساعته در یک درخواست ممکن است مشکلاتی ایجاد کند:

  • عبور از Context Window؛
  • حذف بخش‌های میانی؛
  • تمرکز بیش از حد روی ابتدا یا انتهای متن؛
  • خلاصه عمومی و کم‌جزئیات؛
  • از دست رفتن تایم‌کدها؛
  • افزایش هزینه؛
  • دشوارشدن کنترل خروجی.

روش بهتر، خلاصه‌سازی سلسله‌مراتبی است.

مرحله اول: بخش‌بندی

Transcript را براساس یکی از این معیارها تقسیم کنید:

  • فصل‌های ویدیو؛
  • تغییر موضوع؛
  • تایم‌کد؛
  • هر ۵ تا ۱۰ دقیقه؛
  • تعداد مشخصی کلمه یا توکن؛
  • تغییر گوینده.

تقسیم براساس موضوع معمولاً بهتر از بریدن متن در اندازه ثابت است.

مرحله دوم: خلاصه هر بخش

برای هر بخش خروجی ثابتی تولید کنید:

  • عنوان؛
  • تایم‌کد؛
  • خلاصه؛
  • نکات اصلی؛
  • اعداد و نام‌ها؛
  • ابهام‌ها.

مرحله سوم: ادغام خلاصه‌ها

خلاصه بخش‌ها را به مدل بدهید و درخواست کنید:

  • تکرارها حذف شوند؛
  • ترتیب ویدیو حفظ شود؛
  • اختلاف دیدگاه‌ها باقی بماند؛
  • هیچ اطلاعات تازه‌ای اضافه نشود؛
  • نتیجه نهایی با تایم‌کد ساخته شود.

مرحله چهارم: کنترل پوشش

بررسی کنید هر فصل مهم حداقل در یک بخش از خلاصه آمده باشد.

پرامپت کنترل پوشش:

فهرست فصل‌های ویدیو و خلاصه نهایی را مقایسه کن.

مشخص کن:
- کدام فصل‌ها پوشش داده شده‌اند؟
- کدام فصل‌ها حذف شده‌اند؟
- کدام بخش‌ها بیش از حد خلاصه شده‌اند؟
- کدام نکات بدون تایم‌کد هستند؟
- کدام اطلاعات فقط در خلاصه آمده و در منبع وجود ندارد؟

چگونه خلاصه دارای تایم‌کد بسازیم؟

اگر Transcript شامل زمان باشد، از مدل بخواهید تایم‌کد را به اولین لحظه شروع هر موضوع متصل کند.

نمونه خروجی:

00:00 مقدمه و تعریف مسئله
03:25 معرفی روش اول
08:40 مثال عملی
15:10 مقایسه ابزارها
22:35 اشتباهات رایج
28:50 جمع‌بندی

برای افزایش دقت:

  • تایم‌کدها را از ورودی حذف نکنید؛
  • از مدل نخواهید زمان را حدس بزند؛
  • تایم‌کد هر بخش را از نزدیک‌ترین بلوک Transcript بردارد؛
  • چند زمان مهم را با ویدیو کنترل کنید.

ساخت جزوه از ویدیوی آموزشی

هوش مصنوعی می‌تواند یک کلاس ضبط‌شده را به جزوه تبدیل کند.

پرامپت:

از Transcript این کلاس یک جزوه آموزشی کامل بساز.

قواعد:
- ساختار درس را حفظ کن.
- توضیحات تکراری مدرس را ادغام کن.
- تعریف‌ها را دقیق بنویس.
- مثال‌های مدرس را جدا نمایش بده.
- نکات مهم را برجسته کن.
- مطالب خارج از Transcript اضافه نکن.
- برای هر بخش تایم‌کد شروع بنویس.
- در پایان، خلاصه مرور و ۱۰ سؤال تمرینی بساز.
- پاسخ سؤال‌ها را در بخش جداگانه قرار بده.

خروجی را پیش از استفاده آموزشی بررسی کنید؛ به‌خصوص در بخش اعداد، فرمول‌ها، نام‌ها و اصطلاحات تخصصی.

تبدیل خلاصه ویدیو به محتوای دیگر

یک Transcript می‌تواند ورودی چند نوع محتوا باشد.

تبدیل به مقاله

براساس Transcript ویدیو، یک مقاله ساختاریافته بنویس.

از کپی‌کردن لحن گفتاری خودداری کن.
تکرارها را حذف کن.
هیچ ادعا یا منبع جدیدی اضافه نکن.
مطالب را با تیترهای منطقی مرتب کن.

تبدیل به پست شبکه اجتماعی

از این خلاصه، پنج پست کوتاه مستقل بساز.
هر پست فقط یک نکته داشته باشد.
لحن ساده و آموزشی باشد.
ادعایی فراتر از ویدیو اضافه نکن.

تبدیل به سؤال و جواب

از محتوای ویدیو ۱۵ سؤال و جواب برای مرور بساز.
هر پاسخ حداکثر سه جمله باشد.
برای هر سؤال تایم‌کد بخش مرتبط را بنویس.

تبدیل به فلش‌کارت

از این ویدیو فلش‌کارت بساز.
هر کارت فقط یک مفهوم را بسنجد.
خروجی شامل Front، Back، Tag و Timestamp باشد.

تبدیل به توضیحات یوتیوب

از Transcript این ویدیو، توضیحات مناسب صفحه YouTube تولید کن.

شامل:
- معرفی کوتاه
- موضوعات اصلی
- فصل‌ها و تایم‌کدها
- سه نکته مهم

اطلاعاتی که در Transcript وجود ندارد اضافه نکن.

ساخت سیستم خلاصه‌ساز ویدیو با API درواره

توسعه‌دهندگان می‌توانند یک سامانه خلاصه‌سازی ویدیو با این معماری بسازند:

آپلود ویدیو
↓
استخراج صدا
↓
تبدیل گفتار به متن
↓
پاک‌سازی Transcript
↓
بخش‌بندی
↓
خلاصه هر بخش
↓
ادغام خلاصه‌ها
↓
کنترل پوشش
↓
خروجی نهایی

درواره زیرساخت دسترسی به مدل‌های هوش مصنوعی را فراهم می‌کند. برای هر مرحله باید مدلی متناسب با قابلیت موردنظر انتخاب شود:

  • مدل Speech-to-Text برای Transcript؛
  • مدل زبانی برای پاک‌سازی و خلاصه‌سازی؛
  • مدل دارای Context Window بزرگ برای محتوای طولانی؛
  • مدل سریع‌تر برای پردازش تعداد زیاد فایل.

آدرس پایه API درواره:

https://api.darvareh.ir/v1

برای مشاهده مدل‌های موجود و اطلاعات قیمت به صفحه مدل‌های درواره مراجعه کنید.

نمونه پایتون برای خلاصه‌سازی Transcript طولانی

در این مثال فرض می‌کنیم Transcript قبلاً ساخته شده و در فایل transcript.txt قرار دارد.

ابتدا کتابخانه را نصب کنید:

pip install openai

سپس:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)

MODEL_ID = "YOUR_MODEL_ID"
CHUNK_SIZE = 12000

with open("transcript.txt", "r", encoding="utf-8") as file:
    transcript = file.read()

def split_text(text, size):
    paragraphs = text.split("\n")
    chunks = []
    current = []

    for paragraph in paragraphs:
        candidate = "\n".join(current + [paragraph])

        if len(candidate) > size and current:
            chunks.append("\n".join(current))
            current = [paragraph]
        else:
            current.append(paragraph)

    if current:
        chunks.append("\n".join(current))

    return chunks

def summarize_chunk(chunk, index):
    prompt = f"""
این بخش شماره {index} از Transcript یک ویدیو است.

آن را به فارسی خلاصه کن.

خروجی:
- عنوان بخش
- خلاصه
- نکات کلیدی
- نام‌ها و اعداد مهم
- تایم‌کدهای موجود
- بخش‌های مبهم

فقط از متن استفاده کن و اطلاعات جدید اضافه نکن.

Transcript:
{chunk}
"""

    response = client.chat.completions.create(
        model=MODEL_ID,
        messages=[
            {
                "role": "system",
                "content": "تو ویراستار و خلاصه‌ساز دقیق محتوای ویدیویی هستی."
            },
            {
                "role": "user",
                "content": prompt
            }
        ],
        temperature=0.1,
    )

    return response.choices[0].message.content

chunks = split_text(transcript, CHUNK_SIZE)
partial_summaries = []

for index, chunk in enumerate(chunks, start=1):
    summary = summarize_chunk(chunk, index)
    partial_summaries.append(summary)

combined = "\n\n".join(partial_summaries)

final_prompt = f"""
خلاصه‌های بخش‌های یک ویدیو در ادامه آمده‌اند.

از آن‌ها یک خلاصه نهایی فارسی بساز.

ساختار:
1. خلاصه اجرایی
2. فصل‌های اصلی با تایم‌کد
3. نکات کلیدی
4. نام‌ها، اعداد و اصطلاحات مهم
5. نتیجه‌گیری گوینده
6. موارد نیازمند بررسی در ویدیوی اصلی

قواعد:
- ترتیب بخش‌ها حفظ شود.
- تکرارها حذف شوند.
- هیچ اطلاعات جدیدی اضافه نشود.
- تایم‌کدها تغییر نکنند.
- اختلاف دیدگاه‌ها حذف نشوند.

خلاصه‌های میانی:
{combined}
"""

response = client.chat.completions.create(
    model=MODEL_ID,
    messages=[
        {
            "role": "system",
            "content": "تو خلاصه‌های چندبخشی را بدون حذف نکات مهم ادغام می‌کنی."
        },
        {
            "role": "user",
            "content": final_prompt
        }
    ],
    temperature=0.1,
)

final_summary = response.choices[0].message.content

with open("video-summary.md", "w", encoding="utf-8") as file:
    file.write(final_summary)

print("Summary saved to video-summary.md")

به جای YOUR_MODEL_ID، شناسه مدل درواره را قرار دهید.

در پروژه عملی بهتر است به جای تقسیم صرفاً براساس تعداد نویسه، از توکن‌شماری، مرز موضوع و تایم‌کد استفاده شود.

انتخاب مدل مناسب برای خلاصه‌سازی ویدیو

هنگام انتخاب مدل به این موارد توجه کنید:

Context Window

اگر Transcript طولانی است، مدل باید ظرفیت کافی داشته باشد. با این حال، حتی مدل دارای Context بزرگ نیز ممکن است در خلاصه‌سازی مرحله‌ای نتیجه دقیق‌تری ارائه دهد.

کیفیت فارسی

مدل باید بتواند متن فارسی روان تولید و اصطلاحات انگلیسی را درست حفظ کند.

هزینه

برای فایل‌های طولانی، تعداد توکن ورودی زیاد می‌شود. می‌توان از مدل سریع و اقتصادی برای خلاصه بخش‌ها و مدل قوی‌تر برای ادغام نهایی استفاده کرد.

خروجی ساختاریافته

اگر نتیجه وارد نرم‌افزار می‌شود، خروجی JSON می‌تواند پردازش را ساده‌تر کند.

سرعت

برای پردازش تعاملی، زمان پاسخ مهم است. در پردازش دسته‌ای می‌توان اولویت بیشتری به هزینه یا کیفیت داد.

قالب JSON برای خلاصه ویدیو

{
  "title": "عنوان ویدیو",
  "language": "fa",
  "summary": "خلاصه کلی",
  "chapters": [
    {
      "start": "00:03:20",
      "title": "عنوان بخش",
      "summary": "خلاصه بخش",
      "key_points": [
        "نکته اول",
        "نکته دوم"
      ]
    }
  ],
  "important_terms": [
    {
      "term": "Context Window",
      "definition": "تعریف براساس ویدیو"
    }
  ],
  "action_items": [],
  "uncertain_segments": [
    {
      "timestamp": "00:17:40",
      "reason": "نام ابزار در Transcript واضح نیست"
    }
  ]
}

در سامانه عملی، این ساختار باید با JSON Schema اعتبارسنجی شود.

مشکلات رایج در خلاصه کردن ویدیو

اشتباه در نام‌ها و اصطلاحات

Speech-to-Text ممکن است نام مدل، شرکت، شخص یا اصطلاح فنی را اشتباه بنویسد.

راه‌حل:

  • واژه‌نامه تخصصی ارائه کنید؛
  • نام‌های احتمالی را پیش از پردازش مشخص کنید؛
  • Transcript را برای کلمات کلیدی بررسی کنید؛
  • نام‌ها را با منابع معتبر تطبیق دهید.

خلاصه بیش از حد کوتاه

اگر فقط بگویید «خلاصه کن»، مدل ممکن است جزئیات مهم را حذف کند.

نوع خروجی، طول و بخش‌های ضروری را مشخص کنید.

تولید اطلاعات خارج از ویدیو

مدل ممکن است برای تکمیل توضیح از دانش عمومی خود استفاده کند.

در پرامپت بنویسید:

فقط از Transcript استفاده کن. اگر اطلاعات کافی وجود ندارد، عبارت «در ویدیو مشخص نشده است» را بنویس.

حذف اختلاف‌نظر گویندگان

در مصاحبه و پادکست، ادغام بیش از حد ممکن است تفاوت دیدگاه‌ها را از بین ببرد.

از مدل بخواهید نظر هر گوینده را جدا نگه دارد.

تایم‌کدهای نادرست

اگر Transcript بدون زمان باشد، مدل نمی‌تواند زمان واقعی را بداند. از آن نخواهید تایم‌کد را حدس بزند.

کیفیت ضعیف صدا

نویز، موسیقی بلند، هم‌زمانی گویندگان و میکروفون ضعیف باعث افت دقت Transcript می‌شوند.

خلاصه‌کردن محتوای بصری فقط از روی صدا

اگر ویدیو شامل نمودار، کد، اسلاید یا آموزش تصویری است، Transcript تمام اطلاعات را منتقل نمی‌کند.

برای چنین محتوایی ممکن است به این موارد نیاز باشد:

  • استخراج فریم‌های مهم؛
  • OCR اسلایدها؛
  • مدل چندوجهی؛
  • توضیح دستی عناصر بصری؛
  • دریافت فایل اسلاید در کنار Transcript.

خلاصه‌سازی ویدیوی آموزشی برنامه‌نویسی

در آموزش برنامه‌نویسی، فقط گفتار کافی نیست. کد نمایش‌داده‌شده روی صفحه ممکن است در Transcript وجود نداشته باشد.

فرایند بهتر:

  1. Transcript را استخراج کنید.
  2. مخزن یا کدهای همراه ویدیو را دریافت کنید.
  3. فریم‌های مربوط به کد را جدا کنید.
  4. اصطلاحات و نام کتابخانه‌ها را اصلاح کنید.
  5. مراحل اجرا را به ترتیب بنویسید.
  6. دستورات را در بلوک کد قرار دهید.
  7. خطاهای مطرح‌شده را جدا کنید.
  8. نسخه ابزارها را ثبت کنید.

پرامپت:

این Transcript مربوط به آموزش برنامه‌نویسی است.

خلاصه را به شکل Tutorial تولید کن:
- پیش‌نیازها
- ابزارها و نسخه‌ها
- مراحل نصب
- دستورات
- توضیح کد
- خروجی مورد انتظار
- خطاهای مطرح‌شده
- جمع‌بندی

هیچ کدی را از خودت تولید نکن.
اگر کد در Transcript کامل نیست، آن را با برچسب «کد ناقص» مشخص کن.

چگونه دقت خلاصه را بررسی کنیم؟

نمونه‌برداری زمانی

چند بخش از خلاصه را انتخاب و به تایم‌کد مربوطه مراجعه کنید.

کنترل اعداد

تمام اعداد، تاریخ‌ها، نسخه‌ها، قیمت‌ها و درصدها را با ویدیو تطبیق دهید.

کنترل نام‌ها

نام اشخاص، شرکت‌ها، مدل‌ها و ابزارها را بررسی کنید.

کنترل پوشش

فصل‌های ویدیو را با خلاصه مقایسه کنید تا موضوع مهمی حذف نشده باشد.

کنترل انتساب

مطمئن شوید هر دیدگاه به گوینده درست نسبت داده شده است.

کنترل اطلاعات افزوده

جمله‌هایی را که در Transcript پشتوانه ندارند حذف یا مشخص کنید.

چک‌لیست نهایی

  • زبان ویدیو درست انتخاب شده است؟
  • Transcript کامل است؟
  • تایم‌کدها حفظ شده‌اند؟
  • نام‌ها و اصطلاحات اصلاح شده‌اند؟
  • نوع خلاصه متناسب با هدف است؟
  • مدل فقط از منبع استفاده کرده است؟
  • دیدگاه گویندگان با هم ترکیب نشده است؟
  • اعداد و نسخه‌ها بررسی شده‌اند؟
  • فصل‌های مهم پوشش داده شده‌اند؟
  • بخش‌های مبهم مشخص شده‌اند؟
  • محتوای بصری مهم نادیده گرفته نشده است؟
  • فایل خصوصی بدون بررسی شرایط سرویس بارگذاری نشده است؟
  • خلاصه جایگزین بررسی منبع در تصمیم‌های مهم نشده است؟

پرسش‌های متداول

چگونه ویدیو یوتیوب را با هوش مصنوعی خلاصه کنیم؟

ساده‌ترین روش این است که Transcript ویدیو را از YouTube دریافت و آن را با یک پرامپت دقیق به مدل زبانی بدهید. همچنین می‌توانید از ابزارهای لینک‌محور مانند Glasp یا Notta استفاده کنید.

آیا می‌توان لینک یوتیوب را مستقیم به هوش مصنوعی داد؟

بعضی ابزارها و سرویس‌ها می‌توانند لینک عمومی YouTube را پردازش کنند، اما همه مدل‌های چت مستقیماً به ویدیو یا Transcript آن دسترسی ندارند. اگر پردازش لینک ممکن نبود، Transcript را استخراج کنید.

بهترین هوش مصنوعی خلاصه ویدیو چیست؟

برای استفاده سریع، ابزارهای تخصصی YouTube Summarizer مناسب‌اند. برای تحلیل چند منبع، Gemini Notebook کاربردی است. برای ساخت محصول اختصاصی و پردازش کنترل‌شده نیز می‌توان از مدل‌های Speech-to-Text و مدل‌های زبانی از طریق API درواره استفاده کرد.

آیا می‌توان ویدیوی فارسی را خلاصه کرد؟

بله. ابتدا باید گفتار فارسی با دقت مناسب به متن تبدیل شود. سپس مدل زبانی می‌تواند Transcript را به خلاصه، جزوه یا نکات کلیدی فارسی تبدیل کند.

آیا خلاصه‌کردن ویدیو رایگان است؟

بعضی ابزارها استفاده محدود رایگان دارند، اما محدودیت طول، تعداد ویدیو یا مدل ممکن است تغییر کند. شرایط فعلی هر سرویس را در صفحه رسمی آن بررسی کنید.

چگونه ویدیوی بدون زیرنویس را خلاصه کنیم؟

فایل ویدیو یا صدای آن را با یک مدل Speech-to-Text به Transcript تبدیل کنید و سپس متن را خلاصه کنید.

آیا هوش مصنوعی محتوای تصویری ویدیو را هم می‌فهمد؟

مدل چندوجهی می‌تواند فریم‌ها و عناصر بصری را تحلیل کند، اما بسیاری از خلاصه‌سازهای لینک‌محور فقط از Transcript استفاده می‌کنند. برای ویدیوهای دارای اسلاید، کد یا نمودار باید محتوای تصویری نیز پردازش شود.

چگونه خلاصه دارای تایم‌کد بسازیم؟

Transcript را همراه با زمان به مدل بدهید و بخواهید هر فصل یا نکته را به نزدیک‌ترین زمان موجود متصل کند. اگر ورودی زمان ندارد، نباید از مدل بخواهید تایم‌کد را حدس بزند.

آیا می‌توان از یک ویدیو مقاله ساخت؟

بله. پس از تولید Transcript و خلاصه، می‌توان محتوا را به مقاله تبدیل کرد. متن نهایی باید بازنویسی، ساختاربندی، کنترل و از نظر منابع و صحت اطلاعات بررسی شود.

آیا درواره یک سایت آماده خلاصه‌کردن یوتیوب است؟

درواره ابزار مصرفی آماده برای قراردادن لینک YouTube نیست؛ بلکه زیرساخت دسترسی به مدل‌های هوش مصنوعی را فراهم می‌کند. توسعه‌دهندگان می‌توانند با API درواره سامانه خلاصه‌سازی ویدیو، کلاس، جلسه یا پادکست بسازند.

جمع‌بندی

خلاصه کردن ویدیو با هوش مصنوعی می‌تواند فرایند مرور کلاس، وبینار، مصاحبه، پادکست و ویدیوی یوتیوب را بسیار ساده‌تر کند. با این حال، یک خلاصه دقیق از یک Transcript دقیق آغاز می‌شود.

فرایند پیشنهادی عبارت است از:

  1. هدف خلاصه را مشخص کنید.
  2. Transcript یا زیرنویس را دریافت کنید.
  3. متن خام را پاک‌سازی کنید.
  4. نام‌ها و اصطلاحات را اصلاح کنید.
  5. ویدیوهای طولانی را بخش‌بندی کنید.
  6. هر بخش را جداگانه خلاصه کنید.
  7. خلاصه‌ها را در یک مرحله نهایی ادغام کنید.
  8. تایم‌کدها را حفظ کنید.
  9. اعداد و ادعاهای مهم را با ویدیو تطبیق دهید.
  10. برای محتوای بصری، فریم‌ها یا اسلایدها را نیز بررسی کنید.
  11. بخش‌های مبهم را به‌جای حدس‌زدن مشخص کنید.
  12. خلاصه را متناسب با کاربرد نهایی بازطراحی کنید.

اگر می‌خواهید یک سامانه خلاصه‌سازی برای ویدیو، کلاس، جلسه یا محتوای آموزشی بسازید، می‌توانید در درواره ثبت‌نام کنید و از مدل‌های مختلف تبدیل گفتار به متن و مدل‌های زبانی از طریق یک API یکپارچه استفاده کنید. مدل‌های موجود و اطلاعات قیمت در صفحه مدل‌های درواره ارائه شده‌اند.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more