تبدیل PDF به Word با هوش مصنوعی؛ آموزش فایل فارسی و اسکن‌شده

در این راهنمای عملی یاد می‌گیرید فایل‌های PDF متنی، فارسی، اسکن‌شده و جدول‌دار را به Word قابل ویرایش تبدیل کنید و خطاهای OCR و ساختار سند را با هوش مصنوعی اصلاح کنید.

Share
تبدیل PDF به Word با هوش مصنوعی؛ آموزش فایل فارسی و اسکن‌شده

تبدیل PDF به Word یکی از پرکاربردترین نیازهای کاربران اداری، دانشجویان، پژوهشگران، مترجمان و تولیدکنندگان محتوا است. بسیاری از اسناد فقط به‌صورت PDF در دسترس هستند، اما برای اصلاح متن، استخراج جدول، ترجمه، به‌روزرسانی گزارش یا استفاده مجدد از محتوا به یک فایل Word قابل ویرایش نیاز داریم.

تبدیل یک PDF ساده و متنی معمولاً کار دشواری نیست. مشکل زمانی آغاز می‌شود که فایل شامل متن فارسی، صفحات اسکن‌شده، جدول، فرمول، چند ستون، پاورقی یا ترکیبی از فارسی و انگلیسی باشد. مبدل‌های معمولی در چنین شرایطی ممکن است ترتیب جمله‌ها را به هم بریزند، حروف فارسی را جدا کنند یا هر خط را داخل یک کادر مستقل قرار دهند.

هوش مصنوعی می‌تواند بعد از استخراج متن، ساختار سند را تشخیص دهد، خطاهای OCR را اصلاح کند، تیترها و پاراگراف‌ها را بازسازی کند و محتوای نهایی را برای انتقال به Word آماده سازد.

در این راهنما یاد می‌گیرید:

  • چگونه نوع PDF را تشخیص دهید
  • فایل PDF متنی را مستقیماً در Word باز کنید
  • PDF اسکن‌شده را با OCR به متن تبدیل کنید
  • خطاهای متن فارسی را با هوش مصنوعی اصلاح کنید
  • جدول‌ها و سرفصل‌ها را بازسازی کنید
  • بهترین ابزار را برای هر نوع فایل انتخاب کنید
  • با پایتون و API درواره فایل DOCX تولید کنید
  • کیفیت خروجی را قبل از استفاده نهایی کنترل کنید

آیا واقعاً برای تبدیل PDF به Word به هوش مصنوعی نیاز داریم؟

همیشه نه.

اگر PDF شما بیشتر شامل متن ساده باشد و از یک فایل Word یا نرم‌افزار مشابه تولید شده باشد، Microsoft Word یا یک مبدل PDF معمولی می‌تواند نتیجه مناسبی ایجاد کند.

هوش مصنوعی زمانی ارزش بیشتری دارد که با یکی از این مشکلات روبه‌رو باشید:

  • فایل PDF اسکن‌شده است.
  • متن فارسی به‌درستی استخراج نمی‌شود.
  • ترتیب پاراگراف‌ها به هم ریخته است.
  • سند چندستونه است.
  • جدول‌ها خراب شده‌اند.
  • عنوان‌ها از متن عادی قابل تشخیص نیستند.
  • سربرگ و پابرگ در متن اصلی تکرار شده‌اند.
  • فاصله و نیم‌فاصله کلمات فارسی نادرست است.
  • حروف مشابه در OCR اشتباه تشخیص داده شده‌اند.
  • می‌خواهید هم‌زمان متن را بازنویسی یا خلاصه کنید.
  • باید تعداد زیادی فایل را به‌صورت خودکار پردازش کنید.
  • می‌خواهید خروجی قالب ثابتی مانند گزارش یا صورت‌جلسه داشته باشد.

در چنین شرایطی، تبدیل فایل بهتر است در سه مرحله انجام شود:

  1. استخراج متن و عناصر سند
  2. اصلاح و بازسازی محتوا با هوش مصنوعی
  3. تولید و صفحه‌آرایی فایل Word

تفاوت PDF متنی و PDF اسکن‌شده چیست؟

پیش از انتخاب ابزار باید نوع PDF را تشخیص دهید.

PDF متنی

در PDF متنی می‌توانید با ماوس کلمات را انتخاب و کپی کنید. این فایل معمولاً از Word، مرورگر، نرم‌افزار حسابداری یا ابزار صفحه‌آرایی خروجی گرفته شده است.

ویژگی‌های PDF متنی:

  • متن قابل انتخاب است.
  • جست‌وجوی کلمات داخل فایل کار می‌کند.
  • حجم فایل معمولاً کمتر است.
  • استخراج متن دقت بیشتری دارد.
  • تبدیل به Word ساده‌تر است.

PDF اسکن‌شده

PDF اسکن‌شده در واقع مجموعه‌ای از تصاویر است. ممکن است صفحه شبیه متن دیده شود، اما نرم‌افزار آن را به‌عنوان تصویر می‌شناسد.

ویژگی‌های PDF اسکن‌شده:

  • متن قابل انتخاب نیست.
  • جست‌وجوی کلمات نتیجه‌ای ندارد.
  • با بزرگ‌نمایی، نوشته‌ها پیکسلی می‌شوند.
  • برای استخراج متن به OCR نیاز دارد.
  • کیفیت خروجی به وضوح و زاویه اسکن وابسته است.

OCR مخفف Optical Character Recognition و به معنی تشخیص نوری کاراکتر است. OCR تصویر حروف را تحلیل و آن‌ها را به متن قابل انتخاب تبدیل می‌کند.

PDF ترکیبی

بعضی فایل‌ها ترکیبی هستند؛ برای مثال، صفحات اول متنی و ضمیمه‌ها اسکن‌شده‌اند. این فایل‌ها باید صفحه‌به‌صفحه بررسی شوند.

انتخاب سریع روش مناسب

نوع فایلروش پیشنهادینیاز به OCRنقش هوش مصنوعی
PDF ساده و متنیباز کردن در Wordخیراصلاح نگارش و ساختار
PDF متنی با جدولAdobe Acrobat یا Wordمعمولاً خیربازسازی جدول
PDF اسکن‌شده واضحابزار OCRبلهاصلاح خطاهای OCR
PDF فارسی اسکن‌شدهOCR دارای پشتیبانی فارسیبلهاصلاح فاصله، حروف و ترتیب جمله
PDF چندستونهتبدیل اولیه و بازسازی ساختارشایدتشخیص ترتیب بخش‌ها
PDF دارای فرمولابزار تخصصی استخراج فرمولشایدتوضیح یا بازنویسی، نه بازسازی قطعی فرمول
تعداد زیاد فایلگردش‌کار خودکاربسته به فایلدسته‌بندی و ساخت DOCX
سند محرمانه سازمانیابزار داخلی یا پردازش کنترل‌شدهبسته به فایلتولید خروجی در سامانه اختصاصی

روش اول: باز کردن مستقیم PDF در Microsoft Word

ساده‌ترین راه برای تبدیل PDF متنی، باز کردن آن داخل Word است.

مراحل تبدیل PDF به Word

  1. Microsoft Word را باز کنید.
  2. از منوی File وارد Open شوید.
  3. گزینه Browse را انتخاب کنید.
  4. فایل PDF را باز کنید.
  5. پیام تبدیل PDF را تأیید کنید.
  6. بعد از باز شدن سند، نتیجه را بررسی کنید.
  7. از مسیر File و Save As فایل را با فرمت DOCX ذخیره کنید.

Word محتوای PDF را به یک سند قابل ویرایش تبدیل می‌کند و تلاش می‌کند پاراگراف‌ها، فهرست‌ها، تصاویر و جدول‌ها را حفظ کند. مایکروسافت توضیح می‌دهد که نتیجه تبدیل ممکن است دقیقاً شبیه فایل اصلی نباشد و این روش برای PDFهایی که بیشتر شامل متن هستند عملکرد بهتری دارد. راهنمای رسمی باز کردن PDF در Word

این روش برای چه فایل‌هایی مناسب است؟

  • گزارش‌های متنی
  • مقاله‌های ساده
  • قراردادها و نامه‌های تایپ‌شده
  • رزومه‌های ساده
  • فایل‌های خروجی‌گرفته‌شده از Word
  • اسناد بدون صفحه‌آرایی پیچیده

محدودیت‌های باز کردن PDF در Word

ممکن است مشکلات زیر ایجاد شوند:

  • محل شکست صفحات تغییر کند.
  • فونت اصلی جایگزین شود.
  • هر خط به یک پاراگراف تبدیل شود.
  • جدول‌ها به متن ساده تبدیل شوند.
  • ترتیب ستون‌ها تغییر کند.
  • تصاویر جابه‌جا شوند.
  • پاورقی‌ها در محل نامناسب قرار بگیرند.
  • متن فارسی و انگلیسی جهت درستی نداشته باشد.
  • فرمول‌ها به تصویر تبدیل شوند.

اگر هدف شما فقط اصلاح چند جمله است، این مشکلات اهمیت زیادی ندارند. اما برای بازسازی یک سند حرفه‌ای باید بعد از تبدیل، صفحه‌آرایی را اصلاح کنید.

روش دوم: تبدیل PDF به Word با Adobe Acrobat

Adobe Acrobat یکی از ابزارهای شناخته‌شده برای تبدیل فایل PDF به فرمت‌های Word است.

مراحل کلی

  1. فایل را در Adobe Acrobat باز کنید.
  2. گزینه Convert یا Export a PDF را انتخاب کنید.
  3. Microsoft Word را به‌عنوان فرمت خروجی انتخاب کنید.
  4. فرمت DOCX را مشخص کنید.
  5. تنظیمات تبدیل را بررسی کنید.
  6. فایل Word را ذخیره کنید.

Adobe راهنمای رسمی مستقلی برای تبدیل PDF به Word ارائه کرده است. راهنمای تبدیل PDF به Word در Acrobat

تبدیل PDF اسکن‌شده در Acrobat

برای فایل اسکن‌شده ابتدا باید OCR اجرا شود:

  1. PDF اسکن‌شده را باز کنید.
  2. وارد بخش All tools شوید.
  3. گزینه Scan & OCR را انتخاب کنید.
  4. روی In this file بزنید.
  5. محدوده صفحات و زبان سند را مشخص کنید.
  6. Recognize Text را اجرا کنید.
  7. بعد از تشخیص متن، فایل را به Word تبدیل کنید.

Acrobat پس از اجرای OCR یک لایه متنی قابل جست‌وجو روی تصویر صفحات ایجاد می‌کند. مستندات رسمی OCR در Adobe Acrobat

کنترل خطاهای OCR

در فایل‌های اسکن‌شده نباید بدون بازبینی، خروجی را نهایی در نظر بگیرید. Acrobat می‌تواند بعضی کلمات نامطمئن را برای بررسی مشخص کند. این قابلیت برای اصلاح نام افراد، اعداد و واژه‌های کم‌کیفیت مفید است. آموزش بررسی خطاهای OCR در Acrobat

روش سوم: تبدیل رایگان PDF به متن با Google Drive

Google Drive می‌تواند فایل PDF یا تصویر را به متن قابل ویرایش تبدیل کند. این روش بیشتر برای استخراج محتوا مناسب است و نباید انتظار داشته باشید صفحه‌آرایی پیچیده سند کاملاً حفظ شود.

مراحل استفاده

  1. فایل PDF را در Google Drive بارگذاری کنید.
  2. روی فایل کلیک راست کنید.
  3. Open with را انتخاب کنید.
  4. فایل را با Google Docs باز کنید.
  5. متن استخراج‌شده را بررسی کنید.
  6. از منوی File گزینه Download را انتخاب کنید.
  7. فایل را با فرمت Microsoft Word دانلود کنید.

گوگل برای تبدیل PDF و تصاویر به متن، راهنمای رسمی ارائه کرده است. راهنمای تبدیل PDF و تصویر به متن در Google Drive

مزایای این روش

  • استفاده ساده
  • مناسب برای استخراج متن
  • امکان ویرایش داخل Google Docs
  • امکان دانلود خروجی با فرمت DOCX
  • مناسب برای فایل‌های کم‌حجم و نسبتاً ساده

محدودیت‌ها

  • صفحه‌آرایی ممکن است حفظ نشود.
  • جدول‌ها احتمالاً نیازمند بازسازی هستند.
  • کیفیت OCR فارسی به کیفیت تصویر وابسته است.
  • سربرگ و پابرگ ممکن است وارد متن اصلی شوند.
  • ترتیب متن در فایل‌های چندستونه ممکن است نادرست باشد.

روش چهارم: استفاده از مبدل‌های آنلاین PDF به Word

سرویس‌هایی مانند iLovePDF و ابزارهای مشابه، تبدیل PDF به Word را مستقیماً در مرورگر انجام می‌دهند.

فرایند معمول شامل این مراحل است:

  1. ورود به ابزار PDF to Word
  2. بارگذاری فایل
  3. انتخاب تبدیل معمولی یا OCR
  4. شروع پردازش
  5. دانلود فایل DOCX
  6. بررسی خروجی در Word

iLovePDF امکان تبدیل PDF به Word و استفاده از OCR برای بعضی فایل‌های اسکن‌شده را ارائه می‌دهد. پشتیبانی زبان OCR ممکن است بین ابزارها و طرح‌های مختلف متفاوت باشد؛ بنابراین برای فایل فارسی، زبان‌های قابل پشتیبانی را پیش از بارگذاری بررسی کنید. ابزار PDF to Word در iLovePDF

مبدل آنلاین برای اسناد عمومی و غیرحساس مناسب است. برای اسناد سازمانی یا اطلاعات خصوصی، ابتدا شرایط نگهداری و پردازش فایل سرویس را بررسی کنید یا از ابزار آفلاین و سامانه اختصاصی استفاده کنید.

هوش مصنوعی چگونه کیفیت فایل Word را بهتر می‌کند؟

مبدل PDF فقط قالب فایل را تغییر می‌دهد. مدل هوش مصنوعی می‌تواند محتوای استخراج‌شده را تحلیل و بازسازی کند.

اصلاح شکست نادرست خطوط

خروجی اولیه ممکن است چنین باشد:

استفاده از هوش مصنوعی در
فرایندهای سازمانی می‌تواند
سرعت انجام کارها را افزایش
دهد.

پرامپت اصلاح:

متن زیر از یک فایل PDF استخراج شده است. شکست‌های غیرضروری خطوط را حذف و جمله‌ها را به پاراگراف‌های طبیعی تبدیل کن. هیچ کلمه یا اطلاعاتی را اضافه، حذف یا بازنویسی نکن.

حذف سربرگ و پابرگ تکراری

این متن از یک PDF چندصفحه‌ای استخراج شده است. عبارت‌هایی را که در ابتدا یا انتهای بیشتر صفحات به‌عنوان سربرگ، پابرگ یا شماره صفحه تکرار شده‌اند شناسایی و حذف کن.

به متن اصلی، عنوان‌ها، اعداد و منابع دست نزن.

اصلاح خطاهای OCR فارسی

خطاهای رایج OCR فارسی شامل موارد زیر است:

  • اشتباه گرفتن «ی» و «ى»
  • اشتباه گرفتن «ک» و «ك»
  • حذف فاصله میان کلمات
  • افزودن فاصله داخل یک کلمه
  • اشتباه در اعداد فارسی
  • جابه‌جایی علائم نگارشی
  • جدا شدن پیشوند «می»
  • تغییر جهت پرانتزها
  • اشتباه در واژه‌های فارسی و انگلیسی ترکیبی

پرامپت پیشنهادی:

متن زیر با OCR از یک PDF فارسی استخراج شده است.

وظیفه:
فقط خطاهای احتمالی OCR، فاصله‌گذاری، نیم‌فاصله و نشانه‌گذاری را اصلاح کن.

قواعد:
- جمله‌ها را بازنویسی نکن.
- مفهوم متن را تغییر نده.
- عدد، تاریخ، نام و اصطلاح تخصصی جدید نساز.
- اگر درباره کلمه‌ای مطمئن نیستی، آن را داخل [براکت] قرار بده.
- شکل فارسی «ی» و «ک» را یکدست کن.
- متن نهایی راست‌به‌چپ و مناسب Word باشد.

تشخیص سرفصل‌ها

متن استخراج‌شده از PDF را بررسی کن و ساختار آن را بازسازی کن.

برای هر بخش یکی از این برچسب‌ها را قرار بده:
[TITLE]
[HEADING 1]
[HEADING 2]
[PARAGRAPH]
[LIST]
[CAPTION]

هیچ متن جدیدی تولید نکن و ترتیب منطقی محتوای اصلی را حفظ کن.

بعد می‌توانید این برچسب‌ها را در Word به Styleهای واقعی تبدیل کنید.

بازسازی فهرست‌ها

بخش زیر در فایل PDF به‌صورت فهرست بوده، اما پس از استخراج به یک پاراگراف تبدیل شده است. موارد مستقل را تشخیص بده و به فهرست شماره‌دار یا بولت‌دار تبدیل کن. کلمات و ترتیب موارد را تغییر نده.

بازسازی جدول

فرض کنید خروجی OCR چنین باشد:

محصول تعداد قیمت
مدل الف 10 250000
مدل ب 8 310000

پرامپت:

متن زیر از یک جدول PDF استخراج شده است. آن را بدون تغییر مقادیر به جدول Markdown تبدیل کن.

ستون‌ها:
محصول
تعداد
قیمت

اگر محل یک مقدار مشخص نیست، آن را حدس نزن و عبارت «نامشخص» بنویس.

خروجی:

محصولتعدادقیمت
مدل الف۱۰۲۵۰٬۰۰۰
مدل ب۸۳۱۰٬۰۰۰

این جدول را می‌توانید در Word بازسازی کنید. برای جدول‌های مالی یا آماری، تمام مقادیر باید با PDF اصلی تطبیق داده شوند.

پرامپت جامع تبدیل متن PDF به محتوای Word

نقش شما:
به‌عنوان ویراستار اسناد فارسی و متخصص بازسازی محتوای استخراج‌شده از PDF عمل کن.

وظیفه:
متن استخراج‌شده را برای انتقال به Microsoft Word پاک‌سازی و ساختاربندی کن.

قواعد:
- هیچ اطلاعات جدیدی تولید نکن.
- متن را خلاصه یا بازنویسی نکن.
- ترتیب منطقی بخش‌ها را حفظ کن.
- شکست‌های غیرضروری خط را حذف کن.
- سربرگ، پابرگ و شماره صفحه تکراری را حذف کن.
- خطاهای آشکار OCR را اصلاح کن.
- موارد نامطمئن را داخل [براکت] قرار بده.
- عنوان‌ها و زیرعنوان‌ها را تشخیص بده.
- فهرست‌ها را بازسازی کن.
- جدول‌ها را تا حد ممکن ساختاریافته ارائه بده.
- اعداد، تاریخ‌ها، نام‌ها و منابع را عیناً حفظ کن.
- نیم‌فاصله و نشانه‌گذاری فارسی را رعایت کن.
- عبارت‌های انگلیسی را تغییر نده.

قالب خروجی:
عنوان سند
سرفصل‌های اصلی
زیرعنوان‌ها
پاراگراف‌های پیوسته
فهرست‌ها
جدول‌ها
فهرست موارد نیازمند بررسی

متن استخراج‌شده:
[متن PDF]

تبدیل PDF فارسی به Word؛ گردش‌کار پیشنهادی

برای یک فایل فارسی، این فرایند معمولاً نتیجه بهتری ایجاد می‌کند:

مرحله اول: بررسی کیفیت فایل

کنترل کنید:

  • متن قابل انتخاب است یا نه؟
  • صفحات صاف و بدون چرخش هستند؟
  • وضوح تصویر کافی است؟
  • حاشیه صفحات بریده نشده است؟
  • فایل تک‌ستونه یا چندستونه است؟
  • جدول، تصویر یا فرمول دارد؟
  • زبان سند فقط فارسی است یا فارسی و انگلیسی؟

مرحله دوم: انتخاب روش استخراج

  • PDF متنی ساده: Word یا Acrobat
  • PDF اسکن‌شده: OCR دارای پشتیبانی فارسی
  • فایل چندستونه: استخراج صفحه‌به‌صفحه
  • جدول‌های پیچیده: استخراج جداگانه جدول
  • فرمول‌های علمی: ابزار تخصصی یا بازنویسی دستی
  • سند طولانی: پردازش بخش‌بخش

مرحله سوم: اصلاح متن با هوش مصنوعی

در این مرحله از مدل نخواهید متن را «بهتر» کند. هدف باید حفظ محتوا و اصلاح خطاهای تبدیل باشد.

مرحله چهارم: انتقال به Word

بعد از اصلاح محتوا:

  1. متن را در Word قرار دهید.
  2. جهت پاراگراف‌ها را راست‌به‌چپ کنید.
  3. عنوان‌ها را به Heading تبدیل کنید.
  4. جدول‌ها را بازسازی کنید.
  5. تصاویر را در محل مناسب قرار دهید.
  6. Header و Footer را دوباره بسازید.
  7. فهرست مطالب ایجاد کنید.

مرحله پنجم: مقایسه با PDF اصلی

PDF و Word را کنار هم باز کنید و موارد زیر را بررسی کنید:

  • تعداد صفحات و بخش‌ها
  • عنوان‌ها
  • پاراگراف‌های حذف‌شده
  • ترتیب ستون‌ها
  • اعداد و تاریخ‌ها
  • جدول‌ها
  • پاورقی‌ها
  • منابع
  • تصاویر و توضیحات آن‌ها

در Word می‌توانید دو سند یا پنجره را کنار هم قرار دهید تا مقایسه آسان‌تر شود.

تبدیل PDF طولانی به Word

ارسال یک PDF صدصفحه‌ای به مدل در یک مرحله ممکن است باعث حذف بخش‌ها، جابه‌جایی محتوا یا افزایش هزینه پردازش شود.

روش مناسب:

  1. صفحات مقدماتی را جدا کنید.
  2. فهرست مطالب را استخراج کنید.
  3. سند را بر اساس فصل یا سرفصل تقسیم کنید.
  4. هر بخش را جداگانه پاک‌سازی کنید.
  5. خروجی‌ها را به ترتیب در Word قرار دهید.
  6. یک مرحله نهایی برای کنترل ساختار اجرا کنید.

برای هر بخش یک شناسه مشخص در نظر بگیرید:

سند: گزارش سالانه
بخش: فصل سوم
صفحات: ۳۲ تا ۴۸
وظیفه: اصلاح خطاهای استخراج بدون بازنویسی محتوا

این روش احتمال ترکیب شدن بخش‌های مختلف را کاهش می‌دهد.

ساخت خودکار فایل Word از PDF با API درواره

برای پردازش تعداد زیادی فایل می‌توان یک برنامه ساخت که:

  1. متن PDF را استخراج کند.
  2. متن را به مدل هوش مصنوعی ارسال کند.
  3. ساختار سند را بازسازی کند.
  4. فایل DOCX ایجاد کند.
  5. خروجی را برای بازبینی آماده کند.

درواره یک مبدل آماده PDF به Word نیست؛ بلکه زیرساخت API هوش مصنوعی را در اختیار توسعه‌دهندگان قرار می‌دهد. استخراج اولیه PDF باید با کتابخانه یا سرویس مناسب انجام شود و سپس می‌توان از مدل‌های در دسترس درواره برای پاک‌سازی و ساختاربندی محتوا استفاده کرد.

نصب کتابخانه‌ها

pip install openai pymupdf python-docx

در این نمونه:

  • PyMuPDF متن PDF را استخراج می‌کند.
  • API درواره متن را پاک‌سازی می‌کند.
  • python-docx فایل Word می‌سازد.

تنظیم کلید API

Linux و macOS:

export DARVAREH_API_KEY="YOUR_API_KEY"

PowerShell:

$env:DARVAREH_API_KEY="YOUR_API_KEY"

نمونه کد کامل

import os

import fitz
from docx import Document
from docx.enum.text import WD_ALIGN_PARAGRAPH
from docx.oxml import OxmlElement
from openai import OpenAI


client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)


def extract_pdf_text(pdf_path):
    pdf = fitz.open(pdf_path)
    pages = []

    for page_number, page in enumerate(pdf, start=1):
        text = page.get_text("text")
        pages.append(
            f"\n[PAGE {page_number}]\n{text.strip()}"
        )

    pdf.close()
    return "\n".join(pages)


def clean_with_ai(raw_text):
    prompt = f"""
متن زیر از یک فایل PDF فارسی استخراج شده است.

آن را برای انتقال به Word پاک‌سازی کن.

قواعد:
- هیچ اطلاعاتی اضافه یا حذف نکن.
- متن را خلاصه یا بازنویسی نکن.
- شکست‌های غیرضروری خطوط را اصلاح کن.
- سربرگ و پابرگ تکراری را حذف کن.
- خطاهای آشکار OCR را اصلاح کن.
- عنوان‌ها را با علامت ## مشخص کن.
- زیرعنوان‌ها را با علامت ### مشخص کن.
- پاراگراف‌ها را پیوسته نگه دار.
- اعداد، تاریخ‌ها و نام‌ها را تغییر نده.
- موارد نامطمئن را داخل [براکت] قرار بده.
- خروجی فقط شامل متن پاک‌سازی‌شده باشد.

متن:
{raw_text}
"""

    response = client.chat.completions.create(
        model="YOUR_MODEL_ID",
        messages=[
            {
                "role": "system",
                "content": (
                    "شما متخصص بازسازی اسناد فارسی هستید. "
                    "باید محتوای منبع را دقیقاً حفظ کنید."
                ),
            },
            {
                "role": "user",
                "content": prompt,
            },
        ],
        temperature=0.1,
    )

    return response.choices[0].message.content


def set_rtl(paragraph):
    paragraph.alignment = WD_ALIGN_PARAGRAPH.RIGHT
    paragraph_properties = paragraph._p.get_or_add_pPr()

    bidi = OxmlElement("w:bidi")
    paragraph_properties.append(bidi)

    for run in paragraph.runs:
        run_properties = run._r.get_or_add_rPr()
        rtl = OxmlElement("w:rtl")
        run_properties.append(rtl)


def create_word_document(cleaned_text, output_path):
    document = Document()

    for line in cleaned_text.splitlines():
        line = line.strip()

        if not line:
            continue

        if line.startswith("### "):
            paragraph = document.add_heading(line[4:], level=2)
        elif line.startswith("## "):
            paragraph = document.add_heading(line[3:], level=1)
        else:
            paragraph = document.add_paragraph(line)

        set_rtl(paragraph)

    document.save(output_path)


raw_text = extract_pdf_text("input.pdf")
cleaned_text = clean_with_ai(raw_text)
create_word_document(cleaned_text, "output.docx")

print("فایل output.docx ساخته شد.")

نکته مهم درباره PDF اسکن‌شده

کد بالا برای PDF متنی مناسب است. اگر page.get_text() متن خالی یا بسیار کوتاهی برگرداند، فایل احتمالاً اسکن‌شده است.

در این حالت باید پیش از ارسال محتوا به مدل، OCR اجرا کنید:

PDF اسکن‌شده
      ↓
تبدیل هر صفحه به تصویر
      ↓
اجرای OCR فارسی
      ↓
اصلاح متن با مدل هوش مصنوعی
      ↓
ساخت فایل DOCX

مدل زبانی جایگزین کامل OCR نیست. OCR وظیفه تشخیص نوشته داخل تصویر را بر عهده دارد و مدل هوش مصنوعی نتیجه تشخیص را اصلاح و ساختاربندی می‌کند.

پردازش فایل‌های طولانی

برای PDFهای طولانی، متن را یکجا ارسال نکنید. آن را بر اساس صفحات یا فصل‌ها تقسیم کنید:

def split_text(text, max_chars=12000):
    chunks = []
    current = []

    current_length = 0

    for paragraph in text.split("\n"):
        paragraph_length = len(paragraph) + 1

        if current_length + paragraph_length > max_chars and current:
            chunks.append("\n".join(current))
            current = []
            current_length = 0

        current.append(paragraph)
        current_length += paragraph_length

    if current:
        chunks.append("\n".join(current))

    return chunks

سپس هر بخش را جداگانه پردازش و به همان ترتیب در فایل Word قرار دهید. بهتر است شماره صفحه در متن هر بخش حفظ شود تا امکان تطبیق خروجی با فایل اصلی وجود داشته باشد.

چگونه جدول PDF را به Word منتقل کنیم؟

جدول یکی از سخت‌ترین عناصر در تبدیل PDF است. دلیل آن این است که برخی PDFها اطلاعات جدول را به‌صورت مجموعه‌ای از کلمات با موقعیت‌های جداگانه ذخیره می‌کنند و ساختار واقعی سطر و ستون در فایل وجود ندارد.

روش عملی

  1. ابتدا از ابزار تبدیل معمولی استفاده کنید.
  2. بررسی کنید جدول به‌درستی منتقل شده است یا نه.
  3. اگر جدول خراب است، آن را جداگانه استخراج کنید.
  4. متن جدول را به مدل بدهید.
  5. خروجی ساختاریافته دریافت کنید.
  6. جدول را در Word بسازید.
  7. تمام سلول‌ها را با PDF اصلی تطبیق دهید.

پرامپت پیشنهادی:

داده‌های زیر از یک جدول PDF استخراج شده‌اند.

وظیفه:
ساختار احتمالی سطرها و ستون‌ها را بازسازی کن.

قواعد:
- هیچ مقدار جدیدی تولید نکن.
- اعداد را تغییر نده.
- اگر جای یک مقدار مشخص نیست، «نامشخص» بنویس.
- خروجی را به‌صورت جدول Markdown ارائه بده.
- بعد از جدول، تمام موارد مبهم را فهرست کن.

داده‌ها:
[محتوای استخراج‌شده]

اگر جدول شامل مبالغ، نمرات، تعداد، تاریخ یا آمار مهم است، کنترل انسانی تک‌تک سلول‌ها ضروری است.

تبدیل PDF دارای فرمول به Word

فرمول‌های ریاضی و علمی ممکن است هنگام تبدیل:

  • به تصویر تبدیل شوند.
  • نمادهایشان تغییر کند.
  • توان و زیرنویس را از دست بدهند.
  • ترتیب علائم آن‌ها به هم بریزد.
  • به متن نامفهوم تبدیل شوند.

برای فرمول‌ها بهتر است:

  1. تصویر فرمول را جداگانه نگه دارید.
  2. از ابزار تخصصی تشخیص فرمول استفاده کنید.
  3. نتیجه را در Equation Editor ورد وارد کنید.
  4. فرمول نهایی را با PDF اصلی مقایسه کنید.

از مدل زبانی نخواهید فرمول ناخوانا را حدس بزند. اگر بخشی از فرمول قابل تشخیص نیست، باید همان قسمت به‌عنوان نامشخص مشخص شود.

تبدیل PDF دوزبانه فارسی و انگلیسی

اسناد دوزبانه معمولاً با مشکلات جهت متن روبه‌رو می‌شوند.

برای نتیجه بهتر:

  • پاراگراف فارسی را راست‌به‌چپ تنظیم کنید.
  • پاراگراف انگلیسی را چپ‌به‌راست نگه دارید.
  • نام محصولات و کدها را تغییر ندهید.
  • پرانتزها و علائم را کنترل کنید.
  • از مدل بخواهید زبان هر پاراگراف را حفظ کند.
  • اعداد داخل URL و کد را فارسی نکنید.

پرامپت پیشنهادی:

این متن شامل فارسی و انگلیسی است. خطاهای OCR را اصلاح کن، اما زبان و جهت منطقی هر بخش را حفظ کن.

نام محصولات، URLها، کدها، شماره نسخه‌ها، فرمان‌ها و اصطلاحات انگلیسی را تغییر نده. اعداد داخل کد و آدرس اینترنتی باید لاتین باقی بمانند.

چرا خروجی تبدیل PDF به Word به هم می‌ریزد؟

دلایل رایج عبارت‌اند از:

PDF برای نمایش ساخته شده، نه ویرایش

PDF محل دقیق عناصر روی صفحه را ذخیره می‌کند. الزاماً مشخص نمی‌کند کدام خطوط یک پاراگراف یا کدام بخش‌ها یک جدول را تشکیل می‌دهند.

فونت داخل فایل ذخیره نشده است

اگر فونت اصلی در دسترس نباشد، Word از فونت جایگزین استفاده می‌کند و اندازه خطوط تغییر می‌کند.

سند از چند کادر متنی ساخته شده است

نرم‌افزار تبدیل ممکن است هر کادر را یک عنصر جداگانه در نظر بگیرد.

کیفیت اسکن پایین است

تاری تصویر، سایه، چرخش صفحه و کنتراست ضعیف دقت OCR را کاهش می‌دهد.

سند چندستونه است

اگر ترتیب خواندن ستون‌ها تشخیص داده نشود، جمله‌های ستون اول و دوم با یکدیگر ترکیب می‌شوند.

زبان OCR اشتباه انتخاب شده است

انتخاب زبان نادرست باعث افزایش خطا در حروف و کلمات می‌شود.

اشتباهات رایج هنگام تبدیل PDF به Word

انتخاب مبدل بدون توجه به نوع PDF

مبدل معمولی برای فایل اسکن‌شده کافی نیست. ابتدا باید تشخیص دهید که به OCR نیاز دارید یا خیر.

انتظار حفظ کامل صفحه‌آرایی

تبدیل PDF پیچیده به Word ممکن است نیازمند بازطراحی بخش‌هایی از سند باشد.

اعتماد کامل به OCR

OCR حتی در تصاویر واضح نیز ممکن است نام‌ها، اعداد و نشانه‌ها را اشتباه تشخیص دهد.

بازنویسی ناخواسته متن

اگر به مدل بگویید «متن را اصلاح کن»، ممکن است جمله‌ها را بازنویسی کند. صریحاً مشخص کنید که فقط خطاهای استخراج اصلاح شوند.

حذف شماره صفحات در مراحل اولیه

شماره یا برچسب صفحه برای تطبیق خروجی با منبع مفید است. بهتر است تا پایان بازبینی حفظ شود.

پردازش یکجای سند طولانی

این کار احتمال حذف یا ترکیب شدن محتوا را افزایش می‌دهد. سند را فصل‌به‌فصل پردازش کنید.

کنترل نکردن جدول‌ها

یک جدول ظاهراً درست ممکن است مقادیر جابه‌جاشده داشته باشد.

چک‌لیست کنترل کیفیت فایل Word

بعد از تبدیل، این موارد را بررسی کنید:

  • آیا تمام صفحات پردازش شده‌اند؟
  • آیا عنوان اصلی حفظ شده است؟
  • آیا ترتیب فصل‌ها درست است؟
  • آیا پاراگرافی حذف نشده است؟
  • آیا متن تکراری وجود دارد؟
  • آیا سربرگ و پابرگ اضافی حذف شده‌اند؟
  • آیا شماره صفحات وارد متن اصلی نشده‌اند؟
  • آیا حروف «ی» و «ک» یکدست هستند؟
  • آیا نیم‌فاصله‌ها درست‌اند؟
  • آیا اعداد با PDF اصلی مطابقت دارند؟
  • آیا نام افراد و سازمان‌ها درست هستند؟
  • آیا تاریخ‌ها تغییر نکرده‌اند؟
  • آیا ترتیب ستون‌ها صحیح است؟
  • آیا جدول‌ها سلول گمشده ندارند؟
  • آیا پاورقی‌ها در محل مناسب قرار گرفته‌اند؟
  • آیا تصاویر و زیرنویس آن‌ها حفظ شده‌اند؟
  • آیا فرمول‌ها با منبع تطبیق دارند؟
  • آیا متن فارسی راست‌به‌چپ است؟
  • آیا عبارات انگلیسی جهت درستی دارند؟
  • آیا Headingهای Word استفاده شده‌اند؟
  • آیا فهرست مطالب به‌درستی ساخته می‌شود؟
  • آیا شکست صفحات منطقی است؟
  • آیا فایل روی دستگاه دیگری نیز درست نمایش داده می‌شود؟

سؤالات متداول

بهترین روش تبدیل PDF به Word چیست؟

برای PDF متنی ساده، باز کردن مستقیم فایل در Microsoft Word معمولاً سریع‌ترین روش است. برای PDF اسکن‌شده باید ابتدا OCR انجام شود. برای فایل فارسی، جدول‌دار یا چندستونه بهتر است بعد از استخراج، متن با هوش مصنوعی پاک‌سازی و ساختار آن بازسازی شود.

چگونه PDF فارسی را به Word تبدیل کنیم؟

ابتدا بررسی کنید متن قابل انتخاب است یا خیر. اگر قابل انتخاب است، فایل را در Word یا Acrobat باز کنید. اگر اسکن‌شده است، از OCR دارای پشتیبانی فارسی استفاده کنید. سپس خطاهای نگارشی و ساختاری را با یک پرامپت محدود و دقیق اصلاح کنید.

آیا تبدیل PDF به Word رایگان است؟

بعضی قابلیت‌های Microsoft Word، Google Drive و ابزارهای آنلاین امکان تبدیل رایگان یا محدود ارائه می‌دهند. امکانات OCR، حجم فایل، تعداد صفحات و دانلود خروجی ممکن است در هر سرویس متفاوت باشد.

چگونه PDF اسکن‌شده را به Word تبدیل کنیم؟

ابتدا با OCR نوشته‌های داخل تصویر را تشخیص دهید. سپس خروجی را از نظر خطاهای حروف، فاصله، اعداد و ترتیب متن بررسی کنید و در پایان فایل DOCX بسازید.

آیا هوش مصنوعی می‌تواند جدول PDF را استخراج کند؟

هوش مصنوعی می‌تواند داده‌های استخراج‌شده را به ساختار سطر و ستون تبدیل کند، اما نباید برای اعداد مهم بدون بازبینی به آن اعتماد کرد. تمام سلول‌ها باید با فایل اصلی مقایسه شوند.

آیا می‌توان چند PDF را هم‌زمان به Word تبدیل کرد؟

بله. بعضی ابزارهای دسکتاپ پردازش گروهی دارند. توسعه‌دهندگان نیز می‌توانند با کتابخانه استخراج PDF، OCR، API هوش مصنوعی و python-docx یک گردش‌کار خودکار بسازند.

چرا متن فارسی بعد از تبدیل جدا یا نامرتب است؟

ممکن است فونت، کدگذاری متن، جهت پاراگراف، ساختار PDF یا زبان OCR مناسب نباشد. اصلاح Right-to-Left، یکدست‌سازی حروف فارسی و بازسازی پاراگراف‌ها معمولاً بخش زیادی از مشکل را رفع می‌کند.

آیا درواره مستقیماً فایل PDF را به Word تبدیل می‌کند؟

درواره در این سناریو زیرساخت API هوش مصنوعی را فراهم می‌کند و یک مبدل آماده PDF به Word نیست. توسعه‌دهندگان می‌توانند استخراج PDF یا OCR را با API درواره ترکیب کنند تا پاک‌سازی متن، تشخیص ساختار و تولید فایل DOCX را خودکار کنند.

جمع‌بندی

تبدیل PDF به Word فقط تغییر پسوند فایل نیست. کیفیت نتیجه به نوع PDF، ساختار صفحات، زبان متن، کیفیت اسکن و ابزار انتخاب‌شده بستگی دارد.

برای یک PDF متنی ساده، باز کردن مستقیم فایل در Word احتمالاً کافی است. برای فایل اسکن‌شده باید از OCR استفاده کنید. در اسناد فارسی، چندستونه یا جدول‌دار، هوش مصنوعی می‌تواند خطاهای OCR را اصلاح و ساختار محتوا را برای Word بازسازی کند.

گردش‌کار پیشنهادی چنین است:

  1. نوع PDF را تشخیص دهید.
  2. متن و عناصر سند را استخراج کنید.
  3. در صورت نیاز OCR فارسی اجرا کنید.
  4. متن را بدون تغییر محتوا با هوش مصنوعی پاک‌سازی کنید.
  5. عنوان‌ها، فهرست‌ها و جدول‌ها را بازسازی کنید.
  6. فایل DOCX بسازید.
  7. خروجی را صفحه‌به‌صفحه با PDF اصلی مقایسه کنید.

اگر قصد دارید تبدیل، پاک‌سازی و ساخت اسناد Word را به نرم‌افزار یا فرایند سازمانی خود اضافه کنید، می‌توانید از API هوش مصنوعی درواره برای پردازش محتوا و بازسازی ساختار اسناد استفاده کنید.

برای انتخاب مدل مناسب و مشاهده اطلاعات به‌روز هزینه، صفحه مدل‌ها و قیمت‌های درواره را ببینید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی چیست؟ کاربردها و آموزش ساخت AI Automation

اتوماسیون هوش مصنوعی با ترکیب گردش‌کارهای خودکار و مدل‌های هوش مصنوعی، پردازش متن، دسته‌بندی، استخراج اطلاعات و تصمیم‌های پیشنهادی را خودکار می‌کند. در این راهنما، معماری و ساخت نمونه عملی آن با API درواره را می‌آموزید.

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce چیست؟ آینده خرید با ایجنت هوش مصنوعی

Agentic Commerce شیوه‌ای جدید برای خرید اینترنتی است که در آن ایجنت هوش مصنوعی می‌تواند نیاز کاربر را بفهمد، محصولات را جست‌وجو و مقایسه کند و فرایند خرید را پیش ببرد. در این راهنما با معماری، UCP، ACP و پیاده‌سازی آن با API درواره آشنا می‌شوید.