تشخیص متن هوش مصنوعی؛ آیا AI Detector فارسی قابل اعتماد است؟

آیا می‌توان فهمید یک متن با ChatGPT یا هوش مصنوعی نوشته شده است؟ در این مقاله روش کار AI Detectorها، محدودیت تشخیص متن فارسی و فرایند حرفه‌ای ارزیابی محتوا را بررسی می‌کنیم.

Share
تشخیص متن هوش مصنوعی؛ آیا AI Detector فارسی قابل اعتماد است؟

با گسترش استفاده از ChatGPT و سایر مدل‌های زبانی، جست‌وجو برای ابزارهای «تشخیص متن هوش مصنوعی» یا AI Detector افزایش پیدا کرده است. مدارس، دانشگاه‌ها، ناشران، مدیران محتوا، سردبیران و کسب‌وکارها می‌خواهند بدانند آیا یک مقاله، تکلیف، گزارش یا محتوای وب توسط انسان نوشته شده یا با هوش مصنوعی تولید شده است.

در نگاه اول، راه‌حل ساده به نظر می‌رسد: متن را در یک سایت تشخیص هوش مصنوعی قرار می‌دهیم و ابزار درصدی مانند «۸۰ درصد نوشته‌شده با AI» نمایش می‌دهد.

اما واقعیت بسیار پیچیده‌تر است.

یک AI Detector معمولاً نمی‌تواند منشأ واقعی متن را مشاهده کند. این ابزار فقط الگوهای آماری و زبانی متن را بررسی می‌کند و براساس آن‌ها احتمال می‌دهد که متن به خروجی مدل‌های زبانی شباهت دارد یا خیر.

به همین دلیل، دو نوع خطا ممکن است رخ دهد:

  • متن انسانی به اشتباه هوش مصنوعی تشخیص داده شود؛
  • متن تولیدشده با هوش مصنوعی، انسانی تشخیص داده شود.

در زبان فارسی، مسئله دشوارتر است؛ زیرا بسیاری از ابزارها عمدتاً با داده‌های انگلیسی آموزش دیده یا فقط برای تعداد محدودی از زبان‌ها اعتبارسنجی شده‌اند.

نتیجه مهم این مقاله را می‌توان در یک جمله خلاصه کرد:

نمره AI Detector می‌تواند یک نشانه اولیه باشد، اما به‌تنهایی مدرک قطعی درباره نحوه تولید متن نیست.

تشخیص متن هوش مصنوعی چیست؟

تشخیص متن هوش مصنوعی فرایندی است که در آن یک نرم‌افزار تلاش می‌کند مشخص کند آیا متن احتمالاً توسط یک مدل زبانی تولید شده است یا توسط انسان.

این ابزارها ممکن است خروجی را به یکی از شکل‌های زیر نمایش دهند:

  • احتمال تولید با هوش مصنوعی؛
  • احتمال انسانی‌بودن متن؛
  • درصد بخش‌های مشکوک؛
  • جمله‌ها یا پاراگراف‌های علامت‌گذاری‌شده؛
  • برچسب AI، Human یا Mixed؛
  • امتیاز اطمینان؛
  • تحلیل الگوهای نوشتاری.

نکته مهم این است که واژه «تشخیص» ممکن است تصور قطعیت ایجاد کند، در حالی که خروجی ابزار معمولاً یک پیش‌بینی احتمالی است.

آیا واقعاً می‌توان متن ChatGPT را تشخیص داد؟

در برخی شرایط می‌توان شباهت یک متن به خروجی مدل‌های زبانی را تخمین زد، اما نمی‌توان برای هر متن و هر زبان با قطعیت گفت که نویسنده آن انسان یا هوش مصنوعی بوده است.

این محدودیت چند دلیل دارد:

  • مدل‌های مختلف سبک نوشتاری متفاوتی دارند؛
  • یک متن ممکن است ترکیبی از نوشته انسان و مدل باشد؛
  • انسان می‌تواند متن تولیدشده را ویرایش کند؛
  • مدل می‌تواند از سبک و نمونه‌های انسانی پیروی کند؛
  • ترجمه می‌تواند الگوهای آماری متن را تغییر دهد؛
  • متن‌های کوتاه اطلاعات کافی برای تحلیل ندارند؛
  • نوشته‌های رسمی و قالب‌محور ممکن است ماشینی به نظر برسند؛
  • برخی انسان‌ها به‌طور طبیعی منظم و قابل پیش‌بینی می‌نویسند؛
  • مدل‌های جدید الزاماً شبیه داده‌های مورد استفاده برای آموزش Detector نیستند.

OpenAI در سال ۲۰۲۳ ابزار تشخیص متن خود را به دلیل دقت پایین از دسترس خارج کرد. این شرکت در همان صفحه توضیح داد که Classifier نمی‌تواند با اطمینان تمام متن‌های تولیدشده با هوش مصنوعی را تشخیص دهد. اطلاعیه رسمی OpenAI درباره AI Classifier

AI Detector چگونه کار می‌کند؟

ابزارهای مختلف از روش‌های متفاوتی استفاده می‌کنند، اما معمولاً چند نوع نشانه را بررسی می‌کنند.

پیش‌بینی‌پذیری متن

مدل‌های زبانی کلمه بعدی را براساس احتمال تولید می‌کنند. بعضی Detectorها بررسی می‌کنند که توالی کلمات تا چه اندازه برای یک مدل قابل پیش‌بینی است.

اگر متن بسیار منظم و قابل پیش‌بینی باشد، ممکن است احتمال ماشینی‌بودن آن بیشتر در نظر گرفته شود.

این معیار به‌تنهایی قابل اعتماد نیست؛ زیرا متن‌های آموزشی، رسمی، اداری و ساده انسانی نیز می‌توانند پیش‌بینی‌پذیر باشند.

Perplexity

Perplexity معیاری برای سنجش میزان غافلگیرکننده‌بودن یک متن برای مدل زبانی است.

به‌صورت ساده:

  • Perplexity پایین‌تر می‌تواند نشان دهد متن برای مدل قابل پیش‌بینی‌تر است؛
  • Perplexity بالاتر می‌تواند به تنوع بیشتر در انتخاب واژگان و ساختار اشاره کند.

اما Perplexity پایین به معنای قطعی‌بودن تولید با هوش مصنوعی نیست. متن‌های قالب‌محور، ترجمه‌شده، ساده یا نوشته‌شده توسط افراد غیرمتخصص نیز ممکن است Perplexity پایینی داشته باشند.

Burstiness

Burstiness به تغییرپذیری ساختار و طول جمله‌ها اشاره می‌کند. برخی نوشته‌های انسانی ترکیبی از جمله‌های کوتاه، بلند، ساده و پیچیده دارند.

خروجی مدل‌های زبانی ممکن است در بعضی شرایط یکنواخت‌تر باشد، اما این ویژگی نیز ثابت نیست. مدل می‌تواند با یک دستور مناسب، طول و ساختار جمله‌ها را متنوع کند.

الگوهای سبکی

بعضی ابزارها به مواردی مانند این توجه می‌کنند:

  • طول متوسط جمله؛
  • تکرار عبارت‌ها؛
  • نوع اتصال پاراگراف‌ها؛
  • میزان استفاده از کلمات عمومی؛
  • ساختار مقدمه و جمع‌بندی؛
  • چگالی واژگان؛
  • علائم نگارشی؛
  • توزیع بخش‌های گفتار؛
  • میزان تنوع ساختاری.

این روش بیشتر «سبک متن» را بررسی می‌کند، نه منشأ واقعی آن را.

مدل طبقه‌بندی

برخی Detectorها با مجموعه‌ای از متن‌های انسانی و ماشینی آموزش داده می‌شوند. مدل تلاش می‌کند الگوهای هر گروه را یاد بگیرد و متن جدید را طبقه‌بندی کند.

مشکل این است که با انتشار مدل‌های جدید، تغییر زبان، حوزه یا سبک محتوا، داده آموزشی قبلی ممکن است نماینده متن جدید نباشد.

تطبیق با واترمارک

واترمارک متنی با Detector معمولی متفاوت است. در یک سیستم واترمارک، مدل هنگام تولید متن یک الگوی آماری پنهان ایجاد می‌کند که ابزار مخصوص می‌تواند آن را بررسی کند.

این روش نیز فقط زمانی قابل استفاده است که:

  • مدل از ابتدا واترمارک ایجاد کرده باشد؛
  • سازوکار تشخیص همان واترمارک در دسترس باشد؛
  • متن به‌اندازه کافی بلند باشد؛
  • ویرایش یا ترجمه، الگو را از بین نبرده باشد.

بنابراین نمی‌توان هر متن اینترنتی را با یک ابزار عمومی از نظر واترمارک بررسی کرد.

خطای مثبت و خطای منفی چیست؟

برای ارزیابی یک AI Detector باید دو خطای اصلی را بشناسیم.

خطای مثبت کاذب

False Positive زمانی رخ می‌دهد که متن انسانی به اشتباه به‌عنوان متن هوش مصنوعی علامت‌گذاری شود.

این خطا ممکن است برای موارد زیر بیشتر مسئله‌ساز شود:

  • متن رسمی و دانشگاهی؛
  • نوشته‌های کوتاه؛
  • متن ترجمه‌شده؛
  • متن افراد غیربومی؛
  • محتوای دارای قالب ثابت؛
  • پاسخ‌های ساده و مستقیم؛
  • توضیحات فنی استاندارد.

پژوهشی درباره چند Detector پرکاربرد نشان داد که نوشته‌های انگلیسی افراد غیربومی بیشتر در معرض طبقه‌بندی اشتباه به‌عنوان متن تولیدشده با هوش مصنوعی قرار می‌گیرند. پژوهش منتشرشده درباره سوگیری AI Detectorها

این مطالعه مستقیماً درباره زبان فارسی نیست، اما نشان می‌دهد تفاوت زبانی و سبک نوشتن می‌تواند روی خروجی Detector اثر بگذارد.

خطای منفی کاذب

False Negative زمانی رخ می‌دهد که متن واقعاً با هوش مصنوعی تولید شده، اما ابزار آن را انسانی تشخیص می‌دهد.

این حالت ممکن است زمانی رخ دهد که:

  • انسان متن را ویرایش کرده باشد؛
  • چند مدل در تولید متن نقش داشته باشند؛
  • متن ترجمه شده باشد؛
  • مدل جدیدتر از داده آموزشی Detector باشد؛
  • متن بسیار کوتاه باشد؛
  • بخش‌های انسانی و ماشینی با هم ترکیب شده باشند.

یک Detector خوب باید هر دو نوع خطا را در شرایط واقعی گزارش و ارزیابی کند.

آیا AI Detector فارسی دقیق است؟

در حال حاضر باید نسبت به ادعای «تشخیص قطعی متن فارسی» بسیار محتاط بود.

بسیاری از ابزارهای شناخته‌شده اطلاعات شفافی درباره موارد زیر منتشر نمی‌کنند:

  • حجم داده فارسی مورد استفاده برای آموزش؛
  • نوع متن‌های فارسی موجود در داده ارزیابی؛
  • مدل‌های زبانی استفاده‌شده برای تولید نمونه‌ها؛
  • نرخ خطای مثبت برای فارسی؛
  • نرخ خطای منفی برای فارسی؛
  • عملکرد روی متن رسمی، محاوره‌ای و ترجمه‌شده؛
  • عملکرد روی متن ویرایش‌شده توسط انسان؛
  • عملکرد روی متن ترکیبی.

برای مثال، مستندات فعلی Turnitin زبان‌های پشتیبانی‌شده برای AI Writing Report را انگلیسی، اسپانیایی و ژاپنی اعلام می‌کند؛ فارسی در این فهرست نیست. شرایط فایل و زبان در Turnitin

بنابراین صرف اینکه یک سایت متن فارسی را دریافت و یک درصد نمایش می‌دهد، به معنای اعتبارسنجی علمی آن برای زبان فارسی نیست.

چرا تشخیص متن فارسی دشوارتر است؟

داده ارزیابی کمتر

ابزارهای انگلیسی معمولاً به داده‌های بسیار بیشتری دسترسی دارند. برای فارسی، مجموعه‌داده‌های عمومی و متنوع کمتری برای مقایسه متن انسانی و ماشینی وجود دارد.

تفاوت رسم‌الخط

متن فارسی ممکن است تفاوت‌هایی در این موارد داشته باشد:

  • نیم‌فاصله؛
  • شکل حروف عربی و فارسی؛
  • فاصله‌گذاری؛
  • علائم نگارشی؛
  • اعداد فارسی و انگلیسی؛
  • شیوه نوشتن کلمات مرکب؛
  • نویسه‌های نامرئی.

پیش‌پردازش متفاوت می‌تواند نتیجه ابزار را تغییر دهد.

ترکیب فارسی و انگلیسی

مقالات فنی فارسی معمولاً شامل کلمات انگلیسی، کد، نام محصول و اصطلاحات تخصصی هستند. این ترکیب می‌تواند روی تحلیل آماری متن اثر بگذارد.

ترجمه ماشینی

ممکن است متن ابتدا به انگلیسی تولید و سپس به فارسی ترجمه شده باشد. در چنین حالتی، Detector باید الگوهای ترجمه و تولید ماشینی را از یکدیگر تفکیک کند.

کمبود اطلاعات درباره مدل‌های فارسی

یک Detector ممکن است با خروجی چند مدل انگلیسی آموزش دیده باشد، اما روی مدل‌های چندزبانه یا فارسی عملکرد متفاوتی داشته باشد.

ابزارهای تشخیص متن هوش مصنوعی

ابزارهای متعددی برای AI Text Detection وجود دارند. نمونه‌های شناخته‌شده عبارت‌اند از:

  • Turnitin AI Writing Detection؛
  • GPTZero؛
  • Copyleaks AI Detector؛
  • Originality.ai؛
  • Winston AI؛
  • Sapling AI Detector؛
  • Writer AI Content Detector.

وجود نام یک زبان در رابط کاربری یا امکان واردکردن متن فارسی به معنای دقت تأییدشده برای آن زبان نیست. پیش از انتخاب ابزار، مستندات رسمی آن را بررسی کنید.

معیارهای انتخاب ابزار

هنگام ارزیابی یک Detector این سؤال‌ها را بپرسید:

  • آیا فارسی رسماً پشتیبانی می‌شود؟
  • نرخ خطای مثبت فارسی منتشر شده است؟
  • نرخ خطای منفی فارسی منتشر شده است؟
  • ابزار روی کدام مدل‌های تولید متن آزمایش شده است؟
  • حداقل طول متن چقدر است؟
  • متن ترجمه‌شده را چگونه پردازش می‌کند؟
  • آیا نتیجه جمله‌به‌جمله ارائه می‌شود؟
  • داده ورودی چگونه نگهداری می‌شود؟
  • آیا ابزار روش ارزیابی خود را توضیح می‌دهد؟
  • آخرین به‌روزرسانی مدل تشخیص چه زمانی بوده است؟

اگر پاسخ بیشتر این پرسش‌ها مشخص نیست، درصد نمایش‌داده‌شده را نباید یک نتیجه قطعی در نظر گرفت.

درصد AI Detector دقیقاً چه معنایی دارد؟

یکی از اشتباهات رایج، تفسیر مستقیم درصد Detector است.

برای مثال، عبارت «۷۰ درصد AI» الزاماً به این معنا نیست که:

  • دقیقاً ۷۰ درصد کلمات توسط هوش مصنوعی نوشته شده‌اند؛
  • احتمال قطعی ماشینی‌بودن متن ۷۰ درصد است؛
  • نویسنده ۷۰ درصد از ChatGPT استفاده کرده است.

معنای نمره به طراحی همان ابزار بستگی دارد. ممکن است نشان‌دهنده نسبت متن علامت‌گذاری‌شده، امتیاز طبقه‌بندی یا تخمین احتمال باشد.

قبل از تفسیر درصد، مستندات ابزار را بخوانید.

Turnitin نیز صریحاً اعلام می‌کند گزارش AI Writing نباید به‌تنهایی به‌عنوان پاسخ قطعی استفاده شود و بررسی انسانی و زمینه کار اهمیت دارد. راهنمای بررسی گزارش Turnitin

این سرویس همچنین برای نتایج پایین‌تر از محدوده مشخص، به دلیل احتمال بیشتر خطای مثبت، درصد دقیق نمایش نمی‌دهد. راهنمای مدل تشخیص Turnitin

آیا ChatGPT می‌تواند تشخیص دهد متن را خودش نوشته است؟

خیر، نباید از یک مدل زبانی بپرسید:

آیا این متن را تو نوشته‌ای؟

مدل به تاریخچه تولید تمام متن‌های جهان دسترسی ندارد و نمی‌تواند مالکیت یا منشأ یک متن را از روی حافظه تأیید کند.

ممکن است براساس سبک متن حدس بزند، اما این حدس نیز با همان محدودیت‌های تشخیص آماری روبه‌رو است.

پرسش بهتر این است:

این متن را از نظر الگوهایی که ممکن است نیازمند بازبینی انسانی باشند تحلیل کن.

موارد زیر را بررسی کن:
- ادعاهای بدون منبع
- جمله‌های بیش از حد عمومی
- تکرار معنایی
- لحن یکنواخت
- ارجاع‌های نامعتبر
- مثال‌های مبهم
- تناقض در متن

درباره انسانی یا ماشینی بودن متن حکم قطعی صادر نکن.

این پرامپت منشأ متن را مشخص نمی‌کند، اما می‌تواند کیفیت و بخش‌های نیازمند بررسی را نشان دهد.

نشانه‌های ظاهری متن تولیدشده با هوش مصنوعی

برخی الگوها ممکن است در خروجی مدل‌های زبانی دیده شوند، اما هیچ‌کدام به‌تنهایی اثبات‌کننده نیستند.

مقدمه‌های بسیار عمومی

نمونه:

در دنیای امروز که فناوری با سرعت زیادی در حال پیشرفت است، استفاده از ابزارهای نوین اهمیت فراوانی پیدا کرده است.

چنین مقدمه‌ای ممکن است توسط انسان نیز نوشته شده باشد، اما در متن‌های تولیدشده بدون Context زیاد دیده می‌شود.

تکرار یک ایده با عبارت‌های مختلف

مدل ممکن است یک نتیجه را در مقدمه، بدنه و جمع‌بندی چند بار تکرار کند، بدون اینکه اطلاعات تازه‌ای اضافه شود.

ساختار بیش از حد منظم

برای مثال، تمام بخش‌ها دقیقاً شامل یک مقدمه، سه Bullet و یک نتیجه مشابه باشند.

لحن یکنواخت

متن ممکن است از ابتدا تا انتها سرعت، طول جمله و لحن ثابتی داشته باشد.

استفاده زیاد از عبارت‌های انتقالی

عبارت‌هایی مانند موارد زیر ممکن است بیش از حد تکرار شوند:

  • علاوه بر این؛
  • از سوی دیگر؛
  • در نهایت؛
  • به‌طور کلی؛
  • لازم به ذکر است؛
  • در دنیای امروز.

اما بسیاری از نویسندگان انسانی نیز از این عبارت‌ها استفاده می‌کنند.

مثال‌های عمومی و بدون جزئیات

مدل ممکن است به جای نمونه مشخص، مثالی بسازد که فقط ساختار مفهوم را تکرار می‌کند.

منابع غیرقابل تأیید

ارجاع‌های ساختگی یا ترکیب عنوان و نویسنده واقعی با اطلاعات نادرست از نشانه‌های مهم نیاز به بررسی هستند.

وجود منابع معتبر و قابل تأیید اثبات نمی‌کند متن انسانی است، اما منابع جعلی نشان می‌دهند فرایند تولید و بازبینی مشکل داشته است.

تغییر ناگهانی سبک

ممکن است بخشی از متن از نظر لحن، واژگان و ساختار با سایر بخش‌ها تفاوت داشته باشد. این موضوع می‌تواند ناشی از استفاده از هوش مصنوعی، کپی‌کردن از منبع دیگر یا ویرایش چند نویسنده باشد.

هیچ‌کدام از این نشانه‌ها نباید به‌تنهایی مبنای نتیجه‌گیری قرار بگیرند.

روش حرفه‌ای ارزیابی منشأ متن

یک روش قابل دفاع باید چند نوع شواهد را کنار هم قرار دهد.

مرحله اول: هدف بررسی را مشخص کنید

آیا هدف شما کنترل کیفیت است یا بررسی فرایند تولید؟

اگر هدف کنترل کیفیت محتواست، ممکن است منشأ متن اهمیت کمتری از این موارد داشته باشد:

  • صحت اطلاعات؛
  • اصالت تحلیل؛
  • کیفیت منابع؛
  • تناسب با مخاطب؛
  • رعایت دستورالعمل تحریریه؛
  • ارزش افزوده متن.

مرحله دوم: سوابق تولید متن را بررسی کنید

شواهد فرایندی معمولاً از یک درصد Detector مفیدترند:

  • نسخه‌های قبلی فایل؛
  • تاریخچه ویرایش؛
  • Outline اولیه؛
  • یادداشت‌های تحقیق؛
  • منابع استفاده‌شده؛
  • پیش‌نویس‌ها؛
  • توضیح نویسنده درباره انتخاب‌ها؛
  • بازخوردها و اصلاحات.

مرحله سوم: منابع و ادعاها را بررسی کنید

برای هر ادعای مهم بپرسید:

  • منبع آن چیست؟
  • منبع واقعاً وجود دارد؟
  • منبع ادعا را پشتیبانی می‌کند؟
  • تاریخ و عدد درست است؟
  • نقل‌قول با متن اصلی تطابق دارد؟
  • لینک به صفحه واقعی می‌رسد؟

مرحله چهارم: متن را با نمونه‌های قبلی مقایسه کنید

اگر نمونه معتبر از نوشته قبلی نویسنده دارید، می‌توانید موارد زیر را مقایسه کنید:

  • طول جمله‌ها؛
  • انتخاب واژگان؛
  • شیوه استدلال؛
  • نوع مثال؛
  • میزان خطاهای معمول؛
  • ساختار پاراگراف؛
  • لحن؛
  • نحوه استفاده از منابع.

تفاوت سبک می‌تواند دلایل مختلفی داشته باشد و باز هم مدرک قطعی محسوب نمی‌شود.

مرحله پنجم: Detector را فقط به‌عنوان سیگنال استفاده کنید

اگر از Detector استفاده می‌کنید:

  • متن کافی و پیوسته وارد کنید؛
  • زبان پشتیبانی‌شده را بررسی کنید؛
  • نتیجه چند ابزار را مقایسه کنید؛
  • اختلاف نتایج را ثبت کنید؛
  • بخش‌های علامت‌گذاری‌شده را دستی بخوانید؛
  • نتیجه را حکم نهایی در نظر نگیرید.

مرحله ششم: فرایند تولید را بررسی کنید

در محیط آموزشی یا کاری می‌توان درباره موارد زیر سؤال کرد:

  • متن چگونه ساختاربندی شد؟
  • چرا این منابع انتخاب شدند؟
  • نتیجه اصلی چیست؟
  • کدام بخش دشوارتر بود؟
  • یک ادعا چگونه تأیید شده است؟
  • نویسنده چگونه می‌تواند بخشی را توضیح یا بازنویسی کند؟

توانایی توضیح فرایند و محتوای متن، اطلاعاتی فراهم می‌کند که Detector به آن دسترسی ندارد.

یک چارچوب تصمیم‌گیری بهتر

به جای برچسب قطعی «انسان» یا «هوش مصنوعی»، نتیجه بررسی را در سه سطح بیان کنید.

شواهد کافی وجود ندارد

وقتی فقط یک نمره Detector یا چند نشانه سبکی وجود دارد، نباید نتیجه قطعی صادر شود.

نیازمند بررسی بیشتر

وقتی مواردی مانند منابع جعلی، تغییر ناگهانی سبک، ناهماهنگی با سوابق یا ناتوانی در توضیح متن دیده می‌شود، بررسی بیشتر لازم است.

فرایند تولید مشخص است

اگر تاریخچه ویرایش، منابع، پیش‌نویس‌ها و توضیح نویسنده در دسترس باشد، می‌توان درباره فرایند تولید تصویر دقیق‌تری به دست آورد.

چگونه یک AI Detector را آزمایش کنیم؟

اگر یک سازمان قصد استفاده از ابزار تشخیص متن را دارد، بهتر است ابتدا آن را روی داده واقعی خود ارزیابی کند.

مجموعه آزمایشی بسازید

نمونه‌ها باید شامل این گروه‌ها باشند:

  • متن کاملاً انسانی؛
  • متن کاملاً تولیدشده با مدل؛
  • متن تولیدشده و ویرایش‌شده توسط انسان؛
  • متن انسانی ویرایش‌شده با هوش مصنوعی؛
  • متن ترجمه‌شده؛
  • متن کوتاه و بلند؛
  • متن رسمی و محاوره‌ای؛
  • متن در موضوعات مختلف؛
  • نمونه فارسی همراه با اصطلاحات انگلیسی.

منشأ نمونه‌ها را ثبت کنید

برای هر متن مشخص کنید:

  • چه کسی یا چه مدلی آن را نوشته است؛
  • چه مقدار ویرایش شده است؛
  • زبان اولیه چه بوده است؛
  • طول متن چقدر است؛
  • موضوع چیست؛
  • چه مراحلی طی شده است.

معیارها را محاسبه کنید

حداقل این موارد را بسنجید:

  • چند متن انسانی اشتباه علامت‌گذاری شد؟
  • چند متن ماشینی شناسایی نشد؟
  • عملکرد روی متن ترکیبی چگونه بود؟
  • عملکرد روی متن فارسی رسمی و محاوره‌ای چه تفاوتی داشت؟
  • با کاهش طول متن چه اتفاقی افتاد؟
  • ابزارهای مختلف چقدر با هم توافق داشتند؟

آستانه را با کاربرد هماهنگ کنید

اگر نتیجه Detector پیامد مهمی دارد، حتی نرخ خطای ظاهراً کم نیز می‌تواند مشکل‌ساز باشد. در چنین کاربردهایی باید بررسی انسانی و شواهد فرایندی الزامی باشد.

تشخیص متن هوش مصنوعی برای سئو

در تولید محتوای وب، تمرکز بیش از حد روی عبور از AI Detector رویکرد مناسبی نیست.

برای کیفیت و سئو، موارد زیر مهم‌ترند:

  • پاسخ دقیق به هدف جست‌وجو؛
  • ارائه اطلاعات واقعی؛
  • استفاده از منابع معتبر؛
  • تجربه و مثال اختصاصی؛
  • ساختار خوانا؛
  • پرهیز از تکرار؛
  • به‌روزرسانی محتوا؛
  • تطبیق عنوان و بدنه؛
  • بررسی فنی و انسانی؛
  • تولید ارزش افزوده.

ممکن است یک متن انسانی ضعیف باشد و یک متن تهیه‌شده با کمک هوش مصنوعی پس از تحقیق و بازبینی، مفیدتر باشد. ارزیابی محتوا باید روی کیفیت خروجی و فرایند تولید متمرکز شود، نه فقط برچسب ابزار.

آیا بازنویسی متن نتیجه Detector را تغییر می‌دهد؟

بله، تغییر واژگان، ساختار جمله، ترتیب پاراگراف‌ها و ترجمه می‌تواند الگوهای آماری متن را تغییر دهد. به همین دلیل، متن تولیدشده و ویرایش‌شده ممکن است نمره متفاوتی بگیرد.

این ویژگی یکی از محدودیت‌های ذاتی تشخیص براساس سبک است. هدف از بازنویسی باید بهبود کیفیت، دقت و وضوح متن باشد، نه پنهان‌کردن منشأ آن یا دورزدن قواعد یک محیط آموزشی و کاری.

استفاده از API درواره برای بررسی کیفیت متن

مدل زبانی نباید به‌عنوان قاضی قطعی منشأ متن استفاده شود. اما می‌توان از API درواره برای ساخت یک سیستم «بازبینی کیفیت محتوا» استفاده کرد که بخش‌های نیازمند بررسی را شناسایی کند.

این سیستم می‌تواند موارد زیر را استخراج کند:

  • ادعاهای نیازمند منبع؛
  • عبارت‌های عمومی؛
  • تکرارهای معنایی؛
  • تناقض‌ها؛
  • ارجاع‌های مشکوک؛
  • تغییر ناگهانی لحن؛
  • جمله‌های مبهم؛
  • بخش‌های نیازمند بازنویسی.

نمونه پایتون

ابتدا کتابخانه را نصب کنید:

pip install openai

کد نمونه:

import json
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DARVAREH_API_KEY"],
    base_url="https://api.darvareh.ir/v1",
)

with open("article.txt", "r", encoding="utf-8") as file:
    article = file.read()

prompt = f"""
متن زیر را از نظر کیفیت و نیاز به بازبینی تحلیل کن.

مهم:
- درباره انسانی یا ماشینی بودن متن حکم قطعی صادر نکن.
- درصد AI تولید نکن.
- فقط نشانه‌های قابل مشاهده در خود متن را گزارش کن.
- برای هر مورد، بخش مرتبط از متن را مشخص کن.

موارد بررسی:
1. ادعاهای نیازمند منبع
2. ارجاع‌های غیرقابل تأیید
3. تکرار معنایی
4. عبارت‌های بیش از حد عمومی
5. تغییر ناگهانی لحن
6. تناقض داخلی
7. مثال‌های مبهم
8. جمله‌های نیازمند بازنویسی

خروجی فقط JSON معتبر باشد:

{{
  "summary": "خلاصه ارزیابی",
  "review_items": [
    {{
      "type": "unsupported_claim",
      "text": "بخش موردنظر",
      "reason": "دلیل نیاز به بررسی",
      "priority": "high"
    }}
  ]
}}

متن:
{article}
"""

response = client.chat.completions.create(
    model="YOUR_MODEL_ID",
    messages=[
        {
            "role": "system",
            "content": "تو ویراستار و ارزیاب کیفیت محتوای فارسی هستی."
        },
        {
            "role": "user",
            "content": prompt
        }
    ],
    temperature=0.1,
)

result = json.loads(response.choices[0].message.content)

print(json.dumps(
    result,
    ensure_ascii=False,
    indent=2
))

به جای YOUR_MODEL_ID، شناسه مدل درواره را وارد کنید.

این برنامه AI Detector نیست و نباید برای تعیین منشأ متن استفاده شود. هدف آن کمک به ویراستار برای پیدا کردن بخش‌های نیازمند بررسی است.

برای انتخاب مدل و مشاهده اطلاعات قیمت به صفحه مدل‌های درواره مراجعه کنید.

طراحی سامانه ارزیابی محتوا برای سازمان

یک سیستم حرفه‌ای بهتر است چند لایه داشته باشد:

  1. دریافت متن و اطلاعات منبع؛
  2. بررسی سرقت ادبی با ابزار مناسب؛
  3. کنترل منابع و لینک‌ها؛
  4. تحلیل کیفیت و انسجام؛
  5. ثبت تاریخچه ویرایش؛
  6. اجرای Detector به‌عنوان سیگنال فرعی؛
  7. بررسی انسانی؛
  8. ثبت نتیجه و دلیل تصمیم.

تفاوت AI Detection و تشخیص سرقت ادبی

این دو مفهوم یکسان نیستند.

تشخیص سرقت ادبی بررسی می‌کند آیا بخشی از متن با منابع موجود شباهت دارد یا بدون ارجاع استفاده شده است.

تشخیص متن هوش مصنوعی تلاش می‌کند براساس الگوهای زبانی، منشأ احتمالی متن را تخمین بزند.

ممکن است یک متن:

  • با هوش مصنوعی تولید شده اما سرقت ادبی نباشد؛
  • انسانی باشد اما از منبعی کپی شده باشد؛
  • ترکیبی از متن انسانی، منابع و مدل زبانی باشد.

بنابراین ابزار Plagiarism Checker جای AI Detector را نمی‌گیرد و برعکس.

اشتباهات رایج در استفاده از AI Detector

تصمیم‌گیری براساس یک درصد

یک عدد بدون اطلاع از تعریف، آستانه و نرخ خطای ابزار ارزش محدودی دارد.

استفاده از ابزار انگلیسی برای فارسی

اگر ابزار عملکرد فارسی را منتشر نکرده باشد، نتیجه آن باید با احتیاط بیشتری تفسیر شود.

بررسی متن بسیار کوتاه

متن کوتاه ویژگی‌های آماری کافی ندارد و نمره آن می‌تواند ناپایدار باشد.

نادیده‌گرفتن خطای مثبت

متن انسانی ممکن است اشتباه علامت‌گذاری شود. این موضوع در تصمیم‌های مهم باید جدی گرفته شود.

تصور اینکه سبک منظم اثبات ماشینی‌بودن است

ساختار مرتب، جمله‌بندی رسمی و غلط املایی کم می‌تواند ویژگی یک نویسنده انسانی نیز باشد.

پرسیدن از ChatGPT درباره نویسنده متن

مدل نمی‌تواند فقط با مشاهده متن، منشأ آن را تأیید کند.

استفاده از Detector به‌عنوان مدرک مستقل

حتی Turnitin در راهنمای خود تأکید می‌کند که گزارش تشخیص نباید در انزوا و بدون Context استفاده شود.

اشتباه‌گرفتن کیفیت با منشأ

یک متن ماشینی می‌تواند پس از بررسی مفید باشد و یک متن انسانی می‌تواند نادرست، تکراری یا ضعیف باشد. این دو ارزیابی باید جدا شوند.

چک‌لیست بررسی متن مشکوک

  • آیا ابزار از زبان فارسی پشتیبانی رسمی دارد؟
  • آیا حداقل طول متن رعایت شده است؟
  • نرخ خطای مثبت ابزار مشخص است؟
  • نتیجه بیش از یک ابزار بررسی شده است؟
  • بخش‌های علامت‌گذاری‌شده دستی خوانده شده‌اند؟
  • منابع متن بررسی شده‌اند؟
  • ادعاها قابل تأیید هستند؟
  • تاریخچه ویرایش وجود دارد؟
  • نمونه قبلی از نوشته نویسنده در دسترس است؟
  • نویسنده می‌تواند ساختار و استدلال متن را توضیح دهد؟
  • متن ترجمه‌شده یا چندزبانه است؟
  • نتیجه فقط به‌عنوان یک سیگنال استفاده شده است؟
  • محدودیت و میزان عدم قطعیت ثبت شده است؟

پرسش‌های متداول

آیا سایتی وجود دارد که متن ChatGPT را صددرصد تشخیص دهد؟

خیر. ابزارهای موجود می‌توانند احتمال یا شباهت آماری را تخمین بزنند، اما تشخیص صددرصدی و بدون خطا برای تمام مدل‌ها، زبان‌ها و انواع متن وجود ندارد.

بهترین AI Detector فارسی کدام است؟

برای انتخاب ابزار باید پشتیبانی رسمی فارسی، داده ارزیابی، نرخ خطای مثبت و منفی و عملکرد روی مدل‌های جدید را بررسی کرد. صرف نمایش یک درصد برای متن فارسی نشانه معتبر بودن ابزار نیست.

آیا Turnitin متن فارسی هوش مصنوعی را تشخیص می‌دهد؟

طبق مستندات فعلی AI Writing Report، زبان‌های پشتیبانی‌شده انگلیسی، اسپانیایی و ژاپنی هستند و فارسی در این فهرست ذکر نشده است.

آیا می‌توان از روی سبک متن فهمید ChatGPT آن را نوشته است؟

برخی الگوها ممکن است باعث ایجاد ظن شوند، اما سبک به‌تنهایی برای نتیجه قطعی کافی نیست. انسان و مدل می‌توانند سبک مشابهی داشته باشند.

چرا متن انسانی به‌عنوان AI شناخته می‌شود؟

متن ممکن است رسمی، ساده، قالب‌محور، ترجمه‌شده یا از نظر آماری قابل پیش‌بینی باشد. همچنین مدل تشخیص ممکن است برای زبان یا حوزه متن به‌خوبی ارزیابی نشده باشد.

چرا ابزارهای مختلف نتیجه متفاوت می‌دهند؟

هر ابزار از داده آموزشی، مدل، معیار و آستانه متفاوتی استفاده می‌کند. بنابراین یک متن می‌تواند در یک ابزار ماشینی و در ابزار دیگر انسانی تشخیص داده شود.

آیا ویرایش متن توسط انسان روی نتیجه اثر دارد؟

بله. ویرایش واژگان، ساختار جمله و ترتیب پاراگراف‌ها می‌تواند ویژگی‌های آماری متن را تغییر دهد.

آیا متن تولیدشده با هوش مصنوعی برای سئو مشکل دارد؟

کیفیت، صحت، ارزش محتوا و پاسخ‌گویی به نیاز کاربر مهم‌تر از نمره AI Detector است. محتوای منتشرشده باید دقیق، مفید، بازبینی‌شده و دارای ارزش واقعی باشد.

آیا هوش مصنوعی می‌تواند خودش متن AI را تشخیص دهد؟

یک مدل زبانی می‌تواند سبک متن را تحلیل کند، اما نمی‌تواند منشأ آن را با قطعیت تأیید کند. بهتر است از مدل برای ارزیابی کیفیت، منابع و تناقض‌ها استفاده شود.

آیا درواره AI Detector آماده ارائه می‌دهد؟

درواره زیرساخت دسترسی به مدل‌های مختلف هوش مصنوعی است. می‌توانید با API آن سامانه‌های ارزیابی کیفیت، تحلیل سبک و بررسی محتوا بسازید؛ اما خروجی یک مدل زبانی نباید به‌عنوان تشخیص قطعی منشأ متن استفاده شود.

جمع‌بندی

تشخیص متن هوش مصنوعی مسئله‌ای احتمالاتی است، نه یک آزمایش قطعی. AI Detectorها معمولاً الگوهای آماری، پیش‌بینی‌پذیری، ساختار جمله و ویژگی‌های سبکی را تحلیل می‌کنند؛ اما به فرایند واقعی تولید متن دسترسی ندارند.

برای متن فارسی، محدودیت‌ها جدی‌ترند؛ زیرا بسیاری از ابزارها پشتیبانی و نرخ خطای مشخصی برای فارسی منتشر نکرده‌اند.

روش مناسب این است که:

  1. Detector را فقط یک سیگنال اولیه در نظر بگیرید.
  2. پشتیبانی رسمی زبان را بررسی کنید.
  3. به یک ابزار و یک درصد تکیه نکنید.
  4. احتمال خطای مثبت و منفی را در نظر بگیرید.
  5. منابع و ادعاهای متن را کنترل کنید.
  6. تاریخچه ویرایش و فرایند تولید را بررسی کنید.
  7. متن را با نمونه‌های قبلی مقایسه کنید.
  8. نتیجه را با بررسی انسانی تکمیل کنید.
  9. میان منشأ متن و کیفیت متن تفاوت قائل شوید.
  10. در تصمیم‌های مهم، بدون شواهد تکمیلی حکم قطعی صادر نکنید.

اگر می‌خواهید سامانه‌ای برای ارزیابی کیفیت، بررسی منابع، دسته‌بندی محتوا یا تحلیل متن فارسی بسازید، می‌توانید در درواره ثبت‌نام کنید و از مدل‌های مختلف هوش مصنوعی از طریق یک API یکپارچه استفاده کنید. برای انتخاب مدل و مشاهده قیمت‌ها، به صفحه مدل‌های درواره مراجعه کنید.

مقالات مرتبط

برای مطالعه شرایط استفاده و محدودیت‌های مسئولیت، صفحه «سلب مسئولیت» را مشاهده کنید.

Read more