Undetectable AI مقابل Turnitin: ماذا تقول الوثائق الرسمية فعلًا

إذا أدخلت النص نفسه في كاشف Undetectable AI وفي Turnitin، فستختلف النتيجتان في أغلب الأحيان. وهذا أمر متوقّع: فالأداتان تعتمدان على نماذج مختلفة، تدرّبت على بيانات مختلفة، وتتبعان قواعد مختلفة في حساب النتيجة. وفي ما يلي ما تذكره وثائق Turnitin عن طريقة عمل كاشفها، وعن سبب عدم تطابق النتيجتين.

فريق HumanPen

· مدة القراءة: 5 د

Undetectable AI وTurnitin: نظامان منفصلان

كاشف Undetectable AI وكاشف الكتابة بالذكاء الاصطناعي في Turnitin من تطوير فريقين مختلفين، ويقوم كل منهما على نموذج مختلف. وقد تدرّب كل نموذج على بياناته الخاصة، ويصنّف النصوص بطريقته الخاصة. وعندما يستخدم كاشفان نموذجين مختلفين، يخرجان بنتيجتين مختلفتين للنص نفسه: فالمقطع الذي يحدّده Undetectable AI بوصفه مكتوبًا بالذكاء الاصطناعي بنسبة 70% قد يحصل على 25% في Turnitin، أو العكس. ولا يعني ذلك بالضرورة أن إحدى النتيجتين خاطئة؛ فكلتاهما تقدير احتمالي صادر عن نموذجين تدرّبا على مجموعتَي بيانات مختلفتين.

لا توجد نتيجة كشف يتفق عليها الجميع، وهي النقطة التي نفصّلها في لماذا يحصل النص نفسه على نتيجة مختلفة في كل كاشف. فكل كاشف يقدّم تقديره الخاص. أما التعامل مع نتائج الأدوات المختلفة كما لو أنها تقيس الشيء نفسه بالوحدة نفسها، فلا يؤدي إلا إلى الالتباس.

نحن لا نزعم أن إحدى الأداتين أدقّ من الأخرى. ما نفعله هو عرض ما تقوله وثائق Turnitin عن نظامها، وعن سبب خروج هذا النظام بنتائج لا تطابق نتائج Undetectable AI.

كيف تحسب Turnitin نتيجتها

تصف وثائق Turnitin عملية محدّدة للوصول إلى نتيجة الكتابة بالذكاء الاصطناعي:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عند إرسال ورقة بحثية إلى Turnitin، تُستخرج الجمل من النص المُرسَل وتُجزَّأ إلى مقاطع متداخلة من أجل تحليل التنبؤ. ويصنّف نموذج كشف الذكاء الاصطناعي كل مقطع ويمنحه قيمة بين 0 و1، تدل على احتمال أن يكون النص بشريًا أو مولّدًا بالذكاء الاصطناعي. وترث كل جملة مؤهّلة داخل هذه المقاطع نتيجة المقطع الذي تنتمي إليه. ولأن المقاطع متداخلة، قد تحصل بعض الجمل على أكثر من نتيجة، وتُدمَج هذه النتائج في نتيجة واحدة. ثم تُجمَع نتائج الجمل وتُستخدم لحساب النتيجة الإجمالية للكتابة بالذكاء الاصطناعي في المستند.)

تعتمد هذه العملية على استخراج الجمل، وتجزئتها إلى وحدات متداخلة، وحساب نتيجة لكل مقطع، ودمج نتائج الجمل، ثم تجميعها في نسبة مئوية على مستوى المستند. وقد تستخدم الكواشف الأخرى، ومنها Undetectable AI، استراتيجيات تجزئة مختلفة، أو وحدات تنبؤ مختلفة، أو طرقًا مختلفة في التجميع. ولذلك لن تتطابق أرقام الأداتين على النص نفسه.

وتوضّح وثائق Turnitin أيضًا أن نسبة الكشف عن الكتابة بالذكاء الاصطناعي ونتيجة التطابق (Similarity) أمران منفصلان. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (نتيجة التطابق ونسبة الكشف عن الكتابة بالذكاء الاصطناعي مستقلّتان تمامًا، ولا تؤثر إحداهما في الأخرى.) وتشير نتيجة التطابق إلى نسبة النص المطابق الذي عُثر عليه في المستند المُرسَل عند مقارنته بمجموعة المحتوى الشاملة التي يستخدمها Turnitin للتحقق من التطابق. ومن الممكن أن يكون المستند عالي التطابق ومنخفض الذكاء الاصطناعي، أو العكس. ويبيّن تقرير الكتابة بالذكاء الاصطناعي من Turnitin مقابل تقرير التطابق ما يحسبه كل رقم من الرقمين. والرقمان لا يؤثر أحدهما في الآخر.

معدل الإيجابيات الخاطئة الذي تعلنه Turnitin

تنشر Turnitin هدفًا محدّدًا لمعدل الإيجابيات الخاطئة:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (نسعى إلى تعظيم فعالية كاشفنا مع إبقاء معدل الإيجابيات الخاطئة لدينا — أي اعتبار نص بشري بالكامل مولّدًا بالذكاء الاصطناعي عن طريق الخطأ — دون 1% في المستندات التي تزيد فيها نسبة الكتابة بالذكاء الاصطناعي على 20%.)

وتعيد الوثائق صياغة هذا المعنى كالتالي: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (بعبارة أخرى، قد نضع علامة على مستند مكتوب بقلم بشري بوصفه مكتوبًا بالذكاء الاصطناعي، وذلك في حالة واحدة من كل 100 مستند مكتوب بالكامل بقلم بشري.) وتُسقط هذه الصياغة قيد "أكثر من 20% من الكتابة بالذكاء الاصطناعي". أما الصياغة التي تتضمّن حدّ الـ 20% فهي الأدق.

وللتحقق من هذا الهدف، تصف Turnitin إطار الاختبار الذي تعتمده: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (لتعزيز إطار الاختبار لدينا وتشخيص الاتجاهات الإحصائية للإيجابيات الخاطئة، نُجري قبل كل تحديث أو إصدار لنموذج جديد اختبارات على أكثر من 700,000 ورقة بحثية إضافية كُتبت قبل إطلاق ChatGPT، وذلك لمواصلة التحقق من أن معدل الإيجابيات الخاطئة لدينا يقلّ عن 1%.)

هذا ما تقوله Turnitin عن نظامها. ولمعرفة ما يعنيه ذلك الواحد بالمئة على مدار سنة من عمليات الإرسال، راجع ما يعنيه معدل إيجابيات خاطئة بنسبة 1%. وقد تكون لـ Undetectable AI أهداف مختلفة للدقة، وعمليات تحقق مختلفة، أو قد لا تنشر أرقامًا قابلة للمقارنة من الأساس. ولا نستطيع إجراء مقارنة مباشرة للدقة؛ كل ما نستطيعه هو نقل ما تذكره وثائق Turnitin.

سلوك الكاشف مع المستندات القصيرة

يؤثر طول المستند في طريقة معالجة كاشف Turnitin للنص. فمع المستندات القصيرة، تعمل آلية حساب النتيجة بطريقة مختلفة. وتذكر الوثائق ما يلي:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (في المستندات الأقصر، التي لا تحتوي إلا على بضع مئات من الكلمات، سيكون التنبؤ في أغلبه 'all or nothing' أي إما كل شيء أو لا شيء؛ لأننا نُجري التنبؤ على مقطع واحد، دون أن تتاح لنا فرصة التداخل.)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (وهذا يعني أن بعض النصوص التي تمزج بين محتوى مولّد بالذكاء الاصطناعي ومحتوى أصلي قد تُعلَّم بالكامل على أنها مولّدة بالذكاء الاصطناعي.)

آلية التداخل التي تعمل على توزيع النتائج في المستندات الطويلة لا تعمل عندما يكون النص مقطعًا واحدًا. فبضع مئات من الكلمات التي تمزج بين كتابة بشرية وأخرى بالذكاء الاصطناعي قد تُسفر عن نتيجة 100%، وهي إحدى الآليات الكامنة وراء سبب قول Turnitin إن عملك مكتوب بالذكاء الاصطناعي بنسبة 100%. وهذا سلوك بنيوي مرتبط بالمدخلات القصيرة.

وإذا خرجت Undetectable AI بنتيجة مختلفة للمستند القصير نفسه، فذلك يعود جزئيًا إلى أن الأداتين لا تعالجان المدخلات القصيرة بالطريقة نفسها.

كيف تظهر النتائج المنخفضة

لا يعرض Turnitin النتائج الرقمية التي تقلّ عن 20%. وتذكر الوثائق ما يلي:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (لتجنّب احتمال وقوع إيجابيات خاطئة، لا تُنسَب أي نتيجة أو تمييزات إلى نتائج كشف الذكاء الاصطناعي في النطاق من 1% إلى 19%. وعندما يُكتشف ذكاء اصطناعي دون حدّ الـ 20% في التقرير، يُشار إليه الآن بنجمة (*%)، ولا تُنسب إليه أي نسبة مئوية.)

المستند الذي يقدّر نموذج Turnitin نسبة الذكاء الاصطناعي فيه بـ 8% سيظهر في التقرير كنجمة، لا كرقم 8%. ولا تُطبَّق أي تمييزات على النص. والسبب هو تجنّب إبراز احتمالات الإيجابيات الخاطئة في نطاق تنخفض فيه الثقة، وهو ما نفصّله في ما تعنيه النجمة (*%) في نتيجة Turnitin للذكاء الاصطناعي.

قد يعرض Undetectable AI النتائج في هذا النطاق كنسبة مئوية كاملة. وقد تميّز أدوات أخرى النص عند أي مستوى غير صفري. أما Turnitin فيحجب عن قصد الرقم والتمييزات معًا دون 20%. ويعني هذا الاصطلاح في عرض النتائج أن الأداتين ستقدّمان مخرجات شديدة الاختلاف للمستند نفسه إذا كانت نسبة الذكاء الاصطناعي فيه منخفضة.

ما يعنيه ذلك لك

إذا كنت تقارن نتائج Undetectable AI وTurnitin على المستند نفسه، فإليك الخلاصة:

  • لكل نموذج نتيجته. يستخدم Undetectable AI وTurnitin نموذجَي كشف مختلفين، وليس من المتوقّع أن تتطابق نتائجهما.
  • Turnitin تحسب النتيجة بالتجزئة والتجميع. تُستخرج الجمل، وتُجزَّأ إلى وحدات متداخلة، وتُقيَّم، وتُدمج نتائجها، ثم تُجمَّع. ونتيجة الذكاء الاصطناعي ونتيجة التطابق مستقلّتان تمامًا عن بعضهما.
  • تستهدف Turnitin معدل إيجابيات خاطئة دون 1% في المستندات التي تتجاوز نسبة الكتابة بالذكاء الاصطناعي فيها 20%، وقد تحقّقت من ذلك باختبارات على أكثر من 700,000 ورقة بحثية إضافية كُتبت قبل إطلاق ChatGPT.
  • المستندات القصيرة تأخذ نتيجة من طرفين. بضع مئات من الكلمات قد تُسفر عن 0% أو 100% حتى لو كان النص مختلطًا.
  • النتائج دون 20% تظهر كنجمة. لا تظهر أي نسبة مئوية رقمية أو تمييزات في النطاق من 1 إلى 19%.

ويمكن إعادة تشغيل المقاطع المؤهّلة مجانًا.

تابع القراءة