GPTZero مقابل Turnitin: لماذا لا تتطابق النتائج وما الذي تقيسه كل أداة فعليًا

إذا جرّبت النص نفسه على GPTZero وTurnitin، فلن تتطابق النتائج في الغالب. هذا لا يعني أن إحدى الأداتين معطّلة. الكواشف المختلفة تستخدم نماذج مختلفة وبيانات تدريب مختلفة وطرق نتائج مختلفة. إليك ما تقوله وثائق Turnitin عن كيفية عمل كاشفها ولماذا المقارنات بين الأداتين غير موثوقة.

فريق HumanPen

· مدة القراءة: 5 د

الكواشف المختلفة تستخدم نماذج مختلفة

GPTZero وTurnitin نظامان منفصلان طوّرهما فريقان مختلفان، لكل منهما نموذجه الخاص وبيانات تدريبه ومنهجيته في تصنيف النصوص. عندما يستخدم كاشفان نموذجين مختلفين، فلن تتطابق نتائجهما على المستند نفسه. نص قد يقيّمه GPTZero بـ 60% AI قد يحصل على 30% من Turnitin، أو العكس. لا يعني هذا بالضرورة أن إحدى النتيجتين خاطئة—إنها تقديرات احتمالية من نموذجين مختلفين مدربين على بيانات مختلفة.

لا يوجد نظام نقاط عالمي لكشف AI تتقارب عليه كل الأدوات، وهذا جوهر المشكلة في لماذا يحصل النص نفسه على نتائج مختلفة في كل كاشف. كل أداة تنتج تقديرًا خاصًا بها. مقارنة النتائج بين الأدوات كما لو كانت تقيس الشيء نفسه بنفس الوحدات تؤدي إلى الارتباك.

لا ندّعي أن إحدى الأداتين أدق من الأخرى. الوثائق تصف كيف يعمل كاشف Turnitin، وهذه الآلية تختلف عما تفعله الأدوات الأخرى.

كيف يحسب كاشف Turnitin درجة المستند

تصف وثائق Turnitin عملية محدّدة للوصول إلى درجة AI على مستوى المستند:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عندما يُقدَّم مستند إلى Turnitin، تُستخرج الجُمل منه وتُقسَّم إلى أقسام متداخلة لتحليل التنبؤ. كل قسم يُصنَّف بواسطة نموذج كشف AI ويُعطى قيمة بين 0 و1، تُشير إلى احتمال أن يكون النص بشريًا أو مولَّدًا بالـ AI. كل جملة مؤهَّلة داخل هذه الأقسام ترث درجة قسمها. وبما أن الأقسام تتداخل، فقد يكون لبعض الجمل درجات متعددة تُدمَج في درجة واحدة. درجات الجمل هذه تُجمَّع لاحقًا وتُستخدم لحساب درجة كتابة AI الإجمالية للمستند)

الدرجة هي تجميع لتنبؤات على مستوى الأقسام. الأقسام تتداخل، ودرجات الجمل تُدمَج قبل التجميع النهائي. الكواشف الأخرى قد تقسِّم النصوص بشكل مختلف، أو تستخدم وحدات تنبؤ مختلفة، أو تجمع الدرجات بطرق مختلفة.

توضِّح وثائق Turnitin أيضًا أن نسبة كشف كتابة AI ودرجة التشابه هما قياسان منفصلان. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (درجة التشابه ونسبة كشف كتابة AI مستقلتان تمامًا ولا تؤثر إحداهما على الأخرى). درجة التشابه تُشير إلى النسبة المئوية للنص المطابق الموجود في المستند المُقدَّم عند مقارنته بمجموعة Turnitin الشاملة من المحتوى للتحقق من التشابه. درجة التشابه العالية لا تعني درجة AI عالية، والعكس صحيح. تقرير كتابة AI من Turnitin مقابل تقرير التشابه يضع الاثنين جنبًا إلى جنب.

هدف Turnitin للإيجابيات الكاذبة

تذكر Turnitin هدفًا محدَّدًا للإيجابيات الكاذبة في وثائقها:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (نسعى إلى تعزيز فعالية كاشفنا مع إبقاء معدل الإيجابيات الكاذبة—التعرُّف الخاطئ على النص المكتوب بشريًا بالكامل على أنه مولَّد بالـ AI—تحت 1% للمستندات التي تحتوي على أكثر من 20% من كتابة AI)

ثم تعيد الوثائق صياغة هذا بالقول: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (بمعنى آخر، قد نُعلِّم مستندًا مكتوبًا بشريًا على أنه AI لواحد من كل 100 مستند مكتوب بشريًا بالكامل). هذه الصياغة تسقط قيود "أكثر من 20% من كتابة AI". النسخة التي تحتوي على عتبة 20% هي البيان الأدق.

للتحقُّق من هذا المعدّل، تصف Turnitin عملية اختبار: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (لتعزيز إطار اختبارنا وتشخيص الاتّجاهات الإحصائية للإيجابيات الكاذبة، قبل كل تحديث أو إطلاق نموذج جديد، نجري اختبارات على أكثر من 700,000 ورقة أكاديمية إضافية كُتِبت قبل إطلاق ChatGPT للتحقُّق أكثر من معدل الإيجابيات الكاذبة الأقل من 1%)

هذا هو الهدف المعلن لـ Turnitin وعملية التحقُّق منه. ما تكلفه النسبة المئوية فعليًا على نطاق ما ترسله الجامعة يُحسَب في ما الذي تعنيه نسبة 1% من الإيجابيات الكاذبة. الكواشف الأخرى قد يكون لها أهداف مختلفة أو طرق تحقُّق مختلفة، أو قد لا تنشر أرقامًا قابلة للمقارنة. لا يمكننا إجراء مقارنة دقّة مباشرة بين الأدوات بناءً على هذه المعلومة. يمكننا فقط الإبلاغ عمّا تقوله وثائق Turnitin.

المستندات القصيرة تتصرَّف بشكل مختلف

طول المستند يؤثِّر على كيفية تصرُّف كاشف Turnitin. بالنسبة للنصوص القصيرة، قد تنتج آلية الدرجات نتائج متطرِّفة:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (في المستندات الأقصر التي تحتوي على بضع مئات من الكلمات فقط، سيكون التنبؤ في الغالب 'كل شيء أو لا شيء' لأننا نتنبأ على قسم واحد بدون فرصة للتداخل)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (هذا يعني أن بعض النصوص التي هي مزيج من المحتوى المولَّد بالـ AI والمحتوى الأصلي قد تُعلَّم على أنها AI بالكامل)

آلية التداخل التي تُنعِّم الدرجات في المستندات الأطول لا تعمل عندما يكون هناك قسم واحد فقط للتنبؤ عليه. بضع مئات من الكلمات من النص المختلط بشريًا وAI قد تعود بنسبة 100% AI، أحد المسارات المغطاة في لماذا يقول Turnitin أن عملك 100% AI. هذا قيود على المدخلات القصيرة، وليس حكمًا قاطعًا حول تكوين النص.

إذا قيَّم GPTZero مستندًا قصيرًا بشكل مختلف، فإن سلوك الكل أو لا شيء هو أحد التفسيرات. الأداتان تتعاملان مع النصوص القصيرة بشكل مختلف لأن معماريات الدرجات الخاصة بهما مختلفة.

نطاق النجمة 1-19%

لا تُظهِر Turnitin درجة رقمية لنتائج كشف AI بين 1% و19%. تذكر الوثائق:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (لتجنُّب الحدوث المحتمل للإيجابيات الكاذبة، لا تُنسَب أي درجة أو تظليل لدرجات كشف AI في النطاق من 1% إلى 19%. عندما يُكتشَف AI تحت عتبة 20% في التقرير، يُشار إليه الآن بنجمة (%) ولا تُنسَب أي نسبة مئوية)

هذا يعني أنه إذا قدَّر نموذج Turnitin محتوى AI بنسبة 12%، سيُظهِر التقرير نجمة بدلاً من رقم. لا تُطبَّق أي تظليلات أيضًا. السبب هو تجنُّب إظهار الإيجابيات الكاذبة المحتملة في نطاق الثقة المنخفضة، مُفصَّل أكثر في ما الذي تعنيه النجمة (*%) على درجة AI من Turnitin.

GPTZero وأدوات أخرى قد تُظهِر الدرجات في هذا النطاق بشكل مختلف. بعضها يُظهِر نسبة كاملة لأي نتيجة غير صفرية. Turnitin تُخفي الرقم تحت 20%. هذا سبب آخر لعدم تطابق الدرجات: أداة قد تُظهِر درجة رقمية حيث تُظهِر الأخرى نجمة فقط.

ما يعنيه هذا لك

إذا كنت تقارن درجات GPTZero وTurnitin على المستند نفسه، إليك ما يجب تذكره:

  • نماذج مختلفة، درجات مختلفة. GPTZero وTurnitin يستخدمان نموذجي كشف منفصلين مدربين على بيانات منفصلة. لا يُتوقَّع أن تتطابق درجاتهما.
  • Turnitin تقيس بتجميع الأقسام. النص يُقسَّم، ويُقاس لكل قسم، ثم يُجمَّع. درجة AI ودرجة Similarity مستقلتان تمامًا.
  • Turnitin تهدف إلى أقل من 1% إيجابيات كاذبة للمستندات التي تحتوي على أكثر من 20% كتابة AI، مُتحقَّق منه ضد أكثر من 700,000 ورقة أكاديمية إضافية كُتِبت قبل إطلاق ChatGPT.
  • المستندات القصيرة تحصل على درجات كل شيء أو لا شيء. بضع مئات من الكلمات قد تنتج نتيجة 0% أو 100% حتى عندما يكون النص مختلطًا.
  • الدرجات تحت 20% تُظهِر كنجمة. لا تظهر نسبة مئوية رقمية أو تظليلات في النطاق 1-19%.

يمكن إعادة تشغيل الفقرات المؤهلة بدون رسوم.