Pangram مقابل Turnitin: لماذا لا يتطابق مؤشرا الذكاء الاصطناعي
أجرت مجلة أو مدرسة أو منصة نشر فحصاً لنصك عبر Pangram، ولديك أيضاً رقم من Turnitin. والاثنان لا يتفقان. والسبب أكثر تحديداً من عبارة «نماذج مختلفة». فالشركتان لا تقدمان حتى النوع نفسه من المقاييس، بل وتحسبان في ما دون ذلك وحدات مختلفة على مدونات نصية مختلفة. في ما يلي ما تنشره كل منهما، وما يمكنك فعله برقمين لن يتوافقا.
فريق HumanPen
· مدة القراءة: 19 د
الجواب المختصر
نتيجة Pangram ونتيجة Turnitin ليستا قراءتين للكمية نفسها؛ فوجود فجوة بينهما أمر متوقع، وليس دليلاً على أن أحدهما معطّل. تذكر الورقة البيضاء لـ Turnitin الصادرة في أغسطس 2024 أن الشركة لا تستخدم "accuracy" (الدقة) مقياساً. وتحمل الصفحة الرئيسية لـ Pangram، التي راجعناها في 15 سبتمبر 2026، شارة "99.9%+ Accuracy" (دقة تتجاوز 99.9%). وتحت العنوان يفترقان من جديد: فالأسئلة الشائعة لدى Turnitin تصف جملاً تُقيَّم داخل مقاطع متداخلة ونسبة مئوية تُحسب على النص المؤهَّل، في حين تصف بطاقة نموذج Pangram تنبؤاً على مستوى الرموز بثلاثة تصنيفات، ونسباً من المستند مرجّحة بعدد الأحرف. الرقم الذي يترتب عليه أثر هو الرقم الذي تنتجه الأداة التي تتخذ مؤسستك قرارها بناءً عليه.
الشركتان تختلفان حول المقياس الذي يجب الإبلاغ عنه
تقول الورقة البيضاء لـ Turnitin، Turnitin's AI Writing Detection Model Architecture and Testing Protocol، المؤرَّخة في أغسطس 2024، ما يلي:
"Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed." (لا تستخدم Turnitin "accuracy" مقياساً لأنه يسهل التلاعب به أكثر من اللازم، ويعتمد بشدة على مجموعة البيانات المحددة التي يُحسب عليها.)
وتوضح الجملة التالية السبب، ويمكنك التحقق من الحساب بنفسك:
"For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system." (على سبيل المثال، تأمل مجموعة بيانات تضم 100 نصاً، 99 منها كُتبت بقلم بشري. فخوارزمية بسيطة وساذجة تصنف كل النصوص بوصفها «مكتوبة بقلم بشري» ستحقق دقة 99% على هذه المجموعة، رغم أنها لا قيمة لها كنظام لكشف الكتابة بالذكاء الاصطناعي.)
هذا المثال هو ما يستحق أن تأخذه معك. فالكاشف الذي لا يحدد شيئاً قط يصيب في 99 من تلك الـ100، ولذلك يتحرك الرقم مع تركيبة مجموعة الاختبار لا مع جودة الكاشف. وتقول الورقة البيضاء إن Turnitin "uses two main metrics to test AIW-2: recall and FPR" (يستخدم مقياسين رئيسيين لاختبار AIW-2: الاستدعاء ومعدل الإيجابيات الخاطئة)، وتعرّف الاثنين في القسم نفسه مع أمثلة محسوبة.
ينشر Pangram رقماً للدقة بشكل بارز. تقول الشارة على الصفحة الرئيسية "99.9%+ Accuracy" (دقة تتجاوز 99.9%؛ رُوجعت في 15 سبتمبر 2026). وتحمل صفحة التعليم العالي الرقمين معاً: "99.98% accuracy" (دقة 99.98%) في الجملة الافتتاحية، وبعد 52 حرفاً، داخل اللافتة نفسها، شارة "99.9%+ Accuracy" (دقة تتجاوز 99.9%)، لا يفصل بينهما سوى "Detects AI Assistance Free Credits" (يكشف المساعدة بالذكاء الاصطناعي، رصيد مجاني). أما بطاقة نموذج Pangram 4، المؤرَّخة في 29 يوليو 2026، فلا تبرز الدقة إطلاقاً: إذ تعرض معدلات الإيجابيات الخاطئة والسلبيات الخاطئة مصنفةً حسب المدونة النصية واللغة والمجال.
إذن فالرقمان الرئيسيان ليسا رقماً مرتفعاً ورقماً منخفضاً للخاصية ذاتها. فقد نشر أحد الموردين اعتراضاً مكتوباً على المقياس الذي يتصدر به الآخر. ونحن لا نقول إن أياً من الخيارين خاطئ، ولا أحدهما سرّ: فكلتا العبارتين موجودة اليوم على صفحات عامة.
ما تحسبه كل درجة في الواقع
كلا النظامين يُرجع نسبة مئوية. وهاتان النسبتان مبنيتان من مادة خام مختلفة.
| Turnitin (الأسئلة الشائعة والورقة البيضاء الصادرة في أغسطس 2024) | Pangram (بطاقة نموذج Pangram 4، 29 يوليو 2026) | |
|---|---|---|
| وحدة التصنيف | الجمل، مجمعة في مقاطع متداخلة | الرموز، مفكوكة إلى مقاطع متفاوتة الطول |
| معالجة التداخل | تحصل الجمل الواردة في عدة مقاطع على عدة درجات، "which are then pooled into a single score" (تُجمع بعد ذلك في درجة واحدة) | "predictions for tokens that appear in multiple windows are aligned and averaged" (تُحاذى تنبؤات الرموز التي تظهر في نوافذ متعددة وتُحسب متوسطاتها)، وذلك داخل نافذة استدلال من 512 رمزاً |
| ماذا تمثل النسبة المئوية للمستند | النص المؤهَّل فقط. "this percentage is not necessarily the percentage of the entire submission" (هذه النسبة ليست بالضرورة نسبة العمل المقدَّم بأكمله) | المستند المحلَّل. `fraction_human` و`fraction_ai_assisted` و`fraction_ai` هي "character-weighted" (مرجّحة بعدد الأحرف) و"sum to 1.0" (مجموعها 1.0) |
| عدد الفئات | فئتان. تغطي النسبة النص "likely generated by AI or likely generated and modified by an AI paraphraser or bypasser" (المرجح أنه وُلّد بالذكاء الاصطناعي، أو وُلّد بالذكاء الاصطناعي ثم عُدّل بأداة إعادة صياغة أو أداة تحايل تعمل بالذكاء الاصطناعي) | ثلاث: `Human` (بشري)، `AI-Assisted` (مساند بالذكاء الاصطناعي)، `AI-Generated` (مولّد بالذكاء الاصطناعي) |
| الحد الأدنى للطول | 300 كلمة من النثر | 50 كلمة |
| النتائج المنخفضة | من 1% إلى 19% يظهر نجمة، دون نسبة مئوية ودون إبرازات | `prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise (يُعيد الصيغة المختصرة «بشري» عندما تمثل الأحرف البشرية 90% على الأقل، و«ذكاء اصطناعي» عندما تمثل الأحرف المولَّدة بالذكاء الاصطناعي 80% على الأقل، و«مختلط» في الحالات الأخرى) |
الصف الذي يلسع هو صف المقام. تقول الأسئلة الشائعة لدى Turnitin إن النسبة المعروضة تغطي "the amount of qualifying text within the submission" (مقدار النص المؤهَّل داخل العمل المقدَّم)، وإن "If text within the submission is not considered long-form prose text, it will not be included." (إذا لم يُعتبر نص داخل العمل المقدَّم نثراً طويلاً، فلن يُدرج.) وتغطي نسب Pangram النص المحلَّل ويبلغ مجموعها 1.0. أعطِ النظامين ورقة بحثية فيها قائمة مراجع طويلة وجدول محتويات وجدولان أو ثلاثة، ولن يكونا يعملان على المجموعة نفسها من الكلمات قبل أن يعمل أي من النموذجين. ويتتبع كيفية قراءة تقرير الكتابة بالذكاء الاصطناعي من Turnitin ما يدخل في مقام Turnitin وما يخرج منه.
لماذا لا يقع الـ 1% والـ 1 في 10,000 على المقياس نفسه
هذان هما الرقمان اللذان يضعهما الناس جنباً إلى جنب، وقسمة أحدهما على الآخر تنتج نسبة لا معنى لها. كلاهما يُسمى معدل إيجابيات خاطئة. ولا يُقاس أي منهما بالطريقة التي يُقاس بها الآخر.
تحدد الأسئلة الشائعة لدى Turnitin هدفاً:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (نسعى إلى تعظيم فاعلية كاشفنا مع إبقاء معدل الإيجابيات الخاطئة لدينا — أي تصنيف نص مكتوب بالكامل بقلم بشري خطأً على أنه مولّد بالذكاء الاصطناعي — دون 1% للمستندات التي تزيد فيها نسبة الكتابة بالذكاء الاصطناعي على 20%.)
هذا الشرط في ذيل الجملة يحمل العبارة، وتشرح الورقة البيضاء مصدره. يُصنَّف المستند بوصفه مولّداً بالذكاء الاصطناعي عندما تتجاوز أكثر من 20% من درجاته على مستوى الجملة عتبةً للجملة، وتقول الورقة البيضاء إن "the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%)." (اُختير حدّ القطع لنسبة المستند البالغة 20%، وكذلك عتبة النموذج المحددة سلفاً، لإبقاء معدل الإيجابيات الخاطئة على مستوى المستند دون 0.01 (1%)). فحدّ القطع والمعدل جزآن من آلية واحدة، وليسا ادعاءً مستقلاً عنها. ويتولى ما يعنيه معدل إيجابيات خاطئة بنسبة 1% عندما تقدّم جامعة 75,000 ورقة عملية الضرب.
تحدد الأسئلة الشائعة في صفحة Pangram الرئيسية معدلاً:
"Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents." (معدل الإيجابيات الخاطئة لدى Pangram — وهو المعدل الذي تُحدد به المستندات البشرية خطأً بوصفها ذكاءً اصطناعياً — يبلغ حالياً 1 في 10,000. ويُحسب هذا الرقم على تجميعة من مجموعات البيانات العامة التي تحتوي على عشرات الملايين من الوثائق المكتوبة.)
وتقدم بطاقة النموذج رقماً أضيق مع مدونة نصية محددة بالاسم: "At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples." (عند نقطة التشغيل في الإنتاج، يحقق Pangram 4 معدل إيجابيات خاطئة قدره 0.0041% — أي نحو 1 في 24,000 — على 1,000,000 مثال تقييمي من FineWeb بالإنجليزية ومكتوب بقلم بشري.) ويقسم جدول ثانٍ في البطاقة المعدل حسب المجال، وتبلغ قيمة صف الكتابة الأكاديمية فيه 0.019% على 62,971 عنصراً، وهي أعلى من الرقم العام للإنجليزية الذي يعلوه.
قواعد تصنيف مختلفة، ونقاط تشغيل مختلفة، وعلى جانب Turnitin معدل لا ينطبق إلا فوق حدّ قطع 20%. لذلك لن نقدم لك مقارنة حسابية بين الرقمين. وما يمكنك فعله بدلاً من ذلك هو أن تسأل عن الأساس الذي قيس عليه كل منهما، وكلا الموردين يجيب عن ذلك كتابةً. وتقول الأسئلة الشائعة لدى Turnitin إنها تتحقق من معدلها مقابل "over 700,000 additional academic papers that were written before the release of ChatGPT" (أكثر من 700,000 ورقة أكاديمية إضافية كُتبت قبل إطلاق ChatGPT). وتنسب صفحة Pangram الرئيسية معدلها إلى "an aggregate of public datasets" (تجميعة من مجموعات البيانات العامة)، وتنسب بطاقة نموذجه الرقم الأضيق إلى أمثلة FineWeb، مع ظهور الكتابة الأكاديمية منفصلة بوصفها صف مجال واحد من بين أحد عشر صفاً. هذه إجابات عن أسئلة مختلفة، وتلك هي المشكلة بأكملها.
التسمية نفسها موضوعة على أرقام بمقامات مختلفة
لا يعني معدل الإيجابيات الخاطئة شيئاً إلا مع مجموعة المستندات التي حُسب عليها. وينشر الموردَان عدة أرقام تحت تسمية واحدة، ويستحق أحد الزوجين أن يُتبع بالكامل، لأن التفسير البديهي للفجوة يتبين أنه التفسير الخاطئ.
نبدأ بـ Pangram، وكل ذلك رُوجع في 15 سبتمبر 2026. اقرأ العمود الأيمن بقدر العناية التي تقرأ بها العمود الأيسر: فجزء من التباين مردّه الصفحة التي وقعت عليها، وجزء آخر مردّه الأساس الذي قيس عليه كل رقم.
| الرقم | موضع ظهوره |
|---|---|
| "99.9%+ Accuracy" (دقة تتجاوز 99.9%) | شارة في الصفحة الرئيسية، وشارة في لافتة صفحة التعليم العالي |
| "99.98% accuracy" (دقة 99.98%) | الجملة الافتتاحية للافتة نفسها، قبل 52 حرفاً |
| "99.26% overall" (99.26% إجمالاً) | Pangram vs. Turnitin، منشور مؤرَّخ في 28 يوليو 2026 |
| لا يوجد رقم للدقة | بطاقة نموذج Pangram 4، المؤرَّخة في 29 يوليو 2026، وتعرض بدلاً من ذلك معدلي الإيجابيات الخاطئة والسلبيات الخاطئة حسب المدونة النصية |
| "1 in 10,000" (واحد في كل 10,000) | الأسئلة الشائعة في الصفحة الرئيسية، على "an aggregate of public datasets" (تجميعة من مجموعات البيانات العامة) |
| "roughly 1 in 24,000" (نحو واحد في كل 24,000) | بطاقة النموذج، على 1,000,000 مثال إنجليزي من FineWeb |
| "approximately 1 in 25,000" (واحد تقريباً في كل 25,000) للمقالات الأكاديمية | منشور 28 يوليو 2026 |
| 0.019% لـ "Academic Writing (English)" (الكتابة الأكاديمية، الإنجليزية) | بطاقة النموذج، على 62,971 عنصراً، أعلى من رقمها العام |
وتنتج Turnitin النسخة الأخف من هذا الظاهرة داخل ملف واحد: فالورقة البيضاء الصادرة في أغسطس 2024 تعطي معدل الإيجابيات الخاطئة على مستوى المستند لـ AIW-2 بوصفه 0.5% في نصها، و0.51% في الجدول 1، وذلك على المجموعة نفسها من 719,877 ورقة طلابية تعود إلى ما قبل 2019.
أما الزوج الأهم فهو الرقمان اللذان تنشرهما Turnitin وكلاهما يُسمى معدل إيجابيات خاطئة على مستوى الجملة. ففي يونيو 2023 كتب كبير مسؤولي المنتجات لديها:
"Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." (معدل الإيجابيات الخاطئة لدينا على مستوى الجملة يبلغ نحو 4%. وهذا يعني أن هناك احتمالاً بنسبة 4% لأن تكون جملة محددة مُعلَّمة بوصفها مكتوبة بالذكاء الاصطناعي قد كُتبت بقلم بشري.)
وتعطي الورقة البيضاء الصادرة في أغسطس 2024 قيمة 0.33%، من اختبار إجهاد على أوراق قُدمت قبل 2019، وتقول عنها "All papers in this dataset are human written." (جميع الأوراق في مجموعة البيانات هذه مكتوبة بقلم بشري.)
القراءة المغرية هي أن نموذجاً تغيّر في أثناء ذلك. وقد تغيّر بالفعل، وهذا لا يفسر الفجوة. تقول الورقة البيضاء إن AIW-1 أُطلق في أبريل 2023، وإن "In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model" (في ديسمبر 2023، أطلقت Turnitin نموذج AIW-2، وهو نموذج محدَّث ومحسَّن ليحل محل نموذج AIW-1)، وبذلك يكون النموذج الذي كان يعمل في يونيو 2023 هو AIW-1. ثم ابحث عن AIW-1 في الجدول 2 من الورقة البيضاء نفسها: فعلى مجموعة الأوراق نفسها البالغة 719,877 ورقة، يبلغ معدل الإيجابيات الخاطئة على مستوى الجملة 0.42%، لا 4%. النموذج نفسه، والتسمية نفسها، ورقمان بينهما رتبة من حيث الحجم. وتنهار رواية الإصدار.
ما يختلف هو المجموعة التي حُسبت عليها كل نسبة مئوية. فالـ 4% مشروطة بجملة جرى تعليمها أصلاً: من الجمل التي حددها الكاشف، قد يتبين أن تلك الحصة مكتوبة بقلم بشري. أما 0.42% و0.33% فتجريان على كتابات بشرية بالكامل من الأساس: من كل تلك الجمل، تلك الحصة هي التي جرى تحديدها. وهذان يجيبان عن سؤالين مختلفين، وليس هناك ما يدعو لأن يقترب أحدهما من الآخر. ويمكنك قراءة تعريف الـ 4% في شرح Turnitin الصادر في يونيو 2023.
ليس في هذا أي مورد ضُبط متلبساً، وليس فيه رقمٌ شاخ. إنه ما يحدث عندما تُلصق عبارة واحدة بعدة قياسات مختلفة. لذلك، عندما يُلقى عليك معدل في اجتماع، فإن السؤال الذي يوصلك إلى مكان ما هو: على أي مجموعة حُسب؟ جميع المستندات المقدَّمة؟ الجمل التي جرى تعليمها فقط؟ النثر المؤهَّل فقط؟ النسبة المئوية بلا مجموعة لا يمكن التحقق منها، ولا يمكن مجادلتها أيضاً.
ما هو موجود من اختبارات مستقلة، وما لا تحسمه
دراسة واحدة محكَّمة ومفتوحة الوصول اختبرت الأداتين وجهاً لوجه. فقد بنت دراسة Who wrote this? Evaluating the reliability of AI detection tools in higher education (من كتب هذا؟ تقييم موثوقية أدوات كشف الذكاء الاصطناعي في التعليم العالي)، المنشورة في International Journal for Educational Integrity في 29 يونيو 2026، مجموعة اصطناعية من 160 ورقة أكاديمية بالإنجليزية، أربعون ورقة في كل من الفئات الأربع، ولا تقل أي منها عن 4,000 كلمة.
على مجموعة ما كُتب بقلم بشري، يشمل النتيجة الأدوات الأربع التي اختبرتها: "all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers." (صنفت الأدوات الأربع جميعها 100% من النصوص البشرية تصنيفاً صحيحاً بوصفها «سلبيات صحيحة» — أي بدرجة بين 0 و20%. وهذا يشير إلى أنه ليس لدى أي من الكواشف ميل إلى تحديد الكتابة البشرية خطأً بوصفها مولَّدة بالذكاء الاصطناعي في هذه المجموعة من الأوراق). أما على مجموعة ما وُلّد بالكامل بالذكاء الاصطناعي فقد افترقت الأداتان. وتورد الورقة أن "Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)" (صنفت Turnitin 100% من الأوراق المولَّدة بالكامل بالذكاء الاصطناعي بوصفها سلبيات خاطئة — بدرجات بين 0 و20%)، وأن "Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified." (كانت Pangram الأداة الوحيدة التي أدت أداءً جيداً، بدقة صارمة 65% ودقة شاملة 97.5%، ولم يُصنف خطأً سوى حالة واحدة).
قبل أن يقتبس أحدهم ذلك أمامك في أي من الاتجاهين، يضع المؤلفون حدودهم بأنفسهم: "the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category" (اقتصر نطاق بحثنا على 160 ورقة، وأربع أدوات لكشف الذكاء الاصطناعي، ونموذج ذكاء اصطناعي توليدي واحد هو GPT-4o Deep Research لفئة ما وُلّد بالكامل بالذكاء الاصطناعي)، والنتائج "valid only for a specific snapshot in time" (صالحة فقط للقطة زمنية محددة). وتوصيتهم للمؤسسات هي الجملة التي تستحق أن تُحمل إلى اجتماع: أدوات الكشف "should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy." (لا ينبغي أن تُستخدم بوصفها الدليل الوحيد في القرارات عالية المخاطر، بل ينبغي أن تُدرج في استراتيجية تقييم أوسع).
ملاحظة على الصياغة، لأن النسخة المعدَّلة تنتقل أبعد من الأصل. تقول الجملة الختامية للورقة: "From the four AI detection tools studied here, at this moment only one produced satisfactory results." (من بين أدوات كشف الذكاء الاصطناعي الأربع التي دُرست هنا، لم تُنتج سوى واحدة في هذه اللحظة نتائج مرضية.) وتصوغها Pangram في تلخيصها الخاص للدراسة على أنها "only [Pangram] produced satisfactory results" (وحدها [Pangram] أنتجت نتائج مرضية)، مع الإبدال بين قوسين معقوفين.
ثمة عملان آخران يُستشهد بهما في هذه المقارنة، وكلاهما يحتاج تحفظاً. يقول موجز بحثي صادر عن معهد Becker Friedman في جامعة شيكاغو، مؤرَّخ في 6 أكتوبر 2025، إن "Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages" (بين الخيارات التجارية، تحقق Pangram معدلات إيجابيات خاطئة وسلبيات خاطئة تقترب فعلياً من الصفر على المقاطع المتوسطة والطويلة). ولم تختبر Turnitin: إذ كانت الأدوات الأربع Pangram وOriginality.ai وGPTZero وخط أساس RoBERTa. وكانت مدونتها 1,992 مقطعاً عبر ستة أنواع يومية تشمل الأخبار والمدونات ومراجعات المستهلكين والسير الذاتية، وليس واجبات الطلاب. وهناك صلة تستحق أن توضع على الطاولة، بكلا شطريها: أحد المؤلفين الاثنين، Alex Imas، يظهر في شهادة موقعة على الصفحة الرئيسية لـ Pangram، وتحمل ورقة العمل في صفحتها الأولى سطراً يقول "All authors declare that they have no financial or personal conflicts of interest related to this study." (يعلن جميع المؤلفين أنه لا توجد لديهم تضاربات مالية أو شخصية في المصالح تتعلق بهذه الدراسة.) والورقة متاحة للتنزيل المجاني من المعهد، على بعد نقرتين من الموجز. زنها كما ترى أنها تستحق؛ ونحن نفضّل أن ترى الحقيقتين معاً بدلاً من ألا ترى أياً منهما.
والثاني اختبار عملي أجراه مراسل من TechCrunch في يوليو 2026، أنتج رقمين من مقال واحد: "Pangram gave it a 13% AI assisted score" (أعطتها Pangram درجة مساندة بالذكاء الاصطناعي 13%)، و"when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score." (عندما قدمتُ إلى Pangram المقال نفسه كاملاً، كما كتبته، حصل على درجة بشرية 100%). جلسة صحفي واحد ليست معياراً. إنها سجل مباشر لكيفية تغيّر الرقم العائد بتغيّر طريقة تقديم النص، وهو الموقف الذي تكون فيه عندما تُشغّل مؤسستان ملفين مختلفين.
ثم هناك الحالة التي يستحيل فيها المقارنة بينهما أصلاً، لأن واحداً منهما فقط هو من يُرجع رقماً. تلاحظ الورقة المحكَّمة نفسها، تحت شكلها الرئيسي، أن "Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score" (تعتبر Turnitin الأوراق التي تتراوح درجتها في الذكاء الاصطناعي بين 0% و20% غير مؤكدة، وتعلمها بنجمة بدلاً من درجة رقمية)، وأنه نتيجة لذلك "19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure." (رُمّزت 19 ورقة مولَّدة بالكامل بالذكاء الاصطناعي، و7 أوراق هجينة، و6 معدَّلة بشرياً، و3 مكتوبة بالكامل بقلم بشري بوصفها مفقودة في الشكل). أي أن 35 ورقة من أصل 160 ليس لها أي رقم من Turnitin تُقابله بأي شيء. وإذا كانت نتيجتك من Turnitin نجمة، فأنت لا تدافع عن درجة منخفضة، بل لا تملك درجة أصلاً، وتشرح ما تعنيه النجمة (*%) في درجة الذكاء الاصطناعي من Turnitin قاعدة العرض التي تقف وراءها.
ما يمكنك فعله عندما تختلف النتيجتان
ابدأ بالحصول على التقريرين، لأنك في الجانبين تعتمد على من شغّلهما. تقول الأسئلة الشائعة لدى Turnitin: "The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students." (مؤشر كشف الكتابة بالذكاء الاصطناعي والتقرير غير مرئيين للطلاب. ولكن عبر ميزة تنزيل PDF، يمكن للمدرسين تنزيل تقرير الذكاء الاصطناعي ومشاركته مع الطلاب.) ويقول مركز مساعدة Pangram إن النتيجة يمكن مشاركتها برابط، وإن من يتلقاها "will see the scan overview and segment details without having to create a Pangram account." (سيرون نظرة عامة على الفحص وتفاصيل المقاطع دون الحاجة إلى إنشاء حساب Pangram). اطلب الاثنين، ومن جانب Pangram اطلب تحديداً رابط المشاركة لا لقطة شاشة: فعرض المقاطع يبيّن أي المقاطع أنتجت الرقم، ولقطة شاشة لنسبة مئوية لا تقدم لك شيئاً تعمل به.
لا تخطط لتصحيح السجل مباشرة لدى Pangram. فأداة الملاحظات لديها مرتبطة بالحساب الذي شغّل الفحص: إذ تطلب صفحة المساعدة "Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account" (فتح النتيجة التي تريد إبداء ملاحظاتك عليها، إما بعد فحصها أو من صفحة History / All Checks في حسابك)، مع إبهام لأعلى وإبهام لأسفل أسفل النتيجة. والفحص الذي أجراه أستاذك ليس في حسابك.
كذلك لم نعثر على مسار تظلم منشور مخصص لمن يتلقى النتيجة. قرأنا النص الأساسي لجميع عناوين URL البالغ عددها 256 والمُدرجة في خريطة موقع Pangram في 15 سبتمبر 2026، وبإجمالي 2,117,382 حرفاً، وبحثنا في كل صفحة. تظهر كلمة `appeal` (تظلم، وهنا بمعنى شيء جذاب) في واحدة، في تدوينة عن الإعلان. وتظهر `dispute` (نزاع) في اثنتين: شرط التحكيم في شروط الخدمة، وتدوينة عن شراكة بشأن نزاعات المؤلف. ولا تظهر `grievance` (شكوى) أو `contest` (طعن) أو `redress` (جبر) أو `ombuds` (وسيط) أو `request a review` (طلب مراجعة) في أي من الصفحات الـ 256. ووجد البحث نفسه `false positive` (إيجابية خاطئة) في 162 من تلك الصفحات و`student` (طالب) في 182، وبهذا تعرف أن العدّاد كان يجد تطابقات فعلاً بدلاً من أن يُرجع صفراً بصمت لكل استعلام.
ثمة حدّ واحد على هذا العدد، لأنه النوع من الادعاءات الذي ينبغي أن تكون قادراً على هدمه إن كان خاطئاً: خريطة الموقع ليست الموقع كله. فالصفحة التي يقتبسها هذا المقال أكثر من غيرها، وهي بطاقة نموذج Pangram 4، تُرجع استجابة 200 وليست مدرجة في تلك الخريطة. اقرأ النتيجة إذاً بوصفها 256 صفحة مدرجة لا يوجد عليها أي مسار من هذا النوع، لا بوصفها حكماً على كل صفحة تستضيفها Pangram. واقرأها في الاتجاهين: فهي لا تعني أن Pangram ترفض التصحيحات، ولا تعني بالتأكيد أن مؤسستك لا تملك إجراءً. إنما تعني أن المورد ليس العنوان الذي يُوجَّه إليه.
تنشر مؤسستان تطبقان Pangram مساراً خاصاً بهما، وهما ما يستحق أن تعرفه. تأمر Substack الكتّاب بـ "select Report detection error" (تحديد Report detection error) في تقرير كشف الذكاء الاصطناعي، وتوثق أداة "Disable AI detection" (تعطيل كشف الذكاء الاصطناعي) على المسودات. وتخبر Wiki Education، التي تُمرر تعديلات المشاركين فيها على ويكيبيديا عبر Pangram، المدرسين بما كان وراء معظم الأخطاء التي أكدتها: "If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen." (إذا حفظ طالب مخططاً فارغاً — على سبيل المثال بنقاط قصيرة فقط أو عناوين أقسام فارغة — أو أدرج قدراً كبيراً من نص غير نثري، مثل أجزاء الجمل أو المدخلات الببليوغرافية، فقد يُطلق ذلك كاشف الذكاء الاصطناعي. والنص غير النثري عامل مشترك في معظم الإيجابيات الخاطئة المؤكدة التي رأيناها.) وتكتب أيضاً أنها "not use Pangram as definitive proof that the text was AI generated" (لا تستخدم Pangram دليلاً قاطعاً على أن النص وُلّد بالذكاء الاصطناعي)، بل "a way to flag which text needs additional human scrutiny for verifiability." (وسيلة لتحديد النص الذي يحتاج إلى فحص بشري إضافي للتأكد من إمكانية التحقق منه).
وهذه النقطة عن النص غير النثري يمكن التحقق منها في ملفك أنت، وتدعمها بطاقة نموذج Pangram من جانب المورد. فالنموذج مخصص للكتابة "of at least 50 words, written primarily in complete sentences" (البالغة 50 كلمة على الأقل، والمكتوبة أساساً بجمل كاملة)، وتسرد البطاقة ما يخرج عن هذا النطاق، ومنه "tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation" (جداول المحتويات، وأقسام المراجع، والكتابة القائمة على قوالب أو المولَّدة آلياً، والتعليمات والأدلة التقنية، والنص الذي تهيمن عليه الرموز الرياضية). وتضيف أن "human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document" (ينبغي إزالة العناوين والتذييلات والتعليمات وغيرها من التنسيقات الدخيلة التي كتبها بشر قبل فحص المستند)، وأن "Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts." (يُوصى بالملفات النصية الخام وملفات .docx بدلاً من PDF عند توفرها، لأن تحليل PDF قد يُدخل نتائج غير مقصودة). سؤالان محددان إذاً لمن شغّل الفحص: هل كان ملف PDF، وهل مرّت قائمة المراجع والصفحات التمهيدية معه؟
ثمة بضعة سطور تستحق أن تُقتبس في اجتماع تحديداً لأنها صادرة عن الموردين لا عنا. فتوجيه Pangram للمعلمين يقول "we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures" (نعتقد أن كشف الذكاء الاصطناعي وسيلة ممتازة لتحديد الواجبات، غير أن نتيجة الكشف تستلزم مزيداً من التحقيق قبل أي إجراءات عقابية — والتهجئة لهم)، ويضيف أن "A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong." (إن معدلاً غير صفري للإيجابيات الخاطئة يعني أن أي كشف إيجابي قد يكون حقيقياً، أو قد يكون الحالة الشاذة إحصائياً، واحدة في كل عشرة آلاف، التي تخطئ فيها Pangram). وتقول الأسئلة الشائعة لدى Turnitin "Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies." (لا تُصدر Turnitin حكماً بسوء السلوك؛ بل تقدم للمربين بيانات ليتخذوا قراراً مستنيراً استناداً إلى سياساتهم الأكاديمية والمؤسسية).
وتوجّه صفحة Pangram للمعلمين المدرسين أيضاً إلى أدلة على عملية الكتابة، وتسمي Google Docs: "select File -> Version history -> See version history to see a full history of their writing process." (تحديد File -> Version history -> See version history لعرض السجل الكامل لعملية كتابتهم). فإذا كان لديك هذا السجل، فإنه ينقل الحوار بعيداً عن سؤال أي النسب المئوية على حق، وهو السؤال الوحيد الذي لا تستطيع الأرقام المنشورة حسمه. ويغطي كيفية الاحتفاظ بسجل الإصدارات في Word وGoogle Docs وOverleaf مكان تخزين كل أداة له، ويغطي الاتهام زوراً بالذكاء الاصطناعي: كيف تتظلم، وما الأدلة التي ستقبلها جامعتك بقية الإجراء.
ما يعنيه ذلك لك
- الموردان لا يبلغان عن المقياس نفسه. تقول الورقة البيضاء لـ Turnitin الصادرة في أغسطس 2024 إنها لا تستخدم الدقة مقياساً؛ وتتصدر Pangram برقم دقة في صفحتها الرئيسية وصفحة التعليم العالي.
- النسب المئوية تحسب أشياء مختلفة. نسبة Turnitin تغطي النثر المؤهَّل فقط؛ ونسب Pangram مرجّحة بعدد الأحرف على النص المحلَّل ومجموعها 1.0. كما أن هدف Turnitin بالبقاء دون 1% مشروط أيضاً بالمستندات التي تزيد نسبة الكتابة بالذكاء الاصطناعي فيها على 20%، فلا توجد حسابات تحوّله إلى الـ 1 في 10,000 لدى Pangram.
- اسأل عن المجموعة التي حُسبت عليها النسبة، لا عن الإصدار الذي أنتجها. تنشر Turnitin معدلين على مستوى الجملة: نحو 4% (يونيو 2023) و0.33% (الورقة البيضاء، أغسطس 2024). وقد حدث تغيير في النموذج بينهما بالفعل، في ديسمبر 2023، ولا يفسر الفجوة: إذ تضع الورقة البيضاء النموذج الأقدم عند 0.42% على مدونتها الاختبارية، لا عند 4%. ما يفصل بينهما هو المجموعة. فالـ 4% تحسب الجمل التي جرى تعليمها فقط؛ أما 0.42% و0.33% فتجريان على كتابات بشرية بالكامل.
- حدد ما إذا كان رقمك حصة أم ثقة قبل أن تقارنه بأي شيء.
- النجمة ليست درجة منخفضة. في الدراسة المحكَّمة، لم يكن لدى 35 ورقة من أصل 160 أي رقم من Turnitin.
- وجّه اعتراضك عبر من شغّل الفحص. توجد أداة الملاحظات لدى Pangram في الحساب الذي أجرى الفحص، ولا تحمل أي من الصفحات الـ 256 المدرجة في خريطة موقعه مسار تظلم لمن جرى تحديده. اطلب التقرير نفسه، واطلب رابط المشاركة من Pangram مع عرض المقاطع.
إذا كان لديك تقرير من Turnitin أو iThenticate، فيمكنك استيراد التقرير والعمل على المقاطع التي حددها. يمكن إعادة تشغيل المقاطع المستوفية للشروط مجاناً.
تابع القراءة