اختبرت Turnitin كاشفها الخاص بحثاً عن تحيز ضد متعلمي الإنجليزية. وللنتيجة شطران.
بالنسبة للمواد التي تتجاوز 300 كلمة، تُفيد Turnitin بأن الفجوة بين الكتّاب من فئة L2 والكتّاب من فئة L1 صغيرة وليست ذات دلالة إحصائية. أما في المواد التي تتراوح بين 150 و300 كلمة، فقد وجد التقييم نفسه فجوة أوسع، أعلى بشكل ملحوظ من هدفه المعلن البالغ 1%. كما تذكر Turnitin قيداً على عيّنتها يهمك إذا كنت تكتب على المستوى الجامعي.
فريق HumanPen
· مدة القراءة: 6 د
الجواب المختصر، بشطريه
أجرت Turnitin تقييمها الخاص لهذا السؤال ونشرت النتيجة. للجواب شطران، وهما يشيران إلى اتجاهين متعاكسين.
بالنسبة للمواد المكوّنة من 300 كلمة أو أكثر، تبيّن أن الفجوة في معدل الإيجابيات الخاطئة (FPR) بين متعلمي الإنجليزية (L2) والناطقين بها كلغة أم (L1) صغيرة وليست ذات دلالة إحصائية. أما في المواد التي تتراوح بين 150 و300 كلمة، فقد وجد التقييم نفسه فجوة أوسع، أعلى بشكل ملحوظ من هدفه البالغ 1%.
لذا فإن انطباق النتيجة المطمئنة عليك من عدمه يعتمد على طول ما أرسلته. وهناك أيضاً قيد تذكره Turnitin عن عيّنتها نفسها، وهو يهمك إذا كنت تكتب على المستوى الجامعي، وستجده في الأسفل.
ما الذي خضع للاختبار
جمعت Turnitin ما يصل إلى 2,000 نص لكل تركيبة من متغيّرين: الإنجليزية L2 (متعلم الإنجليزية) مقابل الإنجليزية L1 (الإنجليزية كلغة أم)، و"قصير جداً" (بين 150 و300 كلمة) مقابل "طويل بما يكفي" (300 كلمة أو أكثر). ولم تكن مجموعات البيانات جزءاً من بيانات تدريب كاشفها.
النتيجة التي تصدّرت العنوان
بالنسبة للمستندات التي تستوفي الحد الأدنى البالغ 300 كلمة، تُفيد Turnitin بأن الفارق في معدل الإيجابيات الخاطئة بين الكتّاب من فئة L2 والكتّاب من فئة L1 صغير وليس ذا دلالة إحصائية:
"For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target." (بالنسبة للمستندات التي تستوفي شرطنا المتمثل في حد أدنى قدره 300 كلمة، فإن الفارق في معدل الإيجابيات الخاطئة (FPR) بين كتّاب الإنجليزية من فئة L2 (كتّاب ELL) وكتّاب الإنجليزية من فئة L1 (الناطقين بها كلغة أم) صغير وليس ذا دلالة إحصائية، مما يدل على أن كاشفنا غير متحيز بين هاتين المجموعتين من الكتّاب. وإضافة إلى ذلك، ورغم أن معدل الإيجابيات الخاطئة لدى كل مجموعة أعلى قليلاً من هدفنا الإجمالي البالغ 0.01 (1%)، فإنه لا يختلف عن هذا الهدف اختلافاً يُعتد به إحصائياً لدى أي من المجموعتين.)
عبارة "Not statistically significant" (ليست ذات دلالة إحصائية) تعني أن الفارق الذي وجدوه قد يكون مجرد ضجيج. ولا تعني أن الفارق معدوم، ولا تعني غياب التحيز. كما أن معدل الإيجابيات الخاطئة لدى المجموعتين كان أعلى من هدف 1%، وإن لم يكن بهامش اعتبره الاختبار ذا معنى. و"Slightly higher" (أعلى قليلاً) ليست "at or below." (عند المستوى أو دونه).
النتيجة التي لم تتصدّر العنوان
بالنسبة للمستندات التي تتراوح بين 150 و300 كلمة، وجد التقييم نفسه الاتجاه المعاكس. فقد كانت الفجوة بين الكتّاب من فئة L2 والكتّاب من فئة L1 أوسع، وكان معدل الإيجابيات الخاطئة أعلى بشكل ملحوظ من هدف 1%:
"Conversely, for documents that are (في المقابل، بالنسبة للمستندات التي تُعد) "too short," (قصيرة جداً:) we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum." (في هذه الحالات، وجدنا فارقاً أكبر في معدل الإيجابيات الخاطئة بين هاتين المجموعتين من الكتّاب، وهو أعلى بشكل ملحوظ من هدفنا البالغ 0.01. وهذا يؤكد من جديد ما توصلنا إليه سابقاً من أن كواشف الكتابة بالذكاء الاصطناعي تحتاج إلى عيّنات أطول للتعرف الصحيح على المحتوى المولّد بالذكاء الاصطناعي وللحفاظ على الإيجابيات الخاطئة في حدها الأدنى.)
الدراسة نفسها، والكاشف نفسه، أسفرا عن نتيجة للنصوص الطويلة وأخرى للنصوص القصيرة. عنوان التدوينة يحمل الأولى، أما الثانية ففي المتن.
ما الذي احتوته العيّنة فعلياً
تقول Turnitin ما يلي:
"Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation." (معظم المستندات بالإنجليزية L2 هي مهام كتابة قصيرة إقناعية أو معلوماتية، وهي أقرب ما تكون إلى مجموعة مقالات المرحلة الثانوية في Automated Scoring and Assessment Prize (ASAP). ولم تتوفر لهذا التقييم مجموعة مماثلة، متاحة للعموم، من المستندات الجامعية الكاملة التي كتبها كتّاب من فئة L2 وكتّاب من فئة L1.)
كتابات L2 في هذا التقييم هي في معظمها مقالات بمستوى المدرسة الثانوية. إذا كنت تكتب بحثاً جامعياً، أو مراجعة للأدبيات، أو تقريراً مخبرياً، أو فصلاً من أطروحة، فليس هذا ما خضع للاختبار. وتذكر Turnitin أنها لم تجد مجموعة متاحة للعموم من الكتابات الجامعية لكتّاب L2 وكتّاب L1 تُجري عليها هذه المقارنة. ونتيجة "not statistically significant" (ليست ذات دلالة إحصائية) تنطبق على المقالات الإقناعية والمعلوماتية القصيرة بمستوى المرحلة الثانوية. أما انطباقها على نوع المستند الذي تقدمه أنت فسؤال لا يستطيع هذا التقييم الإجابة عنه.
حد الـ300 كلمة
تربط Turnitin الحد الأدنى البالغ 300 كلمة مباشرة بهذا البحث. فبعد تقييم 800,000 مستند وملاحظة أن المواد القصيرة ترفع معدل الإيجابيات الخاطئة، انتقلوا إلى اشتراط 300 كلمة:
"Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission." (يُظهر تقييمنا لـ800,000 مستند، وقد سبقت الإشارة إليه في هذه التدوينة، أن المواد القصيرة (أقل من 300 كلمة) تسجّل معدلاً للإيجابيات الخاطئة أعلى قليلاً مما يريحنا. فقد لا تحتوي هذه العيّنات القصيرة على قدر كافٍ من الإشارات أو العلامات التي تكشف الفروق التوزيعية الدالة على الكتابة بالذكاء الاصطناعي. ولضمان بقاء معدل الإيجابيات الخاطئة لدينا دون 1%، بادرنا إلى رفع الحد الأدنى لطول المادة المطلوب لكي تعالج خاصية الكشف عن الكتابة بالذكاء الاصطناعي أي إرسال، فجعلناه 300 كلمة.)
هذا الحد الأدنى موجود لأن النصوص القصيرة سبّبت مشكلات. والنتيجة المطمئنة لا تنطبق إلا فوق هذا الحد الأدنى. أما دونه، فقد وجد التقييم نفسه الفجوة التي تريد معرفتها.
وماذا عن دراسة Liang؟
ربما صادفت عناوين مرتبطة بدراسة أجراها Liang. وتتناولها Turnitin مباشرة:
"Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short." (يعتمد ادعاء Liang على مجموعة صغيرة من الأعمال لا تتجاوز 91 مقالة تدريبية من اختبار TOEFL (Test of English as a Foreign Language)، وجميعها أقل من 150 كلمة. ولم تُدرج خاصية Turnitin للكشف عن الكتابة بالذكاء الاصطناعي في هذا التقييم، ولعل من أسباب ذلك أننا لا نُصدر تنبؤات عن مستندات بهذا القِصر.)
ماذا تفعل بهذا
إذا تجاوز ما تقدمه 300 كلمة، فإن بيانات Turnitin نفسها تقول إن الفجوة بين معدلي الإيجابيات الخاطئة لدى L2 وL1 صغيرة وليست ذات دلالة إحصائية. وهذا ليس ضماناً بألا يتم تحديدك. بل يعني أن التقييم لم يجد دليلاً قوياً على أن الكتّاب من فئة L2 في وضع أسوأ بشكل منهجي، على الأقل في العيّنة التي كانت لديهم.
إليك ما يمكنك استخدامه فعلاً:
تحقق من عدد الكلمات قبل الإرسال. إذا تم تحديد قسم يقل عن 300 كلمة، فإن تقييم الكاشف نفسه يقول إن النصوص القصيرة تُنتج فجوة أوسع بين الكتّاب من فئة L2 والكتّاب من فئة L1، ومعدلاً للإيجابيات الخاطئة أعلى عموماً. ويمكنك أن تطلب من مُدرّسك إجراء الفحص على المستند الكامل بدلاً من مقتطف قصير.
اسأل عما تم تحديده وعند أي عتبة. إذا استُخدمت Turnitin، فإن الحد الأدنى البالغ 300 كلمة وتفصيلة "slightly higher than 1%" (أعلى قليلاً من 1%) أمران محددان يمكنك إثارتهما مع من يراجع عملية التحديد.
احتفظ بمسوّداتك وملاحظاتك ومصادرك. إذا تم تحديدك وكنت تعتقد أن كتابتك بالإنجليزية L2 كان لها دور، فإن إظهار سجل مراجعاتك وموادك المصدرية هو ما يحسم الحوار. أما الجدال مع أستاذك حول الدلالة الإحصائية فغالباً لن يحسمه.
تابع القراءة