هل وُضع على كتابتك وسم الذكاء الاصطناعي لأنك لست ناطقاً أصلياً بالإنجليزية؟ ما تقوله الوثائق

الكتابة بلغة ثانية أمر صعب بما يكفي حتى من دون أن يضاف إليه وسم الذكاء الاصطناعي. تقول الأسئلة الشائعة في Turnitin إن بيانات التدريب ضمت متعلمي الإنجليزية كلغة ثانية بهدف الحد من التحيز، لكنها لا تقدم أي أرقام. وما زال الكاشف يقرأ أنماط احتمالية الكلمات. وبعض أنماط الكتابة الأكاديمية الشائعة بين غير الناطقين الأصليين يمكن أن تتقاطع مع الخصائص التي تؤدي إلى الإيجابيات الخاطئة.

فريق HumanPen

· مدة القراءة: 4 د

الإجابة المختصرة

يمكن لمن لا يتحدث الإنجليزية كلغة أم أن يتلقى وسم ذكاء اصطناعي على نص كتبه إنسان بالكامل. تقول الأسئلة الشائعة في Turnitin إن بيانات تدريب النموذج "took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries" (راعت المجموعات الممثلة تمثيلاً ناقصاً من الناحية الإحصائية، مثل متعلمي الإنجليزية كلغة ثانية ومستخدمي الإنجليزية في بلدان غير ناطقة بالإنجليزية) وذلك للحد من التحيز. هذا ادعاء الشركة نفسها، ولم يتحقق منه أحد بشكل مستقل. وما زال الكاشف يعمل بتصنيف أنماط احتمالية الكلمات في النص النثري. فالكتابة الأكاديمية الرسمية التي تُلقَّن لغير الناطقين الأصليين، بما تقوم عليه من قوالب مهيكلة وانتقالات نمطية، يمكن أن تنتج نصاً قليل التنوع البنيوي. وهذه الخاصية مدرجة في قائمة Turnitin نفسها لأنواع النصوص المعرضة للإيجابيات الخاطئة. فالوسم لا يعني إذن أن لغتك الإنجليزية أفضل مما ينبغي أو أنها آلية أكثر مما ينبغي. بل يعني أن الملف الإحصائي لنصك تقاطع مع أنماط يربطها النموذج بالذكاء الاصطناعي.

ما تدّعيه Turnitin عن تنوع بيانات التدريب

تتناول الأسئلة الشائعة مسألة التحيز بشكل مباشر:

"While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model." (أثناء إنشاء مجموعة بيانات العينة، راعينا أيضاً المجموعات الممثلة تمثيلاً ناقصاً من الناحية الإحصائية، مثل متعلمي الإنجليزية كلغة ثانية ومستخدمي الإنجليزية في بلدان غير ناطقة بالإنجليزية، وطلاب الكليات والجامعات ذات التركيبة الطلابية المتنوعة، ومجالات المواد الأقل شيوعاً مثل الأنثروبولوجيا والجيولوجيا وعلم الاجتماع وغيرها، وذلك للحد من التحيز عند تدريب نموذجنا.)

هذا هو وصف Turnitin لمنهجية التدريب التي تتبعها. والادعاء هو أن الكتابة بلغة ثانية كانت ممثلة في بيانات التدريب. أما ما لا يتضمنه هذا الادعاء فهو أي رقم أو نتيجة اختبار أو تحقق خارجي من مدى جودة أداء النموذج على الكتابة بلغة ثانية. ولا تنشر الأسئلة الشائعة معدلات الإيجابيات الخاطئة مقسمة بين الناطقين الأصليين وغير الناطقين الأصليين. إذن، الادعاء هو أن بيانات متنوعة قد استُخدمت، لكن مدى فاعلية هذا الجهد لا يمكن قياسه بشكل مستقل استناداً إلى الوثائق المتاحة للجمهور.

كيف يقرأ الكاشف الكتابة بلغة ثانية

مسار الكشف واحد لكل النصوص:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عندما تُرسل ورقة بحثية إلى Turnitin، تُستخرج الجمل من النص المرسل وتُقسَّم إلى مقاطع متداخلة من أجل تحليل التنبؤ. ويصنف نموذج كشف الذكاء الاصطناعي كل مقطع ويعطيه قيمة بين 0 و1 تدل على احتمال أن يكون النص بشرياً أو مولداً بالذكاء الاصطناعي. وترث كل جملة مؤهلة داخل هذه المقاطع درجة المقطع. ولأن المقاطع متداخلة، قد تحمل بعض الجمل أكثر من درجة، تُدمج بعد ذلك في درجة واحدة. ثم تُجمع درجات الجمل هذه وتُستخدم لحساب درجة الذكاء الاصطناعي الإجمالية للمستند.)

الكاشف لا يعرف خلفيتك اللغوية. إنه يقرأ تسلسل الكلمات ويصنفه. فإذا كانت أنماط كتابتك، وقد تشكلت بتعليم رسمي للإنجليزية، تنتج تسلسلات احتمالية تتقاطع مع ما تعلم النموذج أن يربطه بالنص المولد بالذكاء الاصطناعي، فقد تكون الدرجة أعلى مما تتوقع. وتوضح ما الذي تقيسه كواشف الذكاء الاصطناعي إلى جانب الحيرة والتذبذب الأسلوبي ماهية هذه الأنماط.

التقاطع مع خصائص الإيجابيات الخاطئة

تدرج الأسئلة الشائعة النصوص المعرضة للإيجابيات الخاطئة:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (في بعض الأحيان يمكن أن تشمل الإيجابيات الخاطئة — أي وسم نص كتبه إنسان خطأً على أنه مولد بالذكاء الاصطناعي — محتوى يفتقر إلى قدر كبير من التنوع البنيوي، أو نصاً يكرر نفسه حرفياً، أو نصاً أعيدت صياغته من دون أن يطور أفكاراً جديدة.)

والجملة التالية: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (إذا أظهر مؤشرنا قدراً أعلى من الكتابة بالذكاء الاصطناعي في هذا النوع من النصوص، فننصحك بأن تأخذ ذلك في الاعتبار عند النظر إلى النسبة المئوية المبينة.)

كثيراً ما يشدد تعليم الإنجليزية لغير الناطقين الأصليين على القوالب الأكاديمية المهيكلة. فالطلاب يتعلمون أنماطاً نموذجية للجمل، وانتقالات رسمية، وبنى موحدة للفقرات. وهذا ينتج كتابة تتسم بنوع التجانس الذي تصفه الأسئلة الشائعة بأنه معرض للإيجابيات الخاطئة. وهذا التقاطع ليس مقصوداً. إنه نتيجة للطريقة التي تُدرَّس بها الإنجليزية الأكاديمية لغير الناطقين الأصليين وللكيفية التي يصف بها الكاشف النص. أما ما إذا كان الرد الصحيح هو الكتابة بأسلوب مختلف فهو سؤال قائم بذاته: هل يجب أن تغير طريقة كتابتك لتجنب الوسم

ما الذي تفعله إذا وُسم نصك

تقول الأسئلة الشائعة:

"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors." (لذلك، لا بد أن نؤكد أن النسبة المئوية في مؤشر الكتابة بالذكاء الاصطناعي لا ينبغي أن تُستخدم كأساس وحيد لاتخاذ إجراء أو كمعيار تقييم نهائي من قبل المدرسين.)

إذا وُسم نصك الذي كتبته بنفسك، فلديك ما تستند إليه في الحديث مع مدرسك. يمكنك الإشارة إلى الأوصاف التي تقدمها الأسئلة الشائعة للنصوص المعرضة للإيجابيات الخاطئة، وشرح طريقة كتابتك، والتنبيه إلى أن الدرجة ليست سوى نقطة بيانات واحدة. ويمكنك أيضاً الاستشهاد بالادعاء المتعلق بتنوع بيانات التدريب، مع الإقرار بصدق بأن ذلك لا يضمن الحصانة من الإيجابيات الخاطئة. ويتناول موسوم، لكنك كتبته بنفسك كيفية تجميع هذه الحجة.

ما يعنيه هذا لك

لتلخيص ما تناولناه:

  • تدّعي Turnitin أن بيانات تدريبها ضمت متعلمين بلغة ثانية، لكنها لا تقدم أرقاماً تتيح التحقق من الفاعلية.
  • يقرأ الكاشف أنماط احتمالية الكلمات بصرف النظر عن الخلفية اللغوية.
  • يمكن للكتابة الأكاديمية الرسمية الشائعة بين غير الناطقين الأصليين أن تتقاطع مع خصائص الإيجابيات الخاطئة.
  • تقول الأسئلة الشائعة إن الدرجة لا ينبغي أن تكون الأساس الوحيد لاتخاذ إجراء.
  • إذا وُسم نصك، فإن طريقة كتابتك وأوصاف الإيجابيات الخاطئة الواردة في الأسئلة الشائعة نفسها تمنحك ما تستند إليه في المناقشة.

إذا كان لديك تقرير من Turnitin يوضح المقاطع التي وُسمت، فاستورد التقرير واعمل على تلك المقاطع تحديداً. ويمكن إعادة معالجة المقاطع المؤهلة مجاناً.

تابع القراءة