الطلاب الدوليون ونتائج كشف الذكاء الاصطناعي: ما يحتاج معرفته من يكتب بلغة ثانية

الكتابة الأكاديمية بالإنجليزية كلغة ثانية شاقة بما يكفي دون أن تقلق من كشف الذكاء الاصطناعي. تقول إدارة Turnitin في أسئلتها الشائعة إن بيانات تدريب النموذج شملت متعلمي اللغة الثانية لتقليل التحيز، لكن الأداة لا تزال تقرأ أنماط احتمالية الكلمات، وبعض خصائص الكتابة معرضة أكثر من غيرها للإيجابيات الكاذبة. هذا ما يعنيه الأمر للطلاب الدوليين.

فريق HumanPen

· مدة القراءة: 4 د

الإجابة باختصار

تقول الأسئلة الشائعة من Turnitin إن بيانات تدريب النموذج "took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model" (راعت مجموعات ممثلة تمثيلاً ناقصاً إحصائياً كمتعّلمي اللغة الثانية، ومستخدمي الإنجليزية من دول غير ناطقة بالإنجليزية، وطلاب كليات وجامعات ذات تشكيلة طلابية متنوعة، وتخصصات أقل شيوعاً كالأنثروبولوجيا والجيولوجيا وعلم الاجتماع وغيرها لتقليل التحيز عند تدريب نموذجنا). هذا ادعاء من Turnitin نفسها، وليس نتيجةً تم التحقق منها بشكل مستقل. انضمام كتابات اللغة الثانية لبيانات التدريب يعني أن النموذج اطلع عليها أثناء التدريب، لكنه لا يزال يعمل بتصنيف أنماط احتمالية الكلمات في النصوص النثرية. فإذا صادفت كتابتك أن تشترك في أنماط إحصائية مع نصوص إنجليزية ولّدها الذكاء الاصطناعي، سيُعلِّمها الكاشف regardless مما إذا كانت الإنجليزية لغتك الأولى أم لا. فهم هذه الفجوة بين ادعاء التدريب وآلية الكشف هو مفتاح التعامل مع أي تعليم.

ما تدّعيه Turnitin حول التحيز

تتناول الأسئلة الشائعة مسألة التحيز مباشرة:

"While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model." (أثناء إنشاء مجموعة البيانات النموذجية، راعينا أيضاً المجموعات الممثلة تمثيلاً ناقصاً إحصائياً كمتعّلمي اللغة الثانية، ومستخدمي الإنجليزية من بلدان غير ناطقة بالإنجليزية، وطلاب كليات وجامعات ذات تشكيلة طلابية متنوعة، وتخصصات أقل شيوعاً كالأنثروبولوجيا والجيولوجيا وعلم الاجتماع وغيرها لتقليل التحيز عند تدريب نموذجنا)

هذا بيان الشركة الرسمي عن منهجية تدريبها. تقول إن بيانات التدريب صُممت لتشمل عينات كتابة متنوعة، لكنها لا تقدم أرقاماً أو نتائج اختبارات أو تحققاً خارجياً من مستويات التحيز. الادعاء هو أن كتابات اللغة الثانية وُجدت في التدريب، غير أن هذا لا يعني أنها محصّنة ضد الإيجابيات الكاذبة. النموذج دُرب على بيانات متنوعة، لكنه لا يزال يصنّف وفق أنماط احتمالية الكلمات. مقال لماذا تُعلَّم كتابات غير الناطقين بالإنجليزية أكثر من غيرها يستعرض الأبحاث حول هذه الفجوة.

كيف يقرأ الكاشف نَصّك

سلسلة الكشف تعمل بالطريقة نفسها بغض النظر عمن كتب النص:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عند تقديم ورقة إلى Turnitin، تُستخرَج جمل من التقديم وتُجزَّأ إلى أقسام متداخلة لتحليل التنبؤ. يُصنَّف كل قسم بواسطة نموذج كشف الذكاء الاصطناعي ويُعطى قيمة بين 0 و1 تدل على احتمالية أن يكون النص بشرياً أو مولَّداً بالذكاء الاصطناعي. كل جملة مستحقة داخل هذه الأقسام ترث درجة القسم. ولأن الأقسام تتداخل، قد يكون لبعض الجمل درجات متعددة تُجمَّع بعدها في درجة واحدة. تُجمَّع درجات الجمل هذه further وتُستخدم لحساب درجة كتابة الذكاء الاصطناعي الإجمالية للوثيقة)

لا يعرف الكاشف خلفيتك اللغوية. لا يعدّل تصنيفه بناءً على كونك متحدثاً أصلياً أو غير أصلي للغة الإنجليزية. يقرأ السمات الإحصائية لتسلسلات كلماتك ويصنّفها. فإذا صادفت أنماط كتابتك الإنجليزية -ربما المتأثرة بتعليم رسمي يركّز على عبارات وهياكل أكاديمية معينة- أن تتداخل مع الأنماط التي يربطها النموذج بنصوص الذكاء الاصطناعي، فقد تكون النتيجة أعلى مما تتوقع.

الإيجابيات الكاذبة والكتابة بلغة ثانية

تسرد الأسئلة الشائعة خصائص النصوص المعرضة للإيجابيات الكاذبة:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (أحياناً الإيجابيات الكاذبة -أي التعليم الخاطئ لنص مكتوب بشرياً على أنه مولَّد بالذكاء الاصطناعي- قد تشمل محتوى يفتقر للتنوع الهيكلي، أو نصوصاً تتكرر حرفياً، أو نصوصاً أُعيدت صياغتها دون تطوير أفكار جديدة)

يليها: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (إذا أظهر مؤشرنا كمية أعلى من كتابة الذكاء الاصطناعي في مثل هذا النص، ننصحك بأخذ ذلك في الاعتبار عند النظر للنسبة المئوية المُعلَنة)

بعض هذه الخصائص أكثر شيوعاً في الكتابة الأكاديمية بلغة ثانية. غير الناطقين بالإنجليزية غالباً ما يتعلمونها عبر قوالب منظمة وعبارات أكاديمية متكررة، فينتج عن هذا كتابة أقل تنوعاً هيكلياً. أدوات الربط مثل moreover وfurthermore وin addition تُدرَّس كوصلات قياسية، وتكرار استخدامها قد ينتج البنية الموحدة التي تصفها الأسئلة الشائعة. هذا لا يعني أن كتابات اللغة الثانية تُعلَّم دائماً، بل أن خصائص الإيجابيات الكاذبة قد تتداخل مع أنماط شائعة في الكتابة الأكاديمية بلغة ثانية. أما هل ينبغي لك أن تغيّر أسلوب كتابتك لتجنب التعليم، فهذا سؤال آخر: هل تغير طريقة كتابتك لتجنب تعليم الذكاء الاصطناعي.

لا يمكنك رؤية نتيجتك الخاصة

شيء آخر يحتاج الطلاب الدوليون لمعرفته. تقول الأسئلة الشائعة: "only instructors and administrators are able to see the indicator." (فقط المدرّسون والمدراء قادرون على رؤية المؤشر). الطلاب لا يستطيعون التحقق من نتيجة الذكاء الاصطناعي الخاصة بهم. وتضيف: "However, with the PDF download feature, instructors can download and share the AI report with students." (غير أنه بفضل ميزة تحميل PDF، يستطيع المدرّسون تحميل تقرير الذكاء الاصطناعي ومشاركته مع الطلاب). إن قلقك من نتيجتك، فالطريقة الوحيدة لرؤيتها هي أن تطلب من مدرّسك مشاركة تقرير PDF معك. لا يمكنك تشغيل الفحص نفسه عبر حساب طالب. بمجرد حصولك على PDF، فإن كيفية قراءة تقرير Turnitin لكتابة الذكاء الاصطناعي هي الخطوة التالية.

ماذا تفعل إن عُلمَّت ورقتك

ملخص لما سبق:

  • تدّعي Turnitin أن بيانات تدريبها شملت متعلمي اللغة الثانية لتقليل التحيز، لكنها لا تقدم أرقاماً للتحقق من هذا الادعاء.
  • يقوم الكاشف بقراءة أنماط احتمالية الكلمات بغض النظر عمن كتب النص أو ما لغته الأم.
  • خصائص الإيجابيات الكاذبة كالتنوع الهيكلي المنخفض قد تتداخل مع أنماط شائعة في الكتابة الأكاديمية بلغة ثانية.
  • الطلاب لا يرون نتيجة الذكاء الاصطناعي الخاصة بهم. المدرّسون فقط يرونها، لكن بإمكانهم مشاركة PDF.
  • نتيجة الذكاء الاصطناعي ونتيجة التشابه قياسان مستقلان.

إذا كان لديك تقرير Turnitin يوضح الفقرات المُعلَّمة، استورد التقرير واعمل على تلك الفقرات تحديداً. يمكن إعادة تشغيل الفقرات المؤهلة دون رسوم.

تابع القراءة