ماذا يعني معدّل الإيجابيات الكاذبة بنسبة 1% حين تُقدّم جامعة 75,000 ورقة بحثية

يبدو معدّل خطأ بنسبة واحد في المئة وكأنّه فارق تقريبي لا يُذكر، إلى أن يأتي من يضربه في حجم submissions الفعلي. إحدى الجامعات نشرت هذه العملية الحسابية، ونشرت قرارها أيضًا.

فريق HumanPen

· مدة القراءة: 8 د

الإجابة المختصرة

معدّل الإيجابيات الكاذبة خاصّ بالمجتمع ككل، لا بورقتك أنت. جامعة Vanderbilt وضعت أرقامًا على هذا في أغسطس 2023: فقد قدّمت 75,000 ورقة إلى Turnitin في 2022، لذا لو كان كاشف الذكاء الاصطناعي يعمل آنذاك، لكان معدّل 1% يعني \"أن حوالي 750 ورقة طالب قد تُوسَم خطأ\". عطّلت الجامعة الكاشف. شرطان يلازمان هذه الجملة ويُحذفان دائمًا في الروايات اللاحقة: الكاشف لم يكن يعمل في 2022، ولهذا تقول المصادر \"لو\"، والرقم 1% نفسه من المورد carries a qualifier تُسقِطه الجملة التي تليه.

العملية الحسابية بكلمات الجامعة نفسها

نشر مكتب التعلّم والابتكار في Vanderbilt منشورًا في 16 أغسطس 2023 بعنوان \"Guidance on AI Detection and Why We're Disabling Turnitin's AI Detector\" (إرشادات حول كشف الذكاء الاصطناعي ولماذا نعطّل كاشف Turnitin). القرار نفسه مُعلَن بوضوح: \"Vanderbilt has decided to disable Turnitin's AI detection tool for the foreseeable future.\" (قرّرت Vanderbilt تعطيل أداة كشف الذكاء الاصطناعي من Turnitin في المستقبل المنظور).

العبارة التي تستحقّ أن تحفظها هي العملية الحسابية:

\"At the time of launch, Turnitin claimed that its detection tool had a 1% false positive rate (Chechitelli, 2023). To put that into context, Vanderbilt submitted 75,000 papers to Turnitin in 2022. If this AI detection tool was available then, around 750 student papers could have been incorrectly labeled as having some of it written by AI.\" (وقت الإطلاق، ادّعت Turnitin أن أداة الكشف لديها معدّل إيجابيات كاذبة 1%. لوضع هذا في سياقه، قدّمت Vanderbilt 75,000 ورقة إلى Turnitin في 2022. لو كانت أداة كشف الذكاء الاصطناعي متاحة حينها، لكان حوالي 750 ورقة طالب قد وُسِمت خطأً على أن جزءًا منها كُتب بالذكاء الاصطناعي).

لا شيء معقّد هنا. إنّها النسبة المئوية من خمسة وسبعين ألفًا. لكنّها تحوّل النسبة إلى عدد مستندات، وهذا التحويل هو السبب كلّه في صعوبة استيعاب معدّلات الخطأ.

اقرأ الجملة الثانية مرة أخرى، بدءًا من كلمة if. الكاشف لم يكن يعمل حين قُدّمت الـ75,000 ورقة، وهذا ما تعنيه \"لو كانت أداة كشف الذكاء الاصطناعي متاحة حينها\". إذًا 750 ليس عددًا لأي شيء حدث فعليًا في Vanderbilt أو أي مكان آخر. إنّه مجرد ما يبدو عليه واحد في المئة من الحجم السنوي الفعلي لجامعة واحدة حين يُكتب بالأرقام. هذا ادّعاء أصغر بكثير ممّا يُستخدَم الرقم لدعمه عادةً، وأسهل كثيرًا في الدفاع عنه.

لماذا يتغيّر معنى الرقم باختلاف زاوية نظرك إليه

بالنسبة للمورّد، واحد من كل مئة هو مواصفة فنية. بالنسبة للمؤسسة، إنّه عبء عمل سنوي. وبالنسبة لك، ليس هذا ولا ذاك — أنت مجرّد مستند واحد، والمعدّل لا يقول شيئًا عمّا إذا كانت ورقتك هي ذلك الواحد.

هذه النقطة الأخيرة سيف ذو حدّين، وموقع المبالغات من كلا الجانبين:

  • لا يعني هذا أن علامتك الحمراء غالبًا خاطئة. معدّل خطأ 1% على الأوراق المكتوبة بواسطة البشر يتوافق تمامًا مع كون معظم الأوراق المُعلَمة صحيحة التعليم، اعتمادًا على كم كان منها بمساعدة الذكاء الاصطناعي أصلاً.
  • ويعني في الوقت ذاته أن \"الأداة دقيقة بنسبة 99%، إذًا لا بد أنك فعلتها\" ليس حجةً مقبولة. المعدّل يصف مجتمعًا؛ ولا يمكنه أن يخبرك أي فرد من هذا المجتمع يقف أمامك. وواحد في المئة من عام فيه 75,000 ورقة يعني مئات المستندات، لذا فالوقوع في هذا النطاق شيء عادي لا استثنائي. غير أن مئات المستندات ليست مئات الاتهامات، والمسافة بين هذين هما حيث تعيش معظم النسخ السيئة من هذه الحجة.

الموقف المفيد ليس \"الكاشف معطوب\" ولا \"الكاشف على حق\". إنّهُ أن إحصائية مجتمعية لا يمكنها الفصل في حالة فردية، والمورّد يوافق على هذا كتابةً: تعليماته للمدرسين تنص على عدم التعامل مع نسبة مؤشر الكتابة بالذكاء الاصطناعي على أنها \"the sole basis for action or a definitive grading measure\" (الأساس الوحيد لاتخاذ إجراء أو مقياس نهائي للدرجات).

القيّد الذي يسقط دائمًا

إليك تفصيلًا يهمّك إن كنت ستقتبس رقم 1% أمام أي أحد.

تذكّرة Turnitin تطرح الادّعاء هكذا: إنها تسعى للحفاظ على معدّل الإيجابيات الكاذبة — \"incorrectly identifying fully human-written text as AI-generated\" (التعرّف خطأً على نص مكتوب بالكامل بواسطة البشر على أنه مُولَّد بالذكاء الاصطناعي) — تحت 1% لـ\"for documents with over 20% of AI writing.\" (\"المستندات التي تزيد نسبة الكتابة بالذكاء الاصطناعي فيها عن 20%\".)

For documents with over 20% of AI writing. (للمستندات التي تزيد نسبة الكتابة بالذكاء الاصطناعي فيها عن 20%.) هذا قيد جوهري على الادّعاء، ولا ينجو من إعادة صياغة المورد نفسها في الجملة التي تليها، والتي تقول: \"In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents.\" (بمعنى آخر، قد نُعلّم مستندًا مكتوبًا بواسطة البشر على أنه كُتب بالذكاء الاصطناعي في حالة واحدة من كل 100 مستند مكتوب بالكامل بواسطة البشر).

الجملتان لا تتكافئان، والثانية هي التي تنتشر. إن استخدمت الرقم، فاستخدم النسخ المقيّدة — جزئيًا لأنها دقيقة، وقبل ذلك لأن شخصًا على الطرف الآخر من الطاولة قد يعرف أن القيد موجود.

أي أجزاء من منشور 2023 تصمد عند إعادة النقل

المنشور من أغسطس 2023. جزء منه عملية حسابية لا تشيخ. وجزء ادّعاء عمّا نشره المورد، وهذا يتغيّر. فرز هذين قبل اقتباس أي شيء هو جلّ العمل.

العملية الحسابية آمنة للتكرار، بشرط إرفاق if. واحد في المئة من حجم submissions كبير هو عدد كبير من المستندات، ولا شيء منذ 2023 يلمس هذا.

القلق بشأن الكُتّاب غير الناطقين بالإنجليزية كلغة أم آمن للتكرار أيضًا، ولا يستند إلى هذا المنشور أصلًا. وراءه بحث، وقد شرحنا ما قاسه ذلك البحث فعليًا في التحيّز في كشف الذكاء الاصطناعي ضد الكتابة الإنجليزية لغير الناطقين بها.

شكوى الشفافية هي ما يجب التحقق منه قبل تكراره. كتبت Vanderbilt أن \"Turnitin gives no detailed information as to how it determines if a piece of writing is AI-generated or not\" (لا تقدّم Turnitin معلومات مفصّلة عن كيفيّة تحديد ما إذا كانت قطعة كتابة مولّدة بالذكاء الاصطناعي أم لا). لكن تذكّرة اليوم تصف كيف تُجمَّع الدرجة: تُستخرج الجمل وتُقسَّم إلى أجزاء متداخلة، كل جزء يُصنَّف ويُعطى قيمة بين 0 و1، الجمل المؤهّلة ترث درجة جزءها، الدرجات المتداخلة تُجمَّع معًا، ودرجات الجمل المُجمَّعة تُدمَج في درجة المستند. إن ادّعيت في اجتماع أنه لم يُنشَر شيء أبدًا عن كيفيّة عمله، يمكن لأحد أن يضع تلك الفقرة أمامك.

مع ذلك، اقرأ الجملة التي تليها في المنشور قبل أن تقرّر أن الاعتراض قد أُجيب، لأن الاعتراض أضيق من \"أخبرونا كيف يعمل\". الشكوى أن الأداة \"تبحث عن أنماط شائعة في الكتابة بالذكاء الاصطناعي، لكنّها لا تشرح أو تُعرّف ما هي هذه الأنماط\". وصف كيف تُدمَج درجات الأجزاء ليس وصفًا للأنماط. الآلية المنشورة والاعتراض المنشور عن سؤالين مختلفين، وكلاهما يمكن اقتباسه بدقة في اليوم نفسه.

ما لا نستطيع إخبارك به هو متى ظهرت فقرة التذكّرة هذه أول مرة. لم نحدّد تاريخها، لذا لا ينبغي قراءة أي شيء فوق على أن المورد نشرها ردًا على هذا المنشور.

قيّد آخر، وهذا خاص بـVanderbilt. المنشور يصف الميزة بأنها وصلت بـ\"less than 24-hour advance notice, no option at the time to disable the feature\" (إشعار مسبق بأقل من 24 ساعة، لا خيار وقتها لتعطيل الميزة). At the time (وقتذاك) موجودة في الجملة الأصلية. اقتبسها بدون هذه الكلمات الثلاث فتحوّل عبارة عن الإطلاق إلى ادّعاء دائم عن المنتج. نفس الحركة مثل إسقاط \"over 20%\" من رقم 1%، فقط من الطرف الآخر من الجدال.

كيف تستخدم هذا دون مبالغة

  1. اذكر التاريخ. \"في 2023، عطّلت Vanderbilt الأداة ونشرت هذا السبب\" قابل للتحقق وقابل للدفاع. \"الجامعات هجرت كشف الذكاء الاصطناعي\" ليس كذلك.
  2. قل ما توضّحه العملية الحسابية. تنتشر لأن أي أحد يمكنه إعادة حسابها بحجم مؤسسته الخاص، وتُشير إلى نقطة حقيقية: نسبة صغيرة لا تزال تُنتج عبء عمل يجب على أحد مراجعته بإنصاف. ما لا تفعله هو تقدير الاتهامات. ليس كل submission مؤهّلاً لدرجة، ولا أحد خارج المؤسسة يعرف كم كان استخدام الذكاء الاصطناعي فعليًا، والتعليم لا يجب أن يتحوّل إلى تهمة. نشرّح هذا بمزيد من التفصيل في هل 20% ذكاء اصطناعي كثير جدًا.
  3. لا تدّعِ أنها تثبت أي شيء عن مستندك. تُثبِت فقط أن الخطأ في التعليم حدث عادي على النطاق الكبير، وهذا ادّعاء مختلف وأكثر تواضعًا.
  4. تحقّق عمّا إذا كانت مؤسّستك نشرت أي شيء. ابحث في سياسة النزاهة الأكاديمية وفي أي شيء يُصدره مركز التعلّم والتدريس، لا فقط صفحة الأخبار. بيان محلي يفوق بيانًا بعيدًا في كل محادثة من المرجّح أن تخوضها.
  5. أبقِه خارج افتتاحيتك. العمليات والمصادر تُقنع أولًا؛ الإحصاءات هي ما تلجأ إليه حين يجادل أحد بأن الرقم بديهي وحاسم.

إن كانت مؤسّستك لا تزال تستخدمه

إن كان كذلك، فالتقرير أمامك هو الشيء الذي يهمّ لا أي مما سبق. ما النسبة المئوية إحصائية له، ولماذا يمكن أن تختلف النقاط المميّزة عن الرقم، أرض منفصلة، مغطّاة في قراءة تقرير الكتابة بالذكاء الاصطناعي سطرًا بسطر.

HumanPen يدخل فقط عند النقطة التي تُعلَّم فيها فقرات محدّدة وبعضها يحتاج إلى تغيير: التقرير يرسم الحدود، والفقرات غير المُعلَّمة تحتفظ بالصياغة التي لديك بالفعل.

لا شيء من هذا جواب على إيجابية كاذبة. إن كان موقفك أنك كتبته، فإعادة كتابته هي الخطوة الخطأ، وما أقنع المحكّمين فعليًا موضوع مختلف تمامًا: الدليل الذي حرّك مجلسًا.

أسئلة شائعة

هل يعني معدّل إيجابيات كاذبة 1% أن علامتي الحمراء غالبًا خاطئة؟ لا. إنّه معدّل عبر مجتمع من المستندات المكتوبة بواسطة البشر ولا يقول شيئًا عن حالة فردية. معناه أنه على الحجم المؤسّسي، الأوراق المُعلَّمة خطأً هي حدث عادي لا شاذ.

من أين يأتي رقم 750؟ من منشور Vanderbilt نفسه في 16 أغسطس 2023، بتطبيق رقم 1% على الـ75,000 ورقة التي قدّمتها إلى Turnitin في 2022. لاحظ الشرطي: الكاشف لم يكن يعمل في 2022، لذا الجملة تقول \"if this AI detection tool was available then\" (لو كانت أداة كشف الذكاء الاصطناعي متاحة حينها). يوضّح كيف يبدو واحد في المئة من حجم تلك الجامعة مكتوبًا بالأرقام. ليس سجلًا لـ750 ورقة وُسِمت خطأ، وليس توقّعًا لمؤسّسة أحد آخر.

هل ادّعاء 1% غير مقيّد؟ لا. الهدف المعلن من Turnitin هو تحت 1% \"for documents with over 20% of AI writing\" (\"للمستندات التي تزيد نسبة الكتابة بالذكاء الاصطناعي فيها عن 20%\"), إعادة صياغتهم في الجملة التالية تُسقِط ذلك القيد، ولهذا تنتشر النسخة غير المقيّدة.

هل أغلقت الجامعات بشكل عام كشف الذكاء الاصطناعي؟ هذا ليس ما يدعمه هذا المصدر. يوثّق قرار مؤسسة واحدة في 2023، مع سبب ذلك. هل تستخدم مؤسّستك هذا سؤال محلي له جواب محلي.

تابع القراءة