كوبي ليكس ضد تورنيتين: لماذا تختلف نتائج كشف الذكاء الاصطناعي؟
كثيرًا ما يرفع الطلاب ورقتهم البحثية إلى أكثر من أداة كشف ذكاء اصطناعي فيحصلون على درجات مختلفة تمامًا. قد يُظهر تورنيتين 20% بينما يُعطي كوبي ليكس 80%. السبب بسيط: نماذج مختلفة، بيانات تدريب مختلفة، وعتبات تصنيف مختلفة. وفهم أسباب هذا الاختلاف يساعدك على قراءة كل درجة ضمن سياقها.
فريق HumanPen
· مدة القراءة: 4 د
الإجابة المختصرة
تختلف درجات كشف الذكاء الاصطناعي من أداة لأخرى لأن كلًا منها نموذج مُدرَّب على بيانات مختلفة وبعتبات تصنيف خاصة به. كوبي ليكس وتورنيتين منتجان منفصلان طورتهما فريقي عمل مختلفان. لكل منهما نموذجه الخاص ومجموعة بيانات التدريب الخاصة به وطريقته في تجميع توقعات المقاطع النصية لإنتاج درجة الوثيقة كاملة. حين يقول كوبي ليكس 80% وتورنيتين 20% للنص نفسه، فلا يعني بالضرورة أن أحدهما مخطئ. كلاهما يقيس أنماطًا إحصائية مختلفة ويطبق حدود قرار مختلفة. الدرجة التي يجب أن تهتم بها حقًا هي تلك الصادرة عن الأداة التي تستخدمها مؤسستك فعليًا. فإذا كانت جامعتك تستخدم تورنيتين، فإن درجة كوبي ليكس مفيدة للاسترشاد لكنها ليست حاسمة.
كيف يعمل كاشف تورنيتين
يصف قسم الأسئلة الشائعة في تورنيتين آلية العمل كالتالي:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عند رفع ورقة إلى تورنيتين، تُستخرج الجمل وتُقسَّم إلى مقاطع متداخلة لتحليل التوقع. يُصنّف نموذج كشف الذكاء الاصطناعي كل مقطع ويعطيه قيمة بين 0 و1، تُعبّر عن احتمال أن يكون النص بشريًا أو مولَّدًا بالذكاء الاصطناعي. ترث كل جملة مؤهَّلة داخل هذه المقاطع درجة المقطع. ولأن المقاطع متداخلة، فقد يكون لبعض الجمل أكثر من درجة، تُجمَّع بعدها في درجة واحدة. ثم تُجمَّع درجات الجمل هذه وتُستخدم لحساب درجة الذكاء الاصطناعي الإجمالية للوثيقة.)
ويحدد تورنيتين أيضًا هدفًا محددًا لمعدل الإيجابيات الكاذبة: "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (نسعى إلى تعظيم فعالية كاشفنا مع إبقاء معدل الإيجابيات الكاذبة -أي تحديد نص كتبه بشر بالكامل خطأً على أنه مولَّد بالذكاء الاصطناعي- تحت 1% للوثائق التي تزيد نسبة الذكاء الاصطناعي فيها عن 20%). وهذا الهدف يؤثر في مدى حدة تصنيف النموذج للنصوص الحدية. فالنموذج المُضبَّط لتقليل الإيجابيات الكاذبة سيصنّف المزيد من المقاطع غير الواضحة على أنها بشرية، ما قد ينتج عنه درجات ذكاء اصطناعي أقل في النصوص المختلطة.
لماذا يختلف كوبي ليكس عن تورنيتين
يستخدم كوبي ليكس نموذج كشف ذكاء اصطناعي خاصًا به، ببيانات تدريب وعتبات تصنيف خاصة. تفاصيل نموذج كوبي ليكس غير معلنة للعامة بالطريقة التي نُشرت بها تفاصيل تورنيتين في قسم الأسئلة الشائعة، لذا لا يمكننا إجراء مقارنة تفصيلية بين آليتي العمل. لكن السبب الهيكلي للاختلاف واضح: نموذجان مختلفان مُدرَّبان على بيانات مختلفة سيصنّفان النص نفسه بشكل مختلف. جملة قد يصنّفها نموذج تورنيتين باحتمال 0.3 للذكاء الاصطناعي قد يعطيها نموذج كوبي ليكس 0.7. وعندما تتراكم هذه الاختلافات على مستوى المقاطع عبر الوثيقة كاملة، يمكن أن تتباعد النسب المئوية النهائية تباعدًا كبيرًا. مقال لماذا يعطي النصُ نفسه درجاتٍ مختلفة في كل كاشف يشرح هذه النقطة بتفصيل أعم.
هناك أيضًا اختلاف في العتبة. فتورنيتين لا يعرض درجات بين 1% و19%، بل يظهر نجمة () بدلًا من ذلك. ويوضح قسم الأسئلة الشائعة: "To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range." (تجنبًا لاحتمال وقوع إيجابيات كاذبة، لا تُعطى أي درجة أو تظليل لدرجات كشف الذكاء الاصطناعي في النطاق من 1% إلى 19%). فإذا أظهر كوبي ليكس درجة 15% للنص نفسه الذي يعرضه تورنيتين على شكل نجمة، فالفرق هنا يعود جزئيًا إلى قرار عرض، وليس فقط إلى اختلاف في التصنيف — راجع [ماذا تعني النجمة (%) في درجة ذكاء اصطناعي على تورنيتين](/blog/what-does-the-asterisk-mean-on-turnitin-ai-score).
المستندات القصيرة تُعظِّم الاختلاف
يلاحظ قسم الأسئلة الشائعة في تورنيتين أن المستندات القصيرة تنتج توقعات أقل موثوقية:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (في المستندات الأقصر التي لا تتجاوز بضع مئات من الكلمات، يكون التوقع في الغالب «إما الكل أو لا شيء» لأننا نتوقع على مقطع واحد دون فرصة للتداخل.)
الجملة التالية تقول: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (هذا يعني أن بعض النصوص الممزوجة بين محتوى مولَّد بالذكاء الاصطناعي ومحتوى أصلي قد تُعلَّم على أنها مولَّدة بالكامل بالذكاء الاصطناعي.)
في المستندات القصيرة، قد يصنّف أحد الكواشف النص كاملًا على أنه ذكاء اصطناعي (فيُعطيه 100%) بينما يصنّفه كاشف آخر على أنه بشري (فيُعطيه 0%). وسلوك «إما الكل أو لا شيء» هذا يعني أن فروقًا صغيرة في طريقة تعامل كل نموذج مع مقطع واحد قد تنتج فروقًا جذرية في الدرجة النهائية. فإذا كنت تقارن درجات بين كواشف مختلفة، فطول الوثيقة matters. ملخص من 300 كلمة قد يحصل على درجات متباينة بشدة من أدوات مختلفة، بينما ورقة من 3000 كلمة قد تظهر تقاربًا أكبر في الدرجات.
أي درجة تهمك حقًا
الدرجة التي تهمك هي تلك الصادرة عن الأداة التي تستخدمها مؤسستك. فإذا كانت جامعتك تستخدم تورنيتين، فإن درجة الذكاء الاصطناعي على تورنيتين هي التي تؤثر في وضعك الأكاديمي. درجة 5% على كوبي ليكس لن تنفعك إذا كانت درجتك على تورنيتين 80%. ودرجة 80% على كوبي ليكس لن تضرك إذا لم تكن مؤسستك تستخدم كوبي ليكس. فحص ورقتك عبر أكثر من كاشف قد يعطيك فكرة عامة عمّا إذا كان نصك يحمل أنماطًا شبيهة بالذكاء الاصطناعي، لكنه لا يخبرك عمّا سيقوله كاشف مؤسستك. الطريقة الوحيدة لمعرفة درجتك الفعلية هي رؤية التقرير الصادر عن الأداة التي تستخدمها مؤسستك، ولا يمكن سوى للمدرسين والإداريين رؤية مؤشر الذكاء الاصطناعي في تورنيتين. وما إذا كانت جامعتك تستخدم أي كاشف من الأساس يتوقف على ما اشتروه.
ما يعنيه هذا لك
ملخصًا لما سبق:
- تستخدم كواشف الذكاء الاصطناعي المختلفة نماذج مختلفة ببيانات تدريب وعتبات تصنيف مختلفة. الاختلاف متوقع، بل طبيعي.
- ينشر تورنيتين هدفَه لمعدل الإيجابيات الكاذبة (أقل من 1% للوثائق التي تزيد نسبة الذكاء الاصطناعي فيها عن 20%) وآليته (تصنيف المقاطع المتداخلة).
- يكبت تورنيتين الدرجات بين 1% و19% فيظهرها كنجوم، ما قد يُعظِّم الظاهر من الاختلاف مع أدوات أخرى.
- المستندات القصيرة تنتج توقعات من نوع «إما الكل أو لا شيء»، ما قد يسبب تباعدًا كبيرًا بين الكواشف.
- الدرجة التي تهمك حقًا هي الصادرة عن الأداة التي تستخدمها مؤسستك فعليًا.
إذا كان لديك تقرير Turnitin يوضح الفقرات المُعلَّمة، يمكنك رفع التقرير والعمل على تلك الفقرات تحديدًا. ويمكن إعادة تشغيل الفقرات المؤهَّلة دون رسوم إضافية.
تابع القراءة