المراجعات المنهجية وكشف الذكاء الاصطناعي: لماذا تُعلّم أقسام المنهجية
المراجعات المنهجية تتبع قوالب منهجية صارمة. قسم المنهجية يكرر نفس الأفعال وتراكيب الجمل عبر الدراسات، وهذا يتطابق مع أنماط الإيجابيات الكاذبة التي تصفها Turnitin. الكاشف لا يقيس burstiness أو perplexity. إنه مصنّف لاحتمالية الكلمات. إليك ما تقوله الوثائق حول كيفية إنتاج النتيجة وكيفية تفسيرها.
فريق HumanPen
· مدة القراءة: 6 د
لماذا تطابق أقسام المنهجية أنماط الإيجابيات الكاذبة
المراجعات المنهجية تتطلب قسماً منهجياً موحداً. تصف قواعد البيانات التي بُحث فيها وسلاسل البحث ومعايير الإدراج والاستبعاد وعملية الفحص. اللغة بالضرورة متكررة لأن قائمة PRISMA تتطلب عناصر إبلاغ محددة. وثائق Turnitin تصف أنواع النصوص التي تنتج إيجابيات كاذبة:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (أحياناً الإيجابيات الكاذبة -أي تعليم النص البشري على أنه مولّد بالذكاء الاصطناعي بشكل خاطئ- قد تتضمن محتوى بدون تنوع هيكلي كبير، أو نصاً يكرر نفسه حرفياً، أو نصاً أُعيدت صياغته دون تطوير أفكار جديدة)
الجملة التالية: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (إذا أظهر مؤشرنا كمية أكبر من الكتابة بالذكاء الاصطناعي في مثل هذا النص، ننصحك بأخذ ذلك في الاعتبار عند النظر إلى النسبة الموضحة)
قسم المنهجية يستوفي المعايير الثلاثة، ولهذا سبب شيوع شكوى قسم المنهجية كله أُعلّم من قبل Turnitin. التنوع الهيكلي منخفض لأن كل مراجعة منهجية تبلغ عن نفس الخطوات. الصياغة متكررة ("بحثنا"، "حددنا"، "فحصنا"). النص مُعاد صياغته من أوصاف البروتوكولات دون تطوير أفكار جديدة. الوثائق تقول خذ النسبة في الاعتبار عندما يطابق النص هذه الأنماط، لا أن تقبلها كحقيقة قاطعة.
كيف يحسب الكاشف النتيجة
خطوة الكشف تقسم النص المؤهل إلى مقاطع وتُسجّل كل واحد:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عندما تُقدّم ورقة إلى Turnitin، تُستخرَج الجُمل من المُقدَّم وتُقسَّم إلى أقسام متداخلة لتحليل التوقع. كل مقطع يُصنَّف بواسطة نموذج كشف الذكاء الاصطناعي ويُعطى قيمة بين 0 و1، تدل على احتمال كون النص بشرياً أو مولّداً بالذكاء الاصطناعي. كل جملة مؤهلة ضمن هذه المقاطع ترث درجة المقطع. نظراً لأن المقاطع تتداخل، قد يكون لبعض الجُمل درجات متعددة، تُجمَّع بعد ذلك في درجة واحدة. درجات الجُمل هذه تُجمَّع أكثر وتُستخدم لحساب درجة كتابة الذكاء الاصطناعي العامة للمستند)
في المراجعة المنهجية، الأنماط المتكررة في قسم المنهجية قد تنتج درجات مقاطع عالية عبر مقاطع متداخلة متعددة. هذه الدرجات تتجمع في نسبة عالية على مستوى المستند. قسم منهجية من 800 كلمة قد يرفع درجة مراجعة كاملة من 5000 كلمة. إذا انتهيت إلى مراجعته، ما يمكنك إعادة صياغته وما يجب أن يبقى كما هو يحدد الأسطر التي لا يمكنك تحريكها.
ماذا يقيس الكاشف فعلياً
الكاشف لا يقيّم burstiness أو perplexity أو مقاييس أخرى مسماة، ادعاء فُحص في هل تستخدم Turnitin perplexity وburstiness لكشف الذكاء الاصطناعي:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (نموذجنا ليس مبرمجاً صراحةً لتقييم إشارات محددة مثل 'burstiness' أو 'perplexity' أو مقاييس فردية أخرى يُشار إليها أحياناً في النقاشات العامة)
الجملة التالية: "Instead, it learns statistical patterns from our training data." (بدلاً من ذلك، يتعلم أنماطاً إحصائية من بيانات التدريب الخاصة بنا)
المصدر نفسه يشرح ما يفعله النموذج فعلياً:
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (مصنّفاتنا مُدرَّبة على كشف هذه الفروقات في احتمال الكلمات وماهرة في سلاسل احتمال الكلمات الخاصة بالكتّاب البشر)
الكاشف يقيّم سلاسل احتمال الكلمات. يتحقق مما إذا كانت الكلمات في مقطع تطابق الأنماط المتعلمة من الكتابة البشرية أو من النص المولّد بالذكاء الاصطناعي. في قسم المنهجية، سلسلة الكلمات مدفوعة بقالب الإبلاغ. عبارات مثل "بحثنا في قواعد البيانات التالية" و"شُملت الدراسات إذا" تظهر عبر آلاف الأوراق. هذه السلاسل قد تتوافق بشكل أقرب مع الأنماط الإحصائية من بيانات التدريب منها مع خيارات كلمات كاتب فردي. هذا التوافق قد ينتج درجة احتمال عالية دون تورط الذكاء الاصطناعي.
ما الذي يُعتبر نصاً مُحلّلاً
الكاشف يعالج فقط النص المؤهل:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (هذا النص المؤهل يتضمن فقط جمل نثرية، ما يعني أننا نحلل فقط كتل النص المكتوبة في جمل نحوية قياسية ولا تتضمن أنواع كتابة أخرى مثل القوائم أو النقاط (تراكيب قصيرة غير جملية) أو تراكيب غير جملية أخرى)
الجملة التالية: "This percentage is not necessarily the percentage of the entire submission." (هذه النسبة ليست بالضرورة نسبة المُقدَّم كاملاً)
المراجعات المنهجية تحتوي على جداول (مخططات تدفق PRISMA، جداول الاستخراج) وقوائم مهيكلة (معايير الإدراج والاستبعاد). هذه ليست نثراً مؤهلاً. النسبة تغطي فقط الجمل النثرية. إذا كان قسم النتائج لديك في معظمه جداول، النسبة تُوزَّن نحو الأقسام الغنية بالنثر مثل المنهجية. الوثائق تلاحظ أيضاً:
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (النموذج لا يكتشف بشكل موثوق النص المولّد بالذكاء الاصطناعي في شكل غير نثري، أو كود، ولا يكتشف الكتابة قصيرة الشكل/غير التقليدية مثل النقاط (تراكيب قصيرة غير جملية))
الجملة التالية: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (هذا يعني أن مستنداً يحتوي على عدة أنواع كتابة مختلفة سينتج عنه تفاوت بين النسبة والتحديدات)
المراجعة المنهجية مستند متعدد التنسيقات. التفاوت بين النسبة والتحديدات سلوك متوقّع.
المقاطع القصيرة
أقسام المنهجية أحياناً تُقسَّم إلى أقسام فرعية قصيرة. قسم استراتيجية البحث قد يكون 200 كلمة فقط. الوثائق تحذر:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (في المستندات الأقصر التي تحتوي على بضع مئات من الكلمات فقط، التوقع سيكون في الغالب 'الكل أو لا شيء' لأننا نتوقع على مقطع واحد بدون فرصة للتداخل)
الجملة التالية: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (هذا يعني أن بعض النص الذي هو مزيج من محتوى مولّد بالذكاء الاصطناعي وأصلي قد يُعلَّم على أنه مولّد بالذكاء الاصطناعي بالكامل)
لقسم فرعي قصير، الكاشف قد يتوقع على مقطع واحد بدون تداخل لتخفيف الدرجة. قسم فرعي مكتوب بشرياً لكنه يتبع قالباً قد يتلقى درجة عالية من نوع الكل أو لا شيء.
تحسين الحدود لدى Turnitin
في 2023، Turnitin عالجت أيضاً الإيجابيات الكاذبة عند حدود المستند:
"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (منذ الإطلاق، لاحظنا حدوثاً أعلى لكشف الإيجابيات الكاذبة في الجمل القليلة الأولى أو الأخيرة من مستند. كثير من المرات هذه الجمل تتكون من محتوى مقدمة أو خاتمة مكتوب بطريقة عامة. نتيجة لذلك، غيّرنا منطق الكشف للمساعدة في تقليل هذه الإيجابيات الكاذبة)
الجملة التالية: "We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (عملنا أيضاً على جعل كشف حدود مقاطعنا أكثر دقة مما قد يؤدي في بعض الحالات النادرة إلى تغيير الحدود مقارنة بنسخة سابقة)
كان هذا تحسيناً في 2023. مقدمات وخواتيم المراجعات المنهجية تتبع قوالب (خلفية، فجوة، هدف، ملخص النتائج). تغيير المنطق عالَج هذا النمط.
لا تعامل النتيجة كدليل وحيد
وثائق Turnitin صريحة حول الحدود:
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (نموذج كشف كتابة الذكاء الاصطناعي الخاص بنا قد لا يكون دقيقاً دائماً (قد يخطئ في تحديد النص البشري أو المولّد بالذكاء الاصطناعي أو المُعاد صياغته بالذكاء الاصطناعي)، لذا لا ينبغي استخدامه كأساس وحيد لإجراءات سلبية ضد طالب)
الجملة التالية: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (يتطلب الأمر تدقيقاً إضافياً وحكماً بشرياً بالاقتران مع تطبيق المنظمة لسياساتها الأكاديمية المحددة لتحديد ما إذا حدث سوء سلوك أكاديمي)
مراجعة منهجية بنتيجة ذكاء اصطناعي عالية على قسم المنهجية ليست إثباتاً لسوء سلوك. قسم المنهجية يطابق أنماط الإيجابيات الكاذبة. الكاشف مصنّف لاحتمالية الكلمات. النتيجة تتطلب حكماً بشرياً وسياسة مؤسسية. ما يُقَال لمُدرِّبك أن يفعله عندما تكون نسبة الذكاء الاصطناعي عالية هو التوجيه الذي يعمل به المقيّم.
ماذا يعني هذا لك
خلاصة:
- أقسام المنهجية تطابق أنماط الإيجابيات الكاذبة: تنوع هيكلي منخفض، صياغة متكررة، ونص مُعاد صياغته دون أفكار جديدة.
- الكاشف مصنّف لاحتمالية الكلمات، وليس مقيّماً لـ burstiness أو perplexity.
- فقط النثر المؤهل يُحلّل. الجداول والقوائم والنقاط مستبعدة.
- الأقسام المنهجية القصيرة تواجه مشكلة تسجيل الكل أو لا شيء.
- في 2023، حسّنت Turnitin منطق الكشف لتقليل الإيجابيات الكاذبة عند حدود المستند.
- النتيجة لا ينبغي استخدامها كأساس وحيد للإجراءات السلبية. تتطلب حكماً بشرياً.
إذا استلمت تقرير ذكاء اصطناعي من Turnitin على مراجعة منهجية وترغب في معالجة الفقرات المُعلّمة، استورد التقرير واعمل عليها. الفقرات المؤهلة يمكن إعادة تشغيلها بدون رسوم.
تابع القراءة