هل يكشف Turnitin نصوص LLaMA؟ ماذا تقول قائمة النماذج بالفعل
يظهر LLaMA ضمن قائمة النماذج التي تنشر Turnitin أنها قادرة على كشفها. في هذا المقال نقرأ ما تقوله القائمة فعلًا، ونشرح كيف تعمل آلية الكشف، ولماذا يفلت جزء من النصوص المولّدة بالذكاء الاصطناعي من الرصد، وما الخطوة التالية إذا عاد تقريرك وفيه فقرات مُعلَّمة.
فريق HumanPen
· مدة القراءة: 5 د
الجواب المختصر
نعم. ورد اسم LLaMA صراحةً في قائمة النماذج التي تنشرها Turnitin. وتقول القائمة إن نموذج Turnitin لكشف الكتابة بالذكاء الاصطناعي في الأعمال المقدَّمة بالإنجليزية قادر على كشف محتوى صادر عن مجموعة من النماذج تضم LLaMA إلى جانب GPT وGemini وClaude وMistral وDeepSeek وNova وGrok وo1-mini. وتشمل القائمة أيضًا "tools based on these LLMs as well," (الأدوات المبنية على هذه النماذج اللغوية أيضًا)، أي أن التطبيقات والخدمات المبنية فوق نماذج LLaMA اللغوية تدخل ضمن نطاق الكشف المذكور.
LLaMA عائلة نماذج مفتوحة المصدر، وهذا يضيف شيئًا من التعقيد. فثمة نسخ كثيرة أُعيد ضبطها ومشتقات عديدة بنتها جهات مختلفة فوق نماذج LLaMA الأساسية. وعبارة "tools based on these LLMs" (الأدوات المبنية على هذه النماذج اللغوية) الواردة في صياغة Turnitin وُضعت خصيصًا لتغطية هذه الحالات؛ والتعقيد نفسه المتعلق بالأوزان المفتوحة يظهر في هل يكشف Turnitin نصوص Mistral. أما ما إذا كان كل نسخة مُعاد ضبطها تُكتشف بالدقة نفسها، فهذا سؤال آخر لا تجيب عنه القائمة نفسها.
ماذا تقول القائمة فعلًا
لا تنشر Turnitin جدولًا بالطرز مع نتائج كشف من قبيل ناجح أو فاشل، بل تورد داخل وثائقها قائمة سطرية تفصل بين عناصرها فواصل. ونص الجملة التمهيدية هو: "Currently, Turnitin's AI writing detection model for English submissions can detect content from" (نموذج Turnitin الحالي لكشف الكتابة بالذكاء الاصطناعي في الأعمال المقدَّمة بالإنجليزية قادر على كشف محتوى صادر عن) قائمة تضم LLaMA إلى جانب نماذج لغوية كبرى أخرى. ويقع Claude وGemini في السطر نفسه، ويتناول هل يكشف Turnitin نصوص Claude أم Copilot أم Gemini النصف المغلق الأوزان من القائمة. وتختم القائمة بالقول إن التغطية تمتد إلى "tools based on these LLMs as well." (الأدوات المبنية على هذه النماذج اللغوية أيضًا).
العبارة المفتاحية هنا هي "can detect content from." (قادر على كشف محتوى صادر عن). هذه الصياغة تخبرنا أن الكاشف مُدرَّب على تمييز النصوص التي تولّدها هذه النماذج، وهي لا تَعِد بكشف كامل. والجملة التي تلي القائمة مباشرة لا تقل أهمية: "We will continue to expand our detection capabilities to other models in the future." (سنواصل توسيع قدراتنا على الكشف لتشمل نماذج أخرى في المستقبل).
بالنسبة إلى LLaMA تحديدًا، فإن كون هذه العائلة من النماذج مفتوحة المصدر يعني وجود أدوات كثيرة مبنية عليها ونسخ أُعيد ضبطها. وعبارة "tools based on these LLMs" (الأدوات المبنية على هذه النماذج اللغوية) وُضعت لتغطية هذه المشتقات، فتدخلها في نطاق الكشف المذكور. غير أن حساسية هذه التغطية قد تتفاوت، وسنتناول ذلك في الأقسام التالية.
كيف تعمل آلية الكشف
لكي تفهم لماذا لا يكون الكشف إجابة قاطعة بنعم أو لا، من المفيد أن تنظر في الآلية كما تصفها Turnitin. عند إرسال البحث، تُستخرج الجمل وتُقسَّم إلى مقاطع متداخلة لتحليل التوقّعات. ثم يُصنِّف نموذج كشف الذكاء الاصطناعي كل مقطع ويمنحه قيمة بين 0 و1، تمثّل احتمال أن يكون النص بشريًا أو مولّدًا بالذكاء الاصطناعي. وترث كل جملة مستوفية للشروط داخل هذه المقاطع درجة المقطع الذي تقع فيه. ولأن المقاطع تتداخل، قد تحمل بعض الجمل أكثر من درجة، ثم تُجمَّع هذه الدرجات في درجة واحدة. ثم تُجمَّع درجات الجمل بدورها وتُستخدم لحساب درجة الكتابة بالذكاء الاصطناعي للوثيقة ككل.
أي أن النسبة المئوية النهائية في تقريرك هي حصيلة عدد كبير من توقّعات صغيرة على مستوى الجملة. فالأمر ليس فحصًا واحدًا يختم الوثيقة كلها بوصفها مولّدة بالذكاء الاصطناعي أو مكتوبة بيد بشرية. كل جملة تسهم في النتيجة، وتساعد المقاطع المتداخلة على تخفيف حدّة الحالات الواقعة على الحد الفاصل.
قدرات الكشف تتغير مع الوقت
نموذج Turnitin ليس ثابتًا لا يتحرك. فبحسب الوثائق: "As we iterate and develop our model further to better detect newer LLMs, it is likely that our detection capabilities will also change, affecting the AI percentage.. However, for a submitted document, the AI percentage will change only if it's re-submitted again to be processed." (مع مواصلتنا تحسين نموذجنا وتطويره لرصد النماذج اللغوية الأحدث على نحو أفضل، من المرجّح أن تتغير قدراتنا على الكشف هي الأخرى، بما يؤثر في نسبة الذكاء الاصطناعي.. ومع ذلك، فإن نسبة الذكاء الاصطناعي في أي وثيقة مُرسَلة لن تتغير إلا إذا أُعيد إرسالها مرة أخرى لتُعالَج).
ولذلك تبعات عملية. إذا أرسلت وثيقة اليوم وحصلت على نسبة معينة للذكاء الاصطناعي، فقد تحصل الوثيقة نفسها على نسبة مختلفة لو أُعيد إرسالها بعد أسابيع أو أشهر. فالنموذج يُحدَّث، وهذه التحديثات قد تُحرّك النتائج في أي من الاتجاهين: فقرة تقرأ بوصفها بشرية اليوم قد تُقرأ بوصفها مولّدة بالذكاء الاصطناعي بعد تحديث، والعكس صحيح.
أما بالنسبة إلى نصوص LLaMA، فيعني هذا أن معدل الكشف الذي تلاحظه الآن قد لا يطابق ما ستلاحظه لاحقًا. تؤكد القائمة أن LLaMA داخل النطاق، غير أن حساسية هذا الكشف قد تتفاوت مع مواصلة Turnitin تحسين نموذجها.
لماذا يفلت بعض النصوص المولّدة بالذكاء الاصطناعي (وما الذي يحرّك الكشف)
تقول Turnitin صراحةً إن كاشفها لا يمسك بكل شيء. وجاء في الوثائق: "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (للحفاظ على معدل الإيجابيات الخاطئة عند هذا المستوى المنخفض البالغ 1%، ثمة احتمال أن نفوت بعض النصوص المكتوبة بالذكاء الاصطناعي في الوثيقة. ونحن مرتاحون لذلك، لأننا لا نريد أن نُعلّم نصًا كتبه بشر على أنه مكتوب بالذكاء الاصطناعي عن طريق الخطأ. فمثلًا، إذا تبين لنا أن 50% من الوثيقة مكتوبة على الأرجح بأداة ذكاء اصطناعي، فقد تحتوي في الواقع على ما يصل إلى 65% من الكتابة بالذكاء الاصطناعي).
هذه مقايضة مقصودة. فإن Turnitin تُعطي الأولوية لانخفاض معدل الإيجابيات الخاطئة، أي أنها تقبل مسبقًا أن يفلت جزء من النصوص المولّدة بالذكاء الاصطناعي. الوثيقة التي تظهر فيها نسبة 50% للذكاء الاصطناعي قد تحتوي في الحقيقة على ما يصل إلى 65% من محتوى الذكاء الاصطناعي. والكاشف يميل إلى جانب الحذر: لأن يفوته نص مولّد بالذكاء الاصطناعي أهون عنده من أن يُعلّم نصًا بشريًا خطأً.
ولتفهم سبب عمل الكاشف على هذا النحو، عليك أن تنظر في ما يقيسه بالفعل. فنموذج Turnitin لا يعتمد على المقاييس التي يتداولها الناس في النقاشات العامة حول كشف الذكاء الاصطناعي، وهو موضوع هل يستخدم Turnitin الحيرة والتفاوت للكشف عن الذكاء الاصطناعي برمته. وجاء في الوثائق: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. Instead, it learns statistical patterns from our training data." (نموذجنا ليس مبرمجًا صراحةً لتقييم إشارات محددة مثل التفاوت أو الحيرة أو غيرهما من المقاييس الفردية التي يُشار إليها أحيانًا في النقاشات العامة؛ بل إنه يتعلم أنماطًا إحصائية من بيانات تدريبنا). ثم يطبّق النموذج ما تعلّمه لتصنيف النص. وكما تعبّر Turnitin عن ذلك: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (مصنّفاتنا مُدرَّبة على رصد هذه الفروق في احتمالية الكلمات، وهي بارعة في تمييز متتاليات احتمالية الكلمات التي تطبع كتابة البشر).
بعبار أخرى، ينظر الكاشف إلى أنماط احتمالية الكلمات، لا إلى إشارات سطحية من قبيل تفاوت أطوال الجمل أو ندرة المفردات. لهذا قد يفلت النص المولّد بالذكاء الاصطناعي من الكشف أحيانًا بعد تحرير كثيف أو إعادة صياغة، ولهذا يدور هل يكشف Turnitin أدوات تحويل النصوص إلى نصوص بشرية على مدى عمق إعادة الصياغة. فإذا تحركت متتاليات احتمالية الكلمات بالقدر الكافي أثناء التحرير، فقد يتوقف المصنِّف عن تمييز النص بوصفه مولّدًا بالذكاء الاصطناعي. وبالنسبة إلى نسخ LLaMA، يعني هذا أن الكاشف ينظر إلى الأنماط الإحصائية في النص نفسه، لا إلى النسخة المحددة التي أنتجته.
ما العمل إذا عُلِّم تقريرك
إذا علّم تقرير Turnitin فقرات بوصفها مولّدة بالذكاء الاصطناعي، فأنفع خطوة هي معالجة المقاطع المُعلَّمة وحدها بدلًا من إعادة كتابة الوثيقة كلها، وهو المنهج المتبع في إعادة صياغة الفقرات التي علّمها تقرير Turnitin دون غيرها. ولأن تقييم Turnitin يجري على مستوى الجملة، يمكنك تحديد المقاطع المحددة التي أثارت الكشف وتركيز مراجعتك عليها.
حافظ على مراجعك وجداولك وتنسيقك سليمة كما هي. الفقرات التي عُلِّمت بوصفها مولّدة بالذكاء الاصطناعي وحدها هي ما يحتاج إلى عمل. وإذا عدّلت عملك وأعدت إرساله، فتذكّر أن نسبة الذكاء الاصطناعي قد تتغير بفعل تحديثات النموذج، لا بفعل تعديلاتك أنت وحدها.
الفقرات المستوفية للشروط يمكن إعادة تشغيلها دون أي مقابل.
تابع القراءة
العروض التقديمية الملصقة واكتشاف الذكاء الاصطناعي: لماذا تصبح الدرجات غير موثوقة
مدة القراءة: 5 د
أدوات كشف الذكاء الاصطناعيالمراجعات المنهجية وكشف الذكاء الاصطناعي: لماذا تُعلّم أقسام المنهجية
مدة القراءة: 6 د
تقارير الكشفهل يكشف Turnitin عن نصوص DeepSeek؟ ماذا تقول قائمة النماذج
مدة القراءة: 5 د