كشف المحتوى المنتج بالذكاء الاصطناعي (AIGC) في الأوراق البحثية الإنجليزية: ما المقصود به وكيف يعمل
«كشف AIGC» هو المصطلح الذي يستخدمه كثير من الباحثين الصينيين حين يسألون عن كشف الكتابة بالذكاء الاصطناعي في الأوراق الإنجليزية. آلية الكشف واحدة مهما كان الاسم الذي تطلقه عليها. وتصف الأسئلة الشائعة لدى Turnitin مسار معالجة يصنف مقاطع النص المتداخلة بحسب احتمالية الكلمات. وفهم هذه الآلية يساعدك على قراءة تقريرك قراءة دقيقة.
فريق HumanPen
· مدة القراءة: 4 د
الجواب المختصر
يشير كشف AIGC في الأوراق الإنجليزية إلى العملية نفسها التي يجريها كشف الكتابة بالذكاء الاصطناعي. إذ يقسم كاشف Turnitin نصك إلى مقاطع متداخلة، ويصنف كل مقطع بحسب احتمال أن يكون من كتابة بشرية أو منتجا بالذكاء الاصطناعي، ثم يجمع تلك الدرجات في نسبة على مستوى المستند. ومصطلح «AIGC» (المحتوى المنتج بالذكاء الاصطناعي) شائع في الأوساط الأكاديمية الصينية، غير أن آلية الكشف واحدة بغض النظر عما تسميها به. ولا يبحث الكاشف عن بصمات أدوات ذكاء اصطناعي محددة أو علامات مائية. بل يقرأ أنماطا إحصائية في اختيار الكلمات، وتحديدا أنماط احتمالية الكلمات التي تعلمها أثناء التدريب. ودرجة الذكاء الاصطناعي مستقلة تماما عن درجة التشابه (الانتحال)، ولا يستطيع رؤية مؤشر الذكاء الاصطناعي سوى المدرسين أو الإداريين.
كيف يعمل كشف AIGC
تصف الأسئلة الشائعة لدى Turnitin مسار الكشف على النحو التالي:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عند إرسال ورقة بحثية إلى Turnitin، تُستخرج الجمل من المادة المقدمة وتُقسم إلى أقسام متداخلة لغرض التحليل التنبؤي. ويصنف نموذج كشف الذكاء الاصطناعي كل قسم ويمنحه قيمة بين 0 و1، تدل على احتمال أن يكون النص من كتابة بشرية أو منتجا بالذكاء الاصطناعي. وترث كل جملة مؤهلة داخل هذه الأقسام درجة القسم الذي تنتمي إليه. ولأن الأقسام متداخلة، قد تحمل بعض الجمل درجات متعددة، تجمع بعد ذلك في درجة واحدة. ثم تجمع درجات الجمل هذه مرة أخرى وتستخدم في حساب درجة الكتابة بالذكاء الاصطناعي للمستند ككل.)
لا يبحث الكاشف عن عبارات محددة «تبدو كأنها من صنع الذكاء الاصطناعي». بل هو يصنف مقاطع النص باستخدام نموذج تعلم أنماطا إحصائية من بيانات التدريب. يحصل كل مقطع على احتمال، وتجمع هذه الاحتمالات وتحسب لتصبح نسبة واحدة. وتمثل هذه النسبة مقدار النص المؤهل الذي يصنفه النموذج على أنه منتج على الأرجح بالذكاء الاصطناعي.
ما الذي يقرأه النموذج
عبارتان وردتا في الأسئلة الشائعة توضحان نهج النموذج. الأولى: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (لم تتم برمجة نموذجنا بشكل صريح لتقييم إشارات محددة مثل «التفجر» أو «الغموض» أو غيرها من المقاييس الفردية التي يشار إليها أحيانا في النقاشات العامة.) وتقول الجملة التالية: "Instead, it learns statistical patterns from our training data." (بدلا من ذلك، يتعلم أنماطا إحصائية من بيانات تدريبنا.) والثانية: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (دُربت مصنفاتنا على اكتشاف هذه الفروق في احتمالية الكلمات، وهي بارعة في متواليات احتمالية الكلمات التي تميز الكتاب من البشر.)
لا يحسب النموذج مقاييس مسمّاة مثل التفجر أو الغموض. لكنه مدرب على بيانات احتمالية الكلمات. والأنماط التي يتعلمها تتجلى في كيفية اختيار الكلمات وترتيبها، لا في سمات سطحية مثل تفاوت طول الجمل أو تنوع المفردات. ولهذا السبب قد لا تغير التعديلات السطحية، كتبديل بضع كلمات أو إضافة عبارات رابطة، الدرجة. فالكاشف يقرأ سمات إحصائية أعمق في متواليات الكلمات، وهو موضوع ما تقيسه كاشفات الذكاء الاصطناعي إلى جانب الغموض والتفجر.
النثر وحده هو ما يحلل
تحدد الأسئلة الشائعة ما يعد نصا قابلا للتحليل:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (لا يضم هذا النص المؤهل سوى الجمل النثرية، أي أننا لا نحلل سوى كتل النص المكتوبة بجمل نحوية سليمة، ولا تشمل أنواعا أخرى من الكتابة مثل القوائم أو النقاط المرقّمة (وهي تراكيب قصيرة غير جملية) أو غيرها من التراكيب غير الجملية.)
وتقول الجملة التالية: "This percentage is not necessarily the percentage of the entire submission." (ليست هذه النسبة بالضرورة نسبة المادة المقدمة بأكملها.)
بالنسبة للأوراق الأكاديمية الإنجليزية، يعني هذا أن جداول المنهجية ومربعات المعادلات وتعليقات الأشكال وقائمة المراجع مستبعدة إلى حد كبير من تحليل الذكاء الاصطناعي. وتنطبق النسبة على الأجزاء النثرية من مخطوطتك فحسب. والورقة التي تكثر فيها الجداول والمعادلات يكون نصها المؤهل أقل، ما يعني أن نسبة الذكاء الاصطناعي تمثل جزءا أصغر من المستند مما قد يبدو. وتتناول كيفية قراءة تقرير الكتابة بالذكاء الاصطناعي من Turnitin موضع ظهور هذه الفجوة على الصفحة.
درجة AIGC في مقابل درجة التشابه
الدرجتان قياسان منفصلان:
"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (درجة التشابه ونسبة كشف الكتابة بالذكاء الاصطناعي مستقلتان تماما ولا تؤثر إحداهما في الأخرى.)
تعكس درجة التشابه مقدار ما يطابقه نصك من مصادر موجودة في قاعدة البيانات. وتعكس درجة AIGC مقدار ما يصنفه النموذج من نصك على أنه منتج على الأرجح بالذكاء الاصطناعي. فقد تكون لورقة ما درجة تشابه مرتفعة (بسبب مصادر موثقة توثيقا صحيحا) ودرجة AIGC منخفضة، أو درجة تشابه منخفضة ودرجة AIGC مرتفعة. والعمل على إحدى الدرجتين لا يؤثر في الأخرى. فإذا كنت تحاول خفض درجة AIGC، فلن يفيدك خفض درجة التشابه، والعكس صحيح؛ إذ إن الخطأ يبدأ عادة من قراءة الدرجتين على أنهما شيء واحد.
ما تفعله إذا كانت درجة AIGC مرتفعة
تلخيصا لما تناولناه:
- يعمل كشف AIGC في الأوراق الإنجليزية بالطريقة نفسها التي يعمل بها كشف الكتابة بالذكاء الاصطناعي: تصنيف أنماط احتمالية الكلمات في مقاطع النثر.
- لا يحسب النموذج التفجر أو الغموض بوصفهما مقياسين مسميين، لكنه مدرب على بيانات احتمالية الكلمات.
- لا تحلل سوى الجمل النثرية. أما الجداول والمعادلات وقوائم المراجع فمستبعدة إلى حد كبير.
- درجة AIGC ودرجة التشابه مستقلتان تماما. تغيير إحداهما لا يؤثر في الأخرى.
- لا يرى مؤشر الذكاء الاصطناعي سوى المدرسين والإداريين. ويمكن للطلاب طلب النسخة بصيغة PDF من مدرسهم.
إذا كان لديك تقرير من Turnitin أو iThenticate يوضح المقاطع التي تم تحديدها، فاستورد التقرير واعمل على تلك المقاطع بعينها. ويمكن إعادة تشغيل المقاطع المؤهلة دون أي تكلفة.
تابع القراءة