لماذا يُصنَّف الإبداع الأدبي خطأً على أنه مكتوب بالذكاء الاصطناعي من قبل Turnitin

يلاحظ طلاب مقررات الكتابة الإبداعية أحياناً درجات عالية للذكاء الاصطناعي على أعمال كتبوها بأنفسهم بالكامل. توضح وثائق Turnitin أن النموذج يحلل فقط جمل النثر المستوفية للشروط، وتذكر إحدى مقالات المساعدة أن الشعر والنصوص المسرحية من أنواع النصوص التي لا يكتشفها بدقة. كما تميل الوثائق القصيرة إلى إعطاء نتائج either百分之百 أو صفر. إليك ما تقوله الوثائق فعلياً.

فريق HumanPen

· مدة القراءة: 4 د

الإجابة المختصرة

قد يُظهِر نظام كشف الذكاء الاصطناعي من Turnitin نتائج إيجابية خاطئة للكتابة الإبداعية لعدة أسباب موثّقة من Turnitin نفسها. يحلل النموذج ما يسميه "النصوص المستوفية للشروط"، وهي تقتصر على جمل النثر المكتوبة بصيغ نحوية قياسية. تقول إحدى مقالات Turnitin المساعدة إن النموذج "does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code" (لا يكتشف بدقة النصوص المولدة بالذكاء الاصطناعي في أشكال غير النثر، مثل الشعر أو النصوص المسرحية أو الأكواد). تواجه القطع الإبداعية القصيرة مشكلة إضافية: تذكر الأسئلة الشائعة أن الوثائق المكونة من بضع مئات من الكلمات تكون نتيجتها "the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap" (التوقع سيكون غالباً 'الكل أو لا شيء' لأننا نتوقع على مقطع واحد دون فرصة للتداخل). كما تسرد الأسئلة الشائعة خصائص تؤدي إلى نتائج إيجابية خاطئة، منها "content without a lot of structural variation" (المحتوى دون الكثير من التباين الهيكلي) و"text that literally repeats itself" (النص الذي يكرر نفسه حرفياً). قد تتطابق الكتابة الإبداعية التي تستخدم حوافز متكررة أو تراكيب جمل موحدة مع هذا الملف الشخصي حتى لو كانت مكتوبة بالكامل بواسطة البشر.

ما الذي يحتسبه Turnitin في النسبة المئوية

تحدد الأسئلة الشائعة ما يفحصه النموذج:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (هذا النص التأهيلي يتضمن فقط جملًا نثرية، مما يعني أننا نحلل فقط كتل النص المكتوبة في جمل نحوية قياسية ولا تتضمن أنواعًا أخرى من الكتابة مثل القوائم أو النقاط النقطية (هياكل قصيرة غير جمل) أو الهياكل الأخرى غير الجمل.)

تليها الجملة التالية: "هذه النسبة ليست بالضرورة نسبة الإرسال بأكمله."

تقدم إحدى مقالات Turnitin المساعدة قائمة أوسع بأنواع النصوص التي لا يكتشفها النموذج بدقة:

"The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies." (لا يكتشف النموذج بشكل موثوق النصوص التي أنشأها الذكاء الاصطناعي في شكل غير نثري، مثل الشعر أو النصوص أو الكود، ولا يكتشف الكتابة القصيرة/غير التقليدية مثل النقاط النقطية أو الجداول أو الببليوغرافيات المشروحة.)

هذا حد لمحتوى النص وليس لصيغة الملف. تقبل متطلبات الملفات الحالية من Turnitin ملفات .docx و.pdf و.txt و.rtf، لكن الملف المقبول قد يخلط بين النثر الطويل المستوفي للشروط وبين الشعر أو الحوار بأسلوب النصوص المسرحية أو التراكيب غير التقليدية. تقول مقالة مساعدة إن هذه الأشكال الإبداعية لا تُكتشف بدقة، لكنها لا تقول إن كل قسم من هذا النوع يُستبعد دائماً. تقول الأسئلة الشائعة إن النص الذي لا يُعتبر نثراً طويلاً غير مشمول، لذا قد لا تمثل النسبة المئوية الإرسال بأكمله.

لماذا تحصل القطع القصيرة على نتائج 'الكل أو لا شيء'

غالباً ما تكون قطع الكتابة الإبداعية قصيرة. قطعة خيالية قصيرة من 500 كلمة تقع في نطاق "بضع مئات من الكلمات" المذكور في الأسئلة الشائعة. تقول:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (في المستندات الأقصر التي تحتوي بضع مئات من الكلمات فقط، سيكون التنبؤ في الغالب 'كل شيء أو لا شيء' لأننا نتنبأ بناءً على مقطع واحد دون فرصة للتداخل.)

تليها الجملة التالية: "هذا يعني أن بعض النصوص التي تمزج بين المحتوى المولد بالذكاء الاصطناعي والمحتوى الأصلي قد تُعلَّم على أنها مولدة بالكامل بالذكاء الاصطناعي."

ترسم متطلبات الملفات الحالية من Turnitin حداً منفصلاً: لإنشاء تقرير كتابة بالذكاء الاصطناعي ونسبة مئوية، يجب أن يحتوي الإرسال على 300 كلمة على الأقل من نص النثر في تنسيق كتابة طويل.

دون هذا الحد الأدنى، لا يستوفي الإرسال المتطلبات المنشورة لتقرير الذكاء الاصطناعي أو النسبة المئوية. بمجرد أن تحتوي قطعة مستوفية على بضع مئات من الكلمات فقط، تقول الأسئلة الشائعة الحالية إن التوقع يكون غالباً كلياً أو معدوماً، وقد يُعلَّم النص الممزج بين محتوى الذكاء الاصطناعي والمحتوى الأصلي على أنه مولد بالكامل بالذكاء الاصطناعي. يوضح مقال لماذا يقول Turnitin إن عملك 100% ذكاء اصطناعي هذا التقلب مقطعاً بمقطع.

خصائص الإيجابيات الكاذبة في الكتابة الإبداعية

تسرد الأسئلة الشائعة خصائص النصوص التي تميل إلى إنتاج نتائج إيجابية خاطئة:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (في بعض الأحيان تشمل الإيجابيات الكاذبة (التعليم غير الصحيح للنص المكتوب بشريًا على أنه مولّد بالذكاء الاصطناعي) محتوى بدون الكثير من التباين الهيكلي أو نصًا يكرر نفسه حرفيًا أو نصًا تمت إعادة صياغته دون تطوير أفكار جديدة.)

تليها الجملة التالية: "إذا أظهر مؤشرنا كمية أكبر من كتابة الذكاء الاصطناعي في مثل هذا النص، ننصحك بأخذ ذلك في الاعتبار عند النظر إلى النسبة المئوية المُشار إليها."

تتداخل عدة من هذه الخصائص مع تقنيات الكتابة الإبداعية الشائعة. قد تتطابق القطعة التي تستخدم التكرار المتعمد كجهاز أسلوب مع "النص الذي يكرر نفسه حرفياً". وقد تتطابق القطعة ذات الصوت السردي الموحد والإيقاع المنتظم للجمل مع "المحتوى دون الكثير من التباين الهيكلي". النصيحة الرسمية هي أخذ النسبة المئوية "في الاعتبار" بدلاً من اعتبارها نهائية. تُقرَأ العادات الأسلوبية الفردية بالطريقة نفسها، وهذا هو السؤال وراء مقال هل علامة التعجب الطويلة من سمات الذكاء الاصطناعي.

كيف يعمل النموذج على نصك

يعالج النموذج الكشف نصك بتقسيمه إلى مقاطع متداخلة وإعطاء كل منها درجة احتمالية:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (عند إرسال ورقة إلى Turnitin، يتم استخراج الجمل من الإرسال وتقسيمها إلى أقسام متداخلة لتحليل التنبؤ. يصنف نموذج اكتشاف الذكاء الاصطناعي كل مقطع ويعطيه قيمة بين 0 و1، تشير إلى احتمالية أن يكون النص بشريًا أو مولّدًا بالذكاء الاصطناعي.)

في الوثيقة الأطول، تتداخل المقاطع، مما يعني أن جملة واحدة قد تتلقى درجات متعددة تُجمَع معاً. يُنعّم هذا التجمع أخطاء التوقع الفردية. في القطعة الإبداعية القصيرة، قد يكون هناك مقطع واحد فقط دون تداخل، ولهذا يصبح التوقع كلياً أو معدوماً. يغطي مقال ماذا تقيسه كواشف الذكاء الاصطناعي beyond perplexity and burstiness ما يتم تقييم كل مقطع عليه.

ماذا يعني هذا لك

لتلخيص ما غطيناه:

  • النسبة المئوية تستند إلى النثر الطويل المستوفي للشروط وليست بالضرورة نسبة الإرسال بأكمله.
  • تسرد إحدى مقالات Turnitin المساعدة الشعر والنصوص المسرحية والببليوغرافيات المشروحة كأنواع نصوص لا يكتشفها النموذج بدقة.
  • بالنسبة للوثائق المستوفية المكونة من بضع مئات من الكلمات فقط، تقول Turnitin إن التوقع سيكون غالباً كلياً أو معدوماً لأن التداخل غير متاح.
  • الإرسالات التي تحتوي على أقل من 300 كلمة من النثر الطويل المستوفي للشروط لا تستوفي المتطلبات الحالية لتقرير الذكاء الاصطناعي أو النسبة المئوية.
  • تنصح الأسئلة الشائعة المدرسين بأخذ النسبة المئوية "في الاعتبار" عندما يكون النص قليل التباين الهيكلي أو يكرر نفسه.
  • قد تتطابق تقنيات الكتابة الإبداعية مثل التكرار المتعمد والصوت الموحد مع خصائص عرضة للإيجابيات الكاذبة.

إذا تلقيت تقرير Turnitin على قطعة كتابة إبداعية وترغب في معالجة الفقرات المُعلَّمة، استورد التقرير واعمل عليها. يمكن إعادة تشغيل الفقرات المستوفاة مجاناً.

تابع القراءة