هل يكتشف Turnitin النسخ واللصق؟

هذا السؤال يخلط بين تقريرين مختلفين. نفصل هنا ما يبحث عنه كل منهما فعليًا، ولماذا يرفع النص البشري المنسوخ درجة التشابه دون أن يرفع مؤشر الذكاء الاصطناعي، وما الذي ينبغي أن تراجعه إن كنت قلقًا بشأن الدرجتين.

فريق HumanPen

· مدة القراءة: 9 د

الإجابة المختصرة

يشغّل Turnitin نظامين مستقلين عن بعضهما. أما الذي يكتشف النسخ واللصق فهو Similarity Report، إذ يقارن النص الذي ترسله بقاعدة بيانات تضم محتوى منشورًا وأعمالًا لطلاب آخرين ومصادر من الويب، ويضع علامات على السلاسل النصية المطابقة. إن كنت قد نسخت من مصدر موجود في قاعدة البيانات، فسيظهر ذلك في Similarity Report. أما AI Writing Report فلا يكتشف النسخ واللصق، بل يحلل أنماط احتمال الكلمات في النص النثري ليقدّر ما إذا كان النص قد كُتب بالذكاء الاصطناعي. والنص البشري المنسوخ من كتاب أو مقال لا يفعّل كاشف الذكاء الاصطناعي، لأن للكتابة البشرية أنماط احتمال تختلف عن أنماط النص المُولّد بالذكاء الاصطناعي.

هاتان الدرجتان لا تؤثر إحداهما في الأخرى. سنستعرض معًا طريقة عمل كل نظام، وما يعنيه ذلك إن كنت قد لصقت نصًا من مكان ما.

كيف يلتقط Similarity Report النص المنسوخ والملصوق

التقرير الذي يؤدي ما يقصده معظم الناس حين يسألون "هل يكتشف Turnitin النسخ واللصق؟" هو Similarity Report. يأخذ المستند الذي ترسله ويقارنه بمجموعة المحتويات لدى Turnitin. وتشمل هذه المجموعة أعمالًا منشورة وصفحات ويب وأعمالًا أخرى لطلاب سُبق أن أُرسلت إلى Turnitin، وما الذي تُقارن به مخطوطتك يشرح ذلك بتفصيل أكبر. وعندما يعثر النظام في مستندك على سلسلة نصية تطابق سلسلة في قاعدة البيانات، يبرز التطابق ويحتسبه ضمن نسبة التشابه.

الآلية هي مطابقة السلاسل النصية. إن لصقت فقرة من موقع ويب، أو جملة من كتاب رُقمن وأُدرج في الفهرس، أو قسمًا من عمل زميل سُبق إرساله، فسيجد Similarity Report التطابق إن كان المصدر موجودًا في قاعدة البيانات. ويوضح لك التقرير بالتحديد أي السلاسل تطابقت، ومن أي مصدر جاءت.

تذكر الأسئلة الشائعة عن قدرات اكتشاف الكتابة بالذكاء الاصطناعي الخاصة بـ Turnitin هذا الفصل بصيغة مباشرة:

"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (درجة التشابه ونسبة اكتشاف الكتابة بالذكاء الاصطناعي مستقلتان تمامًا، ولا تؤثر إحداهما في الأخرى.)

والجملة التالية في الصفحة نفسها هي:

"The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking." (تشير درجة التشابه إلى نسبة النص المطابق الموجود في المستند المُرسَل عند مقارنته بمجموعة المحتوى الشاملة لدى Turnitin لأغراض فحص التشابه.)

تصف هذه الجملة الثانية بدقة ما يفعله Similarity Report: فهو يبحث عن النص المطابق، ولا يقيّم ما إذا كان ذلك النص قد كتبه إنسان أم ذكاء اصطناعي، ولا يعنيه من كتبه. الذي يعنيه هو وجود السلسلة نفسها في مكان ما داخل قاعدة البيانات. ولهذا السبب أيضًا يظل النص المقتبس والموثّق بالاستشهاد ظاهرًا في Similarity Report حتى عندما تكون قد فعلت كل شيء بشكل صحيح.

كيف يعمل AI Writing Report، ولماذا لا يلتقط النسخ واللصق

يعمل AI Writing Report وفق مبدأ مختلف تمامًا. فهو لا يقارن نصك بقاعدة بيانات من السلاسل النصية، بل يمرره عبر نموذج يمنح مقاطع النص النثري درجات احتمال. وتصف الأسئلة الشائعة الآلية على هذا النحو:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (عند إرسال ورقة بحثية إلى Turnitin، تُستخرج الجمل من العمل المُرسَل وتُقسَّم إلى مقاطع متداخلة من أجل تحليل التنبؤ. ويُصنَّف كل مقطع بواسطة نموذج اكتشاف الذكاء الاصطناعي ويُمنح قيمة بين 0 و1، تدل على احتمال أن يكون النص على الأرجح بشريًا أو مُولَّدًا بالذكاء الاصطناعي. وترث كل جملة مؤهلة داخل هذه المقاطع درجة المقطع. ولأن المقاطع تتداخل، قد تحمل بعض الجمل عدة درجات، تُدمج بعد ذلك في درجة واحدة. ثم تُجمَع درجات الجمل هذه وتُستخدم لحساب درجة الكتابة بالذكاء الاصطناعي للمستند ككل.)

العبارة المفتاحية هي "the probability of the text being likely human or AI-generated." (احتمال أن يكون النص على الأرجح بشريًا أو مُولَّدًا بالذكاء الاصطناعي). النموذج ينظر إلى كيفية اختيار الكلمات وترتيبها. فالنص المُولَّد بالذكاء الاصطناعي يميل إلى إنتاج كلمات يمكن التنبؤ بها بدرجة كبيرة بالنظر إلى السياق السابق، لأن نماذج اللغة تختار الرموز التالية الأعلى احتمالًا. أما الكتابة البشرية فتميل إلى أن تكون أقل قابلية للتنبؤ في اختيار كلماتها. وهذا الاختلاف في أنماط الاحتمال هو ما يقرأه النموذج.

ولهذا السبب لا يفعّل النص البشري المنسوخ كاشف الذكاء الاصطناعي. إن لصقت في عملك فقرة من كتاب منشور، فتلك الفقرة كتبها إنسان، وأنماط احتمال كلماتها تشبه الكتابة البشرية لا النص المُولَّد بالذكاء الاصطناعي، فيصنفها النموذج على أنها بشرية، ولا يضع AI Writing Report عليها علامة.

والعكس صحيح أيضًا. إن أنشأت فقرة بأداة ذكاء اصطناعي ولصقتها في عملك، فقد يضع AI Writing Report عليها علامة، لأن أنماط الاحتمال في تلك الفقرة تشبه مخرجات الذكاء الاصطناعي. لكن Similarity Report لن يضع عليها علامة، لأن تلك السلسلة النصية بالتحديد لا وجود لها على الأرجح في قاعدة بيانات المحتوى المنشور لدى Turnitin. فالذكاء الاصطناعي أنتج نصًا جديدًا، ولم ينسخ من مصدر قائم.

هذا هو الفرق الجوهري: يلتقط Similarity Report النص الموجود مسبقًا في مكان آخر، ويلتقط AI Writing Report النص الذي يُقرأ كما لو كان من إنتاج آلة. فالنسخ واللصق مسألة تشابه، والتوليد بالذكاء الاصطناعي مسألة احتمال. أما ما يدخل في هذا الاحتمال فهو سؤال آخر، وهل يستخدم Turnitin الحيرة والتفاوت الأسلوبي هو الصيغة التي يطرحه بها معظم الناس.

ما يقرأه نموذج الذكاء الاصطناعي فعليًا، وما يتجاوزه

ثمة طبقة ثانية في طريقة عمل AI Writing Report، وهي مهمة في حالات النسخ واللصق. فالنموذج لا يحلل كل ما في مستندك. تقول الأسئلة الشائعة:

"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (لا يكتشف النموذج بشكل موثوق النص المُولَّد بالذكاء الاصطناعي في صورة نص غير نثري أو في صورة كود، كما أنه لا يكتشف الكتابة القصيرة أو غير المعتادة مثل النقاط التعدادية، أي البُنى القصيرة التي ليست جملًا.)

والجملة التالية هي:

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (وهذا يعني أن المستند الذي يحتوي على عدة أنواع مختلفة من الكتابة سيؤدي إلى وجود تفاوت بين النسبة والعلامات المميّزة.)

وتحدد الأسئلة الشائعة أيضًا ما الذي يخضع للتحليل:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (لا يضم هذا النص المؤهل سوى الجمل النثرية، أي أننا نحلل فقط كتل النص المكتوبة بجمل نحوية سليمة، ولا نُدخل أنواعًا أخرى من الكتابة مثل القوائم أو النقاط التعدادية، أي البُنى القصيرة التي ليست جملًا، أو غيرها من البُنى غير الجملية.)

والجملة التالية هي:

"This percentage is not necessarily the percentage of the entire submission." (هذه النسبة ليست بالضرورة نسبة العمل المُرسَل بأكمله.)

المعنى العملي هو الآتي: إن كنت قد نسخت ولصقت قائمة تعدادية أو جدول بيانات أو مقطع كود، فربما لا يقرأ نموذج الذكاء الاصطناعي ذلك أصلًا، فهو يستبعد المحتوى غير النثري قبل أن يبدأ تحليله. أما Similarity Report فيقرأ كل شيء، على العكس من ذلك. فهو يلتقط القائمة الملصوقة أو مقطع الكود الملصوق بالسهولة نفسها التي يلتقط بها الفقرة الملصوقة، لأنه يجري مطابقة سلاسل نصية على المستند بأكمله.

لذا، عندما تلصق من مصدر محتوى غير نثري، تكون النتيجة غير متكافئة: Similarity Report يلتقطه، وأما AI Writing Report فلا يفعل، لأنه لا يراه أبدًا.

لماذا يظهر النص البشري المنسوخ في أحد التقريرين ولا يظهر في الآخر

بجمع الآليتين معًا، نجد تفسيرًا للسيناريو الأكثر شيوعًا الذي يسأل عنه الطلاب: وجدت فقرة على موقع ويب أو في كتاب، ولصقتها في عملك، وصارت درجة التشابه ودرجة الذكاء الاصطناعي تقلقانك معًا. إليك ما يحدث.

سيضع Similarity Report علامة على الفقرة الملصوقة، بشرط أن يكون المصدر موجودًا في قاعدة البيانات. السلسلة النصية متطابقة، وترتفع النسبة، ويُحدَّد المصدر. التقرير يؤدي عمله.

لن يضع AI Writing Report علامة على الفقرة الملصوقة، بشرط أن يكون النص الأصلي قد كتبه إنسان. يقرأ النموذج الفقرة بوصفها نصًا نثريًا، ويمنح مقاطعها درجات احتمال، ويجد أن اختيارات الكلمات تبدو بشرية، فتُصنَّف الفقرة على أنها مكتوبة بيد إنسان. ولا توجد أي علامة ذكاء اصطناعي.

ينطبق هذا حتى لو كان النص الملصوق طويلًا. فنموذج الذكاء الاصطناعي لا يعنيه من أين جاء النص، بل يعنيه كيف يُقرأ النص. فالفقرة المنسوخة من مقالة أكاديمية تعود إلى عقد 1990 تحمل أنماط احتمال الكلمات الخاصة بالكتابة الأكاديمية البشرية في عقد 1990. وهكذا لا يبدو النص المُولَّد بالذكاء الاصطناعي.

تجعل الأسئلة الشائعة هذا الاستقلال صريحًا. يقول Turnitin: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (درجة التشابه ونسبة اكتشاف الكتابة بالذكاء الاصطناعي مستقلتان تمامًا، ولا تؤثر إحداهما في الأخرى.) فدرجة التشابه المرتفعة الناتجة عن نص ملصوق لا ترفع درجة الذكاء الاصطناعي، ودرجة الذكاء الاصطناعي المرتفعة الناتجة عن نص مُولَّد لا ترفع درجة التشابه. فهما تُحسبان بنظامين مختلفين يبحثان عن أشياء مختلفة، ولهذا لا ينبغي قراءة الدرجتين باعتبارهما شيئًا واحدًا.

ماذا يعني هذا إن كنت قلقًا بشأن الدرجتين

إن كنت قد لصقت نصًا من مكان ما، وكان التقريران أمامك، فإليك كيف تقرأهما.

إن ظهر النص الملصوق في Similarity Report، فذلك متوقع: لقد وجد النظام التطابق. وعليك إما أن تعيد صياغة النص بكلماتك، أو أن تضعه بين علامتي تنصيص مع استشهاد، أو أن تحذفه. وعلامتا التنصيص مع الاستشهاد هما الحالة الوحيدة التي يكون فيها النص الملصوق مشروعًا. سيظل Turnitin يظهر التطابق، لكن مدرّسك يستطيع أن يرى أنه منسوب بشكل صحيح.

إن كان النص الملصوق قد كتبه إنسان، وكنت تراجع AI Writing Report، فلا ينبغي أن ترى عليه علامة. فإن رأيت علامة، وكان النص في الحقيقة من مصدر بشري، فالعلامة إيجابية خاطئة: فنموذج الذكاء الاصطناعي يقدّر الاحتمالات، ولا يقدّم يقينًا، ويمكنه أن يخطئ في التصنيف. لكن التفسير الأكثر شيوعًا هو أن النص الملصوق ليس هو ما أُشير إليه. اقرأ النص المميّز فعليًا: قد يكون ما كتبته أنت بجوار القسم الملصوق، لا القسم الملصوق نفسه.

أما إن كنت قد أنشأت نصًا بأداة ذكاء اصطناعي ثم لصقته، فتنقلب الحال: فلن يضع Similarity Report عليه علامة على الأرجح، لأن السلسلة النصية جديدة. وقد يضع AI Writing Report عليه علامة، لأن أنماط الاحتمال هي التي دُرّب النموذج على التعرف عليها.

ماذا تفعل

الخلاصة لكل من يتساءل عما إذا كان Turnitin يكتشف النسخ واللصق:

  1. Similarity Report يكتشف النسخ واللصق: فهو يجري مطابقة سلاسل نصية مع قاعدة بيانات، فإن كان المصدر موجودًا في قاعدة البيانات، سيظهر النص الملصوق بوصفه تطابقًا.
  2. AI Writing Report لا يكتشف النسخ واللصق: فهو يحلل أنماط احتمال الكلمات في النص النثري، والنص البشري المنسوخ يُقرأ بوصفه نصًا بشريًا ولا تُوضع عليه علامة.
  3. الدرجتان مستقلتان: فدرجة التشابه المرتفعة لا تؤدي إلى درجة ذكاء اصطناعي مرتفعة، والعكس صحيح.
  4. إن لصقت محتوى غير نثري، مثل القوائم أو الأكواد أو الجداول، فقد يلتقطه Similarity Report، بينما قد لا يحلله نموذج الذكاء الاصطناعي أصلًا، لأنه لا يقرأ سوى الجمل النثرية.
  5. إن لصقت نصًا مُولَّدًا بالذكاء الاصطناعي، فقد يضع AI Writing Report عليه علامة حتى وإن لم يفعل Similarity Report ذلك، لأن السلسلة النصية جديدة لكن أنماط الاحتمال قابلة للتعرف.

لا يبقى هذا الفرق غامضًا بمجرد أن تعرف ما يبحث عنه كل نظام: ففحص التشابه يبحث عن سلاسل نصية موجودة، واكتشاف الذكاء الاصطناعي يبحث عن أنماط احتمال في النص النثري. فالنسخ واللصق مسألة سلاسل نصية، والتوليد بالذكاء الاصطناعي مسألة أنماط.

تابع القراءة