تقارير علوم الحاسوب واكتشاف الذكاء الاصطناعي: الشيفرة، والشيفرة الزائفة، والنثر الواقع بينهما

تقرير مقرر في علوم الحاسوب هو وثيقتان مثبتتان معًا. إحداهما تُقاس. أما الأخرى فمكوّنة من قيم، وهي التي تتلف بصمت أثناء مراجعة النص.

فريق HumanPen

· مدة القراءة: 12 د

الجواب المختصر

موقف Turnitin المعلن عن الشيفرة قصير ومحدد: فالنموذج "does not reliably detect AI-generated text in the form of non-prose, or code" (لا يكتشف بشكل موثوق النص المولد بالذكاء الاصطناعي في صيغة غير نثرية أو في صيغة شيفرة)، وتضيف صفحة الأسئلة الشائعة أن Turnitin "not pursuing ChatGPT code detection at this time." (لا تسعى حاليًا إلى اكتشاف شيفرة ChatGPT). إذن قوائم الشيفرة وكتل الشيفرة الزائفة وسجلات الطرفية ليست ما تعنيه نسبة الذكاء الاصطناعي. ما تعنيه هو الفقرات الواقعة بينها، وهو ما يعنيه في تقرير علوم الحاسوب مبرر التصميم وشرح الخوارزمية وتحليل التعقيد ومناقشة التقييم. وهذه الفقرات هي أيضًا أكثر كتابات الوثيقة تجانسًا، لأن الكتابة التقنية الجيدة يُفترض أن تكون متجانسة.

بعيدًا عن كل ذلك: ما يسمح لك قسمك بتوليده تحدده سياسة النزاهة الأكاديمية الخاصة به، لا ما يقيسه كاشف ما. والإجابة عن أحد السؤالين لا تجيب عن الآخر، واعتبارهما سؤالًا واحدًا هو الطريق إلى اجتماع تأديبي.

ما تقوله Turnitin فعليًا عن الشيفرة

جملتان تحملان الأمر كله. الأولى واردة في تعريف صفحة الأسئلة الشائعة لما يخضع للتحليل:

"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (لا يكتشف النموذج بشكل موثوق النص المولد بالذكاء الاصطناعي في صيغة غير نثرية أو في صيغة شيفرة، ولا يكتشف أيضًا الكتابة القصيرة أو غير المعتادة مثل النقاط النقطية، أي التراكيب القصيرة التي ليست جملًا.)

تابع القراءة سطرًا آخر، لأن الفائدة تبدأ من هناك:

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (وهذا يعني أن احتواء الوثيقة على عدة أنواع مختلفة من الكتابة قد يؤدي إلى تفاوت بين النسبة والمقاطع المميزة.)

تقرير علوم الحاسوب هو بحكم تكوينه وثيقة تحتوي على عدة أنواع مختلفة من الكتابة، لذلك فإن هذا التفاوت هو الحالة الطبيعية لهذا النوع من الوثائق لا حالة شاذة. ويذكر دليل التقرير الاستبعاد نفسه بقائمة أطول، فيسمي الشعر والنصوص التمثيلية إلى جانب الشيفرة، ويضيف الجداول وقوائم المراجع المشروحة إلى جانب الصيغة القصيرة.

أما الجملة الثانية فغالبًا ما تنتقل منفصلة عن سياقها، لذا يجدر بنا أن نقول أين توجد. إنها السطر الأخير من الإجابة عن سؤال "Why is AI detection not being added to Gradescope?" (لماذا لا تُضاف ميزة اكتشاف الذكاء الاصطناعي إلى Gradescope؟)، وتلك الإجابة تقول: إن Turnitin "not currently have plans to add these capabilities to Gradescope, since the primary use case for Gradescope is handwritten text while for AI detection we're focusing on typed text" (ليس لديها حاليًا خطط لإضافة هذه الإمكانات إلى Gradescope، إذ إن حالة الاستخدام الأساسية لـ Gradescope هي النص المكتوب بخط اليد، بينما نركز في اكتشاف الذكاء الاصطناعي على النص المكتوب بالطباعة)، ثم تضيف: "In addition, we are not pursuing ChatGPT code detection at this time." (بالإضافة إلى ذلك، لا نسعى حاليًا إلى اكتشاف شيفرة ChatGPT).

وهذا أهم لعلوم الحاسوب من أي تخصص آخر، لأن Gradescope هو المكان الذي تُسلَّم فيه كثير من واجبات البرمجة. فإذا كان التنفيذ يذهب إلى مصحح آلي وتقريرك المكتوب يذهب إلى واجب في Turnitin، فهما مساران مختلفان في المهمة، ونسبة الكتابة بالذكاء الاصطناعي التي تراها في النهاية حُسبت على الثاني. ويتناول أي منتجات Turnitin تتضمن اكتشاف الذكاء الاصطناعي جانب الترخيص في هذا الفصل.

أي أجزاء تقريرك تُعد نثرًا بالمعنى المستخدم هنا

التعريف موجود في دليل التقرير، وأمثلته جديرة بالانتباه:

"Qualifying text (prose sentences contained in long-form writing format) means individual sentences contained in paragraphs that make up a longer piece of written work, such as an essay, a dissertation, or an article, etc." (النص المشمول، أي الجمل النثرية الواردة في صيغة كتابة طويلة، يعني الجمل المفردة الموجودة في الفقرات التي يتألف منها عمل مكتوب أطول، مثل مقال أو أطروحة أو بحث، وهكذا.)

مقال، أطروحة، بحث. تقرير مشروع مكتوب بأسلوب مرجع واجهة برمجة التطبيقات ليس أيًّا من هذه الثلاثة، ولا تنشر Turnitin حكمًا بشأنه. وما تنشره هو اختبار الجملة، وإليك هذا الاختبار مطبقًا عنصرًا بعنصر. هذا تصنيفنا نحن، لا تصنيف الشركة الموردة.

عنصر في تقرير علوم الحاسوبهل هي جمل داخل فقرات؟ملاحظات
المقدمة، وتحديد المشكلة، والدراسات السابقةنعمنثر أكاديمي عادي
مبرر التصميم: لماذا اخترت بنية دون أخرىنعمغالبًا أكثر ما يحمل حجاجًا في الملف
شرح الخوارزمية باللغة الإنجليزيةنعمهنا يميل التمييز إلى التركّز
فقرات تحليل التعقيدنعم، إن كُتبت على شكل جملالسطر الذي لا يحتوي إلا على `O(n log n)` مع رمز على كل جانب ليس جملة
كتلة الشيفرة الزائفةلامبنية على أسطر، لا على جمل نحوية
قائمة الشيفرة المصدريةلامذكورة بالاسم في جملة الاستبعاد لدى الشركة
سجل الطرفية، ومخرجات السجل، وتتبع المكدسلاليست نثرًا، وليست مما ينبغي أن تعيد صياغته
تعليمات الإعداد أو البناء في صورة أوامر مرقمةلاالنقاط النقطية والتراكيب القصيرة غير الجملية مستبعدة
مدخلات مرجع الدوال أو نقاط النهايةالأمر يعتمد على طريقة كتابتها"تُعيد سلسلة الرموز المحلَّلة." جملة؛ أما جدول المعاملات ذو العمودين فليس جملة
جداول التقييم الخاصة بالزمن والدقةأرقام، لاتقول ملاحظة إصدار بتاريخ 9 أغسطس 2023 إن النثر الطويل داخل خلايا الجدول يُعالَج، وإن عمليات الإرسال القائمة يجب إعادة إرسالها لتُعاد معالجتها
مناقشة النتائج، والقيود، والعمل المستقبلينعمنثر من البداية إلى النهاية
المراجعمستبعدةتقول ملاحظة الإصدار نفسها إن قوائم المراجع تُستبعد عند معالجة تقرير الكتابة بالذكاء الاصطناعي

ينتج عن هذا الجدول أمران. مقامك صغير، فالنسبة عبارة عن حكم على شريحة من الملف لا على الملف كله، وهذا ما تقوله صفحة الأسئلة الشائعة صراحةً: "This percentage is not necessarily the percentage of the entire submission. If text within the submission is not considered long-form prose text, it will not be included." (ليست هذه النسبة بالضرورة نسبة العمل المُرسَل بأكمله. فإذا لم يُعتبر نص ما داخل الإرسال نثرًا طويلًا، فلن يُدرج.) وإذا كان التقرير كثيف القوائم، فقد ينخفض النص المشمول إلى حد يصبح معه سلوك «كل شيء أو لا شيء» في الوثائق القصيرة ذا صلة. وتقول متطلبات الملف إن الإرسال يحتاج إلى "at least 300 words of prose text in a long-form writing format" (300 كلمة على الأقل من النص النثري بصيغة كتابة طويلة) قبل أن يصدر أي تقرير أصلًا.

النثر الذي يُقاس هو أكثر ما تكتبه نثرًا تجانسًا

تنشر Turnitin وصفًا لما يميل إلى أن تشترك فيه حالات الخطأ الإيجابي لديها:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (قد تشمل الإيجابيات الخاطئة، أي وضع علامة على نص كتبه إنسان بوصفه مولدًا بالذكاء الاصطناعي بشكل غير صحيح، محتوى لا تنوّع بنيويًا فيه كثيرًا، أو نصًا يكرر نفسه حرفيًا، أو نصًا أُعيدت صياغته دون أن يطوّر أفكارًا جديدة.)

والجملة التالية موجهة إلى مصححك لا إليك:

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (إذا أظهر مؤشرنا قدرًا أعلى من الكتابة بالذكاء الاصطناعي في هذا النص، فننصحك بأن تأخذ ذلك في الاعتبار عند النظر إلى النسبة المشار إليها.)

الآن اقرأ هاتين الخاصيتين في ضوء وثيقة تقنية مكتوبة بإتقان. التنوّع البنيوي هو ما يتعمّد قسم المرجع إزالته: فكل دالة تحصل على الإطار نفسه، الاسم ثم المعاملات ثم القيمة المعادة ثم حالات الفشل، حتى يتمكن قارئ تعلّم الإطار مرة واحدة من تصفح البقية. وقول الشيء نفسه بالطريقة نفسها مرتين هو بالضبط ما تخبر به القارئ بأن مكوّنين يتصرفان بالطريقة نفسها. ودليل أسلوب يطلب منك تغيير شكل كل مدخل سيكون دليل أسلوب سيئًا.

ويظهر الشكل نفسه في شرح الخوارزمية، ولسبب مختلف. فهذا القسم عادةً يعيد صياغة ما تقوله القائمة التي فوقه باللغة الإنجليزية. وإعادة قول شيء ما لا مجال لها من الناحية الأسلوبية. فكل خطوة تبدأ بالخطوة نفسها، وكل جملة لها المبتدأ نفسه، وتصبح الفقرة نسخةً مكتوبة من تدفق التحكم.

هناك حدّان يقتضي الإنصاف ذكرهما. لا تقدّم Turnitin تكرارًا لهاتين الخاصيتين، بل تكتفي بقائمة بما يمكن أن يشمله الخطأ الإيجابي، فلا أحد يستطيع أن يقول لك كم يفسّر هذا من الأثر. ثم إن سلوك النموذج ليس كتاب قواعد يمكنك الاستدلال منه عكسيًا: تقول صفحة الأسئلة الشائعة "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (نموذجنا غير مبرمَج صراحةً لتقييم إشارات محددة مثل 'burstiness,' 'perplexity,' أو غيرها من المقاييس الفردية التي يُشار إليها أحيانًا في النقاشات العامة.) وتعرض أسطورة الحيرة والتفاوت النسخة الأكمل، بما في ذلك الجملة الواردة في موضع آخر من الصفحة نفسها والتي تمنعك من المبالغة في قراءة هذه الجملة.

نصف الملف المكوّن من قيم

إليك الاختلال الذي يجعل تقارير علوم الحاسوب مختلفة عن المقالات. فالمحتوى المستبعد من القياس ليس خلفية خاملة. إنه الجزء من الوثيقة الذي يجعل تغيير حرف واحد فيها وثيقةً خاطئة، والذي تقرأه عملية المراجعة سواء كان أحد يقيمها أم لا.

المحتوىلماذا هو قيمة لا صياغةما تكلفه إعادة صياغة تبدو معقولة
المعرفات وطريقة كتابتها، `getUser` مقابل `get_user`الاسم هو ما يُحَلّ به المرجعأصبح النثر يسمي دالة لا يعرّفها كودك
أعلام سطر الأوامر، `--max-workers=8`نص قابل للتنفيذلا يمكن لصق "علامة الحد الأقصى للعمال مضبوطة على ثمانية" في الصدفة
المسارات وأسماء الوحدات، `src/parser/tokenizer.py`إنه يشير إلى موقع حقيقيلا يستطيع القارئ العثور على الملف
الإصدارات، `Python 3.11`، `CUDA 12.4`قابلية التكراربيئة لا يستطيع أحد إعادة بنائها
تعبيرات التعقيد، `O(n log n)`، و`O(1)` المستهلكادعاء يقف خلفه برهان"خطي تقريبًا" ادعاء أضعف ومختلف
نصوص الخطأ المقتبسة ورموز الخروجاقتباس لما طبعه البرنامجلم يعد اقتباسًا
أسماء نقاط النهاية والطرق، `POST /v1/jobs`عقد واجهةطلب يعيد الخطأ 404
البذور، والمعاملات الفائقة، وتقسيمات مجموعة البياناتأساس أرقامكنتائج لا يستطيع أحد تكرارها، وأنت منهم

ثمة فشل ثانٍ أصعب في الملاحظة، لأن المخرجات تُقرأ بشكل سليم تمامًا. الوثيقة التقنية تعطي المفهوم الواحد اسمًا واحدًا. فإذا تركت المراجعة `hash map` في القسم 3 و`dictionary` في القسم 4 للكائن نفسه، أو تناوبت بين `worker` و`thread`، تكون الوثيقة قد توقفت عن إخبار القارئ ما إذا كان هذا شيئًا واحدًا أم شيئين، ولا يستطيع المصحح حسم ذلك دون قراءة كودك. وهذا ضرر بالوثيقة، ولا دخل لأي درجة به على أي حال. ويجدر التصريح به، لأنه يتعارض مع عادة تفيدك في كل مكان آخر: ففي معظم الكتابة يكون المصطلح المحدد خيارًا لفظيًا، أما في هذا النوع فهو أقرب إلى معرّف.

عشر دقائق من الفحص، بهذا الترتيب

لا يحتاج أيٌّ من هذا إلى أداة لا تكون قد فتحتها مسبقًا.

  • انسخ كل أمر من الوثيقة وشغّله في مجلد تجريبي. تعليمات الإعداد هي أول ما يتقادم وآخر ما يعيد أحد قراءته.
  • اذكر المعرفات التي يعرّفها كودك وابحث عن كل واحد منها في الوثيقة. فأي معرف موجود في الكود وغائب عن الوثيقة هو تغيير اسم حدث دون علمك.
  • اختر أهم خمسة مصطلحات مفاهيمية لديك وابحث عن كل منها. اسم واحد لكل مفهوم، في كل موضع، أو صحّحه الآن.
  • اقرأ كل ادعاء عن التعقيد مقابل الدالة التي يصفها. فـ`O(n log n)` و"فعّال" ليسا قابلين للتبادل، وواحد منهما فقط قابل للتقييم.
  • قارن كل ما بين علامات اقتباس بتشغيل فعلي. أسطر السجل ورسائل الخطأ اقتباسات.

أين توجد المساحة فعليًا

إذا كانت الكتلة المميزة هي شرح الخوارزمية، فهناك سؤال يستحق أن تطرحه قبل أن تمس الجمل: هل يفعل هذا القسم شيئًا لا تفعله القائمة التي فوقه أصلًا؟ فالشرح الذي يكتفي بتغيير أسماء المتغيرات وإضافة "ثم" بين الخطوات هو محتوى مكرر في التقرير، مهما قال أي كاشف عنه. أما النسخة التي تستحق مكانها فتشرح لماذا بُنيت الحلقة على هذا النحو، وما البديل، وأين تنهار.

وهناك أيضًا تجد كتابتك مجالًا للتحسّن. مبرر التصميم، والبدائل المرفوضة، والخلل الذي استغرق يومين، وما لا يقيسه الاختبار المعياري، والقيد الذي كنت ستصلحه بأسبوع إضافي. هذه الفقرات تختلف في الشكل لأن التفكير فيها يختلف. أما أقسام نمط المرجع فلا تختلف، ولا ينبغي لها ذلك.

ومن الإنصاف أن نكون صريحين بشأن حدود هذه النصيحة: أنا أصف ما يجعل التقرير أفضل قراءةً وأفضل تقييمًا. ولا أحد، ونحن منهم، يستطيع أن يقول لك ما تفعله برقم ما. فـTurnitin لا تنشر دالة التجميع ولا طول المقطع، وتحذّر من أن نموذجها نفسه "may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (قد لا يكون دقيقًا دائمًا، إذ قد يخطئ في تمييز النص المكتوب بشريًا والنص المولد بالذكاء الاصطناعي والنص المعاد صياغته بالذكاء الاصطناعي، لذا لا ينبغي استخدامه أساسًا وحيدًا لأي إجراء ضار بالطالب.)

إن كنت ستعيد صياغة النثر

ما يجعل مراجعة تقرير علوم الحاسوب بطيئة لا علاقة له بالجمل إلا قليلًا. فقد تحمل فقرة معاد كتابتها أربعة معرفات وعَلَمًا ورقم إصدار، ويجب مطابقة كل واحد منها مع الكود قبل أن تثق بالفقرة. احسب التكلفة بعدد الفقرات التي مُسّت.

ولهذا تجعلك أداة HumanPen تحدد النطاق أولًا. ارفع الوثيقة، ثم إما أن تحدد المقاطع أو تستورد تقرير ذكاء اصطناعي من Turnitin أو iThenticate وتترك المقاطع المميزة فيه ترسم الحدود. وكل ما خارجها يُترك دون مساس، وهو ما يعني في هذا النوع أن قوائم الشيفرة وكتل الأوامر لا تدخل عملية المراجعة أصلًا إلا إذا أدرجتها أنت فيها. والمحرك لا يعمل على وحدة أصغر من الفقرة، فأي تحديد ينتهي في منتصف فقرة يُوسَّع ليغطيها كاملة ويُعرض عليك لتأكيده أولًا، وتحتسب الأرصدة الكلمات التي أُعيدت كتابتها فعلًا. والمصطلحات مدرجة في قائمة ما يسعى إلى الحفاظ عليه، إلى جانب البنية والاقتباسات والتخطيط. والمقاطع التي تظل مميزة بعد ذلك يمكن إعادة كتابتها مجانًا حين تتوفر شروط ذلك.

ثمة سطر في صفحة الأسئلة الشائعة الخاصة بها عن مراجعة الوثائق المعقدة بعد التنزيل. وبالنسبة إلى تقرير ممتلئ بالمعرفات، فهذا يعني قائمة الفحص في القسم السابق، لا قراءة متصلة. أما النسخة على مستوى الوثيقة مما يتلف في الرحلة ذهابًا وعودة، بما في ذلك الحقول والإحالات التبادلية، فموجودة في حقول Word وجداول المحتويات والإحالات التبادلية.

الأسئلة الشائعة

هل تكتشف Turnitin الشيفرة المولدة بالذكاء الاصطناعي؟ تقول Turnitin إن نموذجها لا يكتشف بشكل موثوق النص المولد بالذكاء الاصطناعي في صيغة غير نثرية أو في صيغة شيفرة، وتقول صفحة الأسئلة الشائعة إنها لا تسعى حاليًا إلى اكتشاف شيفرة ChatGPT. هذا قول عمّا يقيسه هذا التقرير. وليس قولًا عمّا تسمح به مؤسستك، فهذه وثيقة منفصلة عليك قراءتها.

هل تُقيَّم كتلة الشيفرة الزائفة الخاصة بي؟ القاعدة المنشورة هي أن النموذج يحلل الجمل النثرية داخل الفقرات، ويذكر الصيغة القصيرة والتراكيب غير الجملية مما لا يكتشفه. وكتلة الشيفرة الزائفة مبنية على أسطر لا على جمل. أما الفقرة التي تقدّمها فنثر.

لماذا يتركّز التمييز في قسم واحد؟ جزء من السبب حسابي. فإذا كان معظم ملفك مستبعدًا، فلا يمكن أن يظهر التمييز إلا في المتبقي. وتصف Turnitin أيضًا تقييم المقاطع المتداخلة وتجميع القيم، فالمقاطع المتجانسة من النص تميل إلى إنتاج نتائج متجانسة لا مبعثرة.

عاد قسم تحليل التعقيد مميزًا، وقد كتبت كل كلمة فيه بنفسي. هذا يحدث، والفقرة الخاصة بالخطأ الإيجابي في صفحة الأسئلة الشائعة هي ما ينبغي عرضه على المصحح، لا سيما جملتها الختامية التي تنصحه بمراعاة خاصية النص عند قراءة النسبة. أما ما لن تفعله فهو حسم مسألة المؤلف، في أي من الاتجاهين.

تقريري يكاد يكون قوائم بالكامل، ولم يصدر أي تقرير ذكاء اصطناعي. تحقق من الحد الأدنى قبل أن تفترض أن شيئًا قد فشل. تقول متطلبات الملف إن الإرسال يحتاج إلى 300 كلمة على الأقل من النص النثري بصيغة كتابة طويلة، ويمكن لتقرير كثيف القوائم أن يبقى دون ذلك حتى حين يبدو عدد الصفحات سليمًا. وقائمة الاستبعاد العامة موجودة في ما المحتوى الذي يتجاوزه كاشف الذكاء الاصطناعي في Turnitin.

تابع القراءة