الحد الأدنى لعدد الكلمات في كاشف الذكاء الاصطناعي: ما تنشره خمس شركات

أن تلصق الفقرة التي أعدتَ كتابتها للتو في فاحص مجاني هو أكثر تصرف يتبادر إلى الذهن، وهو الحالة ذاتها التي تحذّر منها كل واحدة من هذه الشركات في وثائقها. خمسٌ منها تنشر حداً أدنى للطول. وإحداها نشرت تجربتين كتب فيهما موظفوها مقطعاً قصيراً بأيديهم فصنّفته أداتها على أنه ذكاء اصطناعي.

فريق HumanPen

· مدة القراءة: 10 د

كم مقدار النص الذي يحتاجه كاشف الذكاء الاصطناعي قبل أن يصبح رقمه ذا معنى؟

كل كاشف هنا ينشر حداً أدنى، والفقرة الواحدة تقع تحت معظمها. هذه أرقام الشركات نفسها، مأخوذة من وثائقها وتحقّقنا منها في 18 سبتمبر 2026:

الأداةما تنشره
Copyleaks — الحد الأدنى الصارم"For the AI Detector to get an accurate reading, it requires a minimum of 350 characters" (لكي يحصل كاشف الذكاء الاصطناعي على قراءة دقيقة، يحتاج إلى 350 حرفاً كحد أدنى) — الوحدة حروف لا كلمات
Copyleaks — العيّنة المقترحة"we suggest testing text containing an average of 350 words" (نقترح اختبار نص يحتوي على 350 كلمة في المتوسط)
Winston AI"Minimum 300 characters. Texts under 600 characters may produce unreliable results and should be avoided." (الحد الأدنى 300 حرف. النصوص التي تقل عن 600 حرف قد تُنتج نتائج غير موثوقة وينبغي تجنّبها.)
Originality.aiعلى الموقع الحد الأدنى 100 كلمة؛ وفي واجهة البرمجة لا يوجد حد أدنى، لكن "accuracy is decreased for texts below 100 words" (تنخفض الدقة للنصوص التي تقل عن 100 كلمة)
ZeroGPT"At least 150–200 words; longer text (500–1,000+) improves stability." (150 كلمة على الأقل وصولاً إلى 200 كلمة؛ والنص الأطول من 500 إلى 1,000 كلمة فأكثر يزيد الاستقرار)
Turnitinلا درجة ذكاء اصطناعي على الإطلاق إذا قلّ النص النثري عن 300 كلمة

حدّان من هذه الحدود مكتوبان بالأحرف والبقية بالكلمات، ولهذا يسهل الخلط بينها. التحويل سريع: في النص النثري الإنجليزي تبلغ الكلمة نحو ستة أحرف إذا حسبت الفراغ الذي يليها، والوسيط عبر 5,357 فقرة منشورة على هذا الموقع هو 6.0. وبعد التحويل يصير كل حد في الجدول عدد كلمات: حد Winston البالغ 300 حرف يساوي نحو 50 كلمة، وخطّها الذي يدعو إلى تجنّب ما يقل عن 600 حرف يساوي نحو 100 كلمة؛ وحد Copyleaks البالغ 350 حرفاً يساوي نحو 58 كلمة، والعيّنة التي تقترحها هي 350 كلمة؛ وحد Originality هو 100 كلمة؛ وتطلب ZeroGPT 150 كلمة على الأقل وصولاً إلى 200، وتقول إن النص من 500 إلى 1,000 كلمة فأكثر يكون أكثر استقراراً؛ وحد Turnitin هو 300 كلمة. قِس مقطعك أنت على هذه الأرقام. ولإعطاء مقياس، أحصينا فقرات 5,357 نفسها على الحدود نفسها: 54% تبلغ 300 حرف الخاصة بـWinston، و39% تبلغ 350 الخاصة بـCopyleaks، و6% تبلغ 100 كلمة الخاصة بـOriginality، و0.5% تبلغ 150 الخاصة بـZeroGPT، ولا واحدة منها تبلغ عيّنة 350 كلمة التي تقترحها Copyleaks. الفقرة الوسيطة هي 51 كلمة و312 حرفاً، تتجاوز واحداً من الحدود السبعة في الجدول وهو 300 حرف الخاصة بـWinston، وتقصر عن الحدود الستة الأخرى.

من المفيد فصل أمرين يجري خلطهما معاً. الحد الأدنى هو النقطة التي تتوقف عندها الشركة عن الوقوف خلف رقمها هي، وليس بالضرورة النقطة التي لا يعود شيء منها إليك دونها. بعض هذه الأدوات يعيد نسبة مئوية على أي حال: تقول Originality.ai إن الفحوص في واجهة البرمجة لديها "have no word count minimum" (لا حد أدنى لعدد الكلمات) ثم تخبرك أن الدقة تنخفض دون 100 كلمة. وأدوات أخرى ترفض ببساطة، وTurnitin إحداها. لذا فإن ظهور رقم على الشاشة ليس في حد ذاته دليلاً على أن الأداة اعتبرت العيّنة كبيرة بما يكفي.

لماذا تكون الفقرة التي أعدت كتابتها للتو أصعب حالة

تُصلح المقطع الذي جرى تمييزه، وتلصقه في فاحص، وتقرأ الرقم، وتقرر ما إذا كنت قد انتهيت. مركز مساعدة Originality.ai يضع هذه الخطوة بعينها في مقدّمة قائمة أسباب الإيجابيات الخاطئة:

You are more likely to receive false positives by only scanning part of the entire piece of content: a single paragraph, the intro, the conclusion, half of the paper... etc. (من المرجّح أكثر أن تتلقى إيجابيات خاطئة إذا فحصت جزءاً فقط من المحتوى بأكمله: فقرة واحدة، أو المقدمة، أو الخاتمة، أو نصف الورقة... إلخ.)

والجملة التالية تقول ما ينبغي فعله بدلاً من ذلك: "We can fix a lot of false positives by scanning the entire piece of content instead of a snippet. This just gives our tool more context and more content to go off of." (يمكننا إصلاح قدر كبير من الإيجابيات الخاطئة بفحص المحتوى بأكمله بدلاً من مقتطف. هذا يمنح أداتنا سياقاً أكثر ومحتوى أكثر لتعتمد عليه.)

وتحمل الصفحة نفسها تجربتين أجرتهما الشركة على نفسها، وهذا أندر وأفيد من النصيحة نفسها:

  • مقدمة مدوّنة من 50 كلمة، كتبها بيده كاتبُ مقال المساعدة نفسه، عادت بنتيجة 79% ذكاء اصطناعي.
  • خاتمة من 107 كلمات، مكتوبة بيد صاحبها أيضاً، عادت بنتيجة 69% ذكاء اصطناعي. وتفسير الصفحة أن الخاتمة نمطية بقدر ما هي قصيرة: "You summarize everything before, give the reader more options and places to click, and finish up with any final calls to action." (أنت تلخّص كل ما سبق، وتقدّم للقارئ خيارات ومواضع أكثر للنقر، وتختم بأي دعوات أخيرة إلى اتخاذ إجراء.)

كلا الرقمين جاء من نص كتبه بشر. ولا أحدهما دليل على كتابتك أنت. إنهما دليل على ما يفعله مقتطف قصير يمكن التنبؤ ببنائه بالدرجة، ومقدمة المقال وخاتمته قصيرتان ويمكن التنبؤ ببنائهما بحكم طبيعتهما.

والمقتطفات القصيرة تغيّر أيضاً قيمة تنسيق نصك. تقول صفحة قيود Copyleaks إن كاشفها يقرأ آلاف الأنماط، "not just words or formatting" (ليس الكلمات أو التنسيق وحدهما) ثم تضيف الجزء المهم للعيّنة القصيرة: "Numbering, bullets, and outline-style headers are only one small part of the overall signal, but in very short texts they can have a larger relative impact to overall AI detection scores." (الترقيم والنقاط والعناوين على هيئة مخطط ليست سوى جزء صغير من الإشارة الكلية، لكنها في النصوص القصيرة جداً قد يكون لها أثر نسبي أكبر على درجات كشف الذكاء الاصطناعي الكلية.) فقرة مناهج من ثلاث خطوات مرقّمة هي هذه الهيئة بالتحديد.

ثمة سبب ثانٍ يجعل الفقرة المُعادة كتابتها أسوأ عيّنة ممكنة، ولا علاقة له بالطول: إنها الجزء من مستندك الذي جرى تحريره بأكبر قدر للتو. صفحة Originality صريحة في ما يفعله استخدام الأدوات بدرجتها: "if a tool interacted with your content in any way, it will raise the AI score" (إذا تفاعلت أي أداة مع محتواك بأي شكل، فسيرفع درجة الذكاء الاصطناعي) وتسمّي مدقّقات القواعد إلى جانب برامج الدردشة. ومهما يكن رأيك في هذه السياسة، فمعناها أن الفقرة التي كنت تعمل عليها هي الفقرة التي تحمل أكبر قدر من إشارة التحرير، وأنت تطلب من الأداة أن تحكم عليها وحدها.

الرقم على مستوى الجملة أضعف من رقم المستند

معظم الكواشف اليوم تلوّن الجمل مفردة، وهذا يغري بقراءة التقرير جملة جملة. شركتان تقولان مباشرة إن تلك القراءات الأصغر وزنها أقل من القراءة الكلية.

وتضيف وثائق واجهة برمجة Winston AI، في وصفها لمصفوفة درجات الجمل التي تعيدها: "Please note that assessments on smaller samples are less accurate than the general score." (يُرجى ملاحظة أن التقييمات على العيّنات الأصغر أقل دقة من الدرجة العامة.)

وتذهب إرشادات GPTZero حول تمييز الجمل أبعد من ذلك، وتجيب عن سؤال يطرحه علينا الناس باستمرار: لماذا لم يتحرّك الرقم بعد تعديل الجمل المميّزة:

Some sentences in an otherwise AI or human document might not show up as highlighted. They may still have an effect on your score, but they aren't more likely than other parts of your document. (قد لا تظهر بعض الجمل في مستند مصنّف على أنه ذكاء اصطناعي أو بشري مميّزة. وقد يكون لها تأثير على درجتك، لكنها ليست أكثر احتمالاً من أجزاء أخرى من مستندك.)

ثم تأتي الجملة مرفقاً بها السبب: "You may find that adjusting an entire document changes your score more than just adjusting the sentences. This is because our detector holistically analyzes the document, and its prediction can depend on a pattern that affects the bulk of the text." (قد تجد أن تعديل المستند بأكمله يغيّر درجتك أكثر من مجرد تعديل الجمل. ذلك لأن كاشفنا يحلّل المستند ككل، وقد يعتمد توقّعه على نمط يؤثر في مجمل النص.)

هذا هو قول الشركة نفسها إن التمييزات ليست خريطة كاملة لما أنتج الرقم. ويتناول ما يقيسه كاشفو الذكاء الاصطناعي فعلياً كيف تُنتج هذه الدرجات، ولماذا صار التفسير المتداول لها متقادماً؛ أما النقطة العملية هنا فأضيق. فإذا اعتبرت الجمل المميّزة هي القائمة الكاملة لما يحتاج إلى انتباه، فأنت تعمل بخريطة جزئية، وصفاً الشركة نفسها.

النص نفسه، والأداة نفسها، وإجابة مختلفة

الطول ليس وحده ما يحرّك القراءة. تتيح Copyleaks للمؤسسة أن تختار واحداً من ثلاثة إعدادات للحساسية، وتنشر ما يفعله كل إعداد بمعدلات الخطأ لديها:

الإعدادكيف تصفه Copyleaksالإيجابيات الخاطئةالسلبيات الخاطئة
Extra Safe"Designed to minimize false positives by using additional AI detection based filters." (مصمَّم لتقليل الإيجابيات الخاطئة باستخدام مرشّحات إضافية قائمة على كشف الذكاء الاصطناعي.)0.010%0.5765%
Balanced (الافتراضي)"Ideal for detecting AI content while minimizing false positives." (مثالي لكشف محتوى الذكاء الاصطناعي مع تقليل الإيجابيات الخاطئة.)0.0295%0.174%
Extra Sensitive"Our most sensitive model, designed to flag AI text that was put through a 'humanizer' or text spinner." (نموذجنا الأكثر حساسية، مصمَّم لوسم نص الذكاء الاصطناعي الذي مُرِّر عبر أداة 'humanizer' أو محوّل نصوص.)0.1973%0.063%

اقرأ الصفَّين الأول والأخير معاً. الانتقال من الإعداد الأكثر تحفّظاً إلى الأكثر حساسية يضاعف معدل الإيجابيات الخاطئة المنشور نحو عشرين ضعفاً، وهو مفتاح على شاشة شخص آخر. لا يمكنك أن ترى في أي موضع هو، ولا شيء في التقرير الذي تُسلَّمه سيخبرك.

لذا حين يختلف فحصك أنت عن فحص جامعتك، ثمة ثلاثة تفسيرات عادية على الأقل قبل أن يصل أحد إلى القول بأن "أحدهما معطوب": أداة مختلفة، أو إعداد مختلف على الأداة نفسها، أو مقدار مختلف من النص. ويتناول لماذا يعطي كاشفان للذكاء الاصطناعي درجتين مختلفتين ما تبقّى.

القراءة المحتسبة تُجرى على الملف كله

مهما شغّلت في بيتك، الرقم الذي يترتب عليه أثر هو ما تنتجه أداة مؤسستك، على الملف الذي تقدّمه، وبإعداداتها هي. ولن تُنتج Turnitin درجة ذكاء اصطناعي على الإطلاق لعمل يقلّ نثره عن 300 كلمة، أما المستندات التي تعلو هذا الخط مباشرة فهي تصف توقّعها بأنه قريب من «كل شيء أو لا شيء»، وما يفعله ذلك بالواجبات القصيرة موضوع قائم بذاته.

وتنشر واجبات Clarity الأحدث من Turnitin نطاق عمل بالروح نفسها: "For Turnitin Clarity to work optimally, we recommend a minimum word count of 300 words and a maximum of approximately 2,500 words" (لكي يعمل Turnitin Clarity على النحو الأمثل، نوصي بعدد كلمات لا يقل عن 300 كلمة ولا يزيد على نحو 2,500 كلمة). وحين يكون كشف الكتابة بالذكاء الاصطناعي مفعّلاً، "submissions must be between 300 and 30,000 words." (يجب أن يكون العمل المقدَّم بين 300 و30,000 كلمة).

ومجرّد قدرتك على إجراء فحصك الخاص يتوقف على ما فعّلته مؤسستك وعلى الشاشات التي يمكنك الوصول إليها، وهذا سؤال منفصل له إجابته الخاصة: كيف تتحقّق من عملك قبل أن تقدّمه.

ما الذي تفعله بدلاً من ذلك

  1. افحص المستند كله لا المقطع. هذا هو التغيير الوحيد الذي يطابق نصيحة كل شركة لنفسها: لا أداة جديدة، لا حساب جديد، لا إعداد جديد، مجرد الفحص نفسه على نص أكثر. وعلى الأدوات التي تحاسب بالطول يكلّف ذلك أكثر، إذ تقول وثائق واجهة برمجة Winston إن "Each word that is processed by the API consumes one credit" (كل كلمة تعالجها الواجهة تستهلك رصيداً واحداً) ومع ذلك تظل هذه هي القراءة التي تقول صفحاتهم نفسها إن عليك الأخذ بها.
  2. قارن المتشابه بالمتشابه. لا تعني مقارنة قبل وبعد شيئاً إلا إذا كانت الأداة والإعدادات ومقدار النص واحدة على الجانبين. فتغيير حجم العيّنة بين القراءتين يغيّر القراءة بحد ذاته.
  3. توقّع أن يتحرّك الرقم دون أن تمسّ النص. النماذج تُعاد صياغة إصداراتها. تسرد وثائق واجهة برمجة Winston اثنين وعشرين إصداراً قابلاً للاختيار، من 2.0 إلى 4.18، والافتراضي هو الأحدث. درجة من قبل ثلاثة أسابيع ودرجة من اليوم قد لا تأتيان من النموذج نفسه.
  4. لا تعتبر رقماً من فحصك الخاص حكماً، في أي من الاتجاهين. القراءة المنخفضة في البيت ليست تصريحاً بالمرور، لأن أداة جامعتك أداة أخرى. والقراءة المرتفعة على مقتطف من 60 كلمة ليست نتيجة أيضاً: 60 كلمة تتجاوز واحداً من الحدود السبعة أعلاه ولا تتجاوز أياً من البقية.
  5. احتفظ بالتقرير الذي أُعطيته فعلاً. إن كان الوسم قد حدث بالفعل، فالمستند المهم هو الذي أنتجته مؤسستك، لا قراءة ولّدتها أنت لاحقاً. ويتناول إعادة الفحص بعد إعادة الكتابة ما يمكن لهذه المقارنة أن تبيّنه وما لا يمكن.

الأسئلة الشائعة

هل يوجد عدد كلمات تصبح عنده الكواشف موثوقة؟ لا تزعم أي من هذه الشركات نقطة يصبح عنده خرجها يقيناً. ما تنشره هو حد أدنى تقول إن الخرج دونه غير موثوق، واتجاه واحد: كلما طال النص كان أكثر استقراراً. وتصيغها Copyleaks هكذا: "the accuracy of our detection increases as the text length increases" (تزداد دقة كشفنا كلما زاد طول النص)؛ وصياغة ZeroGPT أن النص الأطول "improves stability" (يحسّن الاستقرار).

فقرة من 150 كلمة عادت بنسبة 80%. هل يعني ذلك أن 80% منها ذكاء اصطناعي؟ لا، وهذا اللبس جدير بالتوضيح لأنه مبني في طريقة تسمية هذه الدرجات. تقولها Originality.ai في مركز المساعدة بصراحة: "an AI score of 90% doesn't mean that AI produced 90% of the content. It means that our tool is 90% confident that AI was used in some part to produce the content" (درجة الذكاء الاصطناعي البالغة 90% لا تعني أن الذكاء الاصطناعي أنتج 90% من المحتوى. بل تعني أن أداتنا واثقة بنسبة 90% من أن الذكاء الاصطناعي استُخدم في إنتاج جزء ما من المحتوى). رقم الثقة ورقم نسبة المستند يبدوان متطابقين على الشاشة ويعنيان شيئين مختلفين. ونسبة Turnitin هي الصيغة الثالثة مجدداً، وهي حصة من النص المؤهل.

هل يمكنني ببساطة دمج بضع فقرات لتجاوز الحد الأدنى؟ تقترح ZeroGPT ذلك بالتحديد: "consider merging sections before checking." (يُنظر في دمج الأقسام قبل الفحص.) هذا يجعلك تتجاوز عتبة الطول، لكن القراءة بعدها تصف الكتلة المدموجة لا الفقرة التي كنت قلقاً بشأنها. إن كان سؤالك عن مقطع واحد، فلا ترتيب للنص يجيب عنه نظيفاً، وهذه هي الإجابة الصادقة لا الإجابة المرضية.

هل تنطبق هذه الحدود على تقرير Turnitin في جامعتي أيضاً؟ الحدود أعلاه تعود إلى كاشف كل شركة لنفسها. ولدى Turnitin حدودها الخاصة: لا درجة دون 300 كلمة من النثر، والجمل النثرية وحدها هي ما يُحسب في النسبة أصلاً. والقوائم والجداول والنقاط مستبعدة مما تقيسه، ولهذا قد يبدو التمييز والرقم غير متسقين.

المصادر

تابع القراءة