Raccourcir un texte change-t-il votre score d'IA Turnitin ?

Vous devez rester sous une limite de mots et le pourcentage d'IA vous préoccupe. Voici ce que la documentation de Turnitin dit que ce chiffre mesure, ce que la coupe modifie, et ce que la documentation ne prédit pas.

L'équipe HumanPen

· 5 min de lecture

La réponse courte

Le chiffre de votre rapport d'IA n'est pas un pourcentage de l'ensemble de votre travail. C'est un pourcentage de ce que Turnitin appelle « qualifying text, » (le texte éligible), un sous-ensemble de votre dépôt, et non la totalité. Que la coupe de mots fasse bouger ce chiffre dépend des mots que vous retirez et de leur appartenance à ce sous-ensemble.

The displayed percentage indicates the amount of qualifying text within the submission that Turnitin's AI writing detection model determines was generated by AI. (Le pourcentage affiché indique la quantité de texte éligible, dans le dépôt, que le modèle de détection d'écriture par IA de Turnitin détermine comme ayant été générée par l'IA.)

Cette phrase vient de la page FAQ de Turnitin sur les capacités de détection de l'écriture par IA. L'expression à retenir est « qualifying text. » (le texte éligible). Le pourcentage est une part de cet ensemble, et non de tout ce que vous avez téléversé. Donc, avant de supprimer un seul paragraphe pour passer sous une limite de mots, vous devez savoir ce qui compte comme éligible et ce qui ne compte pas.

De quoi le pourcentage est-il le pourcentage

Turnitin définit « qualifying text » (le texte éligible) sur cette même page FAQ, et la définition est plus étroite que ce que la plupart des étudiants supposent lorsqu'ils voient un rapport pour la première fois.

This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. (Ce texte éligible n'inclut que des phrases de prose, c'est-à-dire que nous n'analysons que des blocs de texte rédigés en phrases grammaticalement standard et n'incluons pas d'autres types d'écriture comme les listes, les puces (structures courtes qui ne sont pas des phrases) ou d'autres structures qui ne sont pas des phrases.)

Le dénominateur, c'est-à-dire la base à partir de laquelle le pourcentage est calculé, est donc constitué des phrases de prose. Tout ce qui n'est pas une phrase de prose se trouve hors de cette base. Pour une répartition plus détaillée de ce qui entre dans cette catégorie et de ce qui en sort, voyez ce que signifie le texte éligible dans Turnitin. À partir de la définition ci-dessus, voici la version courte :

  • Phrases de prose (phrases grammaticalement standard) : comptées comme texte éligible
  • Listes et puces : exclues, décrites comme « short non-sentence structures » (structures courtes qui ne sont pas des phrases)
  • Autres structures qui ne sont pas des phrases : exclues par la même formulation

Ce qui fait bouger le dénominateur et ce qui ne le fait pas

C'est ici que cela devient pratique. Comme le dénominateur ne comprend que la prose, couper différentes parties de votre travail a des effets différents sur ce à quoi le pourcentage est mesuré.

  • Couper des phrases de prose : le dénominateur change
  • Couper des listes ou des puces : le dénominateur reste le même. La définition ci-dessus les nomme comme exclues
  • Couper un tableau : cela dépend de ce qu'il contient. Les notes de version de Turnitin d'août 2023 disent « We are now able to process long-form prose text in tables. » (Nous sommes désormais capables de traiter du texte de prose long dans les tableaux.) Les entrées courtes d'un tableau ne sont pas des phrases de prose ; un paragraphe situé dans une cellule de tableau en est une.

C'est ici que la documentation cesse d'aider. Turnitin ne dit pas si le retrait de prose fera monter le pourcentage, le fera descendre ou le laissera où il est. Le résultat dépend de la prose que vous retirez : des phrases signalées ou non signalées. Vous ne pouvez pas le savoir à l'avance, à moins d'avoir déjà un rapport. Et même avec un rapport en main, les surlignages montrent ce que le modèle a signalé dans la version actuelle, et non ce qu'il signalera après vos modifications. Ce que la documentation permet de dire, c'est ce qui fait bouger le dénominateur et ce qui ne le fait pas. Elle ne permet pas de dire dans quelle direction va le chiffre lorsque le dénominateur bouge.

Couper vers un document plus court

Il y a un second problème qui apparaît lorsque vous coupez beaucoup. La page FAQ de Turnitin reconnaît que les documents courts se comportent différemment.

In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. (Dans les documents plus courts où il n'y a que quelques centaines de mots, la prédiction sera surtout « tout ou rien », car nous prédisons sur un seul segment, sans possibilité de chevauchement.)

Dès qu'un document se réduit à quelques centaines de mots, le modèle prend ce qui est essentiellement une décision unique sur l'ensemble du texte. Le pourcentage cesse d'être une lecture fine et se rapproche d'un jugement binaire. C'est notre inférence à partir de la citation, ce n'est pas la formulation de Turnitin. La citation elle-même dit « all or nothing » (tout ou rien) et en donne la raison : un segment unique, sans chevauchement.

Results show that our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate. (Les résultats montrent que notre exactitude augmente avec un peu plus de texte, si bien que les dépôts contenant moins de 300 mots peuvent donner un score d'écriture par IA probablement moins exact.)

Cette affirmation ne figure pas sur la page FAQ. Elle apparaît dans une note de version de décembre 2023, sur la page de Turnitin consacrée au modèle de détection de l'écriture par IA. Lisez-la attentivement : elle dit « less accurate, » (moins exact), et non « higher » (plus élevé) ni « lower. » (plus bas). L'exactitude concerne la question de savoir si le score reflète la réalité, et non la direction dans laquelle le chiffre se déplace. Un score moins exact peut dépasser ou rester en deçà. La documentation ne dit pas lequel des deux. Ce que cela signifie pour vous, c'est qu'atteindre votre limite de mots et rester dans la plage où la lecture est fiable peuvent être deux objectifs différents, parfois contradictoires. Si vous voulez comprendre pourquoi les travaux courts affichent souvent des lectures extrêmes, voyez pourquoi Turnitin signale les travaux courts comme 100 % IA.

Que faire lorsque vous avez une limite de mots

Compte tenu de tout ce qui précède, voici ce que vous pouvez réellement faire lorsque vous devez raccourcir un travail et que le pourcentage d'IA vous préoccupe.

  • Si vous avez déjà un rapport, vérifiez quelles sections de prose sont surlignées avant de couper. La prose signalée et la prose non signalée agissent différemment sur le pourcentage, et vous voulez savoir laquelle est laquelle avant de commencer à supprimer.
  • Réduisez d'abord les listes et les puces. Elles sont nommées comme exclues ; les couper fait donc baisser votre nombre de mots sans toucher au dénominateur. Les tableaux ne relèvent pas d'une supposition sûre : vérifiez si les cellules contiennent des entrées courtes ou des paragraphes entiers avant de les traiter comme libres.
  • Surveillez la longueur. La FAQ de Turnitin dit que, dans les documents de « only a few hundred words » (seulement quelques centaines de mots), la prédiction devient surtout « all or nothing » (tout ou rien), et sa note de version dit que l'exactitude augmente avec un peu plus de texte.
  • Si le dépôt fait moins de 300 mots, prenez le pourcentage avec scepticisme. Turnitin dit elle-même que le score peut être moins exact à cette longueur. Cela concerne la fiabilité de la lecture, non une direction dans laquelle le chiffre va se déplacer.

Rien de tout cela ne vous dit que le pourcentage va baisser après la coupe. Le dénominateur peut se déplacer, l'exactitude peut baisser, mais la direction n'est pas quelque chose que la documentation prédit. Si vous préférez travailler sur la prose elle-même plutôt que de simplement couper autour, baisser votre score d'IA sans casser les citations traite ce point séparément. L'outil de condensation de HumanPen réduit la verbosité vers un nombre de mots cible que vous fixez, pour l'ensemble du .docx ou pour les paragraphes que vous sélectionnez, et renvoie un fichier modifiable. Il ne promet pas un score d'IA précis, parce que, pour les raisons que cet article vient d'exposer, personne ne le peut.

CONTINUER LA LECTURE