Un bon vocabulaire signalé comme IA ? Voici pourquoi

De nombreux étudiants constatent que leurs meilleurs textos — ceux qui ont un vocabulaire riche et des phrases soignées — sont détectés comme IA. Ce n'est pas que la qualité de l'écriture pose problème. C'est que le détecteur analyse les schémas de probabilité des mots, et certains textes académiques formels partagent des traits statistiques avec les contenus générés par IA.

L'équipe HumanPen

· 4 min de lecture

La réponse courte

Avoir un bon vocabulaire ne déclenche pas automatiquement un signal IA. Le détecteur n'évalue pas la qualité de vos choix lexicaux, mais la probabilité statistique de vos séquences de mots. Une prose académique formelle qui utilise des structures de phrases cohérentes, des transitions standards et des schémas de vocabulaire prévisibles peut produire des profils de probabilité qui se rapprochent de ce que le modèle a appris à associer aux textes générés par IA. Le problème n'est pas que votre vocabulaire est « trop bon ». C'est que le profil statistique de votre texte, façonné par une structure uniforme et des schémas de mots formels, peut ressembler à une écriture machine. La FAQ de Turnitin classe le « content without a lot of structural variation » (contenu sans grande variation structurelle) parmi les caractéristiques susceptibles de générer des faux positifs. Un vocabulaire élaboré couplé à une structure uniforme correspond à cette description.

Comment le détecteur analyse vos mots

La FAQ de Turnitin décrit le processus ainsi :

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu'un document est soumis à Turnitin, des phrases sont extraites et découpées en sections qui se chevauchent pour analyse prédictive. Chaque section est classée par le modèle de détection d'IA et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit humain ou généré par IA. Chaque phrase éligible dans ces sections hérite du score de sa section. Comme les sections se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite fusionnés en un score unique. Ces scores sont agrégés pour calculer le score global d'écriture IA du document.)

Le modèle ne lit pas votre vocabulaire pour décider qu'il est trop sophistiqué pour un humain. Il classe des segments selon des schémas de probabilité lexicale. Deux affirmations de la FAQ précisent ce que le modèle mesure : "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Notre modèle n'est pas explicitement programmé pour évaluer des signaux spécifiques comme la « burstiness », la « perplexité » ou d'autres métriques individuelles parfois évoquées dans les discussions publiques.) Et : "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nos classificateurs sont entraînés à détecter ces différences de probabilité des mots et sont compétents pour identifier les séquences de probabilité lexicale propres aux auteurs humains.)

Le modèle ne calcule pas une métrique appelée perplexité. Mais il est entraîné sur des données de probabilité lexicale. Une écriture académique formelle qui utilise systématiquement les mêmes mots de transition, les mêmes amorces de phrases et les mêmes schémas de vocabulaire peut produire des séquences de probabilité qui ressemblent davantage à des textes générés par IA qu'aux schémas variés et moins prévisibles d'une écriture humaine naturelle. Ce que mesurent les détecteurs d'IA au-delà de la perplexité et de la burstiness explique tout cela en détail.

Pourquoi une écriture soignée correspond au profil des faux positifs

La FAQ recense les textes sujets aux faux positifs :

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Parfois, les faux positifs — qui signalent à tort un texte humain comme généré par IA — peuvent concerner des contenus sans grande variation structurelle, des textes qui se répètent littéralement, ou des textes paraphrasés sans développer de nouvelles idées.)

La phrase suivante précise : "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si notre indicateur montre une quantité plus élevée d'écriture IA dans ce type de texte, nous vous conseillons d'en tenir compte lorsque vous examinez le pourcentage indiqué.)

Une prose académique bien révisée peut correspondre au premier critère. Quand vous peaufinez votre texte, vous pouvez standardiser vos structures de phrases, utiliser des transitions cohérentes et appliquer un vocabulaire formel de bout en bout. Cela produit un texte avec peu de « variation structurelle ». Ce qui améliore votre texte sur le plan littéraire peut le rendre plus uniforme sur le plan statistique, et c'est cette uniformité que pointe la description des faux positifs. C'est tout l'argument développé dans pourquoi les détecteurs d'IA signalent les essais bien écrits.

Le score ne juge pas la qualité

La FAQ précise également :

"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors." (C'est pourquoi nous insistons sur le fait que le pourcentage affiché par l'indicateur d'écriture IA ne doit pas être utilisé comme seul fondement d'une décision ni comme mesure de notation définitive par les enseignants.)

Le score IA n'est pas une évaluation qualitative. Il ne signifie pas que votre écriture est trop bonne, trop soignée ou trop formelle. Il indique que la classification du modèle selon les schémas de probabilité lexicale a produit un certain pourcentage. Un score élevé sur un texte bien écrit et riche en vocabulaire n'invalide pas la qualité de votre travail. Cela signifie simplement que le profil statistique de votre texte recoupe des schémas que le modèle associe à l'IA. Savoir si vous devriez écrire différemment à cause de cela est une autre question : faut-il changer sa façon d'écrire pour éviter d'être signalé.

Que faire ?

Pour résumer ce que nous avons vu :

  • Un bon vocabulaire ne déclenche pas automatiquement un signal IA. Le détecteur analyse des schémas de probabilité des mots, pas la qualité du vocabulaire.
  • Une prose académique formelle avec une structure uniforme peut partager des traits statistiques avec des textes générés par IA.
  • Turnitin classe le « content without a lot of structural variation » (contenu sans grande variation structurelle) parmi les caractéristiques susceptibles de générer des faux positifs.
  • Peaufiner un texte peut réduire sa variation structurelle, le rendant plus uniforme sur le plan statistique.
  • Le score ne juge pas la qualité de l'écriture et ne doit pas être le seul fondement d'une décision.

Si vous avez un rapport Turnitin qui montre quels passages ont été signalés, importez le rapport et travaillez sur ces passages spécifiques. Les passages éligibles peuvent être retraités sans frais.

CONTINUER LA LECTURE