Détection AIGC pour les articles en anglais : ce que cela signifie et comment cela fonctionne

« Détection AIGC » est le terme que beaucoup de chercheurs chinois emploient pour parler de la détection de l’écriture par IA dans les articles en anglais. Le mécanisme de détection est le même, quel que soit le nom qu’on lui donne. La FAQ de Turnitin décrit une chaîne de traitement qui classe des segments de texte chevauchants selon la probabilité des mots. Comprendre ce mécanisme vous aide à lire votre rapport correctement.

L'équipe HumanPen

· 4 min de lecture

La réponse courte

La détection AIGC pour les articles en anglais désigne le même processus que la détection de l’écriture par IA. Le détecteur de Turnitin découpe votre texte en segments chevauchants, classe chaque segment selon la probabilité qu’il soit humain ou généré par IA, puis agrège ces scores en un pourcentage au niveau du document. Le terme « AIGC » (AI-generated content, contenu généré par IA) est courant dans les milieux académiques chinois, mais le mécanisme de détection est le même, quel que soit le nom qu’on lui donne. Le détecteur ne recherche pas les signatures ou les filigranes d’outils d’IA précis. Il lit des schémas statistiques dans le choix des mots, plus précisément des schémas de probabilité des mots appris pendant l’entraînement. Le score IA est totalement indépendant du score de similarité (plagiat), et seuls les enseignants ou les administrateurs peuvent voir l’indicateur IA.

Comment fonctionne la détection AIGC

La FAQ de Turnitin décrit la chaîne de détection :

« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score. » (Lorsqu’un devoir est soumis à Turnitin, les phrases du dépôt sont extraites et segmentées en sections chevauchantes pour l’analyse de prédiction. Chaque segment est classé par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, indiquant la probabilité que le texte soit plutôt humain ou généré par IA. Chaque phrase admissible au sein de ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul. Ces scores de phrase sont à leur tour agrégés et servent à calculer le score global d’écriture par IA du document.)

Le détecteur ne recherche pas des formulations précises qui « ressemblent à de l’IA ». Il classe des segments de texte à l’aide d’un modèle qui a appris des schémas statistiques à partir des données d’entraînement. Chaque segment reçoit une probabilité, et ces probabilités sont regroupées puis agrégées en un pourcentage unique. Ce pourcentage représente la part du texte admissible que le modèle classe comme probablement généré par IA.

Ce que le modèle lit

Deux affirmations de la FAQ précisent l’approche du modèle. Premièrement : « Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. » (Notre modèle n’est pas explicitement programmé pour évaluer des signaux particuliers tels que 'burstiness', 'perplexity' ou d’autres mesures individuelles parfois évoquées dans les débats publics.) La phrase suivante : « Instead, it learns statistical patterns from our training data. » (Il apprend plutôt des schémas statistiques à partir de nos données d’entraînement.) Deuxièmement : « Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers. » (Nos classifieurs sont entraînés à détecter ces différences de probabilité des mots et maîtrisent les séquences de probabilité de mots propres aux rédacteurs humains.)

Le modèle ne calcule pas de mesures nommées comme la burstiness ou la perplexité. Mais il est entraîné sur des données de probabilité des mots. Les schémas qu’il apprend s’expriment dans la façon dont les mots sont choisis et enchaînés, et non dans des caractéristiques de surface comme la variation de la longueur des phrases ou la diversité du vocabulaire. C’est pourquoi des retouches de surface — changer quelques mots ou ajouter des transitions — peuvent ne pas modifier le score. Le détecteur lit des caractéristiques statistiques plus profondes des séquences de mots, ce qui est l’objet de ce que les détecteurs d’IA mesurent au-delà de la perplexité et de la burstiness.

Seule la prose est analysée

La FAQ précise ce qui compte comme texte analysable :

« This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. » (Ce texte admissible n’inclut que des phrases de prose, c’est-à-dire que nous n’analysons que des blocs de texte rédigés en phrases grammaticales standard et qui n’incluent pas d’autres types d’écriture comme des listes, des puces (structures courtes qui ne sont pas des phrases) ou d’autres structures qui ne sont pas des phrases.)

La phrase suivante : « This percentage is not necessarily the percentage of the entire submission. » (Ce pourcentage n’est pas nécessairement celui de l’ensemble du dépôt.)

Pour les articles académiques en anglais, cela signifie que vos tableaux de méthodologie, vos blocs d’équations, vos légendes de figures et votre bibliographie sont en grande partie exclus de l’analyse IA. Le pourcentage ne s’applique qu’aux parties en prose de votre manuscrit. Un article riche en tableaux et en équations contient moins de texte admissible, ce qui signifie que le pourcentage d’IA représente une part plus réduite du document qu’il n’y paraît. Comment lire un rapport d’écriture IA Turnitin détaille l’endroit où cet écart apparaît sur la page.

Score AIGC et score de similarité

Les deux scores sont deux mesures distinctes :

« The Similarity score and the AI writing detection percentage are completely independent and do not influence each other. » (Le score de similarité et le pourcentage de détection de l’écriture par IA sont totalement indépendants et ne s’influencent pas l’un l’autre.)

Votre score de similarité indique la part de votre texte qui correspond à des sources existantes dans la base de données. Votre score AIGC indique la part de votre texte que le modèle classe comme probablement généré par IA. Un article peut avoir une similarité élevée (à cause de sources correctement citées) et un score AIGC faible, ou une similarité faible et un score AIGC élevé. Travailler sur un score n’a pas d’effet sur l’autre. Si vous cherchez à faire baisser votre score AIGC, faire baisser votre score de similarité ne vous aidera pas, et inversement ; prendre les deux scores pour une seule et même chose est l’erreur la plus fréquente.

Que faire si votre score AIGC est élevé

Pour résumer ce que nous avons vu :

  • La détection AIGC pour les articles en anglais fonctionne comme la détection de l’écriture par IA : elle classe des schémas de probabilité des mots dans des segments de prose.
  • Le modèle ne calcule pas la burstiness ni la perplexité comme mesures nommées, mais il est entraîné sur des données de probabilité des mots.
  • Seules les phrases de prose sont analysées. Les tableaux, les équations et les bibliographies sont en grande partie exclus.
  • Le score AIGC et le score de similarité sont totalement indépendants. Modifier l’un n’affecte pas l’autre.
  • Seuls les enseignants et les administrateurs peuvent voir l’indicateur IA. Les étudiants peuvent demander la version PDF à leur enseignant.

Si vous disposez d’un rapport Turnitin ou iThenticate indiquant quels passages ont été signalés, importez le rapport et travaillez sur ces passages précis. Les passages remplissant les conditions peuvent être relancés gratuitement.

CONTINUER LA LECTURE