Signalé comme IA parce que vous n'êtes pas anglophone ? Ce que dit la documentation

Écrire dans une langue seconde est déjà bien assez difficile sans y ajouter un signalement pour IA. La FAQ de Turnitin indique que les données d'entraînement incluaient des apprenants de langue seconde afin de réduire les biais, mais elle ne donne aucun chiffre. Le détecteur continue de lire des schémas de probabilité des mots. Certains schémas d'écriture académique courants chez les non-anglophones peuvent recouper les caractéristiques qui favorisent les faux positifs.

L'équipe HumanPen

· 4 min de lecture

La réponse courte

Un anglophone non natif peut être signalé pour IA sur un texte entièrement écrit par un humain. La FAQ de Turnitin indique que les données d'entraînement du modèle « took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries » (ont pris en compte des groupes statistiquement sous-représentés, comme les apprenants d'anglais langue seconde et les personnes qui utilisent l'anglais dans des pays non anglophones) afin de réduire les biais. Il s'agit de l'affirmation de l'entreprise elle-même, qui n'a pas été vérifiée de façon indépendante. Le détecteur fonctionne toujours en classant les schémas de probabilité des mots dans un texte en prose. L'écriture académique formelle enseignée aux non-anglophones, avec ses modèles structurés et ses transitions standard, peut produire un texte à faible variation structurelle. Cette caractéristique figure dans la liste que Turnitin établit lui-même des types de texte sujets aux faux positifs. Être signalé ne signifie donc pas que votre anglais est trop bon ou trop mécanique. Cela signifie que le profil statistique de votre texte a recoupé des schémas que le modèle associe à l'IA.

Ce que Turnitin affirme au sujet de la diversité des données d'entraînement

La FAQ aborde directement la question des biais :

« While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model. » (Lors de la création de notre jeu de données d'échantillons, nous avons également pris en compte des groupes statistiquement sous-représentés, comme les apprenants d'anglais langue seconde, les personnes qui utilisent l'anglais dans des pays non anglophones, les étudiants d'établissements aux effectifs diversifiés et les domaines d'études moins courants tels que l'anthropologie, la géologie, la sociologie et d'autres, afin de réduire les biais lors de l'entraînement de notre modèle.)

Voilà comment Turnitin décrit sa propre méthodologie d'entraînement. Ce qui est affirmé, c'est que l'écriture en langue seconde était représentée dans les données d'entraînement. Ce que cette affirmation ne contient pas, ce sont des chiffres, des résultats de tests ou une validation externe des performances du modèle sur l'écriture en langue seconde. La FAQ ne publie pas de taux de faux positifs ventilés entre anglophones natifs et non natifs. On affirme donc que des données variées ont été utilisées, mais l'efficacité de cet effort de diversification n'est pas mesurable de façon indépendante à partir de la documentation publique.

Comment le détecteur lit l'écriture en langue seconde

Le processus de détection est le même pour tous les textes :

« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score. » (Lorsqu'un devoir est soumis à Turnitin, les phrases de la soumission sont extraites et découpées en sections se chevauchant pour l'analyse de prédiction. Le modèle de détection d'IA classe chaque section et lui attribue une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit humain ou généré par IA. Chaque phrase retenue dans ces sections hérite du score de la section. Comme les sections se chevauchent, certaines phrases peuvent recevoir plusieurs scores, qui sont ensuite regroupés en un seul. Ces scores de phrase sont à leur tour agrégés et servent à calculer le score global d'écriture par IA du document.)

Le détecteur ne connaît pas votre parcours linguistique. Il lit des suites de mots et les classe. Si vos schémas d'écriture, façonnés par un enseignement formel de l'anglais, produisent des séquences de probabilité qui recoupent ce que le modèle a appris à associer à un texte généré par IA, le score peut être plus élevé que prévu. Ce que les détecteurs d'IA mesurent au-delà de la perplexité et de la variabilité du style détaille ces schémas.

Le recoupement avec les caractéristiques des faux positifs

La FAQ liste les textes sujets aux faux positifs :

« Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. » (Il arrive que les faux positifs — c'est-à-dire le fait de signaler à tort comme généré par IA un texte écrit par un humain — concernent des contenus présentant peu de variation structurelle, des textes qui se répètent littéralement ou des textes reformulés sans développer d'idées nouvelles.)

La phrase suivante : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur montre une proportion plus élevée d'écriture par IA dans ce type de texte, nous vous conseillons d'en tenir compte lorsque vous examinez le pourcentage indiqué.)

L'enseignement de l'anglais aux non-anglophones met souvent l'accent sur des modèles académiques structurés. Les étudiants apprennent des tournures standard, des transitions formelles et des structures de paragraphe régulières. Cela produit une écriture présentant le type d'uniformité que la FAQ décrit comme propice aux faux positifs. Le recoupement n'est pas intentionnel. Il découle de la manière dont l'anglais académique est enseigné aux non-anglophones et de la manière dont le détecteur caractérise un texte. Que la bonne réponse consiste à écrire autrement est une autre question : faut-il changer votre façon d'écrire pour éviter d'être signalé.

Que faire si vous êtes signalé

La FAQ indique :

« Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors. » (C'est pourquoi nous devons souligner que le pourcentage de l'indicateur d'écriture par IA ne doit pas être utilisé comme seule base de décision ni comme critère de notation définitif par les enseignants.)

Si votre texte écrit de votre main est signalé, vous avez matière à engager la discussion avec votre enseignant. Vous pouvez renvoyer aux descriptions que la FAQ donne des textes sujets aux faux positifs, expliquer votre processus d'écriture et rappeler que le score n'est qu'une donnée parmi d'autres. Vous pouvez aussi mentionner l'affirmation sur la diversité des données d'entraînement, tout en reconnaissant honnêtement qu'elle ne garantit pas l'immunité face aux faux positifs. Signalé, mais vous l'avez écrit vous-même explique comment monter ce dossier.

Ce que cela signifie pour vous

Pour résumer ce que nous avons vu :

  • Turnitin affirme que ses données d'entraînement incluaient des apprenants de langue seconde, mais ne fournit aucun chiffre permettant d'en vérifier l'efficacité.
  • Le détecteur lit des schémas de probabilité des mots, quel que soit le parcours linguistique.
  • L'écriture académique formelle courante chez les non-anglophones peut recouper les caractéristiques qui favorisent les faux positifs.
  • La FAQ indique que le score ne doit pas être la seule base de décision.
  • En cas de signalement, votre processus d'écriture et les propres descriptions de faux positifs de la FAQ vous donnent matière à discussion.

Si vous disposez d'un rapport Turnitin indiquant quels passages ont été signalés, importez le rapport et travaillez ces passages précis. Les passages éligibles peuvent être relancés gratuitement.

CONTINUER LA LECTURE