Turnitin a testé son propre détecteur pour y chercher un biais à l'encontre des apprenants de l'anglais. Le résultat a deux moitiés.
Pour les copies de plus de 300 mots, Turnitin indique que l'écart entre scripteurs L2 et scripteurs L1 est faible et non significatif au plan statistique. Pour les copies de 150 à 300 mots, la même évaluation a trouvé un écart plus large, nettement au-dessus de sa propre cible de 1 %. Et Turnitin énonce une limite sur son propre échantillon qui compte si vous écrivez à l'échelle d'un travail universitaire.
L'équipe HumanPen
· 6 min de lecture
La réponse courte, avec ses deux moitiés
Turnitin a mené sa propre évaluation sur cette question et en a publié le résultat. La réponse a deux moitiés, et elles pointent dans des directions opposées.
Pour les copies de 300 mots ou plus, l'écart de taux de faux positifs (FPR) entre apprenants de l'anglais (L2) et anglophones de naissance (L1) s'est révélé faible et non significatif au plan statistique. Pour les copies de 150 à 300 mots, la même évaluation a trouvé un écart plus large, nettement au-dessus de sa propre cible de 1 %.
Que le résultat rassurant vous couvre ou non dépend donc de la longueur de ce que vous avez déposé. Il y a aussi une limite que Turnitin énonce au sujet de son propre échantillon : elle compte si vous écrivez au niveau universitaire, et elle se trouve plus bas.
Ce qui a été testé
Turnitin a réuni jusqu'à 2,000 textes pour chaque combinaison de deux variables : anglais L2 (apprenant de l'anglais) contre anglais L1 (anglais langue maternelle), et « trop court » (entre 150 et 300 mots) contre « assez long » (300 mots ou plus). Les jeux de données ne faisaient pas partie du jeu d'entraînement de leur détecteur.
Le résultat qui fait le titre
Pour les documents qui atteignent le minimum de 300 mots, Turnitin indique que l'écart de taux de faux positifs entre scripteurs L2 et scripteurs L1 est faible et non significatif au plan statistique :
« For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target. » (Pour les documents qui remplissent notre exigence de longueur minimale de 300 mots, la différence de taux de faux positifs (FPR) entre les scripteurs anglophones L2 (scripteurs ELL) et les scripteurs anglophones L1 (anglophones natifs) est faible et non significative au plan statistique, ce qui montre que notre détecteur n'est pas biaisé entre ces deux groupes. De plus, bien que la FPR de chaque groupe soit légèrement supérieure à notre cible globale de 0,01 (1 %), elle ne s'en écarte pas de manière significative dans aucun des deux groupes.)
« Not statistically significant » (non significatif au plan statistique) signifie que la différence trouvée pourrait n'être que du bruit. Cela ne veut pas dire que la différence est nulle, ni qu'aucun biais n'existe. Et le taux de faux positifs des deux groupes était au-dessus de la cible de 1 %, simplement pas d'une marge que le test a jugée significative. « Slightly higher » (légèrement supérieur) n'est pas « at or below. » (à la cible ou en dessous).
Le résultat qui ne fait pas le titre
Pour les documents de 150 à 300 mots, la même évaluation a trouvé la direction inverse. L'écart entre scripteurs L2 et scripteurs L1 était plus large et le taux de faux positifs nettement au-dessus de la cible de 1 % :
« Conversely, for documents that are (À l'inverse, pour les documents qui sont) "too short," (trop courts :) we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum. » (Dans ce cas, nous avons constaté un écart plus grand de FPR entre ces deux groupes de scripteurs, nettement supérieur à notre cible de 0,01. Cela confirme une nouvelle fois notre constat précédent : les détecteurs d'écriture par IA ont besoin d'échantillons plus longs pour identifier correctement un contenu généré par IA et maintenir les faux positifs au minimum.)
La même étude, sur le même détecteur, a donné un résultat pour les textes longs et un autre pour les textes courts. Le titre du billet porte le premier. Le second est dans le corps du texte.
Ce que contenait réellement l'échantillon
Voici ce qu'écrit Turnitin :
« Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation. » (La plupart des documents en anglais L2 sont des tâches d'écriture courtes, argumentatives ou informatives, très proches du corpus de dissertations du secondaire de l'Automated Scoring and Assessment Prize (ASAP). Aucune collection comparable, accessible au public, de documents universitaires complets rédigés par des scripteurs L2 et L1 n'était disponible pour cette évaluation.)
Les écrits L2 de cette évaluation sont surtout des rédactions de niveau secondaire. Si vous rédigez un mémoire universitaire, une revue de littérature, un rapport de laboratoire ou un chapitre de thèse, ce n'est pas ce qui a été testé. Turnitin indique qu'ils n'ont pas trouvé de corpus public de documents universitaires complets rédigés par des scripteurs L2 et L1 pour faire cette comparaison. Le résultat « not statistically significant » (non significatif au plan statistique) vaut pour des rédactions courtes, argumentatives ou informatives, de niveau secondaire. Qu'il tienne aussi pour le type de document que vous déposez réellement, c'est une question à laquelle cette évaluation ne peut pas répondre.
La barre des 300 mots
Turnitin rattache directement le minimum de 300 mots à ces travaux. Après avoir évalué 800,000 documents et constaté que les copies courtes faisaient grimper le taux de faux positifs, ils sont passés à cette exigence de 300 mots :
« Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission. » (Notre évaluation de 800,000 documents, évoquée plus haut dans ce billet, montre un taux de faux positifs légèrement plus élevé que souhaitable sur les copies courtes (moins de 300 mots). Il se peut que ces échantillons si brefs ne contiennent pas assez de signal ni de marqueurs pour repérer les différences de distribution qui trahissent l'écriture par IA. Afin de nous assurer de maintenir notre taux de faux positifs sous 1 %, nous avons rapidement relevé à 300 mots la longueur minimale de copie traitée par notre capacité de détection de l'écriture par IA.)
Ce minimum existe parce que les textes courts ont posé problème. Le résultat rassurant ne vaut qu'au-dessus de ce minimum. En dessous, la même évaluation a trouvé l'écart que vous aimeriez connaître.
Et l'étude de Liang ?
Vous avez peut-être vu des titres liés à une étude de Liang. Turnitin y répond directement :
« Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short. » (L'affirmation de Liang repose sur un petit ensemble de travaux, à savoir 91 dissertations d'entraînement au TOEFL (Test of English as a Foreign Language), toutes de moins de 150 mots. La détection de l'écriture par IA de Turnitin n'a pas été incluse dans cette évaluation, peut-être en partie parce que nous ne formulons pas de prédictions sur des documents aussi courts.)
Quoi faire de tout cela
Si votre copie dépasse 300 mots, les données de Turnitin elles-mêmes disent que l'écart entre les taux de faux positifs L2 et L1 est faible et non significatif au plan statistique. Ce n'est pas la garantie que vous ne serez pas signalé. Cela signifie que l'évaluation n'a pas trouvé de preuve solide que les scripteurs L2 soient systématiquement désavantagés, du moins pas dans l'échantillon dont ils disposaient.
Voici ce que vous pouvez vraiment utiliser :
Vérifiez votre nombre de mots avant de déposer. Si une section de moins de 300 mots est signalée, l'évaluation du détecteur elle-même dit que les textes courts produisent un écart plus large entre scripteurs L2 et scripteurs L1 et un taux de faux positifs plus élevé dans l'ensemble. Vous pouvez demander à votre enseignant de faire tourner la vérification sur le document complet plutôt que sur un court extrait.
Demandez ce qui vous a signalé et à quel seuil. Si Turnitin a été utilisé, le minimum de 300 mots et le détail « slightly higher than 1% » (légèrement au-dessus de 1 %) sont des éléments précis que vous pouvez soulever auprès de la personne qui examine le signalement.
Conservez vos brouillons, vos notes et vos sources. Si vous êtes signalé et que vous pensez que votre anglais L2 a joué un rôle, montrer votre historique de révisions et vos documents sources, c'est ce qui dénoue la conversation. Discuter de significativité statistique avec votre professeur, probablement pas.
CONTINUER LA LECTURE
Pourquoi les auteurs non natifs de l'anglais sont plus souvent signalés par les détecteurs d'IA
8 min de lecture
Rapports de détectionLe taux de faux positifs de Turnitin, expliqué
5 min de lecture
Rapports de détectionDocuments courts et le problème du tout ou rien dans Turnitin
6 min de lecture