GPTZero vs Turnitin : pourquoi les scores diffèrent et ce que chaque outil mesure réellement
Si vous soumettez le même texte à GPTZero et à Turnitin, les scores ne correspondent souvent pas. Ce n'est pas le signe qu'un outil est défectueux. Les différents détecteurs utilisent des modèles distincts, des données d'entraînement différentes et des conventions de notation propres à chacun. Voici ce que la documentation de Turnitin explique sur le fonctionnement de son détecteur et pourquoi il est peu fiable de comparer des outils entre eux.
L'équipe HumanPen
· 5 min de lecture
Des détecteurs différents reposent sur des modèles différents
GPTZero et Turnitin sont des systèmes distincts, développés par des équipes séparées. Chacun dispose de son propre modèle sous-jacent, de ses propres données d'entraînement et de sa propre approche pour classifier les textes. Lorsque deux détecteurs utilisent des modèles différents, leurs résultats ne peuvent pas s'aligner sur un même document. Un texte que GPTZero évalue à 60 % AI peut recevoir un score de 30 % de la part de Turnitin, ou l'inverse. Aucun des deux scores n'est nécessairement erroné. Il s'agit d'estimations probabilistes issues de modèles différents, entraînés sur des données différentes.
Il n'existe pas de score universel de détection AI vers lequel tous les outils convergeraient. C'est là que réside le problème expliqué dans pourquoi un même texte obtient des scores différents sur chaque détecteur. Chaque outil produit sa propre estimation. Comparer les scores d'un outil à l'autre comme s'ils mesuraient la même chose dans les mêmes unités conduit à la confusion.
Nous n'affirmons pas qu'un outil est plus précis qu'un autre. La documentation décrit le fonctionnement du détecteur Turnitin, qui diffère de celui des autres outils.
Comment Turnitin attribue un score à un document
La documentation de Turnitin décrit un processus spécifique pour obtenir un score AI au niveau du document :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu'un document est soumis à Turnitin, les phrases sont extraites et découpées en segments qui se chevauchent pour l'analyse prédictive. Chaque segment est classifié par le modèle de détection AI et reçoit une valeur entre 0 et 1, représentant la probabilité que le texte soit généré par un humain ou par une IA. Chaque phrase éligible dans ces segments hérite du score de son segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un score unique. Ces scores par phrase sont agrégés pour calculer le score AI global du document.)
Le score agrège des prédictions au niveau des segments. Ces segments se chevauchent et les scores des phrases sont regroupés avant agrégation. D'autres détecteurs peuvent découper le texte différemment, utiliser d'autres unités de prédiction ou agréger les scores d'une autre manière.
La documentation de Turnitin précise également que le pourcentage de détection AI et le score Similarity sont des mesures indépendantes. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Le score Similarity et le pourcentage de détection AI sont totalement indépendants et ne s'influencent pas mutuellement.) Le score Similarity indique le pourcentage de texte correspondant trouvé dans le document soumis lorsqu'il est comparé à la collection complète de contenus de Turnitin utilisée pour la vérification de similarité. Un score Similarity élevé ne signifie pas un score AI élevé, et vice versa. Rapport d'écriture IA Turnitin vs rapport de similarité présente les deux côte à côte.
L'objectif de Turnitin en matière de faux positifs
Turnitin indique un objectif précis concernant le taux de faux positifs dans sa documentation :
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nous nous efforçons de maximiser l'efficacité de notre détecteur tout en maintenant notre taux de faux positifs — identifier à tort un texte entièrement rédigé par un humain comme étant généré par une IA — en dessous de 1 % pour les documents contenant plus de 20 % de contenu AI.)
La documentation reformule ensuite ainsi : "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Autrement dit, nous pourrions signaler un document rédigé par un humain comme étant généré par une IA dans un cas sur cent pour les documents entièrement rédigés par des humains.) Cette reformulation omet la précision « plus de 20 % de contenu AI ». La version avec le seuil de 20 % est la formulation la plus exacte.
Pour valider ce taux, Turnitin décrit un processus de test : "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Pour renforcer notre cadre de test et diagnostiquer les tendances statistiques des faux positifs, avant chaque mise à jour ou nouvelle version de modèle, nous effectuons des tests sur plus de 700 000 articles académiques supplémentaires rédigés avant la sortie de ChatGPT afin de valider davantage notre taux de faux positifs inférieur à 1 %.)
Telle est la cible déclarée de Turnitin et son processus de validation. Le coût réel d'un taux de 1 % à l'échelle des soumissions universitaires est détaillé dans ce que signifie un taux de faux positifs de 1 %. D'autres détecteurs peuvent avoir des objectifs différents, des méthodes de validation distinctes, ou ne pas publier de chiffres comparables. Nous ne pouvons pas établir de comparaison directe de précision entre les outils sur la base de ces informations. Nous rapportons uniquement ce que dit la documentation de Turnitin.
Les documents courts se comportent différemment
La longueur du document affecte le comportement du détecteur Turnitin. Pour les textes courts, le mécanisme de notation peut produire des résultats extrêmes :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents courts de quelques centaines de mots seulement, la prédiction sera principalement du type « tout ou rien » car nous prédisons sur un seul segment sans possibilité de chevauchement.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Cela signifie que certains textes mêlant contenu généré par une IA et contenu original peuvent être signalés comme entièrement générés par une IA.)
Le mécanisme de chevauchement qui lisse les scores dans les documents longs ne fonctionne pas lorsqu'il n'y a qu'un seul segment à analyser. Quelques centaines de mots d'un texte mêlant humain et AI peuvent revenir avec un score de 100 % AI. C'est l'une des raisons expliquées dans pourquoi Turnitin indique que votre travail est 100 % IA. Il s'agit d'une limitation liée aux entrées courtes, pas d'un jugement définitif sur la composition du texte.
Si GPTZero attribue un score différent à un document court, le comportement tout-ou-rien en est une explication. Les deux outils traitent les textes courts différemment parce que leurs architectures de notation diffèrent.
La plage marquée d'un astérisque : 1-19 %
Turnitin n'affiche pas de score numérique pour les résultats de détection AI compris entre 1 % et 19 %. La documentation indique :
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (Pour éviter toute incidence potentielle de faux positifs, aucun score ni surlignage n'est attribué pour les scores de détection AI dans la plage de 1 % à 19 %. Lorsque la détection AI est inférieure au seuil de 20 % dans le rapport, elle est désormais indiquée par un astérisque (%) et aucun pourcentage n'est attribué.)
Cela signifie que si le modèle de Turnitin estime le contenu AI à 12 %, le rapport affichera un astérisque plutôt qu'un chiffre. Aucun surlignage n'est appliqué non plus. Le raisonnement consiste à éviter d'afficher de potentiels faux positifs dans une plage de faible confiance, comme l'explique plus en détail ce que signifie l'astérisque (*%) sur un score IA Turnitin.
GPTZero et d'autres outils peuvent afficher les scores dans cette plage différemment. Certains affichent un pourcentage complet pour tout résultat non nul. Turnitin supprime le chiffre en dessous de 20 %. C'est une autre raison pour laquelle les scores ne correspondront pas : un outil peut afficher un pourcentage là où l'autre n'affiche qu'un astérisque.
Ce que cela signifie pour vous
Si vous comparez les scores GPTZero et Turnitin sur le même document, voici ce qu'il faut garder à l'esprit :
- Des modèles différents, des scores différents. GPTZero et Turnitin utilisent des modèles de détection distincts, entraînés sur des données séparées. Leurs scores ne sont pas censés correspondre.
- Turnitin score par agrégation de segments. Le texte est découpé en segments, noté par segment, puis agrégé. Le score AI et le score Similarity sont totalement indépendants.
- Turnitin vise moins de 1 % de faux positifs pour les documents contenant plus de 20 % de contenu AI, validé sur plus de 700 000 articles académiques supplémentaires rédigés avant la sortie de ChatGPT.
- Les documents courts reçoivent des scores tout-ou-rien. Quelques centaines de mots peuvent produire un résultat de 0 % ou 100 % même lorsque le texte est mélangé.
- Les scores inférieurs à 20 % s'affichent par un astérisque. Aucun pourcentage numérique ni surlignage n'apparaît dans la plage 1-19 %.
Les passages éligibles peuvent être retraités sans frais.