Sapling AI Detector vs Turnitin : ce que dit vraiment la documentation
Si vous passez le même texte dans le détecteur d’IA de Sapling et dans Turnitin, les scores diffèrent la plupart du temps. C’est normal. Les deux outils reposent sur des modèles différents, entraînés sur des données différentes, avec leurs propres conventions de notation. Voici ce que la documentation de Turnitin dit du fonctionnement de son détecteur et des raisons pour lesquelles les scores ne peuvent pas concorder.
L'équipe HumanPen
· 5 min de lecture
Sapling et Turnitin sont deux systèmes distincts
Le détecteur d’IA de Sapling et la détection d’écriture par IA de Turnitin sont conçus par des équipes différentes, à partir de modèles sous-jacents différents. Chacun a été entraîné sur ses propres données et classe les textes selon sa propre méthode. Quand deux détecteurs s’appuient sur des modèles différents, ils produisent des scores différents sur un même texte. Un passage que Sapling signale à 70 % d’IA peut recevoir 25 % chez Turnitin, ou l’inverse. Aucun des deux résultats n’est forcément faux. Ce sont des estimations de probabilité émises par des modèles différents, entraînés sur des jeux de données différents.
Il n’existe pas de score de détection d’IA universel vers lequel tous les outils convergeraient ; pourquoi un même texte obtient un score différent sur chaque détecteur détaille d’où viennent ces écarts. Chaque détecteur produit sa propre estimation. Prendre les scores de deux outils comme s’ils mesuraient la même chose dans les mêmes unités ne mène qu’à la confusion.
Nous ne prétendons pas dire quel outil est le plus fiable. Nous décrivons ce que la documentation de Turnitin affirme au sujet de son propre système, et pourquoi ce système produit des scores qui ne correspondront pas à ceux de Sapling.
Comment Turnitin calcule son score
Turnitin décrit un processus précis pour aboutir à son score d’écriture par IA :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (traduction : lorsqu’un devoir est soumis à Turnitin, les phrases de la soumission sont extraites et découpées en sections se chevauchant, en vue de l’analyse de prédiction. Chaque section est classée par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit d’origine humaine ou généré par IA. Chaque phrase admissible à l’intérieur de ces sections hérite du score de la section. Comme les sections se chevauchent, certaines phrases peuvent recevoir plusieurs scores, qui sont ensuite regroupés en un score unique. Ces scores de phrase sont à leur tour agrégés et servent à calculer le score global d’écriture par IA du document.)
Le processus consiste à extraire les phrases, à les découper en unités qui se chevauchent, à noter chaque section, à regrouper les scores obtenus par chaque phrase, puis à agréger le tout en un pourcentage à l’échelle du document. D’autres détecteurs, Sapling compris, peuvent adopter d’autres stratégies de découpage, d’autres unités de prédiction ou d’autres méthodes d’agrégation. Les deux outils ne sortiront donc pas les mêmes chiffres sur un même texte.
La documentation de Turnitin précise aussi que le pourcentage de détection d’écriture par IA et le score Similarity sont deux choses distinctes. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (traduction : le score Similarity et le pourcentage de détection d’écriture par IA sont totalement indépendants et n’ont aucune influence l’un sur l’autre.) Le score Similarity indique la part de texte correspondant à une source déjà connue dans le document soumis, comparé à l’ensemble du contenu que Turnitin utilise pour la vérification de similarité. Un document peut présenter une forte similarité et un faible score d’IA, ou l’inverse. Rapport d’écriture IA Turnitin et rapport Similarity, mis en regard confronte les deux rapports. Les deux chiffres n’ont aucune influence l’un sur l’autre.
Le taux de faux positifs annoncé par Turnitin
Turnitin publie un objectif chiffré en matière de faux positifs :
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (traduction : nous nous efforçons de maximiser l’efficacité de notre détecteur tout en maintenant notre taux de faux positifs — c’est-à-dire le fait d’identifier à tort comme généré par IA un texte entièrement rédigé par un humain — en dessous de 1 % pour les documents comportant plus de 20 % d’écriture par IA.)
La documentation le reformule ainsi : "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (traduction : en d’autres termes, il peut nous arriver de signaler comme écrit par IA un document rédigé par un humain, à raison d’un document sur 100 entièrement écrit par un humain.) Cette reformulation laisse tomber la réserve « plus de 20 % d’écriture par IA ». La version qui comporte le seuil de 20 % est plus précise.
Pour valider cet objectif, Turnitin décrit son dispositif de test : "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (traduction : afin de renforcer notre dispositif de test et de diagnostiquer les tendances statistiques en matière de faux positifs, nous effectuons, avant chaque mise à jour ou sortie d’un nouveau modèle, des tests sur plus de 700 000 articles académiques supplémentaires rédigés avant la sortie de ChatGPT, afin de confirmer que notre taux de faux positifs reste inférieur à 1 %.)
Voilà ce que Turnitin dit de son propre système. Pour mesurer ce que représente 1 % une fois que c’est une université entière qui soumet des copies à grande échelle, voyez ce que signifie un taux de faux positifs de 1 %. Sapling peut viser d’autres niveaux de précision, appliquer d’autres procédures de validation, ou ne pas publier de chiffres comparables. Nous ne pouvons pas comparer directement la fiabilité des deux outils. Nous pouvons seulement rapporter ce que la documentation de Turnitin énonce.
Le comportement sur les documents courts
La longueur du document influe sur la façon dont le détecteur de Turnitin traite le texte. Sur les documents courts, la mécanique de notation se comporte autrement. La documentation indique :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (traduction : dans les documents plus courts, qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », car la prédiction porte sur une seule section, sans possibilité de chevauchement.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (traduction : cela signifie qu’un texte mêlant du contenu généré par IA et du contenu original peut être signalé comme entièrement généré par IA.)
Le mécanisme de chevauchement qui lisse les scores dans les documents longs n’entre pas en jeu quand le texte ne forme qu’une seule section. Quelques centaines de mots mêlant texte humain et texte généré par IA peuvent donc renvoyer un score de 100 % : c’est l’une des voies qui mènent à pourquoi Turnitin annonce que votre travail est à 100 % IA. C’est un comportement structurel sur les textes courts.
Si Sapling attribue un score différent au même document court, c’est en partie parce que les deux outils ne traitent pas les textes courts de la même manière.
Comment s’affichent les scores faibles
Turnitin masque les scores chiffrés inférieurs à 20 %. La documentation indique :
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (traduction : afin d’éviter tout risque de faux positifs, aucun score ni surlignage n’est attribué aux scores de détection d’IA compris entre 1 % et 19 %. Lorsqu’un score d’IA détecté se situe sous le seuil de 20 % dans le rapport, il est désormais indiqué par un astérisque (*%) et aucun pourcentage n’est attribué.)
Un document que le modèle de Turnitin estime à 8 % d’IA affichera un astérisque dans le rapport, et non le chiffre 8 %. Aucun surlignage n’est appliqué au texte. L’idée est d’éviter de mettre en avant de possibles faux positifs dans une zone de faible confiance, un point détaillé dans ce que signifie l’astérisque (*%) sur un score IA Turnitin.
Sapling, lui, affiche peut-être les scores de cette plage sous forme de pourcentage complet. D’autres outils surlignent le texte dès que le score n’est pas nul. Turnitin supprime délibérément le chiffre et les surlignages en dessous de 20 %. Cette convention de notation fait que les deux outils produisent des résultats très différents pour un même document à faible score d’IA.
Ce que cela change pour vous
Si vous comparez les résultats de Sapling et de Turnitin sur un même document, voici l’essentiel :
- Des modèles séparés, des scores séparés. Sapling et Turnitin utilisent des modèles de détection différents. Leurs scores ne sont pas censés concorder.
- Turnitin note en découpant puis en agrégeant. Les phrases sont extraites, réparties en unités qui se chevauchent, notées, regroupées, puis agrégées. Le score d’IA et le score Similarity sont totalement indépendants.
- Turnitin vise moins de 1 % de faux positifs sur les documents comportant plus de 20 % d’écriture par IA, un objectif validé sur plus de 700 000 articles académiques supplémentaires rédigés avant ChatGPT.
- Sur les documents courts, c’est tout ou rien. Quelques centaines de mots peuvent renvoyer 0 % ou 100 %, même si le texte est mixte.
- Sous 20 %, c’est un astérisque qui s’affiche. Aucun pourcentage chiffré ni surlignage n’apparaît dans la plage 1-19 %.
Les passages éligibles peuvent être relancés gratuitement.
CONTINUER LA LECTURE