Humbot face à Turnitin : ce que dit vraiment la documentation
Si vous soumettez le même texte au détecteur d’IA de Humbot et à Turnitin, les scores diffèrent souvent. C’est normal. Les deux outils reposent sur des modèles différents, entraînés sur des données différentes, avec leurs propres conventions de notation. Voici ce que la documentation de Turnitin explique sur le fonctionnement de son détecteur et sur les raisons pour lesquelles les deux scores ne peuvent pas coïncider.
L'équipe HumanPen
· 5 min de lecture
Humbot et Turnitin : deux systèmes distincts
Le détecteur d’IA de Humbot et la détection d’écriture IA de Turnitin sont conçus par des équipes différentes, à partir de modèles sous-jacents différents. Chacun a été entraîné sur ses propres données et classe les textes selon sa propre méthode. Quand deux détecteurs s’appuient sur des modèles différents, ils produisent des scores différents sur un même texte. Un passage que Humbot signale à 70 % d’IA peut très bien recevoir 25 % chez Turnitin, ou l’inverse. Aucun des deux résultats n’est forcément faux : ce sont des estimations de probabilité issues de modèles différents, entraînés sur des jeux de données différents.
Il n’existe pas de score de détection d’IA universel vers lequel tous les outils convergeraient : c’est précisément ce que détaille pourquoi un même texte obtient un score différent sur chaque détecteur. Chaque détecteur produit sa propre estimation. Prendre les scores de deux outils différents comme s’ils mesuraient la même chose, dans la même unité, ne peut mener qu’à la confusion.
Nous ne prétendons pas dire quel outil est le plus fiable. Nous décrivons ce que la documentation de Turnitin affirme au sujet de son propre système, et pourquoi ce système aboutit à des scores qui ne correspondront pas à ceux de Humbot.
Comment Turnitin calcule son score
Turnitin décrit une procédure précise pour aboutir à son score d’écriture IA :
« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score. » (Lorsqu’un devoir est soumis à Turnitin, les phrases du document sont extraites puis découpées en sections chevauchantes pour l’analyse prédictive. Chaque section est classée par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit d’origine humaine ou généré par l’IA. Chaque phrase retenue dans ces sections hérite du score de la section. Comme les sections se chevauchent, certaines phrases peuvent recevoir plusieurs scores, qui sont ensuite regroupés en un seul. Ces scores de phrase sont à leur tour agrégés pour calculer le score d’écriture IA global du document.)
Concrètement : extraction des phrases, découpage en unités chevauchantes, notation de chaque section, regroupement des scores de phrase, puis agrégation en un pourcentage à l’échelle du document. D’autres détecteurs, dont Humbot, peuvent découper le texte autrement, retenir une autre unité de prédiction ou une autre méthode d’agrégation. Les deux outils ne sortiront donc pas les mêmes chiffres sur un même texte.
La documentation de Turnitin précise aussi que le pourcentage de détection d’écriture IA et le score Similarity sont deux choses distinctes. « The Similarity score and the AI writing detection percentage are completely independent and do not influence each other. » (Le score Similarity et le pourcentage de détection d’écriture IA sont totalement indépendants et n’ont aucune influence l’un sur l’autre.) Le score Similarity indique la part de texte correspondant à une source retrouvée dans le document soumis, comparé à l’ensemble du contenu que Turnitin utilise pour la vérification de similarité. Un document peut afficher une similarité élevée et un score d’IA faible, ou l’inverse. Les deux chiffres ne s’influencent pas.
Le taux de faux positifs annoncé par Turnitin
Turnitin affiche un objectif chiffré en matière de faux positifs :
« We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing. » (Nous nous efforçons de maximiser l’efficacité de notre détecteur tout en maintenant notre taux de faux positifs — c’est-à-dire le fait d’identifier à tort un texte entièrement rédigé par un humain comme généré par l’IA — sous 1 % pour les documents contenant plus de 20 % d’écriture IA.)
La documentation le reformule ainsi : « In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents. » (Autrement dit, il nous arrive de signaler comme écrit par l’IA un document rédigé par un humain, à raison d’un document sur 100 entièrement humain.) Cette reformulation laisse tomber la nuance « plus de 20 % d’écriture IA ». La version qui conserve le seuil des 20 % est plus précise, et 20 % d’IA, est-ce trop élevé ? explique pourquoi ce chiffre est un objectif d’ingénierie fixé par l’éditeur, et non une note de passage.
Pour vérifier cet objectif, Turnitin décrit son dispositif de test : « To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate. » (Afin de renforcer notre dispositif de test et d’analyser les tendances statistiques des faux positifs, nous effectuons, avant chaque mise à jour ou chaque nouvelle version du modèle, des tests sur plus de 700 000 articles universitaires supplémentaires rédigés avant la sortie de ChatGPT, pour confirmer que notre taux de faux positifs reste inférieur à 1 %.)
Voilà ce que Turnitin dit de son propre système. Ce que signifie un taux de faux positifs de 1 % replace ce chiffre face aux volumes qu’une université soumet réellement. Humbot peut viser d’autres niveaux de précision, suivre d’autres procédures de validation, ou ne pas publier de chiffres comparables. Il nous est impossible de comparer directement la fiabilité des deux outils. Nous ne pouvons que rapporter ce qu’affirme la documentation de Turnitin.
Le cas des documents courts
La longueur du document influe sur la façon dont le détecteur de Turnitin traite le texte. Sur les documents courts, la mécanique de notation se comporte autrement. La documentation indique :
« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » (Dans les documents courts, qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », car elle porte sur un seul segment, sans possibilité de chevauchement.)
« This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu’un texte mêlant contenu généré par l’IA et contenu original peut être signalé comme entièrement généré par l’IA.)
Le mécanisme de chevauchement qui lisse les scores dans les documents longs n’entre pas en jeu lorsque le texte ne forme qu’un seul segment. Quelques centaines de mots mêlant écriture humaine et écriture artificielle peuvent donc renvoyer un score de 100 % — c’est l’une des causes détaillées dans pourquoi Turnitin annonce que votre travail est à 100 % IA. Ce comportement est structurel sur les textes courts.
Si Humbot note le même document court autrement, c’est en partie parce que les deux outils ne traitent pas les textes courts de la même manière.
Comment s’affichent les scores faibles
Turnitin masque les scores chiffrés inférieurs à 20 %. La documentation indique :
« To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed. » (Afin d’éviter tout risque de faux positifs, aucun score ni surlignage n’est attribué pour les scores de détection d’IA compris entre 1 % et 19 %. Lorsqu’un score d’IA inférieur au seuil de 20 % est détecté, il est désormais indiqué dans le rapport par un astérisque (*%) et aucun pourcentage n’est attribué.)
Un document que le modèle de Turnitin estime à 8 % d’IA affichera un astérisque dans le rapport, et non le chiffre 8 %. Aucun surlignage n’est appliqué au texte. L’idée est d’éviter de mettre en avant de potentiels faux positifs dans une zone de faible confiance — un point approfondi dans ce que signifie l’astérisque (*%) sur un score IA Turnitin.
Humbot, lui, peut afficher les scores de cette plage en pourcentage complet. D’autres outils surlignent le texte dès que le score est non nul. Turnitin masque délibérément le chiffre comme les surlignages en dessous de 20 %. Avec une telle convention de notation, les deux outils produisent des résultats très différents pour un même document à faible score d’IA.
Ce que cela change pour vous
Si vous comparez les résultats de Humbot et de Turnitin sur un même document, voici l’essentiel :
- Des modèles distincts, des scores distincts. Humbot et Turnitin utilisent des modèles de détection différents. Rien ne dit que leurs scores doivent coïncider.
- Turnitin note par découpage puis agrégation. Les phrases sont extraites, découpées en unités chevauchantes, notées, regroupées, puis agrégées. Le score d’IA et le score Similarity sont totalement indépendants.
- Turnitin vise un taux de faux positifs inférieur à 1 % pour les documents contenant plus de 20 % d’écriture IA, validé sur plus de 700 000 articles universitaires supplémentaires rédigés avant ChatGPT.
- Les documents courts obtiennent un score en tout ou rien. Quelques centaines de mots peuvent revenir à 0 % ou à 100 %, même si le texte est mixte.
- Sous 20 %, le score s’affiche sous forme d’astérisque. Aucun pourcentage chiffré ni surlignage n’apparaît dans la plage de 1 à 19 %.
Les passages éligibles peuvent être relancés gratuitement.
CONTINUER LA LECTURE