Copyleaks contre Turnitin : pourquoi les détecteurs d'IA ne sont pas d'accord
Les étudiants font souvent passer leur travail par plusieurs détecteurs d'IA et obtiennent des scores totalement différents. Turnitin peut afficher 20 % tandis que Copyleaks indique 80 %. La raison est simple : modèles différents, données d'entraînement différentes, seuils de classification différents. Comprendre pourquoi les détecteurs divergent permet d'interpréter chaque score dans son contexte.
L'équipe HumanPen
· 4 min de lecture
En bref
Les différents détecteurs d'IA donnent des scores différents car ce sont des modèles distincts, entraînés sur des données différentes et avec des seuils de classification propres à chacun. Copyleaks et Turnitin sont deux produits séparés, développés par des équipes différentes. Chacun possède son propre modèle, son corpus d'entraînement et sa méthode pour agréger les prédictions au niveau des segments en un score global. Quand Copyleaks affiche 80 % et Turnitin 20 % sur le même texte, aucun n'a nécessairement tort. Ils mesurent des motifs statistiques différents et appliquent des frontières de décision différentes. Le score qui compte, c'est celui de l'outil que votre établissement utilise réellement. Si votre école utilise Turnitin, votre score Copyleaks est informatif mais pas faisant autorité.
Comment fonctionne le détecteur de Turnitin
La FAQ de Turnitin décrit son processus ainsi :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu'un travail est soumis à Turnitin, les phrases sont extraites et découpées en segments qui se chevauchent pour analyse. Chaque segment est classé par le modèle de détection d'IA et reçoit une valeur entre 0 et 1, représentant la probabilité que le texte soit humain ou généré par IA. Chaque phrase validée dans ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul score. Ces scores par phrase sont agrégés pour calculer le score global d'écriture IA du document.)
Turnitin publie également un objectif précis en matière de faux positifs : "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nous nous efforçons de maximiser l'efficacité de notre détecteur tout en maintenant notre taux de faux positifs — identifier incorrectement un texte entièrement rédigé par un humain comme étant généré par IA — en dessous de 1 % pour les documents contenant plus de 20 % d'écriture IA.) Cet objectif détermine l'agressivité avec laquelle le modèle classe les textes limite. Un modèle calibré pour minimiser les faux positifs classera davantage de segments incertains comme humains, ce qui peut produire des scores d'IA plus bas sur des textes mixtes.
Pourquoi Copyleaks et Turnitin ne sont pas d'accord
Copyleaks utilise son propre modèle de détection d'IA, avec ses propres données d'entraînement et ses propres seuils de classification. Les détails du modèle de Copyleaks ne sont pas publics, contrairement à la FAQ de Turnitin, donc aucune comparaison côté à côté des mécanismes n'est possible. Mais la raison structurelle du désaccord est claire : deux modèles différents entraînés sur des données différentes ne classeront pas le même texte de la même manière. Une phrase que le modèle de Turnitin classe avec une probabilité IA de 0,3 pourrait obtenir 0,7 avec le modèle de Copyleaks. Lorsque ces différences au niveau des segments sont agrégées sur l'ensemble d'un document, les pourcentages finals peuvent diverger considérablement. Pourquoi le même texte obtient des scores différents selon les détecteurs explique cela plus en détail.
Il y a aussi une différence de seuil. Turnitin n'affiche pas les scores entre 1 % et 19 %, montrant uniquement un astérisque à la place. La FAQ explique : "To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range." (Pour éviter les faux positifs potentiels, aucun score ni surlignage n'est attribué pour les scores de détection d'IA dans la fourchette de 1 % à 19 %.) Si Copyleaks affiche un score de 15 % pour le même texte que Turnitin montre comme un astérisque, l'écart vient en partie d'une décision d'affichage, pas seulement d'une différence de classification — consultez ce que signifie l'astérisque (*%) sur un score d'IA Turnitin.
Les documents courts amplifient le désaccord
La FAQ de Turnitin note que les documents courts produisent des prédictions moins fiables :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents courts de quelques centaines de mots seulement, la prédiction sera surtout du type « tout ou rien » car nous prédisons sur un seul segment sans possibilité de chevauchement.)
La phrase suivante : "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Cela signifie qu'un texte mêlant contenu généré par IA et contenu original pourrait être signalé comme entièrement généré par IA.)
Sur un document court, un détecteur peut classer la totalité du texte comme IA (obtenant 100 %) tandis qu'un autre le classe comme humain (obtenant 0 %). Le comportement tout-ou-rien signifie que de petites différences dans la façon dont chaque modèle traite un segment unique peuvent produire des écarts considérables dans le score final. Si vous comparez des scores entre détecteurs, la longueur du document compte. Un résumé de 300 mots peut obtenir des scores radicalement différents selon les outils, tandis qu'un travail de 3 000 mots affichera des résultats plus proches.
Quel score compte vraiment
Le score qui compte est celui de l'outil utilisé par votre établissement. Si votre université utilise Turnitin, votre score d'IA Turnitin est celui qui affecte votre situation académique. Un score Copyleaks de 5 % ne vous aide pas si votre score Turnitin est de 80 %. Un score Copyleaks de 80 % ne vous porte pas préjudice si votre établissement n'utilise pas Copyleaks. Faire passer votre travail par plusieurs détecteurs peut donner une idée générale de la présence de motifs typiques de l'IA, mais cela ne peut pas prédire ce que dira le détecteur de votre institution. La seule façon de connaître votre score réel est de consulter le rapport de l'outil utilisé par votre établissement. Seuls les enseignants et administrateurs peuvent voir l'indicateur d'IA Turnitin. Quant à savoir si votre école l'utilise, cela dépend de ce qu'ils ont acheté.
Ce que cela signifie pour vous
Pour résumer ce que nous avons vu :
- Les différents détecteurs d'IA utilisent des modèles distincts, avec des données d'entraînement et des seuils différents. Le désaccord est attendu, pas surprenant.
- Turnitin publie son objectif de faux positifs (moins de 1 % pour les documents contenant plus de 20 % d'IA) et son mécanisme (classification par segments qui se chevauchent).
- Turnitin masque les scores entre 1 % et 19 % sous forme d'astérisques, ce qui peut amplifier les écarts apparents avec d'autres outils.
- Les documents courts produisent des prédictions tout-ou-rien, ce qui peut causer des divergences spectaculaires entre les détecteurs.
- Le score qui compte est celui de l'outil réellement utilisé par votre établissement.
Si vous avez un rapport Turnitin indiquant quels passages ont été signalés, importez le rapport et travaillez sur ces passages spécifiques. Les passages éligibles peuvent être retraités sans frais supplémentaires.
CONTINUER LA LECTURE