Détection d’IA : ZeroGPT face à Turnitin, pourquoi les scores ne concordent pas

Beaucoup d’étudiants passent leur copie sur ZeroGPT avant de la rendre sur Turnitin. Or les deux outils reposent sur des modèles différents et n’aboutissent donc pas au même score. La FAQ de Turnitin détaille son fonctionnement, l’objectif qu’elle se fixe en matière de faux positifs et la convention de l’astérisque pour les scores bas. Voilà pourquoi un résultat obtenu sur ZeroGPT ne permet pas de prévoir celui de Turnitin.

L'équipe HumanPen

· 4 min de lecture

La réponse courte

ZeroGPT et Turnitin sont deux détecteurs d’IA distincts : modèles différents, données d’entraînement différentes, seuils de classification différents. Un score bas sur ZeroGPT n’annonce donc pas un score bas sur Turnitin. D’après la FAQ de Turnitin, le texte est découpé en segments qui se chevauchent, chacun recevant une probabilité comprise entre 0 et 1. La FAQ annonce un objectif de faux positifs inférieur à 1 % pour les documents comportant plus de 20 % de texte généré par IA. Turnitin applique aussi une convention d’astérisque aux scores situés entre 1 et 19 % : le pourcentage exact n’est pas communiqué, afin de ne pas donner l’illusion d’une précision qu’il n’a pas. ZeroGPT avance ses propres chiffres de fiabilité, mais ils émanent de l’éditeur lui-même et rien ne permet de les confronter à la documentation de Turnitin. Si votre établissement utilise Turnitin, votre score ZeroGPT n’a aucune valeur prédictive.

Comment fonctionne le détecteur de Turnitin

La FAQ décrit ainsi le processus de détection :

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Lorsqu’un devoir est soumis à Turnitin, les phrases du dépôt sont extraites puis découpées en sections chevauchantes en vue de l’analyse prédictive. Chaque segment est classé par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit plutôt d’origine humaine ou généré par IA.)

Comme les segments se chevauchent, une même phrase peut recevoir plusieurs scores, ensuite agrégés en un pourcentage à l’échelle du document. ZeroGPT fonctionne avec son propre modèle, qui n’est décrit nulle part dans la documentation de Turnitin et qui repose peut-être sur une logique de classification entièrement différente.

L’objectif de faux positifs chez Turnitin, et l’astérisque

La FAQ indique :

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nous nous efforçons de maximiser l’efficacité de notre détecteur tout en maintenant notre taux de faux positifs — c’est-à-dire le fait de signaler comme généré par IA un texte entièrement rédigé par un humain — sous la barre de 1 % pour les documents comportant plus de 20 % de texte rédigé par IA.)

Et la phrase suivante : « In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents. » (Autrement dit, il peut nous arriver de signaler comme généré par IA un document écrit par un humain, et ce pour un document entièrement humain sur cent.)

Pour les scores faibles, Turnitin applique une convention de réserve :

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Afin d’éviter d’éventuels faux positifs, aucun score ni surlignage n’est attribué lorsque le score de détection d’IA se situe entre 1 % et 19 %. Lorsque la présence d’IA est détectée sous le seuil de 20 % dans le rapport, elle est désormais signalée par un astérisque (*%) et aucun pourcentage n’est attribué.)

ZeroGPT n’applique pas cette convention : il affiche en général un pourcentage précis, même dans la zone de faible confiance. Un devoir qui affiche « *% » sur Turnitin peut très bien afficher « 12 % » sur ZeroGPT. Cette différence d’affichage ne dit pas lequel des deux outils est le plus fiable ; elle dit simplement qu’ils ne traitent pas la zone d’incertitude de la même manière. Ce que signifie l’astérisque (*%) sur un score IA Turnitin détaille le fonctionnement côté Turnitin.

Pourquoi les documents courts font exception

La FAQ décrit un comportement propre aux documents courts :

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents plus courts, de quelques centaines de mots seulement, la prédiction sera le plus souvent “tout ou rien”, car elle porte sur un seul segment, sans possibilité de chevauchement.)

Phrase suivante : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu’un texte mêlant passages générés par IA et contenu original peut être signalé comme entièrement généré par IA.)

Ce comportement tient à la façon dont Turnitin découpe le texte. Rien ne dit que ZeroGPT réagisse de la même manière sur les textes courts. Si vous passez un résumé de 300 mots sur ZeroGPT et obtenez 0 %, cela ne vous apprend rien sur ce que fera Turnitin du même texte : sur un texte court, sa prédiction à segment unique peut basculer d’un extrême à l’autre. Pourquoi Turnitin juge votre travail 100 % IA, c’est exactement ce basculement poussé à son maximum.

Le seul score qui compte

Chez Turnitin, le score d’IA et le score de similarité sont indépendants : « The Similarity score and the AI writing detection percentage are completely independent and do not influence each other. » (Le score de similarité et le pourcentage de détection d’écriture IA sont totalement indépendants et n’ont aucune influence l’un sur l’autre.) Certains outils gratuits fusionnent IA et similarité en un seul chiffre : leurs scores sont donc, par construction, impossibles à comparer au pourcentage IA que Turnitin calcule séparément.

Le seul score qui compte pour votre dépôt, c’est celui que produit l’outil utilisé par votre établissement. Si votre école fonctionne avec Turnitin, vous aurez beau multiplier les tests sur ZeroGPT, cela ne vous dira jamais quel score Turnitin vous attribuera. Passer votre texte dans plusieurs détecteurs gratuits peut vous donner une idée générale de la présence de schémas typiques de l’IA, mais cela ne remplace en rien le résultat de l’outil institutionnel. Pourquoi un même texte obtient un score différent sur chaque détecteur explique pourquoi cet écart est structurel, et non le dysfonctionnement isolé de l’un d’entre eux.

Ce que cela change pour vous

Pour résumer ce que nous avons vu :

  • ZeroGPT et Turnitin sont deux détecteurs distincts, dotés de modèles différents. Leurs scores ne correspondront pas.
  • Le détecteur de Turnitin découpe le texte en segments chevauchants et attribue à chacun une probabilité.
  • Turnitin vise un taux de faux positifs inférieur à 1 % pour les documents comportant plus de 20 % de texte généré par IA.
  • Turnitin utilise un astérisque pour les scores de 1 à 19 %, afin de ne pas surestimer sa précision dans une zone propice aux faux positifs.
  • Sur les documents courts, Turnitin n’évalue qu’un seul segment : la prédiction est donc du tout ou rien.
  • Le seul score qui compte est celui de l’outil utilisé par votre établissement.

Si vous recevez un rapport IA Turnitin et souhaitez reprendre les passages signalés, importez le rapport et travaillez dessus. Les passages éligibles peuvent être relancés gratuitement.

CONTINUER LA LECTURE