Winston AI et Turnitin : pourquoi leurs scores de détection d’IA diffèrent

Il arrive que des étudiants passent leur travail dans Winston AI avant de le rendre sur Turnitin. Les deux outils reposent sur des modèles différents et produisent des scores différents. La FAQ de Turnitin décrit son mécanisme, ses cibles de faux positifs et sa convention de l’astérisque. Voici pourquoi comparer deux outils entre eux ne tient pas.

L'équipe HumanPen

· 4 min de lecture

La réponse courte

Winston AI et Turnitin sont deux détecteurs d’IA différents : modèles différents, données d’entraînement différentes, seuils de classification différents. Le score de l’un ne permet pas de prédire le score de l’autre. La FAQ de Turnitin décrit ainsi son mécanisme : le texte est découpé en segments chevauchants, chacun recevant une probabilité comprise entre 0 et 1. La FAQ annonce aussi une cible de faux positifs inférieure à 1 % pour les documents contenant plus de 20 % de texte rédigé par IA, et elle utilise une convention d’astérisque pour les scores compris entre 1 et 19 %. Winston AI publie ses propres chiffres de précision, mais ils émanent du fournisseur et ne peuvent pas être vérifiés à la lumière de la documentation de Turnitin. Le seul score qui compte est celui de l’outil utilisé par votre établissement. Si votre école utilise Turnitin, aucun score tiers ne peut vous dire quel sera votre score Turnitin.

Comment fonctionne le détecteur de Turnitin

La FAQ décrit le processus de détection ainsi :

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Lorsqu’un travail est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections chevauchantes pour l’analyse de prédiction. Chaque segment est classé par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui désigne la probabilité que le texte soit probablement humain ou généré par IA.)

Les segments se chevauchent : une même phrase peut donc recevoir plusieurs scores, qui sont ensuite agrégés en un pourcentage à l’échelle du document. Winston AI utilise sa propre approche de classification, qui n’est documentée nulle part dans les supports de Turnitin. Les deux systèmes sont construits différemment et évaluent le texte différemment.

La cible de faux positifs de Turnitin

La FAQ annonce une cible précise :

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nous nous efforçons de maximiser l’efficacité de notre détecteur tout en maintenant notre taux de faux positifs — c’est-à-dire le fait d’identifier à tort comme généré par IA un texte entièrement rédigé par un humain — en dessous de 1 % pour les documents contenant plus de 20 % de texte rédigé par IA.)

La phrase suivante : "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (En d’autres termes, nous pourrions signaler comme rédigé par IA un document entièrement rédigé par un humain sur cent.)

Cette cible est propre à Turnitin et s’applique aux documents contenant plus de 20 % de texte rédigé par IA. Winston AI peut annoncer un taux de faux positifs différent, mais comparer les deux chiffres suppose de comprendre comment chaque fournisseur définit et mesure les faux positifs. Nous ne formulons aucune affirmation sur la précision des détecteurs tiers.

La convention de l’astérisque

Turnitin applique une règle d’affichage particulière aux scores faibles :

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Afin d’éviter toute occurrence potentielle de faux positifs, aucun score ni surlignage n’est attribué aux scores de détection d’IA compris entre 1 % et 19 %. Lorsque de l’IA est détectée en dessous du seuil de 20 % dans le rapport, cela est désormais indiqué par un astérisque (*%) et aucun pourcentage n’est attribué.)

Winston AI n’utilise pas cette convention et affiche un pourcentage précis dans cette plage. Un travail qui affiche « *% » sur Turnitin peut afficher « 14 % » sur Winston AI. Cela ne veut pas dire qu’un outil est plus précis que l’autre : cela veut dire qu’ils traitent différemment la zone de faible confiance. Ce que signifie l’astérisque (*%) sur un score IA Turnitin détaille le côté Turnitin.

Documents courts et prédictions « tout ou rien »

La FAQ décrit le comportement des documents courts :

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents plus courts, qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », car nous effectuons la prédiction sur un seul segment, sans possibilité de chevauchement.)

La phrase suivante : "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Cela signifie qu’un texte mêlant contenu généré par IA et contenu original pourrait être signalé comme entièrement généré par IA.)

Cela tient à la façon dont Turnitin découpe le texte. Winston AI adopte peut-être le même comportement sur les textes courts, ou peut-être pas. Si vous testez un court extrait dans Winston AI et obtenez 0 %, cela ne vous apprend rien sur ce que fera Turnitin. L’autre extrémité de ce comportement est traitée dans Turnitin dit que votre travail est 100 % IA.

Le score qui compte

Sur Turnitin, le score IA et le score de similarité sont indépendants : "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Le score de similarité et le pourcentage de détection d’écriture par IA sont totalement indépendants et ne s’influencent pas mutuellement.) Certains détecteurs regroupent IA et similarité en un seul chiffre, ce qui rend leurs scores structurellement incomparables avec le pourcentage IA distinct de Turnitin. Le seul score qui compte pour votre rendu est celui produit par l’outil utilisé par votre établissement. Pourquoi un même texte obtient un score différent sur chaque détecteur explique pourquoi cet écart est structurel.

Ce que cela change pour vous

Pour résumer ce que nous avons vu :

  • Winston AI et Turnitin sont des détecteurs différents, dotés de modèles différents. Leurs scores ne correspondront pas.
  • Le détecteur de Turnitin découpe le texte en segments chevauchants et attribue à chacun un score de probabilité.
  • La cible de faux positifs de Turnitin est inférieure à 1 % pour les documents contenant plus de 20 % de texte rédigé par IA.
  • Turnitin utilise un astérisque pour les scores de 1 à 19 %, afin de ne pas se donner une précision qu’il n’a pas.
  • Sur les documents courts, Turnitin produit des prédictions « tout ou rien ».
  • Le seul score qui compte est celui de l’outil utilisé par votre établissement.

Si vous recevez un rapport IA Turnitin et souhaitez traiter les passages signalés, importez le rapport et travaillez dessus. Les passages éligibles peuvent être relancés gratuitement.

CONTINUER LA LECTURE