Détecteur d’IA Scribbr contre Turnitin : ce que dit vraiment la documentation

Scribbr propose un détecteur d’IA gratuit que tout le monde peut utiliser. La détection d’écriture par IA de Turnitin n’est accessible qu’aux établissements qui la licencient. Les deux outils reposent sur des modèles différents et produiront des scores différents sur un même texte. Voici ce que la documentation de Turnitin dit de son propre système et pourquoi les scores ne coïncideront pas.

L'équipe HumanPen

· 5 min de lecture

Scribbr et Turnitin sont deux systèmes distincts

Le détecteur d’IA de Scribbr est un outil gratuit, ouvert à tous. La détection d’écriture par IA de Turnitin est réservée aux établissements ; et savoir si votre propre école l’a activée est une autre question, traitée dans les établissements utilisent-ils des détecteurs d’IA ?. Les deux outils sont conçus par des équipes différentes, à partir de modèles différents. Chacun a été entraîné sur ses propres données et classe les textes selon sa propre méthode. Quand deux détecteurs utilisent des modèles différents, ils produisent des scores différents sur le même texte. Un passage que Scribbr signale à 65 % d’IA peut recevoir 30 % chez Turnitin, ou l’inverse. Aucun des deux résultats n’est nécessairement faux. Ce sont des estimations de probabilité issues de modèles différents, entraînés sur des jeux de données différents.

Il n’existe pas de score de détection d’IA universel vers lequel convergeraient tous les outils, et les raisons en sont exposées dans pourquoi le même texte obtient un score différent sur chaque détecteur. Chaque détecteur produit sa propre estimation. Traiter les scores d’outils différents comme s’ils mesuraient la même chose dans les mêmes unités ne mène qu’à la confusion.

Nous ne prétendons pas dire quel outil est le plus précis. Nous décrivons ce que la documentation de Turnitin dit de son propre système et pourquoi ce système produit des scores qui ne correspondront pas à ceux de Scribbr.

Comment Turnitin calcule son score

Turnitin documente un processus précis pour aboutir à son score d’écriture par IA :

« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score. » (Lorsqu’un devoir est soumis à Turnitin, les phrases de la soumission sont extraites et découpées en sections chevauchantes pour l’analyse de prédiction. Chaque section est classée par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit d’origine humaine ou généré par IA. Chaque phrase retenue dans ces sections hérite du score de la section. Comme les sections se chevauchent, certaines phrases peuvent recevoir plusieurs scores, qui sont ensuite regroupés en un seul. Ces scores de phrase sont encore agrégés et servent à calculer le score d’écriture par IA de l’ensemble du document.)

Le processus consiste à extraire les phrases, à les découper en unités chevauchantes, à noter chaque unité, à regrouper les scores des phrases, puis à agréger le tout en un pourcentage à l’échelle du document. D’autres détecteurs, Scribbr compris, peuvent utiliser d’autres découpages, d’autres unités de prédiction ou d’autres méthodes d’agrégation. Les deux outils ne produiront pas les mêmes chiffres sur le même texte.

La documentation de Turnitin précise aussi que le pourcentage de détection d’écriture par IA et le score de similarité sont deux choses distinctes. « The Similarity score and the AI writing detection percentage are completely independent and do not influence each other. » (Le score de similarité et le pourcentage de détection d’écriture par IA sont totalement indépendants et ne s’influencent pas l’un l’autre.) Un document peut présenter une similarité élevée et peu d’IA, ou l’inverse. Les deux chiffres ne s’influencent pas.

Le taux de faux positifs annoncé par Turnitin

Turnitin publie un objectif chiffré en matière de faux positifs :

« We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing. » (Nous nous efforçons de maximiser l’efficacité de notre détecteur tout en maintenant notre taux de faux positifs — c’est-à-dire le fait d’identifier à tort comme généré par IA un texte entièrement écrit par un humain — sous 1 % pour les documents contenant plus de 20 % d’écriture par IA.)

La nuance a son importance. L’objectif est énoncé spécifiquement pour les documents contenant plus de 20 % d’écriture par IA, un seuil qui ne signifie pas ce que l’on croit, comme l’explique 20 % d’IA, est-ce trop ?. Voilà ce que Turnitin dit de son propre système. Scribbr peut viser d’autres niveaux de précision, appliquer d’autres processus de validation, ou ne pas publier de chiffres comparables. Nous ne pouvons pas établir de comparaison directe de précision. Nous pouvons seulement rapporter ce qu’indique la documentation de Turnitin.

Le comportement sur les documents courts

La longueur du document influe sur la façon dont le détecteur de Turnitin traite le texte. Sur les documents courts, le mécanisme de notation se comporte autrement. La documentation indique :

« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » (Dans les documents plus courts, qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », car nous effectuons la prédiction sur un seul segment, sans possibilité de chevauchement.)

« This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie que certains textes mêlant du contenu généré par IA et du contenu original peuvent être signalés comme entièrement générés par IA.)

Le mécanisme de chevauchement qui lisse les scores dans les documents longs n’entre pas en jeu lorsque le texte ne forme qu’un seul segment. Quelques centaines de mots mêlant contenu humain et IA peuvent renvoyer un score de 100 %, l’une des voies décrites dans pourquoi Turnitin dit que votre travail est 100 % IA. C’est un comportement structurel sur les textes courts. Scribbr traite peut-être les documents courts par un autre mécanisme et parvient à un résultat différent sur le même texte.

Comment les scores faibles sont affichés

Turnitin masque les scores chiffrés inférieurs à 20 %. La documentation indique :

« To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed. » (Afin d’éviter tout risque de faux positifs, aucun score ni surlignage n’est attribué pour les scores de détection d’IA compris entre 1 % et 19 %. Lorsque de l’IA est détectée sous le seuil de 20 % dans le rapport, cela est désormais indiqué par un astérisque (*%) et aucun pourcentage n’est attribué.)

Un document que le modèle de Turnitin estime à 10 % d’IA affichera un astérisque dans le rapport, et non le chiffre 10 %. Aucun surlignage n’est appliqué au texte. La logique est de ne pas faire remonter de faux positifs potentiels dans une zone de faible confiance, ce que ce que signifie l’astérisque (*%) sur un score d’IA Turnitin détaille davantage.

Scribbr affiche peut-être les scores de cette zone en pourcentage complet. D’autres outils peuvent surligner le texte dès que le niveau est non nul. Turnitin masque délibérément, sous 20 %, aussi bien le chiffre que les surlignages. Avec cette convention, les deux outils présenteront des résultats très différents pour le même document à faible teneur en IA.

Ce que cela signifie pour vous

Si vous comparez les résultats de Scribbr et de Turnitin sur un même document, voici le résumé :

  • Des modèles distincts, des scores distincts. Scribbr et Turnitin utilisent des modèles de détection différents. Leurs scores n’ont aucune raison de coïncider.
  • Turnitin note en découpant puis en agrégeant. Les phrases sont extraites, découpées en unités chevauchantes, notées, regroupées puis agrégées. Le score d’IA et le score de similarité sont entièrement indépendants.
  • Turnitin vise moins de 1 % de faux positifs pour les documents contenant plus de 20 % d’écriture par IA.
  • Les documents courts obtiennent des scores tout ou rien. Quelques centaines de mots peuvent revenir à 0 % ou 100 %, même pour un texte mixte.
  • Les scores inférieurs à 20 % s’affichent sous forme d’astérisque. Dans la plage de 1-19 %, aucun pourcentage chiffré ni surlignage n’apparaît.

Les passages éligibles peuvent être relancés gratuitement.

CONTINUER LA LECTURE