Originality.ai contre Turnitin AI Detection : ce que dit la documentation officielle

Il arrive que des étudiants soumettent leur travail à Originality.ai et obtiennent un score différent de celui de Turnitin. C'est normal. Chaque détecteur utilise ses propres modèles, entraînés sur des données différentes. La FAQ de Turnitin explique son fonctionnement, ses objectifs en matière de faux positifs et la convention de l'astérisque pour les scores faibles. Voici ce que la documentation indique.

L'équipe HumanPen

· 4 min de lecture

En résumé

Originality.ai et Turnitin sont deux détecteurs d'IA distincts, construits sur des modèles différents, avec des données d'entraînement et des seuils de classification qui leur sont propres. Un score obtenu sur l'un ne permet pas de prédire celui de l'autre. D'après la FAQ de Turnitin, le texte est découpé en segments qui se chevauchent, chacun se voyant attribuer une probabilité entre 0 et 1. La FAQ indique également un objectif de faux positifs inférieur à 1 % pour les documents contenant plus de 20 % de texte généré par IA, et utilise une convention d'astérisque pour les scores entre 1 et 19 %. Originality.ai publie ses propres chiffres d'exactitude, mais ceux-ci sont communiqués par le fournisseur et ne peuvent pas être vérifiés indépendamment à partir de la documentation de Turnitin. Le seul score qui compte est celui de l'outil utilisé par votre établissement. Si votre école utilise Turnitin, aucun score tiers ne peut vous dire quel sera votre score Turnitin.

Comment fonctionne le détecteur de Turnitin

La FAQ décrit le processus de détection :

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Lorsqu'un travail est soumis à Turnitin, des phrases sont extraites et découpées en sections qui se chevauchent pour une analyse prédictive. Chaque section est classée par le modèle de détection d'IA et se voit attribuer une valeur entre 0 et 1, indiquant la probabilité que le texte soit d'origine humaine ou généré par IA.)

Les segments se chevauchent, ce qui signifie qu'une même phrase peut recevoir plusieurs scores qui sont ensuite regroupés. Ce lissage permet de corriger les erreurs de prédiction individuelles et contribue au score global du document. Originality.ai utilise sa propre approche de classification, qui n'est pas documentée dans les matériaux de Turnitin. Les deux systèmes sont construits différemment et évaluent le texte différemment.

L'objectif de faux positifs de Turnitin

La FAQ indique un objectif précis :

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nous nous efforçons de maximiser l'efficacité de notre détecteur tout en maintenant notre taux de faux positifs − identifier à tort un texte entièrement rédigé par un humain comme étant généré par IA − en dessous de 1 % pour les documents contenant plus de 20 % de texte généré par IA.)

La phrase suivante précise : "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Autrement dit, il se peut que nous signalions comme étant rédigé par IA un document entièrement humain dans un cas sur cent.)

Cet objectif est spécifique à Turnitin et s'applique aux documents contenant plus de 20 % de texte généré par IA. Originality.ai peut avoir un taux de faux positifs différent, mais comparer ces chiffres nécessite de comprendre comment chaque fournisseur définit et mesure les faux positifs. Nous ne faisons aucune déclaration d'exactitude concernant les détecteurs tiers. Ce que la documentation nous apprend, c'est que Turnitin a explicitement indiqué cet objectif pour son propre modèle. Le coût de cet objectif à grande échelle est détaillé dans ce que signifie un taux de faux positifs de 1 % lorsqu'une université soumet 75 000 travaux.

La convention de l'astérisque

Turnitin applique une règle d'affichage spécifique pour les scores faibles :

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (Pour éviter tout risque de faux positifs, aucun score ni aucun surlignage n'est attribué pour les scores de détection d'IA compris entre 1 % et 19 %. Lorsque de l'IA est détectée en dessous du seuil de 20 % dans le rapport, elle est désormais indiquée par un astérisque (%) et aucun pourcentage n'est attribué.)

Cela signifie qu'un score Turnitin affichant "%" indique que de l'IA a été détectée en dessous de 20 %, mais que le pourcentage exact n'est pas communiqué pour éviter de surestimer la précision dans une plage sujette aux faux positifs. Originality.ai n'utilise pas cette convention et affichera un pourcentage précis dans cette plage. Un travail affichant "%" sur Turnitin pourrait afficher "15 %" sur Originality.ai. Cela ne signifie pas qu'un outil est plus précis que l'autre. Cela signifie simplement qu'ils gèrent différemment la plage de faible confiance. Ce que signifie l'astérisque (*%) sur un score AI Turnitin couvre cet aspect côté Turnitin.

Pourquoi les scores diffèrent d'un outil à l'autre

Différents détecteurs d'IA produisent des scores différents sur le même texte parce qu'ils utilisent des modèles, des données d'entraînement et des seuils différents. La FAQ de Turnitin explique comment son modèle regroupe les scores de segments chevauchants en un pourcentage au niveau du document. Un autre détecteur pourrait utiliser une stratégie de segmentation différente, une échelle de notation différente ou une méthode d'agrégation différente. La FAQ note également que les documents courts produisent des prédictions de type "tout ou rien" : "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Pour les documents plus courts ne contenant que quelques centaines de mots, la prédiction sera principalement de type "tout ou rien" car nous prédisons sur un seul segment sans possibilité de chevauchement.) Originality.ai peut ou non présenter le même comportement sur les documents courts.

Le score AI et le score de similarité sont également indépendants sur Turnitin : "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Le score de similarité et le pourcentage de détection d'écriture par IA sont entièrement indépendants et ne s'influencent pas mutuellement.) Un détecteur qui combinerait AI et similarité en un seul score produirait un chiffre qui n'est pas comparable au pourcentage AI séparé de Turnitin. Pourquoi le même texte obtient des scores différents sur chaque détecteur rassemble les raisons.

Ce que cela signifie pour vous

Pour résumer ce que nous avons vu :

  • Originality.ai et Turnitin sont des détecteurs différents avec des modèles différents. Les scores ne correspondent pas.
  • Le détecteur de Turnitin divise le texte en segments chevauchants et attribue des scores de probabilité entre 0 et 1.
  • L'objectif de faux positifs de Turnitin est inférieur à 1 % pour les documents contenant plus de 20 % de texte généré par IA.
  • Turnitin utilise un astérisque pour les scores entre 1 et 19 % afin d'éviter de surestimer la précision.
  • Les documents courts obtiennent des prédictions de type "tout ou rien" sur Turnitin en raison de l'évaluation sur un seul segment.
  • Le score qui compte est celui de l'outil utilisé par votre établissement.

Si vous recevez un rapport AI Turnitin et souhaitez traiter les passages signalés, importez le rapport et travaillez dessus. Les passages éligibles peuvent être retraités sans frais supplémentaires.

CONTINUER LA LECTURE