Quelle est la marge d’un score d’IA Turnitin ? Nous avons compté
Si une copie revient à 43 %, la question qui vient naturellement est : 43 plus ou moins combien. Les trois pages du fournisseur qui définissent le rapport ne publient aucune réponse. La lacune ne se limite pas à une FAQ : elle apparaît dans les trois pages que nous avons vérifiées. Ce que ces pages publient à la place, c’est un exemple directionnel, une plage supprimée et une description du mécanisme qui indique où se trouve la variation réelle.
L'équipe HumanPen
· 13 min de lecture
Quelle est la marge d’erreur d’un score d’IA Turnitin ?
Il n’en existe aucune de publiée. Dans les trois pages qui définissent l’AI Writing Report, lues le 28 août 2026 et totalisant 46 712 caractères de texte d’article rendu, les termes de recherche `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` et `estimat` ne renvoient, à eux tous, aucune occurrence. Le compteur fonctionnait : `percentage` en renvoie 47 sur le même corpus et `false positive` en renvoie 21. Le fournisseur publie bien trois données chiffrées que l’on prend pour une marge, et aucune n’en est une.
Cette absence est le résultat utile, pas une réclamation. Elle vous dit quelle question cesser de poser et quelles deux questions trouvent réellement une réponse à propos du chiffre inscrit sur votre rapport.
Deux pages voisines couvrent un autre terrain et celle-ci ne les répète pas : Le taux de faux positifs de Turnitin, expliqué porte sur le taux d’erreur de la décision oui/non, et Ce que signifie un taux de faux positifs de 1 % quand une université soumet 75 000 copies porte sur ce que ce taux produit à l’échelle d’un établissement. Cette page porte sur le chiffre lui-même : de quoi il est l’estimation, et de combien il pourrait bouger.
Le comptage, avec son dénominateur
Trois pages, lues sans session ouverte dans un navigateur le 28 août 2026, mesurées avec `document.querySelector('article').innerText`, et non le corps de la page. Le corps ajoute environ 725 caractères de navigation et gonflerait le dénominateur sans ajouter de texte pertinent. Nombre de caractères : Using the AI Writing Report 6 492 ; the AI writing detection capabilities FAQs 30 987, que la page elle-même a marquées « Updated 9 days ago » ; the AI writing detection model release notes 9 233. Total 46 712.
| Terme de recherche | Page du rapport | FAQ | Notes de version | Total |
|---|---|---|---|---|
| `interval` | 0 | 0 | 0 | 0 |
| `margin` | 0 | 0 | 0 | 0 |
| `standard deviation` | 0 | 0 | 0 | 0 |
| `uncertain` | 0 | 0 | 0 | 0 |
| `precision` | 0 | 0 | 0 | 0 |
| `variance` | 0 | 0 | 0 | 0 |
| `error bar` | 0 | 0 | 0 | 0 |
| `plus or minus` et `±` | 0 | 0 | 0 | 0 |
| `estimat` | 0 | 0 | 0 | 0 |
| `percentage` (contrôle) | 10 | 31 | 6 | 47 |
| `false positive` (contrôle) | 2 | 12 | 7 | 21 |
| `qualifying text` (contrôle) | 6 | 4 | 3 | 13 |
| `segment` (contrôle) | 0 | 9 | 1 | 10 |
| `reliab` (contrôle) | 2 | 3 | 0 | 5 |
| `probabilit` (contrôle) | 0 | 4 | 0 | 4 |
Les contrôles sont là parce qu’une rangée de zéros ne vaut rien sans eux. Si la recherche avait été cassée, ou si la page ne s’était pas affichée, `percentage` aurait lui aussi renvoyé zéro. Il a renvoyé 47.
Deux quasi-résultats qu’il vaut la peine de publier, parce qu’ils font partie de ces choses qu’une lecture négligée transforme en conclusion. `confidence` ne renvoie qu’une seule occurrence dans tout le corpus, et elle n’est pas statistique : "While Turnitin has confidence in its model, Turnitin does not make a determination of misconduct." (Turnitin a confiance dans son modèle, mais Turnitin ne se prononce pas sur l’existence d’une faute.) Et `precise` n’en renvoie qu’une, dans une note de version de 2023 sur la détection des limites de segment. Aucune des deux n’est une mesure de dispersion. Si vous refaites ce comptage et tombez sur l’une d’elles, lisez la phrase avant de la traiter comme telle.
Et l’affirmation vaut dans les deux sens. Que le fournisseur n’ait pas publié de marge est un fait concernant ces pages à cette date. Cela ne veut pas dire que le modèle n’a aucune mesure interne de sa propre confiance : la section sur le mécanisme, plus bas, dit qu’il en calcule une. Cela ne permet pas non plus à quiconque d’en déduire que le chiffre est précis. Cela veut dire que la question reste sans réponse dans les pages vérifiées, ce qui est différent d’une réponse dans un sens ou dans l’autre.
Les trois chiffres que l’on prend pour une marge
La documentation n’est pas silencieuse sur l’erreur. Elle est silencieuse sur ce type d’erreur. Trois chiffres publiés sont réquisitionnés pour servir de marge et aucun ne convient.
- La cible de moins de 1 % de faux positifs. Son champ d’application déclaré est « documents with over 20% of AI writing » (les documents comportant plus de 20 % d’écriture par IA), et elle porte sur la fréquence à laquelle un document entièrement humain est signalé. C’est le taux d’erreur d’une décision sur une population, pas une plage autour de votre 43.
- L’exemple « 50 % pourraient être 65 % ». C’est celui qui s’en approche le plus, et il fait l’objet de la section suivante. Il est directionnel et il porte sur du texte IA manqué, non sur un chiffre affiché trop élevé.
- La plage supprimée de 1–19 %. Aucun chiffre n’est affiché en dessous du seuil de 20 %. C’est une affirmation sur le point à partir duquel le fournisseur juge la lecture trop peu sûre pour être montrée, ce qui est instructif, mais une règle de suppression n’est pas une marge non plus.
Ce qui manque dans cette liste, c’est précisément ce dont vous auriez besoin : une affirmation de la forme « un document noté X se situe typiquement entre Y et Z ». Rien dans les 46 712 caractères ne prend cette forme. La question « 43 % plus ou moins combien » n’a donc aucune réponse appuyée par ces sources primaires. Quiconque avance une fourchette devrait pouvoir citer une autre source primaire pour l’étayer.
Le sens de l’exemple publié le plus proche
Le passage le plus proche d’une marge d’erreur que nous ayons trouvé quantifie l’écart possible entre le chiffre annoncé et la réalité, et il ne va que dans un seul sens.
"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (Afin de maintenir ce faible taux de 1 % de faux positifs, il se peut que nous manquions une partie du texte écrit par IA dans un document. Nous l’acceptons, car nous ne voulons pas signaler à tort un texte écrit par un humain comme écrit par une IA. Par exemple, si nous identifions que 50 % d’un document ont probablement été écrits par un outil d’IA, ce document pourrait contenir jusqu’à 65 % d’écriture par IA.)
Lisez cela attentivement, car la forme compte plus que les chiffres. Ce passage dit que la quantité réelle de texte IA peut être supérieure au chiffre affiché. Il ne dit pas l’inverse. Notre comptage n’a trouvé aucune fourchette équivalente dans l’autre sens sur ces trois pages. La seule occurrence de `up to` dans les notes de version renvoie à une limite d’entrée de 30 000 mots, pas à un pourcentage.
Voilà toute l’étendue de l’asymétrie que ce passage appuie. Il explique pourquoi l’exemple pointe vers le haut : le système accepte de manquer une partie du texte IA afin de réduire les faux positifs. Il ne dit pas quel poids probant accorder à un score individuel élevé ou faible. Les pages vérifiées ne publient aucune courbe de calibration, aucun rapport de vraisemblance ni aucune mesure ajustée du taux de base pour cette inférence, et la même FAQ dit que le pourcentage ne doit pas être le seul fondement d’une décision.
Ce paragraphe ne vous aide en rien si vous avez écrit le travail vous-même et que vous pensez le score erroné. Ce n’est pas une marge ; c’est une information sur le sens dans lequel le système se trompe. Ce qui aide réellement face à un faux positif relève d’un autre sujet : Le taux de faux positifs de Turnitin, expliqué reprend les déclarations du fournisseur à ce sujet.
Là où se trouve réellement la variation
La FAQ décrit la séquence de notation. Une fois que vous l’avez lue, vous voyez où une mesure d’incertitude aurait dû figurer et où elle disparaît de la description publique.
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu’un devoir est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections chevauchantes pour l’analyse de prédiction. Chaque segment est classé par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui désigne la probabilité que le texte soit probablement humain ou généré par IA. Chaque phrase éligible au sein de ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent recevoir plusieurs scores, qui sont ensuite regroupés en un score unique. Ces scores de phrase sont ensuite agrégés et servent à calculer le score global d’écriture par IA du document.)
Il y a donc quatre étapes, et une grandeur continue existe à la première. Chaque segment reçoit une valeur entre 0 et 1. Les phrases en héritent. Les scores qui se chevauchent sont regroupés. Les résultats restants au niveau de la phrase sont combinés en un seul chiffre pour le document. Une probabilité de 0,51 et une probabilité de 0,99 sont des états de connaissance très différents, et au moment où elles parviennent à votre rapport, elles sont toutes deux devenues une part d’un seul et même pourcentage entier.
Les trois pages n’indiquent ni la règle de regroupement, ni la règle d’agrégation, ni le seuil auquel un score de phrase regroupé devient une phrase signalée. Il reste donc trois fonctions non énoncées entre l’incertitude du modèle et le pourcentage montré à votre enseignant. C’est un compte rendu plus exact de l’écart public que le simple fait de signaler une rangée de zéros.
Rien de tout cela ne rend le chiffre dénué de sens. C’est une estimation issue du modèle concernant la proportion de texte éligible probablement généré par IA. L’absence de règle de regroupement, de règle d’agrégation et de marge limite ce que l’on peut déduire de cette estimation ; elle n’efface pas l’unité publiée. La lecture prudente de 43 % est donc « le modèle a estimé à 43 % la part de texte éligible », et non « 43 % de chaque mot de ce document, avec une marge d’erreur connue ».
L’exception documentée pour les documents courts
La documentation appuie une mise en garde étroite au sujet de la longueur, pas une règle générale qui prédirait la résolution du score à partir du nombre de mots d’un document.
La FAQ indique : "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Dans les documents plus courts, où il n’y a que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », car nous prédisons sur un seul segment sans possibilité de chevauchement. Cela signifie qu’un texte mêlant contenu généré par IA et contenu original pourrait être signalé comme entièrement généré par IA.) Il s’agit d’un cas documenté à segment unique. Les pages vérifiées ne publient aucune fonction générale montrant comment la résolution du score évolue à mesure que les documents s’allongent.
La question pratique à ajouter n’est donc pas une marge inventée, mais le contexte du rapport : quelle quantité de texte éligible est entrée dans l’estimation, et s’agit-il du cas à segment unique de quelques centaines de mots que le fournisseur signale expressément ? N’extrapolez pas ce comportement des documents courts en une règle non publiée pour un chapitre de 8 000 mots. Documents courts et problème du tout ou rien dans Turnitin détaille le cas court documenté, et Ce qui est considéré comme texte éligible dans la détection d’IA de Turnitin traite de ce qui entre, ou non, dans le dénominateur.
La plage où le fournisseur cesse d’afficher un chiffre
Il y a un endroit où Turnitin a effectivement dit que la lecture n’était pas assez solide pour être imprimée, et elle l’a fait en retirant le chiffre.
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Afin d’éviter toute incidence potentielle de faux positifs, aucun score ni surlignage n’est attribué aux scores de détection d’IA compris entre 1 % et 19 %. Lorsqu’une IA est détectée en dessous du seuil de 20 % dans le rapport, cela est désormais indiqué par un astérisque (*%) et aucun pourcentage n’est attribué.)
Deux choses en découlent, qu’il vaut la peine de retenir. Premièrement, un astérisque n’est pas un score bas qu’on vous cacherait : c’est le fournisseur qui refuse d’attribuer un score, et il n’y a pas non plus de surlignages, donc rien de précis sur quoi qui que ce soit puisse pointer. Deuxièmement, c’est l’endroit le plus clair des trois pages où le fournisseur retient une partie de sa sortie en raison du risque de faux positifs. C’est ce que nous avons trouvé de plus proche d’une information sur l’incertitude, et cela prend la forme d’une règle plutôt que d’un chiffre. Que signifie l’astérisque (*%) sur un score d’IA Turnitin ? détaille ce que cet affichage veut réellement dire.
Comment lire un chiffre livré sans marge
Compte tenu de tout ce qui précède, voici ce qui reste utilisable lorsque quelqu’un vous met un pourcentage sous les yeux.
- Cessez de demander la marge et demandez le dénominateur. De combien de phrases éligibles ce chiffre provient-il ? Quelques centaines de mots signifient une sortie quasi binaire selon la propre description du fournisseur.
- Notez le sens de l’exemple publié. 50 annoncés peuvent être 65. Nous n’avons trouvé aucune fourchette appuyée par une source dans l’autre sens sur les trois pages vérifiées.
- Traitez l’astérisque comme une absence d’attribution, pas comme un petit chiffre. Pas de score, pas de surlignages.
- Ne transformez pas la part estimée de texte éligible en une part de vos paragraphes. Elle provient d’un regroupement et d’une agrégation non publiés portant sur des segments, pas d’un comptage de phrases que vous pourriez retrouver une à une.
- N’attribuez aucune signification à une variation entre versions que le fournisseur n’a pas définie. Les pages vérifiées ne publient aucun seuil de signification pour une variation de quelques points. Gardez avec le chiffre le contexte de texte éligible et les surlignages de chaque rapport.
- Utilisez le propre cadrage du fournisseur lorsqu’on vous le cite. Sa FAQ dit que le pourcentage "should not be used as the sole basis for action or a definitive grading measure by instructors" (ne doit pas être utilisé comme seul fondement d’une décision ni comme mesure de notation définitive par les enseignants), et que son modèle "may not always be accurate" (peut ne pas toujours être exact).
Si quelqu’un vous présente un intervalle de confiance pour un score d’IA Turnitin, demandez d’où il vient. Au vu des éléments ci-dessus, il ne vient pas de Turnitin.
Si des passages précis doivent de toute façon être réécrits
Tout ce qui précède porte sur la lecture du rapport plutôt que sur l’action, et les deux doivent rester séparés. Mais il y a une conséquence pratique qu’il vaut la peine d’énoncer, parce qu’elle découle directement du problème de comptage : si un pourcentage n’est assorti d’aucune incertitude publiée, courir après le pourcentage, c’est courir après quelque chose dont la cible n’est pas définie. Les passages surlignés, eux, ont une cible définie. Ce sont des portions de texte précises que vous pouvez regarder.
C’est toute la raison pour laquelle L’outil HumanPen, que nous développons, s’organise autour de l’importation du rapport plutôt qu’autour du chiffre qu’il porte. Lisez ceci comme une description de première main. Vous confiez l’AI Writing Report que vous avez déjà, et les passages signalés deviennent la limite du travail : vous validez cette limite à l’écran, seuls les paragraphes confirmés sont réécrits, tout le reste reste inchangé. C’est une affirmation sur le périmètre de la réécriture, pas sur le téléversement, le transport ou le stockage. La raison de préférer cela à un passage sur tout le document n’est pas un meilleur chiffre, que personne ne peut promettre. Chaque paragraphe modifié ajoute une vérification de source avant la remise, donc un périmètre étroit garde cette file de vérification courte. Lorsque le fichier lui-même est le livrable, ce qu’un humaniseur de texte IA fait des citations, des tableaux et des équations traite de ce qu’il faut vérifier ensuite.
Et la mise en garde évidente, vers laquelle cette page converge depuis huit sections : personne ne peut vous dire quel sera le prochain chiffre, nous y compris. Si vous avez écrit le travail vous-même, rien de tout cela ne s’applique. L’argument à faire porter concerne les preuves et la procédure, pas le texte.
Questions fréquentes
Turnitin publie-t-il une marge d’erreur pour le pourcentage d’IA ? Pas sur les trois pages qui définissent le rapport. Sur les 46 712 caractères lus le 28 août 2026, `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` and `estimat` all return zero, while `percentage` returns 47 and `false positive` returns 21 on the same text.
43 %, est-ce vraiment 43 % de mon devoir ? C’est l’estimation issue du modèle selon laquelle 43 % du texte éligible ont probablement été générés par IA, et non nécessairement 43 % de l’ensemble de la soumission. Comme les règles de regroupement et d’agrégation ainsi qu’une marge ne sont pas publiées, vous ne pouvez pas le projeter terme à terme sur des paragraphes visibles.
La quantité réelle de texte IA pourrait-elle être supérieure au chiffre affiché ? Le fournisseur le dit directement, avec son propre exemple : identifier 50 % et le document "could contain as much as 65% AI writing" (pourrait contenir jusqu’à 65 % d’écriture par IA). Cet exemple pointe vers le haut. Nous n’avons trouvé aucune fourchette appuyée par une source dans la direction opposée sur les trois pages vérifiées.
Pourquoi une dissertation courte reçoit-elle un score extrême ? Parce qu’il peut n’y avoir qu’un seul segment. La FAQ indique que dans les documents de quelques centaines de mots, la prédiction est "mostly 'all or nothing'" (le plus souvent « tout ou rien »), et qu’un texte mêlé peut donc être signalé comme entièrement généré par IA.
Pourquoi mon rapport affiche-t-il un astérisque au lieu d’un chiffre ? En dessous du seuil de 20 %, le fournisseur n’attribue ni score ni surlignages, et affiche `*%` à la place, en indiquant que c’est pour éviter toute incidence potentielle de faux positifs.
Un score bas ou élevé prouve-t-il qui a écrit mon document ? Non. L’exemple du fournisseur dit qu’une part affichée peut sous-estimer le texte IA, mais les pages vérifiées ne publient pas les informations de calibration et de taux de base nécessaires pour transformer un pourcentage individuel en poids probant. Le fournisseur dit aussi que le pourcentage ne doit pas être le seul fondement d’une décision.
CONTINUER LA LECTURE