Pourquoi les détecteurs d'IA signalent les essais bien écrits
La question suppose que le détecteur a lu votre essai et l'a pénalisé pour avoir été trop bien rédigé. Or, rien de ce que l'éditeur publie sur l'outil ne mentionne « well written », ce qui change ce qu'un signalement peut vous révéler.
L'équipe HumanPen
· 14 min de lecture
La réponse courte
Il ne s'agit pas d'une évaluation de la qualité. Sur les trois pages d'aide de Turnitin que nous avons consultées, les termes « quality », « style », « polished », « well written », « vocabulary » et « clarity » étaient absents. Le paramètre de sensibilité « 300 words » figurait sur les trois pages, confirmant que la recherche portait sur le contenu de la page plutôt que de renvoyer des résultats vides. La FAQ ne présente pas le détecteur comme une mesure de la qualité rédactionnelle. Turnitin publie plutôt une liste non quantifiée de texte susceptible de générer des faux positifs. De la prose académique soignée peut correspondre à deux éléments de cette liste lorsqu'elle répète des termes fixes ou utilise des structures parallèles, mais Turnitin ne précise pas la fréquence de ces cas parmi les erreurs.
Cela ne prouve pas que le style soigné est inoffensif, et nous n'allons pas faire semblant que c'est le cas. Ce qu'une entreprise documente correspond à ce qu'elle a choisi de documenter, et un modèle entraîné contient bien plus que ce que ses pages d'aide révèlent. Cela établit quelque chose de plus précis et plus utile : « well written » n'est pas une grandeur que ce système évalue, donc un signalement ne constitue pas un jugement à ce sujet, et les conseils fondés sur l'hypothèse contraire, qui aboutissent toujours à écrire en dessous de son niveau, n'ont aucun fondement publié.
Compter le vocabulaire de l'éditeur lui-même
Nous avons analysé le contenu de trois pages le 18 août 2026, car `guides.turnitin.com` renvoyait une erreur 403 lors d'une requête en ligne de commande standard : « Using the AI Writing Report », « Turnitin's AI writing detection capabilities FAQs » et « File requirements for an AI Writing Report ». Ces pages décrivent le mécanisme et les règles de format de fichier ; les notes de version et les problèmes connus n'étaient pas inclus dans cette recherche. Le tableau indique simplement la présence ou l'absence des termes, sans distinction de casse, plutôt que des comptages exacts, qui peuvent évoluer avec les mises à jour des pages.
| Terme de recherche | Guide du rapport | FAQ sur la détection | Exigences de fichier |
|---|---|---|---|
| `quality` | Absent | Absent | Absent |
| `style` | Absent | Absent | Absent |
| `well written` / `well-written` | Absent | Absent | Absent |
| `polished` | Absent | Absent | Absent |
| `genre` | Absent | Absent | Absent |
| `discipline` | Absent | Absent | Absent |
| `false positive` (contrôle secondaire) | Présent | Présent | Absent |
| `300 words` (contrôle de sensibilité) | Présent | Présent | Présent |
La dernière ligne explique pourquoi le reste du tableau a un sens : un résultat vide et une récupération échouée produisent la même signature, donc un terme connu pour figurer sur les trois pages doit d'abord être présent. Sur la FAQ, « writing » et « segment » sont présents, tandis que « vocabulary », « word choice » et « clarity » sont absents. « Breakdown » apparaît dans le guide du rapport, mais uniquement comme nom d'un panneau d'interface, pas comme statistique.
Ensuite, il y a les images, qu'une recherche textuelle ne peut pas voir. L'article FAQ ne contient aucune image ; le logo du site appartient à l'habillage de la page, pas à l'article. Le guide du rapport comporte des captures d'écran sans texte alternatif, nous les avons donc ouvertes séparément. Elles incluent un exemple de rapport affichant 56% d'IA à côté de 23% de similarité, une page de texte surligné, et des messages d'état. Aucun n'utilise les mots ci-dessus. L'un contient une phrase qui n'apparaît nulle part dans le texte de la page elle-même :
"AI detection includes the possibility of false positives. Although some text in this submission is likely AI generated, scores below the 20% threshold are not surfaced because they have a higher likelihood of false positives." (La détection par IA inclut la possibilité de faux positifs. Bien que certains textes dans cette soumission soient probablement générés par IA, les scores inférieurs au seuil de 20% ne sont pas affichés car ils ont une probabilité plus élevée de faux positifs.)
Voilà le produit qui refuse d'afficher un nombre dans la marge où il a le moins confiance, et cela vaut la peine de s'en souvenir, car partout ailleurs dans ce matériel, le taux d'erreur est décrit plutôt que mis en action.
Ce pour quoi il a des mots
Quelque chose fait le travail, et la FAQ le nomme sous le titre « What parameters or flags does Turnitin's model take into account when detecting AI writing? » :
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nos classificateurs sont entraînés à détecter ces différences de probabilité des mots et excellents à identifier les séquences de probabilité de mots propres aux rédacteurs humains.)
La même réponse précise que le modèle « n'est pas explicitement programmé pour évaluer des signaux spécifiques comme le 'burstiness', la 'perplexité' ou d'autres mesures individuelles parfois évoquées dans les discussions publiques », et qu'il « apprend des modèles statistiques à partir de nos données d'entraînement » à la place. Les deux phrases figurent sur la page, et en lire une sans l'autre conduit à une interprétation erronée : l'éditeur nie deux mesures publiques nommées, pas le fait que la probabilité des mots soit la devise. Ce que cela signifie pour les termes dont les gens débattent est détaillé dans ce que mesurent les détecteurs d'IA.
Suivez maintenant les unités publiées vers le haut plutôt que vers le bas. Les mots, puis les phrases, puis ceci :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1 ... Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu'un document est soumis à Turnitin, les phrases de la soumission sont extraites et divisées en sections qui se chevauchent pour l'analyse de prédiction. Chaque segment est classé par le modèle de détection d'IA et reçoit une valeur comprise entre 0 et 1... Chaque phrase éligible dans ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul score. Ces scores de phrase sont ensuite agrégés et utilisés pour calculer le score global de rédaction par IA du document.)
La chaîne s'arrête là. La plus grande unité jamais classée est un segment, large de quelques phrases, et le chiffre du document est une agrégation de ceux-ci, pas un second jugement fait après avoir lu l'ensemble. Presque tout ce qui rend un essai bon est plus grand qu'un segment : un argument qui tient sur huit pages, des preuves bien choisies, une objection soulevée dans la section deux et répondue dans la section cinq. Rien de tout cela n'est une unité à l'échelle où la classification se produit. Ce n'est pas que le système pèse votre raisonnement et le rejette. Il n'y a pas de case pour cela.
Sur quoi « human » est calibré
En discutant des faux positifs dans la prose académique, l'éditeur pointe vers un corpus de test antérieur à ChatGPT :
"To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Pour renforcer notre cadre de test et diagnostiquer les tendances statistiques des faux positifs, avant chaque mise à jour ou nouvelle version de modèle, nous effectuons des tests sur plus de 700 000 documents académiques supplémentaires rédigés avant la sortie de ChatGPT afin de valider davantage notre taux de faux positifs inférieur à 1%.)
La FAQ se repose la même question sous son propre titre, « How does Turnitin ensure that the false positive rate for a document remains less than 1%? », et répète le chiffre avec le mot « over » omis : « we perform additional tests on 700,000 additional academic papers that were written before the release of ChatGPT ». Même corpus, deux phrases légèrement différentes sur une même page.
Voici comment Turnitin décrit cette population de référence : des documents académiques sélectionnés parce qu'ils ont été rédigés avant la sortie de ChatGPT. C'est une description basée sur la date, pas une affirmation selon laquelle chaque document a été indépendamment vérifié comme rédigé par un humain. L'affirmation plus étroite reste utile : Turnitin indique qu'il réexécute ce corpus académique antérieur à ChatGPT avant les versions de modèle pour surveiller le taux de faux positifs. La page ne décrit pas la vérification document par document de la paternité.
Ce qui ne règle pas la question, et nous exagérerions si nous disions le contraire. L'éditeur publie la cible et non la distribution derrière elle, et la cible elle-même porte une limite que sa propre phrase suivante abandonne discrètement. La version complète de cet argument, y compris ce qui se passe lorsque vous multipliez un petit taux par le volume annuel d'une véritable université, se trouve dans ce que signifie un taux de faux positifs de 1%.
La distribution des erreurs n'est pas publiée
La page indique un taux de faux positifs inférieur à 1%, mais elle ne publie pas comment les erreurs sont réparties dans le corpus de test. Elle ne donne aucun taux par sous-groupe et ne montre pas si un type de texte explique plus d'erreurs qu'un autre.
Ce que la page publie est une liste non quantifiée de texte que les faux positifs peuvent inclure, suivie d'un conseil pour lire le pourcentage :
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Parfois, les faux positifs (qui signalent incorrectement un texte rédigé par un humain comme généré par l'IA) peuvent inclure un contenu sans grande variation structurelle, un texte qui se répète littéralement, ou un texte qui a été reformulé sans développer de nouvelles idées. Si notre indicateur montre une quantité plus élevée de rédaction par l'IA dans un tel texte, nous vous conseillons de prendre cela en compte lors de l'examen du pourcentage indiqué.)
Lisez ce qui figure sur cette liste et ce qui n'y figure pas. Pas de vocabulaire sophistiqué, pas de phrases longues, pas d'argument solide. Elle nomme trois propriétés de texte possibles, mais ne donne aucune fréquence pour aucune d'entre elles. La troisième décrit un processus plutôt que quelque chose que vous auriez produit en écrivant par vous-même.
Les deux premières valent la peine d'être comparées avec la pratique académique ordinaire, et ce qui suit est notre lecture, pas celle de l'éditeur. Si votre domaine vous demande d'appeler une chose par un nom chaque fois qu'elle apparaît, vous pouvez répéter le même terme exprès car un synonyme introduirait une ambiguïté. Si vous établissez des éléments comparables dans des phrases parallèles pour qu'un lecteur puisse les tenir côte à côte, vous pouvez réduire la variation structurelle pour la même raison. Aucun choix n'est une faute. Turnitin indique que les faux positifs peuvent inclure ces propriétés. Il ne dit pas à quelle fréquence, que les erreurs y sont concentrées, ou que les propriétés corrèlent avec les erreurs.
Ce que nous ne disons pas, car c'est une affirmation bien plus large que tout ce que ceci ne soutient, c'est que l'écriture soignée est signalée. Cette phrase circule largement, et ce à quoi elle est généralement attachée est une instruction de paraître moins capable que vous n'êtes. Les modifications que la liste publiée soutient réellement, et ce que les faire à la main coûte, sont examinées dans comment humaniser le texte IA sans outil.
Remarquez aussi pour qui cette seconde phrase est écrite. Elle demande à celui qui regarde le pourcentage de peser quel type de texte l'a produit. L'instruction s'adresse à la personne qui tient le rapport, pas à celle qui a écrit le document.
Si votre type d'écriture est plus mal loti n'est pas publié
La prochaine question évidente est de savoir si les faux positifs sont plus courants dans votre discipline, votre section ou votre genre. La FAQ a un titre qui s'en approche, « Does the Turnitin model take into account that AI writing detection technology might be biased against particular subject-areas or second language writers? », et la réponse porte sur l'échantillon d'entraînement :
"One of the guiding principles of our company and of our AI team has been to minimize the risk of harm to students, especially those disadvantaged or disenfranchised by the history and structure of our society. Hence, while creating our sample dataset, we took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments and less common subject areas such as anthropology, geology, sociology, and others." (L'un des principes directeurs de notre entreprise et de notre équipe d'IA a été de minimiser le risque de préjudice pour les étudiants, en particulier ceux désavantagés ou marginalisés par l'histoire et la structure de notre société. Ainsi, lors de la création de notre ensemble de données d'échantillon, nous avons pris en compte les groupes statistiquement sous-représentés comme les apprenants d'une langue seconde, les utilisateurs d'anglais de pays non anglophones, les étudiants des collèges et universités avec des inscriptions diverses et des domaines moins courants comme l'anthropologie, la géologie, la sociologie, et d'autres.)
Les noms de sujets « anthropology », « geology » et « sociology » n'apparaissent que dans des paragraphes décrivant comment l'échantillon a été construit. « Discipline », « genre » et « sous-groupe » sont absents des trois pages. Ainsi, les domaines apparaissent comme une entrée pour l'entraînement, pas comme une répartition de test publiée. Il n'y a pas de taux de faux positifs publié pour l'anthropologie, et l'éditeur ne met aucun chiffre derrière la réponse sur le biais, c'est pourquoi elle doit être lue comme une déclaration d'intention.
C'est pourquoi le chiffre auquel tout le monde pense pour cette question vient de l'extérieur de l'entreprise : une étude de 2023 sur 91 essais TOEFL, dont la portée, les modifications contrôlées et les limites réelles ont été examinées dans pourquoi les rédacteurs non natifs d'anglais sont plus souvent signalés par les détecteurs d'IA. C'est aussi pourquoi deux détecteurs peuvent rendre le même paragraphe avec deux verdicts différents, ce qui est un chaos séparé couvert dans pourquoi les détecteurs ne sont pas d'accord.
Une partie de votre meilleur travail n'est pas du tout dans la mesure
Il y a une raison de plus pour laquelle « il a signalé mon bon essai » est le mauvais cadre, et cela concerne ce dont le pourcentage est un pourcentage. Seulement une partie de votre document est éligible pour être notée :
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission." (Ce texte éligible inclut uniquement des phrases de prose, ce qui signifie que nous n'analysons que des blocs de texte rédigés dans des phrases grammaticalement standard et n'incluant pas d'autres types d'écriture tels que des listes, des puces (structures courtes non-phrases), ou d'autres structures non-phrases. Ce pourcentage n'est pas nécessairement le pourcentage de l'ensemble de la soumission.)
Deux changements annoncés en août 2023 ont déplacé la frontière plus loin. L'un dit que la prose de forme longue dans les tableaux est maintenant traitée ; l'autre dit qu'un bogue qui mettait parfois en surbrillance la rédaction par l'IA dans une bibliographie a été corrigé et les bibliographies sont maintenant exclues du traitement. Ces deux notes de version se terminent de la même façon, vous disant de resoumettre un document existant avant que l'un ou l'autre changement ne s'y applique.
Ainsi, la bibliographie sur laquelle vous avez passé deux soirées à vous aligner et les critères d'inclusion rédigés sous forme de puces courtes, non-phrases, se situent en dehors de l'ensemble noté. Les tableaux sont conditionnels : la prose de forme longue à l'intérieur peut être traitée, tandis que les cellules numériques, fragments et autres contenus de tableau non-phrases peuvent rester en dehors de la prose éligible. Le pourcentage ne décrit donc pas nécessairement l'ensemble de la soumission. C'est aussi la raison mécanique pour laquelle il peut être en désaccord avec la quantité de texte coloré devant vous, que nous démontons ligne par ligne dans comment lire un rapport de rédaction par l'IA Turnitin.
Que faire de tout cela
Très peu de tout cela concerne votre façon d'écrire, et la plupart concerne le poids que le nombre peut porter.
- Paraître moins compétent est le seul mouvement à exclure. Tout ce qui précède argue contre cela, et l'échange est déséquilibré d'une manière ordinaire : les notes d'un examinateur comptent pour certain, tandis que l'effet sur le score est quelque chose que personne n'a mesuré et que vous n'êtes généralement pas autorisé à observer.
- Demandez quels passages, pas quel nombre. Les surlignages vous disent où le classificateur a atterri. Le pourcentage vous dit sur quelle partie du texte éligible il a atterri, ce qui est une quantité différente de celle de votre essai.
- Attendez-vous à ce qu'un document court soit mesuré grossièrement. Les mots de l'éditeur : « In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » La phrase qui suit est celle qui compte : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » En dessous de 300 mots de texte éligible, les exigences de fichier disent qu'il n'y a aucun rapport à lire du tout.
- Si votre prose est conventionnelle parce que le genre l'exige, vérifiez à qui le conseil de l'éditeur est destiné. Cette phrase s'adresse à celui qui lit le pourcentage, pas à vous. Bon à savoir avant de conclure que le document est la chose qui doit changer.
- Méfiez-vous de toute promesse sur le nombre résultant, la nôtre incluse. La position de Turnitin elle-même est que les prédictions individuelles « peuvent ne pas toujours être explicables en termes simples de caractéristique par caractéristique ». Personne en dehors de l'entreprise ne peut mapper une modification sur un mouvement du score.
Où une réécriture s'ajuste, et où elle ne s'ajuste pas
Rien de tout cela n'est un argument pour la réécriture. Là où le travail est vôtre et que vous êtes prêt à le dire, le document n'est pas l'objet qui devrait changer.
Une réécriture gagne sa place à un point spécifique : quand un rapport existe, des passages particuliers y sont marqués, et ces passages vont être révisés de toute façon. C'est la forme pour laquelle HumanPen est construit. Donnez-lui le fichier plus le rapport IA de Turnitin ou iThenticate et les passages marqués deviennent la portée, avec tout ce qui est en dehors d'eux gardant les mots que vous avez écrits. Notre propre page énonce la règle de granularité : « Un paragraphe est la plus petite unité que le moteur réécrit : si votre sélection ne couvre qu'une partie de l'un, il est étendu au paragraphe complet et affiché ainsi pour que vous confirmiez. » La facturation compte les mots réellement réécrits, donc un travail ciblé coûte ce que coûte la portée plutôt que ce que pèse le fichier.
Si un nouveau rapport signale toujours des passages, les résultats éligibles peuvent continuer à réduire l'IA gratuitement. Ce que personne ne peut vous remettre est le chiffre sur le prochain rapport. Après tout ce qui précède, un outil qui vous cite un chiffre cite un nombre qu'il n'a pas.
Questions fréquemment posées
La prose bien écrite est-elle plus susceptible d'être signalée ? C'est une affirmation plus large que le matériel publié ne le soutient, et nous ne la faisons pas. Ce qui est documenté est une liste de trois types de texte que Turnitin dit que les faux positifs peuvent inclure, dont aucun n'est un jugement de qualité, plus un effet mesuré sur les rédacteurs avec une gamme lexicale plus petite en anglais d'un échantillon 2023. Traitez la version large comme une affirmation en circulation plutôt qu'une découverte.
L'utilisation d'un vocabulaire avancé augmente-t-elle mon score IA ? Rien de ce que l'éditeur publie n'en parle : « vocabulary » et « word choice » étaient tous deux absents des trois pages d'aide que nous avons consultées. Une expérience contrôlée de 2023 a déplacé le choix de mots directement et a poussé contre la théorie populaire plutôt qu'avec elle : les chercheurs ont enrichi la rédaction des essais déjà signalés, et les signalements ont diminué. Cela établit que le choix de mots n'était pas inerte dans cette expérience. Cela n'établit rien sur votre document.
Ma rédaction se répète parce que la terminologie doit être cohérente. C'est le cas conventionnel, et cela répond à un élément de la propre liste de faux positifs de l'éditeur. Son conseil dans cette situation s'adresse à la personne qui lit le rapport : prenez en compte la nature du texte lors de l'examen du pourcentage.
Dois-je ajouter une variation de longueur de phrase exprès ? Pas comme exercice de formatage. Là où la variation portait déjà du sens, la restaurer est une révision ordinaire. La fabriquer dans une section dont les conventions exigent l'uniformité remplace la rédaction que votre discipline a demandée par une rédaction qu'elle n'a pas demandée, en échange d'un effet que personne ne peut mesurer de l'extérieur.
Puis-je vérifier le score moi-même avant de soumettre ? Généralement non. La position de Turnitin est que l'indicateur de rédaction par l'IA et le rapport sont destinés aux instructeurs et administrateurs, et n'atteignent un étudiant que si un instructeur télécharge le rapport et le transmet. Tout conseil qui suppose que vous pouvez observer le nombre bouger suppose un accès que la plupart des étudiants n'ont pas.