Mixed et AI-Polished chez GPTZero : ce que les deux labels signifient
GPTZero vous affiche trois pourcentages, puis cache cinq classifications nommées un clic plus bas. AI Polished est l’une des deux qui vivent sous Mixed. GPTZero le définit dans un panneau de l’écran de résultats, et l’explique dans un article de juin 2025 qui se trouve sur son site d’actualités plutôt que dans son centre d’aide. Voici la série complète, dans les termes de GPTZero, et ce que le nombre à côté de chacune compte réellement.
L'équipe HumanPen
· 14 min de lecture
La réponse courte
GPTZero affiche trois pourcentages, sous le titre « Chance this entire text is... » (probabilité que tout ce texte soit…) : AI, Mixed et Human. Ce chiffre est la confiance du modèle dans le fait que la classe est la bonne, pas la part de votre essai qui en relève. GPTZero le dit sur l’écran de résultats lui-même, en une ligne sous les pastilles. Cliquez sur n’importe quelle pastille : elle s’ouvre en sous-lectures nommées, cinq au total réparties sur les trois, et « AI polished » est l’une des deux sous Mixed. GPTZero le définit comme « Human-written text that was refined or edited by an AI tool » (texte écrit par un humain, affiné ou édité par un outil d’IA), en ajoutant qu’avec ce label « the core ideas and structure are the student's own work, but AI was used as an editing assistant » (les idées principales et la structure sont le travail propre de l’étudiant, mais l’IA a été utilisée comme assistant d’édition). Donc « 100 % mixed » : le modèle dit qu’il est très confiant dans le fait que le document appartient à la classe mixed. Laquelle des deux lectures sous Mixed a pesé le plus est un chiffre distinct, à un clic de là.
Ce que compte réellement le nombre à côté du label
Commencez par l’écran que vous avez sous les yeux, car GPTZero répond à cela dessus. Dépliez la pastille Mixed et cette ligne apparaît juste sous les lectures :
This result isn't the percentage of mixed text, it's the model's confidence in the classification of the entire text as mixed. (Ce résultat n’est pas le pourcentage de texte mixte : c’est la confiance du modèle dans la classification de l’ensemble du texte comme mixed.)
La même phrase attend sous les deux autres pastilles, avec le nom de la classe échangé : « isn't the percentage of AI text » (n’est pas le pourcentage de texte IA) sous AI, « isn't the percentage of human text » (n’est pas le pourcentage de texte humain) sous Human.
Pourquoi cette distinction compte, Alex Adam, qui dirige l’équipe machine learning de GPTZero, l’explique dans un article daté du 12 janvier 2024 :
categorizing predictions this way enables the confidence of the detector to be disentangled from the percentage of sentences that are AI-generated. Without this distinction, an AI probability of 50% could mean that the detector is 50% confident in its prediction (essentially a coin flip), or that 50% of the text is AI-generated. (Catégoriser les prédictions de cette manière permet de dissocier la confiance du détecteur du pourcentage de phrases générées par l’IA. Sans cette distinction, une probabilité d’IA de 50 % pourrait signifier que le détecteur est confiant à 50 % dans sa prédiction — essentiellement un pile ou face —, ou que 50 % du texte est généré par l’IA.)
Deux lectures du même « 50 % », et pour vous elles veulent dire des choses opposées. La sortie à trois classes existe pour les garder séparées.
La documentation dit la même chose depuis trois autres directions. Une entrée datée du 9 janvier 2024 dans les notes de version de GPTZero indique que les prédictions ont été « tuned to better represent the probability that the model is correct » (ajustées pour mieux représenter la probabilité que le modèle ait raison), avec cet exemple développé : un score IA de 90 % signifie « there is a 90% chance that the text is entirely written by an AI » (il y a 90 % de chances que le texte soit entièrement écrit par une IA). La page d’aide de l’API décrit une probabilité de classe comme « the chance that the detector is correct in its classification » (la probabilité que le détecteur ait raison dans sa classification), en ajoutant que 90 % signifie exact « 90% of the time on similar documents » (90 % du temps sur des documents similaires). Notez des documents similaires, au pluriel : pas le vôtre. Et la page technologique le range parmi les contributions de recherche de GPTZero, dans la formulation la plus sèche qui soit : le détecteur y est présenté comme « a trinary classification problem, separating prediction confidence from the proportion of LLM text. » (un problème de classification ternaire, qui sépare la confiance de la prédiction de la proportion de texte LLM).
Une page de GPTZero le formule exactement à l’envers. Le bloc FAQ de la page d’accueil dit que GPTZero « will suggest what percentage of your text is likely to be AI-generated » (suggérera le pourcentage de votre texte susceptible d’être généré par l’IA). Cela figure dans une réponse en trois étapes expliquant comment faire, et non dans la description d’un champ de résultat nommé : c’est donc sans doute un texte marketing approximatif plutôt qu’une contradiction. Dans tous les cas, la règle de travail est la même : « GPTZero a dit 30 % » ne permet pas d’identifier de quelle grandeur parle quelqu’un, alors précisez de quelle surface et de quel champ le chiffre vient. Pourquoi le même texte obtient un score différent sur chaque détecteur met cela en regard des unités de Turnitin, Originality.ai et Winston AI, là où se trouve la version inter-fournisseurs du problème.
Trois pastilles en haut, cinq classes nommées en dessous
C’est la partie qui piège les gens, et c’est la raison pour laquelle une formulation comme « written by a human and polished with AI » (écrit par un humain et peaufiné à l’IA) semble sortir de nulle part. La rangée du haut, ce sont trois pastilles. Chacune s’ouvre.
| Pastille | S’ouvre en | La ligne de GPTZero en dessous |
|---|---|---|
| AI | « chance AI Generated », « chance AI Paraphrased » | « isn't the percentage of AI text » (n’est pas le pourcentage de texte IA) |
| Mixed | « chance AI-Human Mix », « chance AI polished » | « isn't the percentage of mixed text » (n’est pas le pourcentage de texte mixte) |
| Human | « Human written » | « isn't the percentage of human text » (n’est pas le pourcentage de texte humain) |
Cinq lectures nommées au total. « AI polished » n’est pas un quatrième seau à côté de Mixed. C’est l’une des deux choses que Mixed peut signifier. Ce seul fait répond à l’essentiel de la confusion, car un résultat mixed se lit très différemment une fois que vous savez que l’autre lecture en dessous s’appelle AI-Human Mix.
Cliquez sur la petite icône d’information à côté de l’une de ces lectures et un panneau s’ouvre, intitulé « Understanding AI Classifications » (comprendre les classifications de l’IA), avec un onglet pour chacune des cinq. Les définitions de GPTZero, mot pour mot :
AI Generated — Text written directly by an AI language model with no meaningful human editing. AI Paraphrased — AI-generated text that was rewritten — either by a tool or by hand — to disguise its origin. AI-Human Mix — Human-written text combined with AI-generated text in the same document. AI Polished — Human-written text that was refined or edited by an AI tool. Human — Text written entirely by a human with no AI involvement. (AI Generated — texte écrit directement par un modèle de langage d’IA, sans édition humaine significative. AI Paraphrased — texte généré par l’IA qui a été réécrit — avec un outil ou à la main — pour dissimuler son origine. AI-Human Mix — texte écrit par un humain, combiné à du texte généré par l’IA dans le même document. AI Polished — texte écrit par un humain, affiné ou édité par un outil d’IA. Human — texte écrit entièrement par un humain, sans intervention de l’IA.)
L’onglet AI Polished porte un second paragraphe, et c’est celui qu’il vaut la peine d’avoir sous les yeux :
The text was originally written by a human, then run through an AI tool to improve grammar, rephrase sentences, or enhance clarity. The core ideas and structure are the student's own work, but AI was used as an editing assistant. (Le texte a été écrit à l’origine par un humain, puis passé dans un outil d’IA pour améliorer la grammaire, reformuler des phrases ou gagner en clarté. Les idées principales et la structure sont le travail propre de l’étudiant, mais l’IA a été utilisée comme assistant d’édition.)
Notez d’où part chaque définition. Polished part de l’écriture humaine. Paraphrased part d’une sortie d’IA. Ce ne sont pas deux degrés de la même chose : ce sont deux histoires d’origine opposées, et elles dépendent de pastilles différentes.
Deux points plus petits. D’abord, GPTZero écrit ce label de trois façons à trois endroits : « AI polished » sur la pastille, « AI Polished » dans le panneau, et « Polished by AI » sur les boutons d’exemple de sa page d’accueil. Ensuite, le scan gratuit a un minimum : à 0 caractère, la zone affiche « Enter at least 250 characters to scan » (saisissez au moins 250 caractères pour lancer le scan), et passe à « Great! You've entered enough text to scan » (super ! vous avez saisi assez de texte pour lancer le scan) une fois le seuil franchi.
D’où vient « AI Polished », et où GPTZero l’explique
La classe est plus jeune que les quatre autres. Elle arrive dans une note de version datée du 3 juin 2025, classée sous « Added » (ajouté), en une seule ligne :
Ability to detect "polished" texts that are lightly edited by AI (capacité à détecter les textes « polished » légèrement édités par l’IA)
Neuf mois plus tard, une ligne de plus, le 11 mars 2026 : « Improved performance on the AI polished class. » (performances améliorées sur la classe AI polished.) Ces deux entrées sont tout ce qu'elle fait dans les notes de version.
L’explication plus longue est arrivée deux jours après cette première entrée, dans l’article de GPTZero qui présente la classe AI Polished, signé Emily Napier, daté du 5 juin 2025. Il dit en toutes lettres où se situe le label :
To improve transparency, we've decided to distinguish between documents that combine "chunks" of AI and human text and documents rewritten or polished by AI. We now identify these documents under the "Mixed" class with an accompanying tag of "AI Polished". (Pour améliorer la transparence, nous avons décidé de distinguer les documents qui combinent des « chunks » de texte IA et de texte humain des documents réécrits ou peaufinés par l’IA. Nous identifions désormais ces documents sous la classe « Mixed », avec une étiquette associée « AI Polished ».)
C’est le tableau ci-dessus, dans les propres mots de GPTZero et avec une date dessus : deux sortes de document mixte, et l’une d’elles reçoit l’étiquette AI Polished.
Si vous partez chercher l’article, cherchez deux formulations. Son titre et son corps utilisent « AI Polished », la formulation du panneau. Deux de ses légendes de figure utilisent à la place « Lightly edited by AI », qui ne fait pas partie des trois ci-dessus mais est la formulation de la note de version, et l’adresse de la page est construite à partir d’elle.
L’article ne fait pas partie du centre d’aide de GPTZero, et aucun des articles d’aide ne mentionne le label. Nous avons passé le centre de support en revue de façon exhaustive le 15 septembre 2026. Sa page d’accueil liste cinq collections de premier niveau, chacune affichant son propre compte d’articles : General 36, API 17, Origin Extension 8, Account Management 11, Microsoft Word Add-In 5. Soit 77. Entrer dans chacune donne huit sous-collections plus trois articles rattachés directement à la page d’une collection, et les énumérer donne exactement 77 articles distincts. Nous avons récupéré les 77 et cherché dans le `innerText` de chaque page, le texte que le navigateur affiche (espaces insécables reconvertis en espaces ordinaires, navigation et barre latérale du site incluses) : 88 894 caractères au total ce jour-là. La barre latérale change d’un chargement à l’autre, donc une nouvelle passe ne retombera pas exactement sur ce chiffre :
- `polish`, `polished`, `AI polished`, `AI-polished`, `AI Polished`, `Polished` — 0 chacun
- `Polish` — 1, et c’est la langue, dans la liste des langues prises en charge
- `confidence in the classification`, la phrase qu’utilise l’écran de résultats — 0
Le compteur fonctionnait : sur le même corpus ce jour-là, `burstiness` renvoyait 28, `paraphras` 18, `sentence` 19, `mixed` 11. Feuilleter l’index principal des actualités ne vous y mène pas non plus. Le 15 septembre 2026, cet index faisait 30 pages de profondeur et s’arrêtait à 147 adresses d’articles distinctes, et l’article de juin 2025 n’en faisait pas partie. Il était listé dans le sitemap des actualités, qui comptait alors 320 articles. GPTZero publie souvent : les deux totaux auront donc bougé quand vous vérifierez.
Rien de tout cela ne rend le label peu fiable, et le compte n’est pas un argument en ce sens. Il explique seulement pourquoi lire les articles d’aide de GPTZero vous laisse sans rien sur AI Polished. Si quelqu’un vous demande ce que votre label signifie, c’est l’article à lui envoyer. Faites toutefois une capture du panneau de définition en plus du score. C’est une définition courte, à un clic de la lecture qu’a obtenue votre document, et c’est la différence entre un lecteur qui pense que « polished » est un euphémisme et un lecteur qui a lu GPTZero dire que les idées principales sont celles de l’auteur.
De quel niveau le label parle réellement
Les pastilles décrivent le document. Le titre au-dessus d’elles se lit littéralement « Chance this entire text is... » (probabilité que tout ce texte soit…). Les surlignages de phrases sont une seconde sortie, avec un autre rôle, et la FAQ est explicite sur le sens dans lequel va le raisonnement :
The sentence-level classification should not be solely used to indicate that an essay contains AI (such as ChatGPT plagiarism). Rather, when a document gets a MIXED or AI_ONLY classification, the highlighted sentence will indicate where in the document we believe this occurred. (La classification au niveau de la phrase ne doit pas être utilisée seule pour indiquer qu’un essai contient de l’IA (comme un plagiat par ChatGPT). En revanche, lorsqu’un document reçoit une classification MIXED ou AI_ONLY, la phrase surlignée indiquera à quel endroit du document nous pensons que cela s’est produit.)
Le document d’abord, les surlignages ensuite. Ils expliquent le verdict plutôt qu’ils ne s’additionnent pour le former. À l’écran, cela prend la forme d’une liste intitulée « Your most AI sentences » (vos phrases les plus IA), dont chaque entrée porte une mention d’impact au lieu d’un pourcentage propre.
GPTZero publie aussi un classement du degré de confiance à accorder à chaque niveau, et il va à l’encontre de la façon dont la plupart des gens lisent un rapport :
The accuracy of our model increases as more text is submitted to the model. As such, the accuracy of the model on the document-level classification will be greater than the accuracy on the paragraph-level, which is greater than the accuracy on the sentence level. (La précision de notre modèle augmente à mesure que davantage de texte lui est soumis. Ainsi, la précision du modèle sur la classification au niveau du document sera supérieure à celle au niveau du paragraphe, elle-même supérieure à celle au niveau de la phrase.)
La phrase surlignée prise isolément, c’est ce sur quoi votre regard finit par se fixer. C’est aussi la couche que GPTZero juge la moins précise.
Deux autres comportements piègent les gens. Les phrases surlignées, dit l’article d’aide sur l’Advanced Scan, sont celles qui « disproportionately affecting your overall AI or human score » (affectent de façon disproportionnée votre score global IA ou humain) : il s’agit d’un impact, non d’une proportion, et GPTZero ajoute que les phrases non surlignées « may still have an effect on your score, but they aren't more likely than other parts of your document » (peuvent encore avoir un effet sur votre score, mais elles ne sont pas plus probables que d’autres parties de votre document). Par ailleurs, un résultat moyen sans aucun surlignage a son propre article d’aide : « there isn't one specific section of the document that is especially likely to have AI content. Rather, the entire document has signs of being AI generated, but with lower certainty. » (il n’y a pas une section précise du document particulièrement susceptible de contenir de l’IA. C’est plutôt l’ensemble du document qui porte des signes de génération par IA, mais avec une certitude moindre.)
Pourquoi le chiffre a bougé alors que vous n’avez presque rien touché
Deux notes de version parlent de cela, et les deux sont plus étroites qu’on ne le suppose.
6 février 2024 :
Processing of long documents has been made more consistent. There should be less variation in predictions when cutting out a few sentences from long AI-generated documents (Le traitement des documents longs a été rendu plus cohérent. Il devrait y avoir moins de variation dans les prédictions lorsqu’on retire quelques phrases de longs documents générés par l’IA)
2 mai 2025 :
Increased output stability when rescanning multiple times (Stabilité accrue de la sortie lors de scans répétés)
Regardez la portée de chacune. La première concerne le retrait de phrases dans de longs documents générés par l’IA. La seconde concerne le passage du même texte deux fois. Aucune ne dit ce qui se passe si vous modifiez une phrase de votre propre brouillon et que vous relancez un scan, et nous n’en avons trouvé aucune : dans les 77 articles de support ci-dessus, `stabilit`, `rescan` et `re-scan` renvoient tous 0. C’est la lacune de cet article, et elle a une conséquence pratique : un chiffre GPTZero ne veut dire quelque chose à côté d’un autre chiffre GPTZero que si vous savez quand chacun a été pris : notez donc la date avec le score.
La raison pour laquelle les dates comptent se trouve sur la page des notes de version. En comptant les dates d’entrée en début de ligne dans le `innerText` de la page, elle porte 55 entrées datées depuis mai 2023, dont 10 en 2026 jusqu’au 15 septembre, la plus récente étant le 12 août 2026 (Model 4.9b). Deux d’entre elles datent de cette année : « More granular mixed text predictions and identification of interleaving mixed texts » (prédictions de texte mixte plus fines et identification des textes mixtes enchevêtrés) en mai, et « Robustness to headers; headers are now excluded from our model's input » (robustesse face aux en-têtes ; les en-têtes sont désormais exclus de l’entrée de notre modèle) en août. L’écran de résultats imprime la version du modèle à côté du verdict : c’est ce qu’il y a de moins coûteux à noter dessus. Un scan de juillet et un scan de la semaine dernière n’ont pas été faits par le même modèle.
La bande de confiance est l’autre moitié de la lecture, et c’est la partie qui disparaît quand un score est brandi contre quelqu’un. L’article d’aide sur l’Advanced Scan associe les bandes à des taux d’erreur : « Highly confident: our error rate is less than 2% » (très confiant : notre taux d’erreur est inférieur à 2 %), « Moderately confident: our error rate would be around 10% » (moyennement confiant : notre taux d’erreur serait d’environ 10 %), « Low confidence: our error rate would be 14% or higher » (confiance faible : notre taux d’erreur serait de 14 % ou plus). La page technologique place la bande supérieure à une erreur moyenne de « less than 1% » (moins de 1 %), sur un jeu d’évaluation interne. Les deux chiffres viennent de GPTZero, portent sur les données de GPTZero, ne concordent pas, et l’article d’aide qui porte les 2 % est marqué comme mis à jour pour la dernière fois il y a un an. Le responsable machine learning de GPTZero est également franc sur la limite du chiffre sous-jacent : l’étape de calibration fait que le détecteur est « not overconfident in its predictions » (pas trop confiant dans ses prédictions) la plupart du temps, mais « achieving perfect calibration is nearly impossible » (atteindre une calibration parfaite est presque impossible). Une classe citée sans sa bande de confiance est un demi-résultat.
Que faire d’un label
La question de savoir si ce que vous avez fait était autorisé relève de votre établissement, pas d’un classifieur, et GPTZero le dit plus clairement que bien des gens qui le citent : « these results should not be used to punish students » (ces résultats ne doivent pas servir à punir des étudiants) et « we don't recommend using an AI detection result as the only proof for academic punishment or discipline » (nous ne recommandons pas d’utiliser un résultat de détection d’IA comme seule preuve en vue d’une sanction académique ou disciplinaire). Son responsable machine learning va plus loin, et celle-là vaut d’être connue si un scan unique est agité sous votre nez :
we do not encourage punitive actions based solely on the results of a single scan. Instead, a history of scan results should ideally be established, serving as stronger evidence of AI usage. (Nous n’encourageons pas de mesures punitives fondées uniquement sur les résultats d’un seul scan. À la place, un historique de résultats de scan devrait idéalement être établi, constituant une preuve plus solide d’usage de l’IA.)
Cinq choses qui sont entre vos mains :
- Ouvrez la pastille avant de paniquer. Un « Mixed » nu est ce qu’il y a de moins informatif à l’écran. Les deux lectures en dessous sont AI-Human Mix et AI polished, et elles décrivent des situations différentes.
- Capturez la classe, la sous-lecture, la bande de confiance, la version du modèle et la date dans une seule capture d’écran. Les cinq figurent sur le même panneau. Recopier le chiffre à la main jette tout ce qui le rend interprétable.
- Faites aussi une capture du panneau de définition, et gardez le lien vers l’article de juin 2025 de GPTZero. Le panneau se trouve derrière l’icône d’information, et une capture conserve la définition telle que votre écran l’a montrée. L’article est l’endroit où GPTZero explique par écrit qu’AI Polished est une étiquette sous Mixed.
- Renseignez-vous sur ce que votre établissement utilise réellement avant de discuter un chiffre venu d’ailleurs. Une autovérification sur un outil gratuit n’est pas le rapport que votre département regardera, et les noms de classe, les formulations et les seuils ne sont pas partagés entre les fournisseurs. Que deux outils divergent sur votre fichier est le résultat attendu, pas un dysfonctionnement.
- Conservez vos brouillons et votre historique de révisions. Le conseil que GPTZero donne lui-même aux enseignants est de demander « drafts, revision histories, or brainstorming notes » (brouillons, historiques de révision ou notes de remue-méninges), et il distingue l’historique des versions de l’éditeur comme ce qui a tendance à trancher la question. Ces preuves doivent déjà exister au moment où vous en aurez besoin, ce qui en fait un travail d’aujourd’hui plutôt qu’un travail d’après le courriel.
La sortie est une lecture du texte qui se trouve devant elle, pas un relevé de la façon dont ce texte est apparu. Quelle que soit la pastille sur laquelle vous êtes tombé, l’argument que vous pouvez réellement gagner porte sur votre processus, et la preuve de cela se trouve dans vos brouillons.
Pour aller plus loin
- GPTZero contre Turnitin : pourquoi les scores ne concordent pas et ce que chaque outil mesure réellement — pour quand les deux outils renvoient deux chiffres différents sur le même fichier.
- Turnitin a supprimé le surlignage violet « AI-paraphrased » — le jeu de labels de Turnitin a changé en août 2026, et une ancienne capture n’est pas périmée de la façon qu’on imagine.
- Pourquoi un même texte n’obtient jamais le même score d’un détecteur à l’autre
- Ce que les détecteurs d’IA mesurent au-delà de la perplexité et de la burstiness — GPTZero dit avoir cessé d’utiliser les deux à l’automne 2023, en passant à une architecture d’apprentissage profond.
- Signalé, mais c’est vous qui l’avez écrit : préparer une réponse
- Personal Statement signalé comme IA : c’est le sujet imposé qui a choisi la forme d’abord
Tout ce qui est cité plus haut a été lu sur les propres pages de GPTZero et à partir d’un scan gratuit lancé sans être connecté, les 15 et 17 septembre 2026, et chaque citation indique où elle se trouve. Là où deux de ces pages donnent des chiffres différents pour la même chose, les deux sont ici.
CONTINUER LA LECTURE
GPTZero vs Turnitin : pourquoi les scores diffèrent et ce que chaque outil mesure réellement
5 min de lecture
Détecteurs IAPourquoi un même texte obtient un score différent sur chaque détecteur
5 min de lecture
Rapports de détectionTurnitin a supprimé le surlignage violet du texte paraphrasé par IA
11 min de lecture