Pangram face à Turnitin : pourquoi les deux scores d’IA ne concordent pas
Une revue, un établissement ou une plateforme de publication a fait passer votre texte dans Pangram, et vous disposez aussi d’un chiffre Turnitin. Les deux ne sont pas d’accord. La raison est plus précise que « des modèles différents » : les deux fournisseurs ne publient même pas le même type de mesure et, en dessous, ils comptent des unités différentes sur des corpus différents. Voici ce que chacun publie, et ce que vous pouvez faire de deux chiffres qui ne se réconcilieront pas.
L'équipe HumanPen
· 19 min de lecture
La réponse courte
Un résultat Pangram et un résultat Turnitin ne sont pas deux lectures de la même grandeur : un écart entre eux est donc attendu, et non la preuve que l’un des deux est cassé. Le livre blanc de Turnitin d’août 2024 indique que l’entreprise n’utilise pas « accuracy » (exactitude) comme mesure. La page d’accueil de Pangram, consultée le 15 septembre 2026, arbore le badge « 99.9%+ Accuracy » (plus de 99,9 % d’exactitude). Sous le titre, les deux divergent à nouveau : la FAQ de Turnitin décrit des phrases notées au sein de segments chevauchants et un pourcentage calculé sur le texte éligible, tandis que la model card de Pangram décrit une prédiction au niveau des tokens avec trois étiquettes et des fractions du document pondérées par les caractères. Le chiffre qui porte des conséquences est celui que produit l’outil avec lequel votre établissement prend sa décision.
Les deux fournisseurs ne s’accordent pas sur la mesure à publier
Le livre blanc de Turnitin, Turnitin's AI Writing Detection Model Architecture and Testing Protocol, daté d’août 2024, dit ceci :
« Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed. » (Turnitin n’utilise pas « accuracy » comme mesure, car elle est trop facilement manipulable et trop dépendante du jeu de données précis sur lequel elle est calculée.)
La phrase suivante en donne la raison, et vous pouvez vérifier le calcul vous-même :
« For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system. » (Par exemple, prenez un jeu de données de 100 textes, dont 99 sont écrits par des humains. Un algorithme simple et naïf qui identifie tous les textes comme « écrits par des humains » obtiendrait 99 % d’exactitude sur ce jeu de données, tout en n’ayant aucune valeur comme système de détection de l’écriture par IA.)
Cet exemple mérite qu’on s’y arrête. Un détecteur qui ne signale jamais rien en place juste 99 sur ces 100 : le chiffre bouge donc avec la composition du jeu de test, pas avec la qualité du détecteur. Le livre blanc dit que Turnitin « uses two main metrics to test AIW-2: recall and FPR » (utilise deux mesures principales pour tester AIW-2 : le rappel et le taux de faux positifs), et définit les deux dans la même section avec des exemples traités.
Pangram publie un chiffre d’exactitude bien en vue. Le badge de la page d’accueil annonce « 99.9%+ Accuracy » (plus de 99,9 % d’exactitude ; relevé le 15 septembre 2026). La page « enseignement supérieur » affiche les deux à la fois : « 99.98% accuracy » (99,98 % d’exactitude) dans la phrase d’ouverture et, 52 caractères plus loin, dans la même bannière, un badge « 99.9%+ Accuracy » (plus de 99,9 % d’exactitude), avec seulement « Detects AI Assistance Free Credits » (détecte l’assistance par IA, crédits gratuits) entre les deux. La model card de Pangram pour Pangram 4, datée du 29 juillet 2026, ne met l’exactitude en avant nulle part : elle publie des taux de faux positifs et de faux négatifs ventilés par corpus, langue et domaine.
Les deux chiffres de tête ne sont donc pas un chiffre haut et un chiffre bas pour la même propriété. Un fournisseur a publié une objection écrite à la mesure que l’autre met en avant. Nous ne disons pas que l’un des deux choix est mauvais, et rien de tout cela n’est secret : les deux déclarations sont aujourd’hui sur des pages publiques.
Ce que chaque score compte réellement
Les deux systèmes renvoient un pourcentage. Ces pourcentages sont construits à partir de matériaux différents.
| Turnitin (FAQ et livre blanc d’août 2024) | Pangram (model card de Pangram 4, 29 juillet 2026) | |
|---|---|---|
| Unité classée | Des phrases, regroupées en segments chevauchants | Des tokens, décodés en segments de longueur variable |
| Traitement du chevauchement | Les phrases présentes dans plusieurs segments reçoivent plusieurs scores, « which are then pooled into a single score » (qui sont ensuite regroupés en un seul score) | « predictions for tokens that appear in multiple windows are aligned and averaged » (les prédictions pour les tokens qui apparaissent dans plusieurs fenêtres sont alignées et moyennées), au sein d’une fenêtre d’inférence de 512 tokens |
| De quoi le pourcentage du document est-il une part | Le texte éligible seulement. « this percentage is not necessarily the percentage of the entire submission » (ce pourcentage n’est pas nécessairement le pourcentage de l’ensemble du dépôt) | Le document analysé. `fraction_human`, `fraction_ai_assisted` et `fraction_ai` sont « character-weighted » (pondérées par les caractères) et « sum to 1.0 » (leur somme vaut 1,0) |
| Nombre de classes | Deux. Le pourcentage couvre le texte « likely generated by AI or likely generated and modified by an AI paraphraser or bypasser » (probablement généré par IA, ou probablement généré puis modifié par un paraphraseur ou un contourneur d’IA) | Trois : `Human` (humain), `AI-Assisted` (assisté par IA), `AI-Generated` (généré par IA) |
| Longueur minimale | 300 mots de prose | 50 mots |
| Résultats bas | De 1 % à 19 %, un astérisque s’affiche, sans pourcentage ni surlignage | `prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise (renvoie la forme courte « écrit par un humain » lorsque les caractères humains représentent au moins 90 %, « IA » lorsque les caractères générés par l’IA représentent au moins 80 %, et « mixte » sinon) |
C’est la ligne du dénominateur qui fait mal. La FAQ de Turnitin indique que le pourcentage affiché couvre « the amount of qualifying text within the submission » (la quantité de texte éligible dans le dépôt), et que « If text within the submission is not considered long-form prose text, it will not be included. » (Si un texte du dépôt n’est pas considéré comme de la prose longue, il ne sera pas inclus.) Les fractions de Pangram couvrent le texte analysé et s’additionnent à 1,0. Donnez aux deux systèmes un mémoire avec une longue bibliographie, une table des matières et deux ou trois tableaux : ils ne travaillent déjà plus sur le même corps de mots avant même qu’aucun modèle ne tourne. Comment lire un rapport d’écriture IA de Turnitin détaille ce qui entre dans le dénominateur de Turnitin et ce qui en sort.
Pourquoi le 1 % et le 1 sur 10 000 ne sont pas sur la même échelle
Voici les deux chiffres que l’on met côte à côte, et diviser l’un par l’autre produit un rapport qui ne veut rien dire. Les deux s’appellent taux de faux positifs. Aucun n’est mesuré comme l’autre.
La FAQ de Turnitin fixe une cible :
« We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing. » (Nous nous efforçons de maximiser l’efficacité de notre détecteur tout en maintenant notre taux de faux positifs — identifier à tort comme généré par l’IA un texte entièrement écrit par un humain — sous 1 % pour les documents comportant plus de 20 % d’écriture par IA.)
Cette condition en fin de phrase porte toute l’affirmation, et le livre blanc explique d’où elle vient. Un document est étiqueté comme généré par IA lorsque plus de 20 % de ses scores au niveau de la phrase franchissent un seuil de phrase, et le livre blanc indique que « the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%). » (le seuil de 20 % de proportion du document ainsi que le seuil de modèle prédéterminé ont été choisis pour maintenir le taux de faux positifs au niveau du document sous 0,01 (1 %)). Le seuil et le taux sont deux pièces d’un même mécanisme, et non une affirmation indépendante à son sujet. Ce que signifie un taux de faux positifs de 1 % lorsqu’une université dépose 75 000 copies fait la multiplication.
La FAQ de la page d’accueil de Pangram donne un taux :
« Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents. » (Le taux de faux positifs de Pangram — le taux auquel des documents humains sont signalés à tort comme IA — est actuellement de 1 sur 10 000. Ce chiffre est calculé sur un agrégat de jeux de données publics contenant des dizaines de millions de documents écrits.)
La model card donne un chiffre plus étroit, avec un corpus nommé : « At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples. » (Au point de fonctionnement de production, Pangram 4 atteint un taux de faux positifs de 0,0041 % — environ 1 sur 24 000 — sur 1 000 000 d’exemples d’évaluation FineWeb en anglais écrits par des humains.) Un second tableau de la fiche ventile le taux par domaine, et sa ligne « écriture académique » affiche 0,019 % sur 62 971 éléments, au-dessus du chiffre global anglais qui figure juste au-dessus.
Des règles d’étiquetage différentes, des points de fonctionnement différents et, du côté de Turnitin, un taux qui ne s’applique qu’au-dessus d’un seuil de 20 %. Nous n’allons donc pas vous livrer de comparaison arithmétique entre les deux chiffres. Ce que vous pouvez faire, c’est demander sur quoi chacun a été mesuré, et les deux fournisseurs répondent par écrit. La FAQ de Turnitin indique qu’elle valide son taux sur « over 700,000 additional academic papers that were written before the release of ChatGPT » (plus de 700 000 articles académiques supplémentaires écrits avant la sortie de ChatGPT). La page d’accueil de Pangram attribue son taux à « an aggregate of public datasets » (un agrégat de jeux de données publics) et sa model card attribue le chiffre plus étroit à des exemples FineWeb, l’écriture académique apparaissant séparément comme une ligne de domaine parmi onze. Ce sont des réponses à des questions différentes, et c’est là tout le problème.
La même étiquette recouvre des chiffres à dénominateurs différents
Un taux de faux positifs ne veut dire quelque chose qu’avec l’ensemble de documents sur lequel il a été calculé. Les deux fournisseurs publient plusieurs chiffres sous une seule étiquette, et une paire mérite d’être parcourue en entier, parce que l’explication évidente de l’écart se révèle être la mauvaise.
Pangram d’abord, tout vérifié le 15 septembre 2026. Lisez la colonne de droite avec autant d’attention que celle de gauche : une partie de l’écart tient à la page sur laquelle vous êtes tombé, et une partie à ce contre quoi chaque chiffre a été mesuré.
| Chiffre | Où il apparaît |
|---|---|
| « 99.9%+ Accuracy » (plus de 99,9 % d’exactitude) | Badge de la page d’accueil, et un badge dans la bannière de la page enseignement supérieur |
| « 99.98% accuracy » (99,98 % d’exactitude) | Phrase d’ouverture de cette même bannière, 52 caractères plus tôt |
| « 99.26% overall » (99,26 % au total) | Pangram vs. Turnitin, un billet daté du 28 juillet 2026 |
| Aucun chiffre d’exactitude | Model card de Pangram 4, datée du 29 juillet 2026, qui publie à la place des FPR et des FNR par corpus |
| « 1 in 10,000 » (1 sur 10 000) | FAQ de la page d’accueil, portant sur « an aggregate of public datasets » (un agrégat de jeux de données publics) |
| « roughly 1 in 24,000 » (environ 1 sur 24 000) | Model card, sur 1 000 000 d’exemples anglais de FineWeb |
| « approximately 1 in 25,000 » (environ 1 sur 25 000) pour les essais académiques | Le billet du 28 juillet 2026 |
| 0,019 % pour « Academic Writing (English) » (écriture académique, anglais) | Model card, sur 62 971 éléments, au-dessus de son propre chiffre global |
Turnitin produit la version la plus bénigne de ce phénomène à l’intérieur d’un seul fichier : le livre blanc d’août 2024 donne le taux de faux positifs au niveau du document d’AIW-2 à 0,5 % dans son texte et à 0,51 % dans le tableau 1, sur le même ensemble de 719 877 copies étudiantes d’avant 2019.
La paire qui compte le plus est celle des deux chiffres que Turnitin publie sous le même nom de taux de faux positifs au niveau de la phrase. En juin 2023, son Chief Product Officer a écrit :
« Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written. » (Notre taux de faux positifs au niveau de la phrase est d’environ 4 %. Cela signifie qu’il y a 4 % de chances qu’une phrase précise signalée comme écrite par l’IA ait en fait été écrite par un humain.)
Le livre blanc d’août 2024 donne 0,33 %, à partir d’un test de résistance sur des copies déposées avant 2019 dont il dit : « All papers in this dataset are human written. » (Tous les documents de ce jeu de données sont écrits par des humains.)
La lecture tentante est qu’un modèle a changé entre les deux. Il a changé, et cela n’explique pas l’écart. Le livre blanc indique qu’AIW-1 a été lancé en avril 2023 et que « In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model » (En décembre 2023, Turnitin a lancé AIW-2, un modèle mis à jour et amélioré destiné à remplacer le modèle AIW-1) : le modèle en service en juin 2023 était donc AIW-1. Cherchez ensuite AIW-1 dans le tableau 2 du livre blanc lui-même : sur ce même ensemble de 719 877 copies, son taux de faux positifs au niveau de la phrase est de 0,42 %, et non de 4 %. Même modèle, même étiquette, deux chiffres distants d’un ordre de grandeur. L’histoire de la version s’effondre.
Ce qui diffère, c’est l’ensemble sur lequel chaque pourcentage est calculé. Les 4 % sont conditionnés à une phrase déjà signalée : parmi les phrases que le détecteur a signalées, cette part peut s’avérer humaine. Les 0,42 % et 0,33 % portent sur des textes entièrement humains dès le départ : parmi toutes ces phrases, c’est cette part qui a été signalée. Ces deux mesures répondent à deux questions différentes, et rien n’oblige leurs résultats à être proches. Vous pouvez lire la définition des 4 % dans l’explication de Turnitin de juin 2023.
Rien de tout cela n’est un fournisseur pris en faute, et rien de tout cela n’est un chiffre périmé. C’est ce qui arrive lorsqu’une même expression est attachée à plusieurs mesures différentes. Alors, lorsqu’on vous oppose un taux en réunion, la question qui vous mène quelque part est : sur quel ensemble a-t-il été calculé ? Tous les documents déposés ? Seulement les phrases déjà signalées ? Seulement la prose éligible ? Un pourcentage sans ensemble associé ne peut pas être vérifié, et ne peut pas non plus être contesté.
Ce que les tests indépendants apportent, et ce qu’ils ne tranchent pas
Une seule étude relue par des pairs et en accès ouvert a testé les deux outils l’un contre l’autre. Who wrote this? Evaluating the reliability of AI detection tools in higher education, publiée dans l’International Journal for Educational Integrity le 29 juin 2026, a constitué un ensemble synthétique de 160 articles académiques en anglais, quarante dans chacune des quatre catégories, chacun d’au moins 4 000 mots.
Sur l’ensemble écrit par des humains, le résultat vaut pour les quatre outils testés : « all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers. » (les quatre outils ont correctement classé 100 % des textes humains comme « vrais négatifs » — recevant un score entre 0 et 20 %. Cela indique qu’aucun des détecteurs n’est enclin à signaler à tort comme générée par l’IA l’écriture humaine dans cette collection d’articles). Sur l’ensemble entièrement généré par IA, les deux outils se séparent. L’article rapporte que « Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%) » (Turnitin a classé 100 % des articles entièrement générés par IA comme faux négatifs — scores entre 0 et 20 %), et que « Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified. » (Pangram était le seul outil à bien fonctionner, avec une exactitude stricte de 65 % et une exactitude inclusive de 97,5 %, ne laissant qu’un seul cas mal classé).
Avant que quiconque ne vous cite cela dans un sens ou dans l’autre, les auteurs posent eux-mêmes leurs limites : « the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category » (la portée de notre recherche était limitée à 160 articles, quatre outils de détection d’IA et un modèle d’IA générative — GPT-4o Deep Research — pour la catégorie entièrement générée par IA), et les résultats ne sont « valid only for a specific snapshot in time » (valables uniquement pour un instantané précis dans le temps). Leur recommandation aux institutions est la phrase à emporter en réunion : les outils de détection « should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy. » (ne doivent pas être utilisés comme seule preuve dans des décisions à forts enjeux, mais doivent s’inscrire dans une stratégie d’évaluation plus large).
Une remarque de formulation, parce que la version éditée voyage plus loin que l’originale. La phrase conclusive de l’article dit : « From the four AI detection tools studied here, at this moment only one produced satisfactory results. » (Parmi les quatre outils de détection d’IA étudiés ici, un seul a produit à ce moment des résultats satisfaisants.) Le propre résumé qu’en fait Pangram la rend ainsi : « only [Pangram] produced satisfactory results » (seul [Pangram] a produit des résultats satisfaisants), avec la substitution entre crochets.
Deux autres travaux sont cités dans cette comparaison, et les deux appellent une réserve. Une note de recherche du Becker Friedman Institute de l’Université de Chicago, datée du 6 octobre 2025, indique que « Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages » (Parmi les options commerciales, Pangram atteint des taux de faux positifs et de faux négatifs essentiellement nuls sur les passages de longueur moyenne à longue). Elle n’a pas testé Turnitin : les quatre outils étaient Pangram, Originality.ai, GPTZero et une base RoBERTa. Son corpus comptait 1 992 passages dans six genres courants, dont des articles de presse, des blogs, des avis de consommateurs et des CV, et non des travaux d’étudiants. Il y a aussi un lien qu’il faut mettre sur la table, avec ses deux moitiés : l’un des deux auteurs, Alex Imas, figure dans un témoignage signé sur la page d’accueil de Pangram, et le document de travail porte sur sa page d’ouverture une ligne disant « All authors declare that they have no financial or personal conflicts of interest related to this study. » (Tous les auteurs déclarent n’avoir aucun conflit d’intérêts financier ou personnel lié à cette étude.) L’article se télécharge gratuitement depuis l’institut, à deux clics de la note. Pesez cela comme vous pensez qu’il le mérite ; nous préférons que vous voyiez les deux faits plutôt qu’aucun.
Le second est le test pratique d’un journaliste de TechCrunch en juillet 2026, qui a tiré deux chiffres d’un seul article : « Pangram gave it a 13% AI assisted score » (Pangram lui a attribué un score d’assistance par IA de 13 %), et « when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score. » (lorsque j’ai donné à Pangram ce même article dans son intégralité, tel que je l’avais écrit, il a obtenu un score humain de 100 %). La session d’un journaliste n’est pas un banc d’essai. C’est un témoignage de première main montrant que la manière dont un texte est soumis change le chiffre qui revient, ce qui est exactement votre position lorsque deux institutions traitent deux fichiers différents.
Il y a enfin le cas où les deux ne sont pas comparables du tout, parce qu’un seul des deux renvoie un chiffre. Le même article relu par des pairs note sous sa figure principale que « Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score » (Turnitin considère comme incertains les articles dont le score IA se situe entre 0 % et 20 % et les marque d’un astérisque au lieu d’un score numérique), et qu’en conséquence « 19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure. » (19 articles entièrement générés par IA, 7 hybrides, 6 humanisés et 3 entièrement humains ont été codés comme manquants dans la figure). Soit 35 des 160 articles sans aucun chiffre Turnitin à opposer à quoi que ce soit. Si votre résultat Turnitin est un astérisque, vous ne défendez pas un score bas, vous n’avez pas de score, et ce que signifie l’astérisque (*%) sur un score d’IA Turnitin explique la règle d’affichage qui le sous-tend.
Que faire lorsque les deux résultats ne concordent pas
Commencez par obtenir les rapports, car des deux côtés vous dépendez de la personne qui les a lancés. La FAQ de Turnitin dit : « The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students. » (L’indicateur et le rapport de détection d’écriture IA ne sont pas visibles pour les étudiants. Cependant, avec la fonction de téléchargement PDF, les enseignants peuvent télécharger et partager le rapport IA avec les étudiants.) Le centre d’aide de Pangram indique qu’un résultat peut être partagé par un lien et que les destinataires « will see the scan overview and segment details without having to create a Pangram account. » (verront la vue d’ensemble de l’analyse et le détail des segments sans avoir à créer un compte Pangram). Demandez les deux, et du côté de Pangram demandez précisément le lien de partage plutôt qu’une capture d’écran : la vue par segments montre quels passages ont produit le chiffre, et la capture d’un pourcentage ne vous montre rien d’exploitable.
Ne comptez pas corriger le dossier directement auprès de Pangram. Son dispositif de retour est attaché au compte qui a lancé l’analyse : la page d’aide demande « Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account » (d’ouvrir le résultat sur lequel vous voulez donner votre avis, soit après l’avoir analysé, soit depuis la page History / All Checks de votre compte), avec un pouce vers le haut et un pouce vers le bas sous le résultat. Une analyse lancée par votre professeur n’est pas dans votre compte.
Nous n’avons pas non plus trouvé de voie de recours publiée pour la personne qui reçoit un résultat. Nous avons lu le texte principal des 256 URL listées dans le sitemap de Pangram le 15 septembre 2026, soit 2 117 382 caractères au total, et cherché sur chaque page. `appeal` (« recours ») apparaît sur une seule, dans un billet de blog sur la publicité, au sens de quelque chose d’attractif. `dispute` (« litige ») apparaît sur deux : la clause d’arbitrage des conditions d’utilisation et un billet de partenariat sur les conflits d’auteur. `grievance` (« grief »), `contest` (« contester »), `redress` (« réparation »), `ombuds` (« médiateur ») et `request a review` (« demander une révision ») n’apparaissent sur aucune des 256. La même recherche a trouvé `false positive` (« faux positif ») sur 162 de ces pages et `student` (« étudiant ») sur 182, ce qui vous prouve que le compteur trouvait bien des correspondances au lieu de renvoyer discrètement zéro à chaque requête.
Une limite à ce comptage, puisque c’est le genre d’affirmation que vous devriez pouvoir casser si elle est fausse : un sitemap n’est pas tout le site. La page que cet article cite le plus, la model card de Pangram 4, renvoie un code 200 et ne figure pas dans ce sitemap. Lisez donc le résultat comme 256 pages listées sans aucune telle voie, et non comme une affirmation sur toutes les pages hébergées par Pangram. Et lisez-le dans les deux sens : cela ne veut pas dire que Pangram refuse les corrections, et cela ne veut certainement pas dire que votre établissement n’a pas de procédure. Cela veut dire que le fournisseur n’est pas l’adresse à laquelle s’adresser.
Deux organisations qui déploient Pangram publient leur propre voie, et ce sont celles-là qu’il vaut mieux connaître. Substack dit aux auteurs de « select Report detection error » (sélectionner « Signaler une erreur de détection ») sur un rapport de détection d’IA, et documente un contrôle « Disable AI detection » (désactiver la détection d’IA) sur les brouillons. Wiki Education, qui fait passer les modifications Wikipédia de ses participants dans Pangram, explique aux enseignants ce qui se cache derrière la plupart des erreurs qu’elle a confirmées : « If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen. » (Si un étudiant enregistre un plan vide — par exemple avec seulement de courts points ou des en-têtes de section vides — ou inclut une quantité importante de texte non prose, comme des fragments de phrase ou des entrées bibliographiques, cela peut déclencher le détecteur d’IA. Le texte non prose est un facteur courant dans la plupart des faux positifs confirmés que nous avons vus.) Elle écrit aussi qu’elle « not use Pangram as definitive proof that the text was AI generated » (n’utilise pas Pangram comme preuve définitive que le texte a été généré par IA), mais « a way to flag which text needs additional human scrutiny for verifiability. » (comme un moyen de signaler quel texte nécessite un examen humain supplémentaire pour en vérifier la fiabilité).
Ce point sur le texte non prose se vérifie sur votre propre fichier, et la model card de Pangram le confirme du côté du fournisseur. Le modèle est destiné aux écrits « of at least 50 words, written primarily in complete sentences » (d’au moins 50 mots, composés principalement de phrases complètes), et la fiche énumère ce qui sort de ce cadre, notamment « tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation » (les tables des matières, les sections de références, les écrits issus de modèles ou automatisés, les instructions et manuels techniques, et les textes dominés par la notation mathématique). Elle ajoute que « human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document » (les en-têtes, pieds de page, instructions et autres mises en forme parasites écrits par des humains doivent être retirés avant de vérifier un document), et que « Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts. » (le texte brut et les fichiers .docx sont recommandés plutôt que les PDF lorsque c’est possible, car l’analyse des PDF peut introduire des artefacts involontaires). Deux questions concrètes à poser à la personne qui a lancé l’analyse : était-ce un PDF, et la bibliographie et les pages liminaires sont-elles passées avec ?
Quelques lignes méritent d’être citées en réunion précisément parce qu’elles viennent des fournisseurs et non de nous. Le guide de Pangram pour les enseignants dit : « we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures » (nous croyons que la détection d’IA est un excellent moyen de signaler des devoirs, mais qu’un résultat de détection justifie une enquête plus approfondie avant toute mesure punitive — l’orthographe est la leur), et ajoute que « A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong. » (Un taux de faux positifs non nul signifie que toute détection positive peut être réelle, ou peut être le cas statistiquement anormal, une fois sur dix mille, où Pangram se trompe.) La FAQ de Turnitin dit : « Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies. » (Turnitin ne détermine pas s’il y a eu inconduite ; il fournit plutôt des données permettant aux enseignants de prendre une décision éclairée fondée sur leurs politiques académiques et institutionnelles.)
La page de Pangram pour les enseignants oriente aussi ceux-ci vers des preuves du processus d’écriture, en citant Google Docs : « select File -> Version history -> See version history to see a full history of their writing process. » (sélectionner Fichier -> Historique des versions -> Afficher l’historique des versions pour voir l’historique complet de leur processus d’écriture). Si vous disposez de cet historique, la conversation quitte la question de savoir quel pourcentage a raison, qui est la seule question que les chiffres publiés ne peuvent pas trancher. Comment conserver l’historique des versions dans Word, Google Docs et Overleaf indique où chaque outil le stocke, et signalé à tort comme IA : comment faire appel, et quelles preuves votre université acceptera couvre le reste de la démarche.
Ce que cela change pour vous
- Les deux fournisseurs ne publient pas la même mesure. Le livre blanc de Turnitin d’août 2024 indique qu’il n’utilise pas l’exactitude comme mesure ; Pangram met en avant un chiffre d’exactitude sur sa page d’accueil et sur sa page « enseignement supérieur ».
- Les pourcentages comptent des choses différentes. Celui de Turnitin ne couvre que la prose éligible ; les fractions de Pangram sont pondérées par les caractères sur le texte analysé et leur somme vaut 1,0. L’objectif de Turnitin de rester sous 1 % est en outre conditionné aux documents comportant plus de 20 % d’écriture par IA : aucun calcul ne permet donc de le transformer en le 1 sur 10 000 de Pangram.
- Demandez sur quel ensemble un pourcentage a été calculé, pas quelle version l’a produit. Turnitin publie deux taux au niveau de la phrase : environ 4 % (juin 2023) et 0,33 % (livre blanc d’août 2024). Un changement de modèle a bien eu lieu entre les deux, en décembre 2023, et il n’explique pas l’écart : le livre blanc situe l’ancien modèle à 0,42 % sur son corpus de test, pas à 4 %. Ce qui les sépare, c’est l’ensemble. Les 4 % ne comptent que les phrases déjà signalées ; les 0,42 % et 0,33 % portent sur des textes entièrement humains.
- Établissez si votre chiffre est une part ou une confiance avant de le comparer à quoi que ce soit.
- Un astérisque n’est pas un score bas. Dans l’étude relue par des pairs, 35 des 160 articles n’avaient aucun chiffre Turnitin.
- Faites passer votre contestation par la personne qui a lancé l’analyse. Le dispositif de retour de Pangram se trouve dans le compte qui a analysé, et aucune des 256 pages listées dans son sitemap ne porte de voie de recours pour la personne signalée. Demandez le rapport lui-même, et le lien de partage Pangram avec sa vue par segments.
Si vous détenez un rapport Turnitin ou iThenticate, vous pouvez importer le rapport et travailler sur les passages qu’il a signalés. Les passages éligibles peuvent être relancés gratuitement.
CONTINUER LA LECTURE
Pourquoi un même texte obtient un score différent sur chaque détecteur
5 min de lecture
Détecteurs IAQue signifie un taux de faux positifs de 1 % quand une université soumet 75 000 mémoires
8 min de lecture
Rapports de détectionQue signifie l'astérisque (\*%) sur un score d'IA Turnitin ?
11 min de lecture