ChatGPT est-il un détecteur d'IA  ? Ce qu'OpenAI a publié sur son propre classifieur

Un nombre croissant d'accusations commence par la capture d'écran d'un chatbot qui affirme que « ceci a probablement été écrit par une IA ». Il vaut la peine de savoir ce que l'entreprise qui se trouve derrière ce chatbot a publié sur cette pratique précise.

L'équipe HumanPen

· 6 min de lecture

La réponse courte

Non. OpenAI a construit pour cela un classifieur distinct, entraîné exprès, a publié la précision mesurée — il a correctement identifié 26 % du texte écrit par IA tout en étiquetant à tort 9 % du texte écrit par un humain comme écrit par une IA — et l'a retiré le 20 juillet 2023, en indiquant qu'il était retiré « due to its low rate of accuracy » (en raison de son faible taux de précision). Un modèle de chat à qui l'on demande « est-ce que l'IA a écrit ceci  ? » n'est pas ce classifieur et ne l'a jamais été  ; il produit une réponse qui sonne juste parce que produire des réponses qui sonnent juste est précisément ce qu'il fait.

Ce qu'OpenAI a réellement construit, et ce qu'il a mesuré

En janvier 2023, OpenAI a publié un classifieur « trained to distinguish between text written by a human and text written by AIs from a variety of providers » (entraîné à distinguer un texte écrit par un humain d'un texte écrit par des IA de divers fournisseurs). L'annonce est toujours en ligne, avec une note de retrait ajoutée en haut.

Les chiffres figurent dans l'annonce elle-même, pas dans un test indépendant mené par quelqu'un  :

"In our evaluations on a 'challenge set' of English texts, our classifier correctly identifies 26% of AI-written text (true positives) as 'likely AI-written,' while incorrectly labeling human-written text as AI-written 9% of the time (false positives)." (Dans nos évaluations sur un « challenge set » de textes anglais, notre classifieur identifie correctement 26 % du texte écrit par IA comme « probablement écrit par IA », les vrais positifs, tout en étiquetant à tort comme écrit par IA un texte écrit par un humain dans 9 % des cas, les faux positifs.)

Vingt-six pour cent détectés. Neuf pour cent des textes humains signalés à tort. Et il s'agit de l'évaluation que le fournisseur fait lui-même d'un système qu'il a construit exprès, avec accès aux sorties de ses propres modèles comme données d'entraînement.

Le premier paragraphe contient une phrase que l'on cite moins souvent qu'il ne faudrait  : « it is impossible to reliably detect all AI-written text. » (il est impossible de détecter de manière fiable tout le texte écrit par une IA).

Les limites qu'il a publiées sur lui-même

L'annonce comporte une section sur les limites, et elle se lit comme si elle avait été écrite par des gens qui s'attendaient à ce qu'on en fasse un mauvais usage. Dans ses propres termes  :

  • "It should not be used as a primary decision-making tool, but instead as a complement to other methods of determining the source of a piece of text." (Il ne doit pas être utilisé comme outil principal de décision, mais plutôt en complément d'autres méthodes permettant de déterminer la source d'un texte.)
  • "The classifier is very unreliable on short texts (below 1,000 characters). Even longer texts are sometimes incorrectly labeled." (Le classifieur est très peu fiable sur les textes courts, en dessous de 1,000 caractères. Même des textes plus longs sont parfois étiquetés incorrectement.)
  • "Sometimes human-written text will be incorrectly but confidently labeled as AI-written by our classifier." (Il arrive que du texte écrit par un humain soit étiqueté à tort mais avec assurance comme écrit par une IA par notre classifieur.)
  • "We recommend using the classifier only for English text. It performs significantly worse in other languages and it is unreliable on code." (Nous recommandons d'utiliser le classifieur uniquement pour du texte anglais. Ses performances sont nettement moins bonnes dans d'autres langues et il n'est pas fiable sur le code.)
  • "Text that is very predictable cannot be reliably identified." (Un texte très prévisible ne peut pas être identifié de manière fiable.) L'exemple donné est une liste des 1,000 premiers nombres premiers, « because the correct answer is always the same » (parce que la réponse correcte est toujours la même).
  • "Classifiers based on neural networks are known to be poorly calibrated outside of their training data. For inputs that are very different from text in our training set, the classifier is sometimes extremely confident in a wrong prediction." (On sait que les classifieurs fondés sur des réseaux de neurones sont mal calibrés en dehors de leurs données d'entraînement. Pour des entrées très différentes des textes de notre jeu d'entraînement, le classifieur se montre parfois extrêmement sûr d'une prédiction erronée.)

Ce troisième point et le dernier sont le même phénomène énoncé deux fois  : la confiance et la justesse ne sont pas liées. Quand un outil de ce type dit « certainement IA », ce n'est pas une affirmation plus forte que lorsqu'il dit « probablement IA ». C'est la même mécanique avec un chiffre différent accroché.

Puis il a été retiré

En haut de la même page  :

"As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy." (Depuis le 20 juillet 2023, le classifieur d'IA n'est plus disponible en raison de son faible taux de précision.)

Une entreprise qui retire son propre produit et cite la précision comme raison fournit l'une des preuves les plus nettes que ce domaine produise. Cela lui coûte quelque chose de le dire, et c'est précisément pourquoi cela vaut plus qu'un avis tiers dans un sens ou dans l'autre.

Le modèle de chat n'est pas le classifieur

C'est la partie qu'il faut le plus dire, parce que le retrait est parfois rapporté comme si la capacité avait glissé dans le chatbot. Ce n'est pas le cas. Le classifieur était un modèle affiné séparément, décrit dans l'annonce comme « a language model fine-tuned on a dataset of pairs of human-written text and AI-written text on the same topic » (un modèle de langage affiné sur un jeu de données composé de paires de textes écrits par des humains et de textes écrits par des IA sur le même sujet), avec un seuil de confiance délibérément ajusté « to keep the false positive rate low » (pour maintenir un faible taux de faux positifs).

Rien de tout cela ne décrit une interface de chat. Lorsqu'on demande à un modèle de chat si un passage a été écrit par une IA, il n'a aucun composant de détection à consulter  ; il génère le type de texte qui suit généralement ce type de question. Il produira un verdict au ton assuré, un pourcentage si vous en demandez un, et une liste de raisons — et il produira souvent un verdict différent pour le même passage au deuxième essai.

La capture d'écran qui circule n'est donc pas une mesure faible. Ce n'est pas une mesure.

Ce que cela dit et ne dit pas de Turnitin

Le classifieur retiré d'un fournisseur ne dit rien du produit actuel d'un autre fournisseur, et il serait malhonnête de l'étirer jusque-là.

Le détecteur de Turnitin est un système différent, décrit par son fabricant en d'autres termes, avec ses propres affirmations publiées et ses propres modes de défaillance documentés. Les détecteurs divergent en général fortement entre eux sur un même passage, ce qui est un problème distinct avec ses propres preuves, exposé dans l'écart entre détecteurs sur un texte identique. Et la population la plus touchée par les faux positifs est documentée, d'une manière qui compte si l'anglais n'est pas votre première langue  : voir ce que la recherche montre sur l'écriture en anglais non maternel.

L'affirmation étroite qui est faite ici est la seule que la source appuie  : demander à un modèle de chat si quelque chose a été écrit par une IA n'est pas de la détection, et l'entreprise qui fabrique le modèle de chat le plus connu a publié un classifieur construit exprès, l'a mesuré et l'a retiré.

Si c'est ainsi que vous avez été signalé

Un peu de forme pratique, sans prétendre que nous connaissons le processus de votre établissement.

  1. Établissez ce qui a produit l'accusation. « Ça a été signalé » peut désigner un détecteur institutionnel assorti d'un rapport, ou une personne qui a collé votre travail dans un chatbot. Ce sont des situations différentes, et une seule s'accompagne d'un document.
  2. S'il existe un rapport, demandez-le. Un rapport contient des passages et des emplacements  ; la capture d'écran d'une fenêtre de chat contient une phrase.
  3. Posez deux fois la même question à un modèle de chat, sur le même passage, dans deux sessions distinctes. L'instabilité est une propriété que vous pouvez démontrer plutôt que simplement affirmer.
  4. Ne commencez par aucun de ces points. La procédure et la provenance convainquent  ; les arguments sur les outils le font rarement, et ouvrir par une objection technique peut donner l'impression d'éluder la question.

Notre place là-dedans

Nous réécrivons des documents, autant donc être clairs  : rien de ce qui précède n'est un argument selon lequel la détection ne fonctionnerait pas, et nous n'en vendons aucun. L'outil HumanPen s'adresse à la situation où un vrai rapport existe et où des passages précis portent des surlignages. Ces surlignages fixent la limite de ce qu'il modifie  ; rien en dehors n'est touché.

Si votre situation se résume à la capture d'un chatbot sans rapport derrière, vous n'avez pas un problème de réécriture. Vous avez une conversation à avoir, et ce qui précède est ce que nous y apporterions.

Questions fréquentes

ChatGPT peut-il dire si un texte a été écrit par une IA  ? OpenAI a construit un classifieur distinct pour cette tâche plutôt que d'utiliser le modèle de chat, a publié sa précision et l'a retiré en juillet 2023 en invoquant son faible taux de précision. Une interface de chat n'a aucun composant de détection à consulter.

Quels étaient les chiffres du classifieur d'OpenAI  ? Sur un « challenge set » de textes anglais, il a correctement identifié 26 % du texte écrit par IA et a étiqueté à tort comme écrit par IA un texte écrit par un humain dans 9 % des cas.

Pourquoi le chatbot a-t-il l'air si sûr de lui  ? Les limites publiées par OpenAI elle-même signalent que les classifieurs de ce type peuvent être « extremely confident in a wrong prediction » (extrêmement sûrs d'une prédiction erronée), et le ton assuré d'un modèle de chat tient à sa façon d'écrire plutôt qu'à une preuve concernant votre texte. Poser deux fois la question donne souvent deux réponses différentes.

Cela veut-il dire que la détection d'IA de Turnitin ne fonctionne pas non plus  ? Cela n'en dit rien. Fournisseur différent, système différent, affirmations publiées différentes. La seule chose que cette source appuie, c'est qu'utiliser un modèle de chat comme détecteur n'est pas de la détection.

CONTINUER LA LECTURE