ChatGPT è un rilevatore di IA? Quello che OpenAI ha pubblicato sul classificatore che aveva costruito

Un numero crescente di accuse comincia con lo screenshot di un chatbot che dice «questo probabilmente è stato scritto da una IA». Vale la pena sapere cosa ha pubblicato l'azienda dietro quel chatbot proprio su questa pratica.

Team HumanPen

· 6 min di lettura

La risposta breve

No. OpenAI ha costruito per questo un classificatore separato, addestrato apposta, ne ha pubblicato l'accuratezza misurata — ha identificato correttamente il 26% del testo scritto dall'IA mentre etichettava erroneamente come scritto dall'IA il 9% del testo scritto da esseri umani — e lo ha ritirato il 20 luglio 2023, indicando che veniva ritirato «due to its low rate of accuracy» (a causa del basso tasso di accuratezza). Un modello chat a cui si chiede «è stato scritto da una IA?» non è quel classificatore e non lo è mai stato; produce una risposta che suona plausibile perché produrre risposte che suonano plausibili è esattamente ciò che fa.

Cosa ha costruito davvero OpenAI e cosa ha misurato

Nel gennaio 2023 OpenAI ha pubblicato un classificatore «trained to distinguish between text written by a human and text written by AIs from a variety of providers» (addestrato a distinguere tra testi scritti da un essere umano e testi scritti da IA di diversi fornitori). L'annuncio è ancora online, con una nota di ritiro aggiunta in cima.

I numeri stanno nell'annuncio stesso, non in un test indipendente di qualcuno:

"In our evaluations on a 'challenge set' of English texts, our classifier correctly identifies 26% of AI-written text (true positives) as 'likely AI-written,' while incorrectly labeling human-written text as AI-written 9% of the time (false positives)." (Nelle valutazioni che abbiamo fatto su un "challenge set" di testi in inglese, il nostro classificatore identifica correttamente il 26% del testo scritto dall'IA come «probabilmente scritto dall'IA», i veri positivi, mentre etichetta erroneamente come scritto dall'IA un testo scritto da un essere umano nel 9% dei casi, i falsi positivi.)

Ventisei per cento individuati. Nove per cento della scrittura umana segnalati a torto. E questa è la valutazione che il fornitore fa di un sistema che ha costruito di proposito, avendo accesso alle uscite dei modelli che produce come dati di addestramento.

Il paragrafo di apertura contiene una frase che viene citata meno spesso di quanto dovrebbe: «it is impossible to reliably detect all AI-written text.» (è impossibile rilevare in modo affidabile tutto il testo scritto da una IA).

I limiti che ha pubblicato su se stesso

L'annuncio contiene una sezione sui limiti, e si legge come se l'avessero scritta persone che si aspettavano di vederlo usato male. Con le parole del documento:

  • "It should not be used as a primary decision-making tool, but instead as a complement to other methods of determining the source of a piece of text." (Non dovrebbe essere usato come strumento principale di decisione, ma come complemento di altri metodi per determinare la fonte di un testo.)
  • "The classifier is very unreliable on short texts (below 1,000 characters). Even longer texts are sometimes incorrectly labeled." (Il classificatore è molto inaffidabile sui testi brevi, sotto 1,000 caratteri. Anche testi più lunghi a volte vengono etichettati in modo errato.)
  • "Sometimes human-written text will be incorrectly but confidently labeled as AI-written by our classifier." (A volte il testo scritto da un essere umano viene etichettato in modo errato ma con sicurezza come scritto dall'IA dal nostro classificatore.)
  • "We recommend using the classifier only for English text. It performs significantly worse in other languages and it is unreliable on code." (Consigliamo di usare il classificatore solo per testi in inglese. Funziona in modo decisamente peggiore in altre lingue e non è affidabile sul codice.)
  • "Text that is very predictable cannot be reliably identified." (Un testo molto prevedibile non può essere identificato in modo affidabile.) L'esempio che viene fatto è un elenco dei primi 1,000 numeri primi, «because the correct answer is always the same» (perché la risposta corretta è sempre la stessa).
  • "Classifiers based on neural networks are known to be poorly calibrated outside of their training data. For inputs that are very different from text in our training set, the classifier is sometimes extremely confident in a wrong prediction." (È noto che i classificatori basati su reti neurali sono calibrati male al di fuori dei dati su cui sono stati addestrati. Per input molto diversi dai testi presenti nel nostro set di addestramento, il classificatore a volte è estremamente sicuro di una previsione sbagliata.)

Il terzo punto e l'ultimo sono lo stesso fenomeno enunciato due volte: la sicurezza e la correttezza non sono collegate. Se uno strumento di questo tipo dice «sicuramente IA» non è un'affermazione più forte di quando dice «probabilmente IA». È il medesimo meccanismo con un numero diverso attaccato.

Poi è stato ritirato

In cima alla stessa pagina:

"As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy." (A partire dal 20 luglio 2023 il classificatore IA non è più disponibile a causa del basso tasso di accuratezza.)

Un'azienda che ritira un prodotto realizzato da lei stessa e indica l'accuratezza come motivo offre una delle prove più nette che questo campo produca. Dirlo le costa qualcosa, ed è esattamente per questo che vale più dell'opinione di terzi in una direzione o nell'altra.

Il modello chat non è il classificatore

Questa è la parte che più ha bisogno di essere detta, perché il ritiro a volte viene raccontato come se la capacità fosse passata al chatbot. Non è così. Il classificatore era un modello ottimizzato separatamente, descritto nell'annuncio come «a language model fine-tuned on a dataset of pairs of human-written text and AI-written text on the same topic» (un modello linguistico ottimizzato su un dataset di coppie di testi scritti da esseri umani e testi scritti da IA sullo stesso argomento), con una soglia di confidenza regolata di proposito «to keep the false positive rate low» (per mantenere basso il tasso di falsi positivi).

Niente di tutto questo descrive un'interfaccia di chat. Quando a un modello chat si chiede se un passaggio è stato scritto da una IA, non ha alcun componente di rilevamento da consultare; genera il tipo di testo che di solito segue quel tipo di domanda. Produrrà un verdetto dal tono sicuro, una percentuale se la chiedi e un elenco di motivi — e spesso produrrà un verdetto diverso per lo stesso passaggio al secondo tentativo.

Quindi lo screenshot che circola non è una misurazione debole. Non è una misurazione.

Cosa dice e cosa non dice di Turnitin

Il classificatore ritirato di un fornitore non dice nulla sul prodotto attuale di un altro fornitore, e sarebbe disonesto tirarlo fino a quel punto.

Il rilevatore di Turnitin è un sistema diverso, descritto da chi lo produce con termini diversi, con affermazioni pubblicate che gli appartengono e modalità di errore documentate che gli appartengono. I rilevatori in genere divergono molto tra loro sullo stesso passaggio, ed è un problema a parte con prove a parte, illustrato in quanto divergono i rilevatori su un testo identico. E la popolazione più colpita dai falsi positivi è documentata, in un modo che conta se l'inglese non è la tua prima lingua: vedi cosa mostra la ricerca sulla scrittura in inglese non nativo.

L'affermazione ristretta che facciamo qui è la sola che la fonte sostiene: chiedere a un modello chat se qualcosa è stato scritto da una IA non è rilevamento, e l'azienda che produce il modello chat più conosciuto ha pubblicato un classificatore costruito apposta, lo ha misurato e lo ha ritirato.

Se è così che sei stato segnalato

Un po' di struttura pratica, senza fingere di conoscere il processo della tua istituzione.

  1. Stabilisci che cosa ha prodotto l'accusa. «È stato segnalato» può indicare un rilevatore istituzionale con un report, oppure una persona che ha incollato il tuo lavoro in un chatbot. Sono situazioni diverse e solo una delle due arriva con un documento.
  2. Se esiste un report, chiedilo. Un report contiene passaggi e posizioni; lo screenshot di una finestra di chat contiene una frase.
  3. Fai la stessa domanda due volte a un modello chat, sullo stesso passaggio, in due sessioni nuove. L'instabilità è una proprietà che puoi dimostrare invece di limitarti ad affermarla.
  4. Non iniziare da nessuna di queste cose. Procedura e provenienza convincono; le argomentazioni sugli strumenti lo fanno di rado, e partire con un'obiezione tecnica può sembrare un modo di evitare la domanda.

Da che parte stiamo

Riscriviamo documenti, quindi è bene essere chiari: nulla di quanto sopra è un argomento per dire che il rilevamento non funziona, e non ne vendiamo uno. Lo strumento HumanPen serve per la situazione in cui esiste un report reale e passaggi specifici sono evidenziati. Quelle evidenziazioni definiscono il confine di ciò che modifica; nulla al di fuori viene toccato.

Se la tua situazione è lo screenshot di un chatbot senza alcun report alle spalle, non hai un problema di riscrittura. Hai una conversazione da affrontare, e quanto sopra è ciò che vi porteremmo.

Domande frequenti

ChatGPT sa dire se un testo è stato scritto da una IA? OpenAI ha costruito un classificatore separato per questo compito invece di usare il modello chat, ne ha pubblicato l'accuratezza e lo ha ritirato nel luglio 2023 citando il basso tasso di accuratezza. Un'interfaccia di chat non ha alcun componente di rilevamento da consultare.

Quali erano i numeri del classificatore di OpenAI? Su un "challenge set" di testi in inglese ha identificato correttamente il 26% del testo scritto dall'IA e ha etichettato erroneamente come scritto dall'IA un testo scritto da un essere umano nel 9% dei casi.

Perché il chatbot suona così sicuro? Nelle limitazioni che OpenAI ha pubblicato si segnala che i classificatori di questo tipo possono essere «extremely confident in a wrong prediction» (estremamente sicuri di una previsione sbagliata), e il tono sicuro di un modello chat è una proprietà del modo in cui scrive, non una prova sul tuo testo. Chiedere due volte spesso produce due risposte diverse.

Questo significa che anche il rilevamento IA di Turnitin non funziona? Non dice nulla al riguardo. Fornitore diverso, sistema diverso, affermazioni pubblicate diverse. L'unica cosa che questa fonte sostiene è che usare un modello chat come rilevatore non è rilevamento.

CONTINUA A LEGGERE