Cosa significa un tasso di falsi positivi dell'1% quando un'università invia 75.000 paper

Un tasso di errore dell'uno per cento sembra una differenza da arrotondamento, finché qualcuno non lo moltiplica per il proprio volume reale di invii. Un'università ha fatto questa moltiplicazione e l'ha pubblicata, insieme alla propria decisione.

Team HumanPen

· 8 min di lettura

La risposta breve

Il tasso di falsi positivi è una proprietà di una popolazione, non del tuo paper. La Vanderbilt University ha messo dei numeri su questo concetto nell'agosto 2023: aveva inviato 75.000 paper a Turnitin nel 2022, quindi se il rilevatore di AI fosse stato attivo allora, un tasso di falsi positivi dell'1% avrebbe significato "around 750 student papers could have been incorrectly labeled" (circa 750 paper di studenti avrebbero potuto essere etichettati in modo errato). Ha disattivato il rilevatore. Due condizioni accompagnano questa frase e entrambe vengono perse quando la si ripete: il rilevatore non era attivo nel 2022, ed è per questo che la fonte dice "if" (se), e la stessa cifra dell'1% del vendor ha un qualificatore che la frase successiva della stessa fonte ignora.

La moltiplicazione, con le parole dell'università

L'Office of Learning and Innovation della Vanderbilt ha pubblicato un post il 16 agosto 2023 intitolato "Guidance on AI Detection and Why We're Disabling Turnitin's AI Detector". La decisione è dichiarata chiaramente: "Vanderbilt has decided to disable Turnitin's AI detection tool for the foreseeable future." (La Vanderbilt ha deciso di disattivare lo strumento di rilevamento AI di Turnitin per il prossimo futuro).

Il passaggio che vale la pena portarsi appresso è il calcolo:

"At the time of launch, Turnitin claimed that its detection tool had a 1% false positive rate (Chechitelli, 2023). To put that into context, Vanderbilt submitted 75,000 papers to Turnitin in 2022. If this AI detection tool was available then, around 750 student papers could have been incorrectly labeled as having some of it written by AI." (Al momento del lancio, Turnitin ha dichiarato che il suo strumento di rilevamento aveva un tasso di falsi positivi dell'1% (Chechitelli, 2023). Per contestualizzare, la Vanderbilt ha inviato 75.000 paper a Turnitin nel 2022. Se questo strumento di rilevamento AI fosse stato disponibile allora, circa 750 paper di studenti avrebbero potuto essere etichettati in modo errato come contenenti testo scritto da AI).

Non c'è nulla di sofisticato qui. È l'un per cento di settantacinquemila. Ma trasforma una percentuale in un numero di documenti, e questa conversione è l'intera ragione per cui i tassi di errore sono difficili da concepire.

Ora rileggi la seconda frase da capo, a partire dalla parola if. Il rilevatore non era attivo quando quei 75.000 paper sono stati inviati, ed è questo che significa "if this AI detection tool was available then". Quindi 750 non è il conteggio di qualcosa che è realmente accaduto alla Vanderbilt o altrove. È solo come appare scritto l'un per cento del volume annuale reale di un'università. È un'affermazione più modesta di quella per cui la cifra viene solitamente usata, e molto più facile da difendere.

Perché il numero cambia significato a seconda da che parte si guarda

Per un vendor, uno su cento è una specifica tecnica. Per un'istituzione, è un carico annuale di casi. Per te, non è nessuna delle due cose — sei un singolo documento, e il tasso non dice nulla sul fatto che il tuo sia quell'uno.

Quest'ultimo punto funziona in entrambe le direzioni, ed è qui che si esagera in entrambi i sensi:

  • Non significa che la tua segnalazione sia probabilmente errata. Un tasso di errore dell'1% su paper scritti da umani è del tutto compatibile con il fatto che la maggior parte dei paper segnalati lo siano correttamente, a seconda di quanti fossero effettivamente assistiti da AI.
  • Significa che "lo strumento ha un'accuratezza del 99%, quindi devi averlo fatto tu" non è un argomento valido. Un tasso descrive una popolazione; non può dirti quale membro di quella popolazione hai davanti. E l'un per cento di un anno con 75.000 paper sono centinaia di documenti, quindi rientrare in quella fascia è la norma, non l'eccezione. Centinaia di documenti non sono però centinaia di accuse, e la distanza tra queste due cose è dove vivono la maggior parte delle versioni distorte di questo argomento.

L'atteggiamento utile non è né "il rilevatore non funziona" né "il rilevatore ha ragione". È che una statistica di popolazione non può giudicare un caso individuale, e il vendor è d'accordo per iscritto: la sua FAQ dice agli istruttori di non trattare la percentuale dell'indicatore di scrittura AI come "the sole basis for action or a definitive grading measure" (l'unica base per agire o una misura definitiva di valutazione).

Il qualificatore che continua a cadere

Ecco un dettaglio che conta, se mai dovrai citare la cifra dell'1% a qualcuno.

La FAQ di Turnitin espone l'affermazione così: si impegna a mantenere il proprio tasso di falsi positivi — "incorrectly identifying fully human-written text as AI-generated" (identificare erroneamente testo completamente scritto da umani come generato da AI) — "under 1% for documents with over 20% of AI writing." (sotto l'1% per documenti con oltre il 20% di scrittura AI).

For documents with over 20% of AI writing. (Per documenti con oltre il 20% di scrittura AI). È un limite sostanziale all'affermazione, e non sopravvive alla riformulazione del vendor stesso una frase dopo, che recita: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (In altre parole, potremmo segnalare un documento scritto da umani come scritto da AI per uno su ogni 100 documenti completamente scritti da umani).

Le due frasi non sono equivalenti, ed è la seconda quella che circola. Se usi la cifra, usa la versione con il qualificatore — in parte perché è accurata, e soprattutto perché qualcuno dall'altra parte del tavolo potrebbe sapere che il qualificatore esiste.

Quali parti di un post del 2023 sopravvivono quando vengono ripetute

Il post è dell'agosto 2023. Una parte è aritmetica, che non invecchia. Una parte è un'affermazione su ciò che il vendor aveva pubblicato, e quella invecchia. Distinguere queste due cose prima di citare qualsiasi cosa è gran parte del lavoro.

L'aritmetica si può ripetere senza problemi, con il se allegato. L'un per cento di un grande volume di invii è un gran numero di documenti, e nulla dal 2023 in poi cambia questo.

La preoccupazione per gli autori non madrelingua inglese si può ripetere senza problemi, e non si basa affatto su questo post. C'è ricerca dietro, e abbiamo esaminato cosa abbia effettivamente misurato quella ricerca in Il bias dei rilevatori di AI contro la scrittura in inglese non nativo.

La lamentela sulla trasparenza è quella da verificare prima di ripeterla. La Vanderbilt ha scritto che "Turnitin gives no detailed information as to how it determines if a piece of writing is AI-generated or not" (Turnitin non fornisce informazioni dettagliate su come determina se un testo è generato da AI o meno). La FAQ di oggi descrive invece come viene assemblato un punteggio: le frasi vengono estratte e segmentate in sezioni sovrapposte, ogni segmento viene classificato e riceve un valore tra 0 e 1, le frasi qualificate ereditano il punteggio del loro segmento, i punteggi sovrapposti vengono raggruppati e i punteggi delle frasi raggruppati vengono aggregati in un punteggio del documento. Se affermi in una riunione che non è mai stato pubblicato nulla su come funziona, qualcuno può metterti quella frase davanti.

Leggi però la frase che segue nel post, prima di decidere che l'obiezione è stata risolta, perché l'obiezione è più stretta di "diteci come funziona". La lamentela è che lo strumento "looks for patterns common in AI writing, but they do not explain or define what those patterns are" (cerca pattern comuni nella scrittura AI, ma non spiegano né definiscono quali siano questi pattern). Una descrizione di come i punteggi dei segmenti vengono combinati non è una descrizione dei pattern. Il meccanismo pubblicato e l'obiezione pubblicata riguardano due domande diverse, ed entrambi possono essere citati accuratamente nello stesso giorno.

Quello che non possiamo dirti è quando quella frase della FAQ sia apparsa per la prima volta. Non ne abbiamo datato la pubblicazione, quindi nulla di quanto sopra va letto come se il vendor lo avesse pubblicato in risposta a questo post.

Un altro qualificatore, e questo appartiene alla Vanderbilt. Il post descrive la funzionalità arrivata con "less than 24-hour advance notice, no option at the time to disable the feature" (meno di 24 ore di preavviso, nessuna opzione al momento per disattivare la funzionalità). At the time (al momento) è nella frase originale. Se lo citi senza queste tre parole, hai trasformato un'affermazione sul lancio in un'affermazione permanente sul prodotto. È la stessa mossa di togliere "over 20%" dalla cifra dell'1%, solo fatta dall'altra parte dell'argomento.

Come usare questo senza esagerare

  1. Cita la data. "Nel 2023, la Vanderbilt ha disattivato lo strumento e ha pubblicato questo ragionamento" è verificabile e difendibile. "Le università hanno abbandonato il rilevamento AI" non lo è.
  2. Spiega cosa illustra l'aritmetica. Funziona perché chiunque può rifarlo con il volume della propria istituzione, e fa un punto reale: una piccola percentuale produce comunque un carico di casi che qualcuno dovrà revisionare equamente. Quello che non fa è stimare le accuse. Non ogni invio è eleggibile per un punteggio, nessuno fuori dall'istituzione sa quanta percentuale di uso di AI ci fosse realmente, e una segnalazione non deve diventare un'accusa. Approfondiamo questo in Il 20% di AI è troppo?.
  3. Non affermare che dimostri qualcosa sul tuo documento. Stabilisce solo che essere segnalati erroneamente è un evento ordinario su larga scala, che è un'affermazione diversa e più moderata.
  4. Verifica se la tua istituzione ha pubblicato qualcosa. Cerca nella politica di integrità accademica e in ciò che pubblica il centro per la didattica e l'apprendimento, non solo nella pagina news. Una dichiarazione locale batte una lontana in ogni conversazione che potresti avere.
  5. Tienila fuori dall'apertura. Processo e provenienza convincono per primi; le statistiche sono ciò a cui ricorri quando qualcuno sostiene che il numero sia evidentemente conclusivo.

Se la tua istituzione lo usa ancora

Se è così, il report che hai davanti è l'oggetto che conta, non quanto sopra. Di cosa è statistica la percentuale e perché le evidenziazioni e il numero possono essere in disaccordo è un altro argomento, trattato in Leggere il report di scrittura AI riga per riga.

HumanPen entra in gioco solo quando sono segnati passaggi specifici e alcuni di essi devono essere modificati: il report stabilisce il perimetro, e i paragrafi non segnati mantengono la formulazione che già hai.

Nulla di tutto questo è una risposta a un falso positivo. Se la tua posizione è che l'hai scritto tu, riscriverlo è la mossa sbagliata, e ciò che ha realmente convinto i revisori è un argomento completamente diverso: L'evidenza che ha convinto una commissione.

Domande frequenti

Un tasso di falsi positivi dell'1% significa che la mia segnalazione è probabilmente errata? No. È un tasso calcolato su una popolazione di documenti scritti da umani e non dice nulla su un caso individuale. Significa però che su volumi istituzionali, i paper segnalati erroneamente sono un evento ordinario, non un'anomalia.

Da dove viene la cifra di 750? Dal post stesso della Vanderbilt del 16 agosto 2023, applicando la cifra dell'1% ai 75.000 paper inviati a Turnitin nel 2022. Nota il condizionale: il rilevatore non era attivo nel 2022, quindi la frase dice "if this AI detection tool was available then" (se questo strumento di rilevamento AI fosse stato disponibile allora). Mostra come appare scritto l'un per cento del volume di quell'università. Non è un registro di 750 paper segnalati erroneamente, e non è una previsione per l'istituzione di qualcun altro.

L'affermazione dell'1% è incondizionata? No. L'obiettivo dichiarato di Turnitin è sotto l'1% "for documents with over 20% of AI writing" (per documenti con oltre il 20% di scrittura AI). La sua stessa riformulazione nella frase successiva omette quel qualificatore, ed è per questo che circola la versione senza qualificatori.

Le università hanno generalmente disattivato il rilevamento AI? Questa fonte non supporta tale affermazione. Documenta la decisione di un'istituzione nel 2023, con il suo ragionamento. Se la tua istituzione lo usa è una domanda locale con una risposta locale.

CONTINUA A LEGGERE