Turnitin pubblica due tassi di falsi positivi diversi. Quello per le frasi è del 4%.

Se sono evidenziate solo una o due frasi, il numero che descrive la tua situazione non è quel valore inferiore all'1% che tutti citano. Il Chief Product Officer di Turnitin ha pubblicato nel giugno 2023 un tasso distinto, a livello di frase, di circa il 4%, insieme a una statistica sul punto in cui si collocano questi segnali sbagliati. Entrambi i numeri portano con sé delle condizioni, e un elaborato senza IA resta fuori da entrambi.

Team HumanPen

· 5 min di lettura

A cosa si riferisce davvero il 4%

Se hai davanti un report in cui sono segnalate un paio di frasi, il 4% è la probabilità che una qualsiasi di quelle frasi evidenziate sia in realtà scritta da un essere umano. Il segnale su quella frase specifica può essere sbagliato, e «circa il 4%» è la frequenza con cui questo accade. È un numero per frase, non per documento, e l'uno non si ricava dall'altro.

Il Chief Product Officer di Turnitin, Annie Chechitelli, lo ha descritto così nel giugno 2023:

«Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written. The incidence for this is more common in documents that contain a mix of human- and AI-written content, particularly in the transitions between human- and AI-written content.» (Il nostro tasso di falsi positivi a livello di frase è intorno al 4%. Significa che c'è una probabilità del 4% che una frase specifica evidenziata come scritta dall'IA sia in realtà scritta da un essere umano. Il fenomeno è più frequente nei documenti che contengono un mix di contenuti scritti da esseri umani e dall'IA, in particolare nei passaggi tra gli uni e gli altri.)

Il 4% riguarda una frase che è già stata evidenziata. Dice qualcosa sull'affidabilità di un singolo segnale, non su quanti segnali vedrai in un intero documento.

Il tasso a livello di documento è un numero diverso

Per i documenti Turnitin pubblica un tasso separato, più basso:

«Our document false positive rate - incorrectly identifying fully human-written text as AI-generated within a document- is less than 1% for documents with 20% or more AI writing.» (Il nostro tasso di falsi positivi a livello di documento, cioè l'identificazione errata, all'interno di un documento, di un testo interamente scritto da un essere umano come generato dall'IA, è inferiore all'1% per i documenti con il 20% o più di scrittura IA.)

Due cose saltano agli occhi. Da un lato, il tasso descrive un intero documento segnalato a torto come contenente testo IA quando in realtà è scritto interamente da un essere umano. Dall'altro, il valore inferiore all'1% è esplicitamente condizionato ai documenti che contengono il 20% o più di scrittura IA, cioè documenti misti in cui il testo IA è davvero presente.

Quale dei due copre un elaborato che hai scritto interamente da solo

Ecco la parte in cui è facile sbagliare, e su cui vale la pena essere precisi: nessuno dei due dati pubblicati riguarda un elaborato che hai scritto interamente da solo.

Il 4% è descritto come una caratteristica dei documenti misti, «particularly in the transitions between human- and AI-written content.» (in particolare nei passaggi tra contenuti scritti da esseri umani e contenuti scritti dall'IA). Un elaborato senza testo IA non ha questi passaggi, quindi lo scenario a cui Turnitin collega il 4% non descrive la tua situazione.

Ma neanche la soglia dell'1% interviene a coprirti. Rileggi la sua stessa formulazione: è «less than 1% for documents with 20% or more AI writing.» (inferiore all'1% per i documenti con il 20% o più di scrittura IA). Questo dato porta con sé una condizione, e un documento senza scrittura IA non la soddisfa.

Quindi entrambi i numeri hanno un ambito, e un elaborato interamente umano sta fuori da entrambi. Vale la pena saperlo prima che qualcuno ti citi l'uno o l'altro come se la questione fosse chiusa.

Dove si concentrano i segnali sbagliati

Turnitin ha fornito un dato preciso su dove compaiono queste frasi segnalate a torto:

«As explained in my earlier article, there is a correlation between these sentences and their proximity in the document to actual AI writing. 54% of the time, these sentences are located right next to actual AI writing.» (Come spiegato nel mio articolo precedente, esiste una correlazione tra queste frasi e la loro vicinanza, nel documento, alla scrittura IA effettiva. Nel 54% dei casi, queste frasi si trovano esattamente accanto a scrittura IA effettiva.)

«Queste frasi» indica i falsi positivi: le frasi scritte da un essere umano che sono state segnalate comunque. Più della metà si trova subito accanto a testo scritto davvero dall'IA. Questo concorda con l'affermazione precedente secondo cui i passaggi tra scrittura umana e scrittura IA sono il punto in cui i falsi positivi si concentrano.

Ed è per questo che la statistica taglia nella direzione opposta, nel tuo caso. Se i segnali sono sparsi in un elaborato in cui non c'è testo IA da nessuna parte, il meccanismo che Turnitin descrive qui non è quello che li produce. È la spiegazione di dove si addensano i suoi errori nei documenti misti, e nient'altro.

Come Turnitin dice che va letto un segnale

Lo stesso post dice chiaramente che un'evidenziazione è un punto di partenza, non un accertamento, e lo dice ai docenti, cioè proprio a chi vuoi che lo legga:

«Consider highlighted sentences as areas of interest because they're predicted to be close to where AI writing is present. But a small percentage of times, the AI model could get it wrong. So, use the information to initiate a conversation, not to draw a conclusion.» (Considera le frasi evidenziate come aree di interesse, perché si prevede che siano vicine al punto in cui è presente scrittura IA. Ma in una piccola percentuale di casi il modello IA può sbagliare. Quindi usa l'informazione per avviare una conversazione, non per trarre una conclusione.)

Esclude anche la cosa con cui gli studenti più spesso credono di venire misurati. Non esiste un numero da centrare:

«Remember that there is no 'right' or 'target' score with the AI writing indicator, just like with a Similarity Score.» (Ricorda che con l'indicatore di scrittura IA non esiste un punteggio «giusto» né un punteggio «obiettivo», proprio come con il Similarity Score.)

Cosa fare con un report che porta due frasi

Niente di tutto questo ti dice se sei nei guai, perché nessun numero pubblicato può farlo. Quello che ti dà è un modo per tenere la conversazione sul report stesso invece che su una percentuale.

  • Chiedi quali passaggi, e fatti dare il report invece di uno screenshot. Due frasi evidenziate e un numero a livello di documento sono oggetti diversi. Le evidenziazioni sono l'unica parte con una posizione su cui puoi puntare il dito.
  • Chiedi quale numero ti stanno citando, e leggi a voce alta la sua condizione. Il valore inferiore all'1% porta «for documents with 20% or more AI writing» (per i documenti con il 20% o più di scrittura IA) nella sua stessa frase. Se quella condizione non descrive il tuo elaborato, dillo.
  • Porta con te l'indicazione dello stesso Turnitin. Dice ai docenti di usare un'evidenziazione per avviare una conversazione, non per arrivare a una conclusione. Quella frase è rivolta alla persona che ha in mano il tuo report, ed è citata sopra parola per parola.
  • Tieni quello che mostra come è stato scritto l'elaborato — bozze, cronologia delle versioni, appunti, le letture che hai fatto. Questa è una prova di paternità. Una percentuale non lo è.

CONTINUA A LEGGERE