Undetectable AI vs Turnitin: cosa dice davvero la documentazione

Se fai analizzare lo stesso testo dal rilevatore di Undetectable AI e da Turnitin, i punteggi molto spesso non coincidono. È normale che sia così. I due strumenti si basano su modelli diversi, addestrati su dati diversi e con convenzioni di punteggio diverse. Ecco cosa dice la documentazione di Turnitin su come funziona il suo rilevatore e sul perché i punteggi non possano allinearsi.

Team HumanPen

· 5 min di lettura

Undetectable AI e Turnitin sono due sistemi separati

Il rilevatore di Undetectable AI e il rilevamento della scrittura AI di Turnitin sono sviluppati da team diversi, partendo da modelli di base diversi. Ciascuno è stato addestrato sui propri dati e classifica il testo secondo il proprio metodo. Quando due rilevatori usano modelli diversi, sullo stesso testo producono punteggi diversi. Un passaggio che Undetectable AI valuta come AI al 70% potrebbe ricevere da Turnitin un punteggio del 25%, oppure il contrario. Nessuno dei due risultati è per forza sbagliato: sono stime di probabilità fornite da modelli diversi, addestrati su dataset diversi.

Non esiste un punteggio universale di rilevamento AI su cui tutti gli strumenti convergano, un punto approfondito in perché lo stesso testo ottiene punteggi diversi su ogni rilevatore. Ogni rilevatore produce la propria stima. Trattare i punteggi di strumenti diversi come se misurassero la stessa cosa, nelle stesse unità, porta solo confusione.

Non stiamo dicendo quale dei due strumenti sia più accurato. Stiamo descrivendo ciò che la documentazione di Turnitin dice del proprio sistema, e perché quel sistema produce punteggi che non combaciano con quelli di Undetectable AI.

Come funziona il processo di attribuzione del punteggio di Turnitin

Turnitin documenta un procedimento preciso con cui arriva al suo punteggio di scrittura AI:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (quando un elaborato viene inviato a Turnitin, le frasi del testo vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento AI e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia opera di un essere umano oppure generato dall'AI. Ogni frase idonea contenuta in queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono ricevere più punteggi, che vengono poi riuniti in un punteggio unico. I punteggi così ottenuti vengono ulteriormente aggregati e servono a calcolare il punteggio complessivo di scrittura AI del documento.)

Il procedimento passa dall'estrazione delle frasi alla loro suddivisione in unità sovrapposte, dall'attribuzione di un punteggio a ciascuna unità alla riunificazione dei punteggi delle singole frasi, fino all'aggregazione in una percentuale valida per l'intero documento. Altri rilevatori, Undetectable AI compreso, possono adottare strategie di segmentazione diverse, unità di previsione diverse o metodi di aggregazione diversi. I due strumenti non produrranno cifre coincidenti sullo stesso testo.

La documentazione di Turnitin chiarisce anche che la percentuale di rilevamento della scrittura AI e il punteggio di Similarity sono due grandezze distinte. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (il punteggio di Similarity e la percentuale di rilevamento della scrittura AI sono del tutto indipendenti e non si influenzano a vicenda). Il punteggio di Similarity indica la percentuale di testo corrispondente rilevata nel documento inviato, confrontandolo con l'ampia raccolta di contenuti che Turnitin usa per il controllo della similarità. Un documento può avere similarità alta e AI basso, o il contrario. Report di scrittura AI di Turnitin e Similarity Report a confronto mostra cosa conta ciascuno dei due numeri. I due numeri non si influenzano a vicenda.

Il tasso di falsi positivi dichiarato da Turnitin

Turnitin pubblica un obiettivo preciso in materia di falsi positivi:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (ci impegniamo a massimizzare l'efficacia del nostro rilevatore, mantenendo il tasso di falsi positivi - cioè il caso in cui un testo scritto interamente da un essere umano venga indicato come generato dall'AI - al di sotto dell'1% per i documenti con oltre il 20% di scrittura AI.)

La documentazione lo riformula così: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (in altre parole, potremmo segnalare come scritto dall'AI un documento scritto da un essere umano, una volta ogni 100 documenti interamente umani). Questa riformulazione lascia cadere la condizione «oltre il 20% di scrittura AI». La versione con la soglia del 20% è quella più precisa.

Per verificare questo obiettivo, Turnitin descrive il proprio quadro di test: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (per rafforzare il nostro quadro di test e individuare le tendenze statistiche dei falsi positivi, prima di ogni aggiornamento o rilascio di un nuovo modello eseguiamo test su oltre 700,000 elaborati accademici aggiuntivi, scritti prima del rilascio di ChatGPT, per confermare ulteriormente il nostro tasso di falsi positivi inferiore all'1%.)

Questo è ciò che Turnitin dice del proprio sistema. Per capire a cosa corrisponda quell'uno per cento nell'arco di un anno di consegne, vedi cosa significa un tasso di falsi positivi dell'1%. Undetectable AI può avere obiettivi di accuratezza diversi, processi di validazione diversi, oppure non pubblicare dati confrontabili. Un confronto diretto sull'accuratezza non siamo in grado di farlo: possiamo soltanto riferire ciò che la documentazione di Turnitin dichiara.

Il comportamento sui documenti brevi

La lunghezza del documento incide sul modo in cui il rilevatore di Turnitin elabora il testo. Con i documenti brevi il meccanismo di attribuzione del punteggio si comporta in modo diverso. La documentazione lo dice chiaramente:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (nei documenti più brevi, dove ci sono soltanto poche centinaia di parole, la previsione sarà in gran parte «tutto o niente», perché la previsione viene fatta su un singolo segmento, senza la possibilità di sovrapporre.)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (ciò significa che un testo in cui si mescolano contenuti generati dall'AI e contenuti originali potrebbe essere segnalato come interamente generato dall'AI.)

Il meccanismo di sovrapposizione che nei documenti più lunghi fa da media tra i punteggi non entra in funzione quando il testo è un unico segmento. Poche centinaia di parole in cui si mescolano testo umano e AI possono restituire un punteggio del 100%, ed è uno dei meccanismi che stanno dietro a perché Turnitin dice che il tuo elaborato è AI al 100%. È un comportamento strutturale, tipico degli input brevi.

Se Undetectable AI assegna allo stesso documento breve un punteggio diverso, è in parte perché i due strumenti non elaborano gli input brevi allo stesso modo.

Come vengono mostrati i punteggi bassi

Turnitin sopprime i punteggi numerici inferiori al 20%. La documentazione lo afferma esplicitamente:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (per evitare il possibile verificarsi di falsi positivi, non viene attribuito alcun punteggio né alcuna evidenziazione per i punteggi di rilevamento AI compresi tra l'1% e il 19%. Quando nel report viene rilevato un livello di AI inferiore alla soglia del 20%, questo viene ora indicato con un asterisco (*%) e non viene attribuita alcuna percentuale.)

Un documento che il modello di Turnitin stima all'8% di AI mostrerà un asterisco nel report, non il numero 8%. Il testo non riceve alcuna evidenziazione. La logica è evitare di far emergere possibili falsi positivi in una fascia di bassa confidenza, descritta più nel dettaglio in cosa significa l'asterisco (*%) in un punteggio AI di Turnitin.

Undetectable AI, in questa fascia, può mostrare i punteggi come percentuale piena. Altri strumenti possono evidenziare il testo a partire da qualsiasi valore diverso da zero. Turnitin, al di sotto del 20%, sopprime di proposito sia il numero sia le evidenziazioni. Questa convenzione di punteggio fa sì che i due strumenti presentino output molto diversi per uno stesso documento a basso contenuto di AI.

Cosa significa tutto questo per te

Se stai confrontando i risultati di Undetectable AI e di Turnitin sullo stesso documento, ecco il riassunto:

  • Modelli separati, punteggi separati. Undetectable AI e Turnitin usano modelli di rilevamento diversi. Non c'è da aspettarsi che i punteggi coincidano.
  • Turnitin arriva al punteggio segmentando e aggregando. Le frasi vengono estratte, suddivise in unità sovrapposte, valutate, riunificate e aggregate. Il punteggio AI e il punteggio di Similarity sono del tutto indipendenti.
  • Turnitin punta a restare sotto l'1% di falsi positivi per i documenti con oltre il 20% di scrittura AI, un obiettivo verificato su oltre 700,000 elaborati accademici aggiuntivi scritti prima di ChatGPT.
  • I documenti brevi ottengono punteggi tutto o niente. Poche centinaia di parole possono tornare indietro con 0% o 100%, anche quando il testo è misto.
  • I punteggi sotto il 20% compaiono come asterisco. Nella fascia 1-19% non appare né una percentuale numerica né alcuna evidenziazione.

I passaggi idonei possono essere rielaborati gratuitamente.

CONTINUA A LEGGERE