GPTZero contro Turnitin: perché i punteggi non combaciano e cosa misura davvero ciascuno strumento

Se analizzi lo stesso testo con GPTZero e Turnitin, i punteggi spesso non coincidono. Non è segno che uno strumento sia difettoso. I diversi rilevatori usano modelli diversi, dati di addestramento diversi e convenzioni di punteggio diverse. Ecco cosa dice la documentazione ufficiale di Turnitin sul funzionamento del suo rilevatore e perché i confronti tra strumenti non sono affidabili.

Team HumanPen

· 5 min di lettura

I rilevatori usano modelli diversi

GPTZero e Turnitin sono sistemi separati sviluppati da team diversi. Ognuno ha il proprio modello, i propri dati di addestramento e il proprio approccio alla classificazione del testo. Quando due rilevatori usano modelli diversi, i risultati sullo stesso documento non si allineano. Un testo che GPTZero valuta al 60% AI potrebbe ricevere un 30% da Turnitin, o viceversa. Nessuno dei due punteggi è necessariamente sbagliato: sono stime di probabilità da modelli addestrati su dati diversi.

Non esiste un punteggio universale di rilevamento AI a cui tutti gli strumenti convergono: è questa la forma del problema in perché lo stesso testo ottiene punteggi diversi su ogni rilevatore. Ogni strumento produce la propria stima. Confrontare i punteggi tra strumenti come se misurassero la stessa cosa nelle stesse unità di misura genera confusione.

Non stiamo dicendo che uno strumento sia più accurato dell'altro. La documentazione descrive come funziona il rilevatore di Turnitin, e quel meccanismo differisce da ciò che fanno gli altri strumenti.

Come il rilevatore di Turnitin assegna il punteggio a un documento

La documentazione di Turnitin descrive un processo specifico per arrivare a un punteggio AI a livello di documento:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un documento viene inviato a Turnitin, le frasi del testo vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento AI e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato da AI. Ogni frase ammissibile all'interno di queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi raggruppati in un unico valore. Questi punteggi a livello di frase vengono ulteriormente aggregati e utilizzati per calcolare il punteggio AI complessivo del documento.)

Il punteggio è un'aggregazione di previsioni a livello di sezione. Le sezioni si sovrappongono e i punteggi delle frasi vengono raggruppati prima dell'aggregazione. Altri rilevatori possono segmentare il testo in modo diverso, usare unità predittive diverse o aggregare i punteggi con modalità differenti.

La documentazione di Turnitin chiarisce anche che la percentuale di rilevamento scrittura AI e il punteggio Similarity sono misurazioni separate. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." Il punteggio Similarity indica la percentuale di testo corrispondente trovata nel documento inviato quando confrontato con la raccolta completa di contenuti di Turnitin per il controllo delle similarità. Un punteggio di similarità alto non significa un punteggio AI alto, e viceversa. Rapporto sulla scrittura AI di Turnitin vs Rapporto di similarità mette i due a confronto.

L'obiettivo di falsi positivi di Turnitin

Turnitin dichiara un obiettivo specifico per il tasso di falsi positivi nella sua documentazione:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Ci impegniamo a massimizzare l'efficacia del nostro rilevatore mantenendo il nostro tasso di falsi positivi – identificare erroneamente testo completamente scritto da umani come generato da AI – sotto l'1% per documenti con oltre il 20% di scrittura AI.)

La documentazione poi riformula così: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." Questa riformulazione omette il qualificatore "oltre il 20% di scrittura AI". La versione con la soglia del 20% è l'affermazione più precisa.

Per convalidare questo tasso, Turnitin descrive un processo di test: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Per rafforzare il nostro framework di test e diagnosticare le tendenze statistiche dei falsi positivi, prima di ogni aggiornamento o rilascio di un nuovo modello, eseguiamo test su oltre 700.000 articoli accademici aggiuntivi scritti prima del rilascio di ChatGPT per convalidare ulteriormente il nostro tasso di falsi positivi inferiore all'1%.)

Questo è l'obiettivo dichiarato di Turnitin e il suo processo di convalida. Il costo reale dell'1% alla scala di invio di un'università è approfondito in cosa significa un tasso di falsi positivi dell'1%. Altri rilevatori possono avere obiettivi diversi, metodi di convalida differenti o potrebbero non pubblicare cifre comparabili. Non possiamo fare un confronto diretto di accuratezza tra strumenti basandoci su queste informazioni. Possiamo solo riportare cosa dice la documentazione di Turnitin.

I documenti brevi si comportano in modo diverso

La lunghezza del documento influisce sul comportamento del rilevatore di Turnitin. Per i testi brevi, il meccanismo di punteggio può produrre risultati estremi:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Nei documenti più brevi, con solo poche centinaia di parole, la previsione sarà per lo più "tutto o niente" perché si effettua la previsione su un'unica sezione senza possibilità di sovrapposizione.)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Questo significa che alcuni testi che sono un mix di contenuti generati da AI e originali potrebbero essere segnalati come interamente generati da AI.)

Il meccanismo di sovrapposizione che smorza i punteggi nei documenti più lunghi non funziona quando c'è una sola sezione su cui prevedere. Poche centinaia di parole di testo misto umano e AI possono risultare al 100% AI, uno dei casi spiegati in perché Turnitin dice che il tuo lavoro è 100% AI. È un limite negli input brevi, non un giudizio definitivo sulla composizione del testo.

Se GPTZero valuta un documento breve in modo diverso, il comportamento tutto-o-niente è una spiegazione. I due strumenti gestiscono i testi brevi in modo diverso perché le loro architetture di punteggio differiscono.

La fascia asterisco 1-19%

Turnitin non visualizza un punteggio numerico per i risultati di rilevamento AI tra l'1% e il 19%. La documentazione afferma:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (Per evitare potenziali incidenze di falsi positivi, non viene attribuito alcun punteggio o evidenziazione per i punteggi di rilevamento AI nella fascia dall'1% al 19%. Quando viene rilevata scrittura AI sotto la soglia del 20% nel report, ora è indicata con un asterisco (%) e non viene attribuita alcuna percentuale.)

Questo significa che se il modello di Turnitin stima il contenuto AI al 12%, il report mostrerà un asterisco invece di un numero. Non vengono applicate neanche evidenziazioni. Il ragionamento è evitare di evidenziare potenziali falsi positivi in una fascia a bassa confidenza, spiegato più approfonditamente in cosa significa l'asterisco (*%) su un punteggio AI di Turnitin.

GPTZero e altri strumenti possono visualizzare i punteggi in questa fascia in modo diverso. Alcuni mostrano una percentuale completa per qualsiasi risultato non zero. Turnitin sopprime il numero sotto il 20%. Questo è un altro motivo per cui i punteggi non combaceranno: uno strumento può mostrare una percentuale numerica dove l'altro mostra solo un asterisco.

Cosa significa per te

Se stai confrontando i punteggi di GPTZero e Turnitin sullo stesso documento, ecco cosa tenere a mente:

  • Modelli diversi, punteggi diversi. GPTZero e Turnitin usano modelli di rilevamento separati addestrati su dati separati. I loro punteggi non dovrebbero coincidere.
  • Turnitin assegna i punteggi aggregando sezioni. Il testo viene segmentato, valutato per sezione e aggregato. Il punteggio AI e il punteggio Similarity sono completamente indipendenti.
  • Turnitin mira a meno dell'1% di falsi positivi per documenti con oltre il 20% di scrittura AI, convalidato su oltre 700.000 articoli accademici aggiuntivi scritti prima del rilascio di ChatGPT.
  • I documenti brevi ricevono punteggi tutto-o-niente. Poche centinaia di parole possono produrre un risultato 0% o 100% anche quando il testo è misto.
  • I punteggi sotto il 20% appaiono come asterisco. Nessuna percentuale numerica o evidenziazione appare nella fascia 1-19%.

I passaggi idonei possono essere rieseguiti gratuitamente.