Copyleaks contro Turnitin per il rilevamento dell'IA: perché i detector danno risultati diversi

Capita spesso che gli studenti facciano passare il proprio elaborato attraverso più detector dell'IA e ottengano punteggi completamente diversi. Turnitin potrebbe segnare il 20% mentre Copyleaks l'80%. La ragione è semplice: modelli diversi, dati di addestramento diversi, soglie di classificazione diverse. Capire perché i detector non concordano aiuta a leggere ogni punteggio nel giusto contesto.

Team HumanPen

· 4 min di lettura

La risposta breve

I detector dell'IA restituiscono punteggi diversi perché sono modelli differenti, addestrati su dati diversi e con soglie di classificazione diverse. Copyleaks e Turnitin sono prodotti separati, sviluppati da team separati. Ognuno ha il proprio modello, il proprio corpus di addestramento e il proprio modo di aggregare le previsioni a livello di segmento in un punteggio complessivo del documento. Quando Copyleaks dice 80% e Turnitin dice 20% sullo stesso testo, nessuno dei due è necessariamente sbagliato: stanno misurando pattern statistici diversi e applicando confini decisionali diversi. Il punteggio che dovrebbe interessarti è quello dello strumento che la tua istituzione usa davvero. Se la tua scuola usa Turnitin, il punteggio di Copyleaks è informativo ma non fa autorità.

Come funziona il detector di Turnitin

Le FAQ di Turnitin descrivono così la loro procedura:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un elaborato viene inviato a Turnitin, le frasi vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni segmento viene classificato dal modello di rilevamento IA e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia stato generato da umano o da IA. Ogni frase valida all'interno di questi segmenti eredita il punteggio del segmento. Poiché i segmenti si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi combinati in un unico valore. Questi punteggi a livello di frase vengono ulteriormente aggregati per calcolare il punteggio complessivo di scrittura IA del documento.)

Turnitin pubblica anche un obiettivo specifico per i falsi positivi: "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Ci sforziamo di massimizzare l'efficacia del nostro detector mantenendo il nostro tasso di falsi positivi – identificare erroneamente un testo scritto interamente da umani come generato da IA – sotto l'1% per i documenti con oltre il 20% di scrittura IA.) Questo obiettivo influenza quanto aggressivamente il modello classifica il testo al limite. Un modello tarato per minimizzare i falsi positivi classificherà più segmenti incerti come umani, il che può produrre punteggi IA più bassi su testi misti.

Perché Copyleaks e Turnitin non concordano

Copyleaks usa il proprio modello di rilevamento IA con i propri dati di addestramento e le proprie soglie di classificazione. I dettagli del modello di Copyleaks non sono pubblici come lo sono le FAQ di Turnitin, quindi non possiamo fare un confronto diretto dei loro meccanismi. Ma la ragione strutturale del disaccordo è chiara: due modelli diversi addestrati su dati diversi classificheranno lo stesso testo in modo diverso. Una frase che il modello di Turnitin classifica con probabilità IA di 0,3 potrebbe ottenere 0,7 dal modello di Copyleaks. Quando queste differenze a livello di segmento vengono aggregate lungo tutto il documento, le percentuali finali possono divergere in modo significativo. Perché lo stesso testo ottiene punteggi diversi su ogni detector spiega tutto questo in generale.

C'è anche una differenza di soglia. Turnitin non mostra punteggi tra l'1% e il 19%, visualizzando invece solo un asterisco. Le FAQ spiegano: "To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range." (Per evitare potenziali incidenze di falsi positivi, nessun punteggio o evidenziazione viene attribuito per i punteggi di rilevamento IA nell'intervallo dall'1% al 19%.) Se Copyleaks mostra un punteggio del 15% per lo stesso testo che Turnitin mostra come asterisco, la discrepanza è in parte una decisione di visualizzazione, non solo una differenza di classificazione – vedi cosa significa l'asterisco (*%) su un punteggio AI di Turnitin.

I documenti brevi amplificano il disaccordo

Le FAQ di Turnitin notano che i documenti brevi producono previsioni meno affidabili:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Nei documenti più brevi, dove ci sono solo poche centinaia di parole, la previsione sarà per lo più "tutto o niente" perché stiamo prevedendo su un singolo segmento senza possibilità di sovrapposizione.)

La frase successiva: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Questo significa che alcuni testi che sono un mix di contenuti generati da IA e originali potrebbero essere segnalati come interamente generati da IA.)

Su un documento breve, un detector potrebbe classificare l'intero testo come IA (ottenendo il 100%) mentre un altro lo classifica come umano (ottenendo lo 0%). Il comportamento "tutto o niente" significa che piccole differenze nel modo in cui ogni modello gestisce un singolo segmento possono produrre differenze drammatiche nel punteggio finale. Se stai confrontando punteggi tra detector, la lunghezza del documento conta. Un abstract di 300 parole potrebbe ottenere punteggi molto diversi da strumenti diversi, mentre un elaborato di 3.000 parole potrebbe mostrare un accordo più stretto.

Quale punteggio conta

Il punteggio che conta è quello dello strumento che la tua istituzione usa. Se la tua università usa Turnitin, il tuo punteggio AI di Turnitin è quello che influenza la tua posizione accademica. Un punteggio Copyleaks del 5% non ti aiuta se il tuo punteggio Turnitin è dell'80%. Un punteggio Copyleaks dell'80% non ti danneggia se la tua istituzione non usa Copyleaks. Far passare il tuo elaborato attraverso più detector può darti un'idea generale se il tuo testo ha pattern simili all'IA, ma non può dirti cosa dirà il detector della tua istituzione. L'unico modo per conoscere il tuo punteggio reale è vedere il report dello strumento che la tua istituzione usa, e solo docenti e amministratori possono vedere l'indicatore AI di Turnitin. Che la tua scuola ne gestisca uno o meno dipende da cosa hanno acquistato.

Cosa significa per te

Per riassumere quanto abbiamo visto:

  • I detector dell'IA usano modelli diversi con dati di addestramento e soglie diverse. Il disaccordo è prevedibile, non sorprendente.
  • Turnitin pubblica il proprio obiettivo per i falsi positivi (sotto l'1% per documenti con oltre il 20% di IA) e il proprio meccanismo (classificazione a segmenti sovrapposti).
  • Turnitin sopprime i punteggi tra l'1% e il 19% mostrandoli come asterischi, il che può amplificare l'apparente disaccordo con altri strumenti.
  • I documenti brevi producono previsioni "tutto o niente", che possono causare una divergenza drammatica tra i detector.
  • Il punteggio che conta è quello dello strumento che la tua istituzione usa effettivamente.

Se hai un report Turnitin che mostra quali passaggi sono stati segnalati, importa il report e lavora su quei passaggi specifici. I passaggi idonei possono essere rieseguiti senza costi aggiuntivi.

CONTINUA A LEGGERE