Il rilevatore di IA di Scribbr contro Turnitin: cosa dice davvero la documentazione

Scribbr mette a disposizione un rilevatore di IA gratuito che chiunque può usare. Il rilevamento della scrittura IA di Turnitin è disponibile solo per gli atenei che ne acquistano la licenza. I due strumenti usano modelli diversi e sullo stesso testo daranno punteggi diversi. Ecco cosa dice la documentazione di Turnitin sul proprio sistema e perché i punteggi non combaceranno.

Team HumanPen

· 5 min di lettura

Scribbr e Turnitin sono due sistemi separati

Il rilevatore di IA di Scribbr è uno strumento gratuito a disposizione di tutti. Il rilevamento della scrittura IA di Turnitin è riservato agli atenei, e se il tuo ateneo lo abbia attivato è tutt’altra questione, trattata in gli atenei usano i rilevatori di IA?. I due strumenti nascono da team diversi e da modelli diversi. Ognuno è stato addestrato su dati propri e classifica i testi con un metodo proprio. Quando due rilevatori usano modelli diversi, sullo stesso testo producono punteggi diversi. Un passaggio che Scribbr segnala come 65% IA può ricevere da Turnitin un punteggio del 30%, o viceversa. Nessuno dei due risultati è per forza sbagliato. Sono stime di probabilità di modelli diversi, addestrati su dataset diversi.

Non esiste un punteggio di rilevamento IA universale su cui tutti gli strumenti convergano, e le ragioni sono spiegate in perché lo stesso testo riceve punteggi diversi su ogni rilevatore. Ogni rilevatore produce la propria stima. Trattare i punteggi di strumenti diversi come se misurassero la stessa cosa nelle stesse unità genera soltanto confusione.

Non sosteniamo quale dei due strumenti sia più accurato. Descriviamo ciò che la documentazione di Turnitin dice del proprio sistema e perché quel sistema produce punteggi che non combaceranno con quelli di Scribbr.

Come nasce il punteggio di Turnitin

Turnitin documenta un processo preciso con cui arriva al proprio punteggio di scrittura IA:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Quando un elaborato viene inviato a Turnitin, le frasi della consegna vengono estratte e suddivise in sezioni sovrapposte per l’analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall’IA. Ogni frase idonea all’interno di queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi riuniti in uno solo. Questi punteggi di frase vengono ulteriormente aggregati e servono a calcolare il punteggio complessivo di scrittura IA del documento.)

Il processo consiste nell’estrarre le frasi, suddividerle in unità sovrapposte, valutare ogni unità, riunire i punteggi delle frasi e aggregarli in una percentuale a livello di documento. Altri rilevatori, Scribbr compreso, possono usare strategie di segmentazione diverse, unità di previsione diverse o metodi di aggregazione diversi. I due strumenti non arriveranno agli stessi numeri sullo stesso testo.

La documentazione di Turnitin chiarisce anche che la percentuale di rilevamento della scrittura IA e il punteggio di similarità sono due cose distinte. «The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (Il punteggio di similarità e la percentuale di rilevamento della scrittura IA sono del tutto indipendenti e non si influenzano a vicenda.) Un documento può avere una similarità alta e poca IA, o viceversa. I due numeri non si influenzano tra loro.

Il tasso di falsi positivi dichiarato da Turnitin

Turnitin pubblica un obiettivo preciso sui falsi positivi:

«We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing.» (Ci impegniamo a massimizzare l’efficacia del nostro rilevatore mantenendo il tasso di falsi positivi — cioè l’identificazione errata come generato dall’IA di un testo scritto interamente da una persona — sotto l’1% per i documenti con oltre il 20% di scrittura IA.)

La precisazione conta. L’obiettivo è indicato specificamente per i documenti con oltre il 20% di scrittura IA, una soglia che non significa quello che si crede, come spiega il 20% di IA è troppo?. Questo è ciò che Turnitin dice del proprio sistema. Scribbr può avere obiettivi di accuratezza diversi, processi di validazione diversi oppure non pubblicare dati confrontabili. Non possiamo fare un confronto diretto sull’accuratezza. Possiamo soltanto riportare ciò che afferma la documentazione di Turnitin.

Come si comporta con i documenti brevi

La lunghezza del documento incide sul modo in cui il rilevatore di Turnitin elabora il testo. Con i documenti brevi il meccanismo di punteggio funziona diversamente. La documentazione afferma:

«In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.» (Nei documenti più brevi, di poche centinaia di parole, la previsione sarà per lo più «tutto o niente», perché effettuiamo la previsione su un solo segmento, senza possibilità di sovrapposizione.)

«This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (Questo significa che alcuni testi che mescolano contenuti generati dall’IA e contenuti originali possono essere segnalati come interamente generati dall’IA.)

Il meccanismo di sovrapposizione che nei documenti lunghi fa media tra i punteggi non entra in gioco quando il testo è un unico segmento. Poche centinaia di parole con contenuto umano e IA mescolati possono restituire il 100%, una delle strade descritte in perché Turnitin dice che il tuo lavoro è 100% IA. È un comportamento strutturale sui testi brevi. Scribbr potrebbe elaborare i documenti brevi con un meccanismo diverso e arrivare a un risultato diverso sullo stesso testo.

Come vengono mostrati i punteggi bassi

Turnitin nasconde i punteggi numerici sotto il 20%. La documentazione afferma:

«To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed.» (Per evitare possibili casi di falsi positivi, non vengono attribuiti né punteggi né evidenziazioni per i valori di rilevamento IA compresi tra l’1% e il 19%. Quando nel report viene rilevata IA sotto la soglia del 20%, ora questo viene indicato con un asterisco (*%) e non viene attribuita alcuna percentuale.)

Un documento che il modello di Turnitin stima al 10% di IA mostrerà un asterisco nel report, non il numero 10%. Al testo non viene applicata alcuna evidenziazione. La motivazione è evitare di far emergere possibili falsi positivi in una fascia di bassa affidabilità, come spiega più nel dettaglio cosa significa l’asterisco (*%) in un punteggio IA di Turnitin.

Scribbr potrebbe mostrare i punteggi di questa fascia come percentuale piena. Altri strumenti possono evidenziare il testo a partire da qualsiasi valore diverso da zero. Turnitin, sotto il 20%, nasconde deliberatamente sia il numero sia le evidenziazioni. Questa convenzione fa sì che i due strumenti presentino risultati molto diversi per lo stesso documento con poca IA.

Cosa significa per te

Se stai confrontando i risultati di Scribbr e Turnitin sullo stesso documento, ecco il riassunto:

  • Modelli diversi, punteggi diversi. Scribbr e Turnitin usano modelli di rilevamento diversi. Non ci si aspetta che i punteggi combacino.
  • Turnitin valuta segmentando e aggregando. Le frasi vengono estratte, suddivise in unità sovrapposte, valutate, riunite e aggregate. Il punteggio IA e il punteggio di similarità sono del tutto indipendenti.
  • Turnitin punta a meno dell’1% di falsi positivi sui documenti con oltre il 20% di scrittura IA.
  • I documenti brevi ottengono punteggi tutto o niente. Poche centinaia di parole possono tornare come 0% o 100% anche con testo misto.
  • I punteggi sotto il 20% compaiono come asterisco. Nella fascia 1-19% non compaiono né percentuali numeriche né evidenziazioni.

I passaggi che soddisfano i requisiti possono essere rielaborati gratuitamente.

CONTINUA A LEGGERE