Originality.ai contro Turnitin AI Detection: cosa dice la documentazione
Capita che gli studenti facciano passare il proprio elaborato su Originality.ai e ottengano un punteggio diverso rispetto a Turnitin. È normale. I rilevatori usano modelli differenti, addestrati su dataset diversi. La FAQ di Turnitin spiega il funzionamento, l'obiettivo sui falsi positivi e la convenzione dell'asterisco per i punteggi bassi. Ecco cosa riporta la documentazione.
Team HumanPen
· 4 min di lettura
La risposta breve
Originality.ai e Turnitin sono due rilevatori AI diversi, basati su modelli differenti con dati di addestramento e soglie di classificazione proprie. Il punteggio di uno non permette di prevedere quello dell'altro. La FAQ di Turnitin descrive il meccanismo: il testo viene suddiviso in segmenti sovrapposti, ciascuno classificato con un punteggio di probabilità tra 0 e 1. La stessa FAQ indica un obiettivo di falsi positivi inferiore all'1% per documenti con oltre il 20% di testo AI, e adotta la convenzione dell'asterisco per i punteggi nell'intervallo 1-19%. Originality.ai pubblica le proprie dichiarazioni di accuratezza, ma si tratta di dati forniti dal venditore e non verificabili indipendentemente rispetto alla documentazione di Turnitin. L'unico punteggio che conta è quello dello strumento usato dal tuo istituto. Se la tua università usa Turnitin, nessun punteggio di terze parti può dirti quale sarà il tuo risultato su Turnitin.
Come funziona il rilevatore di Turnitin
La FAQ descrive il processo di rilevamento:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando un elaborato viene inviato a Turnitin, le frasi del testo vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento AI e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia stato scritto da un umano o generato da AI.)
I segmenti si sovrappongono, quindi le stesse frasi possono ricevere più punteggi che vengono poi aggregati. Questa aggregazione smorza gli errori delle singole previsioni e contribuisce al punteggio complessivo del documento. Originality.ai usa un proprio approccio di classificazione, non documentato nei materiali di Turnitin. I due sistemi sono costruiti in modo diverso e valutano il testo in modo diverso.
L'obiettivo di falsi positivi di Turnitin
La FAQ indica un obiettivo preciso:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Ci impegniamo a massimizzare l'efficacia del nostro rilevatore mantenendo il nostro tasso di falsi positivi – identificare erroneamente un testo interamente scritto da umani come generato da AI – sotto l'1% per documenti con oltre il 20% di testo AI.)
La frase successiva: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (In altre parole, potremmo segnalare come scritto da AI un documento interamente umano in uno su cento.)
Questo obiettivo è specifico di Turnitin e si applica ai documenti con oltre il 20% di testo AI. Originality.ai potrebbe avere un tasso di falsi positivi diverso, ma confrontare i due numeri richiede di capire come ciascun venditore definisce e misura i falsi positivi. Non facciamo affermazioni sull'accuratezza dei rilevatori di terze parti. Ciò che la documentazione ci dice è che Turnitin ha dichiarato esplicitamente questo obiettivo per il proprio modello. Le implicazioni di questo obiettivo su larga scala sono sviluppate in cosa significa un tasso di falsi positivi dell'1% quando un'università riceve 75.000 elaborati.
La convenzione dell'asterisco
Turnitin ha una regola specifica per la visualizzazione dei punteggi bassi:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (Per evitare possibili falsi positivi, non viene attribuito alcun punteggio né evidenziazione per i punteggi di rilevamento AI nell'intervallo dall'1% al 19%. Quando nel report viene rilevata presenza di AI sotto la soglia del 20%, questa viene ora indicata con un asterisco (%) senza attribuire una percentuale.)
Questo significa che un punteggio Turnitin che mostra "%" indica che è stata rilevata presenza di AI sotto il 20%, ma la percentuale esatta non viene mostrata per evitare di sopravvalutare l'accuratezza in un intervallo soggetto a falsi positivi. Originality.ai non usa questa convenzione e mostrerà una percentuale specifica in questo intervallo. Un elaborato che su Turnitin mostra "%" potrebbe mostrare "15%" su Originality.ai. Non significa che uno strumento sia più accurato dell'altro. Significa che gestiscono in modo diverso l'intervallo a bassa affidabilità. Cosa significa l'asterisco (*%) nel punteggio AI di Turnitin spiega il lato Turnitin della questione.
Perché i punteggi divergono tra strumenti diversi
Rilevatori AI diversi producono punteggi diversi sullo stesso testo perché usano modelli differenti, dati di addestramento diversi e soglie differenti. La FAQ di Turnitin descrive come il proprio modello aggrega i punteggi dei segmenti sovrapposti in una percentuale a livello di documento. Un rilevatore diverso potrebbe usare una strategia di segmentazione differente, una scala di punteggio diversa o un metodo di aggregazione altro. La FAQ nota anche che i documenti brevi generano previsioni del tipo "tutto o niente": "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Nei documenti più brevi, con poche centinaia di parole, la previsione sarà per lo più "tutto o niente" perché si prevede su un singolo segmento senza possibilità di sovrapposizione.) Originality.ai potrebbe o meno avere lo stesso comportamento sui documenti brevi.
Il punteggio AI e il punteggio di similarità sono anche indipendenti su Turnitin: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Il Similarity score e la percentuale di rilevamento scrittura AI sono completamente indipendenti e non si influenzano a vicenda.) Un rilevatore che combina AI e similarità in un unico punteggio produrrà un numero non confrontabile con la percentuale AI separata di Turnitin. Perché lo stesso testo riceve punteggi diversi su ogni rilevatore raccoglie le ragioni.
Cosa significa per te
Per riassumere quanto visto:
- Originality.ai e Turnitin sono rilevatori diversi con modelli diversi. I punteggi non coincidono.
- Il rilevatore di Turnitin divide il testo in segmenti sovrapposti e assegna punteggi di probabilità tra 0 e 1.
- L'obiettivo di falsi positivi di Turnitin è inferiore all'1% per documenti con oltre il 20% di testo AI.
- Turnitin usa un asterisco per i punteggi nell'intervallo 1-19% per evitare di sopravvalutare l'accuratezza.
- I documenti brevi ricevono previsioni "tutto o niente" su Turnitin a causa della valutazione su singolo segmento.
- L'unico punteggio che conta è quello dello strumento usato dal tuo istituto.
Se ricevi un report AI da Turnitin e vuoi lavorare sui passaggi segnalati, importa il report e lavoraci sopra. I passaggi idonei possono essere elaborati di nuovo gratuitamente.
CONTINUA A LEGGERE