Sapling AI Detector e Turnitin a confronto: cosa dice davvero la documentazione

Se fai passare lo stesso testo nel rilevatore AI di Sapling e in Turnitin, i punteggi nella maggior parte dei casi non coincidono. È normale che sia così. I due strumenti usano modelli diversi, addestrati su dati diversi e con convenzioni di punteggio diverse. Ecco cosa dice la documentazione di Turnitin su come funziona il suo rilevatore e sul perché i punteggi non possono allinearsi.

Team HumanPen

· 5 min di lettura

Sapling e Turnitin sono due sistemi separati

Il rilevatore AI di Sapling e il rilevamento della scrittura AI di Turnitin sono costruiti da team diversi, partendo da modelli di base diversi. Ognuno è stato addestrato sui propri dati e classifica il testo secondo il proprio metodo. Quando due rilevatori usano modelli diversi, sullo stesso testo producono punteggi diversi. Un passaggio che Sapling segnala come 70% AI potrebbe ricevere da Turnitin un punteggio del 25%, oppure il contrario. Nessuno dei due risultati è per forza sbagliato: sono stime di probabilità calcolate da modelli diversi, addestrati su dataset diversi.

Non esiste un punteggio di rilevamento AI universale su cui tutti gli strumenti convergano, e perché lo stesso testo ottiene punteggi diversi su ogni rilevatore approfondisce da dove nasca questa divergenza. Ogni rilevatore produce la propria stima. Trattare i punteggi di strumenti diversi come se misurassero la stessa cosa, nelle stesse unità di misura, non fa altro che generare confusione.

Non stiamo dicendo quale dei due strumenti sia più accurato. Stiamo descrivendo cosa afferma la documentazione di Turnitin sul proprio sistema e perché quel sistema produce punteggi che non combaceranno con quelli di Sapling.

Come funziona il calcolo del punteggio di Turnitin

Turnitin documenta un processo ben preciso per arrivare al suo punteggio di scrittura AI:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un elaborato viene inviato a Turnitin, le frasi del testo vengono estratte e segmentate in sezioni sovrapposte per l'analisi predittiva. Ogni segmento viene classificato dal modello di rilevamento AI e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia con ogni probabilità umano oppure generato dall'AI. Ogni frase idonea all'interno di questi segmenti eredita il punteggio del segmento. Poiché i segmenti si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi riuniti in un punteggio unico. Questi punteggi delle frasi vengono ulteriormente aggregati e usati per calcolare il punteggio complessivo di scrittura AI del documento.)

Il processo prevede di estrarre le frasi, suddividerle in unità sovrapposte, attribuire un punteggio a ogni segmento, riunire i punteggi delle singole frasi e aggregarli in una percentuale a livello di documento. Altri rilevatori, Sapling incluso, possono adottare strategie di segmentazione diverse, unità di previsione diverse o metodi di aggregazione diversi. I due strumenti non produrranno numeri uguali sullo stesso testo.

La documentazione di Turnitin chiarisce inoltre che la percentuale di rilevamento della scrittura AI e il punteggio di Similarity sono due cose distinte. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Il punteggio di Similarity e la percentuale di rilevamento della scrittura AI sono completamente indipendenti e non si influenzano a vicenda.) Il punteggio di Similarity indica la percentuale di testo corrispondente trovata nel documento inviato, confrontandolo con l'ampia raccolta di contenuti che Turnitin usa per il controllo di similarità. Un documento può avere similarità alta e AI bassa, oppure il contrario. Il report di scrittura AI di Turnitin e il Similarity Report a confronto legge i due report l'uno alla luce dell'altro. I due numeri non si influenzano fra loro.

Il tasso di falsi positivi dichiarato da Turnitin

Turnitin pubblica un obiettivo preciso sui falsi positivi:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Ci impegniamo a massimizzare l'efficacia del nostro rilevatore mantenendo il nostro tasso di falsi positivi - cioè l'identificazione errata di testi interamente scritti da esseri umani come generati dall'AI - sotto l'1% per i documenti con oltre il 20% di scrittura AI.)

La documentazione lo riformula così: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (In altre parole, potremmo segnalare come scritto dall'AI un documento scritto da un essere umano, per uno ogni 100 documenti interamente scritti da esseri umani.) Questa riformulazione lascia cadere la condizione "oltre il 20% di scrittura AI". La versione con la soglia del 20% è quella più precisa.

Per convalidare questo obiettivo, Turnitin descrive il suo framework di test: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Per rafforzare il nostro framework di test e diagnosticare le tendenze statistiche dei falsi positivi, prima di ogni aggiornamento o rilascio di un nuovo modello eseguiamo test su oltre 700.000 ulteriori paper accademici, scritti prima del rilascio di ChatGPT, per convalidare ulteriormente il nostro tasso di falsi positivi inferiore all'1%.)

Questo è ciò che Turnitin dice del proprio sistema. Per capire cosa comporti un uno per cento quando un intero ateneo invia elaborati su larga scala, vedi cosa significa un tasso di falsi positivi dell'1%. Sapling può avere obiettivi di accuratezza diversi, processi di convalida diversi, oppure può non pubblicare dati confrontabili. Non possiamo fare un confronto diretto sull'accuratezza: possiamo soltanto riportare quello che afferma la documentazione di Turnitin.

Come si comporta con i documenti brevi

La lunghezza del documento incide sul modo in cui il rilevatore di Turnitin elabora il testo. Con i documenti brevi il meccanismo di punteggio funziona in modo diverso. La documentazione lo dice esplicitamente:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Nei documenti più brevi, dove ci sono soltanto poche centinaia di parole, la previsione sarà per lo più «tutto o niente», perché la previsione viene fatta su un singolo segmento, senza la possibilità di sovrapporre.)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Questo significa che alcuni testi, in cui si mescolano contenuti generati dall'AI e contenuti originali, potrebbero essere segnalati come interamente generati dall'AI.)

Il meccanismo di sovrapposizione che nei documenti più lunghi attenua le differenze fra i punteggi non entra in gioco quando il testo è un unico segmento. Poche centinaia di parole che mescolano contenuto umano e AI possono restituire un punteggio del 100%, ed è una delle strade che portano a perché Turnitin dice che il tuo elaborato è 100% AI. È un comportamento strutturale, tipico degli input brevi.

Se Sapling assegna allo stesso documento breve un punteggio diverso, è anche perché i due strumenti non elaborano gli input brevi nello stesso modo.

Come vengono mostrati i punteggi bassi

Sotto il 20%, Turnitin non mostra alcun punteggio numerico. La documentazione lo dice esplicitamente:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Per evitare possibili casi di falsi positivi, non viene attribuito alcun punteggio né alcuna evidenziazione per i punteggi di rilevamento AI compresi tra l'1% e il 19%. Quando nel report l'AI viene rilevata al di sotto della soglia del 20%, ora viene indicata con un asterisco (*%) e non viene attribuita alcuna percentuale.)

Un documento che il modello di Turnitin stima all'8% AI mostrerà nel report un asterisco, non il numero 8%. Nessuna evidenziazione viene applicata al testo. La ragione è evitare di far emergere possibili falsi positivi in una fascia di bassa confidenza: l'argomento è approfondito in cosa significa l'asterisco (*%) in un punteggio AI di Turnitin.

Sapling potrebbe mostrare i punteggi di questa fascia come una percentuale completa. Altri strumenti potrebbero evidenziare il testo a qualsiasi valore diverso da zero. Turnitin, sotto il 20%, sopprime deliberatamente sia il numero sia le evidenziazioni. Questa convenzione di punteggio fa sì che i due strumenti presentino output molto diversi per lo stesso documento con poca AI.

Cosa significa per te

Se stai confrontando i risultati di Sapling e di Turnitin sullo stesso documento, ecco il riassunto:

  • Modelli separati, punteggi separati. Sapling e Turnitin usano modelli di rilevamento diversi. Non c'è da aspettarsi che i loro punteggi combacino.
  • Turnitin calcola il punteggio segmentando e aggregando. Le frasi vengono estratte, suddivise in unità sovrapposte, valutate, riunite e aggregate. Il punteggio AI e il punteggio di Similarity sono del tutto indipendenti.
  • Turnitin punta a meno dell'1% di falsi positivi per i documenti con oltre il 20% di scrittura AI, convalidando il dato su oltre 700.000 paper accademici aggiuntivi scritti prima di ChatGPT.
  • I documenti brevi ottengono punteggi tutto o niente. Poche centinaia di parole possono tornare indietro come 0% o 100%, anche quando il testo è misto.
  • I punteggi sotto il 20% compaiono come asterisco. Nella fascia 1-19% non appare né una percentuale numerica né un'evidenziazione.

I passaggi idonei possono essere rielaborati gratuitamente.

CONTINUA A LEGGERE