Humbot vs Turnitin: cosa dice davvero la documentazione
Se fai analizzare lo stesso testo dal rilevatore IA di Humbot e da Turnitin, i punteggi quasi sempre non coincidono. È normale che sia così. I due strumenti usano modelli diversi, addestrati su dati diversi e con convenzioni di punteggio diverse. Ecco che cosa dice la documentazione di Turnitin su come funziona il suo rilevatore e sul perché i punteggi non possano combaciare.
Team HumanPen
· 5 min di lettura
Humbot e Turnitin sono due sistemi distinti
Il rilevatore IA di Humbot e il rilevamento della scrittura IA di Turnitin sono costruiti da team diversi e si basano su modelli differenti. Ciascuno è stato addestrato sui propri dati e classifica il testo secondo il proprio metodo. Quando due rilevatori usano modelli diversi, sullo stesso testo producono punteggi diversi. Un passaggio che Humbot segnala come 70% IA potrebbe ricevere da Turnitin un punteggio del 25%, oppure il contrario. Nessuno dei due risultati è per forza sbagliato: sono stime probabilistiche, calcolate da modelli diversi su dataset diversi.
Non esiste un punteggio di rilevamento IA universale su cui tutti gli strumenti convergano: perché lo stesso testo ottenga punteggi diversi su ogni rilevatore lo spiega per filo e per segno. Ogni rilevatore produce la propria stima. Trattare i punteggi di strumenti diversi come se misurassero la stessa cosa, nelle stesse unità, serve solo a confondersi.
Non stiamo dicendo quale dei due strumenti sia più accurato. Stiamo descrivendo quello che la documentazione di Turnitin dice del proprio sistema e del perché quel sistema produca punteggi che non combaceranno con quelli di Humbot.
Come funziona il calcolo del punteggio di Turnitin
Turnitin descrive un procedimento preciso per arrivare al suo punteggio di scrittura IA:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (in italiano: «Quando un elaborato viene inviato a Turnitin, le frasi del testo vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall'IA. Ogni frase idonea contenuta in queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono ricevere più punteggi, che vengono poi riuniti in un punteggio unico. I punteggi così ottenuti sulle frasi vengono ulteriormente aggregati e servono a calcolare il punteggio complessivo di scrittura IA del documento.»).
Il procedimento consiste nell'estrarre le frasi, suddividerle in unità sovrapposte, attribuire un punteggio a ogni sezione, riunire i punteggi delle singole frasi e aggregarli in una percentuale valida per l'intero documento. Altri rilevatori, Humbot compreso, possono adottare strategie di segmentazione diverse, unità di previsione diverse o metodi di aggregazione diversi. I due strumenti, sullo stesso testo, non produrranno mai cifre identiche.
La documentazione di Turnitin chiarisce anche che la percentuale di rilevamento della scrittura IA e il punteggio di Similarity sono due grandezze separate. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (in italiano: «Il punteggio di Similarity e la percentuale di rilevamento della scrittura IA sono completamente indipendenti e non si influenzano a vicenda.»). Il punteggio di Similarity indica la percentuale di testo corrispondente rilevata nel documento inviato, confrontandolo con l'ampia raccolta di contenuti che Turnitin usa per il controllo della similarità. Un documento può avere similarità alta e IA bassa, oppure il contrario. I due numeri non si influenzano tra loro.
Il tasso di falsi positivi dichiarato da Turnitin
Turnitin rende pubblico un obiettivo preciso sui falsi positivi:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (in italiano: «Ci impegniamo a massimizzare l'efficacia del nostro rilevatore mantenendo il tasso di falsi positivi, cioè il caso in cui un testo scritto interamente da un essere umano viene erroneamente identificato come generato dall'IA, sotto l'1% per i documenti con oltre il 20% di scrittura IA.»).
La documentazione lo riformula così: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (in italiano: «In altre parole, potremmo segnalare come scritto dall'IA un documento scritto da un essere umano, una volta ogni 100 documenti interamente scritti da esseri umani.»). Questa riformulazione lascia cadere la condizione «in italiano: «oltre il 20% di scrittura IA»». La versione con la soglia del 20% è più precisa, e il 20% di IA è troppo alto spiega perché quella cifra sia un obiettivo tecnico fissato dal fornitore, non una soglia per essere promossi.
Per verificare questo obiettivo, Turnitin descrive il proprio quadro di test: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (in italiano: «Per rafforzare il nostro quadro di test e diagnosticare le tendenze statistiche dei falsi positivi, prima di ogni aggiornamento o rilascio di un nuovo modello eseguiamo test su oltre 700.000 ulteriori elaborati accademici, scritti prima del rilascio di ChatGPT, per continuare a verificare il nostro tasso di falsi positivi inferiore all'1%.»).
Questo è ciò che Turnitin dice del proprio sistema. Che cosa significa un tasso di falsi positivi dell'1% mette quella cifra a confronto con il volume di elaborati che un ateneo invia davvero. Humbot può avere obiettivi di accuratezza diversi, procedure di validazione diverse, oppure può non pubblicare dati confrontabili. Non possiamo fare un confronto diretto sull'accuratezza. Possiamo soltanto riferire ciò che afferma la documentazione di Turnitin.
Come si comporta con i documenti brevi
La lunghezza del documento incide su come il rilevatore di Turnitin elabora il testo. Con i documenti brevi il meccanismo di punteggio funziona in modo diverso. La documentazione afferma:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (in italiano: «Nei documenti più brevi, di poche centinaia di parole, la previsione sarà in gran parte “tutto o niente”, perché viene fatta su un'unica sezione, senza la possibilità di sovrapporre.»).
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (in italiano: «Questo significa che un testo in cui si mescolano contenuti generati dall'IA e contenuti originali potrebbe essere segnalato come interamente generato dall'IA.»).
Il meccanismo di sovrapposizione che smussa i punteggi nei documenti più lunghi non entra in gioco quando il testo è un'unica sezione. Poche centinaia di parole in cui si mescolano contenuto umano e IA possono restituire un punteggio del 100%: è una delle cause elencate in perché Turnitin dice che il tuo elaborato è 100% IA. È un comportamento strutturale sui testi brevi.
Se Humbot valuta lo stesso documento breve in modo diverso, è anche perché i due strumenti non elaborano i testi brevi allo stesso modo.
Come vengono mostrati i punteggi bassi
Turnitin non mostra i punteggi numerici inferiori al 20%. La documentazione afferma:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (in italiano: «Per evitare possibili casi di falsi positivi, non vengono attribuiti punteggi né evidenziazioni per i punteggi di rilevamento IA compresi tra l'1% e il 19%. Quando nel report viene rilevata IA al di sotto della soglia del 20%, il caso è ora indicato con un asterisco (*%) e non viene attribuita alcuna percentuale.»).
Un documento che il modello di Turnitin stima all'8% di IA mostrerà un asterisco nel report, non il numero 8%. Al testo non viene applicata alcuna evidenziazione. La ratio è evitare di far emergere possibili falsi positivi in una fascia di scarsa confidenza: se ne parla più a fondo in che cosa significa l'asterisco (*%) in un punteggio IA di Turnitin.
Humbot può mostrare i punteggi di questa fascia come percentuale per intero. Altri strumenti possono evidenziare il testo a qualsiasi livello diverso da zero. Turnitin, sotto il 20%, sopprime deliberatamente sia il numero sia le evidenziazioni. Questa convenzione di punteggio fa sì che i due strumenti, davanti allo stesso documento con poca IA, presentino risultati molto diversi.
Che cosa significa per te
Se stai confrontando i risultati di Humbot e Turnitin sullo stesso documento, ecco il riassunto:
- Modelli separati, punteggi separati. Humbot e Turnitin usano modelli di rilevamento diversi. I loro punteggi non devono per forza coincidere.
- Turnitin calcola il punteggio segmentando e aggregando. Le frasi vengono estratte, suddivise in unità sovrapposte, valutate, riunite e aggregate. Il punteggio IA e il punteggio di Similarity sono del tutto indipendenti.
- Turnitin punta a meno dell'1% di falsi positivi sui documenti con oltre il 20% di scrittura IA, un obiettivo verificato su oltre 700.000 ulteriori elaborati accademici scritti prima di ChatGPT.
- I documenti brevi ottengono punteggi tutto o niente. Poche centinaia di parole possono tornare indietro come 0% o 100%, anche quando il testo è misto.
- I punteggi inferiori al 20% compaiono come asterisco. Nella fascia 1-19% non appare né una percentuale numerica né alcuna evidenziazione.
I passaggi idonei possono essere rielaborati gratuitamente.
CONTINUA A LEGGERE