Perché Turnitin segnala il mio lavoro come 100% di IA?

Se Turnitin indica 100% di IA su qualcosa che hai scritto tu stesso, il punteggio è reale ma il verdetto non è quello che sembra. I documenti brevi, la struttura ripetitiva e la parafrasi senza idee nuove spingono il testo umano verso il 100%. La documentazione stessa di Turnitin dice che i punteggi non dovrebbero essere usati come unica base per azioni sfavorevoli.

Team HumanPen

· 9 min di lettura

La risposta breve

Un punteggio del 100% non significa che Turnitin è certo che il tuo testo sia generato dall'IA. Per i documenti più brevi, poche centinaia di parole, la previsione è per lo più «tutto o nulla» perché il sistema valuta un singolo segmento senza sovrapposizione su cui mediare. Il testo con poca variazione strutturale, ripetizione letterale o parafrasi senza idee nuove è più soggetto a falsi positivi. E Turnitin stesso dice, in tre documenti di aiuto distinti, che il punteggio non dovrebbe essere usato come unica base per azioni sfavorevoli nei confronti di uno studente.

Abbiamo spiegato come funziona il rilevamento dell'IA di Turnitin in termini di classificatore e dei suoi segmenti. Questo articolo tratta cosa succede quando quel sistema restituisce 100% su un testo che sai di aver scritto tu stesso. Le cause sono meccaniche, non arbitrarie, e sono documentate nelle pagine stesse di Turnitin.

Il problema dei documenti brevi

Questo è il motivo più comune per cui un genuino testo umano ottiene un punteggio del 100%. Le FAQ sulle capacità di rilevamento della scrittura con IA di Turnitin descrivono cosa succede con le consegne brevi:

«In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.» (Nei documenti più brevi in cui ci sono solo poche centinaia di parole, la previsione sarà per lo più «tutto o nulla» perché si prevede su un singolo segmento senza la possibilità di sovrapposizione.)

La frase successiva è quella che completa il quadro:

«This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (Ciò significa che un testo che è un mix di contenuto generato dall'IA e contenuto originale potrebbe essere segnalato come interamente generato dall'IA.)

Leggi queste due frasi insieme e il punteggio del 100% su un breve documento smette di sembrare un verdetto. Sembra un limite sulla risoluzione dello strumento. Quando c'è un solo segmento, non c'è nulla su cui mediare. Un segmento ad alta probabilità diventa il punteggio dell'intero documento. Se il tuo saggio ha 300 o 500 parole, questa è la prima possibilità da verificare.

Turnitin ha anche segnalato in una versione di dicembre 2023 che «submissions that contain less than 300 words may result in an AI writing score that is likely less accurate.» (Le consegne che contengono meno di 300 parole possono dare come risultato un punteggio di scrittura dell'IA probabilmente meno preciso.) I documenti brevi sono più difficili da valutare, e il sistema lo sa.

Che tipo di testo riceve segnalazioni di falso positivo

La stessa pagina delle FAQ elenca i tipi di testo in cui i falsi positivi sono più probabili:

«Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.» (A volte i falsi positivi (segnalare erroneamente testo scritto da un umano come generato dall'IA) possono includere contenuto senza molta variazione strutturale, testo che si ripete letteralmente o testo che è stato parafrasato senza sviluppare nuove idee.)

La frase successiva conta tanto quanto la lista stessa:

«If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.» (Se il nostro indicatore mostra una quantità maggiore di scrittura dell'IA in tale testo, vi consigliamo di tenerne conto quando guardate la percentuale indicata.)

Questo è Turnitin che dice agli istruttori di scontare la percentuale quando appare su questo tipo di testo. Se la tua scrittura è strutturalmente uniforme (paragrafi di lunghezza simile, forme di frase simili, vocabolario ricorrente), o se hai parafrasato materiale da vicino senza aggiungere la tua analisi, il punteggio può salire anche se ogni parola è tua.

Questo non è un bug. È il classificatore che legge l'uniformità come un segnale. I modelli statistici che sembrano regolari possono corrispondere a ciò che il modello ha imparato dal testo dell'IA, anche quando il testo è stato prodotto da un umano che scriveva in un registro coerente. A scala istituzionale si accumula, che è l'aritmetica di cosa significa un tasso di falsi positivi dell'1% quando un'università presenta 75.000 lavori.

Il punteggio del 100% è un aggregato, non un verdetto

Per capire perché un singolo segmento può produrre 100%, aiuta vedere come funziona la valutazione dall'inizio alla fine. Le FAQ di Turnitin descrivono il processo:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Quando un elaborato viene inviato a Turnitin, le frasi della consegna vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Il modello di rilevamento IA classifica ogni segmento e gli assegna un valore compreso tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall'IA. Ogni frase qualificata all'interno di questi segmenti eredita il punteggio del segmento. Poiché i segmenti si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi raggruppati in un unico punteggio. Questi punteggi delle frasi vengono ulteriormente aggregati e utilizzati per calcolare il punteggio complessivo di scrittura dell'IA del documento.)

In un documento più lungo, ci sono molti segmenti sovrapposti. Una frase vicino al limite di un segmento appare anche in quello successivo. I punteggi di entrambi i segmenti vengono raggruppati. Un segmento che si legge come simile all'IA non domina, perché i segmenti vicini tirano il punteggio raggruppato in altre direzioni.

In un documento breve, c'è un solo segmento. Nessuna sovrapposizione. Nessun raggruppamento tra finestre. La classificazione del segmento unico diventa il punteggio del documento. Se quel segmento è classificato con una probabilità di IA di 0,95, il punteggio del documento è 100% (o a ciò che l'aggregazione lo mappa). Il sistema non ha un secondo parere da consultare.

Questo è il motivo meccanico per cui i punteggi del 100% si concentrano sui lavori brevi. Non è che i lavori brevi sono più probabili di essere generati dall'IA. È che lo strumento ha meno occasioni di correggersi.

Cosa dice Turnitin stesso sull'uso dei punteggi

La documentazione stessa di Turnitin è più cauta sui suoi punteggi di quanto tendano a esserlo le istituzioni che li utilizzano. La guida del AI Writing Report stabilisce:

«Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student.» (Il nostro modello di rilevamento della scrittura dell'IA potrebbe non essere sempre accurato (potrebbe identificare erroneamente testo scritto da umani, generato dall'IA e parafrasato dall'IA), quindi non dovrebbe essere utilizzato come unica base per azioni sfavorevoli nei confronti di uno studente.)

La frase successiva in quella stessa guida:

«It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred.» (Serve un ulteriore scrutinio e un giudizio umano insieme all'applicazione da parte di un'organizzazione delle sue specifiche politiche accademiche per determinare se si è verificata una violazione dell'integrità accademica.)

Una guida di revisione separata formula lo stesso punto in modo diverso:

«It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy.» (Non è destinato a fornire risposte definitive in isolamento. Più importante di qualsiasi strumento è l'educatore che vede il punteggio e prende decisioni bilanciando questa informazione con la propria conoscenza personale degli studenti, del loro lavoro e della politica istituzionale.)

E la frase dopo quella:

«When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended.» (Quando gli educatori guardano il punteggio di scrittura dell'IA e lo utilizzano come un singolo punto dati anziché come una risposta definitiva, allora viene utilizzato come previsto.)

Queste sono le parole di Turnitin, non le nostre. L'azienda che ha costruito il rilevatore sta dicendo alle persone che lo usano che un punteggio è un punto dati, non una conclusione. Se la tua istituzione tratta il 100% come prova definitiva, l'istituzione sta usando lo strumento in un modo che Turnitin dice di non usare.

Passi pratici se hai ottenuto 100% sulla tua scrittura

Controlla la lunghezza del documento. Se la consegna era di poche centinaia di parole, il comportamento di «tutto o nulla» descritto in F9 è la spiegazione più probabile. Il punteggio riflette i limiti della previsione su un singolo segmento, non una determinazione sul tuo processo di scrittura.

Controlla se il tuo testo corrisponde al profilo di falso positivo. Scarsa variazione strutturale, ripetizione letterale e parafrasi senza idee nuove sono le tre caratteristiche che Turnitin stesso nomina. Se il tuo testo ne ha una, il consiglio ufficiale è di tenerne conto nella lettura della percentuale. È una citazione che puoi portare in una riunione.

Chiedi quando è stato generato il rapporto. A maggio 2023, Turnitin ha modificato la sua logica di rilevamento per ridurre i falsi positivi nella prima e nell'ultima frase dei documenti, che producevano tassi di falsi positivi più alti. La correzione è documentata nelle note di versione. Se il rapporto è antecedente a quella correzione, può riflettere un problema da allora risolto. I rapporti generati prima di luglio 2024 possono anche mostrare punteggi numerici nel range da 1 a 19 che i rapporti attuali mostrano come asterisco. Il punto è: i rapporti vecchi si comportano diversamente da quelli nuovi, e la data conta.

Porta prove del tuo processo di scrittura. Cronologia delle versioni, file di bozza con timestamp, cronologia del browser che mostri attività di ricerca. Questi non sono argomenti sul punteggio. Sono l'«further scrutiny and human judgment» (un ulteriore scrutinio e il giudizio umano) che Turnitin dice deve accompagnare il punteggio.

Cita le parole stessa di Turnitin. L'affermazione che il punteggio «should not be used as the sole basis for adverse actions against a student» (non dovrebbe essere usato come unica base per azioni sfavorevoli nei confronti di uno studente) appare in tre documenti distinti di Turnitin. L'affermazione che il punteggio è «a single data point rather than a definitive response» (un singolo punto dati anziché una risposta definitiva) è come Turnitin dice che lo strumento dovrebbe essere usato. Queste non sono opinioni. Sono le istruzioni di funzionamento dichiarate dal produttore. Se stai preparando cosa dire, segnalato, ma scritto da te tratta della preparazione di quella risposta.

Cosa ne ricaviamo

Lo strumento HumanPen è uno strumento di riscrittura di documenti. La decisione di progettazione rilevante qui è che riscriviamo a livello di passaggio, non a livello di punteggio. Non cerchiamo di muovere un numero che non possiamo vedere. Prendiamo i passaggi che l'AI Writing Report ha segnalato, cambiamo il linguaggio effettivo di quei passaggi e lasciamo il resto del documento intatto. La fatturazione conta solo le parole riscritte, e se un nuovo rapporto sul testo riscritto torna ancora al 20% o sopra, la riesecuzione dei passaggi ancora segnalati è gratuita.

Non ti diremo cosa dirà il tuo prossimo rapporto. Non facciamo previsioni sui punteggi di rilevamento. Quello che facciamo è più limitato: riscriviamo il linguaggio specifico nei passaggi specifici che il rapporto ha identificato e preserviamo la struttura, le citazioni e la formattazione attorno ad essi.

Domande frequenti

Turnitin può sbagliarsi sul 100% di IA? Sì. Le FAQ stesse di Turnitin dicono che i documenti brevi ottengono previsioni di «tutto o nulla» su un singolo segmento, e che il testo senza variazione strutturale o con parafrasi stretta è più soggetto a falsi positivi. Il punteggio del 100% è un aggregato di classificazioni a livello di segmento, e in un documento breve può esserci un solo segmento.

100% di IA significa che Turnitin è sicuro? No. La percentuale è l'output di un classificatore applicato a segmenti sovrapposti, raggruppati e aggregati. In un documento a segmento unico, un segmento ad alta probabilità diventa tutto il punteggio. Turnitin dice che il punteggio «should not be used as the sole basis for adverse actions against a student» (non dovrebbe essere usato come unica base per azioni sfavorevoli nei confronti di uno studente) ed è «a single data point rather than a definitive response.» (un singolo punto dati anziché una risposta definitiva).

Perché il mio saggio breve ha avuto 100% ma il mio lavoro lungo no? I documenti più lunghi hanno più segmenti sovrapposti, quindi i punteggi vengono raggruppati tra finestre e un singolo segmento simile all'IA viene diluito. I documenti brevi hanno un segmento, nessuna sovrapposizione, nessuna diluizione. Questa è una proprietà meccanica del processo di valutazione, non un giudizio sulla tua scrittura.

E se ho usato Grammarly? Le FAQ di Turnitin dicono che le modifiche di ortografia, grammatica e punteggiatura di Grammarly «in most cases» (nella maggior parte dei casi) non vengono segnalate come IA. Ma le funzioni generative di Grammarly (generazione di bozze, parafrasi, riassunto) sono una categoria diversa, e il contenuto prodotto da quelle funzioni «will likely be flagged as AI-generated.» (verrà probabilmente segnalato come generato dall'IA).

Posso usare le parole stessa di Turnitin nella mia difesa? Sì. L'affermazione che il punteggio non dovrebbe essere l'unica base per l'azione appare in tre documenti di Turnitin. L'affermazione che il punteggio è un singolo punto dati appare nella loro guida di revisione. Queste sono le istruzioni di funzionamento del produttore, e sono rilevanti per qualsiasi conversazione su cosa significa un punteggio.

CONTINUA A LEGGERE