Turnitin rileva il copia-incolla?

La domanda confonde due report diversi. Separiamo cosa cerca davvero ciascuno, perché un testo umano copiato fa scattare la similarità ma non il flag IA, e cosa controllare se entrambi i punteggi ti preoccupano.

Team HumanPen

· 9 min di lettura

La risposta breve

Turnitin usa due sistemi indipendenti. Il Similarity Report rileva il copia-incolla. Confronta il testo che invii con un database di contenuti pubblicati, di elaborati di altri studenti e di fonti web, e segnala le stringhe corrispondenti. Se hai copiato da una fonte presente nel database, il Similarity Report lo mostrerà. L’AI Writing Report non rileva il copia-incolla. Analizza gli schemi di probabilità delle parole nella prosa per stimare se un testo è stato generato dall’IA. Un testo umano copiato da un libro o da un articolo non fa scattare il rilevatore IA, perché la scrittura umana ha schemi di probabilità diversi da quelli del testo generato dall’IA.

Questi due punteggi non si influenzano a vicenda. Vedremo come funziona ogni sistema e cosa significa se hai incollato del testo preso da qualche parte.

Come il Similarity Report individua il testo copiato e incollato

Il Similarity Report è quello che fa esattamente ciò che la maggior parte delle persone intende quando chiede se Turnitin rileva il copia-incolla. Prende il documento che invii e lo confronta con la raccolta di contenuti di Turnitin. Questa raccolta comprende opere pubblicate, pagine web e altri elaborati di studenti già inviati a Turnitin in passato, e con cosa viene confrontato il tuo manoscritto approfondisce la questione. Quando il sistema trova nel tuo documento una stringa di testo che corrisponde a una stringa nel database, evidenzia la corrispondenza e la fa rientrare nella percentuale di similarità.

Il meccanismo è la corrispondenza tra stringhe. Se hai incollato un paragrafo da un sito web, una frase da un libro digitalizzato e indicizzato, o una sezione dell’elaborato di un amico già inviato in precedenza, il Similarity Report troverà la corrispondenza se la fonte è nel database. Il report ti mostra esattamente quali stringhe hanno corrisposto e da quale fonte provengono.

Le FAQ sulle capacità di rilevamento della scrittura IA di Turnitin enunciano questa separazione direttamente:

«The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (Il punteggio di similarità e la percentuale di rilevamento della scrittura IA sono completamente indipendenti e non si influenzano a vicenda.)

La frase successiva su quella stessa pagina è:

«The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking.» (Il punteggio di similarità indica la percentuale di testo corrispondente trovato nel documento inviato quando viene confrontato con l’ampia raccolta di contenuti di Turnitin per il controllo di similarità.)

Questa seconda frase descrive esattamente ciò che fa il Similarity Report. Trova il testo corrispondente. Non valuta se quel testo è stato scritto da un essere umano o da un’IA. Non gli importa chi lo ha scritto. Gli importa se la stessa stringa esiste da qualche parte nel database. Questo è anche il motivo per cui il testo citato e tra virgolette continua a comparire nel Similarity Report anche quando hai fatto tutto correttamente.

Come funziona l’AI Writing Report e perché non individua il copia-incolla

L’AI Writing Report funziona secondo un principio completamente diverso. Non confronta il tuo testo con un database di stringhe. Fa passare il tuo testo attraverso un modello che assegna punteggi di probabilità a segmenti di prosa. Le FAQ descrivono il meccanismo così:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Quando un elaborato viene inviato a Turnitin, le frasi dell’invio vengono estratte e segmentate in sezioni sovrapposte per l’analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall’IA. Ogni frase idonea all’interno di queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi riuniti in un unico punteggio. Questi punteggi di frase vengono ulteriormente aggregati e usati per calcolare il punteggio complessivo di scrittura IA del documento.)

La frase chiave è «the probability of the text being likely human or AI-generated.» (la probabilità che il testo sia probabilmente umano o generato dall’IA). Il modello osserva come le parole vengono scelte e messe in sequenza. Il testo generato dall’IA tende a produrre parole altamente prevedibili dato il contesto precedente, perché i modelli linguistici scelgono i token successivi più probabili. La scrittura umana tende a essere meno prevedibile nelle sue scelte di parole. È questa differenza negli schemi di probabilità che il modello legge.

Ecco perché il testo umano copiato non fa scattare il rilevatore IA. Se incolli nel tuo elaborato un paragrafo da un libro pubblicato, quel paragrafo è stato scritto da un essere umano. I suoi schemi di probabilità delle parole assomigliano alla scrittura umana, non al testo generato dall’IA. Il modello lo classifica come umano. L’AI Writing Report non lo segnala.

Vale anche il contrario. Se generi un paragrafo con uno strumento di IA e lo incolli nel tuo elaborato, l’AI Writing Report può segnalarlo, perché gli schemi di probabilità in quel paragrafo assomigliano a un output dell’IA. Ma il Similarity Report non lo segnalerà, perché quella stringa esatta probabilmente non esiste nel database di contenuti pubblicati di Turnitin. L’IA ha generato testo nuovo. Non ha copiato da una fonte esistente.

Questa è la distinzione di fondo. Il Similarity Report individua il testo che esiste già altrove. L’AI Writing Report individua il testo che sembra scritto da una macchina. Il copia-incolla è un problema di similarità. La generazione con IA è un problema di probabilità. Cosa entri in questa probabilità è un’altra domanda, e se Turnitin usa perplessità e burstiness è la forma in cui la maggior parte delle persone la pone.

Cosa legge davvero il modello IA e cosa salta

C’è un secondo livello nel funzionamento dell’AI Writing Report, ed è importante negli scenari di copia-incolla. Il modello non analizza tutto ciò che c’è nel tuo documento. Le FAQ dicono:

«The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures).» (Il modello non rileva in modo affidabile il testo generato dall’IA sotto forma di testo non in prosa o di codice, e non rileva nemmeno la scrittura breve o non convenzionale come gli elenchi puntati, cioè brevi strutture che non sono frasi.)

La frase successiva è:

«This means that a document containing several different writing types would result in a disparity between the percentage and the highlights.» (Questo significa che un documento contenente diversi tipi di scrittura comporterebbe una discrepanza tra la percentuale e le evidenziazioni.)

Le FAQ specificano anche cosa viene analizzato:

«This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Questo testo idoneo include solo frasi in prosa, il che significa che analizziamo solo blocchi di testo scritti in frasi grammaticalmente standard e non includiamo altri tipi di scrittura come elenchi, punti elenco, cioè brevi strutture che non sono frasi, o altre strutture che non sono frasi.)

La frase successiva è:

«This percentage is not necessarily the percentage of the entire submission.» (Questa percentuale non è necessariamente la percentuale dell’intero invio.)

Il significato pratico è questo. Se hai copiato e incollato un elenco puntato, una tabella di dati o un blocco di codice, il modello IA potrebbe non leggerli affatto. Filtra i contenuti che non sono in prosa prima di eseguire la sua analisi. Il Similarity Report, al contrario, legge tutto. Individua un elenco incollato o un blocco di codice incollato con la stessa facilità di un paragrafo incollato, perché esegue la corrispondenza di stringhe su tutto il documento.

Quindi, quando incolli contenuti che non sono in prosa da una fonte, il risultato è asimmetrico. Il Similarity Report li individua. L’AI Writing Report no, perché non li vede mai.

Perché il testo umano copiato compare in un report e non nell’altro

Mettendo insieme i due meccanismi si spiega lo scenario su cui gli studenti chiedono più spesso. Hai trovato un paragrafo su un sito web o in un libro. Lo hai incollato nel tuo elaborato. Sei preoccupato sia per il punteggio di similarità sia per quello IA. Ecco cosa succede.

Il Similarity Report segnalerà il paragrafo incollato, a patto che la fonte sia nel database. La stringa corrisponde. La percentuale sale. La fonte viene identificata. Il report sta facendo il suo lavoro.

L’AI Writing Report non segnalerà il paragrafo incollato, a patto che il testo originale sia stato scritto da un essere umano. Il modello legge il paragrafo come prosa, assegna punteggi di probabilità ai suoi segmenti e rileva che le scelte di parole sembrano umane. Il paragrafo viene classificato come scritto da un essere umano. Nessun flag IA.

Questo vale anche se il testo incollato è lungo. Al modello IA non importa da dove proviene il testo. Gli importa come suona il testo. Un paragrafo copiato da un articolo di rivista degli anni 1990 ha gli schemi di probabilità delle parole della prosa accademica umana degli anni 1990. Non è così che appare il testo generato dall’IA.

Le FAQ rendono esplicita l’indipendenza. Turnitin dice: «The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (Il punteggio di similarità e la percentuale di rilevamento della scrittura IA sono completamente indipendenti e non si influenzano a vicenda.) Un punteggio di similarità alto dovuto a testo incollato non fa salire il punteggio IA. Un punteggio IA alto dovuto a testo generato non fa salire il punteggio di similarità. Sono calcolati da sistemi diversi che cercano cose diverse, ed è per questo che i due punteggi non dovrebbero essere letti come la stessa cosa.

Cosa significa se entrambi i punteggi ti preoccupano

Se hai incollato del testo da qualche parte e hai davanti entrambi i report, ecco come leggerli.

Se il testo incollato compare nel Similarity Report, è normale. Il sistema ha trovato la corrispondenza. Devi riformulare il testo con parole tue, metterlo tra virgolette con una citazione oppure rimuoverlo. Le virgolette con citazione sono l’unico caso in cui il testo incollato è legittimo. Turnitin mostrerà comunque la corrispondenza, ma il tuo docente potrà vedere che è attribuita correttamente.

Se il testo incollato è stato scritto da un essere umano e stai controllando l’AI Writing Report, non dovresti vedere alcun flag. Se lo vedi e il testo proviene davvero da una fonte umana, il flag è un falso positivo. Il modello IA è uno stimatore di probabilità, non una certezza. Può sbagliare a classificare. Ma la spiegazione più comune è che il testo incollato non sia ciò che è stato segnalato. Leggi il testo effettivamente evidenziato. Potrebbe essere la tua scrittura accanto alla sezione incollata, non la sezione incollata stessa.

Se hai generato del testo con uno strumento di IA e lo hai incollato, la situazione si inverte. Il Similarity Report probabilmente non lo segnalerà, perché la stringa è nuova. L’AI Writing Report può segnalarlo, perché gli schemi di probabilità sono quelli che il modello è addestrato a riconoscere.

Cosa fare

Il riassunto per chiunque si chieda se Turnitin rileva il copia-incolla:

  1. Il Similarity Report rileva il copia-incolla. Confronta le stringhe con un database. Se la fonte è nel database, il testo incollato comparirà come corrispondenza.
  2. L’AI Writing Report non rileva il copia-incolla. Analizza gli schemi di probabilità delle parole nella prosa. Il testo umano copiato si legge come umano e non viene segnalato.
  3. I due punteggi sono indipendenti. Un punteggio di similarità alto non provoca un punteggio IA alto, e viceversa.
  4. Se hai incollato contenuti che non sono in prosa, come elenchi, codice o tabelle, il Similarity Report può individuarli, ma il modello IA potrebbe non analizzarli affatto, perché legge solo frasi in prosa.
  5. Se hai incollato testo generato dall’IA, l’AI Writing Report può segnalarlo anche se il Similarity Report non lo fa, perché la stringa è nuova ma gli schemi di probabilità sono riconoscibili.

La distinzione non è più sottile una volta che sai cosa cerca ogni sistema. La similarità cerca stringhe già esistenti. Il rilevamento IA cerca schemi di probabilità nella prosa. Il copia-incolla è un problema di stringhe. La generazione con IA è un problema di modelli.

CONTINUA A LEGGERE