Perché le proposte di ricerca vengono contrassegnate come IA da Turnitin

Le proposte di ricerca sono documenti brevi e strutturati, ricchi di linguaggio metodologico e riassunti parafrasati della letteratura. Queste caratteristiche coincidono con quanto la stessa documentazione di Turnitin descrive come terreno fertile per falsi positivi. Ecco come funziona il meccanismo di rilevamento sulle proposte, a cosa hanno finora posto rimedio i miglioramenti e perché un singolo punteggio IA non dovrebbe mai essere l'unico criterio di giudizio.

Team HumanPen

· 5 min di lettura

La risposta breve

Le proposte di ricerca attingono a un repertorio ristretto di strutture convenzionali. Le sezioni di metodologia descrivono procedure standard, e Turnitin ha contrassegnato l'intera sezione di metodologia spiega che aspetto ha la situazione quando succede. Le review della letteratura sintetizzano lavori precedenti in forma parafrasata. Questi schemi sono comuni e corrispondono a ciò che la documentazione Turnitin identifica come territorio da falso positivo. Le proposte brevi, con poche centinaia di parole, affrontano un rischio aggiuntivo: il rilevatore le tratta come "tutto o niente", perché non c'è abbastanza testo per la sovrapposizione dei segmenti. Il risultato è che proposte autenticamente scritte da esseri umani possono restituire punteggi IA alti senza alcun coinvolgimento dell'IA.

Cosa dice Turnitin sui falsi positivi

La FAQ descrive qualità specifiche del testo che possono innescare falsi positivi:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A volte i falsi positivi, ovvero la segnalazione errata di testo scritto da umani come generato da IA, possono includere contenuti con scarsa variazione strutturale, testo che si ripete letteralmente o testo parafrasato senza sviluppare nuove idee.)

Questa descrizione corrisponde da vicino alle proposte di ricerca. Una sezione di metodologia che descrive il campionamento mirato e le interviste semi-strutturate usa un linguaggio che compare in migliaia di proposte. Le review della letteratura condensano studi complessi in frasi riassuntive, il che è parafrasi per natura, e la parafrasi tende a spingere il numero nella direzione sbagliata, come spiega perché la parafrasi fa salire il punteggio AI di Turnitin. Nessuna delle due attività sviluppa nuove idee in quel momento. La frase successiva della FAQ è importante:

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se il nostro indicatore mostra una quantità maggiore di scrittura IA in tale testo, vi consigliamo di tenerne conto quando esaminate la percentuale indicata.)

Questo è un riconoscimento esplicito: la percentuale da sola non basta per documenti con queste caratteristiche. Dobbiamo trattare un punteggio alto su una proposta come un segnale da investigare, non come un verdetto definitivo.

Come funziona il meccanismo di rilevamento

Per capire perché le proposte sono vulnerabili, dobbiamo guardare come Turnitin processa una sottomissione:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score." (Quando un documento viene sottomesso a Turnitin, le frasi dalla sottomissione vengono estratte e segmentate in sezioni sovrapposte per l'analisi di predizione. Ogni segmento è classificato dal modello di rilevamento IA e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato da IA. Ogni frase qualificante all'interno di questi segmenti eredita il punteggio del segmento.)

La frase chiave è "qualifying sentence". La FAQ chiarisce cosa conta come testo qualificante:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Questo testo qualificante include solo frasi in prosa, il che significa che analizziamo solo blocchi di testo scritti in frasi grammaticali standard e non includiamo altri tipi di scrittura come elenchi, punti elenco (strutture brevi non frase) o altre strutture non frase.)

Per le proposte, questo significa che i paragrafi di metodologia, la prosa delle review della letteratura e il testo di giustificazione narrativa sono tutti analizzati. Le domande di ricerca formattate come punti elenco o le tabelle temporali con voci brevi non lo sono. La disparità tra ciò che viene valutato e ciò che appare sulla pagina può creare confusione quando vedi solo la percentuale.

Documenti brevi e il problema del tutto-o-niente

Molte proposte di ricerca sono brevi. Una proposta di tesi può andare da 1.500 a 3.000 parole. Una sezione narrativa di domanda di sovvenzione può essere ancora più corta. La FAQ affronta questo direttamente:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Nei documenti più brevi con solo poche centinaia di parole, la predizione sarà per lo più "tutto o niente" perché stiamo prevedendo su un singolo segmento senza l'opportunità di sovrapposizione.)

La frase successiva chiarisce la conseguenza:

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Questo significa che alcuni testi che sono un misto di contenuti generati da IA e originali potrebbero essere contrassegnati come interamente generati da IA.)

Anche le proposte sopra le poche centinaia di parole possono essere influenzate se la prosa qualificante è concentrata in pochi paragrafi densi. Meno segmenti significano meno mediazione, e un singolo segmento con punteggio alto può far salire la percentuale complessiva in modo significativo.

Cosa ha migliorato Turnitin nel 2023

Turnitin ha apportato modifiche per ridurre certi falsi positivi. Una nota di rilascio del maggio 2023 descrive una correzione:

"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (Dal lancio, abbiamo osservato una maggiore incidenza di rilevamento di falsi positivi nelle prime o ultime frasi di un documento. Spesso queste frasi consistono in contenuti di introduzione o conclusione scritti in modo generico. Di conseguenza, abbiamo modificato la nostra logica di rilevamento per aiutare a ridurre questi falsi positivi.)

Questo miglioramento è rilevante per le proposte perché le loro introduzioni spesso seguono uno schema formulare: enunciare il problema, descrivere il gap, presentare la domanda di ricerca. La stessa nota di rilascio menziona un altro affinamento:

"We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (Abbiamo anche lavorato per rendere più precisa la nostra rilevazione dei confini dei segmenti, il che potrebbe portare in alcuni rari casi a un cambiamento dei confini rispetto a una versione precedente.)

Questi erano miglioramenti del 2023, non difetti attuali. Se avessi confrontato il punteggio di una proposta prima e dopo quell'aggiornamento, potresti aver visto una riduzione. I modelli strutturali sottostanti che abbiamo descritto prima esistono ancora nella scrittura delle proposte oggi.

Un singolo punteggio non basta

La FAQ è esplicita sulle limitazioni del punteggio di scrittura IA:

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Il nostro modello di rilevamento della scrittura IA potrebbe non essere sempre accurato (potrebbe identificare erroneamente testo scritto da umani, generato da IA e parafrasato da IA), quindi non dovrebbe essere usato come unica base per azioni avverse contro uno studente.)

La frase successiva rinforza questo concetto:

"It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Ci vuole ulteriore scrutinio e giudizio umano in congiunzione con l'applicazione da parte di un'organizzazione delle sue specifiche politiche accademiche per determinare se si è verificata cattiva condotta accademica.)

Una fonte separata di Turnitin inquadra il punteggio come un pezzo di informazione tra molti:

"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy." (Non è inteso fornire risposte definitive in isolamento. Più importante di qualsiasi strumento è l'educatore che vede il punteggio e prende decisioni bilanciando questa informazione con la sua conoscenza personale dei suoi studenti, del loro lavoro e della politica istituzionale.)

La frase successiva completa il pensiero:

"When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended." (Quando gli educatori guardano al punteggio di scrittura IA e lo utilizzano come un singolo punto dati piuttosto che come una risposta definitiva, allora è usato come previsto.)

Per le proposte di ricerca, questo significa che un'alta percentuale IA dovrebbe spingere una conversazione, non una conclusione. Cosa viene detto al tuo istruttore di fare quando la tua percentuale IA è alta è la guida del fornitore che quella conversazione dovrebbe seguire.

Cosa significa questo per te

Se la tua proposta di ricerca ha ricevuto un punteggio IA alto da Turnitin, ecco cosa tenere a mente:

  • Le proposte usano un linguaggio convenzionale, parafrasato e strutturalmente uniforme che la FAQ identifica come territorio da falso positivo.
  • Le proposte brevi con prosa limitata possono produrre predizioni "tutto o niente" perché ci sono troppi pochi segmenti per la sovrapposizione.
  • La percentuale riflette solo la prosa qualificante, non l'intero documento.
  • Turnitin ha migliorato la gestione delle frasi iniziali e finali nel 2023, ma la vulnerabilità di base del linguaggio delle proposte rimane.
  • Il punteggio IA dovrebbe servire come un singolo punto dati, non come unica base per il giudizio.

Se vuoi affrontare i passaggi contrassegnati, importa il tuo rapporto Turnitin e lavoraci su. I passaggi eleggibili possono essere rieseguiti senza costi.

CONTINUA A LEGGERE