Revisioni sistematiche e rilevamento AI: perché la metodologia viene segnalata

Le revisioni sistematiche seguono modelli metodologici rigidi. La sezione di metodologia ripete gli stessi verbi e le stesse strutture frasali da uno studio all'altro, e questo coincide con i pattern di falsi positivi descritti da Turnitin. Il rilevatore non misura burstiness o perplexity. È un classificatore di probabilità lessicale. Ecco cosa dice la documentazione su come viene calcolato il punteggio e su come interpretarlo.

Team HumanPen

· 6 min di lettura

Perché la sezione di metodologia coincide con i pattern di falsi positivi

Una revisione sistematica richiede una sezione di metodologia standardizzata. Descrivi i database consultati, le stringhe di ricerca, i criteri di inclusione ed esclusione e il processo di screening. Il linguaggio è necessariamente ripetitivo perché la checklist PRISMA impone elementi di rendicontazione specifici. La documentazione di Turnitin descrive i tipi di testo che producono falsi positivi:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." ("A volte i falsi positivi, ovvero segnalazioni errate di testo scritto da umani come generato dall'AI, possono riguardare contenuti con scarsa variazione strutturale, testo che si ripete letteralmente o testo parafrasato senza sviluppare nuove idee.")

La frase successiva: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." ("Se il nostro indicatore mostra una quantità maggiore di scrittura AI in questo tipo di testo, consigliamo di tenerne conto quando si esamina la percentuale indicata.")

Una sezione di metodologia soddisfa tutti e tre i criteri, ecco perché "la mia intera sezione di metodologia è stata segnalata da Turnitin" è un reclamo così comune. La variazione strutturale è bassa perché ogni revisione sistematica descrive gli stessi passaggi. Le formule si ripetono ("abbiamo cercato", "abbiamo individuato", "abbiamo sottoposto a screening"). Il testo è parafrasato da descrizioni di protocollo senza sviluppare idee nuove. La documentazione dice di considerare la percentuale con attenzione quando il testo corrisponde a questi pattern, non di accettarla come definitiva.

Come il rilevatore calcola il punteggio

La pipeline di rilevamento suddivide il testo qualificato in segmenti e assegna un punteggio a ciascuno:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." ("Quando un articolo viene inviato a Turnitin, le frasi del documento vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni segmento viene classificato dal modello di rilevamento AI e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall'AI. Ogni frase qualificata all'interno di questi segmenti eredita il punteggio del segmento. Poiché i segmenti si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi aggregati in un unico valore. Questi punteggi a livello di frase vengono ulteriormente aggregati e utilizzati per calcolare il punteggio complessivo AI del documento.")

In una revisione sistematica, i pattern ripetitivi della sezione di metodologia possono generare punteggi di segmento elevati in più segmenti sovrapposti. Questi punteggi si sommano in una percentuale alta a livello di documento. Una sezione di metodologia di 800 parole può far salire il punteggio dell'intera revisione da 5000 parole. Se devi rivederla, "cosa puoi riformulare e cosa deve restare esatto" indica le parti che non puoi modificare.

Cosa misura realmente il rilevatore

Il rilevatore non valuta burstiness, perplexity o altre metriche citate, un'affermazione esaminata in "Turnitin usa perplexity e burstiness per rilevare l'AI":

"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." ("Il nostro modello non è programmato esplicitamente per valutare segnali specifici come 'burstiness', 'perplexity' o altre singole metriche talvolta citate nelle discussioni pubbliche.")

La frase successiva: "Instead, it learns statistical patterns from our training data." ("Impara invece pattern statistici dai nostri dati di addestramento.")

La stessa fonte spiega cosa fa realmente il modello:

"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." ("I nostri classificatori sono addestrati a rilevare queste differenze nella probabilità delle parole e sono esperti nel riconoscere le particolari sequenze di probabilità lessicale tipiche degli scrittori umani.")

Il rilevatore valuta le sequenze di probabilità delle parole. Verifica se le parole in un segmento corrispondono ai pattern appresi dalla scrittura umana o dal testo generato dall'AI. In una sezione di metodologia, la sequenza lessicale è guidata dal modello di rendicontazione. Frasi come "abbiamo cercato i seguenti database" e "gli studi sono stati inclusi se" compaiono in migliaia di articoli. Queste sequenze possono allinearsi più strettamente con i pattern statistici dei dati di addestramento che con le scelte lessicali individuali di un autore. Quell'allineamento può produrre un punteggio di probabilità elevato senza alcun intervento dell'AI.

Cosa conta come testo analizzato

Il rilevatore elabora solo "testo qualificato":

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." ("Questo testo qualificato include solo frasi in prosa, il che significa che analizziamo solo blocchi di testo scritti in frasi grammaticalmente standard ed escludiamo altri tipi di scrittura come elenchi, punti elenco (strutture brevi non frasali) o altre strutture non frasali.")

La frase successiva: "This percentage is not necessarily the percentage of the entire submission." ("Questa percentuale non corrisponde necessariamente alla percentuale dell'intero documento inviato.")

Le revisioni sistematiche contengono tabelle (diagrammi di flusso PRISMA, tabelle di estrazione) ed elenchi strutturati (criteri di inclusione ed esclusione). Questi non sono prosa qualificata. La percentuale copre solo le frasi in prosa. Se la tua sezione risultati è composta soprattutto da tabelle, la percentuale si concentra sulle sezioni ricche di prosa come la metodologia. La documentazione precisa anche:

"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." ("Il modello non rileva in modo affidabile il testo generato dall'AI sotto forma di non-prosa o codice, né rileva scrittura breve/non convenzionale come i punti elenco (strutture brevi non frasali).")

La frase successiva: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." ("Ciò significa che un documento contenente diversi tipi di scrittura può presentare una discrepanza tra la percentuale e le evidenziazioni.")

Una revisione sistematica è un documento multi-formato. La discrepanza tra percentuale ed evidenziazioni è un comportamento atteso.

Segmenti brevi

Le sezioni di metodologia sono talvolta suddivise in sottosezioni brevi. Una sottosezione sulla strategia di ricerca può essere di sole 200 parole. La documentazione avverte:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." ("Nei documenti più brevi, con solo poche centinaia di parole, la previsione sarà per lo più 'tutto o niente' perché stiamo prevedendo su un singolo segmento senza possibilità di sovrapposizione.")

La frase successiva: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." ("Ciò significa che del testo che è un misto di contenuti generati dall'AI e originali potrebbe essere segnalato come interamente generato dall'AI.")

Per una sottosezione breve, il rilevatore può prevedere su un singolo segmento senza sovrapposizioni che moderino il punteggio. Una sottosezione scritta da umani ma che segue un modello può ricevere un punteggio alto del tipo tutto-o-niente.

Il miglioramento di Turnitin ai confini del documento

Nel 2023, Turnitin ha affrontato anche i falsi positivi ai confini del documento:

"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." ("Dall'avvio, abbiamo osservato un'incidenza maggiore di falsi positivi nelle prime o nelle ultime frasi di un documento. Spesso queste frasi contengono contenuto introduttivo o conclusivo scritto in modo generico. Di conseguenza, abbiamo modificato la nostra logica di rilevamento per ridurre questi falsi positivi.")

La frase successiva: "We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." ("Abbiamo anche lavorato per rendere più preciso il rilevamento dei confini dei segmenti, il che potrebbe portare in alcuni rari casi a una modifica dei confini rispetto a una versione precedente.")

Questo è stato un miglioramento del 2023. Le introduzioni e le conclusioni delle revisioni sistematiche seguono modelli (contesto, lacuna, obiettivo, sintesi dei risultati). La modifica logica ha affrontato questo pattern.

Non considerare il punteggio come unica evidenza

La documentazione di Turnitin è esplicita sui limiti:

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." ("Il nostro modello di rilevamento della scrittura AI potrebbe non essere sempre accurato (può identificare erroneamente testo scritto da umani, generato dall'AI o parafrasato dall'AI), quindi non dovrebbe essere utilizzato come unica base per azioni avverse contro uno studente.")

La frase successiva: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." ("Sono necessari un'ulteriore verifica e il giudizio umano, congiuntamente all'applicazione da parte dell'istituzione delle proprie politiche accademiche specifiche, per determinare se si sia verificato un illecito accademico.")

Una revisione sistematica con un punteggio AI elevato nella sezione di metodologia non è una prova di illecito. La sezione di metodologia corrisponde ai pattern di falsi positivi. Il rilevatore è un classificatore di probabilità lessicale. Il punteggio richiede giudizio umano e politica istituzionale. "Cosa viene detto al tuo relatore di fare quando la tua percentuale AI è alta" è la guida da cui parte il valutatore.

Cosa significa per te

Per riassumere:

  • Le sezioni di metodologia coincidono con i pattern di falsi positivi: bassa variazione strutturale, formulazioni ripetitive e testo parafrasato senza idee nuove.
  • Il rilevatore è un classificatore di probabilità lessicale, non un valutatore di burstiness o perplexity.
  • Viene analizzata solo la prosa qualificata. Tabelle, elenchi e punti elenco sono esclusi.
  • Le sottosezioni brevi di metodologia affrontano un problema di punteggio tutto-o-niente.
  • Nel 2023, Turnitin ha migliorato la logica di rilevamento per ridurre i falsi positivi ai confini del documento.
  • Il punteggio non dovrebbe essere utilizzato come unica base per azioni avverse. Richiede giudizio umano.

Se ricevi un report AI di Turnitin su una revisione sistematica e vuoi affrontare i passaggi segnalati, importa il report e lavoraci sopra. I passaggi idonei possono essere rielaborati senza costi aggiuntivi.

CONTINUA A LEGGERE