Turnitin segnala i saggi riflessivi come AI? Falsi positivi spiegati

I saggi riflessivi si collocano all'incrocio tra voce personale e struttura generica. La stessa documentazione di Turnitin descrive i tipi di testo che attivano falsi positivi, e i saggi riflessivi corrispondono a diverse di queste descrizioni. Quelli più brevi affrontano un problema di punteggio tutto-o-niente. Ecco cosa dice la documentazione e come gestire il punteggio.

Team HumanPen

· 5 min di lettura

Perché i saggi riflessivi suscitano sospetti

I saggi riflessivi chiedono agli studenti di scrivere delle proprie esperienze, ma la struttura tende a essere ripetitiva. Introduci l'esperienza, descrivi cosa è successo e ne trai una lezione. Il formato introspettivo fa sì che le frasi spesso seguano schemi simili tra studenti diversi. La documentazione di Turnitin descrive i tipi di testo che producono falsi positivi:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A volte i falsi positivi, ovvero quando si segnala erroneamente testo scritto da umani come generato dall'AI, possono includere contenuti senza molta variazione strutturale, testo che si ripete letteralmente o testo che è stato parafrasato senza sviluppare nuove idee.)

La frase successiva: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se il nostro indicatore mostra una quantità maggiore di scrittura AI in tale testo, vi consigliamo di tenerne conto quando esaminate la percentuale indicata.)

I saggi riflessivi presentano spesso tutte e tre queste caratteristiche. La variazione strutturale è bassa perché il formato introspettivo segue un arco prevedibile. Il fraseggio si ripete perché gli studenti usano un vocabolario simile per descrivere crescita, sfide e apprendimento. Le idee sono parafrasate dal materiale del corso senza necessariamente sviluppare nuovi argomenti. Nulla di tutto questo significa che il testo sia stato generato dall'AI. Significa che il testo corrisponde al profilo di quei testi che Turnitin stessa dice poter produrre falsi positivi, qualcosa di più chiaro una volta che sai cosa misurano i detector AI.

Come il detector processa il tuo testo

Per capire perché un saggio riflessivo ottiene un punteggio alto, dobbiamo vedere come funziona il detector:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un elaborato viene inviato a Turnitin, le frasi del testo vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni segmento viene classificato dal modello di rilevamento AI e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall'AI. Ogni frase qualificante all'interno di questi segmenti eredita il punteggio del segmento. Poiché i segmenti si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi aggregati in un unico punteggio. Questi punteggi delle frasi sono ulteriormente aggregati e utilizzati per calcolare il punteggio AI complessivo del documento.)

Ogni frase riceve un punteggio di probabilità. I punteggi vengono aggregati in un'unica percentuale a livello di documento. Un saggio riflessivo con schemi di frase costantemente simili potrebbe ricevere punteggi di segmento alti ovunque, e questi punteggi si cumulano in una percentuale complessiva elevata.

Cosa analizza effettivamente il detector

Il detector non processa ogni parola del testo. Processa solo il testo qualificante:

"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (Il modello non rileva in modo affidabile il testo generato dall'AI sotto forma di non-prosa o codice, né rileva scritture brevi/non convenzionali come elenchi puntati (strutture brevi non frasali).)

La frase successiva: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Ciò significa che un documento contenente diversi tipi di scrittura risulterebbe in una disparità tra la percentuale e le evidenziazioni.)

La stessa documentazione chiarisce cosa viene conteggiato:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Questo testo qualificante include solo frasi in prosa, il che significa che analizziamo solo blocchi di testo scritti in frasi grammaticali standard e non includiamo altri tipi di scrittura come elenchi, punti elenco (strutture brevi non frasali) o altre strutture non frasali.)

La frase successiva: "This percentage is not necessarily the percentage of the entire submission." (Questa percentuale non è necessariamente la percentuale dell'intero elaborato.)

Nei saggi riflessivi, la maggior parte del testo è in prosa, quindi il testo qualificante copre quasi tutto il documento. Il problema della disparità è meno rilevante qui rispetto ai documenti a formato misto. La percentuale che vedi è vicina alla percentuale della prosa effettiva.

Il problema dei documenti brevi

I saggi riflessivi sono spesso brevi. Un saggio da 500 parole è comune, e la documentazione avverte proprio su questo scenario:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Nei documenti più brevi con solo poche centinaia di parole, la previsione sarà per lo più 'tutto o niente' perché stiamo prevedendo su un singolo segmento senza possibilità di sovrapposizione.)

La frase successiva: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Ciò significa che un testo che è un misto di contenuti generati dall'AI e originali potrebbe essere segnalato come interamente generato dall'AI.)

In un saggio riflessivo breve, il detector può avere un solo segmento da valutare. Non c'è sovrapposizione per attenuare la previsione. Se quel singolo segmento ottiene un punteggio alto, l'intero saggio viene segnalato. Un documento misto, in parte originale e in parte assistito da bozze, potrebbe essere riportato come 100% generato dall'AI, che è una delle strade che porta a perché Turnitin dice che il tuo lavoro è 100% AI. La brevità elimina l'effetto di mediazione di cui beneficiano i documenti più lunghi.

Non trattare il punteggio come unica prova

La documentazione di Turnitin è esplicita su come il punteggio dovrebbe e non dovrebbe essere usato:

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Il nostro modello di rilevamento della scrittura AI potrebbe non essere sempre accurato (potrebbe identificare erroneamente testo scritto da umani, generato dall'AI o parafrasato dall'AI), quindi non dovrebbe essere usato come unica base per azioni avverse contro uno studente.)

La frase successiva: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Occorrono ulteriori verifiche e il giudizio umano, insieme all'applicazione da parte dell'istituzione delle sue specifiche politiche accademiche, per determinare se si sia verificata una violazione accademica.)

Un'altra fonte Turnitin rafforza questa posizione:

"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy." (Non è progettato per fornire risposte definitive in isolamento. Più importante di qualsiasi strumento è l'educatore che vede il punteggio e prende decisioni bilanciando queste informazioni con la propria conoscenza personale degli studenti, del loro lavoro e delle politiche istituzionali.)

La frase successiva: "When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended." (Quando gli educatori esaminano il punteggio di scrittura AI e lo utilizzano come un singolo punto dati piuttosto che come risposta definitiva, allora viene usato come previsto.)

Se il tuo saggio riflessivo riceve un punteggio AI alto, quel punteggio è un singolo punto dati. Non è una prova. La documentazione dice che il modello può identificare erroneamente il testo e richiede giudizio umano insieme alle politiche istituzionali. Se sei tu quello che deve rispondere del punteggio, segnalato ma l'hai scritto tu spiega come preparare quella risposta.

Cosa significa per te

Per riassumere quanto abbiamo visto:

  • I saggi riflessivi corrispondono a diversi schemi di falsi positivi descritti nella documentazione di Turnitin, tra cui bassa variazione strutturale, fraseggio ripetitivo e idee parafrasate.
  • Turnitin consiglia: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se il nostro indicatore mostra una quantità maggiore di scrittura AI in tale testo, vi consigliamo di tenerne conto quando esaminate la percentuale indicata.)
  • Il detector suddivide il testo e assegna un punteggio a ogni segmento. I saggi brevi possono avere un solo segmento, creando un risultato tutto-o-niente.
  • I saggi riflessivi brevi (poche centinaia di parole) affrontano il rischio più alto di un punteggio binario.
  • Il punteggio non dovrebbe essere usato come unica base per azioni avverse. È un singolo punto dati che richiede giudizio umano.

Se ricevi un rapporto AI di Turnitin su un saggio riflessivo e vuoi affrontare i passaggi segnalati, importa il rapporto e lavoraci sopra. I passaggi idonei possono essere rieseguiti senza costi aggiuntivi.