Come ridurre la percentuale di AI in un paper in inglese? Capire cosa controlla Turnitin
Per abbassare la percentuale di AI devi prima sapere cosa analizza il detector. Turnitin esamina solo frasi di prosa standard. Il suo modello classifica in base alla probabilità lessicale, non a burstiness o perplexity. I testi strutturalmente uniformi o ripetitivi rischiano più facilmente falsi positivi.
Team HumanPen
· 4 min di lettura
Quali testi vengono falsamente segnalati
Prima di iniziare a riscrivere, tieni presente una cosa: alcuni testi segnalati non sono generati dall'AI, ma le loro caratteristiche attivano falsi positivi. La FAQ di Turnitin spiega:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A volte i falsi positivi – quando viene segnalato erroneamente un testo scritto da umani come generato dall'AI – possono riguardare contenuti con poca variazione strutturale, testi che si ripetono letteralmente, o testi parafrasati senza sviluppare nuove idee)
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se il nostro indicatore mostra una quantità maggiore di scrittura AI in tali testi, ti consigliamo di tenerne conto quando esamini la percentuale indicata)
Questo significa che se la tua scrittura ha poca variazione strutturale, contiene ripetizioni letterali o è stata parafrasata senza aggiungere nuove idee, il detector potrebbe riportare una percentuale di AI gonfiata. Non significa che hai usato l'AI. Significa che queste caratteristiche si sovrappongono ai pattern statistici dei testi generati dall'AI.
Quella frase della FAQ ti dà tre cose da verificare sulla tua bozza, e tutte e tre sono proprietà del paragrafo finito: se la struttura varia, se si ripete, e se ogni paragrafo fa avanzare un argomento che quello precedente non aveva ancora affrontato. Ciò che la frase non fa è dire quali modifiche hai usato per arrivarci. Le modifiche che effettivamente cambiano le statistiche è il nostro tentativo di affrontare quella parte a mano.
Turnitin analizza solo frasi di prosa
Non tutto nel tuo paper viene analizzato. La FAQ dichiara:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Questo testo qualificativo include solo frasi di prosa, il che significa che analizziamo solo blocchi di testo scritti in frasi grammaticali standard e non includono altri tipi di scrittura come elenchi, punti elenco (strutture brevi non frasali) o altre strutture non frasali)
Elenchi, punti elenco e strutture brevi non frasali sono al di fuori dell'ambito di analisi. Se il tuo report mostra una percentuale, quella percentuale è calcolata solo sulle frasi di prosa, non sull'intero documento.
Questo indica anche una strategia: se i tuoi argomenti vivono in paragrafi di prosa, quelli sono i paragrafi che il detector esamina. Quando riscrivi, concentra il tuo sforzo su quei paragrafi. Elenchi e tabelle non devono preoccuparsi del rilevamento AI. Quali frasi all'interno di quei paragrafi devono rimanere esatte è una questione separata: cosa puoi riformulare e cosa deve rimanere esatto.
Come il classificatore assegna i punteggi
Capire come il detector assegna i punteggi aiuta a spiegare perché alcune revisioni funzionano e altre no. Turnitin descrive il processo:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando un paper viene inviato a Turnitin, le frasi del submission vengono estratte e segmentate in sezioni sovrapposte per l'analisi di previsione. Ogni segmento viene classificato dal modello di rilevamento AI e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall'AI)
Ogni segmento riceve un valore tra 0 e 1, che rappresenta la probabilità di essere generato dall'AI. Ma il modello non funziona usando le metriche che vedi spesso nei blog post:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Il nostro modello non è esplicitamente programmato per valutare segnali specifici come 'burstiness', 'perplexity' o altre metriche individuali talvolta citate nelle discussioni pubbliche)
"Instead, it learns statistical patterns from our training data." (Invece, apprende pattern statistici dai nostri dati di addestramento)
Il segnale principale è la probabilità lessicale:
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (I nostri classificatori sono addestrati a rilevare queste differenze nella probabilità lessicale e sono abili nelle particolari sequenze di probabilità lessicale degli scrittori umani)
Collegando questo alla sezione sui falsi positivi: i testi strutturalmente uniformi e ripetitivi vengono segnalati non perché "sembrano AI" in qualche modo superficiale, ma perché le loro sequenze di probabilità lessicale assomigliano a quelle dei testi generati dall'AI. La scrittura umana tende ad avere più imprevedibilità nella scelta delle parole, mentre i testi generati dall'AI tendono a selezionare parole ad alta probabilità. Cosa misurano i detector AI oltre a perplexity e burstiness è il resoconto più lungo di questo.
Indicazioni pratiche per ridurre la tua percentuale di AI
Mettendo insieme quanto sopra:
- Rivedi i paragrafi di prosa, non gli elenchi. Il detector analizza solo frasi di prosa standard. Elenchi, punti elenco e strutture brevi nelle tabelle sono al di fuori dell'ambito di analisi.
- Aumenta la variazione strutturale. La mancanza di variazione strutturale è una causa comune di falsi positivi. Se i tuoi paragrafi hanno tutti lunghezza e struttura frasale simili, prova a variare la lunghezza delle frasi e i pattern sintattici.
- Riduci la ripetizione. La ripetizione letterale spinge in alto il punteggio AI. Se due paragrafi dicono la stessa cosa, uniscili o fai in modo che il secondo faccia davvero avanzare l'argomento.
- Sviluppa l'idea, non solo la formulazione. Ciò che la FAQ chiama parafrasi "senza sviluppare nuove idee", quindi il test che implica è se il paragrafo ora porta qualcosa che non portava prima. Non dice nulla su quali modifiche fai lungo il percorso, e scegliere una parola più chiara è una parte normale del revisionare qualsiasi cosa.
- Capisci l'unità di punteggio. Ogni segmento viene valutato individualmente, quindi un paragrafo segnalato non significa che l'intero paper sia generato dall'AI. Il report fornisce probabilità per segmento, non un giudizio unico e generale.
Cosa significa per te
Ridurre la tua percentuale di AI non riguarda trovare lo strumento giusto o il prompt giusto. Inizia con il capire cosa esamina il detector. Turnitin analizza solo frasi di prosa. Elenchi e strutture brevi sono fuori ambito. Il modello classifica in base alle sequenze di probabilità lessicale, non a burstiness o perplexity, e ogni segmento viene valutato indipendentemente. I testi con poca variazione strutturale, ripetizione letterale o parafrasi che non sviluppano nuove idee hanno più probabilità di essere falsamente segnalati.
Dopo aver ricevuto il tuo report, guarda quali paragrafi di prosa sono segnalati e lavora su quelli: varia la struttura, riduci la ripetizione e sviluppa argomenti sostanziali. Non devi toccare elenchi, tabelle o citazioni. Mantenere intatto il testo intatto è l'idea centrale dietro riscrivere solo i paragrafi che un report Turnitin ha segnalato.
CONTINUA A LEGGERE