Perché i rilevatori di AI segnalano i saggi ben scritti
La domanda presuppone che il rilevatore abbia letto il tuo saggio e lo abbia penalizzato perché troppo ben scritto. Ma nulla di ciò che il fornitore pubblica sullo strumento prevede un criterio per 'ben scritto', il che cambia completamente ciò che una segnalazione può dirti.
Team HumanPen
· 14 min di lettura
La risposta breve
Non si tratta di valutare la scrittura. Nelle tre pagine di aiuto di Turnitin che abbiamo consultato, i termini "quality", "style", "polished", "well written", "vocabulary" e "clarity" non comparivano affatto. Il controllo di sensibilità "300 words" era presente su tutte e tre le pagine, quindi la nostra ricerca leggeva il testo delle pagine anziché restituire valori vuoti. Le FAQ non descrivono il rilevatore come uno strumento per misurare la qualità della scrittura. Turnitin pubblica invece un elenco non quantificato di tipi di testo che possono generare falsi positivi. La prosa accademica curata può assomigliare a due voci di quell'elenco quando ripete termini fissi o utilizza strutture parallele, ma Turnitin non specifica con quale frequenza queste caratteristiche compaiano tra gli errori.
Questo non dimostra che la cura formale sia innocua, e non faremo finta che lo sia. Ciò che un'azienda documenta è solo ciò che ha scelto di documentare, e un modello addestrato contiene molto più di quanto le sue pagine di aiuto mostrino. Stabilisce qualcosa di più ristretto ma più utile: "well written" non è una quantità che questo sistema riporta, quindi una segnalazione non è un verdetto su di essa, e il consiglio che le persone elaborano basandosi sull'assunto contrario, che finisce sempre con lo scrivere al di sotto delle proprie capacità, non ha alcun fondamento pubblicato.
Contando il vocabolario dello stesso fornitore
Abbiamo cercato il testo renderizzato di tre pagine recuperate il 18 agosto 2026, poiché `guides.turnitin.com` restituiva 403 a un semplice fetch da riga di comando: "Using the AI Writing Report", "Turnitin's AI writing detection capabilities FAQs" e "File requirements for an AI Writing Report". Quelle pagine illustrano il meccanismo e le regole sui file; le note di rilascio e le pagine dei problemi noti erano al di fuori di questa ricerca. La tabella registra la presenza o assenza indipendentemente dal caso, piuttosto che conteggi esatti, che possono variare man mano che le pagine live cambiano.
| Termine di ricerca | Guida al rapporto | FAQ sul rilevamento | Requisiti file |
|---|---|---|---|
| `quality` | Assente | Assente | Assente |
| `style` | Assente | Assente | Assente |
| `well written` / `well-written` | Assente | Assente | Assente |
| `polished` | Assente | Assente | Assente |
| `genre` | Assente | Assente | Assente |
| `discipline` | Assente | Assente | Assente |
| `false positive` (secondary control) | Presente | Presente | Assente |
| `300 words` (sensitivity control) | Presente | Presente | Presente |
La riga inferiore è il motivo per cui il resto della tabella ha un senso: un risultato vuoto e un recupero fallito lasciano la stessa traccia, quindi un termine noto per essere su tutte e tre le pagine deve innanzitutto essere presente. Nelle FAQ compaiono "writing" e "segment", mentre "vocabulary", "word choice" e "clarity" sono assenti. "Breakdown" è presente nella guida al rapporto, ma solo come nome di un pannello dell'interfaccia, non come statistica.
Poi ci sono le immagini, che una ricerca testuale non può vedere affatto. L'articolo delle FAQ stesse non contiene immagini; il logo del sito appartiene alla grafica della pagina, non all'articolo. La guida al rapporto contiene screenshot senza testo alt, quindi li abbiamo aperti separatamente. Includono un rapporto di esempio che mostra 56% AI accanto al 23% di similarità, una pagina di prosa evidenziata e messaggi di stato. Nessuno usa le parole di cui sopra. Una reca una frase che non appare da nessuna parte nel testo della pagina stessa:
"AI detection includes the possibility of false positives. Although some text in this submission is likely AI generated, scores below the 20% threshold are not surfaced because they have a higher likelihood of false positives." (Il rilevamento AI include la possibilità di falsi positivi. Sebbene alcuni testi in questa submission siano probabilmente generati dall'AI, i punteggi al di sotto della soglia del 20% non vengono mostrati perché hanno una probabilità maggiore di falsi positivi.)
È il prodotto che rifiuta di stampare un numero nella fascia in cui si fida meno, e vale la pena tenerlo a mente, perché ovunque altro in questo materiale il tasso di errore è descritto piuttosto che messo in atto.
Per cosa ha parole
Qualcosa sta facendo il lavoro, e le FAQ lo nominano sotto la voce "What parameters or flags does Turnitin's model take into account when detecting AI writing?":
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (I nostri classificatori sono addestrati a rilevare queste differenze nella probabilità delle parole e sono abili nel riconoscere le particolari sequenze di probabilità delle parole degli scrittori umani.)
La stessa risposta aggiunge con attenzione che il modello "is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions" (non è esplicitamente programmato per valutare segnali specifici come 'burstiness', 'perplexity' o altre metriche individuali talvolta menzionate nelle discussioni pubbliche), e che invece "learns statistical patterns from our training data" (apprende schemi statistici dai nostri dati di addestramento). Entrambe le frasi sono sulla pagina e leggerne una senza l'altra porta da qualche parte di sbagliato: il fornitore sta negando due metriche pubbliche con nome, non negando che la probabilità delle parole sia la valuta. Cosa significa per i termini di cui le persone discutono è esposto in cosa misurano i rilevatori di AI.
Ora segui le unità pubblicate verso l'alto piuttosto che verso il basso. Parole, poi frasi, poi questo:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1 ... Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un documento viene sottoposto a Turnitin, le frasi della submission vengono estratte e segmentate in sezioni sovrapposte per l'analisi predittiva. Ogni segmento viene classificato dal modello di rilevamento AI e riceve un valore tra 0 e 1… Ogni frase qualificata all'interno di questi segmenti eredita il punteggio del segmento. Poiché i segmenti si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi raggruppati in un unico punteggio. Questi punteggi delle frasi vengono ulteriormente aggregati e utilizzati per calcolare il punteggio complessivo del documento AI.)
La catena si ferma lì. L'oggetto più grande che viene mai classificato è un segmento, largo alcune frasi, e il numero del documento è un'aggregazione di quelli, non un secondo giudizio fatto dopo aver letto l'intera cosa. Quasi tutto ciò che rende un saggio buono è più grande di un segmento: un argomento che tiene per otto pagine, prove scelte bene, un'obiezione sollevata nella sezione due e risposta nella sezione cinque. Nulla di tutto ciò è un oggetto alla scala in cui avviene la classificazione. Non è che il sistema pesa il tuo ragionamento e non gli piace. Non c'è slot.
A cosa è calibrato "umano"
Quando si discutono falsi positivi nella prosa accademica, il fornitore punta a un corpus di test pre-ChatGPT:
"To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Per rafforzare il nostro framework di test e diagnosticare le tendenze statistiche dei falsi positivi, prima di ogni aggiornamento o rilascio di un nuovo modello, eseguiamo test su oltre 700.000 documenti accademici aggiuntivi che sono stati scritti prima del rilascio di ChatGPT per convalidare ulteriormente il nostro tasso di falsi positivi inferiore all'1%.)
Le FAQ si chiedono la stessa cosa di nuovo sotto la sua stessa voce, "How does Turnitin ensure that the false positive rate for a document remains less than 1%?", e ripete la cifra con la parola "over" eliminata: "we perform additional tests on 700,000 additional academic papers that were written before the release of ChatGPT". Stesso corpus, due frasi leggermente diverse su una pagina.
Leggi come Turnitin descrive quella popolazione di riferimento: documenti accademici selezionati perché sono stati scritti prima del rilascio di ChatGPT. Questa è una descrizione basata sulla data, non un'affermazione che ogni documento è stato verificato indipendentemente come scritto da umani. L'affermazione più ristretta è ancora utile: Turnitin dice che ri-esegue questo corpus accademico pre-ChatGPT prima dei rilasci del modello per osservare il tasso di falsi positivi. La pagina non descrive la verifica autore per autore.
Il che non lo risolve, e staremmo esagerando se dicessimo che lo fa. Il fornitore pubblica il target e non la distribuzione dietro di esso, e il target stesso porta un limite che la sua stessa frase successiva elimina tranquillamente. La versione completa di quell'argomento, incluso cosa succede quando si moltiplica un piccolo tasso per il volume annuale di una vera università, è in cosa significa un tasso di falsi positivi dell'1%.
La distribuzione degli errori non è pubblicata
La pagina dichiara un tasso di falsi positivi inferiore all'1%, ma non pubblica come gli errori sono distribuiti attraverso il corpus di test. Non fornisce tassi per sottogruppi e non mostra se un tipo di testo rappresenta più errori di un altro.
La pagina pubblica invece un elenco non quantificato di testi che possono includere falsi positivi, seguito da consigli per leggere la percentuale:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (A volte i falsi positivi (contrassegnare erroneamente un testo scritto da umani come generato dall'AI), possono includere contenuti senza molta variazione strutturale, testi che si ripetono letteralmente, o testi che sono stati parafrasati senza sviluppare nuove idee. Se il nostro indicatore mostra una quantità maggiore di scrittura AI in tali testi, ti consigliamo di prenderlo in considerazione quando guardi la percentuale indicata.)
Leggi cosa c'è in quella lista e cosa non c'è. Non vocabolario sofisticato, non frasi lunghe, non un argomento forte. Nominano tre possibili proprietà del testo, ma non danno alcuna frequenza per nessuna di esse. La terza descrive un processo piuttosto che qualcosa che avresti prodotto scrivendo per conto tuo.
Le prime due valgono il confronto con la pratica accademica ordinaria, e ciò che segue è la nostra lettura, non quella del fornitore. Se il tuo campo ti chiede di chiamare una cosa con un nome ogni volta che appare, puoi ripetere lo stesso termine apposta perché un sinonimo introdurrebbe ambiguità. Se imposti elementi comparabili in frasi parallele in modo che un lettore possa tenerli uno accanto all'altro, puoi ridurre la variazione strutturale per la stessa ragione. Nessuna delle due scelte è un errore. Turnitin dice che i falsi positivi possono includere queste proprietà. Non dice con quale frequenza, che gli errori sono concentrati lì, o che le proprietà correlano con gli errori.
Quello che non stiamo dicendo, perché è un'affermazione molto più grande di quanto tutto questo supporti, è che la scrittura ben curata viene segnalata. Quella frase circola ampiamente, e ciò a cui di solito arriva allegata è un'istruzione di sembrare meno capaci di quanto sei. Le modifiche che l'elenco pubblicato supporta effettivamente, e il costo di farle a mano, sono elaborati in come umanizzare il testo AI senza uno strumento.
Nota anche per chi è scritta quella seconda frase. Chiede a chiunque stia guardando la percentuale di soppesare che tipo di testo l'ha prodotta. L'istruzione è indirizzata alla persona che tiene il rapporto, non alla persona che ha scritto il documento.
Se il tuo tipo di scrittura sia svantaggiato non è pubblicato
La domanda ovvia successiva è se i falsi positivi sono più comuni nella tua disciplina, nella tua sezione o nel tuo genere. Le FAQ hanno un'intestazione che si avvicina, "Does the Turnitin model take into account that AI writing detection technology might be biased against particular subject-areas or second language writers?", e la risposta riguarda il campione di addestramento:
"One of the guiding principles of our company and of our AI team has been to minimize the risk of harm to students, especially those disadvantaged or disenfranchised by the history and structure of our society. Hence, while creating our sample dataset, we took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments and less common subject areas such as anthropology, geology, sociology, and others." (Uno dei principi guida della nostra azienda e del nostro team di AI è stato minimizzare il rischio di danno agli studenti, specialmente quelli svantaggiati o emarginati dalla storia e dalla struttura della nostra società. Quindi, mentre creavamo il nostro dataset di esempio, abbiamo tenuto conto di gruppi statisticamente sottorappresentati come gli studenti di seconda lingua, gli utenti inglesi di paesi non anglofoni, gli studenti di college e università con iscrizioni diverse e aree tematiche meno comuni come antropologia, geologia, sociologia e altre.)
I nomi delle materie "anthropology", "geology" e "sociology" compaiono solo nei paragrafi che descrivono come è stato costruito il campione. "Discipline", "genre" e "subgroup" sono assenti da tutte e tre le pagine. Quindi le aree tematiche compaiono come input per l'addestramento, non come breakdown di test pubblicato. Non c'è un tasso di falsi positivi pubblicato per l'antropologia, e il fornitore non mette numeri dietro la risposta sul bias, ecco perché deve essere letta come una dichiarazione di intenti.
Questo divario è il motivo per cui la cifra a cui tutti arrivals su questa domanda viene dall'esterno dell'azienda: uno studio del 2023 su 91 saggi TOEFL, il cui ambito, modifiche controllate e limiti reali abbiamo esaminato in perché gli scrittori di inglese non nativo vengono segnalati dai rilevatori di AI più spesso. È anche il motivo per cui due rilevatori possono consegnare allo stesso paragrafo due verdetti diversi, che è un pasticcio separato coperto in perché i rilevatori non sono d'accordo.
Una parte del tuo miglior lavoro non è affatto nella misurazione
C'è un'altra ragione per cui "ha segnalato il mio buon saggio" è la cornice sbagliata, e riguarda cosa è la percentuale una percentuale di. Solo una parte del tuo documento è idonea a essere valutata:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission." (Questo testo qualificato include solo frasi di prosa, il che significa che analizziamo solo blocchi di testo scritti in frasi grammaticali standard e non includono altri tipi di scrittura come elenchi, punti elenco (strutture brevi non di frase), o altre strutture non di frase. Questa percentuale non è necessariamente la percentuale dell'intera submission.)
Due cambiamenti annunciati nell'agosto 2023 hanno spostato ulteriormente il limite. Uno dice che la prosa di forma lunga all'interno delle tabelle è ora elaborata; l'altro dice che un bug che a volte evidenziava la scrittura AI all'interno di una bibliografia è stato corretto e le bibliografie sono ora escluse dall'elaborazione. Entrambe queste note di rilascio terminano allo stesso modo, dicendoti di inviare nuovamente un documento esistente prima che si applichi uno di questi cambiamenti.
Quindi la bibliografia su cui hai passato due serate ad allineare e i criteri di inclusione scritti come punti elenco brevi e non frasali stanno fuori dall'insieme valutato. Le tabelle sono condizionali: la prosa di forma lunga al loro interno può essere elaborata, mentre le celle numeriche, i frammenti e altri contenuti tabellari non frasali possono rimanere fuori dalla prosa qualificata. La percentuale quindi non deve per forza descrivere l'intera submission. Questa è anche la ragione meccanica per cui può essere in disaccordo con la quantità di testo colorato davanti a te, che smontiamo riga per riga in come leggere un rapporto di scrittura AI di Turnitin.
Cosa fare con tutto questo
Ben poco riguarda come scrivi, e la maggior parte riguarda quanto peso può portare il numero.
- Sembra meno capace è la prima mossa da escludere. Tutto quanto sopra argomenta contro di essa, e lo scambio è sbilanciato in modo ordinario: i voti di un esaminatore atterrano per certi, mentre l'effetto sul punteggio è qualcosa che nessuno ha misurato e di solito non ti è permesso osservare.
- Chiedi quali passaggi, non quale numero. Le evidenziazioni ti dicono dove si è posato il classificatore. La percentuale ti dice su quanta parte del testo qualificato si è posato, che è una quantità diversa da quanta parte del tuo saggio.
- Aspettati che un documento breve sia misurato in modo grossolano. Secondo le parole del fornitore: "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Nei documenti più brevi dove ci sono solo poche centinaia di parole, la previsione sarà per lo più 'tutto o niente' perché stiamo prevedendo su un singolo segmento senza l'opportunità di sovrapposizione.) La frase successiva è quella che conta: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Questo significa che alcuni testi che sono un misto di contenuti generati dall'AI e originali potrebbero essere segnalati come interamente generati dall'AI.) Sotto le 300 parole di testo qualificato, i requisiti file dicono che non c'è affatto un rapporto da leggere.
- Se la tua prosa è convenzionale perché il genere lo richiede, controlla per chi è scritto il consiglio del fornitore. Quella frase è indirizzata a chiunque legga la percentuale, non a te. Vale la pena saperlo prima di concludere che è il documento la cosa che deve cambiare.
- Diffida di qualsiasi promessa sul numero risultante, inclusa la nostra. La posizione di Turnitin stessa è che le previsioni individuali "may not always be explainable in simple feature-by-feature terms" (potrebbero non essere sempre spiegabili in semplici termini di caratteristica per caratteristica). Nessuno fuori dall'azienda può mappare una modifica su un movimento nel punteggio.
Dove una riscrittura si inserisce, e dove no
Niente di tutto questo è un argomento per riscrivere. Dove il lavoro è tuo e sei preparato a dirlo, il documento non è l'oggetto che dovrebbe cambiare.
Una riscrittura guadagna il suo posto in un punto specifico: quando esiste un rapporto, passaggi particolari sono segnati su di esso, e quei passaggi stanno per essere revisionati comunque. Questa è la forma per cui HumanPen è costruito. Passagli il file più il rapporto AI di Turnitin o iThenticate e i passaggi segnati diventano lo scope, con tutto ciò che è fuori da essi che mantiene le parole che hai scritto. La nostra pagina dichiara la regola di granularità: "A paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm." (Un paragrafo è l'unità più piccola che il motore riscrive: se la tua selezione copre solo una parte di uno, è espansa al paragrafo completo e mostrata in quel modo per te da confermare.) La fatturazione conta le parole effettivamente riscritte, quindi un lavoro con scope costa quanto costa lo scope piuttosto che quanto pesa il file.
Se un nuovo rapporto segnala ancora passaggi, i risultati idonei possono continuare abbassando l'AI gratuitamente. Quello che nessuno può darti è la cifra sul prossimo rapporto. Dopo tutto quanto sopra, un tool che ti cita un numero sta citando un numero che non ha.
Domande frequenti
La prosa ben scritta ha più probabilità di essere segnalata? Questa è un'affermazione più ampia di quanto il materiale pubblicato supporti, e non la stiamo facendo. Ciò che è documentato è un elenco di tre tipi di testo che Turnitin dice che i falsi positivi possono includere, nessuno dei quali è un giudizio di qualità, più un effetto misurato su scrittori con un lessico più piccolo in inglese da un campione del 2023. Tratta la versione ampia come un'affermazione in circolazione piuttosto che un risultato.
Usare un vocabolario avanzato alza il mio punteggio AI? Nulla di ciò che il fornitore pubblica ne parla: "vocabulary" e "word choice" erano entrambi assenti dalle tre pagine di aiuto che abbiamo cercato. Un esperimento controllato del 2023 ha mosso direttamente la scelta delle parole e ha spinto contro la teoria popolare piuttosto che con essa: i ricercatori hanno arricchito il wording di saggi già segnalati, e le segnalazioni sono diminuite. Questo stabilisce che la scelta delle parole non era inerte in quell'esperimento. Non stabilisce nulla sul tuo documento.
La mia scrittura si ripete perché la terminologia deve essere coerente. Questo è il caso convenzionale, e risponde a un elemento dell'elenco dei falsi positivi del fornitore stesso. Il suo consiglio in quella situazione è rivolto alla persona che legge il rapporto: tieni conto della natura del testo quando guardi la percentuale.
Dovrei aggiungere variazione della lunghezza delle frasi di proposito? Non come esercizio di formattazione. Dove la variazione stava già portando significato, ripristinarla è una revisione ordinaria. Costruirla in una sezione le cui convenzioni richiedono uniformità sostituisce la scrittura che la tua disciplina ha chiesto con scrittura che non ha chiesto, in cambio di un effetto che nessuno può misurare dall'esterno.
Posso controllare il punteggio io stesso prima di inviare? Di solito no. La posizione di Turnitin è che l'indicatore di scrittura AI e il rapporto sono per istruttori e amministratori, e raggiunge uno studente solo se un istruttore scarica il rapporto e lo passa. Qualsiasi consiglio che presuppone che puoi guardare il numero che si muove sta presupponendo un accesso che la maggior parte degli studenti non ha.