Quanto è ampio il margine su un punteggio IA di Turnitin? Abbiamo contato

Se un elaborato torna con 43%, la domanda naturale è 43 più o meno quanto. Le tre pagine del fornitore che definiscono il report non pubblicano una risposta. La lacuna non riguarda una sola FAQ: compare in tutte e tre le pagine che abbiamo controllato. Ciò che quelle pagine pubblicano, invece, è un esempio direzionale, una fascia soppressa e una descrizione del meccanismo che ti dice dove sta davvero la variazione.

Team HumanPen

· 13 min di lettura

Qual è il margine di errore di un punteggio IA di Turnitin?

Non ce n'è uno pubblicato. Nelle tre pagine che definiscono l'AI Writing Report, lette il 28 agosto 2026, per un totale di 46.712 caratteri di testo dell'articolo renderizzato, i termini di ricerca `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` e `estimat` non danno, tutti insieme, nemmeno un'occorrenza. Il conteggio funzionava: `percentage` compare 47 volte nello stesso corpus e `false positive` 21 volte. Il fornitore pubblica invece tre dati numerici che vengono scambiati per un margine, e nessuno di questi lo è.

Questa assenza è il risultato utile, non una lamentela. Ti dice quale domanda smettere di fare e quali due domande sul numero del tuo report hanno davvero una risposta.

Due pagine vicine qui coprono un terreno diverso e questa non le ripete: Il tasso di falsi positivi di Turnitin, spiegato riguarda il tasso di errore della decisione sì/no, e Cosa significa un tasso di falsi positivi dell'1% quando un'università consegna 75.000 elaborati riguarda ciò che quel tasso produce su scala istituzionale. Questa pagina riguarda il numero in sé: di cosa è una stima e quanto potrebbe spostarsi.

Il conteggio, con il suo denominatore

Tre pagine, lette da browser senza sessione aperta il 28 agosto 2026, misurate come `document.querySelector('article').innerText`, non come corpo della pagina. Il corpo aggiunge circa 725 caratteri di navigazione e gonfierebbe il denominatore senza aggiungere testo rilevante. Conteggio dei caratteri: Using the AI Writing Report 6.492; the AI writing detection capabilities FAQs 30.987, che la pagina stessa ha contrassegnato come "Updated 9 days ago"; the AI writing detection model release notes 9.233. Totale 46.712.

Termine di ricercaPagina del reportFAQNote di rilascioTotale
`interval`0000
`margin`0000
`standard deviation`0000
`uncertain`0000
`precision`0000
`variance`0000
`error bar`0000
`plus or minus` e `±`0000
`estimat`0000
`percentage` (controllo)1031647
`false positive` (controllo)212721
`qualifying text` (controllo)64313
`segment` (controllo)09110
`reliab` (controllo)2305
`probabilit` (controllo)0404

I controlli servono perché una fila di zeri, senza di loro, non varrebbe nulla. Se la ricerca si fosse rotta, o la pagina non si fosse caricata, anche `percentage` avrebbe restituito zero. Ne ha restituiti 47.

Due quasi-riscontri che vale la pena pubblicare, perché sono esattamente il genere di cosa che una lettura frettolosa trasforma in un risultato. `confidence` dà esattamente un'occorrenza in tutto il corpus, e non è statistica: "While Turnitin has confidence in its model, Turnitin does not make a determination of misconduct." (Sebbene Turnitin abbia fiducia nel proprio modello, Turnitin non stabilisce che ci sia stata una violazione.) E `precise` ne dà esattamente una, in una nota di rilascio del 2023 sul rilevamento dei confini dei segmenti. Nessuna delle due è una misura di dispersione. Se ripeti questo conteggio e ti imbatti in una delle due, leggi la frase prima di considerarla tale.

E l'affermazione vale in entrambi i sensi. Che il fornitore non abbia pubblicato un margine è un fatto che riguarda queste pagine a questa data. Non significa che il modello non abbia una misura interna della propria affidabilità: la sezione sul meccanismo più avanti dice che ne calcola una. Allo stesso modo, nessuno può usarla per sostenere che il numero sia preciso. Significa che la domanda non ha risposta nelle pagine controllate, che è diverso dall'averne una in un senso o nell'altro.

I tre numeri che vengono scambiati per un margine

La documentazione non tace sull'errore. Tace su questo tipo di errore. Tre numeri pubblicati vengono arruolati come margine e nessuno dei tre calza.

  • L'obiettivo di falsi positivi sotto l'1%. Il suo ambito dichiarato sono "documents with over 20% of AI writing" (documenti con oltre il 20% di scrittura IA), e riguarda la frequenza con cui un documento interamente umano viene segnalato. È il tasso di errore di una decisione su una popolazione, non una fascia intorno al tuo 43.
  • L'esempio «50% potrebbero essere 65%». È quello che si avvicina di più, ed è l'argomento della prossima sezione. È direzionale e riguarda il testo IA mancato, non il fatto che la cifra mostrata sia troppo alta.
  • La fascia soppressa 1–19%. Sotto la soglia del 20% non viene mostrato alcun numero. È un'affermazione su dove il fornitore ritenga la lettura troppo poco sicura da mostrare, il che è informativo, ma anche una regola di soppressione non è un margine.

Ciò che manca in quell'elenco è esattamente ciò che ti servirebbe: un'affermazione della forma «un documento con punteggio X di solito cade tra Y e Z». Nulla, in 46.712 caratteri, ha questa forma. Quindi anche «43% più o meno quanto» non ha risposta sulla base di queste fonti primarie. Chiunque proponga un intervallo dovrebbe poter indicare un'altra fonte primaria diversa.

La direzione dell'esempio pubblicato più vicino

Il passaggio più vicino a un margine di errore che abbiamo trovato quantifica quanto la cifra riportata possa discostarsi dalla realtà, e indica una sola direzione.

"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (Per mantenere questo basso tasso dell'1% di falsi positivi, c'è la possibilità che ci sfugga parte del testo scritto dall'IA in un documento. Per noi va bene così, perché non vogliamo segnalare erroneamente come scritto dall'IA un testo scritto da esseri umani. Per esempio, se rileviamo che il 50% di un documento è probabilmente stato scritto da uno strumento di IA, quel documento potrebbe contenere fino al 65% di scrittura IA.)

Leggilo con attenzione, perché la forma conta più dei numeri. Dice che la quantità reale di testo IA può essere superiore alla cifra mostrata. Non dice il contrario. Il nostro conteggio non ha trovato, su quelle tre pagine, alcun intervallo equivalente nell'altra direzione. L'unica occorrenza di `up to` nelle note di rilascio riguarda un limite di input di 30.000 parole, non una percentuale.

Questa è tutta l'estensione dell'asimmetria che quel passaggio giustifica. Spiega perché l'esempio punta verso l'alto: il sistema accetta di perdere una parte del testo IA per ridurre i falsi positivi. Non ci dice quanto peso probatorio dare a un singolo punteggio alto o basso. Le pagine controllate non pubblicano alcuna curva di calibrazione, rapporto di verosimiglianza o misura corretta per il tasso di base a sostegno di quell'inferenza, e la stessa FAQ dice che la percentuale non dovrebbe essere l'unica base per decidere.

Quel paragrafo non ti è di alcun aiuto se hai scritto tu stesso l'elaborato e ritieni che il punteggio sia sbagliato. Non è un margine; è una dichiarazione su quale sia la direzione in cui il sistema sbaglia. Il materiale che serve davvero contro un falso positivo è un altro argomento: Il tasso di falsi positivi di Turnitin, spiegato raccoglie le dichiarazioni del fornitore in proposito.

Dove sta davvero la variazione

Le FAQ descrivono la sequenza con cui viene assegnato il punteggio. Dopo averla letta, vedi dove una misura di incertezza avrebbe dovuto comparire e dove invece esce dalla descrizione pubblica.

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un elaborato viene inviato a Turnitin, le frasi della consegna vengono estratte e divise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato dall'IA. Ogni frase idonea all'interno di queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi riuniti in un punteggio unico. Questi punteggi di frase vengono ulteriormente aggregati e usati per calcolare il punteggio complessivo di scrittura IA del documento.)

Ci sono quindi quattro passaggi, e una grandezza continua esiste al primo. Ogni sezione riceve un valore tra 0 e 1. Le frasi lo ereditano. I punteggi sovrapposti vengono riuniti. I risultati rimanenti a livello di frase vengono combinati in un'unica cifra per il documento. Una probabilità di 0,51 e una di 0,99 sono stati di conoscenza molto diversi, e quando arrivano al tuo report sono entrambi diventati parte di un'unica percentuale intera.

Le tre pagine non indicano la regola di riunione, né la regola di aggregazione, né la soglia alla quale un punteggio di frase riunito diventa una frase segnalata. Restano così tre funzioni non dichiarate tra l'incertezza del modello e la percentuale mostrata al tuo docente. È un resoconto più preciso della lacuna pubblica che limitarsi a riferire una fila di zeri.

Nulla di tutto questo rende la cifra priva di senso. È una stima derivata dal modello della quota di testo idoneo probabilmente generato dall'IA. La mancanza della regola di riunione, della regola di aggregazione e del margine limita ciò che si può dedurre da quella stima; non cancella l'unità pubblicata. La lettura attenta di 43% è quindi «il modello ha stimato il 43% del testo idoneo», non «il 43% di ogni parola di questo documento, con una fascia di errore nota».

L'eccezione documentata per i documenti brevi

La documentazione sostiene un avvertimento ristretto sulla lunghezza, non una regola generale che preveda la risoluzione del punteggio a partire dal numero di parole di un documento.

Le FAQ dicono: "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Nei documenti più brevi, dove ci sono solo poche centinaia di parole, la previsione sarà per lo più «tutto o niente», perché prevediamo su un singolo segmento senza possibilità di sovrapposizione. Questo significa che una parte del testo che mescola contenuto generato dall'IA e contenuto originale potrebbe essere segnalata come interamente generata dall'IA.) Questo è un caso documentato a segmento singolo. Le pagine controllate non pubblicano una funzione generale che mostri come cambia la risoluzione del punteggio all'allungarsi dei documenti.

Quindi la domanda pratica da aggiungere non è un margine inventato, ma il contesto del report: quanto testo idoneo è entrato nella stima, e si tratta del caso a segmento singolo di poche centinaia di parole che il fornitore segnala espressamente? Non estrapolare quel comportamento dei documenti brevi fino a farne una regola non pubblicata per un capitolo di 8.000 parole. Documenti brevi e il problema del tutto o niente in Turnitin analizza il caso breve documentato, e Cosa si intende per testo idoneo nel rilevamento IA di Turnitin spiega cosa entra e cosa non entra nel denominatore fin dall'inizio.

La fascia in cui il fornitore smette di mostrare un numero

C'è un punto in cui Turnitin ha di fatto detto che la lettura non è abbastanza solida da essere pubblicata, e lo ha fatto togliendo il numero.

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Per evitare possibili casi di falsi positivi, non vengono attribuiti punteggi o evidenziazioni per i punteggi di rilevamento IA compresi tra l'1% e il 19%. Quando l'IA viene rilevata sotto la soglia del 20% nel report, ora viene indicata con un asterisco (*%) e non viene attribuita alcuna percentuale.)

Da qui seguono due cose che vale la pena portarsi dietro. Primo: un asterisco non è un punteggio basso che ti viene nascosto; è il fornitore che rinuncia ad attribuire un punteggio, e non ci sono nemmeno evidenziazioni, quindi non c'è nulla di preciso su cui qualcuno possa indicare. Secondo: questo è il punto più chiaro, nelle tre pagine, in cui il fornitore trattiene parte del proprio output per il rischio di falsi positivi. È la cosa più vicina a una dichiarazione di incertezza che abbiamo trovato, e assume la forma di una regola anziché di un numero. Cosa significa l'asterisco (*%) su un punteggio IA di Turnitin? spiega cosa vuol dire davvero quella visualizzazione.

Come leggere un numero che arriva senza margine

Alla luce di tutto quanto sopra, ecco che cosa resta utilizzabile quando qualcuno ti mette davanti una percentuale.

  1. Smetti di chiedere il margine e chiedi il denominatore. Da quante frasi idonee è uscita questa cifra? Poche centinaia di parole significano un output quasi binario, secondo la stessa descrizione del fornitore.
  2. Segnati la direzione dell'esempio pubblicato. 50 riportati potrebbero essere 65. Nelle tre pagine controllate non abbiamo trovato alcun intervallo fondato su fonti nella direzione opposta.
  3. Considera l'asterisco come un'assenza di attribuzione, non come un numero piccolo. Nessun punteggio, nessuna evidenziazione.
  4. Non trasformare la quota stimata di testo idoneo in una quota dei tuoi paragrafi. Deriva da una riunione e da un'aggregazione non pubblicate sui segmenti, non da un conteggio di frasi che puoi individuare una a una.
  5. Non attribuire significato a un cambiamento tra versioni che il fornitore non ha definito. Le pagine controllate non pubblicano alcuna soglia di significatività per uno spostamento di pochi punti. Tieni insieme al numero il contesto del testo idoneo e le evidenziazioni di ogni report.
  6. Usa l'inquadramento del fornitore quando te lo citano. La sua FAQ dice che la percentuale "should not be used as the sole basis for action or a definitive grading measure by instructors" (non dovrebbe essere usata come unica base per prendere provvedimenti né come misura di valutazione definitiva da parte dei docenti), e che il suo modello "may not always be accurate" (potrebbe non essere sempre accurato).

Se qualcuno ti presenta un intervallo di confidenza per un punteggio IA di Turnitin, chiedi da dove arriva. Sulla base degli elementi qui sopra, non arriva da Turnitin.

Se alcuni passaggi specifici verranno comunque riscritti

Tutto quanto sopra riguarda la lettura del report, non l'agire di conseguenza, e le due cose devono restare separate. C'è però una conseguenza pratica che vale la pena enunciare, perché deriva direttamente dal problema del conteggio: se a una percentuale non è associata alcuna incertezza pubblicata, inseguire la percentuale significa inseguire qualcosa senza un bersaglio definito. I passaggi evidenziati un bersaglio definito ce l'hanno. Sono porzioni di testo precise che puoi guardare.

È tutta qui la ragione per cui Lo strumento HumanPen, che sviluppiamo noi, è organizzato intorno all'importazione del report anziché al numero che vi compare sopra. Leggila come una descrizione di prima parte. Conferisci l'AI Writing Report che hai già e i passaggi segnalati diventano il confine del lavoro; approvi quel confine a schermo, vengono riscritti solo i paragrafi confermati e tutto il resto resta invariato. È un'affermazione sul perimetro della riscrittura, non sul caricamento, sul trasferimento o sull'archiviazione. La ragione per preferirlo a una passata su tutto il documento non è una cifra migliore, che nessuno può promettere. Ogni paragrafo modificato aggiunge un controllo delle fonti prima della consegna, quindi un perimetro ristretto tiene corta quella coda di verifiche. Quando il file stesso è il risultato da consegnare, cosa succede a citazioni, tabelle ed equazioni in uno strumento per umanizzare testi IA spiega che cosa controllare dopo.

E l'avvertenza ovvia, verso cui questa pagina ha puntato per otto sezioni: nessuno può dirti quale sarà la prossima cifra, noi compresi. Se hai scritto tu stesso il lavoro, nulla di tutto questo ti riguarda. L'argomento da portare riguarda prove e procedura, non il testo.

Domande frequenti

Turnitin pubblica un margine di errore per la percentuale IA? Non sulle tre pagine che definiscono il report. Su 46.712 caratteri letti il 28 agosto 2026, `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` and `estimat` all return zero, while `percentage` returns 47 and `false positive` returns 21 on the same text.

Il 43% è davvero il 43% del mio elaborato? È la stima derivata dal modello secondo cui il 43% del testo idoneo è probabilmente generato dall'IA, non necessariamente il 43% dell'intera consegna. Poiché le regole di riunione e di aggregazione e un margine non sono pubblicate, non puoi proiettarlo uno a uno sui paragrafi visibili.

La quantità reale di testo IA potrebbe essere superiore al numero mostrato? Il fornitore lo dice direttamente, con il suo esempio: rilevare 50% e il documento "could contain as much as 65% AI writing" (potrebbe contenere fino al 65% di scrittura IA). Questo esempio punta verso l'alto. Nelle tre pagine controllate non abbiamo trovato alcun intervallo fondato su fonti nella direzione opposta.

Perché un tema breve riceve un punteggio estremo? Perché potrebbe esserci un solo segmento. Le FAQ dicono che nei documenti di poche centinaia di parole la previsione è "mostly 'all or nothing'" (per lo più «tutto o niente»), e che quindi un testo misto può essere segnalato come interamente generato dall'IA.

Perché il mio report mostra un asterisco invece di un numero? Sotto la soglia del 20% il fornitore non attribuisce né punteggio né evidenziazioni, e mostra `*%`, indicando che questo serve a evitare possibili casi di falsi positivi.

Un punteggio basso o alto dimostra chi ha scritto il mio documento? No. L'esempio del fornitore dice che una quota mostrata può sottostimare il testo IA, ma le pagine controllate non pubblicano le informazioni di calibrazione e sul tasso di base necessarie per trasformare una singola percentuale in peso probatorio. Il fornitore dice anche che la percentuale non dovrebbe essere l'unica base per decidere.

CONTINUA A LEGGERE