Pangram contro Turnitin: perché i due punteggi IA non concordano

Una rivista, una scuola o una piattaforma di pubblicazione ha fatto passare il tuo testo in Pangram, e hai anche un valore Turnitin. I due non concordano. Il motivo è più specifico di «modelli diversi»: i due fornitori non riportano nemmeno lo stesso tipo di metrica e, sotto, contano unità diverse su corpus diversi. Ecco cosa pubblica ciascuno e cosa puoi farci con due numeri che non si concilieranno.

Team HumanPen

· 19 min di lettura

La risposta breve

Un risultato Pangram e un risultato Turnitin non sono due letture della stessa grandezza: uno scarto tra i due è quindi atteso, non la prova che uno dei due sia rotto. Il whitepaper di Turnitin dell'agosto 2024 afferma che l'azienda non usa «accuracy» (accuratezza) come metrica. La home page di Pangram, controllata il 15 settembre 2026, mostra il badge «99.9%+ Accuracy» (oltre il 99,9% di accuratezza). Sotto il titolo i due divergono di nuovo: le FAQ di Turnitin descrivono frasi valutate all'interno di segmenti sovrapposti e una percentuale calcolata sul testo idoneo, mentre la model card di Pangram descrive una previsione a livello di token con tre etichette e frazioni del documento ponderate per i caratteri. Il numero che ha conseguenze è quello prodotto dallo strumento con cui il tuo istituto prende la decisione.

I due fornitori non concordano su quale metrica pubblicare

Il whitepaper di Turnitin, Turnitin's AI Writing Detection Model Architecture and Testing Protocol, datato agosto 2024, dice questo:

«Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed.» (Turnitin non usa «accuracy» come metrica, perché è troppo facilmente manipolabile e troppo dipendente dallo specifico set di dati su cui viene calcolata.)

La frase successiva ne dà la ragione, e puoi controllare tu stesso l'aritmetica:

«For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system.» (Per esempio, considera un set di dati con 100 testi, 99 dei quali scritti da esseri umani. Un algoritmo semplice e ingenuo che classificasse tutti i testi come «scritti da umani» raggiungerebbe il 99% di accuratezza su questo set, pur non avendo alcun valore come sistema di rilevamento della scrittura IA.)

Da questo esempio vale la pena portarsi via qualcosa. Un rilevatore che non segnala mai nulla ne azzecca 99 su quei 100: la cifra si muove quindi con la composizione del set di prova, non con la qualità del rilevatore. Il whitepaper dice che Turnitin «uses two main metrics to test AIW-2: recall and FPR» (usa due metriche principali per testare AIW-2: recall e FPR), e definisce entrambe nella stessa sezione con esempi svolti.

Pangram pubblica una cifra di accuratezza in bella vista. Il badge della home page recita «99.9%+ Accuracy» (oltre il 99,9% di accuratezza; rilevato il 15 settembre 2026). La pagina per l'istruzione superiore ne mostra due insieme: «99.98% accuracy» (accuratezza 99,98%) nella frase di apertura e, 52 caratteri dopo, nella stessa fascia, un badge «99.9%+ Accuracy» (oltre il 99,9% di accuratezza), con in mezzo solo «Detects AI Assistance Free Credits» (rileva l'assistenza IA, crediti gratuiti). La model card di Pangram per Pangram 4, datata 29 luglio 2026, l'accuratezza non la mette affatto in evidenza: riporta tassi di falsi positivi e falsi negativi suddivisi per corpus, lingua e dominio.

Quindi le due cifre di testa non sono un numero alto e un numero basso della stessa proprietà. Un fornitore ha pubblicato un'obiezione scritta alla metrica che l'altro mette in vetrina. Non diciamo che una delle due scelte sia sbagliata, e nessuna delle due è un segreto: entrambe le dichiarazioni sono oggi su pagine pubbliche.

Cosa conta davvero ciascun punteggio

Entrambi i sistemi restituiscono una percentuale. Le percentuali sono costruite a partire da materiale grezzo diverso.

Turnitin (FAQ e whitepaper dell'agosto 2024)Pangram (model card di Pangram 4, 29 luglio 2026)
Unità classificataFrasi, raggruppate in segmenti sovrappostiToken, decodificati in segmenti di lunghezza variabile
Gestione delle sovrapposizioniLe frasi presenti in più segmenti ricevono più punteggi, «which are then pooled into a single score» (che vengono poi riuniti in un solo punteggio)«predictions for tokens that appear in multiple windows are aligned and averaged» (le previsioni per i token che compaiono in più finestre vengono allineate e mediate), all'interno di una finestra di inferenza di 512 token
Di cosa è una quota la percentuale del documentoSolo il testo idoneo. «this percentage is not necessarily the percentage of the entire submission» (questa percentuale non è necessariamente la percentuale dell'intera consegna)Il documento analizzato. `fraction_human`, `fraction_ai_assisted` e `fraction_ai` sono «character-weighted» (ponderate per i caratteri) e «sum to 1.0» (la loro somma fa 1,0)
Numero di classiDue. La percentuale copre il testo «likely generated by AI or likely generated and modified by an AI paraphraser or bypasser» (probabilmente generato dall'IA o probabilmente generato e modificato da un parafrasatore o da uno strumento per aggirare l'IA)Tre: `Human` (umano), `AI-Assisted` (assistito dall'IA), `AI-Generated` (generato dall'IA)
Lunghezza minima300 parole di prosa50 parole
Risultati bassiDall'1% al 19% compare un asterisco, senza percentuale e senza evidenziazioni`prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise (restituisce la forma breve «scritto da un umano» quando i caratteri umani rappresentano almeno il 90%, «IA» quando i caratteri generati dall'IA rappresentano almeno l'80%, e «misto» negli altri casi)

La riga del denominatore è quella che fa male. Le FAQ di Turnitin dicono che la percentuale mostrata copre «the amount of qualifying text within the submission» (la quantità di testo idoneo nella consegna) e che «If text within the submission is not considered long-form prose text, it will not be included.» (Se un testo nella consegna non è considerato prosa di lunga forma, non verrà incluso.) Le frazioni di Pangram coprono il testo analizzato e sommano a 1,0. Dai a entrambi i sistemi un elaborato con una lunga bibliografia, un indice e un paio di tabelle: già prima che parta uno dei due modelli, non stanno lavorando sullo stesso corpo di parole. Come leggere un report di scrittura IA di Turnitin passa in rassegna cosa entra e cosa esce dal denominatore di Turnitin.

Perché l'1% e l'1 su 10.000 non sono sulla stessa scala

Queste sono le due cifre che la gente mette una accanto all'altra, e dividerne una per l'altra produce un rapporto che non significa nulla. Tutte e due si chiamano tasso di falsi positivi. Nessuna delle due è misurata come l'altra.

Le FAQ di Turnitin indicano un obiettivo:

«We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing.» (Ci impegniamo a massimizzare l'efficacia del nostro rilevatore mantenendo il nostro tasso di falsi positivi — l'identificazione errata come generato dall'IA di un testo scritto interamente da un essere umano — sotto l'1% per i documenti con oltre il 20% di scrittura IA.)

Quella condizione in coda è portante, e il whitepaper spiega da dove viene. Un documento viene etichettato come generato dall'IA quando più del 20% dei suoi punteggi a livello di frase supera una soglia di frase, e il whitepaper dice che «the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%).» (sia la soglia del 20% di proporzione del documento sia la soglia del modello predeterminata sono state scelte per mantenere il tasso di falsi positivi a livello di documento sotto 0,01 (1%)). La soglia e il tasso sono parti di un unico meccanismo, non un'affermazione indipendente su di esso. Cosa significa un tasso di falsi positivi dell'1% quando un'università presenta 75.000 elaborati fa la moltiplicazione.

Le FAQ della home page di Pangram indicano un tasso:

«Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents.» (Il tasso di falsi positivi di Pangram — il tasso con cui documenti umani vengono segnalati erroneamente come IA — è attualmente di 1 su 10.000. Questo numero è calcolato su un aggregato di set di dati pubblici che contiene decine di milioni di documenti scritti.)

La model card dà una cifra più ristretta, con un corpus dichiarato: «At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples.» (Nel punto operativo di produzione, Pangram 4 raggiunge un tasso di falsi positivi dello 0,0041% — circa 1 su 24.000 — su 1.000.000 di esempi di valutazione FineWeb in inglese scritti da esseri umani.) Una seconda tabella sulla scheda suddivide il tasso per dominio, e la sua riga sulla scrittura accademica segna lo 0,019% su 62.971 elementi, sopra la cifra complessiva in inglese che la precede.

Regole di etichettatura diverse, punti operativi diversi e, dal lato Turnitin, un tasso che vale solo oltre una soglia del 20%. Quindi non ti daremo un confronto aritmetico tra le due cifre. Quello che puoi fare è chiedere su cosa ciascuna sia stata misurata, e entrambi i fornitori rispondono per iscritto. Le FAQ di Turnitin dicono che valida il proprio tasso su «over 700,000 additional academic papers that were written before the release of ChatGPT» (oltre 700.000 articoli accademici aggiuntivi scritti prima del rilascio di ChatGPT). La home page di Pangram attribuisce il proprio tasso a «an aggregate of public datasets» (un aggregato di set di dati pubblici) e la model card attribuisce quello più ristretto a esempi FineWeb, con la scrittura accademica che compare a parte come una riga di dominio tra undici. Sono risposte a domande diverse, ed è tutto qui il problema.

Una percentuale può essere una quota, oppure una confidenza

Due report possono mostrare «99%» e intendere cose diverse, ed entrambi i fornitori lo dicono nella loro documentazione.

La model card di Pangram tratta i numeri del documento come quote: le tre frazioni sono porzioni di testo ponderate per i caratteri la cui somma fa 1,0. Dice anche esplicitamente che gli altri suoi numeri non sono ciò che sembrano. ai_assistance_score è «a continuous AI-involvement score, not the probability of the displayed discrete label» (un punteggio continuo del coinvolgimento dell'IA, non la probabilità dell'etichetta discreta mostrata), e il valore di confidenza del segmento «measures the peakedness of the unconstrained CRF posterior, it is not a calibrated probability estimate.» (misura la concentrazione della posterior CRF non vincolata; non è una stima di probabilità calibrata). Detto in parole semplici: un segmento contrassegnato come High è uno in cui i punteggi interni del modello si sono stretti attorno a una sola etichetta, e il fornitore ti sta dicendo di non trasformare questo in probabilità.

La pagina di orientamento di Pangram per gli insegnanti legge una percentuale esattamente al contrario:

«If a segment of text gets a 99% AI score, that doesn't mean we necessarily think the entire text was AI-generated. Rather, we are 99% confident that AI was used to generate some portion of the text.» (Se un segmento di testo riceve un punteggio IA del 99%, questo non significa necessariamente che pensiamo che tutto il testo sia stato generato dall'IA. Piuttosto, siamo sicuri al 99% che l'IA sia stata usata per generare una parte del testo.)

Anche le FAQ di Turnitin mettono in guardia dalla lettura come quota: «Unlike our Similarity Report, the AI writing percentage does not necessarily correlate to the amount of text in the submission.» (A differenza del nostro Similarity Report, la percentuale di scrittura IA non corrisponde necessariamente alla quantità di testo nella consegna.)

Prima di confrontare due percentuali, stabilisci di cosa ciascuna sia la percentuale. Se una è una quota di caratteri e l'altra un livello di confidenza, non sarebbero mai potute concordare, e nessuna delle due ti stava mentendo. Perché lo stesso testo ottiene punteggi diversi su ogni rilevatore raccoglie le altre ragioni.

La stessa etichetta sta su numeri con denominatori diversi

Un tasso di falsi positivi significa qualcosa solo insieme all'insieme di documenti su cui è stato calcolato. Entrambi i fornitori pubblicano più numeri sotto un'unica etichetta, e una coppia vale la pena percorrerla per intero, perché la spiegazione ovvia dello scarto si rivela quella sbagliata.

Prima Pangram, tutto controllato il 15 settembre 2026. Leggi la colonna di destra con la stessa attenzione di quella di sinistra: parte della dispersione dipende da quale pagina hai aperto, e parte da cosa è stato misurato ciascun numero.

CifraDove compare
«99.9%+ Accuracy» (oltre il 99,9% di accuratezza)Badge della home page e un badge nella fascia della pagina per l'istruzione superiore
«99.98% accuracy» (accuratezza 99,98%)Frase di apertura della stessa fascia, 52 caratteri prima
«99.26% overall» (99,26% complessivo)Pangram vs. Turnitin, un post del 28 luglio 2026
Nessuna cifra di accuratezzaModel card di Pangram 4, del 29 luglio 2026, che riporta invece FPR e FNR per corpus
«1 in 10,000» (1 su 10.000)FAQ della home page, su «an aggregate of public datasets» (un aggregato di set di dati pubblici)
«roughly 1 in 24,000» (circa 1 su 24.000)Model card, su 1.000.000 di esempi inglesi di FineWeb
«approximately 1 in 25,000» (circa 1 su 25.000) per i saggi accademiciIl post del 28 luglio 2026
0,019% per «Academic Writing (English)» (scrittura accademica, inglese)Model card, su 62.971 elementi, sopra la propria cifra complessiva

Turnitin produce la versione più lieve di questo fenomeno dentro un solo file: il whitepaper dell'agosto 2024 dà il tasso di falsi positivi a livello di documento di AIW-2 come 0,5% nel testo e come 0,51% nella Tabella 1, sullo stesso insieme di 719.877 elaborati studenteschi precedenti al 2019.

La coppia che conta di più è quella dei due numeri che Turnitin pubblica entrambi con il nome di tasso di falsi positivi a livello di frase. Nel giugno 2023 il suo Chief Product Officer ha scritto:

«Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written.» (Il nostro tasso di falsi positivi a livello di frase è intorno al 4%. Questo significa che c'è il 4% di probabilità che una specifica frase evidenziata come scritta dall'IA sia in realtà scritta da un essere umano.)

Il whitepaper dell'agosto 2024 dà lo 0,33%, da uno stress test su elaborati presentati prima del 2019 di cui dice: «All papers in this dataset are human written.» (Tutti gli elaborati in questo set di dati sono scritti da esseri umani.)

La lettura allettante è che nel frattempo sia cambiato un modello. È cambiato, e non spiega lo scarto. Il whitepaper dice che AIW-1 è stato lanciato nell'aprile 2023 e che «In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model» (Nel dicembre 2023 Turnitin ha lanciato AIW-2, un modello aggiornato e migliorato per sostituire il modello AIW-1): il modello in funzione nel giugno 2023 era quindi AIW-1. Vai allora a cercare AIW-1 nella Tabella 2 dello stesso whitepaper: su quel medesimo insieme di 719.877 elaborati il suo tasso di falsi positivi a livello di frase è 0,42%, non 4%. Stesso modello, stessa etichetta, due numeri distanti di un ordine di grandezza. La storia della versione crolla.

Ciò che cambia è l'insieme su cui è calcolata ciascuna percentuale. Il 4% è condizionato a una frase che è già stata evidenziata: delle frasi segnalate dal rilevatore, quella quota può rivelarsi umana. Lo 0,42% e lo 0,33% scorrono su testi che sono interamente umani fin dall'inizio: di tutte quelle frasi, quella quota è stata segnalata. Rispondono a due domande diverse, e non c'è motivo perché finiscano vicine. Puoi leggere la definizione del 4% nella spiegazione di Turnitin del giugno 2023.

Niente di tutto questo è un fornitore colto in fallo, e niente di tutto questo è un numero diventato vecchio. È quello che succede quando una stessa espressione viene attaccata a più misurazioni diverse. Quindi, quando in una riunione ti viene citato un tasso, la domanda che ti porta da qualche parte è su quale insieme sia stato calcolato. Tutti i documenti presentati? Solo le frasi già evidenziate? Solo la prosa idonea? Una percentuale senza l'insieme a cui si riferisce non può essere verificata, e non può nemmeno essere contestata.

Quali test indipendenti esistono, e cosa non risolvono

Un solo studio con revisione paritaria e ad accesso aperto ha messo alla prova entrambi gli strumenti testa a testa. Who wrote this? Evaluating the reliability of AI detection tools in higher education, pubblicato sull'International Journal for Educational Integrity il 29 giugno 2026, ha costruito un insieme sintetico di 160 articoli accademici in inglese, quaranta per ciascuna delle quattro categorie, ognuno di almeno 4.000 parole.

Sull'insieme scritto da esseri umani il risultato vale per tutti e quattro gli strumenti testati: «all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers.» (tutti e quattro gli strumenti hanno classificato correttamente il 100% dei testi umani come «veri negativi» — ricevendo un punteggio tra 0 e 20%. Questo indica che nessuno dei rilevatori tende a segnalare erroneamente come generata dall'IA la scrittura umana in questa raccolta di articoli). Sull'insieme interamente generato dall'IA i due strumenti si separano. L'articolo riporta che «Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)» (Turnitin ha classificato il 100% degli articoli interamente generati dall'IA come falsi negativi — punteggi tra 0 e 20%) e che «Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified.» (Pangram è stato l'unico strumento a funzionare bene, con un'accuratezza rigorosa del 65% e un'accuratezza inclusiva del 97,5%, lasciando un solo caso classificato male).

Prima che qualcuno te lo citi nell'una o nell'altra direzione, gli autori fissano da sé i propri limiti: «the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category» (la portata della nostra ricerca era limitata a 160 articoli, quattro strumenti di rilevamento dell'IA e un modello GenAI — GPT-4o Deep Research — per la categoria interamente generata dall'IA), e i risultati sono «valid only for a specific snapshot in time» (validi solo per un'istantanea specifica nel tempo). La loro raccomandazione alle istituzioni è la frase da portarsi in una riunione: gli strumenti di rilevamento «should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy.» (non dovrebbero essere usati come unica prova in decisioni ad alto impatto, ma dovrebbero essere inseriti in una strategia di valutazione più ampia).

Una nota sulla formulazione, perché la versione modificata viaggia più lontano dell'originale. La frase conclusiva dell'articolo recita: «From the four AI detection tools studied here, at this moment only one produced satisfactory results.» (Dei quattro strumenti di rilevamento dell'IA studiati qui, in questo momento solo uno ha prodotto risultati soddisfacenti.) Il riassunto che Pangram fa dello studio la rende come «only [Pangram] produced satisfactory results» (solo [Pangram] ha prodotto risultati soddisfacenti), con la sostituzione tra parentesi quadre.

Altri due lavori vengono citati in questo confronto, ed entrambi hanno bisogno di una riserva. Un research brief del Becker Friedman Institute dell'Università di Chicago, datato 6 ottobre 2025, dice che «Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages» (Tra le opzioni commerciali, Pangram raggiunge tassi di falsi positivi e di falsi negativi essenzialmente nulli su passaggi da medi a lunghi). Non ha testato Turnitin: i quattro strumenti erano Pangram, Originality.ai, GPTZero e una baseline RoBERTa. Il suo corpus era di 1.992 passaggi in sei generi quotidiani, tra cui notizie, blog, recensioni di consumatori e curriculum, non elaborati studenteschi. C'è anche una connessione che vale la pena mettere sul tavolo, con entrambe le metà: uno dei due autori, Alex Imas, compare in una testimonianza firmata sulla home page di Pangram, e il working paper riporta sulla prima pagina una riga che dice «All authors declare that they have no financial or personal conflicts of interest related to this study.» (Tutti gli autori dichiarano di non avere conflitti di interesse finanziari o personali legati a questo studio.) L'articolo si scarica gratuitamente dall'istituto, a due clic dal brief. Pesa questo come ritieni che meriti; preferiamo che tu veda entrambi i fatti piuttosto che nessuno.

Il secondo è il test pratico di un reporter di TechCrunch nel luglio 2026, che ha prodotto due numeri da un solo articolo: «Pangram gave it a 13% AI assisted score» (Pangram gli ha dato un punteggio di assistenza IA del 13%), e «when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score.» (quando ho dato a Pangram quello stesso articolo per intero, come lo avevo scritto io, ha ricevuto un punteggio umano del 100%). La sessione di un giornalista non è un benchmark. È la documentazione di prima mano di come il modo in cui un testo viene presentato cambi il numero che torna indietro, che è esattamente la posizione in cui ti trovi quando due istituzioni elaborano due file diversi.

C'è poi il caso in cui i due non sono affatto confrontabili, perché solo uno dei due restituisce un numero. Lo stesso articolo con revisione paritaria nota sotto la sua figura principale che «Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score» (Turnitin considera incerti gli elaborati con un punteggio IA tra 0% e 20% e li contrassegna con un asterisco invece che con un punteggio numerico), e che di conseguenza «19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure.» (19 articoli interamente generati dall'IA, 7 ibridi, 6 umanizzati e 3 interamente umani sono stati codificati come mancanti nella figura). Sono 35 dei 160 articoli senza alcun numero Turnitin da contrapporre a qualunque cosa. Se il tuo risultato Turnitin è un asterisco, non stai difendendo un punteggio basso, non hai alcun punteggio, e cosa significa l'asterisco (*%) in un punteggio IA di Turnitin spiega la regola di visualizzazione che c'è dietro.

Cosa puoi fare quando i due risultati non concordano

Comincia procurandoti i report, perché da entrambi i lati dipendi da chi li ha eseguiti. Le FAQ di Turnitin dicono: «The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students.» (L'indicatore e il report di rilevamento della scrittura IA non sono visibili agli studenti. Tuttavia, con la funzione di download PDF, i docenti possono scaricare e condividere il report IA con gli studenti.) Il centro assistenza di Pangram dice che un risultato può essere condiviso come link e che chi lo riceve «will see the scan overview and segment details without having to create a Pangram account.» (vedrà la panoramica della scansione e i dettagli dei segmenti senza dover creare un account Pangram). Chiedili entrambi, e dal lato Pangram chiedi espressamente il link di condivisione invece di uno screenshot: la vista per segmenti mostra quali passaggi hanno prodotto la cifra, e lo screenshot di una percentuale non ti mostra niente con cui tu possa lavorare.

Non contare di correggere la situazione direttamente con Pangram. Il suo controllo per il feedback è legato all'account che ha eseguito la scansione: la pagina di assistenza dice di «Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account» (aprire il risultato su cui vuoi dare un feedback, dopo la scansione oppure dalla pagina History / All Checks nel tuo account), con un pollice su e un pollice giù sotto il risultato. Una scansione eseguita dal tuo professore non è nel tuo account.

Non abbiamo trovato nemmeno un percorso di ricorso pubblicato per la persona che riceve un risultato. Abbiamo letto il testo di tutte le 256 URL elencate nella sitemap di Pangram il 15 settembre 2026, 2.117.382 caratteri in totale, e cercato in ogni pagina. `appeal` («ricorso») compare in una sola, in un post sul blog che parla di pubblicità, nel senso di qualcosa di attraente. `dispute` («controversia») compare in due: la clausola arbitrale nei termini di servizio e un post di partnership sulle controversie di paternità. `grievance` («reclamo formale»), `contest` («impugnare»), `redress` («riparazione»), `ombuds` («difensore civico») e `request a review` («richiedere una revisione») non compaiono in nessuna delle 256. La stessa ricerca ha trovato `false positive` («falso positivo») in 162 di quelle pagine e `student` («studente») in 182, ed è così che sai che il contatore stava trovando corrispondenze invece di restituire silenziosamente zero per ogni query.

Un limite di questo conteggio, dato che è il tipo di affermazione che dovresti poter smentire se è sbagliata: una sitemap non è tutto il sito. La pagina che questo articolo cita più spesso, la model card di Pangram 4, restituisce 200 e non è elencata in quella sitemap. Leggi quindi il risultato come 256 pagine elencate senza alcun percorso di questo tipo, non come un'affermazione su tutte le pagine ospitate da Pangram. E leggilo in entrambe le direzioni: non significa che Pangram rifiuti le correzioni, e certamente non significa che il tuo istituto non abbia un procedimento. Significa che il fornitore non è l'indirizzo giusto.

Due organizzazioni che usano Pangram pubblicano un percorso proprio, ed è quello che vale la pena conoscere. Substack dice agli autori di «select Report detection error» (selezionare «Segnala errore di rilevamento») su un report di rilevamento IA, e documenta un controllo «Disable AI detection» (disattiva il rilevamento IA) sulle bozze. Wiki Education, che fa passare in Pangram le modifiche su Wikipedia dei propri partecipanti, dice ai docenti cosa c'è stato dietro la maggior parte degli errori che ha confermato: «If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen.» (Se uno studente salva una scaletta vuota — per esempio con solo brevi elenchi puntati o intestazioni di sezione vuote — o include una quantità significativa di testo non in prosa, come frammenti di frase o voci bibliografiche, questo può far scattare il rilevatore IA. Il testo non in prosa è un fattore comune nella maggior parte dei falsi positivi confermati che abbiamo visto.) Scrive anche che «not use Pangram as definitive proof that the text was AI generated» (non usa Pangram come prova definitiva che il testo sia stato generato dall'IA), ma «a way to flag which text needs additional human scrutiny for verifiability.» (un modo per segnalare quale testo richiede un ulteriore esame umano per verificarne l'attendibilità).

Questo punto sul testo non in prosa lo puoi verificare sul tuo stesso file, e la model card di Pangram lo conferma dal lato del fornitore. Il modello è pensato per testi «of at least 50 words, written primarily in complete sentences» (di almeno 50 parole, scritti principalmente in frasi complete), e la scheda elenca ciò che resta fuori da quel perimetro, tra cui «tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation» (indici, sezioni di bibliografia, scritti basati su modelli o automatizzati, istruzioni e manuali tecnici, e testi dominati dalla notazione matematica). Aggiunge che «human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document» (intestazioni, piè di pagina, istruzioni e altre formattazioni estranee scritte da esseri umani dovrebbero essere rimossi prima di controllare un documento), e che «Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts.» (il testo grezzo e i file .docx sono raccomandati rispetto ai PDF quando disponibili, perché l'analisi dei PDF può introdurre artefatti indesiderati). Due domande concrete, quindi, da fare a chi ha eseguito la scansione: era un PDF, e la bibliografia e le pagine preliminari sono passate insieme ad esso?

Alcune righe vale la pena citarle in una riunione proprio perché vengono dai fornitori e non da noi. La guida di Pangram per gli insegnanti dice: «we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures» (riteniamo che il rilevamento dell'IA sia un ottimo modo per segnalare i compiti, ma un risultato di rilevamento richiede ulteriori accertamenti prima di qualsiasi misura punitiva — la grafia è loro), e aggiunge che «A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong.» (Un tasso di falsi positivi diverso da zero significa che qualsiasi rilevamento positivo potrebbe essere reale, oppure potrebbe essere la situazione statisticamente anomala, una su diecimila, in cui Pangram sbaglia.) Le FAQ di Turnitin dicono: «Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies.» (Turnitin non stabilisce se vi sia stata una cattiva condotta; piuttosto fornisce dati ai docenti perché prendano una decisione informata sulla base delle loro politiche accademiche e istituzionali.)

La pagina di Pangram per gli insegnanti indirizza inoltre i docenti verso le prove del processo di scrittura, citando Google Docs: «select File -> Version history -> See version history to see a full history of their writing process.» (selezionare File -> Cronologia delle versioni -> Visualizza cronologia delle versioni per vedere la storia completa del loro processo di scrittura). Se hai quella documentazione, la conversazione si sposta via dalla domanda su quale percentuale abbia ragione, che è l'unica domanda che i numeri pubblicati non possono risolvere. Come conservare la cronologia delle versioni in Word, Google Docs e Overleaf tratta di dove ciascuno strumento la memorizza, e segnalato ingiustamente come IA: come fare ricorso e quali prove accetterà la tua università tratta il resto del procedimento.

Cosa significa questo per te

  • I due fornitori non riportano la stessa metrica. Il whitepaper di Turnitin dell'agosto 2024 dice che l'accuratezza non viene usata come metrica; Pangram mette in vetrina una cifra di accuratezza sulla home page e sulla pagina per l'istruzione superiore.
  • Le percentuali contano cose diverse. Quella di Turnitin copre solo la prosa idonea; le frazioni di Pangram sono ponderate per i caratteri sul testo analizzato e sommano a 1,0. L'obiettivo di Turnitin di restare sotto l'1% è inoltre condizionato ai documenti con oltre il 20% di scrittura IA: non esiste quindi alcuna somma che lo trasformi nell'1 su 10.000 di Pangram.
  • Chiedi su quale insieme è stata calcolata una percentuale, non quale versione l'ha prodotta. Turnitin pubblica due tassi a livello di frase: circa il 4% (giugno 2023) e lo 0,33% (whitepaper dell'agosto 2024). Un cambio di modello c'è stato davvero nel mezzo, nel dicembre 2023, e non spiega lo scarto: il whitepaper colloca il modello più vecchio allo 0,42% sul proprio corpus di prova, non al 4%. Ciò che li separa è l'insieme. Il 4% conta solo le frasi già evidenziate; lo 0,42% e lo 0,33% scorrono su testi interamente umani.
  • Stabilisci se il tuo numero è una quota o una confidenza prima di confrontarlo con qualunque cosa.
  • Un asterisco non è un punteggio basso. Nello studio con revisione paritaria, 35 dei 160 articoli non avevano alcun numero Turnitin.
  • Fai passare la tua contestazione da chi ha eseguito la scansione. Il controllo per il feedback di Pangram sta nell'account che ha effettuato la scansione, e nessuna delle 256 pagine elencate nella sua sitemap riporta un percorso di ricorso per la persona segnalata. Chiedi il report stesso, e il link di condivisione Pangram con la sua vista per segmenti.

Se hai in mano un report di Turnitin o iThenticate, puoi importare il report e lavorare sui passaggi che ha segnalato. I passaggi idonei possono essere rielaborati gratuitamente.

CONTINUA A LEGGERE