Come Turnitin gestisce le equazioni matematiche e i contenuti che non sono prosa
Chi studia matematica o ingegneria si chiede spesso se equazioni e formule incidano sul proprio punteggio IA. Le FAQ di Turnitin dicono che il modello analizza solo le frasi in prosa che rispettano i requisiti e che non rileva in modo affidabile i contenuti che non sono prosa. Dicono anche che Turnitin non sta lavorando al rilevamento del codice. Ecco cosa conta come testo idoneo e cosa no.
Team HumanPen
· 4 min di lettura
La risposta breve
Equazioni matematiche, formule e blocchi di codice non vengono analizzati dal rilevatore IA di Turnitin. Le FAQ affermano: «This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Questo testo idoneo comprende solo frasi in prosa, il che significa che analizziamo esclusivamente blocchi di testo scritti in frasi grammaticali standard e che non includiamo altri tipi di scrittura come elenchi, punti elenco — strutture brevi che non sono frasi — o altre strutture che non sono frasi.) Del modello si dice anche che «does not reliably detect AI-generated text in the form of non-prose, or code.» (non rileva in modo affidabile il testo generato dall'IA sotto forma di non-prosa o di codice.) E le FAQ aggiungono: «In addition, we are not pursuing ChatGPT code detection at this time.» (Inoltre, al momento non stiamo lavorando al rilevamento del codice di ChatGPT.) Questo significa che le tue equazioni e formule non incidono direttamente sul tuo punteggio IA. Il punteggio riflette soltanto le parti in prosa del tuo elaborato. Se il tuo lavoro è fatto soprattutto di equazioni con brevi frasi di spiegazione, il rilevatore IA ha a disposizione pochissimo testo da valutare, e questo rende il punteggio meno significativo.
Cosa conta come testo idoneo
Le FAQ definiscono che cosa esamina il modello:
«This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Questo testo idoneo comprende solo frasi in prosa, il che significa che analizziamo esclusivamente blocchi di testo scritti in frasi grammaticali standard e che non includiamo altri tipi di scrittura come elenchi, punti elenco — strutture brevi che non sono frasi — o altre strutture che non sono frasi.)
La frase successiva: «This means that a document containing several different writing types would result in a disparity between the percentage and the highlights.» (Questo significa che un documento che contiene diversi tipi di scrittura può dare luogo a una discrepanza tra la percentuale e le parti evidenziate.)
Per un elaborato di matematica o ingegneria questo significa che le equazioni in sé non vengono valutate. A finire sotto la lente del rilevamento IA sono solo le frasi in prosa che le circondano: le spiegazioni, le introduzioni, le discussioni. Se hai una pagina piena di equazioni con due frasi di spiegazione, sono proprio quelle due frasi a essere valutate. E se riscrivi il testo nasce la domanda speculare: cosa succede a citazioni, tabelle ed equazioni in uno strumento per umanizzare testi IA.
Il codice e i contenuti che non sono prosa
Le FAQ sono dirette sui contenuti non in prosa:
«The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures).» (Il modello non rileva in modo affidabile il testo generato dall'IA sotto forma di non-prosa o di codice, e non rileva nemmeno la scrittura breve o non convenzionale, come i punti elenco — strutture brevi che non sono frasi.)
Le FAQ affermano anche: «In addition, we are not pursuing ChatGPT code detection at this time.» (Inoltre, al momento non stiamo lavorando al rilevamento del codice di ChatGPT.)
Questo ha una conseguenza pratica per gli elaborati scientifici e tecnici. Se hai usato uno strumento di IA per generare codice o equazioni, il rilevatore IA non è progettato per accorgersene. Quello che valuta è la prosa che sta intorno, non il codice e non la matematica in sé.
Come funziona il meccanismo sulla prosa
Il modello di rilevamento elabora il testo idoneo suddividendolo in segmenti che si sovrappongono:
«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated.» (Quando un elaborato viene inviato a Turnitin, le frasi dell'invio vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia opera di un essere umano o generato dall'IA.)
I segmenti si sovrappongono, quindi una frase può ricevere più valori che poi vengono messi insieme. In un elaborato fitto di equazioni e povero di prosa, questo vantaggio della sovrapposizione si riduce, perché ci sono meno frasi in prosa da suddividere. Il risultato è un punteggio meno stabile: il modello ha meno dati su cui lavorare.
E le tabelle e i dati?
Una nota di rilascio dell'agosto 2023 descrive come il modello gestisce le tabelle:
«We are now able to process long-form prose text in tables.» (Ora siamo in grado di elaborare testi in prosa di una certa lunghezza all'interno delle tabelle.)
La frase successiva: «Resubmit to reprocess existing submissions that contain tables.» (Invia di nuovo l'elaborato per rielaborare gli invii già presenti che contengono tabelle.)
Questo significa che, se la tua tabella contiene frasi in prosa di una certa lunghezza, oggi quelle frasi vengono analizzate. I dati grezzi, i numeri e le etichette brevi nelle tabelle però non sono frasi in prosa e restano fuori dalla definizione di testo idoneo. Anche le bibliografie sono escluse: la stessa nota di rilascio dice «Bibliographies are now excluded when processing the AI writing report.» (Le bibliografie ora vengono escluse durante l'elaborazione del report di scrittura IA.) La frase successiva richiede di nuovo un nuovo invio per gli elaborati già consegnati, ed è per questo che un report più vecchio può ancora sembrare un caso in cui Turnitin ha segnalato i tuoi riferimenti.
Punteggio IA e punteggio di similarità sono due cose separate
Una fonte di confusione ricorrente è se il contenuto matematico segnalato nel controllo di similarità incida anche sul punteggio IA. Non è così. Le FAQ affermano:
«The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (Il punteggio di similarità e la percentuale di rilevamento della scrittura IA sono completamente indipendenti e non si influenzano a vicenda.)
Se le tue equazioni corrispondono a una fonte presente nel database di similarità, questo incide sul tuo punteggio di similarità, non su quello IA. Il rilevatore IA valuta solo la prosa, alla ricerca di schemi riconducibili all'IA, indipendentemente da ciò che trova il controllo di similarità. L'errore da evitare qui è leggere i due punteggi come se fossero la stessa cosa.
Che cosa significa per te
Per riassumere quello che abbiamo visto:
- Le equazioni e le formule matematiche non vengono analizzate dal rilevatore IA. Contano solo le frasi in prosa che rispettano i requisiti.
- Secondo le FAQ il modello non rileva in modo affidabile la non-prosa o il codice, e non sta lavorando al rilevamento del codice.
- Le tabelle con testi in prosa di una certa lunghezza oggi vengono elaborate, ma i dati grezzi e le etichette brevi no.
- Le bibliografie sono escluse dall'elaborazione del rilevamento IA.
- Il punteggio IA e il punteggio di similarità sono completamente indipendenti e non si influenzano a vicenda.
- Gli elaborati fitti di equazioni e poveri di prosa offrono al modello meno testo da valutare, e questo può rendere il punteggio meno stabile.
Se ricevi un report Turnitin su un elaborato scientifico o tecnico e vuoi intervenire sui passaggi in prosa segnalati, importa il report e lavoraci sopra. I passaggi che rispettano i requisiti possono essere rielaborati gratuitamente.
CONTINUA A LEGGERE
Non sei di madrelingua inglese e il tuo testo è stato segnalato come IA? Cosa dice la documentazione
4 min di lettura
Report TurnitinPerché introduzioni e conclusioni vengono segnalate come AI (e cosa fare)
4 min di lettura
Rilevatori AIPerché la scrittura creativa viene segnalata come AI da Turnitin
4 min di lettura