Non sei di madrelingua inglese e il tuo testo è stato segnalato come IA? Cosa dice la documentazione

Scrivere in una seconda lingua è già abbastanza impegnativo, senza contare le segnalazioni per IA. Secondo le FAQ di Turnitin i dati di addestramento includevano studenti di inglese come seconda lingua per ridurre i pregiudizi, ma non vengono forniti numeri. Il rilevatore continua a leggere schemi di probabilità delle parole. Alcuni schemi di scrittura accademica diffusi tra chi non è di madrelingua inglese possono sovrapporsi alle caratteristiche che favoriscono i falsi positivi.

Team HumanPen

· 4 min di lettura

La risposta breve

Chi non è di madrelingua inglese può ricevere una segnalazione per IA su un testo scritto interamente da una persona. Le FAQ di Turnitin affermano che i dati di addestramento del modello «took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries» (hanno tenuto conto di gruppi statisticamente sottorappresentati, come chi studia l'inglese come seconda lingua e chi usa l'inglese in paesi di lingua diversa) per ridurre i pregiudizi. È l'affermazione dell'azienda stessa e non è verificata in modo indipendente. Il rilevatore continua a funzionare classificando gli schemi di probabilità delle parole nel testo. La scrittura accademica formale insegnata a chi non è di madrelingua inglese, con la sua insistenza su modelli strutturati e transizioni standard, può produrre testi con scarsa varietà strutturale. Questa caratteristica compare nell'elenco che Turnitin stesso fa dei tipi di testo più esposti ai falsi positivi. Essere segnalati non significa quindi che il vostro inglese sia troppo buono o troppo meccanico. Significa che il profilo statistico del vostro testo si è sovrapposto agli schemi che il modello associa all'IA.

Cosa afferma Turnitin sulla varietà dei dati di addestramento

Le FAQ affrontano direttamente il tema dei pregiudizi:

"While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model." (Nella creazione del nostro set di dati campione abbiamo tenuto conto anche di gruppi statisticamente sottorappresentati, come chi studia l'inglese come seconda lingua, chi usa l'inglese in paesi di lingua diversa, gli studenti di college e università con popolazione studentesca eterogenea e le aree disciplinari meno comuni come antropologia, geologia, sociologia e altre, per ridurre i pregiudizi durante l'addestramento del modello.)

Questa è la descrizione che Turnitin dà della propria metodologia di addestramento. Quel che si afferma è che la scrittura in seconda lingua era rappresentata nei dati di addestramento. Quel che l'affermazione non contiene sono numeri, risultati di test o una validazione esterna delle prestazioni del modello sulla scrittura in seconda lingua. Le FAQ non pubblicano tassi di falsi positivi distinti tra madrelingua e non madrelingua. Si afferma quindi che siano stati usati dati vari, ma l'efficacia di questo sforzo non è misurabile in modo indipendente a partire dalla documentazione pubblica.

Come il rilevatore legge la scrittura in seconda lingua

Il processo di rilevamento è lo stesso per tutti i testi:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un elaborato viene inviato a Turnitin, le frasi del testo vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Il modello di rilevamento IA classifica ogni sezione e le assegna un valore compreso tra 0 e 1, che indica la probabilità che il testo sia opera umana o generato dall'IA. Ogni frase idonea all'interno di queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi unificati in uno solo. Questi punteggi delle frasi vengono ulteriormente aggregati e usati per calcolare il punteggio complessivo di scrittura IA del documento.)

Il rilevatore non conosce il vostro retroterra linguistico. Legge sequenze di parole e le classifica. Se i vostri schemi di scrittura, plasmati da un insegnamento formale dell'inglese, generano sequenze di probabilità che si sovrappongono a ciò che il modello ha imparato ad associare al testo generato dall'IA, il punteggio può essere più alto del previsto. Cosa misurano i rilevatori di IA oltre la perplexity e la variabilità dello stile spiega quali sono questi schemi.

La sovrapposizione con le caratteristiche dei falsi positivi

Le FAQ elencano i testi più esposti ai falsi positivi:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A volte i falsi positivi, cioè segnalare come generato dall'IA un testo scritto da una persona, possono riguardare contenuti con poca varietà strutturale, testi che si ripetono alla lettera o testi riformulati senza sviluppare idee nuove.)

La frase successiva: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se il nostro indicatore mostra una quantità maggiore di scrittura IA in questo tipo di testo, vi consigliamo di tenerne conto quando osservate la percentuale indicata.)

L'insegnamento dell'inglese a chi non è madrelingua insiste spesso su modelli accademici strutturati. Gli studenti imparano schemi di frase standard, transizioni formali e strutture di paragrafo uniformi. Il risultato è una scrittura con quel tipo di uniformità che le FAQ descrivono come esposta ai falsi positivi. La sovrapposizione non è intenzionale. È una conseguenza di come l'inglese accademico viene insegnato a chi non è madrelingua e di come il rilevatore caratterizza un testo. Se la risposta giusta sia scrivere in modo diverso è un'altra questione: dovresti cambiare il tuo modo di scrivere per evitare di essere segnalato.

Cosa fare se venite segnalati

Le FAQ affermano:

"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors." (Perciò dobbiamo sottolineare che la percentuale dell'indicatore di scrittura IA non deve essere usata come unico fondamento per prendere provvedimenti né come criterio di valutazione definitivo da parte dei docenti.)

Se il vostro testo scritto di vostra mano viene segnalato, avete elementi per aprire un confronto con il docente. Potete richiamare le descrizioni dei testi esposti ai falsi positivi presenti nelle FAQ, spiegare il vostro processo di scrittura e ricordare che il punteggio è un dato fra tanti. Potete anche richiamare l'affermazione sulla varietà dei dati di addestramento, ammettendo onestamente che non garantisce l'immunità dai falsi positivi. Segnalato, ma l'avete scritto voi spiega come costruire questo caso.

Cosa significa questo per voi

Per riassumere quanto abbiamo visto:

  • Turnitin afferma che i suoi dati di addestramento includevano studenti di seconda lingua, ma non fornisce numeri per verificarne l'efficacia.
  • Il rilevatore legge schemi di probabilità delle parole, a prescindere dal retroterra linguistico.
  • La scrittura accademica formale diffusa tra chi non è madrelingua può sovrapporsi alle caratteristiche che favoriscono i falsi positivi.
  • Le FAQ dicono che il punteggio non deve essere l'unico fondamento per prendere provvedimenti.
  • In caso di segnalazione, il vostro processo di scrittura e le stesse descrizioni dei falsi positivi contenute nelle FAQ vi danno elementi per discuterne.

Se avete un report di Turnitin che indica quali passaggi sono stati segnalati, importate il report e lavorate su quei passaggi specifici. I passaggi che soddisfano i requisiti possono essere rielaborati gratuitamente.

CONTINUA A LEGGERE