Perché le istruzioni nel prompt non riescono ad abbassare in modo affidabile il tuo punteggio AI
Cercare "istruzioni per abbassare la percentuale AI" presuppone che il prompt giusto possa modificare le statistiche lette dal rilevatore. Ma un prompt viene elaborato da un modello AI, che produce testo con i propri schemi di probabilità lessicale. La FAQ di Turnitin afferma che può rilevare testo modificato da parafrasi e strumenti di elusione. Questo meccanismo spiega perché i soli prompt non sono una soluzione affidabile.
Team HumanPen
· 4 min di lettura
La risposta breve
Un prompt è un'istruzione testuale elaborata da un modello AI. Quando chiedi a un'IA di "riscrivere questo per farlo sembrare più umano" o "aggiungi burstiness e perplexity", il modello genera nuovo testo basato su quell'istruzione. Il nuovo testo presenta comunque schemi di probabilità lessicale, e sono proprio questi schemi che il classificatore di Turnitin analizza. Il rilevatore non vede il tuo prompt: vede solo l'output. Che il punteggio sia più basso dipende dal fatto che il profilo di probabilità lessicale dell'output si discosti sufficientemente da ciò che il modello ha imparato a riconoscere come testo generato da IA. Non puoi controllare questo aspetto scrivendo un'istruzione migliore, perché è il modello a decidere le scelte lessicali, e sono proprio queste scelte che il rilevatore è addestrato a identificare.
Cosa vede il rilevatore
La FAQ di Turnitin descrive il processo:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando un elaborato viene inviato a Turnitin, le frasi vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni segmento viene classificato dal modello di rilevamento AI e riceve un valore tra 0 e 1, che indica la probabilità che il testo sia stato generato da un umano o da un'IA. Ogni frase qualificante all'interno di questi segmenti eredita il punteggio del segmento. Poiché i segmenti si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi combinati in un unico valore. Questi punteggi a livello di frase vengono ulteriormente aggregati e utilizzati per calcolare il punteggio AI complessivo del documento.)
Il rilevatore analizza le caratteristiche statistiche delle sequenze lessicali nel tuo testo. Non vede il prompt che hai usato. Non sa se il testo è stato generato, riscritto o modificato da un umano. Vede le sequenze lessicali finali e le classifica.
Perché "aggiustare la burstiness" non funziona
Un tipo comune di istruzione chiede all'IA di "aumentare la burstiness" o "variare la perplexity". La FAQ di Turnitin afferma:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Il nostro modello non è programmato esplicitamente per valutare segnali specifici come 'burstiness', 'perplexity' o altre metriche individuali talvolta citate nelle discussioni pubbliche.)
Subito dopo: "Instead, it learns statistical patterns from our training data." (Al contrario, apprende pattern statistici dai nostri dati di addestramento.)
E dalla stessa pagina: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (I nostri classificatori sono addestrati a rilevare queste differenze nella probabilità lessicale e sono esperti nel riconoscere le sequenze di probabilità delle parole tipiche degli scrittori umani.)
Il modello non calcola una metrica chiamata burstiness per poi confrontarla con una soglia. Quindi chiedere a un'IA di "aumentare la burstiness" significa chiederle di regolare qualcosa che il rilevatore potrebbe non misurare nel modo in cui pensi. Ciò che il rilevatore misura sono i pattern di probabilità lessicale appresi dai dati di addestramento. Non puoi verificare semplicemente leggendo l'output se un testo generato con "più burstiness" produca effettivamente pattern favorevoli. Turnitin utilizza perplexity e burstiness è la versione più approfondita di questa domanda.
Un'IA che riscrive un'IA produce testo rilevabile
C'è un problema ancora più fondamentale. Se usi un'IA per riscrivere un testo già identificato come generato da IA, stai producendo testo modificato da uno strumento di intelligenza artificiale. La FAQ di Turnitin afferma:
"Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection." (Inoltre, può anche identificare casi in cui testo generato da IA potrebbe essere stato modificato da strumenti di parafrasi AI o di elusione (chiamati anche humanizer) per evadere il rilevamento.)
Il rilevatore non cerca solo testo grezzo generato da IA. Cerca anche testo che è stato elaborato tramite strumenti di parafrasi o elusione. Quando scrivi un prompt chiedendo a un'IA di riscrivere l'output di un'altra IA, il risultato è funzionalmente un output da parafraser. Il rilevatore è addestrato a identificare questo tipo di testo. Questo esito ha un suo approfondimento: Ho parafrasato un testo AI con un'altra AI e Turnitin l'ha comunque segnalato.
Quando la riscrittura va male
La FAQ di Turnitin elenca anche i tipi di testo soggetti a falsi positivi:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Talvolta i falsi positivi (segnalazione errata di testo scritto da umani come generato da IA) possono includere contenuti senza molta variazione strutturale, testo che si ripete letteralmente, o testo che è stato parafrasato senza sviluppare nuove idee.)
La frase successiva: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se il nostro indicatore mostra una quantità maggiore di scrittura AI in tali testi, ti consigliamo di tenerne conto quando esamini la percentuale indicata.)
Il terzo elemento è quello da notare. "Parafrasato senza sviluppare nuove idee" descrive esattamente ciò che accade quando un'IA riscrive un testo mescolando le parole senza aggiungere sostanza. Il rilevatore vede una struttura uniforme e schemi lessicali che ricordano la parafrasi automatica. Quindi una riscrittura AI che si limita a modificare la superficie del testo mantenendo la stessa struttura può avvicinare il testo al profilo dei falsi positivi, anziché allontanarlo. Le modifiche che cambiano davvero le statistiche mostra come appare l'alternativa fatta a mano.
Cosa cambia davvero il punteggio
Per riassumere quanto visto finora:
- Un prompt viene elaborato da un modello AI, che produce testo con i propri schemi di probabilità lessicale. Il rilevatore vede l'output, non l'istruzione.
- Il modello non calcola burstiness o perplexity come metriche denominate, quindi chiedere a un'IA di "regolarle" potrebbe non influire su ciò che il rilevatore legge.
- Turnitin rileva attivamente il testo modificato da strumenti di parafrasi e elusione, ovvero proprio ciò che produce la riscrittura AI su testo AI.
- Una riscrittura che si limita a mescolare parole senza aggiungere sostanza può avvicinare il testo al profilo dei falsi positivi.
- Ciò che cambia il punteggio è modificare il profilo di probabilità lessicale dei passaggi segnalati, non scrivere un prompt migliore.
Se hai un rapporto Turnitin che mostra quali passaggi sono stati segnalati, importalo e lavora specificamente su quei passaggi. I passaggi idonei possono essere rieseguiti gratuitamente.
CONTINUA A LEGGERE