Por Que Instruções de Prompt Não Conseguem Reduzir seu Score de IA de Forma Confiável
Buscar por "instructions to lower AI rate" parte do pressuposto de que o prompt certo consegue mudar as estatísticas que o detector lê. Mas um prompt é processado por um modelo de IA, que produz texto com seus próprios padrões de probabilidade de palavras. O FAQ da Turnitin diz que consegue detectar texto modificado por parafraseadores e ferramentas bypasser. Esse mecanismo explica por que prompts sozinhos não são uma solução confiável.
Equipe HumanPen
· 4 min de leitura
A Resposta Curta
Um prompt é uma instrução de texto processada por um modelo de IA. Quando você pede para uma IA "reescrever isso para soar mais humano" ou "adicionar burstiness e perplexity", o modelo gera novo texto com base nessa instrução. O texto novo ainda tem padrões de probabilidade de palavras, e são esses padrões que o classificador da Turnitin lê. O detector não vê seu prompt. Ele só vê o output. Se o output vai ter score mais baixo depende se o perfil de probabilidade de palavras dele difere o bastante daquilo que o modelo aprendeu a associar com texto gerado por IA — e você não controla isso escrevendo uma instrução melhor. O modelo decide as escolhas de palavras, e são as escolhas de palavras do modelo que o detector foi treinado para reconhecer.
O Que o Detector Vê
O FAQ da Turnitin descreve o processo:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, frases da submissão são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, indicando a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificada dentro desses segmentos herda o score do segmento. Como os segmentos se sobrepõem, algumas frases podem ter múltiplos scores, que então são consolidados num único score. Esses scores de frase são ainda agregados e usados para calcular o score geral de escrita por IA do documento.)
O detector está lendo características estatísticas de sequências de palavras no seu texto. Ele não vê o prompt que você usou. Ele não sabe se o texto foi gerado, reescrito ou editado por um humano. Ele vê as sequências de palavras finais e as classifica.
Por Que "Ajustar Burstiness" Não É uma Alavanca
Um tipo comum de instrução manda a IA "aumentar burstiness" ou "variar perplexity". O FAQ da Turnitin diz:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Nosso modelo não é explicitamente programado para avaliar sinais específicos como 'burstiness', 'perplexity' ou outras métricas individuais às vezes mencionadas em discussões públicas.)
A frase seguinte: "Instead, it learns statistical patterns from our training data." (Em vez disso, ele aprende padrões estatísticos dos nossos dados de treinamento.)
E da mesma página: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nossos classificadores são treinados para detectar essas diferenças na probabilidade de palavras e são aptos nas sequências particulares de probabilidade de palavras de escritores humanos.)
O modelo não computa uma métrica chamada burstiness e checa contra um threshold. Então mandar uma IA "aumentar burstiness" é pedir para ela ajustar algo que o detector pode não estar medindo do jeito que você pensa. O que o detector mede são padrões de probabilidade de palavras aprendidos com dados de treinamento. Se uma IA gerando texto com "mais burstiness" realmente desloca esses padrões numa direção favorável não é algo que você consiga verificar lendo o output. O Turnitin usa perplexity e burstiness? é a versão mais longa dessa pergunta.
IA Reescrevendo IA Produz Texto Detectável
Tem um problema mais fundamental. Se você usa uma IA para reescrever texto que foi sinalizado como gerado por IA, está produzindo texto que foi modificado por uma ferramenta de IA. O FAQ da Turnitin diz:
"Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection." (Além disso, também consegue identificar instâncias onde texto gerado por IA pode ter sido modificado por ferramentas parafraseadoras ou bypasser de IA (também chamadas humanizers) para evitar detecção.)
O detector não está só procurando texto bruto gerado por IA. Ele também está procurando texto que passou por uma ferramenta parafraseadora ou bypasser. Quando você escreve um prompt mandando uma IA reescrever o output de outra IA, o resultado é funcionalmente um output de parafraseador. O detector é treinado para identificar esse tipo de texto. Esse desfecho tem seu próprio relato: Parafraseei texto de IA com outra IA e o Turnitin ainda sinalizou.
Quando a Reescrita Dá Errado
O FAQ da Turnitin também lista texto que é propenso a falsos positivos:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Às vezes falsos positivos (sinalizar incorretamente texto escrito por humano como gerado por IA) podem incluir conteúdo sem muita variação estrutural, texto que literalmente se repete, ou texto que foi parafraseado sem desenvolver novas ideias.)
A frase seguinte: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se nosso indicador mostra uma quantidade maior de escrita por IA em tal texto, aconselhamos você a levar isso em consideração ao olhar a porcentagem indicada.)
O terceiro item é o que importa notar. "Parafraseado sem desenvolver novas ideias" descreve o que acontece quando uma IA reescreve texto embaralhando palavras sem adicionar substância. O detector vê estrutura uniforme e padrões de palavras que se assemelham a paráfrase gerada por máquina. Então uma reescrita por IA que só muda o wording superficial enquanto preserva a mesma estrutura pode mover o texto mais perto do perfil de falso positivo, não mais longe. Os edits que realmente mudam as estatísticas é como se parece a alternativa feita à mão.
O Que Realmente Muda o Score
Para resumir o que cobrimos:
- Um prompt é processado por um modelo de IA, que produz texto com seus próprios padrões de probabilidade de palavras. O detector vê o output, não a instrução.
- O modelo não computa burstiness ou perplexity como métricas nomeadas, então mandar uma IA "ajustar" eles pode não afetar o que o detector lê.
- A Turnitin detecta ativamente texto modificado por ferramentas parafraseadoras e bypasser, que é o que IA-reescrevendo-IA produz.
- Reescrita que só embaralha palavras sem adicionar substância pode mover o texto mais perto do perfil de falso positivo.
- O que muda o score é mudar o perfil de probabilidade de palavras dos trechos sinalizados, não escrever um prompt melhor.
Se você tem um relatório do Turnitin mostrando quais trechos foram sinalizados, importe ele e trabalhe especificamente nesses trechos. Trechos elegíveis podem ser rodados de novo sem custo.
Continue lendo