Por que o uso de ferramentas de paráfrase faz sua porcentagem de IA no Turnitin subir?

Baixar a similaridade e baixar a detecção de IA são objetivos que puxam para lados opostos. As palavras que uma ferramenta de reescrita escolhe para evitar uma correspondência são justamente as mesmas palavras de alta frequência que geradores de IA usam, e o detector lê exatamente esse padrão de distribuição.

Equipe HumanPen

· 10 min de leitura

A resposta curta

Ferramentas de paráfrase são feitas para reduzir seu score de similaridade, e elas fazem isso trocando suas palavras por outras de significado equivalente. As palavras substitutas tendem a ser expressões de alta frequência, o tipo de linguagem que geradores de IA também usam como padrão. O detector do Turnitin lê padrões de probabilidade das palavras, e quando seu texto reescrito se aproxima mais dessa distribuição, a porcentagem de IA sobe. Isso não é um bug. É o mecanismo funcionando como foi projetado, só que visando um alvo diferente daquele que você tinha em mente.

O score de similaridade e a porcentagem de IA são, nas próprias palavras do Turnitin, "completely independent and do not influence each other" (completamente independentes e não se influenciam mutuamente). Eles medem coisas diferentes, são computados por processos diferentes, e nada que você faça em um garante ajuda no outro. Quando puxam para lados opostos, a ferramenta de paráfrase que você usou para consertar o primeiro pode te levar direto para o segundo.

Dois scores, dois alvos, um documento

O Turnitin afirma isso de forma explícita nas FAQs de detecção: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (O score de Similaridade e a porcentagem de detecção de escrita por IA são completamente independentes e não se influenciam mutuamente). O score de similaridade diz quanto do seu texto corresponde a outros textos no banco de dados. A porcentagem de IA diz quanto do seu texto parece ter sido escrito por máquina. Não são duas visões da mesma propriedade.

Uma ferramenta de paráfrase foi projetada para o primeiro alvo. Ela pega uma frase que corresponde a algo no banco de dados e a reescreve para que não corresponda mais. Isso reduz seu score de similaridade. Só que a ferramenta consegue isso substituindo suas escolhas originais de palavras por alternativas, e essas alternativas vêm das expressões mais comuns e mais prováveis para cada significado. Sua frase original pode ter sido peculiar. A substituição é, por design, o oposto de peculiar.

Já a porcentagem de IA é computada a partir de algo totalmente diferente. Rastreamos como esse cálculo funciona em o que os detectores de IA medem, e a versão resumida é que o detector corta seu texto em segmentos sobrepostos, dá uma pontuação de probabilidade para cada um e reúne tudo num número a nível de documento. As palavras que a ferramenta de paráfrase escolheu agora são as palavras sendo pontuadas. Se essas palavras se concentram na zona de alta probabilidade, o número sobe.

O que o detector realmente lê

Muita gente diz que o detector do Turnitin mede "perplexity" e "burstiness". Não é bem isso. A FAQ do Turnitin diz: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Nosso modelo não é programado explicitamente para avaliar sinais específicos como 'burstiness', 'perplexidade' ou outras métricas individuais às vezes referenciadas em discussões públicas). A frase seguinte no mesmo parágrafo diz: "Instead, it learns statistical patterns from our training data." (Em vez disso, ele aprende padrões estatísticos a partir dos nossos dados de treinamento).

Mas a mesma página de FAQ, em uma seção separada, diz isto: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nossos classificadores são treinados para detectar essas diferenças na probabilidade das palavras e são especializados nas sequências particulares de probabilidade de palavras de escritores humanos). Ou seja, o modelo não está computando um score de perplexidade e chamando assim. Ele está, nas próprias palavras dele, lendo probabilidade de palavras. A perplexidade é uma medida de probabilidade de palavras. A distinção importa porque a primeira citação, copiada sozinha, parece dizer que o detector ignora probabilidade de palavras por completo. Ele não ignora. Por que detectores discordam mostra como ferramentas diferentes chegam a números diferentes para o mesmo texto, e a modelagem de probabilidade de palavras é central nisso.

O que isso significa para paráfrase é direto. Sua frase original tinha um perfil de probabilidade de palavras moldado pelo seu próprio vocabulário, seus próprios hábitos, as coisas específicas que você leu antes de escrever. A versão parafraseada tem um perfil moldado pelo que a ferramenta selecionou, e a ferramenta seleciona a partir do centro da distribuição, não das bordas. O detector, que é treinado em probabilidade de palavras, vê a frase reescrita como mais próxima do modelo dele de saída de máquina. Não porque você usou IA, mas porque a pegada estatística de uma frase parafraseada se parece mais com uma.

O perfil exato que o Turnitin chama de falso positivo

É aqui que fica desconfortável. A FAQ do Turnitin lista os tipos de texto que tendem a produzir falsos positivos, e a descrição parece uma ficha técnica do que uma ferramenta de paráfrase produz:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Às vezes, falsos positivos — marcar incorretamente texto escrito por humano como gerado por IA — podem incluir conteúdo sem muita variação estrutural, texto que literalmente se repete, ou texto que foi parafraseado sem desenvolver novas ideias.)

A frase logo depois dessa é a que mais importa: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se nosso indicador mostrar uma quantidade maior de escrita por IA em tal texto, aconselhamos que você leve isso em consideração ao olhar a porcentagem indicada). O Turnitin está dizendo aos instrutores para desconsiderarem scores altos de IA em textos que se encaixam nessa descrição.

Uma ferramenta de paráfrase, por design, não desenvolve novas ideias. Ela pega suas ideias existentes e as reformula. Também tende a reduzir a variação estrutural, porque suaviza o estilo ao longo do documento em vez de introduzir novas formas de frase. A ferramenta não está tentando deixar seu texto mais variado. Está tentando deixar menos parecido com algo do banco de dados. Esses dois objetivos não se alinham, e o segundo empurra o texto exatamente para o perfil que o Turnitin diz ser propenso a falsos positivos.

Nos aprofundamos no que faz escrita polida acionar detectores, e o mecanismo ali é o mesmo que está em jogo aqui. Suavização é um sinal estatístico.

A direção para a qual o detector está inclinado

O Turnitin afirma que prefere deixar passar texto de IA do que marcar falsamente escrita humana. A FAQ diz: "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written." (Para manter essa taxa baixa de 1% de falsos positivos, há uma chance de que possamos deixar passar algum texto escrito por IA em um documento. Estamos confortáveis com isso, pois não queremos marcar incorretamente texto escrito por humano como escrito por IA.)

Essa inclinação é real, e é a razão pela qual um documento totalmente escrito por humano tem baixa probabilidade de ser sinalizado. Mas não protege texto parafraseado do jeito que as pessoas imaginam. A taxa de 1% de falsos positivos se aplica a texto que não corresponde ao perfil de falso positivo. Texto que corresponde ao perfil, o tipo que o próprio Turnitin descreve na citação acima, não é o texto contra o qual o número de 1% foi medido. O detector está inclinado para cautela em geral, mas as características que acionam os gatilhos são as mesmas que uma ferramenta de paráfrase instala.

Se seu texto foi parafraseado por uma ferramenta movida a IA, existe um caminho separado. O Turnitin diz que "can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection." (também pode identificar instâncias em que texto gerado por IA pode ter sido modificado por ferramentas parafraseadoras ou burladoras de IA (também chamadas de humanizadoras) para evadir detecção). Isso não é um falso positivo. É um positivo verdadeiro em um sinal diferente, e o detector tem uma capacidade nomeada para isso. Parafraseado com IA e mesmo assim sinalizado mostra o que acontece quando a ferramenta que você usou foi ela mesma um modelo de IA fazendo a reescrita.

Nem todas as ferramentas de paráfrase fazem a mesma coisa

Há uma diferença significativa entre um verificador de gramática que corrige sua ortografia e uma ferramenta generativa que reescreve suas frases. O Turnitin traça essa linha de forma explícita. Sobre o Grammarly, a FAQ diz: "Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector." (Com base em testes que conduzimos em documentos escritos por humanos sem conteúdo gerado por IA neles, na maioria dos casos, alterações feitas pelo Grammarly (gratuito e premium) e/ou outras ferramentas de verificação gramatical não foram sinalizadas como escritas por IA pelo nosso detector). O qualificador chave é "in most cases" (na maioria dos casos). A isenção não é absoluta.

E a FAQ continua: "Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector." (Atenção: isso exclui conteúdo gerado pelos recursos de IA generativa do Grammarly, incluindo geração de rascunhos, paráfrase, resumir e outros recursos. Conteúdo produzido usando esses recursos provavelmente será sinalizado como gerado por IA pelo nosso detector). Correções de soletração e pontuação são uma categoria. Paráfrase e reescrita são outra. É na segunda categoria que o score de IA sobe.

O Turnitin não publica uma lista de quais ferramentas de paráfrase e burladores foram treinadas e testadas. A FAQ diz: "However, to safeguard the integrity of our solution and its effectiveness in maintaining academic honesty, we're unable to disclose the names of these tools." (No entanto, para salvaguardar a integridade de nossa solução e sua eficácia em manter a honestidade acadêmica, não podemos divulgar os nomes dessas ferramentas). Então ninguém fora do Turnitin pode dizer quais ferramentas específicas são detectadas e quais não são, e qualquer afirmação de que uma ferramenta nomeada "vence" o detector é uma afirmação que ninguém pode verificar contra os próprios testes do Turnitin. Não fazemos essa afirmação, e não recomendamos confiar em quem faz.

O que realmente reduz a porcentagem de IA

A porcentagem de IA desce quando o perfil de probabilidade de palavras do seu texto se afasta da distribuição que o detector associa com saída de máquina. Isso acontece quando você introduz vocabulário, estruturas de frase e ideias que um gerador não teria escolhido por conta própria. Paráfrase sem adicionar novas ideias faz o oposto. Move o perfil para o centro.

Se você já passou seu texto por uma ferramenta de paráfrase e o score de IA subiu, o caminho a seguir não é outra passada de paráfrase. Outra passada substitui um conjunto de palavras de alta frequência por outro conjunto de palavras de alta frequência. O perfil não se move. Você precisa reescrever os trechos sinalizados com suas próprias escolhas de palavras, suas próprias formas de frase e, idealmente, sua própria análise adicional ou exemplos. É isso que desloca a distribuição de probabilidade que o detector lê.

A versão prática disso, com o relatório na sua frente, está em como ler um relatório de escrita por IA do Turnitin. O relatório mostra quais segmentos estão sinalizados, e esses são os segmentos onde suas escolhas de palavras precisam deixar de ser a média e começar a ser suas.

Onde está a linha

O HumanPen é um reescritor de documentos, e a escolha de design relevante aqui é sobre o que é reescrito e o que não é. Você pode fazer upload do documento junto com seu relatório de escrita por IA, e apenas os trechos que o relatório sinalizou são reescritos. O resto do documento fica como você escreveu.

A razão pela qual isso importa para este artigo é que uma passada de paráfrase em documento completo é o pior cenário para o mecanismo descrito acima. Reescreve tudo, incluindo trechos que não foram sinalizados, e faz isso movendo todos eles para o centro de alta frequência. Uma reescrita segmentada toca apenas os segmentos que o detector já sinalizou, e faz isso com o objetivo de deslocar o perfil de probabilidade de palavras deles em vez de suavizá-los ainda mais.

A cobrança conta apenas as palavras realmente reescritas. Se um relatório posterior ainda sinalizar trechos, estes podem ser reprocessados sem custo adicional. Não dizemos o que o próximo relatório vai apontar, porque ninguém pode. Mas o mecanismo é o mecanismo, e uma reescrita segmentada trabalha com ele em vez de contra ele.

Perguntas frequentes

Paráfrase sempre aumenta o score de IA? Nem sempre, mas com frequência suficiente para que o padrão tenha um nome. O Turnitin lista "text that has been paraphrased without developing new ideas" (texto que foi parafraseado sem desenvolver novas ideias) entre os perfis propensos a falsos positivos. O que esse perfil aciona é se nova análise foi adicionada, não quais operações de edição produziram as frases. Texto que permanece dentro das mesmas ideias mantém um perfil de probabilidade de palavras que o detector foi treinado para associar com saída de IA. Se seu score específico sobe ou não depende de como seu texto original era e com o que a ferramenta o substituiu.

Usei o Grammarly para corrigir ortografia. Isso vai aumentar meu score de IA? O Turnitin diz que, na maioria dos casos, alterações feitas pelo Grammarly e outras ferramentas de verificação gramatical "were not flagged as AI-written by our detector" (não foram sinalizadas como escritas por IA pelo nosso detector). O qualificador "in most cases" (na maioria dos casos) está fazendo trabalho nessa frase. Se você usou os recursos generativos do Grammarly como paráfrase, resumo ou geração de rascunho, a FAQ diz que esse conteúdo "will likely be flagged as AI-generated" (provavelmente será sinalizado como gerado por IA).

Por que meu score de similaridade desce mas meu score de IA sobe? Porque medem coisas diferentes. O Turnitin diz que os dois scores são "completely independent and do not influence each other" (completamente independentes e não se influenciam mutuamente). Paráfrase reduz similaridade ao remover texto correspondente. As palavras substitutas podem aumentar o score de IA porque tendem a ser expressões de alta frequência, e o detector lê padrões de probabilidade de palavras que se sobrepõem aos de texto gerado por IA.

Posso só rodar a ferramenta de paráfrase de novo para consertar o score de IA? Rodar de novo substitui um conjunto de palavras comuns por outro conjunto de palavras comuns. O perfil de probabilidade de palavras não se move numa direção útil. O que desloca o perfil é reescrever os trechos sinalizados com seu próprio vocabulário, suas próprias estruturas de frase e suas próprias ideias adicionais.

O Turnitin detecta qual ferramenta de paráfrase eu usei? O Turnitin diz que foi "trained and tested to detect leading paraphraser and bypasser tools" (treinado e testado para detectar ferramentas líderes de paráfrase e burladores) mas não divulga quais. A FAQ diz que compartilhar uma lista "would make it easier for students to evade our system" (tornaria mais fácil para estudantes evadir nosso sistema). Ninguém fora do Turnitin pode verificar se uma ferramenta específica está nessa lista.