Como ler um teste de humanizador de IA de terceiros

Um recurso que imprime suas entradas e saídas oferece evidência que você pode inspecionar. Parte do veredito pode ser reconstituída a partir da página e parte depende de material ou julgamento que a página não torna reproduzível. Distinguir essas partes é a habilidade útil.

Equipe HumanPen

· 10 min de leitura

A resposta curta

Leia um teste publicado duas vezes. A primeira passagem diz o que o revisor concluiu. A segunda pergunta quais conclusões você poderia tirar das evidências impressas na página. No artigo do Tom's Guide de agosto de 2026, uma constatação é diretamente verificável: uma ferramenta de reescrita transformou “pelo menos 15,000 anos atrás” em “séculos atrás”, e ambas as frases estão impressas. Os julgamentos sobre ritmo e naturalidade são diferentes. Você pode concordar com eles, mas o artigo não fornece nenhuma regra declarada para aplicar esse julgamento a outro arquivo.

O artigo é Testei humanizadores de IA populares — e eles pioraram muito minha escrita, de Amanda Caswell, publicado em 21 de agosto de 2026. Verifiquei a página em 28 de agosto de 2026. Cada citação atribuída ao artigo abaixo provém de seu artigo renderizado; citações na seção HumanPen são identificadas como texto de página de produto de primeira parte.

Uma coisa deve estar na mesa antes de qualquer outra. Vendemos uma ferramenta de reescrita de documentos, então temos interesse em como esta categoria é discutida. Mantenha esse interesse à vista. A contagem abaixo usa parágrafos impressos por outra publicação, o que significa que você pode refazê-la sem confiar em nós.

O que o teste realmente foi

O artigo imprime o suficiente de sua configuração para que um leitor inspecione um exemplo de antes e depois.

  • O texto-fonte foi gerado: o revisor “pediu ao ChatGPT que escrevesse um pequeno ensaio sobre a domesticação dos cães”, e a introdução desse ensaio está impressa na íntegra. Tem 65 palavras por uma simples divisão por espaços.
  • Esse parágrafo foi passado por ferramentas de reescrita, e três das versões devolvidas estão impressas na íntegra: o Humanizer do Grammarly, Rehumanize.io e Ace.ai.
  • Dois detectores são nomeados na página, GPTZero e Pangram, e um veredito é relatado: Pangram marcou a saída do Ace.ai como gerada por IA.
  • O artigo diz que “várias” ferramentas foram testadas e que o mesmo problema apareceu “com pontuações de referência e números de versão quando executei o teste com conteúdo mais técnico.” Essas execuções adicionais são descritas, mas não impressas.

O corpus visível é, portanto, quatro parágrafos: uma entrada e três saídas, todos sobre o mesmo tópico e todos em inglês. É um pequeno corpo de evidência, mas é inspecionável. A página não divulga quando as execuções ocorreram, quanto tempo levaram ou as configurações usadas.

Três constatações, e não são o mesmo tipo de coisa

O artigo relata três problemas, e eles se comportam de maneira completamente diferente assim que você tenta levá-los a qualquer lugar.

O que o artigo relataO que a página oferece para verificaçãoVocê pode reconstituir você mesmo?
“the rhythm became choppy and unnatural” (o ritmo ficou entrecortado e não natural)os quatro parágrafos, impressos na íntegraNão por uma regra fixa fornecida na página. Você pode ler todos os quatro e formar sua própria opinião, mas o artigo não publica uma regra de pontuação para aplicar esse julgamento a outro documento
“the tools changed facts or stripped away important context” (as ferramentas alteraram fatos ou removeram contexto importante)a frase de entrada e a frase de saída, ambas verbatimSim. Os dois textos contêm uma mudança factual diretamente verificável
“processing a draft through a humanizer actually increased its probability of being flagged” (processar um rascunho por um humanizador realmente aumentou sua probabilidade de ser sinalizado)uma frase, mais um veredito de detector nomeado em uma saídaParcialmente. O veredito único é declarado. As várias execuções por trás da frase não são impressas

Resultados de detectores estão fora do escopo deste artigo, e não vou construir nada sobre a terceira linha. Ela está incluída para marcar o limite da evidência: a página relata um veredito nomeado, enquanto as outras execuções por trás da frase mais ampla não são impressas. Essa frase não deveria ser transformada em uma taxa.

Reconstituindo a única constatação que você pode reconstituir

Aqui está minha regra, para que você possa discordar dela. Um token numeral é uma sequência máxima de dígitos com vírgulas internas opcionais, encontrada pelo padrão `\d[\d,]*`. O corpus são os quatro parágrafos conforme impressos naquela página e nada mais. Um numeral sobrevive se o token idêntico aparecer em algum lugar na saída correspondente. Não julguei significado; fiz correspondência de strings.

Entrada: “evidência genética e arqueológica sugere que os cães descendem de uma população antiga de lobos pelo menos 15,000 anos atrás.” · Saída do Rehumanize.io: “com base na genética e em descobertas antigas, parece que os cães vieram de um grupo antigo de lobos há séculos.” A própria linha do artigo: “Fomos de 15,000 anos para 'séculos.'”

O parágrafo de entrada contém dois tokens numéricos, `15,000` e `30,000`. Três saídas impressas oferecem seis chances para esses dois tokens voltarem, e cinco dos seis o fizeram. O que não voltou é `15,000` na saída do Rehumanize.io, que é o desvio que o artigo nomeia. As outras duas saídas devolveram ambos os tokens. Verificação de sensibilidade nos mesmos parágrafos extraídos: uma contagem de palavra inteira que ignora maiúsculas e minúsculas de `dogs` retorna duas correspondências em cada parágrafo, então a verificação estava lendo todos os quatro em vez de travar em um.

Agora a parte honesta sobre esse número. Seis é dois numerais vezes três saídas impressas, todos derivados da única entrada de 65 palavras mostrada na página. Isso verifica um exemplo nomeado relatado em um artigo com data de publicação. Não está nem perto de ser suficiente para uma taxa, um ranking ou uma expectativa sobre seu próprio arquivo. A linha para levar do artigo é a do próprio revisor: “você não pode confiar na saída sem verificá-la contra o original linha por linha. Qualquer tempo que a ferramenta possa economizar desaparece rapidamente.”

Por que esse tipo de erro sobrevive a uma revisão

“Séculos atrás” não é um erro de digitação. É gramatical, mas a alegação que faz não é a alegação na frase-fonte. Uma verificação ortográfica não compara essas alegações. Uma comparação exata de antes e depois faz isso.

A página não revela como nenhuma das três ferramentas funciona internamente, então não pode nos dizer por que essa mudança aconteceu. O que o par visível mostra é mais restrito: um valor específico tornou-se um rótulo de tempo amplo enquanto a frase permanecia gramatical. O revisor nomeia pontuações de referência e números de versão como mais dois exemplos e escreve que “detalhes como dados não são intercambiáveis da mesma forma que certas palavras.” Em um documento acadêmico, a mesma comparação pode abranger tamanhos de amostra, valores de p, doses, números de estatuto e seção, datas, as palavras dentro de aspas e o par autor-ano dentro de uma citação.

Neste exemplo, a maneira direta de capturar a mudança é comparar a frase devolvida com a fonte. Se você quiser um mapa mais amplo dos riscos, o que acontece com citações, tabelas e equações em um humanizador de IA aborda os elementos que precisam de verificações separadas. Se algo já voltou errado, Humanizador de IA arruinou meu trabalho? Restaurar citações e formatação aborda a ordem de recuperação.

O que um teste de recurso não pode dizer sobre seu documento

Um artigo de revista não é um benchmark e nunca disse que era, então nada disso é uma reclamação. É a lista que você deveria ter em mente antes de citar o artigo para alguém, incluindo para si mesmo.

  • Uma taxa. Um parágrafo, três saídas impressas. Não há denominador aqui que sustente “N% das ferramentas fazem isso.”
  • Como outra ferramenta se comporta. O antes e depois visível nomeia três produtos. Não pode estabelecer como um produto não mostrado na página se comporta.
  • O que acontece com um documento. Os quatro parágrafos impressos não contêm nota de rodapé, tabela numerada, referência cruzada ou lista de referências. O artigo menciona execuções adicionais de conteúdo técnico sem imprimi-las, então o corpus visível não pode responder a uma pergunta de camada de arquivo.
  • Quando as execuções visíveis ocorreram. 21 de agosto de 2026 é a data de publicação do artigo. A página não divulga as datas das execuções dos produtos, então não pode fixar as saídas àquele dia.
  • O que acontece no seu idioma. Todos os quatro parágrafos são em inglês.

O que ele oferece é evidência de uma publicação de terceiros em vez de uma página de produto: um antes e depois impresso com uma mudança factual visível. Isso é suficiente para construir uma verificação, não uma tabela de classificação. Para um método separado voltado a alegações de formato de documento e dados de teste baixáveis, consulte como verificar a alegação de um humanizador de IA de que {QO}preserva sua formatação{QC}.

Verifique você mesmo o exemplo publicado

Você pode reproduzir a contagem acima sem enviar texto a nenhuma ferramenta. Isso verifica o que o artigo imprime, não qualquer execução não impressa por trás de seu veredito mais amplo.

  1. Abra o artigo e localize os quatro parágrafos impressos: a entrada sobre domesticação de cães e as saídas do Grammarly, Rehumanize.io e Ace.ai.
  2. Extraia os tokens numéricos da fonte com a regra declarada, uma sequência máxima de dígitos com vírgulas internas opcionais. A entrada deve fornecer `15,000` e `30,000`.
  3. Verifique cada saída quanto a essas strings exatas. Registre presente ou ausente em uma grade de duas colunas. Isso cria seis células em vez de uma porcentagem.
  4. Mantenha alegações não impressas em uma coluna separada. As execuções de conteúdo técnico, configurações de produto, datas de execução e valores de detector são relatadas pelo artigo, mas não podem ser reconstruídas a partir dos parágrafos visíveis.

Sua grade deve conter cinco células presentes e uma célula ausente. Se não, compare as âncoras de parágrafo e a regra de token antes de tirar uma conclusão. Para testar um documento próprio, use um protocolo separado de nível de arquivo: como verificar a alegação de um humanizador de IA de que {QO}preserva sua formatação{QC} abrange uma amostra deliberadamente difícil, e como revisar um documento do Word humanizado antes da submissão abrange o arquivo devolvido.

Onde o limite é traçado

Desde que declarei o interesse no início, aqui está a parte de primeira parte, limitada ao que nossa própria página diz. O HumanPen recebe o arquivo em vez de uma caixa de texto, e o escopo é algo que você define antes que qualquer coisa seja executada: você pode adicionar passagens diretamente ou importar um relatório do Turnitin ou iThenticate, e a página afirma que um parágrafo é a menor unidade que o motor reescreve, de modo que uma seleção que cobre parte de um “is expanded to the full paragraph and shown that way for you to confirm. Everything else is left untouched.” (é expandida ao parágrafo completo e mostrada assim para você confirmar. Todo o resto é deixado intocado.) O objetivo declarado para o que está dentro do escopo é “preserve meaning, structure, terminology, citations, layout, and styles while rewriting only the necessary language.” (preservar significado, estrutura, terminologia, citações, layout e estilos ao reescrever apenas a linguagem necessária.) Resultados elegíveis podem continuar a reduzir a IA gratuitamente.

Isso é uma descrição de onde um limite se encontra, não uma alegação sobre o que volta dentro dele. Nossa própria FAQ encerra a resposta relevante com “Review complex documents after download,” (Revise documentos complexos após o download,) e eu não gostaria que essa linha fosse removida, porque este artigo inteiro é um argumento a favor dela.

Nada em um fluxo de trabalho remove o passo quatro acima. Um escopo menor significa uma lista mais curta de parágrafos para comparar, o que é uma economia real quando a alternativa é uma tese inteira. Não é um motivo para pular a comparação nos parágrafos que estavam no escopo.

Perguntas frequentes

Você verificou todo o teste do Tom's Guide? Não. Reconstituí o antes e depois visível e encontrei a mudança declarada de `15,000` para “séculos”. A página não imprime as outras execuções técnicas, configurações, datas ou valores de detector, então este artigo não audita essas partes do recurso.

Por que não simplesmente repetir o veredito geral do revisor como o seu? Porque a entrada visível é uma introdução de ensaio gerada de 65 palavras sem citações, tabela ou lista de referências, enquanto o artigo também menciona execuções técnicas que não imprime. Você pode verificar independentemente a mudança factual impressa. O veredito mais amplo permanece o relato do revisor sobre um conjunto maior e parcialmente não divulgado de execuções.

Isso significa que números são sempre alterados? Não. Cinco das seis devoluções numéricas na página voltaram intactas. O exemplo visível estabelece que esse tipo de mudança ocorreu uma vez e que uma comparação exata a captura. Não estabelece se uma leitura normal a capturaria, ou se o problema é comum ou raro.

Por onde começo se quiser testar meu próprio arquivo? Use o protocolo separado de preservação de formatação linkado acima. Ele já abrange a construção de uma amostra deliberadamente difícil e a comparação do artefato devolvido, enquanto esta página permanece na reconstrução da evidência impressa em um artigo publicado.

O que devo perguntar a um fornecedor depois de ler um teste como este? Peça um antes e depois construído a partir de material como o seu, depois separe o que o exemplo visivelmente prova do que o fornecedor diz sobre ele. Se uma contagem aparecer, pergunte o que foi contado, qual era o denominador e qual regra produziu o número.

Continue lendo