O que acontece com citações, tabelas e equações num humanizador de IA?

Essa pergunta geralmente é feita como se o risco fosse a pontuação. Não é. A pontuação é calculada com base em frases de prosa e sua bibliografia não entra nisso. O risco é o arquivo que você entrega.

Equipe HumanPen

· 11 min de leitura

A resposta curta

O Turnitin exclui bibliografias ao processar o relatório de escrita com IA, e o relatório analisa apenas frases de prosa, então reescrever uma lista de referências não muda nada quanto ao número. Ainda pode custar as próprias referências. Marcadores se deslocam quando frases são mescladas ou divididas, campos do gerenciador de referências viram texto morto, e uma análise gravada mostra uma ferramenta que reescreveu a lista de referências e produziu uma citação que não estava na entrada.

Tudo o que vem a seguir trata dessa segunda frase, porque é a que ninguém precifica.

Duas coisas diferentes estão sendo chamadas pelo mesmo nome

Existem dois tipos de ferramentas de reescrita e elas falham de maneiras diferentes.

A primeira usa uma caixa de texto. Você cola, ela reescreve, você cola de volta. A ferramenta nunca vê seu documento, então qualquer questão sobre tabelas e campos é na verdade sobre o que você fez antes e depois de colar. Seja qual for a estrutura no arquivo, você a removeu manualmente e está prestes a recolocá-la manualmente.

A segunda recebe o arquivo. Ela abre o documento, localiza os trechos de texto dentro dele, reescreve alguns e salva o documento de volta. Esse tipo de ferramenta pode preservar a estrutura, mas também pode romper a estrutura em uma escala que você jamais conseguiria manualmente, porque processa todos os parágrafos de uma vez.

Nenhum dos dois tipos é seguro por padrão. O que determina o resultado é o escopo: quanto do documento entra na reescrita e se você conseguiu ver essa fronteira antes de acontecer.

Os marcadores de citação se movem porque as frases se movem

Vale a pena ler uma vez a descrição que o próprio Turnitin faz do mecanismo de detecção, porque explica por que nada das suas citações está protegido do lado do detector. Submissões são cortadas em segmentos sobrepostos; cada segmento recebe uma pontuação entre 0 e 1; uma frase qualificativa assume os valores de todos os segmentos que a cobrem; esses valores são agrupados e agregados no número do relatório (AI writing detection FAQs). Não há nenhum passo nessa sequência que reconheça uma citação.

A mesma cegueira opera na direção oposta em uma ferramenta de reescrita. Para um modelo que reescreve prosa, `(Smith, 2019)` é apenas uma sequência de caracteres dentro de uma frase, sem nada que a marque como estrutural. Junte duas frases e o marcador fica abandonado atrás de uma afirmação que a fonte nunca fez. Divida uma frase e metade mantém o marcador enquanto a outra vira uma declaração sem suporte que parece perfeita.

Essa falha é invisível numa revisão, porque nada está agramatical nem faltando. A frase se sustenta sozinha. Só que não diz mais o que a fonte disse. Já explicamos como auditar esse vínculo afirmação por afirmação em revisar uma revisão de literatura sem quebrar a cadeia de evidências.

A segunda falha é mecânica, não semântica. Se suas citações vieram do Zotero, Mendeley ou EndNote, elas não são texto. São campos, e uma passada por texto puro as transforma em caracteres idênticos que não atualizam mais. campos do Word, sumários e referências cruzadas detalha o custo disso em documentos longos.

Uma ferramenta que reescreveu a lista de referências, filmada

Isso não é hipotético, e prefiro apontar para a gravação de outra pessoa do que fazer minha própria afirmação.

Tadhg Blommerde dá aulas na Northumbria University, tem acesso de instrutor ao Turnitin e afirma nas descrições de seus vídeos que eles são não patrocinados e sem links de afiliado.

O método dele num vídeo de fevereiro de 2025 review é o que torna o achado verificável. O ensaio de teste não é dele; ele pede ao ChatGPT que o produza — "1.500 palavras em inglês britânico", com "citações no texto e lista de referências no estilo APA" — então há uma entrada conhecida na tela antes de qualquer outra coisa tocar nisso. Esse arquivo passa pelo Walter Writes, e ele relata que "até humanizou a lista de referências". Ele também para numa citação na saída com a frase que importa: não estava na versão do ChatGPT.

É por isso que o segundo achado vale mais que o primeiro. Uma referência deturpada é um erro que você eventualmente notaria. Uma citação que ninguém escreveu é uma fonte fabricada sentada num documento que você está prestes a assinar, e a única razão pela qual alguém pode dizer que foi fabricada é que a entrada foi produzida no vídeo primeiro e pôde ser comparada com a saída linha por linha.

O que o benchmark público mediu, e o que não mediu

O único conjunto de dados aberto que encontrei sobre isso vem com um aviso anexado, e o aviso precisa acompanhar os números. O benchmark, HumanizerBench, é executado pela WriteHuman — uma das doze ferramentas no leaderboard que publica, e a ferramenta no topo no ciclo que vou citar. Isso não é algo que eu descobri; eles mesmos dizem na página sobre e de novo no rodapé de cada página do site. Independente, então, não é uma palavra que se aplica.

O que ele é, incomumente para esta categoria, é um benchmark que entrega os arquivos. Toda entrada e saída do ciclo de agosto de 2026 está num repositório público sob CC BY 4.0. É isso que o torna utilizável apesar de quem o executa: você pode discordar do resumo de alguém disso, este incluso, abrindo o mesmo arquivo e contando.

Então aqui está a parte que vale a pena contar, e a regra é tão simples quanto parece — um título em Markdown é uma linha que começa com um sustenido, e depois da reescrita está lá ou não está. Das doze ferramentas daquele ciclo, quatro retornaram saídas sem nenhum título restante, e três devolveram todos os títulos que as entradas tinham. "Essas ferramentas destroem sua formatação" é algo confortável de acreditar, e os arquivos publicados não sustentam isso. O intervalo dentro desta categoria é toda a extensão.

Depois há o limite da medição, que importa mais que qualquer porcentagem. O que está sendo contado é um caractere de sustenido no início de uma linha de texto puro. Toda ferramenta naquele conjunto de dados é colar-entrada, colar-saída; nenhum `.docx` circula. Estilos, definições de numeração, objetos de tabela, partes de nota de rodapé, indicadores de referência cruzada e campos de sumário vivem numa camada diferente, e não encontrei conjunto de dados público que chegue perto dessa camada.

O que contamos na camada DOCX

Então contamos nós mesmos, na nossa própria saída. Somos nós medindo nós — três pares de antes-e-depois das nossas execuções, lidos com um script que abre `word/document.xml` em vez de confiar no que o produto relata sobre si mesmo. Pegue o maior dos três: 405 parágrafos não vazios, 46 parágrafos carregando estilo de título, uma tabela de 7 linhas e 14 células. Depois, todas as três contagens eram idênticas.

Duas qualificações, e a segunda é a importante.

Um título sobrevivendo como título não significa que sua redação sobreviveu. Desses 46 títulos, 18 voltaram com palavras diferentes sob a configuração balanceada, ainda ligados ao mesmo estilo. Ser reescrito e ser achatado em texto de corpo são eventos separados, e as contagens Markdown na seção anterior estão captando o segundo.

O limite maior é o que o corpus não continha. Nenhum campo de sumário, nenhuma referência cruzada, nenhuma nota de rodapé: zero `fldChar`, zero âncoras, nenhum `footnotes.xml` em lugar nenhum do pacote. Essas são as partes mais propensas a quebrar silenciosamente, já que nenhuma delas é armazenada ao lado das palavras a que pertencem; um marcador de nota de rodapé e a própria nota de rodapé estão em arquivos diferentes dentro do pacote, conectados apenas por um número. Então o escopo honesto dessa medição é parágrafos, estilos de título e uma tabela, em três documentos que escolhemos.

Você não pode reproduzir nossos números. Os arquivos não são nossos para publicar, e um número do corpus próprio de um fornecedor vale aproximadamente o que você esperaria. O que você pode reproduzir é o procedimento, no documento que realmente lhe interessa, numa tarde: copie o `.docx`, renomeie a cópia para `.zip`, abra `word/document.xml`, conte os elementos `<w:p>` não vazios, conte quantos deles carregam um estilo de parágrafo cujo nome começa com `Heading`, e procure no pacote por `fldChar` e por `footnotes.xml`. Faça isso antes e depois de qualquer ferramenta que esteja considerando, a nossa incluída, e o número que obtém é sobre sua tese em vez de sobre nossos três arquivos.

Qualquer pessoa que lhe diga que sua ferramenta preserva referências cruzadas, nós incluídos, deveria ser questionada sobre o que contou.

Tabelas estão dentro do escopo do detector

A página do modelo de detecção de escrita com IA do Turnitin traz notas de lançamento, e a entrada de 9 de agosto de 2023 diz que o modelo agora é capaz de processar texto em prosa de forma longa em tabelas. A mesma entrada acrescenta que submissões existentes contendo tabelas precisam ser reenviadas antes de serem reprocessadas.

Duas coisas se seguem. Prosa sentada numa célula de tabela pode carregar destaque de IA, então "está numa tabela, não conta" está desatualizado há três anos. E isso coloca tabelas dentro do escopo de uma ferramenta de reescrita também: se a célula conta para a pontuação, uma ferramenta a nível de arquivo tem razão para entrar lá, célula por célula.

Não medi o que diferentes ferramentas fazem dentro de uma célula, então trate o resto deste parágrafo como onde olhar em vez de como achados. Uma célula que continha dois parágrafos vale reabrir. O mesmo vale para uma linha que cresceu mais alta porque seu texto ficou mais longo. E numa tabela de resultados, a célula a verificar primeiro é a que contém um número com uma unidade escrita depois, já que esse é o conteúdo numa tabela que mais se assemelha a uma frase.

Equações, números e texto citado

Não tenho medição para oferecer sobre equações, e prefiro dizer isso do que preencher a lacuna com um parágrafo confiante. Nosso corpus não tinha nenhuma.

O que posso lhe dar é o limite que importa, e não é realmente sobre equações. É sobre qualquer coisa cujo valor é o valor. Uma frase citada precisa voltar com as mesmas palavras dentro das aspas ou não é mais uma citação. Um tamanho de amostra, um valor-p, um intervalo de confiança, uma unidade, uma data e um nome próprio todos precisam sobreviver caractere por caractere. Prosa pode se mover. Estes não podem.

O que você pode reformular em Métodos e Resultados, e o que deve permanecer exato organiza um artigo nessas duas colunas adequadamente.

Dez minutos de verificação, nesta ordem

  1. Abra o arquivo no Word, pressione Ctrl+A, depois F9. Campos que sobreviveram serão atualizados. Campos que foram achatados ficarão parados, e é assim que você os encontra.
  2. Conte suas entradas de referência antes e depois. Um número que mudou é o sinal mais alto possível, e leva dez segundos.
  3. Pesquise a saída por cada marcador no texto e verifique se a frase em que ele agora está ainda faz essa afirmação. Este é o lento. Também é o que pega suporte fabricado.
  4. Leia cada célula de tabela que contenha um número. Não a prosa ao redor. A célula.
  5. Compare o material entre aspas. Qualquer coisa entre aspas deve ser idêntico, byte por byte, à fonte.

A versão completa disso, com a configuração de versionamento de arquivos que o torna repetível, está em como revisar um documento do Word "humanizado" antes de enviar.

Onde traçamos a fronteira

O pressuposto por trás do HumanPen é que "o que foi tocado" deve ser uma resposta que você deu, não uma que você descobre no Word depois.

O mecanismo não reescreve nada menor que um parágrafo. Pare uma seleção no meio de um e o parágrafo inteiro é o que será reescrito, e você vê esse limite desenhado antes de qualquer coisa acontecer. Você pode definir o limite você mesmo, ou importar um relatório do Turnitin ou iThenticate e deixar que suas passagens sinalizadas o definam, caso em que apenas o texto sinalizado é reescrito. Os créditos são contados nas palavras realmente reescritas, então um trabalho escopado para quatro parágrafos é cobrado como quatro parágrafos em vez de como uma tese. Resultados elegíveis podem continuar baixando IA gratuitamente.

Nossa própria FAQ termina essa seção com "Revise documentos complexos após o download", e eu não removeria essa linha. Uma reescrita de um documento complexo é algo que você verifica. O que o escopo lhe dá é uma lista muito mais curta de coisas para verificar.

Perguntas frequentes

Um humanizador muda minha lista de referências? Depende inteiramente se a lista de referências estava no escopo. Nada sobre uma bibliografia ajuda sua pontuação de IA, porque as notas de lançamento do Turnitin dizem que bibliografias são excluídas quando o relatório de escrita com IA é processado, então não há razão para ela estar no escopo em primeiro lugar. Uma revisão gravada de uma ferramenta mostra uma lista de referências sendo reescrita mesmo assim.

Minhas citações no texto ainda corresponderão à minha bibliografia depois? Os marcadores normalmente sobrevivem como caracteres. O que quebra é a conexão entre o marcador e a afirmação, quando frases são mescladas ou divididas ao redor dele. Verifique a frase, não os parênteses.

Tabelas são reescritas? Podem ser, e o Turnitin analisa prosa de forma longa dentro de tabelas, então uma ferramenta tem razão para entrar. Células contendo números, unidades e rótulos curtos são as primeiras a inspecionar.

Por que meu sumário quebrou? Quase sempre porque o documento passou por uma etapa de texto puro. Um sumário é um campo, não texto; achatar o documento para uma string e o campo desaparece mesmo que as palavras ainda estejam na página.

Continue lendo