Reescrever só os parágrafos que um relatório do Turnitin sinalizou
Reescrita seletiva guiada por relatório é isso: você importa um AI Writing Report do Turnitin ou iThenticate, localiza no seu documento original as passagens que foram destacadas e reescreve somente os parágrafos que confirmar. O que não for confirmado fica como está. Existem ferramentas que fazem isso. Eu desenvolvo uma, o HumanPen. A maior parte do trabalho de engenharia está em descobrir a quais parágrafos o relatório se refere.
Equipe HumanPen
· 8 min de leitura
Por que reescrever o documento inteiro é o padrão errado
Eu desenvolvo o HumanPen, que faz exatamente isso que vou descrever, então esta não é uma análise imparcial. Mesmo assim, o mecanismo vale a pena ser explicado, inclusive se você preferir fazer tudo manualmente.
Uma ferramenta que reescreve tudo é barata de executar e cara de conferir.
O custo que realmente cai no seu colo é a verificação. E a verificação depende do que mudou, não do que estava errado. Onde houve reescrita, você precisa confirmar: os números se mantiveram, a terminologia continua coerente com o resto da seção, a citação no texto ainda está ligada à afirmação que sustenta, o "ver Tabela 2" ainda aponta para a Tabela 2, e nenhuma ressalva virou certeza do nada. O que me assusta é "associação" virar "causação", porque a frase continua perfeita no papel.
Num parágrafo que ninguém mexeu, você não confere nada.
Pegue o exemplo que usamos no nosso material de comparação: um artigo de 10.000 palavras com 2.800 palavras sinalizadas. Reescreva tudo e você relê 10.000 palavras para corrigir a mesma coisa. As outras 7.200 eram as que você não tinha motivo para questionar.
Um segundo custo aparece depois. Depois que uma reescrita completa mexe nos parágrafos que já estavam limpos, o próximo relatório não é mais comparável ao primeiro. Se algo novo for sinalizado, você não sabe dizer se já estava sinalizado antes, porque o texto por baixo não é mais o mesmo que o primeiro relatório analisou. A reescrita seletiva mantém o texto não sinalizado como controle.
Qual relatório importar: AI Writing, não Similarity
A documentação do Turnitin é clara: o indicador de escrita por IA e o índice de similaridade são independentes, e os destaques de AI writing não aparecem no Similarity Report (Using the AI Writing Report). Um Similarity Report destaca sobreposição com fontes existentes. Se você usar isso num fluxo guiado por relatório, vai trabalhar em passagens que ninguém classificou como escrita por IA. O HumanPen não lê um Similarity Report como se fosse um AI Writing Report.
Mais duas coisas que mudam como você lê o relatório:
- Abaixo de 20%, não tem número. O Turnitin mostra um asterisco em vez da porcentagem para pontuações entre 1 e 19, e atribui isso a uma taxa maior de falsos positivos nessa faixa. Então a porcentagem nem sempre está disponível. Os destaques, sim.
- A porcentagem não é uma fatia do documento inteiro. O Turnitin só analisa o que chama de "qualifying text", ou seja, prosa longa em frases gramaticais padrão. Listas, bullets e outras estruturas que não são frases ficam fora da análise. O próprio Turnitin diz que "a document containing several different writing types would result in a disparity between the percentage and the highlights". Então os destaques e a porcentagem nem sempre batem, e o quanto eles se afastam depende de quanto do seu documento não é prosa.
Os trechos destacados, não o número, são a parte do relatório em que você pode agir.
O que o mecanismo realmente exige
A reescrita é a parte fácil.
- Extrair os destaques de um documento que nunca foi feito para ser analisado. No Turnitin, só instrutores e administradores veem os indicadores de escrita por IA. Instrutores podem baixar um PDF do relatório para compartilhar com o aluno, então o que chega ao autor em geral é um PDF, não um feed de dados. E um relatório em PDF é uma renderização: a camada de texto são sequências de glifos dispostos em linhas, e o destaque é uma forma colorida desenhada por cima. Nada no arquivo diz "estes caracteres estão sinalizados". Recuperar isso significa cruzar a geometria dos destaques com a geometria da camada de texto e ler quais glifos caem dentro.
- Normalizar o que sai, porque não é o texto que você escreveu. Palavras quebram entre linhas com hífens que nunca estiveram no original. Ligaduras voltam como um glifo só onde você digitou duas letras. Apóstrofos retos voltam curvos. Cabeçalhos, números de página e rodapés se misturam ao fluxo extraído, então um parágrafo pode chegar com o nome do jornal embutido. Cada um desses detalhes derrota a correspondência exata de strings, e o único sintoma é um matcher que silenciosamente não retorna nada.
- Fazer o match de volta ao arquivo original com a mesma normalização dos dois lados. Você está comparando uma renderização com perda de um parágrafo contra o parágrafo em si, então isso é um fuzzy match por construção, e um fuzzy match é um que você tem que mostrar para alguém.
- Expandir o match para o parágrafo inteiro. Destaques não são obrigados a alinhar com parágrafos, e o caso que decide o design é justamente aquele em que não alinham: o trecho começa em algum lugar dentro do parágrafo e para no meio da frase. Se você reescrever só os caracteres destacados, metade do parágrafo volta num registro diferente da outra metade, e as frases ficam apoiadas em pronomes e termos definidos que foram introduzidos na parte que ninguém tocou. É por isso que o parágrafo é a menor unidade de reescrita. Um destaque parcial é expandido para o parágrafo completo, e essa lista expandida é o que o autor vê e é perguntado para confirmar.
- Reescrever no lugar, dentro do arquivo. Não extrair, reescrever, colar de volta. Cada parágrafo reescrito volta para onde estava, e um conjunto protegido é deixado em paz no caminho: marcadores de citação, entradas de referência, fórmulas, código, legendas, numeração de figuras, notas de rodapé, células de tabela, campos de cross-reference e o sumário.
Por que o escopo tem que ser mostrado antes de qualquer coisa rodar
O passo 3 é heurístico, e heurísticas às vezes erram.
Uma frase destacada que aparece duas vezes no documento, como acontece com boilerplate de métodos, pode dar match na instância errada. Um parágrafo que você editou depois de gerar o relatório pode não dar match nenhum. Uma legenda ou célula de tabela pode parecer prosa de corpo. Se a ferramenta age num match ruim em silêncio, ela reescreve um parágrafo que o relatório nunca sinalizou e você nunca fica sabendo, que é exatamente a coisa que esta abordagem existe para evitar.
Então os parágrafos com match são mostrados antes do job começar. Você adiciona à lista, corta dela, e qualquer coisa que não confirmou fica fora do escopo. Escopo também é preço, já que o billing segue as palavras realmente reescritas, então aquela tela é a estimativa também.
Reescrita de documento inteiro vs reescrita seletiva guiada por relatório
| Dimensão | Reescrita de documento inteiro | Reescrita seletiva guiada por relatório |
|---|---|---|
| O que decide o escopo | A ferramenta. Tudo está no escopo por padrão | Os destaques do relatório, depois sua confirmação |
| Palavras que você tem que re-verificar | Todas elas | Só os parágrafos sinalizados |
| Texto não sinalizado | Também reescrito | Deixado em paz a menos que você adicione ao escopo, então permanece utilizável como baseline para o próximo relatório |
| Input que você precisa | O documento | O documento mais o PDF do AI Writing Report |
| Menor unidade alterada | Varia por ferramenta | O parágrafo |
| Falha quando | Você não pode pagar para re-verificar o texto que ninguém sinalizou, ou queria que o próximo relatório permanecesse comparável a este | O relatório está desatualizado em relação ao arquivo, ou o arquivo não é a versão que foi submetida |
Report-guided só faz sentido quando você realmente tem um relatório. Sem um, processar o documento inteiro ou escolher as passagens você mesmo é a resposta honesta, e o nosso faz ambos também.
Limites honestos
O output precisa de uma leitura humana. Reescrita automatizada produz detalhes que precisam de correção, e recusar-se a injetar erros deliberados de gramática ou ortografia não torna o resultado submission-ready por si só.
O matching roda contra o arquivo que você upload, então se você editou bastante desde que o relatório foi gerado, espere menos matches e um escopo proposto mais curto. Se o escopo que você vê parece mais fino que os destaques no seu relatório, essa é geralmente a razão.
Não tem comparação de detection-score em lugar nenhum deste texto, de propósito. O Turnitin diz claramente que não vai publicar os nomes das ferramentas de paráfrase e bypass que o detector cobre, porque uma lista pública ajudaria as pessoas a evadir (AI writing detection FAQs). O que significa que ninguém fora do Turnitin pode checar uma afirmação de "batemos o detector X", então eu não vou fazer uma. O Turnitin também diz que o indicador não deve ser a única base para ação contra um aluno, o que vale ter em mente quando um número volta mais alto do que você esperava.
Se um novo relatório ainda sinaliza passagens, resultados elegíveis podem continuar baixando AI de graça. Isso é suporte, não uma promessa sobre onde o número termina.
Perguntas frequentes
Tem uma ferramenta que reescreve só os parágrafos sinalizados num relatório do Turnitin? Tem. O HumanPen importa um AI Writing Report do Turnitin ou iThenticate, faz o match das passagens destacadas de volta ao seu documento original, mostra os parágrafos com match e reescreve só os que você confirmar. O arquivo volta no mesmo formato em que entrou.
Dá para fazer isso manualmente? Dá, e para cinco ou seis parágrafos sinalizados é completamente razoável. Abra o relatório ao lado do documento, ache cada destaque, reescreva aquele parágrafo você mesmo, deixe o resto em paz. Você ganha o mesmo benefício de escopo. O que uma ferramenta te compra é o matching num PDF longo e não ter que remontar o arquivo depois.
Funciona com iThenticate assim como com Turnitin? Funciona. Ambos produzem um AI Writing Report e ambos são suportados. O que não é intercambiável é o Similarity Report, que mede outra coisa completamente diferente.
Como eu testaria se uma ferramenta realmente faz isso? Ache um destaque no seu relatório que começa no meio de uma frase. Mande o relatório para a ferramenta e olhe o escopo que ela propõe. Tem que conter aquele parágrafo inteiro, e não pode conter o parágrafo antes ou depois a menos que aqueles também tenham sido sinalizados. Uma ferramenta que propõe o fragmento destacado exato vai te entregar um parágrafo escrito por duas pessoas, e uma ferramenta que propõe a seção inteira não está realmente trabalhando a partir do relatório.
Continue lendo