Overleaf, LaTeX e Turnitin: o que um PDF compilado pode mudar
O arquivo `.tex` e o PDF compilado a partir dele são objetos diferentes. Nosso caso de teste fixo mostra o quanto depende tanto do compilador quanto do extrator: as contagens de palavras mudaram, as quebras por hifenização mudaram, ligaduras apareceram para duas ferramentas e não para uma terceira, e uma frase visualmente intacta foi cortada por uma nota de rodapé, um número de página, uma tabela e uma figura.
Equipe HumanPen
· 11 min de leitura
Escrever em LaTeX muda o que um relatório de IA do Turnitin vê?
O Turnitin aceita PDF, mas isso não revela o que o extrator privado dele vê. Em nosso caso de teste reproduzível, mutool e PyMuPDF devolveram 694 palavras separadas por espaços cada um a partir de um mesmo arquivo pdfTeX de duas colunas; o pypdf devolveu 692. Tanto a compilação quanto o extrator moldaram o fluxo de texto. Isso é mensurável. Um efeito sobre a entrada ou a pontuação do Turnitin não é.
Essa fronteira é o artigo inteiro. O código-fonte, três PDFs, nove fluxos de extração brutos e o script de medição estão guardados com o pacote de evidências; a verificação de cinco minutos perto do fim é a versão para rodar no seu próprio artigo.
O que compilamos e com que lemos
Um único arquivo `.tex`: a classe padrão `article`, `twocolumn`, 10pt. Ele contém um resumo, quatro seções numeradas, matemática no corpo do texto e em destaque, uma lista `itemize`, um ambiente `algorithm` com linhas de pseudocódigo numeradas, um flutuante `table`, um flutuante `figure` com uma legenda escrita como frase completa, uma nota de rodapé longa o bastante para quebrar linha e duas chamadas `\cite` que resolvem para uma bibliografia numerada. As compilações em duas colunas produzem duas páginas; a versão de controle em uma coluna produz três.
Compilado com pdfTeX 3.141592653-2.6-1.40.26, TeX Live 2024. Lido com três extratores independentes: mutool 1.25.6, PyMuPDF 1.26.0 e pypdf 6.4.0.
Depois de reduzir cada sequência de espaços a um único espaço, mutool e PyMuPDF devolveram 694 palavras cada um a partir do PDF pdfTeX de duas colunas. O pypdf devolveu 692. Os três fluxos preservam a mesma ordem geral das seções, mas a diferença de duas palavras basta para rejeitar a afirmação cômoda de que extratores independentes veem um objeto idêntico.
A ordem de leitura em duas colunas se manteve
O aviso mais repetido sobre enviar um PDF de duas colunas é que o extrator lê reto atravessando as duas colunas e transforma seu artigo em um texto intercalado sem sentido. Aqui isso não aconteceu. A última frase do resumo, no pé da primeira coluna, chega imediatamente antes da primeira frase da Introdução, no topo da segunda coluna. A ordem está intacta no documento inteiro.
Um layout, uma classe, três extratores, uma máquina. É esse o tamanho da afirmação. A `.cls` de uma revista, com posicionamento incomum de flutuantes ou uma barra lateral, pode se comportar de outro modo, e é exatamente por isso que a verificação no fim deste artigo vale cinco minutos no seu arquivo real em vez do nosso.
Em vez disso, outra coisa quebrou, e é muito menos discutida.
Flutuantes, notas de rodapé e números de página cortando o meio das frases
Aqui está um trecho literal do fluxo do PyMuPDF, com os espaços normalizados e sem remover nada entre os pontos citados:
"…justification for treating a visually correct page as a reliable 1This footnote is deliberately long enough to wrap onto a second line so that its position in the extracted stream can be observed and compared with nearby prose. 1 Table 1: Primary outcome by condition. Condition Mean SD Control 12.4 3.1 Intervention 18.9 2.7 Figure 1: The framed area is a fixture rather than a reported empirical result. text stream…" (…justificativa para tratar uma página visualmente correta como um 1Esta nota de rodapé é deliberadamente longa o bastante para ocupar uma segunda linha, de modo que sua posição no fluxo extraído possa ser observada e comparada com a prosa ao redor. 1 Tabela 1: Desfecho primário por condição. Condição Média DP Controle 12.4 3.1 Intervenção 18.9 2.7 Figura 1: A área emoldurada é um artefato do teste, não um resultado empírico relatado. fluxo de texto…)
No código-fonte, `reliable text stream` é uma única expressão. Nesta extração, a nota de rodapé, um número de página solto, a legenda da tabela com suas células e a legenda da figura ficam todos entre `reliable` e `text stream`. O marcador de nota também se gruda à pontuação anterior em outro ponto, como `follows:1`.
O `1` solto nessa citação é o número da página. Juntando os fluxos das páginas, ele fica entre a nota de rodapé e a tabela, mesmo que nenhum leitor o perceba como parte de uma passagem ou de outra.
Nada disso é um dano visível no PDF. É o que este extrator local, citado pelo nome, devolveu, e mostra por que "a frase anterior" e "a frase seguinte" não são conceitos estáveis enquanto o método de extração não for conhecido.
De 22 quebras por hifenização a cinco
O LaTeX pode hifenizar palavras nas quebras de linha, e uma coluna estreita cria mais oportunidades. O PyMuPDF encontrou 22 tokens divididos na nossa compilação pdfTeX de duas colunas. Aqui estão seis deles:
Por exemplo: ex- poses · differ- ences · specifica- tions · observa- tions · justifica- tion · partici- pants
Depois compilamos o mesmo código-fonte em uma única coluna e mudamos apenas a opção de classe. O PyMuPDF devolveu 678 palavras normalizadas e cinco tokens divididos em vez de 22: `or- dinary`, `extrac- tion`, `jus- tification`, `partici- pants`, `par- ticular`.
Mesmo código-fonte, uma mudança de layout e um conjunto diferente de quebras. Este é um caso isolado, não uma regra para todo arquivo de classe, mas basta para justificar verificar o arquivo compilado em vez de supor que a tokenização da fonte sobreviveu.
O compilador que você escolheu mudou os caracteres
Compilamos o mesmo código-fonte uma terceira vez com XeLaTeX, com o mesmo layout de duas colunas e as mesmas palavras na página.
No build com pdfLaTeX, as três ferramentas não expuseram nenhum token contendo os codepoints de ligadura `ff`, `fi`, `fl`, `ffi` or `ffl`. In the XeLaTeX build, PyMuPDF and pypdf each exposed six: `affiliated`, `affiliation`, `difficult`, `efficiency`, `insufficient`, `office` (no build com XeLaTeX, PyMuPDF e pypdf expuseram seis cada um). O Mutool não expôs nenhum porque normalizou esses glifos de volta para letras comuns. Por isso, uma busca ingênua por `efficiency` acerta em um fluxo e falha em outro.
A equação mudou na direção oposta. No arquivo pdfTeX, o mutool devolveu um caractere de substituição Unicode para o sinal de somatório, enquanto PyMuPDF e pypdf devolveram um `X` maiúsculo. In the XeLaTeX file, all three exposed the actual `∑` (no arquivo XeLaTeX, as três expuseram o caractere real). Tanto o compilador quanto o extrator fizeram diferença.
As páginas do Turnitin citadas aqui não identificam o extrator nem descrevem essas transformações, e não estamos dizendo que nada disso altera uma pontuação. O que dizemos é algo mais estreito e verificável: a camada de texto é produto da compilação, e extratores diferentes podem expor caracteres diferentes a partir do mesmo PDF.
O que o Turnitin de fato diz sobre um artigo com esse formato
Quatro trechos da documentação do próprio fornecedor dizem respeito diretamente a um artigo com esse formato. Há mais naquelas páginas; estes são os quatro que tocam uma submissão em LaTeX.
O formato é aceito. Os requisitos de arquivo do Turnitin para um AI Writing Report listam `.docx, .pdf, .txt, .rtf`. Isso prova que um PDF pode ser processado; não diz nada sobre qual cadeia de extração é usada. O Turnitin detecta IA em um PDF examina a parte documentada dessa pergunta.
Só a prosa conta. As perguntas frequentes definem o que é analisado como texto elegível:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Esse texto elegível inclui apenas frases em prosa, ou seja: analisamos somente blocos de texto escritos em frases gramaticais padrão e que não incluem outros tipos de escrita, como listas, marcadores (estruturas curtas que não são frases) ou outras estruturas que não são frases.)
A frase seguinte é a que vale levar: "This percentage is not necessarily the percentage of the entire submission." (Esta porcentagem não é necessariamente a porcentagem de toda a submissão.) Seus marcadores de `itemize` e suas linhas de `algorithm` não são frases. Uma fileira de células de tabela também não. Como o Turnitin lida com equações matemáticas e conteúdo que não é prosa cobre o que isso significa para um artigo feito sobretudo de fórmulas. Note, porém, o que conta: uma legenda escrita com `\caption` como uma frase gramatical completa — e é assim que a maioria das pessoas escreve legendas — chega ao fluxo exatamente igual à prosa do corpo do texto.
Bibliografias ficam de fora. Uma nota de versão datada de 9 de agosto de 2023 diz que foi corrigido um bug que destacava escrita de IA dentro das referências e "Bibliographies are now excluded when processing the AI writing report" (as bibliografias agora são excluídas ao processar o relatório de escrita de IA), com a mesma nota acrescentando que as submissões existentes precisam ser reenviadas antes de isso valer para elas. O que o fornecedor não publica é como uma bibliografia é identificada dentro de um fluxo de texto achatado, e a nossa extração também não dá pista alguma: `References` chega como uma palavra comum, seguida de `[1] J. Smith, "A study of things," Journal of Testing, vol. 4, no. 2, pp. 100–110, 2019.`, sem nada marcando a fronteira. Não construa seu plano sobre nenhuma das duas leituras. O que as exclusões de referências realmente cobrem mostra o que é documentado e o que não é.
Artigos curtos se comportam de outro modo. Quando um documento cai para algumas centenas de palavras, a formulação do próprio fornecedor é que a previsão passa a ser "mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap" (basicamente "tudo ou nada", porque fazemos a previsão sobre um único segmento, sem oportunidade de sobreposição), e a frase seguinte acrescenta que conteúdo misto ali pode ser marcado como inteiramente gerado por IA. Um artigo de conferência de seis páginas que é metade equações pode não ter muito texto elegível. Documentos curtos e o problema do tudo ou nada tem o mecanismo.
Quando alguém lê, um comando de citação já é só um colchete e um dígito
`\cite{smith2019,jones2020}` chegou à extração como os quatro caracteres `[1, 2]`. `\ref{sec:method}` chegou como `2`. `\label` não deixou nada. Os títulos de seção chegaram com o número e o título separados, então `2 Method` fica no fluxo logo depois da frase anterior, e a referência cruzada anterior `Section 2 describes the method.` se lê como prosa contendo um dígito perdido.
O que significa que todo plano apoiado em formatação de citação está agindo sobre algo que não está lá. Não existe objeto de citação no texto extraído, só colchetes e dígitos, e a descrição publicada do cálculo pelo Turnitin não menciona uma citação em nenhuma etapa. Por que o Turnitin marcou minhas referências lista as edições específicas que disso decorrem e por que cada uma não tem nada sobre o que agir.
A verificação de cinco minutos, no seu artigo em vez do nosso
Você não precisa de nenhuma das ferramentas que usamos. Abra o PDF compilado em qualquer visualizador que tiver, selecione tudo e cole em um editor de texto simples. É mais um caminho de extração, não um substituto do Turnitin, mas pode revelar problemas na camada de texto que você está realmente enviando.
Leia procurando isto, nesta ordem:
- Palavras divididas. Procure um hífen seguido de quebra de linha. Cada ocorrência é uma palavra que deixou de ser uma só palavra.
- Onde seus flutuantes caíram. Localize a legenda de uma tabela e leia as duas frases em volta. Se a legenda e as células caíram dentro de um parágrafo, essa passa a ser a ordem de leitura daquele parágrafo.
- Suas legendas. Se uma legenda é uma frase gramatical completa, ela parece prosa, porque é prosa.
- A matemática. Leia uma equação em destaque no texto colado. O que você vê é o que um extrator obteve. Se faltam caracteres ou eles estão errados, isso é um fato sobre a incorporação das suas fontes, não sobre a sua álgebra.
- O começo da bibliografia. Veja se algo no texto puro marca onde a lista de referências começa. No nosso caso, nada marcava.
- Seu nome e sua afiliação. Eles também estão na camada de texto, o que importa se você estiver enviando para algum lugar que espera anonimato.
Se você mantém seu `.tex` no Git ou no Overleaf, faça isso uma vez por revisão grande, em vez de uma vez no fim. E quanto à questão separada de saber se o histórico de escrita no Overleaf vale algo como registro, onde fica o histórico de versões no Word, no Google Docs e no Overleaf traz as regras de retenção do plano gratuito e o que fazer a respeito, que são mais específicas do que a maioria das pessoas espera.
Se as frases precisarem mudar
Para um artigo em LaTeX a resposta é tediosa e correta: mude o código-fonte, recompile e nunca edite o PDF. A frase vive no arquivo `.tex`. Todo o resto é uma renderização dele.
A cadeia fica desconfortável quando termina em outro lugar que não um PDF. Um orientador pode querer controle de alterações, uma revista pode exigir um manuscrito em Word, ou alguém pode devolver um relatório de escrita de IA feito sobre o PDF compilado e perguntar quais passagens vão mudar. Agora você tem o mesmo artigo em dois formatos.
Para uma versão DOCX em inglês, A ferramenta HumanPen pode limitar uma reescrita às passagens que você selecionar ou às passagens correspondentes de um relatório do Turnitin ou do iThenticate. O Humanize é atualmente só em inglês; não aceita `.tex` nem um PDF compilado como fonte editável. Confirme o escopo em nível de parágrafo, mantenha o código-fonte LaTeX como mestre e revise o documento convertido depois do download. Passagens elegíveis podem ser reprocessadas sem custo.
Perguntas frequentes
Devo enviar o arquivo `.tex` em vez do PDF? Envie o que a tarefa ou a revista pedir. Um arquivo `.tex` é texto puro com marcação, e cada comando nele chegaria como caracteres literais, então ele não é uma versão mais limpa do seu artigo para leitor nenhum, humano ou não.
Minhas equações aumentam minha pontuação de IA? Elas não são frases em prosa, então pela própria definição do fornecedor estão fora do texto elegível. As frases explicativas em volta delas estão dentro. Em um artigo feito sobretudo de equações, isso significa que o número é calculado sobre uma fatia pequena das páginas.
O formato de duas colunas causa problemas por si mesmo? A ordem geral das seções se manteve neste caso. Sob o PyMuPDF, a compilação de duas colunas teve 22 quebras por hifenização e a de uma coluna teve 5. Esta é uma diferença medida para este arquivo de classe, não uma regra para todo template de revista.
Minha instituição quer um arquivo do Word e eu escrevo em LaTeX. Então você tem um passo de conversão, e é aí que numeração, referências cruzadas e campos de citação têm mais chance de quebrar. Converta uma vez, no fim, e verifique os tipos de objeto em vez de ler as duas primeiras páginas.
Posso usar o histórico do Overleaf para mostrar como o artigo foi escrito? É um registro, não um veredito, e no plano gratuito a maior parte dele desaparece depois de um dia, a menos que você rotule as versões. O artigo linkado acima cobre a regra exata e o hábito de rotular que resolve isso.
Continue lendo