Como o Turnitin lida com equações matemáticas e com conteúdo que não é prosa

Quem estuda matemática ou engenharia costuma se perguntar se equações e fórmulas afetam a pontuação de IA. As perguntas frequentes do Turnitin dizem que o modelo analisa apenas frases de prosa elegível e que não detecta de forma confiável conteúdo que não seja prosa. Dizem também que o Turnitin não está trabalhando na detecção de código. Veja o que conta como texto elegível e o que não conta.

Equipe HumanPen

· 4 min de leitura

A resposta curta

Equações matemáticas, fórmulas e blocos de código não são analisados pelo detector de IA do Turnitin. As perguntas frequentes dizem: "This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto elegível inclui apenas frases de prosa, o que significa que analisamos somente blocos de texto escritos em frases gramaticais padrão e não incluímos outros tipos de escrita, como listas, marcadores — estruturas curtas que não são frases — ou outras estruturas que não são frases.) Sobre o modelo, dizem também que ele "does not reliably detect AI-generated text in the form of non-prose, or code." (não detecta de forma confiável texto gerado por IA na forma de não prosa ou de código.) E acrescentam: "In addition, we are not pursuing ChatGPT code detection at this time." (Além disso, neste momento não estamos trabalhando na detecção de código do ChatGPT.) Isso significa que as suas equações e fórmulas não entram diretamente na sua pontuação de IA. A pontuação reflete apenas as partes em prosa do seu documento. Se o seu trabalho é feito principalmente de equações com um texto explicativo curto, o detector de IA está avaliando muito pouco texto, e isso torna a pontuação menos significativa.

O que conta como texto elegível

As perguntas frequentes definem o que o modelo examina:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto elegível inclui apenas frases de prosa, o que significa que analisamos somente blocos de texto escritos em frases gramaticais padrão e não incluímos outros tipos de escrita, como listas, marcadores — estruturas curtas que não são frases — ou outras estruturas que não são frases.)

A frase seguinte: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Isso significa que um documento com vários tipos diferentes de escrita resultaria em uma discrepância entre a porcentagem e os trechos destacados.)

Para um trabalho de matemática ou engenharia, isso significa que as equações em si não são avaliadas. Só passam pela detecção de IA as frases de prosa em volta delas: as explicações, as introduções, as discussões. Se você tem uma página cheia de equações com duas frases de explicação, são exatamente essas duas frases que o detector avalia. E, na hora de reescrever, surge a pergunta espelhada: o que acontece com citações, tabelas e equações em um humanizador de IA.

Código e conteúdo que não é prosa

As perguntas frequentes são diretas sobre o conteúdo que não é prosa:

"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (O modelo não detecta de forma confiável texto gerado por IA na forma de não prosa ou de código, e também não detecta escrita curta ou fora do padrão, como marcadores — estruturas curtas que não são frases.)

As perguntas frequentes também afirmam: "In addition, we are not pursuing ChatGPT code detection at this time." (Além disso, neste momento não estamos trabalhando na detecção de código do ChatGPT.)

Isso tem uma consequência prática para trabalhos de ciências e engenharia. Se você usou uma ferramenta de IA para gerar código ou equações, o detector de IA não foi feito para pegar isso. O que ele avalia é a prosa ao redor, não o código nem a matemática em si.

Como o mecanismo funciona na prosa

O modelo de detecção processa o texto elegível dividindo-o em segmentos que se sobrepõem:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e divididas em seções sobrepostas para a análise de predição. Cada seção é classificada pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser humano ou gerado por IA.)

Os segmentos se sobrepõem, e por isso uma frase pode receber vários valores, que depois são combinados. Em um trabalho com muitas equações e pouca prosa, essa vantagem da sobreposição diminui, porque sobram menos frases de prosa para dividir. Com isso a pontuação fica menos estável: o modelo tem menos dados com que trabalhar.

E as tabelas e os dados?

Uma nota de versão de agosto de 2023 descreve como o modelo lida com tabelas:

"We are now able to process long-form prose text in tables." (Agora conseguimos processar texto de prosa longo dentro de tabelas.)

A frase seguinte: "Resubmit to reprocess existing submissions that contain tables." (Reenvie o trabalho para reprocessar os envios existentes que contêm tabelas.)

Isso significa que, se a sua tabela contém frases de prosa longas, essas frases hoje são analisadas. Mas dados brutos, números e rótulos curtos em tabelas não são frases de prosa e ficam fora da definição de texto elegível. As bibliografias também ficam de fora: a mesma nota de versão diz "Bibliographies are now excluded when processing the AI writing report." (As bibliografias agora são excluídas no processamento do relatório de escrita com IA.) A frase seguinte exige de novo um reenvio para os trabalhos já entregues, e é por isso que um relatório mais antigo ainda pode parecer um caso em que o Turnitin sinalizou as suas referências.

A pontuação de IA e a de similaridade são coisas separadas

Uma confusão comum é achar que o conteúdo matemático marcado na verificação de similaridade também afeta a pontuação de IA. Não afeta. As perguntas frequentes afirmam:

"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de similaridade e a porcentagem de detecção de escrita com IA são totalmente independentes e não se influenciam mutuamente.)

Se as suas equações coincidem com uma fonte da base de similaridade, isso afeta a sua pontuação de similaridade, não a de IA. O detector de IA examina apenas a prosa em busca de padrões de texto gerado por IA, independentemente do que a verificação de similaridade encontre. O erro que você deve evitar aqui é tratar as duas pontuações como se fossem a mesma coisa.

O que isso significa para você

Para resumir o que vimos até aqui:

  • Equações e fórmulas matemáticas não são analisadas pelo detector de IA. Só contam as frases de prosa elegível.
  • Segundo as perguntas frequentes, o modelo não detecta de forma confiável conteúdo que não seja prosa nem código, e não está trabalhando na detecção de código.
  • Tabelas com prosa longa hoje são processadas, mas dados brutos e rótulos curtos não.
  • As bibliografias ficam de fora do processamento da detecção de IA.
  • A pontuação de IA e a de similaridade são totalmente independentes e não se influenciam mutuamente.
  • Trabalhos com muitas equações e pouca prosa dão ao modelo menos texto para avaliar, o que pode deixar a pontuação menos estável.

Se você recebeu um relatório do Turnitin sobre um trabalho de ciências ou engenharia e quer resolver as passagens de prosa sinalizadas, importe o relatório e trabalhe nelas. As passagens que cumprem os requisitos podem ser processadas novamente sem custo.

Continue lendo