O Turnitin detecta copiar e colar?

A pergunta confunde dois relatórios diferentes. Vamos separar o que cada um realmente procura, por que um texto humano copiado gera correspondência de similaridade mas não um alerta de IA, e o que verificar se os dois resultados preocupam você.

Equipe HumanPen

· 9 min de leitura

A resposta curta

O Turnitin usa dois sistemas independentes. O Similarity Report detecta copiar e colar. Ele compara o texto que você envia com um banco de dados de conteúdo publicado, trabalhos de outros alunos e fontes da web, e sinaliza as sequências de texto correspondentes. Se você copiou de uma fonte que está no banco de dados, o Similarity Report vai mostrar isso. O AI Writing Report não detecta copiar e colar. Ele analisa padrões de probabilidade das palavras na prosa para estimar se um texto foi gerado por IA. Um texto humano copiado de um livro ou de um artigo não aciona o detector de IA, porque a escrita humana tem padrões de probabilidade diferentes dos do texto gerado por IA.

Esses dois resultados não se influenciam. Vamos ver como cada sistema funciona e o que isso significa se você colou texto de algum lugar.

Como o Similarity Report identifica texto copiado e colado

O Similarity Report é o que faz exatamente aquilo que a maioria das pessoas quer dizer quando pergunta se o Turnitin detecta copiar e colar. Ele pega o documento que você envia e compara com o acervo de conteúdo do Turnitin. Esse acervo inclui obras publicadas, páginas da web e outros trabalhos de alunos já enviados ao Turnitin antes, e contra o que seu manuscrito é comparado detalha isso. Quando o sistema encontra no seu documento uma sequência de texto que corresponde a uma sequência do banco de dados, ele destaca a correspondência e a conta na porcentagem de similaridade.

O mecanismo é a correspondência de sequências de texto. Se você colou um parágrafo de um site, uma frase de um livro digitalizado e indexado ou uma seção do trabalho de um amigo que já foi enviado antes, o Similarity Report vai encontrar a correspondência se a fonte estiver no banco de dados. O relatório mostra exatamente quais sequências corresponderam e de qual fonte vieram.

As perguntas frequentes sobre os recursos de detecção de escrita por IA do Turnitin afirmam essa separação diretamente:

"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de similaridade e a porcentagem de detecção de escrita por IA são completamente independentes e não se influenciam.)

A frase seguinte na mesma página é:

"The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking." (A pontuação de similaridade indica a porcentagem de texto correspondente encontrada no documento enviado quando comparado ao amplo acervo de conteúdo do Turnitin para verificação de similaridade.)

Essa segunda frase descreve exatamente o que o Similarity Report faz. Ele encontra texto correspondente. Ele não avalia se esse texto foi escrito por um humano ou por uma IA. Não importa quem o escreveu. O que importa é se a mesma sequência existe em algum lugar do banco de dados. É também por isso que texto citado e entre aspas continua aparecendo no Similarity Report mesmo quando você fez tudo certo.

Como o AI Writing Report funciona e por que ele não identifica copiar e colar

O AI Writing Report funciona com um princípio completamente diferente. Ele não compara seu texto com um banco de dados de sequências. Ele passa seu texto por um modelo que atribui pontuações de probabilidade a segmentos de prosa. As perguntas frequentes descrevem o mecanismo assim:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada seção é classificada pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase elegível dentro dessas seções herda a pontuação da seção. Como as seções se sobrepõem, algumas frases podem ter várias pontuações, que depois são reunidas em uma única pontuação. Essas pontuações por frase são ainda agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)

A expressão-chave é "the probability of the text being likely human or AI-generated." (a probabilidade de o texto ser provavelmente humano ou gerado por IA). O modelo observa como as palavras são escolhidas e sequenciadas. O texto gerado por IA tende a produzir palavras altamente previsíveis dado o contexto anterior, porque os modelos de linguagem escolhem os próximos tokens mais prováveis. A escrita humana tende a ser menos previsível nas escolhas de palavras. É essa diferença nos padrões de probabilidade que o modelo lê.

É por isso que texto humano copiado não aciona o detector de IA. Se você cola no seu trabalho um parágrafo de um livro publicado, esse parágrafo foi escrito por um humano. Seus padrões de probabilidade das palavras se parecem com escrita humana, não com texto gerado por IA. O modelo o classifica como humano. O AI Writing Report não o sinaliza.

O contrário também é verdadeiro. Se você gera um parágrafo com uma ferramenta de IA e o cola no seu trabalho, o AI Writing Report pode sinalizá-lo, porque os padrões de probabilidade daquele parágrafo se parecem com uma saída de IA. Mas o Similarity Report não vai sinalizá-lo, porque aquela sequência exata provavelmente não existe no banco de dados de conteúdo publicado do Turnitin. A IA gerou texto novo. Não copiou de uma fonte existente.

Essa é a distinção central. O Similarity Report identifica texto que já existe em outro lugar. O AI Writing Report identifica texto que parece ter sido gerado por máquina. Copiar e colar é um problema de similaridade. Geração por IA é um problema de probabilidade. O que entra nessa probabilidade é outra questão, e se o Turnitin usa perplexidade e variabilidade de estilo é a forma como a maioria das pessoas pergunta.

O que o modelo de IA realmente lê e o que ele ignora

Existe uma segunda camada no funcionamento do AI Writing Report, e ela importa nos casos de copiar e colar. O modelo não analisa tudo o que está no seu documento. As perguntas frequentes dizem:

"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (O modelo não detecta de forma confiável texto gerado por IA na forma de texto que não é prosa ou de código, e também não detecta escrita curta ou não convencional, como marcadores, ou seja, estruturas curtas que não são frases.)

A frase seguinte é:

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Isso significa que um documento com vários tipos diferentes de escrita resultaria em uma discrepância entre a porcentagem e os destaques.)

As perguntas frequentes também especificam o que é analisado:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Esse texto elegível inclui apenas frases em prosa, o que significa que analisamos apenas blocos de texto escritos em frases gramaticalmente padrão e não incluímos outros tipos de escrita como listas, marcadores, ou seja, estruturas curtas que não são frases, ou outras estruturas que não são frases.)

A frase seguinte é:

"This percentage is not necessarily the percentage of the entire submission." (Essa porcentagem não é necessariamente a porcentagem de todo o envio.)

Na prática, é o seguinte. Se você copiou e colou uma lista com marcadores, uma tabela de dados ou um bloco de código, o modelo de IA pode nem ler isso. Ele filtra o conteúdo que não é prosa antes de rodar a análise. O Similarity Report, ao contrário, lê tudo. Ele identifica uma lista colada ou um bloco de código colado com a mesma facilidade com que identifica um parágrafo colado, porque faz a correspondência de sequências no documento inteiro.

Então, quando você cola conteúdo que não é prosa de uma fonte, o resultado é assimétrico. O Similarity Report identifica. O AI Writing Report não, porque nunca vê esse conteúdo.

Por que texto humano copiado aparece em um relatório e não no outro

Juntando os dois mecanismos, explica-se o cenário mais comum sobre o qual os estudantes perguntam. Você encontrou um parágrafo em um site ou em um livro. Colou no seu trabalho. Está preocupado com o resultado de similaridade e com o de IA. É isto que acontece.

O Similarity Report vai sinalizar o parágrafo colado, desde que a fonte esteja no banco de dados. A sequência corresponde. A porcentagem sobe. A fonte é identificada. O relatório está fazendo o trabalho dele.

O AI Writing Report não vai sinalizar o parágrafo colado, desde que o texto original tenha sido escrito por um humano. O modelo lê o parágrafo como prosa, atribui pontuações de probabilidade aos seus segmentos e conclui que as escolhas de palavras parecem humanas. O parágrafo é classificado como escrito por um humano. Nenhum alerta de IA.

Isso vale mesmo que o texto colado seja longo. Para o modelo de IA não importa de onde o texto veio. Importa como o texto soa. Um parágrafo copiado de um artigo acadêmico dos anos 1990 tem os padrões de probabilidade das palavras da prosa acadêmica humana dos anos 1990. Não é assim que o texto gerado por IA se parece.

As perguntas frequentes tornam a independência explícita. O Turnitin diz: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de similaridade e a porcentagem de detecção de escrita por IA são completamente independentes e não se influenciam.) Um resultado alto de similaridade por causa de texto colado não puxa o resultado de IA para cima. Um resultado alto de IA por causa de texto gerado não puxa o resultado de similaridade para cima. Eles são calculados por sistemas diferentes que procuram coisas diferentes, e é por isso que os dois resultados não devem ser lidos como a mesma coisa.

O que isso significa se os dois resultados preocupam você

Se você colou texto de algum lugar e está com os dois relatórios na frente, é assim que deve lê-los.

Se o texto colado aparece no Similarity Report, isso é esperado. O sistema encontrou a correspondência. Você precisa parafrasear o texto com suas próprias palavras, colocá-lo entre aspas com uma citação ou removê-lo. Aspas com citação é o único caso em que texto colado é legítimo. O Turnitin ainda vai mostrar a correspondência, mas seu professor pode ver que ela está devidamente atribuída.

Se o texto colado foi escrito por um humano e você está verificando o AI Writing Report, não deveria ver um alerta nele. Se você vê, e o texto realmente vem de uma fonte humana, o alerta é um falso positivo. O modelo de IA é um estimador de probabilidades, não uma certeza. Ele pode classificar errado. Mas a explicação mais comum é que o texto colado não foi o que foi sinalizado. Leia o texto realmente destacado. Pode ser a sua própria escrita ao lado da seção colada, e não a seção colada em si.

Se você gerou texto com uma ferramenta de IA e o colou, a situação se inverte. O Similarity Report provavelmente não vai sinalizá-lo, porque a sequência é nova. O AI Writing Report pode sinalizá-lo, porque os padrões de probabilidade são os que o modelo foi treinado para reconhecer.

O que fazer

O resumo para quem pergunta se o Turnitin detecta copiar e colar:

  1. O Similarity Report detecta copiar e colar. Ele compara sequências de texto com um banco de dados. Se a fonte estiver no banco de dados, o texto colado aparecerá como correspondência.
  2. O AI Writing Report não detecta copiar e colar. Ele analisa padrões de probabilidade das palavras na prosa. Texto humano copiado soa como humano e não é sinalizado.
  3. Os dois resultados são independentes. Um resultado alto de similaridade não causa um resultado alto de IA, e vice-versa.
  4. Se você colou conteúdo que não é prosa, como listas, código ou tabelas, o Similarity Report pode identificar, mas o modelo de IA pode nem analisar, porque só lê frases em prosa.
  5. Se você colou texto gerado por IA, o AI Writing Report pode sinalizá-lo mesmo que o Similarity Report não o faça, porque a sequência é nova mas os padrões de probabilidade são reconhecíveis.

A distinção deixa de ser sutil quando você sabe o que cada sistema procura. A similaridade procura sequências que já existem. A detecção de IA procura padrões de probabilidade na prosa. Copiar e colar é um problema de sequências. Geração por IA é um problema de padrões.

Continue lendo