GPTZero vs Turnitin: por que as pontuações não coincidem e o que cada ferramenta realmente mede

Se você passar o mesmo texto pelo GPTZero e pelo Turnitin, as pontuações frequentemente não vão bater. Isso não significa que uma das ferramentas esteja com defeito. Detectores diferentes usam modelos diferentes, dados de treinamento diferentes e convenções de pontuação diferentes. Veja o que a documentação do Turnitin diz sobre como o detector funciona e por que comparações entre ferramentas não são confiáveis.

Equipe HumanPen

· 5 min de leitura

Detectores diferentes usam modelos diferentes

GPTZero e Turnitin são sistemas separados, desenvolvidos por equipes diferentes. Cada um tem seu próprio modelo subjacente, seus próprios dados de treinamento e sua própria abordagem para classificar texto. Quando dois detectores usam modelos diferentes, as saídas não vão coincidir no mesmo documento. Um texto que o GPTZero pontua como 60% IA pode receber 30% do Turnitin, ou vice-versa. Nenhuma das pontuações está necessariamente errada. São estimativas de probabilidade vindas de modelos diferentes, treinados com dados diferentes.

Não existe uma pontuação universal de detecção de IA na qual todas as ferramentas convergem — eis o cerne da questão em por que o mesmo texto recebe pontuações diferentes em cada detector. Cada ferramenta produz sua própria estimativa. Comparar pontuações entre ferramentas como se medissem a mesma coisa nas mesmas unidades gera confusão.

Não estamos afirmando que uma ferramenta é mais precisa que a outra. A documentação descreve como o detector do Turnitin funciona, e esse mecanismo difere do que outras ferramentas fazem.

Como o detector do Turnitin pontua um documento

A documentação do Turnitin descreve um processo específico para chegar a uma pontuação de escrita por IA no nível do documento:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um artigo é submetido ao Turnitin, frases do envio são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, indicando a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificada dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter múltiplas pontuações, que são então agrupadas em uma única pontuação. Essas pontuações por frase são ainda mais agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)

A pontuação é uma agregação de predições no nível do segmento. Os segmentos se sobrepõem e as pontuações das frases são agrupadas antes da agregação. Outros detectores podem segmentar texto de forma diferente, usar unidades de predição diferentes ou agregar pontuações de maneiras diferentes.

A documentação do Turnitin também esclarece que a porcentagem de detecção de escrita por IA e a pontuação de Similaridade são medições separadas. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de Similarity e a porcentagem de detecção de escrita por IA são completamente independentes e não se influenciam mutuamente.) A pontuação de Similarity indica a porcentagem de texto correspondente encontrado no documento submetido quando comparado à coleção abrangente de conteúdo do Turnitin para verificação de similaridade. Uma pontuação de similaridade alta não significa uma pontuação de IA alta, e vice-versa. Relatório de escrita por IA do Turnitin vs relatório de Similarity coloca os dois lado a lado.

A meta de falsos positivos do Turnitin

O Turnitin estabelece uma meta específica de falsos positivos em sua documentação:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nos esforçamos para maximizar a eficácia do nosso detector, mantendo nossa taxa de falsos positivos — identificar incorretamente texto totalmente escrito por humanos como gerado por IA — abaixo de 1% para documentos com mais de 20% de escrita por IA.)

A documentação então reformula assim: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Em outras palavras, podemos sinalizar um documento escrito por humanos como escrito por IA em um a cada 100 documentos totalmente escritos por humanos.) Essa reformulação omite o qualificador "mais de 20% de escrita por IA". A versão com o limiar de 20% é a declaração mais precisa.

Para validar essa taxa, o Turnitin descreve um processo de teste: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Para reforçar nosso framework de testes e diagnosticar tendências estatísticas de falsos positivos, antes de cada atualização ou lançamento de novo modelo, realizamos testes em mais de 700.000 artigos acadêmicos adicionais que foram escritos antes do lançamento do ChatGPT para validar ainda mais nossa taxa de falsos positivos inferior a 1%.)

Essa é a meta declarada do Turnitin e seu processo de validação. O que um por cento realmente custa na escala que uma universidade submete é trabalhado em o que uma taxa de falsos positivos de 1% significa. Outros detectores podem ter metas diferentes, métodos de validação diferentes ou podem não publicar figuras comparáveis. Não podemos fazer uma comparação direta de precisão entre ferramentas com base nessas informações. Podemos apenas relatar o que a documentação do Turnitin diz.

Documentos curtos se comportam de forma diferente

O comprimento do documento afeta como o detector do Turnitin se comporta. Para textos curtos, o mecanismo de pontuação pode produzir resultados extremos:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos, onde há apenas algumas centenas de palavras, a predição será principalmente 'tudo ou nada' porque estamos predizendo em um único segmento sem oportunidade de sobreposição.)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que algum texto que seja uma mistura de conteúdo gerado por IA e original pode ser sinalizado como inteiramente gerado por IA.)

O mecanismo de sobreposição que suaviza pontuações em documentos mais longos não funciona quando há apenas um segmento para predizer. Algumas centenas de palavras de texto misto humano e IA podem retornar como 100% IA, um dos caminhos abordados em por que o Turnitin diz que seu trabalho é 100% IA. Esta é uma limitação em entradas curtas, não um julgamento definitivo sobre a composição do texto.

Se o GPTZero pontuar um documento curto de forma diferente, o comportamento tudo-ou-nada é uma explicação. As duas ferramentas lidam com textos curtos de forma diferente porque suas arquiteturas de pontuação diferem.

A faixa do asterisco de 1-19%

O Turnitin não exibe uma pontuação numérica para resultados de detecção de IA entre 1% e 19%. A documentação afirma:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (Para evitar incidência potencial de falsos positivos, nenhuma pontuação ou destaques são atribuídos para pontuações de detecção de IA na faixa de 1% a 19%. Quando IA é detectada abaixo do limiar de 20% no relatório, agora é indicado com um asterisco (%) e nenhuma porcentagem é atribuída.)

Isso significa que, se o modelo do Turnitin estimar o conteúdo de IA em 12%, o relatório mostrará um asterisco em vez de um número. Nenhum destaque é aplicado também. O raciocínio é evitar expor falsos positivos potenciais em uma faixa de baixa confiança, explicado com mais detalhes em o que o asterisco (*%) significa numa pontuação de IA do Turnitin.

O GPTZero e outras ferramentas podem exibir pontuações nessa faixa de forma diferente. Algumas mostram uma porcentagem completa para qualquer resultado não zero. O Turnitin suprime o número abaixo de 20%. Essa é mais uma razão pela qual as pontuações não vão coincidir: uma ferramenta pode mostrar uma pontuação numérica onde a outra mostra apenas um asterisco.

O que isso significa para você

Se você está comparando pontuações do GPTZero e do Turnitin no mesmo documento, aqui está o que ter em mente:

  • Modelos diferentes, pontuações diferentes. GPTZero e Turnitin usam modelos de detecção separados, treinados com dados separados. Não se espera que suas pontuações coincidam.
  • O Turnitin pontua agregando segmentos. O texto é segmentado, pontuado por segmento e agregado. A pontuação de IA e a pontuação de Similarity são totalmente independentes.
  • O Turnitin tem como meta menos de 1% de falsos positivos para documentos com mais de 20% de escrita por IA, validado contra mais de 700.000 artigos acadêmicos adicionais escritos antes do lançamento do ChatGPT.
  • Documentos curtos recebem pontuações tudo-ou-nada. Algumas centenas de palavras podem produzir um resultado de 0% ou 100% mesmo quando o texto é misto.
  • Pontuações abaixo de 20% aparecem como asterisco. Nenhuma porcentagem numérica ou destaques aparece na faixa de 1-19%.

Trechos elegíveis podem ser reenviados sem custo.