Humbot vs Turnitin: o que a documentação realmente diz

Se você passar o mesmo texto pelo detector de IA da Humbot e pelo Turnitin, as pontuações quase sempre vão divergir. Isso é esperado. As duas ferramentas usam modelos diferentes, treinados com dados diferentes e com convenções próprias de pontuação. A seguir, o que a documentação do Turnitin diz sobre como o detector funciona e por que os resultados não coincidem.

Equipe HumanPen

· 5 min de leitura

Humbot e Turnitin são sistemas distintos

O detector de IA da Humbot e a detecção de escrita por IA do Turnitin foram criados por equipes diferentes, com modelos subjacentes diferentes. Cada um foi treinado com os seus próprios dados e classifica o texto do seu próprio jeito. Quando dois detectores usam modelos diferentes, eles produzem pontuações diferentes para o mesmo texto. Uma passagem que a Humbot marca como 70% de IA pode receber 25% no Turnitin, ou o contrário. Nenhum dos dois resultados está necessariamente errado. São estimativas de probabilidade feitas por modelos diferentes, treinados com conjuntos de dados diferentes.

Não existe uma pontuação universal de detecção de IA com a qual todas as ferramentas concordem — é isso que por que o mesmo texto tem pontuações diferentes em cada detector analisa em detalhe. Cada detector produz a sua própria estimativa. Tratar pontuações de ferramentas diferentes como se medissem a mesma coisa, na mesma escala, só gera confusão.

Não estamos afirmando qual das duas ferramentas é mais precisa. Estamos descrevendo o que a documentação do Turnitin diz sobre o próprio sistema e por que ele produz pontuações que não batem com as da Humbot.

Como funciona o processo de pontuação do Turnitin

O Turnitin documenta um processo específico para chegar à sua pontuação de escrita por IA:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, as frases da submissão são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificada dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter várias pontuações, que depois são consolidadas em uma única pontuação. Essas pontuações das frases são ainda agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)

O processo consiste em extrair as frases, dividi-las em unidades sobrepostas, pontuar cada segmento, consolidar as pontuações das frases e agregar tudo em uma porcentagem para o documento inteiro. Outros detectores, a Humbot inclusive, podem usar estratégias de segmentação diferentes, unidades de predição diferentes ou métodos de agregação diferentes. As duas ferramentas não vão gerar números iguais para o mesmo texto.

A documentação do Turnitin também deixa claro que a porcentagem de detecção de escrita por IA e a pontuação de Similarity são coisas separadas. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de Similarity e a porcentagem de detecção de escrita por IA são totalmente independentes e não influenciam uma à outra.) A pontuação de Similarity indica a porcentagem de texto correspondente encontrada no documento enviado, na comparação com o acervo abrangente de conteúdo do Turnitin para verificação de similaridade. Um documento pode ter similaridade alta e IA baixa, ou o inverso. Os dois números não se influenciam.

A taxa de falsos positivos declarada pelo Turnitin

O Turnitin publica uma meta específica de falsos positivos:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Buscamos maximizar a eficácia do nosso detector mantendo a nossa taxa de falsos positivos — identificar incorretamente um texto totalmente escrito por humanos como gerado por IA — abaixo de 1% em documentos com mais de 20% de escrita por IA.)

A documentação reformula isso assim: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Em outras palavras, podemos sinalizar como escrito por IA um documento escrito por humano a cada 100 documentos totalmente humanos.) Essa reformulação abandona a ressalva "mais de 20% de escrita por IA". A versão com o limite de 20% é mais precisa, e 20% de IA é alto demais? explica por que esse número é uma meta de engenharia do fornecedor, e não uma nota de corte.

Para validar essa meta, o Turnitin descreve o seu regime de testes: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Para reforçar o nosso regime de testes e diagnosticar tendências estatísticas de falsos positivos, antes de cada atualização ou lançamento de novo modelo, realizamos testes com mais de 700.000 trabalhos acadêmicos adicionais, escritos antes do lançamento do ChatGPT, a fim de validar ainda mais a nossa taxa de falsos positivos inferior a 1%.)

Isso é o que o Turnitin diz sobre o seu próprio sistema. O que significa uma taxa de 1% de falsos positivos coloca esse número ao lado do volume que uma universidade realmente submete. A Humbot pode ter metas de precisão diferentes, processos de validação diferentes, ou pode não publicar números comparáveis. Não podemos fazer uma comparação direta de precisão. Só podemos relatar o que consta na documentação do Turnitin.

O comportamento em documentos curtos

O tamanho do documento afeta a forma como o detector do Turnitin processa o texto. Em documentos curtos, o mecanismo de pontuação se comporta de outro modo. A documentação diz:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos, com apenas algumas centenas de palavras, a predição será basicamente "tudo ou nada", porque fazemos a predição com base em um único segmento, sem a oportunidade de sobreposição.)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que um texto que mistura conteúdo gerado por IA e conteúdo original pode ser sinalizado como inteiramente gerado por IA.)

O mecanismo de sobreposição que nivela as pontuações em documentos longos não entra em ação quando o texto é um único segmento. Algumas centenas de palavras misturando conteúdo humano e de IA podem resultar em 100% — uma das causas listadas em por que o Turnitin diz que o seu trabalho é 100% IA. É um comportamento estrutural em textos curtos.

Se a Humbot pontua o mesmo documento curto de forma diferente, é em parte porque as duas ferramentas não processam textos curtos do mesmo jeito.

Como as pontuações baixas são exibidas

O Turnitin omite as pontuações numéricas abaixo de 20%. A documentação diz:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar a possível ocorrência de falsos positivos, nenhuma pontuação ou destaque é atribuído a pontuações de detecção de IA na faixa de 1% a 19%. Quando é detectada IA abaixo do limite de 20% no relatório, isso passa a ser indicado com um asterisco (*%) e nenhuma porcentagem é atribuída.)

Um documento que o modelo do Turnitin estime em 8% de IA vai mostrar um asterisco no relatório, e não o número 8%. Nenhum destaque é aplicado ao texto. A lógica é evitar expor possíveis falsos positivos numa faixa de baixa confiança — o assunto é aprofundado em o que significa o asterisco (*%) na pontuação de IA do Turnitin.

A Humbot pode exibir pontuações nessa faixa como uma porcentagem completa. Outras ferramentas podem destacar o texto em qualquer nível acima de zero. O Turnitin omite deliberadamente tanto o número quanto os destaques abaixo de 20%. Essa convenção de pontuação faz com que as duas ferramentas apresentem resultados muito diferentes para o mesmo documento com pouca IA.

O que isso significa para você

Se você está comparando os resultados da Humbot e do Turnitin no mesmo documento, aqui vai o resumo:

  • Modelos separados, pontuações separadas. Humbot e Turnitin usam modelos de detecção diferentes. Não se espera que as pontuações coincidam.
  • O Turnitin pontua segmentando e agregando. As frases são extraídas, divididas em unidades sobrepostas, pontuadas, consolidadas e agregadas. A pontuação de IA e a pontuação de Similarity são totalmente independentes.
  • O Turnitin tem como meta menos de 1% de falsos positivos em documentos com mais de 20% de escrita por IA, meta validada com mais de 700.000 trabalhos acadêmicos adicionais escritos antes do ChatGPT.
  • Documentos curtos recebem pontuações tudo ou nada. Algumas centenas de palavras podem voltar como 0% ou 100%, mesmo sendo um texto misto.
  • Pontuações abaixo de 20% aparecem como um asterisco. Nenhuma porcentagem numérica ou destaque aparece na faixa de 1-19%.

As passagens que atendem aos critérios podem ser reprocessadas sem custo.

Continue lendo