Detector de IA do Scribbr contra o Turnitin: o que a documentação realmente diz

O Scribbr oferece um detector de IA gratuito que qualquer pessoa pode usar. A detecção de escrita por IA do Turnitin só está disponível para instituições que licenciam a ferramenta. Os dois usam modelos diferentes e vão gerar pontuações diferentes para o mesmo texto. Veja o que a documentação do Turnitin diz sobre o próprio sistema e por que os números não vão bater.

Equipe HumanPen

· 5 min de leitura

Scribbr e Turnitin são sistemas separados

O detector de IA do Scribbr é uma ferramenta gratuita, aberta a qualquer pessoa. A detecção de escrita por IA do Turnitin é exclusiva de instituições, e saber se a sua faculdade ativou o recurso é outra questão, tratada em as faculdades usam detectores de IA?. As duas ferramentas são criadas por equipes diferentes, com modelos diferentes. Cada uma foi treinada com os próprios dados e classifica o texto do seu próprio jeito. Quando dois detectores usam modelos diferentes, eles produzem pontuações diferentes para o mesmo texto. Uma passagem que o Scribbr marca como 65% de IA pode receber 30% no Turnitin, ou o contrário. Nenhum dos dois resultados está necessariamente errado. São estimativas de probabilidade feitas por modelos diferentes, treinados com conjuntos de dados diferentes.

Não existe uma pontuação universal de detecção de IA com a qual todas as ferramentas concordem, e os motivos estão explicados em por que o mesmo texto recebe uma pontuação diferente em cada detector. Cada detector produz a própria estimativa. Tratar as pontuações de ferramentas diferentes como se medissem a mesma coisa, nas mesmas unidades, só gera confusão.

Não estamos dizendo qual das duas ferramentas é mais precisa. Estamos descrevendo o que a documentação do Turnitin diz sobre o próprio sistema e por que esse sistema gera pontuações que não vão bater com as do Scribbr.

Como funciona a pontuação do Turnitin

O Turnitin documenta um processo específico para chegar à sua pontuação de escrita por IA:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Quando um trabalho é enviado ao Turnitin, as frases da submissão são extraídas e divididas em seções sobrepostas para a análise de previsão. Cada seção é classificada pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser humano ou gerado por IA. Cada frase válida dentro dessas seções herda a pontuação da seção. Como as seções se sobrepõem, algumas frases podem ter várias pontuações, que depois são reunidas em uma só. Essas pontuações por frase são ainda agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)

O processo passa por extrair as frases, dividi-las em unidades sobrepostas, pontuar cada unidade, reunir as pontuações das frases e agregar tudo em uma porcentagem no nível do documento. Outros detectores, o Scribbr incluído, podem usar estratégias de segmentação diferentes, unidades de previsão diferentes ou métodos de agregação diferentes. As duas ferramentas não vão chegar aos mesmos números com o mesmo texto.

A documentação do Turnitin também esclarece que a porcentagem de detecção de escrita por IA e a pontuação de similaridade são coisas separadas. «The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (A pontuação de similaridade e a porcentagem de detecção de escrita por IA são completamente independentes e não influenciam uma à outra.) Um documento pode ter similaridade alta e pouca IA, ou o inverso. Os dois números não se influenciam.

A taxa de falsos positivos declarada pelo Turnitin

O Turnitin publica uma meta específica para falsos positivos:

«We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing.» (Nos esforçamos para maximizar a eficácia do nosso detector mantendo a nossa taxa de falsos positivos — isto é, identificar incorretamente como gerado por IA um texto escrito inteiramente por uma pessoa — abaixo de 1% em documentos com mais de 20% de escrita por IA.)

A ressalva importa. A meta é declarada especificamente para documentos com mais de 20% de escrita por IA, um limite que não significa o que as pessoas imaginam, como mostra 20% de IA é demais?. Isso é o que o Turnitin diz sobre o próprio sistema. O Scribbr pode ter metas de precisão diferentes, processos de validação diferentes, ou pode não publicar números comparáveis. Não dá para fazer uma comparação direta de precisão. Só podemos relatar o que a documentação do Turnitin afirma.

O comportamento em documentos curtos

O tamanho do documento afeta a forma como o detector do Turnitin processa o texto. Em documentos curtos, o mecanismo de pontuação se comporta de outro modo. A documentação diz:

«In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.» (Em documentos mais curtos, com apenas algumas centenas de palavras, a previsão será basicamente «tudo ou nada», porque estamos prevendo a partir de um único segmento, sem chance de sobreposição.)

«This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (Isso significa que alguns textos que misturam conteúdo gerado por IA e conteúdo original podem ser marcados como inteiramente gerados por IA.)

O mecanismo de sobreposição que faz a média das pontuações em documentos longos não entra em ação quando o texto é um único segmento. Algumas centenas de palavras misturando conteúdo humano e de IA podem voltar como 100%, um dos caminhos descritos em por que o Turnitin diz que o seu trabalho é 100% IA. É um comportamento estrutural em textos curtos. O Scribbr pode processar documentos curtos por outro mecanismo e chegar a um resultado diferente para o mesmo texto.

Como as pontuações baixas são exibidas

O Turnitin omite as pontuações numéricas abaixo de 20%. A documentação diz:

«To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed.» (Para evitar a ocorrência de possíveis falsos positivos, nenhuma pontuação ou destaque é atribuído a valores de detecção de IA na faixa de 1% a 19%. Quando é detectada IA abaixo do limite de 20% no relatório, isso agora é indicado com um asterisco (*%) e nenhuma porcentagem é atribuída.)

Um documento que o modelo do Turnitin estima em 10% de IA vai mostrar um asterisco no relatório, e não o número 10%. Nenhum destaque é aplicado ao texto. A justificativa é evitar que possíveis falsos positivos apareçam em uma faixa de baixa confiança, o que o que o asterisco (*%) significa na pontuação de IA do Turnitin explica com mais detalhes.

O Scribbr pode exibir as pontuações dessa faixa como uma porcentagem completa. Outras ferramentas podem destacar o texto a partir de qualquer valor acima de zero. O Turnitin omite de propósito, abaixo de 20%, tanto o número quanto os destaques. Essa convenção faz com que as duas ferramentas apresentem resultados muito diferentes para o mesmo documento com pouca IA.

O que isso significa para você

Se você está comparando os resultados do Scribbr e do Turnitin no mesmo documento, aqui vai o resumo:

  • Modelos separados, pontuações separadas. O Scribbr e o Turnitin usam modelos de detecção diferentes. Não se espera que as pontuações coincidam.
  • O Turnitin pontua segmentando e agregando. As frases são extraídas, divididas em unidades sobrepostas, pontuadas, reunidas e agregadas. A pontuação de IA e a de similaridade são totalmente independentes.
  • O Turnitin busca menos de 1% de falsos positivos em documentos com mais de 20% de escrita por IA.
  • Documentos curtos recebem pontuações tudo ou nada. Algumas centenas de palavras podem voltar como 0% ou 100%, mesmo com texto misto.
  • Pontuações abaixo de 20% aparecem como asterisco. Na faixa de 1-19% não aparecem nem porcentagem numérica nem destaques.

As passagens que cumprem os requisitos podem ser processadas novamente sem custo.

Continue lendo