Sapling AI Detector vs Turnitin: o que a documentação realmente diz

Se você passar o mesmo texto pelo detector de IA da Sapling e pelo Turnitin, as pontuações vão divergir na maior parte das vezes. Isso é esperado. As duas ferramentas usam modelos diferentes, treinados com dados diferentes e com convenções de pontuação diferentes. Aqui está o que a documentação do Turnitin diz sobre o funcionamento do detector dele e sobre por que as pontuações não vão bater.

Equipe HumanPen

· 5 min de leitura

Sapling e Turnitin são sistemas separados

O detector de IA da Sapling e a detecção de escrita por IA do Turnitin são criados por equipes diferentes, com modelos subjacentes diferentes. Cada um foi treinado com os seus próprios dados e classifica o texto do seu próprio jeito. Quando dois detectores usam modelos diferentes, eles produzem pontuações diferentes para o mesmo texto. Uma passagem que a Sapling marca como 70% de IA pode receber 25% no Turnitin, ou o contrário. Nenhum dos dois resultados está necessariamente errado. São estimativas de probabilidade feitas por modelos diferentes, treinados com conjuntos de dados diferentes.

Não existe uma pontuação universal de detecção de IA com a qual todas as ferramentas concordem, e por que o mesmo texto recebe pontuações diferentes em cada detector explica de onde vem essa divergência. Cada detector produz a sua própria estimativa. Tratar as pontuações de ferramentas diferentes como se medissem a mesma coisa, nas mesmas unidades, só gera confusão.

Não estamos afirmando qual das duas ferramentas é mais precisa. Estamos descrevendo o que a documentação do Turnitin diz sobre o próprio sistema e por que esse sistema gera pontuações que não vão coincidir com as da Sapling.

Como funciona o processo de pontuação do Turnitin

O Turnitin descreve um processo específico para chegar à sua pontuação de escrita por IA:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, as frases da submissão são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificada dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter várias pontuações, que são então reunidas em uma única pontuação. Essas pontuações por frase são agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)

O processo consiste em extrair as frases, dividi-las em unidades sobrepostas, pontuar cada segmento, reunir as pontuações das frases e agregar tudo em uma porcentagem para o documento inteiro. Outros detectores, incluindo a Sapling, podem usar estratégias de segmentação diferentes, unidades de predição diferentes ou métodos de agregação diferentes. As duas ferramentas não vão gerar números iguais para o mesmo texto.

A documentação do Turnitin também esclarece que a porcentagem de detecção de escrita por IA e a pontuação de Similarity são coisas separadas. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de Similarity e a porcentagem de detecção de escrita por IA são totalmente independentes e não influenciam uma à outra.) A pontuação de Similarity indica a porcentagem de texto correspondente encontrada no documento enviado, quando comparado ao acervo abrangente de conteúdo do Turnitin para verificação de similaridade. Um documento pode ter similaridade alta e IA baixa, ou o contrário. Relatório de escrita por IA do Turnitin vs relatório Similarity compara os dois relatórios. Os dois números não se influenciam.

A taxa de falsos positivos declarada pelo Turnitin

O Turnitin publica uma meta específica de falsos positivos:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Buscamos maximizar a eficácia do nosso detector mantendo a nossa taxa de falsos positivos — identificar incorretamente um texto totalmente escrito por humanos como gerado por IA — abaixo de 1% em documentos com mais de 20% de escrita por IA.)

A documentação reformula isso assim: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Em outras palavras, podemos sinalizar como escrito por IA um documento humano, em um a cada 100 documentos totalmente escritos por humanos.) Essa reformulação deixa de fora a ressalva "mais de 20% de escrita por IA". A versão com o limite de 20% é mais precisa.

Para validar essa meta, o Turnitin descreve a sua estrutura de testes: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Para reforçar a nossa estrutura de testes e diagnosticar tendências estatísticas de falsos positivos, antes de cada atualização ou lançamento de novo modelo, realizamos testes em mais de 700,000 artigos acadêmicos adicionais escritos antes do lançamento do ChatGPT, para validar ainda mais a nossa taxa de falsos positivos inferior a 1%.)

Isso é o que o Turnitin diz sobre o próprio sistema. Para entender no que dá 1% quando uma universidade submete trabalhos em escala, veja o que significa uma taxa de falsos positivos de 1%. A Sapling pode ter metas de precisão diferentes, processos de validação diferentes, ou pode não publicar números comparáveis. Não podemos fazer uma comparação direta de precisão. Só podemos relatar o que a documentação do Turnitin afirma.

O comportamento em documentos curtos

O tamanho do documento afeta a forma como o detector do Turnitin processa o texto. Em documentos curtos, o mecanismo de pontuação se comporta de outro jeito. A documentação diz:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos, com apenas algumas centenas de palavras, a predição será basicamente 'tudo ou nada', porque estamos prevendo com base em um único segmento, sem a oportunidade de sobreposição.)

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que alguns textos que misturam conteúdo gerado por IA e conteúdo original podem ser sinalizados como inteiramente gerados por IA.)

O mecanismo de sobreposição que dilui as pontuações em documentos mais longos não entra em ação quando o texto é um único segmento. Algumas centenas de palavras misturando conteúdo humano e de IA podem resultar em uma pontuação de 100%, e esse é um dos caminhos que levam a por que o Turnitin diz que o seu trabalho é 100% IA. É um comportamento estrutural em textos curtos.

Se a Sapling dá uma pontuação diferente para o mesmo documento curto, é em parte porque as duas ferramentas não processam textos curtos da mesma forma.

Como as pontuações baixas são exibidas

O Turnitin omite as pontuações numéricas abaixo de 20%. A documentação diz:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar a possível incidência de falsos positivos, nenhuma pontuação ou destaque é atribuído a pontuações de detecção de IA na faixa de 1% a 19%. Quando IA é detectada abaixo do limite de 20% no relatório, isso agora é indicado com um asterisco (*%) e nenhuma porcentagem é atribuída.)

Um documento que o modelo do Turnitin estime em 8% de IA vai exibir um asterisco no relatório, e não o número 8%. Nenhum destaque é aplicado ao texto. A justificativa é evitar que falsos positivos em potencial apareçam numa faixa de baixa confiança, ponto detalhado em o que significa o asterisco (*%) em uma pontuação de IA do Turnitin.

A Sapling pode exibir pontuações nessa faixa como uma porcentagem completa. Outras ferramentas podem destacar o texto em qualquer nível acima de zero. O Turnitin omite deliberadamente tanto o número quanto os destaques abaixo de 20%. Essa convenção de pontuação faz com que as duas ferramentas apresentem resultados muito diferentes para o mesmo documento com pouca IA.

O que isso significa para você

Se você está comparando os resultados da Sapling e do Turnitin no mesmo documento, aqui vai o resumo:

  • Modelos separados, pontuações separadas. Sapling e Turnitin usam modelos de detecção diferentes. Não se espera que as pontuações coincidam.
  • O Turnitin pontua segmentando e agregando. As frases são extraídas, divididas em unidades sobrepostas, pontuadas, reunidas e agregadas. A pontuação de IA e a pontuação de Similarity são totalmente independentes.
  • O Turnitin busca menos de 1% de falsos positivos em documentos com mais de 20% de escrita por IA, validado com mais de 700,000 artigos acadêmicos adicionais escritos antes do ChatGPT.
  • Documentos curtos recebem pontuações de tudo ou nada. Algumas centenas de palavras podem voltar como 0% ou 100%, mesmo sendo texto misto.
  • Pontuações abaixo de 20% aparecem como asterisco. Nenhuma porcentagem numérica ou destaque aparece na faixa de 1-19%.

As passagens que atendem aos critérios podem ser reprocessadas sem custo.

Continue lendo