Winston AI e Turnitin: por que as pontuações de IA não batem

Tem aluno que passa o trabalho pelo Winston AI antes de mandar para o Turnitin. As duas ferramentas usam modelos diferentes e geram pontuações diferentes. As perguntas frequentes do Turnitin descrevem o mecanismo, as metas de falso positivo e a convenção do asterisco. Veja a seguir por que comparar uma ferramenta com a outra não funciona.

Equipe HumanPen

· 4 min de leitura

A resposta curta

Winston AI e Turnitin são detectores de IA diferentes: modelos diferentes, dados de treinamento diferentes, limiares de classificação diferentes. A pontuação de um não permite prever a do outro. As perguntas frequentes do Turnitin descrevem o mecanismo assim: o texto é dividido em segmentos sobrepostos, e cada um recebe uma pontuação de probabilidade entre 0 e 1. As perguntas frequentes também estabelecem uma meta de falso positivo abaixo de 1% para documentos com mais de 20% de texto escrito por IA, e usam a convenção do asterisco para pontuações na faixa de 1% a 19%. O Winston AI divulga os próprios números de precisão, mas eles vêm do próprio fornecedor e não podem ser conferidos na documentação do Turnitin. A única pontuação que importa é a da ferramenta que a sua instituição usa. Se a sua escola usa o Turnitin, nenhuma pontuação de terceiros vai te dizer qual será a sua.

Como funciona o detector do Turnitin

As perguntas frequentes descrevem o processo de detecção assim:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e divididas em seções sobrepostas para a análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA.)

Os segmentos se sobrepõem, de modo que uma mesma frase pode receber várias pontuações, que depois são reunidas em uma porcentagem para o documento inteiro. O Winston AI usa um método de classificação próprio, que não aparece documentado em nenhum material do Turnitin. Os dois sistemas são construídos de formas diferentes e avaliam o texto de formas diferentes.

A meta de falso positivo do Turnitin

As perguntas frequentes estabelecem uma meta específica:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nos esforçamos para maximizar a eficácia do nosso detector mantendo a nossa taxa de falsos positivos — ou seja, identificar por engano como gerado por IA um texto escrito inteiramente por um humano — abaixo de 1% em documentos com mais de 20% de texto escrito por IA.)

A frase seguinte: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Em outras palavras, podemos sinalizar como escrito por IA um documento a cada 100 documentos inteiramente escritos por humanos.)

Essa meta é específica do Turnitin e vale para documentos com mais de 20% de texto escrito por IA. O Winston AI pode informar uma taxa de falso positivo diferente, mas comparar os dois números exige entender como cada fornecedor define e mede os falsos positivos. Não fazemos afirmações sobre a precisão de detectores de terceiros.

A convenção do asterisco

O Turnitin tem uma regra de exibição específica para pontuações baixas:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar a possível ocorrência de falsos positivos, nenhuma pontuação ou destaque é atribuído a resultados de detecção de IA na faixa de 1% a 19%. Quando há detecção de IA abaixo do limite de 20% no relatório, isso agora é indicado com um asterisco (*%) e nenhuma porcentagem é atribuída.)

O Winston AI não usa essa convenção e mostra uma porcentagem específica nessa faixa. Um trabalho que aparece como “*%” no Turnitin pode aparecer como “14%” no Winston AI. Isso não quer dizer que uma ferramenta seja mais precisa que a outra: quer dizer que as duas tratam de formas diferentes a faixa de baixa confiança. O que o asterisco (*%) significa na pontuação de IA do Turnitin explica o lado do Turnitin.

Documentos curtos e previsões do tipo tudo ou nada

As perguntas frequentes descrevem como documentos curtos se comportam:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos, com apenas algumas centenas de palavras, a previsão será basicamente “tudo ou nada”, porque a fazemos em um único segmento, sem possibilidade de sobreposição.)

A frase seguinte: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que um texto que misture conteúdo gerado por IA e conteúdo original pode ser sinalizado como inteiramente gerado por IA.)

Isso vem da forma como o Turnitin segmenta o texto. O Winston AI pode ou não apresentar o mesmo comportamento em textos curtos. Se você testar um trecho curto no Winston AI e der 0%, isso não diz nada sobre o que o Turnitin vai fazer. A outra ponta desse comportamento está em Turnitin dizendo que o seu trabalho é 100% IA.

A pontuação que importa

No Turnitin, a pontuação de IA e a de similaridade são independentes: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de similaridade e a porcentagem de detecção de escrita por IA são completamente independentes e não se influenciam.) Alguns detectores combinam IA e similaridade em um único número, o que torna as pontuações deles estruturalmente incomparáveis com a porcentagem de IA que o Turnitin dá em separado. A única pontuação que importa para a sua entrega é a produzida pela ferramenta que a sua instituição usa. Por que o mesmo texto recebe pontuações diferentes em cada detector explica por que essa dispersão é estrutural.

O que isso significa para você

Para resumir o que vimos até aqui:

  • Winston AI e Turnitin são detectores diferentes, com modelos diferentes. As pontuações não vão bater.
  • O detector do Turnitin divide o texto em segmentos sobrepostos e atribui pontuações de probabilidade.
  • A meta de falso positivo do Turnitin é abaixo de 1% para documentos com mais de 20% de texto escrito por IA.
  • O Turnitin usa um asterisco para pontuações de 1% a 19%, para não sugerir uma precisão maior do que tem.
  • Em documentos curtos, o Turnitin faz previsões do tipo tudo ou nada.
  • A única pontuação que importa é a da ferramenta que a sua instituição usa.

Se você recebeu um relatório de IA do Turnitin e quer trabalhar as passagens sinalizadas, importe o relatório e mãos à obra. As passagens que se enquadram podem ser processadas de novo sem custo.

Continue lendo