StealthWriter x Turnitin: o que a documentação realmente diz
Não trate a porcentagem do detector do StealthWriter como se fosse intercambiável com a pontuação de escrita por IA do Turnitin. O StealthWriter define sua pontuação pública como a porcentagem classificada como natural, enquanto o Turnitin documenta um cálculo próprio para escrita por IA e regras de exibição próprias. Este artigo explica o mecanismo publicado pelo Turnitin e os limites de comparar ferramentas diferentes.
Equipe HumanPen
· 5 min de leitura
As pontuações não são intercambiáveis
O FAQ do StealthWriter define a pontuação do detector como a porcentagem da entrada que ele classifica como natural. O Turnitin descreve uma porcentagem de escrita por IA gerada pelo processo documentado abaixo. As fontes consultadas não trazem nenhuma regra de conversão entre esses dois rótulos, de modo que um número de um produto não pode ser traduzido em um número do outro.
Não existe uma pontuação universal de detecção de IA com a qual todas as ferramentas concordem, e por que o mesmo texto recebe pontuações diferentes em cada detector mostra de onde vem essa diferença. Cada detector produz a própria estimativa. Tratar pontuações de ferramentas diferentes como se medissem a mesma coisa, na mesma unidade, só gera confusão.
Não estamos afirmando qual ferramenta é mais precisa. Nenhum teste de precisão ou de concordância entre fornecedores foi reproduzido para este artigo. Cada resultado precisa ser lido à luz da definição do seu próprio fornecedor.
Como funciona o processo de pontuação do Turnitin
O Turnitin documenta um processo específico para chegar à sua pontuação de escrita por IA:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e divididas em seções sobrepostas para a análise de predição. Cada seção é classificada pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificada dentro dessas seções herda a pontuação da seção. Como as seções se sobrepõem, algumas frases podem ter várias pontuações, que depois são reunidas em uma única. Essas pontuações por frase são então agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)
O processo envolve extrair as frases, dividi-las em unidades sobrepostas, pontuar cada seção, reunir as pontuações das frases e agregá-las em uma porcentagem de nível de documento. As páginas públicas do StealthWriter consultadas para este artigo não documentam uma cadeia equivalente de segmentação e agregação. As fontes atuais, portanto, não permitem dizer que o StealthWriter usa o mesmo método nem um método diferente.
A documentação do Turnitin também esclarece que a porcentagem de detecção de escrita por IA e a pontuação de similaridade são coisas separadas. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (A pontuação de similaridade e a porcentagem de detecção de escrita por IA são completamente independentes e não influenciam uma à outra.) A pontuação de similaridade indica a porcentagem de texto correspondente encontrada no documento enviado quando comparada ao amplo acervo de conteúdos que o Turnitin usa para a verificação de similaridade. Um documento pode ter similaridade alta e IA baixa, ou o contrário. Relatório de escrita por IA do Turnitin x relatório de similaridade mantém os dois separados. Os dois números não se influenciam.
A taxa de falsos positivos declarada pelo Turnitin
O Turnitin publica uma meta específica de falsos positivos:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nós nos esforçamos para maximizar a eficácia do nosso detector mantendo nossa taxa de falsos positivos — identificar incorretamente como gerado por IA um texto escrito inteiramente por humanos — abaixo de 1% em documentos com mais de 20% de escrita por IA.)
A documentação reformula isso assim: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Em outras palavras, podemos sinalizar como escrito por IA um a cada 100 documentos escritos inteiramente por humanos.) Essa reformulação abandona a ressalva “mais de 20% de escrita por IA”. A versão com o limite de 20% é a mais precisa. O que esse limite significa e o que não significa para a sua própria pontuação é tratado em 20% de IA é alto demais?.
Para comprovar essa meta, o Turnitin descreve sua estrutura de testes: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Para reforçar nossa estrutura de testes e diagnosticar tendências estatísticas de falsos positivos, antes de cada atualização ou lançamento de novo modelo realizamos testes com mais de 700.000 trabalhos acadêmicos adicionais escritos antes do lançamento do ChatGPT, a fim de validar ainda mais nossa taxa de falsos positivos inferior a 1%.)
Isso é o que o Turnitin diz sobre o próprio sistema. O StealthWriter pode ter metas de precisão diferentes, processos de validação diferentes, ou pode não publicar números comparáveis. Não podemos fazer uma comparação direta de precisão. Podemos apenas relatar o que diz a documentação do Turnitin.
Comportamento em documentos curtos
O tamanho do documento afeta a forma como o detector do Turnitin processa o texto. Em documentos curtos, o mecanismo de pontuação se comporta de outro modo. A documentação diz:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos, com apenas algumas centenas de palavras, a predição será basicamente “tudo ou nada”, porque estamos prevendo com base em um único segmento, sem chance de sobreposição.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que alguns textos que misturam conteúdo gerado por IA e conteúdo original podem ser sinalizados como inteiramente gerados por IA.)
O mecanismo de sobreposição que nivela as pontuações em documentos longos não atua quando o texto é um único segmento. Algumas centenas de palavras misturando conteúdo humano e de IA podem voltar como 100%, e esse é um dos caminhos descritos em por que o Turnitin diz que seu trabalho é 100% IA. É um comportamento estrutural, típico de entradas curtas.
Esse comportamento com entradas curtas está documentado para o Turnitin. As páginas do StealthWriter consultadas não descrevem um processo equivalente para entradas curtas, então este artigo não atribui ao StealthWriter um mecanismo igual nem diferente.
Como as pontuações baixas são exibidas
O Turnitin omite pontuações numéricas abaixo de 20%. A documentação diz:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar a possível ocorrência de falsos positivos, nenhuma pontuação ou destaque é atribuído a valores de detecção de IA na faixa de 1% a 19%. Quando IA é detectada abaixo do limite de 20% no relatório, isso passa a ser indicado com um asterisco (*%) e nenhuma porcentagem é atribuída.)
Um documento que o modelo do Turnitin estime em 8% de IA vai mostrar um asterisco no relatório, e não o número 8%. Nenhum destaque é aplicado ao texto. A justificativa é não exibir possíveis falsos positivos numa faixa de baixa confiança, e é isso que aprofunda o que significa o asterisco (*%) numa pontuação de IA do Turnitin.
A regra do asterisco é do Turnitin. As páginas do StealthWriter consultadas definem a própria pontuação, mas não documentam como o mesmo caso de valor baixo seria exibido. Não deduza daí uma conversão nem uma diferença de exibição sem um teste separado e documentado.
O que isso significa para você
Se você está comparando resultados do StealthWriter e do Turnitin no mesmo documento, aqui vai o resumo:
- Definições diferentes, sem regra de conversão. O StealthWriter define uma porcentagem de naturalidade, enquanto o Turnitin documenta uma pontuação de escrita por IA. As fontes consultadas não oferecem nenhum mapeamento entre as duas.
- O Turnitin pontua segmentando e agregando. As frases são extraídas, divididas em unidades sobrepostas, pontuadas, reunidas e agregadas. A pontuação de IA e a pontuação de similaridade são totalmente independentes.
- O Turnitin busca menos de 1% de falsos positivos em documentos com mais de 20% de escrita por IA, validado com mais de 700.000 trabalhos acadêmicos adicionais escritos antes do ChatGPT.
- Documentos curtos recebem pontuações de tudo ou nada. Algumas centenas de palavras podem voltar como 0% ou 100%, mesmo com texto misto.
- Pontuações abaixo de 20% aparecem como asterisco. Nenhuma porcentagem numérica ou destaque aparece na faixa de 1% a 19%.
As passagens que cumprem os requisitos podem ser processadas novamente sem custo.
Continue lendo