Detecção de IA: Copyleaks vs Turnitin — Por que detectores diferentes discordam
Estudantes costumam passar seus trabalhos por vários detectores de IA e recebem pontuações completamente diferentes. O Turnitin pode apontar 20% enquanto o Copyleaks indica 80%. A razão é simples: modelos distintos, bases de treinamento diferentes, limiares de classificação diversos. Entender por que os detectores discordam ajuda você a interpretar cada pontuação no seu contexto.
Equipe HumanPen
· 4 min de leitura
Resposta Rápida
Detectores de IA diferentes dão pontuações diferentes porque são modelos distintos, treinados com dados diferentes e limiares de classificação próprios. Copyleaks e Turnitin são produtos separados, desenvolvidos por equipes diferentes. Cada um tem seu próprio modelo, seu conjunto de dados de treinamento e sua própria maneira de agregar previsões de segmentos em uma pontuação do documento. Quando o Copyleaks indica 80% e o Turnitin 20% no mesmo texto, nenhum dos dois está necessariamente errado. Eles medem padrões estatísticos diferentes e aplicam limites de decisão distintos. A pontuação que realmente importa para você é a da ferramenta que sua instituição usa de fato. Se sua faculdade usa Turnitin, sua pontuação no Copyleaks é informativa, mas não tem peso oficial.
Como Funciona o Detector do Turnitin
O FAQ da Turnitin descreve o processo deles:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um artigo é submetido ao Turnitin, frases do envio são extraídas e divididas em seções sobrepostas para análise preditiva. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, indicando a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificada dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter várias pontuações, que são então consolidadas em uma única pontuação. Essas pontuações de frases são ainda agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)
A Turnitin também publica um objetivo específico de falsos positivos: "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Buscamos maximizar a eficácia do nosso detector, mantendo nossa taxa de falsos positivos — identificar incorretamente texto totalmente escrito por humanos como gerado por IA — abaixo de 1% para documentos com mais de 20% de escrita por IA.) Esse objetivo define quão agressivamente o modelo classifica textos no limite. Um modelo ajustado para minimizar falsos positivos vai classificar mais segmentos incertos como humanos, o que pode produzir pontuações de IA mais baixas em textos mistos.
Por que Copyleaks e Turnitin Discordam
O Copyleaks usa seu próprio modelo de detecção de IA, com seus próprios dados de treinamento e limiares de classificação. Os detalhes do modelo do Copyleaks não são públicos da mesma forma que o FAQ da Turnitin é, então não dá para fazer uma comparação lado a lado dos mecanismos. Mas a razão estrutural da discordância é clara: dois modelos diferentes treinados com dados diferentes vão classificar o mesmo texto de formas distintas. Uma frase que o modelo da Turnitin classifica com 0,3 de probabilidade de IA pode receber 0,7 do modelo do Copyleaks. Quando essas diferenças em nível de segmento são agregadas ao longo de um documento, as porcentagens finais podem divergir bastante. Por que o mesmo texto pontua diferente em cada detector explica isso de forma geral.
Há também uma diferença de limiar. O Turnitin não exibe pontuações entre 1% e 19%, mostrando apenas um asterisco. O FAQ explica: "To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range." (Para evitar possível incidência de falsos positivos, nenhuma pontuação ou destaque é atribuído para pontuações de detecção de IA na faixa de 1% a 19%.) Se o Copyleaks exibir uma pontuação de 15% para o mesmo texto que o Turnitin mostra como asterisco, a discrepância é em parte uma decisão de exibição, não apenas uma diferença de classificação — veja o que o asterisco (*%) significa numa pontuação de IA do Turnitin.
Documentos Curtos Amplificam a Discordância
O FAQ da Turnitin observa que documentos curtos produzem previsões menos confiáveis:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos, com apenas algumas centenas de palavras, a previsão será principalmente 'tudo ou nada', porque estamos prevendo em um único segmento sem oportunidade de sobreposição.)
A frase seguinte: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que algum texto que é uma mistura de conteúdo gerado por IA e original pode ser sinalizado como inteiramente gerado por IA.)
Num documento curto, um detector pode classificar todo o texto como IA (dando 100%) enquanto outro classifica como humano (dando 0%). O comportamento tudo-ou-nada significa que pequenas diferenças na forma como cada modelo lida com um único segmento podem produzir diferenças drásticas na pontuação final. Se você está comparando pontuações entre detectores, a extensão do documento importa. Um resumo de 300 palavras pode receber pontuações radicalmente diferentes de ferramentas distintas, enquanto um trabalho de 3.000 palavras pode mostrar concordância maior.
Qual Pontuação Importa
A pontuação que importa é a da ferramenta que sua instituição usa. Se sua universidade usa Turnitin, sua pontuação de IA do Turnitin é a que afeta sua situação acadêmica. Uma pontuação de 5% no Copyleaks não ajuda se sua pontuação no Turnitin for 80%. Uma pontuação de 80% no Copyleaks não te prejudica se sua instituição não usa Copyleaks. Passar seu trabalho por vários detectores pode dar uma noção geral de se seu texto tem padrões semelhantes aos de IA, mas não pode te dizer o que o detector da sua instituição vai apontar. A única forma de saber sua pontuação real é ver o relatório da ferramenta que sua instituição usa, e apenas instrutores e administradores podem ver o indicador de IA do Turnitin. Se sua faculdade roda algum detector depende do que eles compraram.
O Que Isso Significa para Você
Para resumir o que cobrimos:
- Detectores de IA diferentes usam modelos distintos, com dados de treinamento e limiares diferentes. Discordância é de se esperar, não surpreende.
- O Turnitin publica seu objetivo de falsos positivos (abaixo de 1% para documentos com mais de 20% de IA) e seu mecanismo (classificação de segmentos sobrepostos).
- O Turnitin suprime pontuações entre 1% e 19% como asteriscos, o que pode ampliar a aparente discordância com outras ferramentas.
- Documentos curtos produzem previsões tudo-ou-nada, o que pode causar divergência dramática entre detectores.
- A pontuação que importa é a da ferramenta que sua instituição realmente usa.
Se você tem um relatório do Turnitin mostrando quais trechos foram sinalizados, importe o relatório e trabalhe nesses trechos específicos. Trechos elegíveis podem ser reprocessados sem custo adicional.
Continue lendo