Por que o Turnitin sinaliza meu trabalho como 100% de IA?
Se o Turnitin disser 100% de IA em algo que você mesmo escreveu, a pontuação é real, mas o veredito não é o que parece. Documentos curtos, estrutura repetitiva e paráfrase sem novas ideias empurram o texto humano para 100%. A própria documentação do Turnitin diz que as pontuações não devem ser usadas como única base para medidas adversas.
Equipe HumanPen
· 9 min de leitura
A resposta curta
Uma pontuação de 100% não significa que o Turnitin tem certeza de que seu texto foi gerado por IA. Para documentos mais curtos, algumas centenas de palavras, a previsão é em grande parte “tudo ou nada” porque o sistema pontua um único segmento sem sobreposição para fazer média. Texto com pouca variação estrutural, repetição literal ou paráfrase sem novas ideias é mais propenso a falsos positivos. E o próprio Turnitin diz, em três documentos de ajuda distintos, que a pontuação não deve ser usada como única base para medidas adversas contra um estudante.
Já explicamos como funciona a detecção de IA do Turnitin em termos do classificador e de seus segmentos. Este artigo trata do que acontece quando esse sistema retorna 100% em um texto que você sabe ter escrito você mesmo. As causas são mecânicas, não arbitrarías, e estão documentadas nas próprias páginas do Turnitin.
O problema dos documentos curtos
Esta é a razão mais comum pela qual um texto humano genuíno recebe uma pontuação de 100%. O FAQ sobre as capacidades de detecção de escrita por IA do Turnitin descreve o que acontece com envios curtos:
“In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.” (Em documentos mais curtos com apenas algumas centenas de palavras, a previsão será em grande parte “tudo ou nada” porque estamos prevendo em um único segmento sem a oportunidade de sobrepor.)
A frase seguinte é a que completa o quadro:
“This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.” (Isso significa que algum texto que é uma mistura de conteúdo gerado por IA e conteúdo original pode ser sinalizado como inteiramente gerado por IA.)
Leia essas duas frases juntas e a pontuação de 100% em um trabalho curto deixa de parecer um veredito. Parece um teto na resolução do instrumento. Quando há apenas um segmento, não há nada com que fazer média. Um segmento de alta probabilidade se torna a pontuação de todo o documento. Se o seu ensaio tem 300 ou 500 palavras, esta é a primeira possibilidade a verificar.
O Turnitin também observou em uma versão de dezembro de 2023 que “submissions that contain less than 300 words may result in an AI writing score that is likely less accurate.” (envios que contêm menos de 300 palavras podem resultar em uma pontuação de escrita por IA provavelmente menos precisa.) Documentos curtos são mais difíceis de pontuar, e o sistema sabe disso.
Que tipo de texto recebe sinalização de falso positivo
A mesma página de FAQ lista os tipos de texto em que os falsos positivos são mais prováveis de ocorrer:
“Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.” (Às vezes, os falsos positivos (sinalizar incorretamente um texto escrito por um humano como gerado por IA) podem incluir conteúdo sem muita variação estrutural, texto que se repete literalmente ou texto que foi parafraseado sem desenvolver novas ideias.)
A frase seguinte importa tanto quanto a própria lista:
“If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.” (Se o nosso indicador mostrar uma quantidade maior de escrita por IA em tal texto, aconselhamos que você leve isso em consideração ao olhar a porcentagem indicada.)
Isso é o Turnitin dizendo aos instrutores para descontar a porcentagem quando ela aparece nesse tipo de texto. Se a sua escrita é estruturalmente uniforme (parágrafos de tamanho semelhante, formas de frase semelhantes, vocabulário recorrente), ou se você parafraseou material de fonte de perto sem adicionar sua própria análise, a pontuação pode subir mesmo que cada palavra seja sua.
Isso não é um bug. É o classificador lendo a uniformidade como um sinal. Padrões estatísticos que parecem regulares podem corresponder ao que o modelo aprendeu com texto de IA, mesmo quando o texto foi produzido por um humano que por acaso escreveu em um registro consistente. Em escala institucional isso se acumula, o que é a aritmética de o que significa uma taxa de falso positivo de 1% quando uma universidade envia 75.000 trabalhos.
A pontuação de 100% é um agregado, não um veredito
Para entender por que um único segmento pode produzir 100%, ajuda ver como a pontuação funciona de ponta a ponta. O FAQ do Turnitin descreve o pipeline:
“When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.” (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e segmentadas em seções sobrepostas para análise de previsão. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, denotando a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificada dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter várias pontuações, que são então combinadas em uma única pontuação. Essas pontuações de frases são ainda agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)
Em um documento mais longo, há muitos segmentos sobrepostos. Uma frase próximo ao limite de um segmento também aparece dentro do próximo. As pontuações de ambos os segmentos são combinadas. Um segmento que se lê como similar a IA não domina, porque os segmentos vizinhos puxam a pontuação combinada em outras direções.
Em um documento curto, há apenas um segmento. Sem sobreposição. Sem combinação entre janelas. A classificação do segmento único se torna a pontuação do documento. Se esse segmento for classificado com 0,95 de probabilidade de IA, a pontuação do documento é 100% (ou o que a agregação mapeia isso). O sistema não tem uma segunda opinião a consultar.
Esta é a razão mecânica pela qual as pontuações de 100% se concentram em trabalhos curtos. Não é que trabalhos curtos sejam mais propensos a serem gerados por IA. É que o instrumento tem menos oportunidades de se corrigir.
O que o próprio Turnitin diz sobre o uso das pontuações
A própria documentação do Turnitin é mais cautelosa com suas pontuações do que tendem a ser as instituições que as utilizam. O guia do AI Writing Report afirma:
“Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student.” (Nosso modelo de detecção de escrita por IA pode nem sempre ser preciso (ele pode identificar incorretamente texto escrito por humanos, gerado por IA e parafraseado por IA), portanto não deve ser usado como única base para medidas adversas contra um estudante.)
A frase seguinte nesse mesmo guia:
“It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred.” (É necessária uma análise mais aprofundada e um julgamento humano em conjunto com a aplicação, por parte de uma organização, de suas políticas acadêmicas específicas para determinar se ocorreu falta acadêmica.)
Um guia de revisão separado coloca o mesmo ponto de forma diferente:
“It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy.” (Ele não tem o objetivo de fornecer respostas definitivas de forma isolada. Mais importante do que qualquer ferramenta é o educador que vê a pontuação e toma decisões equilibrando essa informação com seu conhecimento pessoal de seus estudantes, de seus trabalhos e da política institucional.)
E a frase depois dessa:
“When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended.” (Quando os educadores olham para a pontuação de escrita por IA e a utilizam como um único ponto de dados em vez de uma resposta definitiva, então ela está sendo usada como pretendido.)
Essas são palavras do Turnitin, não nossas. A empresa que construiu o detector está dizendo às pessoas que o usam que uma pontuação é um ponto de dados, não uma conclusão. Se a sua instituição trata 100% como prova definitiva, a instituição está usando a ferramenta de uma maneira que o Turnitin diz que não deve ser usada.
Passos práticos se você obteve 100% em sua própria escrita
Verifique o tamanho do documento. Se o envio tinha algumas centenas de palavras, o comportamento de “tudo ou nada” descrito em F9 é a explicação mais provável. A pontuação reflete os limites da previsão de um único segmento, não uma determinação sobre o seu processo de escrita.
Verifique se o seu texto corresponde ao perfil de falso positivo. Baixa variação estrutural, repetição literal e paráfrase sem novas ideias são as três características que o próprio Turnitin nomeia. Se o seu texto tem alguma dessas, o conselho oficial é levar isso em consideração ao ler a porcentagem. Isso é uma citação que você pode levar a uma reunião.
Pergunte quando o relatório foi gerado. Em maio de 2023, o Turnitin mudou sua lógica de detecção para reduzir os falsos positivos na primeira e na última frase dos documentos, que vinham produzindo taxas mais altas de falsos positivos. A correção está documentada nas notas de versão. Se o relatório for anterior a essa correção, pode refletir um problema que já foi resolvido. Relatórios gerados antes de julho de 2024 também podem mostrar pontuações numéricas no intervalo de 1 a 19 que os relatórios atuais exibem como um asterisco. O ponto é: relatórios antigos se comportam de forma diferente dos novos, e a data importa.
Traga evidências do seu processo de escrita. Histórico de versões, arquivos de rascunho com marcas de tempo, histórico do navegador que mostre atividade de pesquisa. Esses não são argumentos sobre a pontuação. Eles são o “further scrutiny and human judgment” (uma análise mais aprofundada e o julgamento humano) que o Turnitin diz deve acompanhar a pontuação.
Cite as próprias palavras do Turnitin. A afirmação de que a pontuação “should not be used as the sole basis for adverse actions against a student” (não deve ser usada como única base para medidas adversas contra um estudante) aparece em três documentos distintos do Turnitin. A afirmação de que a pontuação é “a single data point rather than a definitive response” (um único ponto de dados em vez de uma resposta definitiva) é como o Turnitin diz que a ferramenta deve ser usada. Essas não são opiniões. Elas são as instruções de funcionamento declaradas pelo fabricante. Se você está elaborando o que dizer de fato, sinalizado, mas escrito por você mesmo trata do preparo dessa resposta.
O que tiramos disso
A ferramenta HumanPen é uma ferramenta de reescrita de documentos. A decisão de projeto relevante aqui é que reescrevemos no nível de passagem, não no nível de pontuação. Não tentamos mover um número que não podemos ver. Pegamos as passagens que o AI Writing Report sinalizou, alteramos a linguagem real nessas passagens e deixamos o restante do documento intacto. A cobrança conta apenas as palavras reescritas, e se um novo relatório sobre o texto reescrito ainda voltar em 20% ou acima, a reexecução das passagens ainda sinalizadas é gratuita.
Não diremos o que o seu próximo relatório dirá. Não fazemos previsões sobre pontuações de detecção. O que fazemos é mais limitado do que isso: reescrevemos a linguagem específica nas passagens específicas que o relatório identificou e preservamos a estrutura, as citações e a formatação ao redor delas.
Perguntas frequentes
O Turnitin pode estar errado sobre 100% de IA? Sim. O próprio FAQ do Turnitin diz que documentos curtos recebem previsões de “tudo ou nada” em um único segmento, e que texto sem variação estrutural ou com paráfrase próxima é mais propenso a falsos positivos. A pontuação de 100% é um agregado de classificações no nível de segmento, e em um documento curto pode haver apenas um segmento.
100% de IA significa que o Turnitin tem certeza? Não. A porcentagem é a saída de um classificador aplicado a segmentos sobrepostos, combinados e agregados. Em um documento de um único segmento, um segmento de alta probabilidade se torna toda a pontuação. O Turnitin diz que a pontuação “should not be used as the sole basis for adverse actions against a student” (não deve ser usada como única base para medidas adversas contra um estudante) e é “a single data point rather than a definitive response.” (um único ponto de dados em vez de uma resposta definitiva).
Por que meu ensaio curto obteve 100% mas meu trabalho longo não? Documentos mais longos têm mais segmentos sobrepostos, então as pontuações são combinadas entre janelas e um único segmento similar a IA é diluído. Documentos curtos têm um segmento, sem sobreposição, sem diluição. Esta é uma propriedade mecânica do pipeline de pontuação, não um julgamento sobre a sua escrita.
E se eu usei o Grammarly? O FAQ do Turnitin diz que mudanças de ortografia, gramática e pontuação do Grammarly “in most cases” (na maioria dos casos) não são sinalizadas como IA. Mas os recursos generativos do Grammarly (geração de rascunhos, paráfrase, resumo) são uma categoria diferente, e o conteúdo produzido por esses recursos “will likely be flagged as AI-generated.” (provavelmente será sinalizado como gerado por IA).
Posso usar as próprias palavras do Turnitin na minha defesa? Sim. A afirmação de que a pontuação não deve ser a única base para ação aparece em três documentos do Turnitin. A afirmação de que a pontuação é um único ponto de dados aparece em seu guia de revisão. Essas são as instruções de funcionamento do fabricante, e elas são relevantes para qualquer conversa sobre o que uma pontuação significa.
Continue lendo