Qual é a margem de erro de uma pontuação de IA do Turnitin? Fomos contar

Se um trabalho volta com 43%, a pergunta natural é: 43 mais ou menos quanto. As três páginas da fabricante que definem o relatório não publicam uma resposta. A lacuna não se limita a um FAQ: ela aparece nas três páginas que verificamos. O que essas páginas publicam, em vez de uma margem, é um exemplo com uma única direção, uma faixa suprimida e uma descrição do mecanismo que mostra onde está a variação real.

Equipe HumanPen

· 13 min de leitura

Qual é a margem de erro de uma pontuação de IA do Turnitin?

Não existe uma margem publicada. Nas três páginas que definem o AI writing report, lidas em 28 de agosto de 2026 e totalizando 46.712 caracteres de texto de artigo renderizado, as palavras `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` e `estimat` não retornam nenhuma ocorrência, somadas. O contador estava funcionando: `percentage` aparece 47 vezes no mesmo corpus e `false positive`, 21 vezes. A fabricante publica, sim, três coisas numéricas que as pessoas confundem com uma margem, e nenhuma delas é uma.

Essa ausência é o achado útil, não uma reclamação. Ela diz qual pergunta você deve parar de fazer e quais duas perguntas realmente têm resposta sobre o número que está no seu relatório.

Duas páginas vizinhas aqui cobrem terrenos diferentes, e esta não as repete: A taxa de falsos positivos do Turnitin, explicada é sobre a taxa de erro da decisão sim/não, e O que uma taxa de falsos positivos de 1% significa quando uma universidade envia 75.000 trabalhos é sobre o que essa taxa faz em escala institucional. Esta página é sobre o número em si: o que ele estima e até onde pode se mover.

A contagem, com o seu denominador

Três páginas, lidas sem login, em navegador, em 28 de agosto de 2026, medidas como `document.querySelector('article').innerText`, e não o corpo da página. O corpo acrescenta cerca de 725 caracteres de navegação e inflaria o denominador sem acrescentar nenhum texto relevante. Contagem de caracteres: Using the AI Writing Report, 6.492; as AI writing detection capabilities FAQs, 30.987, que a própria página marcou como "Updated 9 days ago" (atualizado há 9 dias); as AI writing detection model release notes, 9.233. Total: 46.712.

Termo buscadoPágina do relatórioFAQsNotas de versãoTotal
`interval`0000
`margin`0000
`standard deviation`0000
`uncertain`0000
`precision`0000
`variance`0000
`error bar`0000
`plus or minus` e `±`0000
`estimat`0000
`percentage` (controle)1031647
`false positive` (controle)212721
`qualifying text` (controle)64313
`segment` (controle)09110
`reliab` (controle)2305
`probabilit` (controle)0404

Os controles estão ali porque uma fileira de zeros não vale nada sem eles. Se a busca estivesse quebrada, ou a página não tivesse renderizado, `percentage` também teria voltado zero. Voltou 47.

Dois quase-acertos que valem ser publicados, porque são do tipo que uma leitura descuidada transforma em achado. `confidence` devolve exatamente uma ocorrência em todo o corpus, e ela não é estatística: "While Turnitin has confidence in its model, Turnitin does not make a determination of misconduct." (Embora o Turnitin tenha confiança no seu modelo, o Turnitin não faz uma determinação de má conduta.) E `precise` devolve exatamente uma, numa nota de versão de 2023 sobre detecção dos limites de segmento. Nenhuma das duas é uma medida de dispersão. Se você repetir esta contagem e cair em uma delas, leia a frase antes de tratá-la como tal.

E a afirmação vale nos dois sentidos. O fato de a fabricante não ter publicado uma margem é um fato sobre estas páginas, nesta data. Não significa que o modelo não tenha uma medida interna da própria confiança; a seção sobre o mecanismo, abaixo, diz que ele calcula uma. Igualmente, não pode ser usada por ninguém para argumentar que o número é preciso. Significa que a pergunta não está respondida nas páginas verificadas, o que é diferente de estar respondida num sentido ou no outro.

Os três números que as pessoas confundem com uma margem

A documentação não se cala sobre erro. Ela se cala sobre este tipo de erro. Três números publicados acabam convocados a fazer o papel de margem, e nenhum deles serve.

  • A meta de falsos positivos abaixo de 1%. O escopo declarado dela é "documents with over 20% of AI writing" (documentos com mais de 20% de escrita por IA), e ela trata de quantas vezes um documento inteiramente humano acaba marcado. Isso é a taxa de erro de uma decisão sobre uma população, não uma faixa em torno do seu 43.
  • O exemplo do "50% pode ser 65%". Este é o que mais se aproxima, e é o assunto da próxima seção. Ele aponta numa única direção e trata de texto de IA que escapou, não de o número exibido estar alto demais.
  • A faixa suprimida de 1–19%. Abaixo do limiar de 20% não aparece número nenhum. Isso é uma declaração sobre onde a fabricante considera a leitura insegura para exibir, o que é informativo, mas uma regra de supressão também não é uma margem.

O que falta nessa lista é justamente o que você precisaria: qualquer afirmação com a forma "um documento avaliado em X normalmente fica entre Y e Z". Nada nos 46.712 caracteres tem essa forma. Portanto, "43% mais ou menos quanto" não tem resposta apoiada nestas fontes primárias. Quem apresentar um intervalo deveria conseguir apontar outra fonte primária para ele.

A direção do exemplo publicado mais próximo

A passagem mais próxima de uma margem de erro que encontramos quantifica até onde o número informado pode estar da realidade, e aponta numa única direção.

"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (Para manter essa taxa baixa de 1% de falsos positivos, existe a chance de deixarmos passar algum texto escrito por IA dentro de um documento. Estamos confortáveis com isso, porque não queremos marcar incorretamente texto escrito por humano como escrito por IA. Por exemplo, se identificamos que 50% de um documento provavelmente foi escrito por uma ferramenta de IA, ele pode conter até 65% de escrita por IA.)

Leia isso com atenção, porque a forma importa mais do que os números. O texto diz que a quantidade real de texto de IA pode ser maior do que o número exibido. Não diz o contrário. Nossa contagem não achou nenhuma faixa equivalente na outra direção naquelas três páginas. A única ocorrência de `up to` nas notas de versão se refere a um limite de entrada de 30.000 palavras, não a uma porcentagem.

Esse é o alcance inteiro da assimetria que essa passagem sustenta. Ela explica por que o exemplo aponta para cima: o sistema aceita deixar passar parte do texto de IA para reduzir falsos positivos. Não diz quanto peso de evidência dar a uma pontuação individual, alta ou baixa. As páginas verificadas não publicam curva de calibração, razão de verossimilhança nem medida ajustada por taxa base para essa inferência, e o mesmo FAQ diz que a porcentagem não deve ser a única base para uma ação.

Esse parágrafo não ajuda em nada quando você mesmo escreveu o trabalho e acredita que a pontuação está errada. Não é uma margem; é uma revelação sobre para que lado o sistema erra. O material que ajuda mesmo num falso positivo é outro assunto: A taxa de falsos positivos do Turnitin, explicada cobre as declarações da própria fabricante sobre isso.

Onde a variação realmente está

As FAQs descrevem a sequência de pontuação. Depois de ler, dá para ver onde uma medida de incerteza entraria e onde ela desaparece da descrição pública.

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e segmentadas em seções sobrepostas para análise de previsão. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase elegível dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter mais de uma pontuação, que então são reunidas numa única pontuação. Essas pontuações de frase são agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)

São quatro etapas, e uma grandeza contínua existe já na primeira. Cada segmento recebe um valor entre 0 e 1. As frases herdam esse valor. Pontuações de segmentos sobrepostos são reunidas. Os resultados restantes, no nível da frase, são combinados num único número para o documento. Uma probabilidade de 0,51 e uma probabilidade de 0,99 são estados de conhecimento muito diferentes, e quando chegam ao seu relatório ambas viraram parte de uma mesma porcentagem inteira.

As três páginas não declaram a regra de agrupamento, nem a regra de agregação, nem o limiar em que a pontuação reunida de uma frase passa a ser uma frase marcada. Isso deixa três funções não declaradas entre a incerteza do modelo e a porcentagem mostrada ao seu professor. É uma descrição mais exata da lacuna pública do que simplesmente apresentar uma fileira de zeros.

Nada disso torna o número sem sentido. Ele é uma estimativa derivada do modelo para a proporção de texto elegível que provavelmente foi gerado por IA. A falta da regra de agrupamento, da regra de agregação e de uma margem limita o que se pode inferir dessa estimativa; não apaga a unidade em que ela é publicada. A leitura cuidadosa de 43% é, portanto, "o modelo estimou 43% do texto elegível", e não "43% de todas as palavras deste documento, com uma faixa de erro conhecida".

A exceção documentada para documentos curtos

A documentação sustenta um alerta estreito sobre extensão, não uma regra geral que preveja a resolução da pontuação a partir da contagem de palavras de um documento.

As FAQs dizem: "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Em documentos mais curtos, com apenas algumas centenas de palavras, a previsão será basicamente 'tudo ou nada', porque estamos prevendo sobre um único segmento, sem a chance de sobreposição. Isso significa que um texto que mistura conteúdo gerado por IA e conteúdo original pode ser marcado como inteiramente gerado por IA.) Esse é um caso documentado de segmento único. As páginas verificadas não publicam uma função geral que mostre como a resolução da pontuação muda à medida que os documentos ficam mais longos.

Portanto, a pergunta prática a acrescentar não é uma margem inventada, e sim o contexto do relatório: quanto texto elegível entrou na estimativa, e será que este é o caso de segmento único de poucas centenas de palavras sobre o qual a fabricante alerta especificamente? Não transforme esse comportamento de documento curto numa regra não publicada para um capítulo de 8.000 palavras. Documentos curtos e o problema do tudo ou nada no Turnitin examina o caso curto documentado, e O que é o "texto elegível" na detecção de IA do Turnitin? cobre o que entra e o que não entra no denominador, para começo de conversa.

A faixa em que a fabricante para de mostrar um número

Existe um lugar em que o Turnitin disse, na prática, que a leitura não é sólida o bastante para imprimir, e fez isso tirando o número.

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar a possível ocorrência de falsos positivos, nenhuma pontuação ou destaque é atribuído a pontuações de detecção de IA na faixa de 1% a 19%. Quando IA é detectada abaixo do limiar de 20% no relatório, isso agora é indicado com um asterisco (*%) e nenhuma porcentagem é atribuída.)

Duas conclusões decorrem disso e vale levá-las adiante. Primeiro: um asterisco não é uma pontuação baixa sendo escondida de você; é a fabricante deixando de atribuir uma pontuação, e também não há destaques, então não existe nada específico para ninguém apontar. Segundo: este é o lugar mais claro, nas três páginas, em que a fabricante retém parte da própria saída por causa do risco de falso positivo. É a coisa mais próxima de uma divulgação de incerteza que encontramos, e ela assume a forma de uma regra, não de um número. O que significa o asterisco (*%) numa pontuação de IA do Turnitin? percorre o que essa exibição realmente quer dizer.

Como ler um número que vem sem margem

Depois de tudo o que foi dito acima, aqui está o que continua sendo utilizável quando alguém coloca uma porcentagem na sua frente.

  1. Pare de pedir a margem e peça o denominador. De quantas frases elegíveis saiu este número? Algumas centenas de palavras significam uma saída quase binária, pela descrição da própria fabricante.
  2. Note a direção do exemplo publicado. Um 50 relatado pode ser 65. Não encontramos, nas três páginas verificadas, nenhuma faixa com respaldo de fonte na outra direção.
  3. Trate o asterisco como ausência de atribuição, não como um número pequeno. Sem pontuação, sem destaques.
  4. Não converta a proporção estimada de texto elegível numa proporção dos seus parágrafos. Ela vem de um agrupamento e de uma agregação não publicados sobre segmentos, não de uma contagem de frases que você possa localizar uma a uma.
  5. Não dê significância a uma mudança entre versões que a fabricante não definiu. As páginas verificadas não publicam nenhum limiar de significância para uma variação de alguns pontos. Guarde junto do número o contexto de texto elegível e os destaques de cada relatório.
  6. Use o enquadramento da própria fabricante quando o citarem para você. O FAQ dela diz que a porcentagem "should not be used as the sole basis for action or a definitive grading measure by instructors" (não deve ser usada como única base para uma ação ou como medida definitiva de avaliação por parte dos professores), e que o modelo dela "may not always be accurate" (pode nem sempre ser preciso).

Se alguém lhe entregar um intervalo de confiança para uma pontuação de IA do Turnitin, pergunte de onde ele saiu. Pelas evidências acima, não saiu do Turnitin.

Se mesmo assim alguns trechos vão ser reescritos

Tudo o que está acima trata de ler o relatório, não de agir sobre ele, e as duas coisas precisam ficar separadas. Mas há uma consequência prática que vale declarar, porque decorre diretamente do problema da contagem: se uma porcentagem não tem incerteza publicada associada a ela, então correr atrás da porcentagem é correr atrás de algo sem alvo definido. Os trechos destacados têm um alvo definido. São pedaços específicos de texto que você pode olhar.

É exatamente por isso que a ferramenta HumanPen, que nós construímos, é organizada em torno de importar o relatório, e não o número que está nele. Leia isto como uma descrição de quem faz o produto. Entregue o AI writing report que você já tem e os trechos marcados passam a ser o limite do trabalho; você aprova esse limite na tela, só os parágrafos confirmados são reescritos e todo o resto fica como está. Isso é uma declaração de escopo de reescrita, não uma afirmação sobre upload, transporte ou armazenamento. O motivo para preferir isso a uma passada pelo documento inteiro não é um número melhor, o que ninguém pode prometer. Cada parágrafo alterado acrescenta mais uma verificação de fonte antes do envio, então um escopo estreito mantém essa fila de verificação curta. Quando o próprio arquivo é o entregável, O que acontece com citações, tabelas e equações num humanizador de IA? cobre o que conferir depois.

E a ressalva óbvia, para a qual esta página vem caminhando há oito seções: ninguém pode dizer qual será o próximo número, nós incluídos. Se você mesmo escreveu o trabalho, nada disso se aplica. O argumento a fazer é sobre evidência e processo, não sobre o texto.

Perguntas frequentes

O Turnitin publica uma margem de erro para a porcentagem de IA? Não nas três páginas que definem o relatório. Nos 46.712 caracteres lidos em 28 de agosto de 2026, `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` e `estimat` retornam todos zero, enquanto `percentage` retorna 47 e `false positive` retorna 21 no mesmo texto.

43% é mesmo 43% do meu trabalho? É a estimativa derivada do modelo de que 43% do texto elegível provavelmente foi gerado por IA, e não necessariamente 43% de tudo o que foi enviado. Como as regras de agrupamento e de agregação, além de uma margem, não são publicadas, você não pode projetar esse número um a um sobre os parágrafos visíveis.

A quantidade real de texto de IA pode ser maior do que o número exibido? A fabricante diz isso diretamente, com o exemplo dela mesma: identifique 50% e o documento "could contain as much as 65% AI writing" (pode conter até 65% de escrita por IA). Esse exemplo aponta para cima. Não encontramos, nas três páginas verificadas, nenhuma faixa com respaldo de fonte na direção oposta.

Por que uma redação curta recebe uma pontuação extrema? Porque pode haver um único segmento. As FAQs dizem que, em documentos de algumas centenas de palavras, a previsão é "mostly 'all or nothing'" (basicamente 'tudo ou nada'), e que por isso um texto misto pode ser marcado como inteiramente gerado por IA.

Por que meu relatório mostra um asterisco em vez de um número? Abaixo do limiar de 20%, a fabricante não atribui pontuação nem destaques e exibe `*%` no lugar, afirmando que isso é para evitar a possível ocorrência de falsos positivos.

Uma pontuação baixa ou alta prova quem escreveu o meu documento? Não. O exemplo da fabricante diz que uma proporção exibida pode subestimar o texto de IA, mas as páginas verificadas não publicam as informações de calibração e de taxa base necessárias para transformar uma porcentagem individual em peso de evidência. A fabricante também diz que a porcentagem não deve ser a única base para uma ação.

Continue lendo