Pangram x Turnitin: por que as duas pontuações de IA não se alinham

Uma revista, uma escola ou uma plataforma de publicação passou o seu texto pelo Pangram, e você também tem um número do Turnitin. Eles discordam. O motivo é mais específico do que «modelos diferentes». Os dois fornecedores nem sequer relatam o mesmo tipo de métrica e, por baixo disso, contam unidades diferentes sobre corpora diferentes. Aqui está o que cada um publica e o que você pode fazer com dois números que não vão se reconciliar.

Equipe HumanPen

· 19 min de leitura

A resposta curta

Um resultado do Pangram e um resultado do Turnitin não são duas leituras da mesma grandeza; uma diferença entre eles é esperada, e não uma prova de que um dos dois está quebrado. O whitepaper do Turnitin de agosto de 2024 afirma que a empresa não usa "accuracy" (exatidão) como métrica. A página inicial do Pangram, verificada em 15 de setembro de 2026, exibe o selo "99.9%+ Accuracy" (exatidão acima de 99,9%). Por baixo do título, os dois divergem de novo: a FAQ do Turnitin descreve frases avaliadas dentro de segmentos sobrepostos e uma porcentagem calculada sobre o texto elegível, enquanto o model card do Pangram descreve predição em nível de token com três rótulos e frações do documento ponderadas por caracteres. O número que tem consequências é o produzido pela ferramenta que a sua instituição usa para tomar a decisão.

Os dois fornecedores discordam sobre qual métrica relatar

O whitepaper do Turnitin, Turnitin's AI Writing Detection Model Architecture and Testing Protocol, datado de agosto de 2024, diz o seguinte:

"Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed." (O Turnitin não usa "accuracy" como métrica, por ser manipulável com demasiada facilidade e depender demasiado do conjunto de dados específico sobre o qual é calculada.)

A frase seguinte dá o motivo, e você mesmo pode conferir a aritmética:

"For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system." (Por exemplo, considere um conjunto de dados com 100 textos, dos quais 99 são escritos por humanos. Um algoritmo simples e ingênuo que identifique todos os textos como "human-written" alcançaria 99% de exatidão nesse conjunto, apesar de não ter valor nenhum como sistema de detecção de escrita por IA.)

É esse exemplo que vale levar daqui. Um detector que nunca sinaliza nada acerta 99 daqueles 100, de modo que o número se move com a composição do conjunto de teste, e não com a qualidade do detector. O whitepaper diz que o Turnitin "uses two main metrics to test AIW-2: recall and FPR" (usa duas métricas principais para testar o AIW-2: recall e FPR), e define ambas na mesma seção, com exemplos resolvidos.

O Pangram publica um número de exatidão com destaque. O selo da página inicial diz "99.9%+ Accuracy" (exatidão acima de 99,9%; verificado em 15 de setembro de 2026). A página de ensino superior traz os dois ao mesmo tempo: "99.98% accuracy" (99,98% de exatidão) na frase de abertura e um selo "99.9%+ Accuracy" (exatidão acima de 99,9%) 52 caracteres depois, na mesma faixa, com apenas "Detects AI Assistance Free Credits" (detecta assistência de IA, créditos grátis) entre os dois. O model card do Pangram para o Pangram 4, datado de 29 de julho de 2026, não destaca exatidão alguma: ele relata taxas de falso positivo e de falso negativo discriminadas por corpus, idioma e domínio.

Portanto, os dois números de destaque não são um valor alto e um valor baixo para a mesma propriedade. Um fornecedor publicou uma objeção por escrito à métrica que o outro coloca na frente. Não estamos dizendo que alguma das escolhas está errada, e nada disso é segredo: as duas declarações estão hoje em páginas públicas.

O que cada pontuação está realmente contando

Os dois sistemas devolvem uma porcentagem. As porcentagens são construídas com material bruto diferente.

Turnitin (FAQ e whitepaper de agosto de 2024)Pangram (model card do Pangram 4, 29 de julho de 2026)
Unidade classificadaFrases, agrupadas em segmentos sobrepostosTokens, decodificados em segmentos de comprimento variável
Tratamento da sobreposiçãoFrases em vários segmentos recebem várias pontuações, "which are then pooled into a single score" (que depois são reunidas em uma única pontuação)"predictions for tokens that appear in multiple windows are aligned and averaged" (as predições para tokens que aparecem em várias janelas são alinhadas e calculadas pela média), dentro de uma janela de inferência de 512 tokens
De que a porcentagem do documento é uma parteSomente o texto elegível. "this percentage is not necessarily the percentage of the entire submission" (esta porcentagem não é necessariamente a porcentagem do envio inteiro)O documento analisado. `fraction_human`, `fraction_ai_assisted` e `fraction_ai` são "character-weighted" (ponderadas por caracteres) e "sum to 1.0" (somam 1,0)
Número de classesDuas. A porcentagem cobre o texto "likely generated by AI or likely generated and modified by an AI paraphraser or bypasser" (provavelmente gerado por IA, ou provavelmente gerado e modificado por um paraphraser ou por um contornador de IA)Três: `Human` (humano), `AI-Assisted` (assistido por IA), `AI-Generated` (gerado por IA)
Extensão mínima300 palavras de prosa50 palavras
Resultados baixosDe 1% a 19%, aparece um asterisco, sem porcentagem e sem destaques`prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise (devolve a forma curta "escrito por humano" quando os caracteres humanos representam pelo menos 90%, "IA" quando os caracteres gerados por IA representam pelo menos 80% e "misto" nos demais casos)

É a linha do denominador que morde. A FAQ do Turnitin diz que a porcentagem exibida cobre "the amount of qualifying text within the submission" (a quantidade de texto elegível dentro do envio), e que "If text within the submission is not considered long-form prose text, it will not be included." (Se o texto dentro do envio não for considerado prosa de forma longa, ele não será incluído.) As frações do Pangram cobrem o texto analisado e somam 1,0. Dê aos dois sistemas um trabalho com uma longa lista de referências, um sumário e duas ou três tabelas, e eles já não estarão operando sobre o mesmo corpo de palavras antes de qualquer modelo rodar. Como ler um relatório de escrita por IA do Turnitin percorre o que entra e o que fica fora do denominador do Turnitin.

Por que o 1% e o 1 em 10.000 não estão na mesma escala

Estes são os dois números que as pessoas colocam lado a lado, e dividir um pelo outro produz uma razão que não significa nada. Ambos se chamam taxa de falso positivo. Nenhum dos dois é medido do modo como o outro é medido.

A FAQ do Turnitin estabelece uma meta:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Buscamos maximizar a eficácia do nosso detector mantendo a nossa taxa de falso positivo - identificar incorretamente como gerado por IA um texto inteiramente escrito por humano - abaixo de 1% para documentos com mais de 20% de escrita por IA.)

Essa condição no fim da frase sustenta a afirmação, e o whitepaper explica de onde ela vem. Um documento é rotulado como gerado por IA quando mais de 20% das suas pontuações em nível de frase ultrapassam um limiar de frase, e o whitepaper diz que "the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%)." (o ponto de corte de 20% da proporção do documento, bem como o limiar predeterminado do modelo, foram escolhidos para manter a taxa de falso positivo em nível de documento abaixo de 0,01 (1%)). O corte e a taxa são partes de um único mecanismo, não uma afirmação independente sobre ele. O que significa uma taxa de falso positivo de 1% quando uma universidade envia 75.000 trabalhos faz essa multiplicação.

A FAQ da página inicial do Pangram informa uma taxa:

"Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents." (A taxa de falso positivo do Pangram - a taxa com que documentos humanos são incorretamente sinalizados como IA - é atualmente de 1 em 10.000. Este número é calculado sobre um agregado de conjuntos de dados públicos que contém dezenas de milhões de documentos escritos.)

O model card dá um número mais estreito, com um corpus nomeado: "At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples." (No ponto de operação de produção, o Pangram 4 alcança uma taxa de falso positivo de 0,0041% - cerca de 1 em 24.000 - em 1.000.000 de exemplos de avaliação FineWeb em inglês escritos por humanos.) Uma segunda tabela no card discrimina a taxa por domínio, e a sua linha de escrita acadêmica apresenta 0,019% sobre 62.971 itens, acima do número geral do inglês que aparece logo acima.

Regras de rotulagem diferentes, pontos de operação diferentes e, do lado do Turnitin, uma taxa que só vale acima do corte de 20%. Por isso não vamos lhe entregar uma comparação aritmética entre os dois números. O que você pode fazer é perguntar sobre o que cada um foi medido, e os dois fornecedores respondem isso por escrito. A FAQ do Turnitin diz que valida a sua taxa contra "over 700,000 additional academic papers that were written before the release of ChatGPT" (mais de 700.000 artigos acadêmicos adicionais escritos antes do lançamento do ChatGPT). A página inicial do Pangram atribui a sua taxa a "an aggregate of public datasets" (um agregado de conjuntos de dados públicos), e o seu model card atribui o número mais estreito a exemplos do FineWeb, com a escrita acadêmica aparecendo separadamente como uma linha de domínio entre onze. São respostas a perguntas diferentes, e esse é todo o problema.

Uma porcentagem pode ser uma parte, ou pode ser uma confiança

Dois relatórios podem exibir "99%" e significar coisas diferentes, e os dois fornecedores dizem isso na própria documentação.

O model card do Pangram trata os números do documento como partes: as três frações são porções do texto ponderadas por caracteres que somam 1,0. Ele também deixa explícito que os seus outros números não são o que parecem. ai_assistance_score é "a continuous AI-involvement score, not the probability of the displayed discrete label" (uma pontuação contínua de envolvimento da IA, não a probabilidade do rótulo discreto exibido), e o valor de confiança do segmento "measures the peakedness of the unconstrained CRF posterior, it is not a calibrated probability estimate." (mede a concentração da posterior CRF irrestrita; não é uma estimativa de probabilidade calibrada). Lido de forma direta, um segmento marcado como High é aquele em que as pontuações internas do modelo se agruparam firmemente em torno de um único rótulo, e o fornecedor está lhe dizendo para não converter isso em probabilidades.

A página de orientação do Pangram para professores lê uma porcentagem do outro modo:

"If a segment of text gets a 99% AI score, that doesn't mean we necessarily think the entire text was AI-generated. Rather, we are 99% confident that AI was used to generate some portion of the text." (Se um segmento de texto recebe uma pontuação de IA de 99%, isso não significa que necessariamente pensamos que o texto inteiro foi gerado por IA. Em vez disso, temos 99% de confiança de que a IA foi usada para gerar alguma parte do texto.)

A FAQ do Turnitin também adverte contra a leitura como parte: "Unlike our Similarity Report, the AI writing percentage does not necessarily correlate to the amount of text in the submission." (Ao contrário do nosso Similarity Report, a porcentagem de escrita por IA não corresponde necessariamente à quantidade de texto no envio.)

Antes de comparar duas porcentagens, descubra de que cada uma é porcentagem. Se uma é uma parte dos caracteres e a outra é um nível de confiança, elas nunca iam concordar, e nenhuma das duas estava lhe mentindo. Por que o mesmo texto tem pontuação diferente em cada detector reúne os outros motivos.

O mesmo rótulo está sobre números com denominadores diferentes

Uma taxa de falso positivo só significa algo junto com o conjunto de documentos sobre o qual foi calculada. Os dois fornecedores publicam vários números sob um único rótulo, e um par merece ser percorrido por inteiro, porque a explicação óbvia para a diferença acaba sendo a errada.

Primeiro o Pangram, tudo verificado em 15 de setembro de 2026. Leia a coluna da direita com tanto cuidado quanto a da esquerda: uma parte da dispersão vem de qual página você acessou, e outra parte é aquilo contra o que cada número foi medido.

NúmeroOnde ele aparece
"99.9%+ Accuracy" (exatidão acima de 99,9%)Selo da página inicial e um selo na faixa da página de ensino superior
"99.98% accuracy" (99,98% de exatidão)Frase de abertura da mesma faixa, 52 caracteres antes
"99.26% overall" (99,26% no geral)Pangram vs. Turnitin, um post datado de 28 de julho de 2026
Nenhum número de exatidãoModel card do Pangram 4, datado de 29 de julho de 2026, que em vez disso relata FPR e FNR por corpus
"1 in 10,000" (1 em 10.000)FAQ da página inicial, sobre "an aggregate of public datasets" (um agregado de conjuntos de dados públicos)
"roughly 1 in 24,000" (cerca de 1 em 24.000)Model card, sobre 1.000.000 de exemplos em inglês do FineWeb
"approximately 1 in 25,000" (aproximadamente 1 em 25.000) para ensaios acadêmicosO post de 28 de julho de 2026
0,019% para "Academic Writing (English)" (escrita acadêmica, inglês)Model card, sobre 62.971 itens, acima do próprio número geral

O Turnitin produz a versão mais branda disso dentro de um único arquivo: o whitepaper de agosto de 2024 dá a taxa de falso positivo em nível de documento do AIW-2 como 0,5% no texto corrido e como 0,51% na Tabela 1, sobre o mesmo conjunto de 719.877 trabalhos de estudantes anteriores a 2019.

O par que importa mais são os dois números que o Turnitin publica com o mesmo nome de taxa de falso positivo em nível de frase. Em junho de 2023, o seu Chief Product Officer escreveu:

"Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." (A nossa taxa de falso positivo em nível de frase é de cerca de 4%. Isso significa que há 4% de probabilidade de que uma frase específica destacada como escrita por IA tenha sido escrita por um humano.)

O whitepaper de agosto de 2024 dá 0,33%, a partir de um teste de estresse com trabalhos enviados antes de 2019, sobre os quais diz: "All papers in this dataset are human written." (Todos os trabalhos neste conjunto de dados são escritos por humanos.)

A leitura tentadora é que um modelo mudou no meio do caminho. Mudou, e isso não explica a diferença. O whitepaper diz que o AIW-1 foi lançado em abril de 2023 e que "In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model" (Em dezembro de 2023, o Turnitin lançou o AIW-2, um modelo atualizado e melhorado para substituir o modelo AIW-1); portanto, o modelo que rodava em junho de 2023 era o AIW-1. Procure então o AIW-1 na própria Tabela 2 do whitepaper: naquele mesmo conjunto de 719.877 trabalhos, a sua taxa de falso positivo em nível de frase é de 0,42%, não de 4%. Mesmo modelo, mesmo rótulo, dois números separados por uma ordem de grandeza. A história da versão desmorona.

O que difere é o conjunto sobre o qual cada porcentagem é calculada. Os 4% são condicionais a uma frase que já foi destacada: das frases que o detector sinalizou, essa parte pode acabar sendo humana. Os 0,42% e os 0,33% incidem sobre escrita que já é inteiramente humana de saída: de todas essas frases, essa parte foi sinalizada. Elas respondem a duas perguntas diferentes, e não há motivo para cair perto uma da outra. Você pode ler a definição dos 4% em a explicação de junho de 2023 do Turnitin.

Nada disso é um fornecedor pego em falha, e nada disso é um número ficando velho. É o que acontece quando uma mesma expressão é presa a várias medições diferentes. Então, quando lhe jogarem uma taxa numa reunião, a pergunta que leva a algum lugar é sobre qual conjunto ela foi calculada. Todos os documentos enviados? Só as frases já destacadas? Só a prosa elegível? Uma porcentagem sem o conjunto não pode ser conferida, e também não pode ser contestada.

Que testes independentes existem, e o que eles não resolvem

Um único estudo revisado por pares e de acesso aberto testou as duas ferramentas frente a frente. Who wrote this? Evaluating the reliability of AI detection tools in higher education, publicado no International Journal for Educational Integrity em 29 de junho de 2026, montou um conjunto sintético de 160 artigos acadêmicos em inglês, quarenta em cada uma das quatro categorias, cada um com pelo menos 4.000 palavras.

No conjunto escrito por humanos, o resultado vale para as quatro ferramentas testadas: "all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers." (todas as quatro ferramentas classificaram corretamente 100% dos textos humanos como "verdadeiros negativos" - recebendo uma pontuação entre 0 e 20%. Isso indica que nenhum dos detectores é propenso a sinalizar incorretamente escrita humana como gerada por IA nesta coleção de trabalhos). No conjunto inteiramente gerado por IA, as duas ferramentas se separaram. O artigo relata que "Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)" (o Turnitin classificou 100% dos trabalhos totalmente gerados por IA como falsos negativos - pontuações entre 0 e 20%), e que "Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified." (o Pangram foi a única ferramenta que teve bom desempenho, com exatidão estrita de 65% e exatidão inclusiva de 97,5%, deixando apenas um caso mal classificado).

Antes de alguém citar isso contra você em qualquer uma das direções, os autores estabelecem os próprios limites: "the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category" (o escopo da nossa pesquisa ficou limitado a 160 trabalhos, quatro ferramentas de detecção de IA e um modelo de GenAI - GPT-4o Deep Research - para a categoria totalmente gerada por IA), e os resultados são "valid only for a specific snapshot in time" (válidos apenas para um retrato específico no tempo). A recomendação deles às instituições é a frase que vale levar para uma reunião: as ferramentas de detecção "should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy." (não devem ser usadas como única prova em decisões de alto impacto, mas sim inseridas numa estratégia de avaliação mais ampla).

Uma nota de redação, porque a versão editada circula mais do que a original. A frase final do artigo diz: "From the four AI detection tools studied here, at this moment only one produced satisfactory results." (Das quatro ferramentas de detecção de IA estudadas aqui, neste momento apenas uma produziu resultados satisfatórios.) O próprio resumo do estudo feito pelo Pangram a apresenta como "only [Pangram] produced satisfactory results" (apenas [Pangram] produziu resultados satisfatórios), com a substituição entre colchetes.

Dois outros trabalhos são citados nesta comparação, e ambos precisam de uma ressalva. Um research brief do Becker Friedman Institute da University of Chicago, datado de 6 de outubro de 2025, diz que "Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages" (Entre as opções comerciais, o Pangram alcança taxas de falso positivo e de falso negativo essencialmente nulas em passagens de comprimento médio a longo). Ele não testou o Turnitin: as quatro ferramentas foram Pangram, Originality.ai, GPTZero e uma linha de base RoBERTa. O seu corpus foi de 1.992 passagens em seis gêneros cotidianos, incluindo notícias, blogs, avaliações de consumidores e currículos, e não trabalhos de estudantes. Há também uma ligação que vale colocar na mesa, com as duas metades dela: um dos dois autores, Alex Imas, aparece num depoimento assinado na página inicial do Pangram, e o working paper traz na primeira página uma linha dizendo "All authors declare that they have no financial or personal conflicts of interest related to this study." (Todos os autores declaram não ter conflitos de interesse financeiros ou pessoais relacionados a este estudo.) O paper é um download gratuito no site do instituto, a dois cliques do brief. Pese isso como achar que merece; preferimos que você visse os dois fatos a nenhum.

O segundo é o teste prático de um repórter da TechCrunch em julho de 2026, que produziu dois números a partir de um único artigo: "Pangram gave it a 13% AI assisted score" (o Pangram lhe deu uma pontuação de assistência por IA de 13%), e "when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score." (quando entreguei ao Pangram esse mesmo artigo por inteiro, do jeito que eu o havia escrito, ele recebeu uma pontuação humana de 100%). A sessão de um jornalista não é um benchmark. É um registro em primeira mão de como o modo de enviar um texto muda o número que volta, que é exatamente a posição em que você fica quando duas instituições rodam dois arquivos diferentes.

Há ainda o caso em que os dois não podem ser comparados, porque só um deles devolve um número. O mesmo artigo revisado por pares observa, sob a sua figura principal, que "Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score" (o Turnitin considera incertos os trabalhos com pontuação de IA entre 0% e 20% e os marca com um asterisco em vez de uma pontuação numérica), e que, por isso, "19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure." (19 trabalhos totalmente gerados por IA, 7 híbridos, 6 humanizados e 3 totalmente humanos foram codificados como ausentes na figura). São 35 dos 160 trabalhos sem nenhum número do Turnitin para contrapor a coisa alguma. Se o seu resultado do Turnitin é um asterisco, você não está defendendo uma pontuação baixa; você não tem pontuação, e o que o asterisco (*%) significa numa pontuação de IA do Turnitin explica a regra de exibição por trás disso.

O que você pode fazer quando os dois resultados discordam

Comece conseguindo os relatórios, porque dos dois lados você depende de quem os rodou. A FAQ do Turnitin diz que "The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students." (O indicador e o relatório de detecção de escrita por IA não ficam visíveis para os estudantes. No entanto, com o recurso de download em PDF, os instrutores podem baixar e compartilhar o relatório de IA com os estudantes.) O help centre do Pangram diz que um resultado pode ser compartilhado como link, e que os destinatários "will see the scan overview and segment details without having to create a Pangram account." (verão a visão geral da varredura e os detalhes dos segmentos sem precisar criar uma conta no Pangram). Peça os dois e, do lado do Pangram, peça especificamente o link de compartilhamento em vez de uma captura de tela: a visão por segmentos mostra quais passagens produziram o número, e a captura de tela de uma porcentagem não lhe mostra nada com que se possa trabalhar.

Não conte com corrigir o registro diretamente no Pangram. O controle de feedback dele está ligado à conta que rodou a varredura: a página de ajuda diz para "Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account" (Abrir o resultado sobre o qual você quer dar feedback, seja depois de escaneá-lo ou pela página History / All Checks da sua conta), com um joinha para cima e um joinha para baixo abaixo do resultado. Uma varredura feita pelo seu professor não está na sua conta.

Também não encontramos uma via de recurso publicada para a pessoa que recebe o resultado. Lemos o texto corrido de todas as 256 URLs listadas no sitemap do Pangram em 15 de setembro de 2026, 2.117.382 caracteres no total, e pesquisamos em todas as páginas. `appeal` (recurso, aqui no sentido de algo atraente) aparece em uma, num post de blog sobre publicidade. `dispute` (contestação) aparece em duas: a cláusula de arbitragem dos termos de serviço e um post de parceria sobre disputas de autoria. `grievance` (queixa), `contest` (contestar), `redress` (reparação), `ombuds` (ouvidoria) e `request a review` (pedir uma revisão) não aparecem em nenhuma das 256. A mesma busca encontrou `false positive` (falso positivo) em 162 dessas páginas e `student` (estudante) em 182, e é assim que você sabe que o contador estava encontrando correspondências em vez de devolver zero discretamente para cada consulta.

Um limite dessa contagem, já que é o tipo de afirmação que você deveria poder quebrar se estiver errada: um sitemap não é o site inteiro. A página que este artigo mais cita, o model card do Pangram 4, responde 200 e não está listada nesse sitemap. Leia então o resultado como 256 páginas listadas sem nenhuma via desse tipo nelas, não como uma afirmação sobre todas as páginas que o Pangram hospeda. E leia nos dois sentidos: não significa que o Pangram recusa correções, e certamente não significa que a sua instituição não tenha processo. Significa que o fornecedor não é o endereço para isso.

Duas organizações que usam o Pangram publicam uma via própria, e são essas que vale conhecer. O Substack diz aos escritores para "select Report detection error" (selecionar Report detection error) num relatório de detecção de IA, e documenta um controle "Disable AI detection" (desativar a detecção de IA) nos rascunhos. A Wiki Education, que passa pelo Pangram as edições na Wikipédia feitas pelos seus participantes, diz aos instrutores o que esteve por trás da maioria dos erros que confirmou: "If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen." (Se um estudante salva um esqueleto vazio - por exemplo, apenas com marcadores curtos ou cabeçalhos de seção vazios - ou inclui uma quantidade significativa de texto que não é prosa, como fragmentos de frase ou entradas bibliográficas, isso pode acionar o detector de IA. O texto que não é prosa é um fator comum na maioria dos falsos positivos confirmados que vimos.) Ela também escreve que "not use Pangram as definitive proof that the text was AI generated" (não usa o Pangram como prova definitiva de que o texto foi gerado por IA), mas sim "a way to flag which text needs additional human scrutiny for verifiability." (como uma forma de sinalizar qual texto precisa de exame humano adicional para verificar a sua comprovação).

Esse ponto sobre o texto que não é prosa pode ser verificado no seu próprio arquivo, e o model card do Pangram o respalda do lado do fornecedor. O modelo é pensado para escrita "of at least 50 words, written primarily in complete sentences" (de pelo menos 50 palavras, escrita principalmente em frases completas), e o card lista o que fica fora desse escopo, incluindo "tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation" (sumários, seções de referências, escrita baseada em modelos ou automatizada, instruções e manuais técnicos, e texto dominado por notação matemática). Ele acrescenta que "human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document" (cabeçalhos, rodapés, instruções e outras formatações estranhas escritos por humanos devem ser removidos antes de verificar um documento), e que "Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts." (texto puro e arquivos .docx são recomendados em vez de PDFs, quando disponíveis, porque a leitura de PDFs pode introduzir artefatos indesejados). Duas perguntas concretas, então, para quem rodou a varredura: era um PDF, e a lista de referências e o material preliminar foram juntos com ele?

Algumas linhas valem ser citadas numa reunião justamente porque vêm dos fornecedores, e não de nós. A orientação do Pangram para professores diz que "we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures" (acreditamos que a detecção de IA é uma ótima forma de sinalizar trabalhos, mas uma detecção exige investigação mais aprofundada antes de qualquer medida punitiva - a grafia é deles), e acrescenta que "A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong." (Uma taxa de falso positivo diferente de zero significa que qualquer detecção positiva pode ser real, ou pode ser o caso estatisticamente anômalo de um em dez mil em que o Pangram se engana.) A FAQ do Turnitin diz que "Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies." (O Turnitin não faz uma determinação de má conduta; em vez disso, fornece dados para que os educadores tomem uma decisão informada com base nas suas políticas acadêmicas e institucionais.)

A página do Pangram para professores também aponta os instrutores para evidências do processo de escrita, citando o Google Docs: "select File -> Version history -> See version history to see a full history of their writing process." (selecionar File -> Version history -> See version history para ver o histórico completo do processo de escrita deles). Se você tem esse histórico, ele tira a conversa da questão de qual porcentagem está certa, que é justamente a única pergunta que os números publicados não conseguem resolver. Como manter o histórico de versões no Word, no Google Docs e no Overleaf mostra onde cada ferramenta o guarda, e marcado por IA injustamente: como recorrer e que evidências a sua universidade aceitará cobre o resto do processo.

O que isso significa para você

  • Os dois fornecedores não relatam a mesma métrica. O whitepaper do Turnitin de agosto de 2024 diz que não usa exatidão como métrica; o Pangram coloca na frente um número de exatidão na sua página inicial e na sua página de ensino superior.
  • As porcentagens contam coisas diferentes. A do Turnitin cobre apenas a prosa elegível; as frações do Pangram são ponderadas por caracteres sobre o texto analisado e somam 1,0. A meta do Turnitin de ficar abaixo de 1% também está condicionada a documentos com mais de 20% de escrita por IA, de modo que não há conta que a transforme no 1 em 10.000 do Pangram.
  • Pergunte sobre qual conjunto uma porcentagem foi calculada, não qual versão a produziu. O Turnitin publica duas taxas em nível de frase: cerca de 4% (junho de 2023) e 0,33% (whitepaper de agosto de 2024). Uma troca de modelo realmente aconteceu entre elas, em dezembro de 2023, e não explica a diferença: o whitepaper coloca o modelo mais antigo em 0,42% no seu corpus de teste, não em 4%. O que as separa é o conjunto. Os 4% contam apenas as frases já destacadas; os 0,42% e os 0,33% incidem sobre escrita inteiramente humana.
  • Descubra se o seu número é uma parte ou uma confiança antes de compará-lo com qualquer coisa.
  • Um asterisco não é uma pontuação baixa. No estudo revisado por pares, 35 dos 160 trabalhos não tinham nenhum número do Turnitin.
  • Encaminhe a sua contestação por quem rodou a varredura. O controle de feedback do Pangram fica na conta que escaneou, e nenhuma das 256 páginas listadas no sitemap dele traz uma via de recurso para a pessoa que foi sinalizada. Peça o próprio relatório, e o link de compartilhamento do Pangram com a sua visão por segmentos.

Se você tem em mãos um relatório do Turnitin ou do iThenticate, pode importar o relatório e trabalhar nas passagens que ele sinalizou. Passagens elegíveis podem ser reprocessadas sem custo.

Continue lendo