Perplexity e burstiness explicados: quais detectores de IA realmente os usam

O GPTZero usa perplexity e burstiness. O Turnitin não. A gente define as duas métricas, explica a diferença entre elas e mostra por que isso importa para a sua estratégia de escrita.

Equipe HumanPen

· 5 min de leitura

O que é perplexity

Perplexity é uma medida de previsibilidade das palavras. Quando um modelo de linguagem lê uma frase, ele atribui uma probabilidade a cada palavra com base nas palavras que vieram antes. Se a palavra seguinte é muito previsível, a perplexity daquela palavra é baixa. Se a palavra seguinte é inesperada, a perplexity é alta. A perplexity de um texto inteiro é basicamente a média de quão previsíveis foram as escolhas de palavras ao longo dele.

Pense assim. Se você escrever "O experimento mostrou uma diferença," a próxima palavra muito provavelmente será "significativa", "clara" ou "expressiva". São palavras de probabilidade alta. Se, em vez disso, a próxima palavra for "abacaxi", a probabilidade é baixa, e a perplexity naquela posição dispara. Um texto que escolhe sempre a palavra mais esperada tem perplexity geral baixa. Um texto que faz escolhas inesperadas tem perplexity mais alta.

Textos gerados por IA tendem a ter perplexity baixa porque os modelos de linguagem são projetados para escolher a próxima palavra mais provável. Eles otimizam a probabilidade contextual, o que faz com que as escolhas de palavras caiam em padrões previsíveis. A escrita humana, ao contrário, costuma trazer escolhas menos previsíveis, verbos incomuns, substantivos específicos de uma área ou formulações que um modelo de linguagem não teria escolhido. Essa diferença é real e mensurável. A questão é se todo detector de IA usa perplexity como parte do algoritmo que ele realmente roda, e a resposta é não.

O que é burstiness

Burstiness é uma medida de variação na estrutura das frases. Se todas as frases de um parágrafo têm mais ou menos o mesmo tamanho, a mesma estrutura gramatical e o mesmo ritmo, a burstiness é baixa. Se as frases variam bastante, umas curtas e diretas, outras longas e complexas com orações subordinadas, a burstiness é alta.

A escrita humana tende a ter burstiness maior do que a de textos gerados por IA. A gente escreve em rajadas. A gente mistura uma frase curta e direta com uma mais longa que traz um comentário entre parênteses. A gente quebra o padrão quando quer enfatizar um ponto. Os modelos de IA tendem a produzir estruturas de frase mais uniformes porque otimizam consistência estatística. O resultado é um texto que corre bem na leitura, mas tem menos variação estrutural.

A burstiness virou uma métrica de detecção popular porque captura algo real sobre como a escrita humana e a escrita de IA diferem. Humanos são irregulares. Modelos de IA são consistentes. Um detector que mede burstiness está olhando se a estrutura das suas frases varia o suficiente para parecer humana. Como a perplexity, a burstiness é um conceito útil. E, também como a perplexity, não é uma métrica que todo detector calcula.

Quais detectores usam essas métricas

O GPTZero é o exemplo mais conhecido de detector que usa publicamente perplexity e burstiness como métricas nomeadas. A documentação deles descreve perplexity como uma medida de quão imprevisível é o texto, e burstiness como uma medida de variação no nível da frase. O algoritmo do GPTZero calcula essas métricas e as usa na decisão de classificação. Se você está tentando entender o comportamento do GPTZero, ou ajustar seu texto a ele, perplexity e burstiness são diretamente relevantes.

O Turnitin segue outro caminho. A FAQ oficial deles diz: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Nosso modelo não é programado explicitamente para avaliar sinais específicos como “burstiness”, “perplexity” ou outras métricas individuais às vezes citadas em discussões públicas.) A frase seguinte diz: "Instead, it learns statistical patterns from our training data." (Em vez disso, ele aprende padrões estatísticos a partir dos nossos dados de treinamento.) Isso é uma negativa direta e explícita de que o Turnitin calcule essas duas métricas.

O motivo pelo qual essa distinção importa é que as duas ferramentas às vezes classificam o mesmo texto de formas diferentes. Um texto montado para ter alta burstiness e alta perplexity pode se sair diferente no GPTZero (onde essas métricas fazem parte direta do algoritmo) e no Turnitin (onde o classificador aprendeu padrões a partir dos dados de treinamento sem calcular nenhuma das duas). Conselhos que mandam você "aumentar sua burstiness" ou "reduzir sua perplexity" foram calibrados para um tipo específico de detector. Eles podem ajudar com o Turnitin, ou não.

O que o Turnitin usa no lugar

Se o Turnitin não calcula nem perplexity nem burstiness, o que ele usa? A documentação descreve um classificador que aprende padrões estatísticos a partir dos dados de treinamento e depois os aplica a trechos do seu texto.

O Turnitin afirma: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. Instead, it learns statistical patterns from our training data." (Nosso modelo não é programado explicitamente para avaliar sinais específicos como “burstiness”, “perplexity” ou outras métricas individuais às vezes citadas em discussões públicas. Em vez disso, ele aprende padrões estatísticos a partir dos nossos dados de treinamento.) O classificador não roda uma fórmula de perplexity nem uma fórmula de burstiness. Ele aplica padrões internalizados durante o treinamento, padrões que envolvem a probabilidade das palavras, mas que não se reduzem a um único escore com nome próprio.

A mesma página de FAQ confirma no que o classificador se concentra: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nossos classificadores são treinados para detectar essas diferenças na probabilidade das palavras e são proficientes nas sequências específicas de probabilidade de palavras típicas de quem escreve como humano.) A probabilidade das palavras está no centro do que o classificador do Turnitin aprendeu, mas o modelo a processa por meio de padrões aprendidos, e não por um cálculo explícito de perplexity.

O mecanismo é baseado em segmentos. O Turnitin descreve assim: "When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando um trabalho é enviado ao Turnitin, as frases do envio são extraídas e divididas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe um valor entre 0 e 1, que indica a probabilidade de o texto ser provavelmente humano ou gerado por IA.) Os segmentos se sobrepõem, as frases herdam os escores, vários escores são reunidos, e a agregação final produz a porcentagem do documento. Nesse encadeamento não existe uma etapa em que perplexity ou burstiness seja calculada.

O Turnitin também observa: "As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms." (Como resultado, seus resultados são produzidos por muitos padrões aprendidos atuando em conjunto, e não por um pequeno conjunto de regras transparentes e legíveis por humanos. Por esse motivo, previsões individuais nem sempre podem ser explicadas de forma simples, atributo por atributo.) O processo de decisão do modelo não é algo que você consiga desmontar acompanhando um punhado de métricas.

A diferença prática para a sua escrita

A conclusão prática é simples. Se você ler um conselho dizendo para "reduzir sua perplexity para vencer o Turnitin", esse conselho nasce de um mal-entendido sobre a ferramenta. O Turnitin não calcula perplexity. Dicas sobre burstiness e perplexity podem ser relevantes para o GPTZero, mas não se encaixam no mecanismo do Turnitin.

O ponto é que o classificador do Turnitin não usa esses conceitos como métricas nomeadas. Ele aprendeu padrões estatísticos a partir dos dados de treinamento, padrões que incluem informações de probabilidade das palavras, e os aplica ao seu texto. Você não pode otimizar para uma métrica que o classificador não calcula. O que dá para fazer é escrever de formas que reflitam uma autoria humana genuína, com variação natural na escolha das palavras e na estrutura, diferente dos padrões que os modelos de IA produzem.

Oferecemos reexecuções gratuitas para você testar sua escrita e ver onde ela está. Experimente aqui.

Continue lendo