Perplexity y burstiness explicados: qué detectores de IA los usan

GPTZero usa perplexity y burstiness; Turnitin no. Definimos ambas métricas, explicamos la diferencia y mostramos por qué importa para tu estrategia de escritura.

Equipo de HumanPen

· 5 min de lectura

Qué significa la perplexity

La perplexity mide la predictibilidad de las palabras. Cuando un modelo de lenguaje lee una oración, asigna a cada palabra una probabilidad basada en las palabras anteriores. Si la palabra siguiente es muy predecible, la perplexity de esa palabra es baja. Si resulta inesperada, la perplexity es alta. La perplexity de un texto completo es, en esencia, el promedio de lo predecibles que fueron las elecciones de palabras a lo largo de todo el texto.

Piénsalo así. Si escribes «El experimento mostró un significativo», lo más probable es que la palabra siguiente sea «resultado», «cambio» o «efecto». Son palabras de alta probabilidad. Si en cambio la palabra siguiente es «ananás», esa es una palabra de baja probabilidad y la perplexity en esa posición se dispararía. Un texto que elige siempre la palabra más esperada tiene una perplexity general baja. Un texto que toma decisiones inesperadas tiene una perplexity más alta.

Los textos generados por IA tienden a tener una perplexity baja porque los modelos de lenguaje están diseñados para elegir la palabra siguiente más probable. Optimizan la probabilidad contextual, así que sus elecciones de palabras caen en patrones predecibles. La escritura humana, en cambio, suele incluir elecciones menos predecibles: verbos inusuales, sustantivos especializados o giros que un modelo de lenguaje no habría elegido. Esta diferencia es real y medible. La pregunta es si todos los detectores de IA usan la perplexity dentro de su algoritmo, y la respuesta es no.

Qué significa la burstiness

La burstiness mide la variación en la estructura de las oraciones. Si todas las oraciones de un párrafo tienen más o menos la misma extensión, la misma estructura gramatical y el mismo ritmo, la burstiness es baja. Si las oraciones varían mucho —algunas cortas y contundentes, otras largas y complejas, con subordinadas—, la burstiness es alta.

La escritura humana tiende a tener más burstiness que el texto generado por IA. Escribimos a ráfagas. Mezclamos una oración corta y directa con otra más larga que incluye un inciso. Rompemos el patrón cuando queremos destacar algo. Los modelos de IA tienden a producir estructuras más uniformes porque optimizan la coherencia estadística. El resultado es un texto que se lee con fluidez, pero con menos variación estructural.

La burstiness se popularizó como métrica de detección porque capta algo real sobre cómo se diferencian la escritura humana y la de IA. Los humanos son irregulares; los modelos de IA, constantes. Un detector que mide la burstiness observa si la estructura de tus oraciones varía lo suficiente como para parecer humana. Como la perplexity, la burstiness es un concepto útil. Y también como la perplexity, no es una métrica que todos los detectores calculen.

Qué detectores usan estas métricas

GPTZero es el ejemplo más conocido de detector que usa públicamente la perplexity y la burstiness como métricas con nombre propio. Su documentación describe la perplexity como una medida de lo impredecible que es un texto, y la burstiness como una medida de la variación a nivel de oración. El algoritmo de GPTZero calcula esas métricas y las usa en su decisión de clasificación. Si quieres entender cómo se comporta GPTZero —o ajustar tu texto a eso—, la perplexity y la burstiness son directamente relevantes.

Turnitin adopta otro enfoque. Su FAQ oficial dice: «Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.» (Nuestro modelo no está programado explícitamente para evaluar señales específicas como 'burstiness', 'perplexity' u otras métricas individuales que a veces se mencionan en debates públicos.) La frase siguiente dice: «Instead, it learns statistical patterns from our training data.» (En cambio, aprende patrones estadísticos a partir de nuestros datos de entrenamiento.) Es una negación directa y explícita de que Turnitin calcule estas dos métricas.

Esta distinción importa porque las dos herramientas a veces clasifican el mismo texto de forma distinta. Un texto diseñado para tener una burstiness y una perplexity altas puede obtener una puntuación distinta en GPTZero (donde esas métricas forman parte directa del algoritmo) que en Turnitin (donde el clasificador aprendió patrones de los datos de entrenamiento sin calcular ninguna de las dos). Los consejos que dicen «aumenta tu burstiness» o «baja tu perplexity» están pensados para un tipo concreto de detector. Puede que te sirvan con Turnitin o puede que no.

Qué usa Turnitin en su lugar

Si Turnitin no calcula ni la perplexity ni la burstiness, ¿qué usa? La documentación describe un clasificador que aprende patrones estadísticos de los datos de entrenamiento y luego los aplica a segmentos de tu texto.

Turnitin afirma: «Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. Instead, it learns statistical patterns from our training data.» (Nuestro modelo no está programado explícitamente para evaluar señales específicas como 'burstiness', 'perplexity' u otras métricas individuales que a veces se mencionan en debates públicos. En cambio, aprende patrones estadísticos a partir de nuestros datos de entrenamiento.) El clasificador no aplica ninguna fórmula de perplexity ni de burstiness. Aplica patrones interiorizados durante el entrenamiento, patrones que tienen que ver con la probabilidad de las palabras, pero que no se reducen a una sola puntuación con nombre.

La misma página de preguntas frecuentes confirma en qué se fija el clasificador: «Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.» (Nuestros clasificadores están entrenados para detectar esas diferencias en la probabilidad de las palabras y conocen bien las secuencias particulares de probabilidad de palabras de los escritores humanos.) La probabilidad de las palabras es central en lo que el clasificador de Turnitin aprendió, pero el modelo la procesa mediante patrones aprendidos, no mediante un cálculo explícito de perplexity.

El mecanismo funciona por segmentos. Turnitin lo describe así: «When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated.» (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada segmento lo clasifica el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA.) Los segmentos se superponen, las oraciones heredan puntuaciones, se agrupan varias puntuaciones y la agregación final produce el porcentaje a nivel de documento. En este proceso no hay ningún paso en el que se calculen la perplexity o la burstiness.

Turnitin también señala: «As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms.» (Como resultado, sus resultados los generan muchos patrones aprendidos que actúan en conjunto, y no un pequeño conjunto de reglas transparentes y legibles para las personas. Por eso, las predicciones individuales no siempre pueden explicarse de forma sencilla, característica por característica.) El proceso de decisión del modelo no es algo que puedas reconstruir siguiendo un puñado de métricas.

La diferencia práctica para tu escritura

La conclusión práctica es sencilla. Si lees un consejo que dice «baja tu perplexity para vencer a Turnitin», ese consejo se basa en un malentendido sobre la herramienta. Turnitin no calcula la perplexity. Los consejos sobre burstiness y perplexity pueden ser relevantes para GPTZero, pero no encajan con el mecanismo de Turnitin.

El problema es que el clasificador de Turnitin no usa estos conceptos como métricas con nombre. Aprendió patrones estadísticos de los datos de entrenamiento —patrones que incluyen información sobre la probabilidad de las palabras— y los aplica a tu texto. No puedes optimizar una métrica que el clasificador no calcula. Lo que sí puedes hacer es escribir de una forma que refleje una autoría humana genuina, con variación natural en la elección de palabras y en la estructura, distinta de los patrones que producen los modelos de IA.

Ofrecemos repeticiones gratuitas para que pruebes tu texto y veas cómo está. Pruébalo aquí.

Seguir leyendo