GPTZero frente a Turnitin: por qué las puntuaciones no coinciden y qué mide realmente cada herramienta
Si pasas el mismo texto por GPTZero y Turnitin, es normal que las puntuaciones no cuadren. No es que una herramienta esté rota. Cada detector usa modelos distintos, datos de entrenamiento diferentes y convenciones de puntuación propias. La documentación de Turnitin explica cómo funciona su detector y por qué comparar herramientas entre sí no es fiable.
Equipo de HumanPen
· 5 min de lectura
Cada detector usa modelos distintos
GPTZero y Turnitin son sistemas independientes, desarrollados por equipos distintos. Cada uno tiene su propio modelo, sus datos de entrenamiento y su forma de clasificar el texto. Cuando dos detectores usan modelos diferentes, sus resultados no van a coincidir en el mismo documento. Un texto que GPTZero puntúa como 60% IA puede recibir un 30% de Turnitin, o al revés. Ninguna puntuación es necesariamente incorrecta: son estimaciones probabilísticas de modelos entrenados con datos distintos.
No existe una puntuación universal de detección de IA a la que todas las herramientas converjan. Esa es la raíz del problema en por qué el mismo texto recibe puntuaciones distintas en cada detector. Cada herramienta genera su propia estimación. Comparar puntuaciones entre herramientas como si midieran lo mismo con las mismas unidades solo genera confusión.
No afirmamos que una herramienta sea más precisa que otra. La documentación describe cómo funciona el detector de Turnitin, y ese mecanismo difiere de lo que hacen otras herramientas.
Cómo calcula Turnitin la puntuación de un documento
La documentación de Turnitin describe un proceso específico para obtener una puntuación de escritura con IA a nivel de documento:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, las frases del envío se extraen y segmentan en secciones solapadas para el análisis de predicción. Cada segmento lo clasifica el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA. Cada frase válida dentro de estos segmentos hereda la puntuación del segmento. Como los segmentos se solapan, algunas frases pueden tener varias puntuaciones, que luego se combinan en una sola. Estas puntuaciones por frase se agregan y se usan para calcular la puntuación general de IA del documento.)
La puntuación es una agregación de predicciones a nivel de segmento. Los segmentos se solapan y las puntuaciones de las frases se combinan antes de la agregación. Otros detectores pueden segmentar el texto de forma distinta, usar unidades de predicción diferentes o agregar las puntuaciones de maneras distintas.
La documentación de Turnitin aclara también que el porcentaje de detección de escritura con IA y la puntuación de Similarity son mediciones independientes: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (La puntuación de Similarity y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen entre sí). La puntuación de Similarity indica el porcentaje de texto coincidente encontrado en el documento enviado cuando se compara con la colección exhaustiva de contenido de Turnitin para verificación de similitud. Una puntuación de similitud alta no significa una puntuación de IA alta, y viceversa. Turnitin AI Writing Report vs Similarity Report los pone lado a lado.
El objetivo de falsos positivos de Turnitin
Turnitin establece un objetivo específico de falsos positivos en su documentación:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nos esforzamos por maximizar la efectividad de nuestro detector manteniendo nuestra tasa de falsos positivos —identificar incorrectamente texto fully human-written como generado por IA— por debajo del 1% para documentos con más del 20% de escritura con IA.)
La documentación reformula esto como: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Es decir, podríamos marcar un documento escrito por humanos como escrito por IA en uno de cada 100 documentos escritos íntegramente por humanos). Esta reformulación omite el calificativo "over 20% AI writing". La versión con el umbral del 20% es la declaración más precisa.
Para validar esta tasa, Turnitin describe un proceso de prueba: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Para reforzar nuestro marco de pruebas y diagnosticar tendencias estadísticas de falsos positivos, antes de cada actualización o lanzamiento de nuevo modelo, realizamos pruebas en más de 700.000 artículos académicos adicionales que fueron escritos antes del lanzamiento de ChatGPT para validar aún más nuestra tasa de falsos positivos inferior al 1%.)
Este es el objetivo declarado de Turnitin y su proceso de validación. En qué significa una tasa de falsos positivos del 1% se calcula lo que ese uno por ciento cuesta realmente a la escala que maneja una universidad. Otros detectores pueden tener objetivos distintos, métodos de validación diferentes, o puede que no publiquen cifras comparables. No podemos hacer una comparación directa de precisión entre herramientas basándonos en esta información. Solo podemos reportar lo que dice la documentación de Turnitin.
Los documentos cortos se comportan de forma distinta
La longitud del documento afecta cómo se comporta el detector de Turnitin. En textos cortos, el mecanismo de puntuación puede producir resultados extremos:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (En documentos más cortos donde solo hay unos pocos centenares de palabras, la predicción será mayormente 'todo o nada' porque estamos prediciendo sobre un solo segmento sin oportunidad de solapamiento.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Esto significa que algunos textos que son una mezcla de contenido generado por IA y original podrían marcarse como totalmente generado por IA.)
El mecanismo de solapamiento que suaviza las puntuaciones en documentos largos no funciona cuando solo hay un segmento sobre el que predecir. Unos pocos centenares de palabras de texto mixto (humano e IA) pueden retornar como 100% IA, una de las vías que cubro en por qué Turnitin dice que tu trabajo es 100% IA. Esto es una limitación con entradas cortas, no un juicio definitivo sobre la composición del texto.
Si GPTZero puntúa un documento corto de forma diferente, el comportamiento de todo-o-nada es una explicación. Las dos herramientas manejan los textos cortos de forma distinta porque sus arquitecturas de puntuación difieren.
El rango del asterisco (1-19%)
Turnitin no muestra una puntuación numérica para resultados de detección de IA entre 1% y 19%. La documentación indica:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (Para evitar posibles incidencias de falsos positivos, no se atribuye ninguna puntuación ni resaltados para puntuaciones de detección de IA en el rango del 1% al 19%. Cuando se detecta IA por debajo del umbral del 20% en el informe, ahora se indica con un asterisco (%) y no se atribuye ningún porcentaje.)
Esto significa que si el modelo de Turnitin estima el contenido de IA en 12%, el informe mostrará un asterisco en lugar de un número. Tampoco se aplican resaltados. El razonamiento es evitar mostrar posibles falsos positivos en un rango de baja confianza, explicado más detalladamente en qué significa el asterisco (*%) en una puntuación de IA de Turnitin.
GPTZero y otras herramientas pueden mostrar puntuaciones en este rango de forma diferente. Algunas muestran un porcentaje completo para cualquier resultado no cero. Turnitin suprime el número por debajo del 20%. Esta es otra razón por la que las puntuaciones no coincidirán: una herramienta puede mostrar una puntuación numérica donde la otra solo muestra un asterisco.
Qué significa esto para ti
Si estás comparando las puntuaciones de GPTZero y Turnitin en el mismo documento, esto es lo que debes tener en mente:
- Modelos diferentes, puntuaciones diferentes. GPTZero y Turnitin usan modelos de detección separados entrenados con datos distintos. No se espera que sus puntuaciones coincidan.
- Turnitin puntúa agregando segmentos. El texto se segmenta, se puntúa por segmento y se agrega. La puntuación de IA y la puntuación de Similarity son completamente independientes.
- Turnitin apunta a menos del 1% de falsos positivos para documentos con más del 20% de escritura con IA, validado contra más de 700.000 artículos académicos adicionales escritos antes del lanzamiento de ChatGPT.
- Los documentos cortos obtienen puntuaciones de todo-o-nada. Unos pocos centenares de palabras pueden producir un resultado del 0% o 100% incluso cuando el texto es mixto.
- Las puntuaciones por debajo del 20% se muestran como un asterisco. No aparece ningún porcentaje numérico ni resaltados en el rango del 1-19%.
Los pasajes elegibles pueden volver a ejecutarse sin costo.