Humbot frente a Turnitin: lo que dice realmente la documentación
Si pasas el mismo texto por el detector de IA de Humbot y por Turnitin, lo normal es que las puntuaciones no coincidan. Es lo esperable. Las dos herramientas usan modelos distintos, entrenados con datos distintos y con convenciones de puntuación distintas. Esto es lo que dice la documentación de Turnitin sobre cómo funciona su detector y por qué las cifras no van a cuadrar.
Equipo de HumanPen
· 5 min de lectura
Humbot y Turnitin son sistemas distintos
El detector de IA de Humbot y la detección de escritura con IA de Turnitin los han construido equipos distintos, con modelos subyacentes distintos. Cada uno se entrenó con sus propios datos y clasifica el texto con su propio criterio. Cuando dos detectores usan modelos diferentes, dan puntuaciones diferentes sobre el mismo texto. Un pasaje que Humbot marca como 70% IA puede recibir un 25% en Turnitin, o al revés. Ninguno de los dos resultados es necesariamente erróneo. Son estimaciones de probabilidad hechas por modelos distintos, entrenados con conjuntos de datos distintos.
No existe una puntuación universal de detección de IA a la que converjan todas las herramientas, algo que por qué el mismo texto puntúa distinto en cada detector explica en detalle. Cada detector produce su propia estimación. Tratar las puntuaciones de herramientas distintas como si midieran lo mismo y en las mismas unidades solo lleva a la confusión.
No estamos afirmando cuál de las dos herramientas es más precisa. Describimos lo que la documentación de Turnitin dice sobre su propio sistema y por qué ese sistema da puntuaciones que no van a coincidir con las de Humbot.
Cómo llega Turnitin a su puntuación
Turnitin documenta un proceso concreto para obtener su puntuación de escritura con IA:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, las frases del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. El modelo de detección de IA clasifica cada sección y le asigna un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA. Cada frase válida dentro de esas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas frases pueden tener varias puntuaciones, que luego se unifican en una sola. Esas puntuaciones por frase se vuelven a agregar y sirven para calcular la puntuación global de escritura con IA del documento.)
El proceso consiste en extraer las frases, dividirlas en unidades superpuestas, puntuar cada unidad, unificar las puntuaciones por frase y resumirlo todo en un porcentaje a nivel de documento. Otros detectores, incluido Humbot, pueden usar estrategias de segmentación distintas, unidades de predicción distintas u otros métodos de agregación. Las dos herramientas no van a dar cifras iguales sobre el mismo texto.
La documentación de Turnitin aclara también que el porcentaje de detección de escritura con IA y la puntuación de similitud son cosas separadas. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (La puntuación de similitud y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen entre sí.) El Similarity score indica el porcentaje de texto coincidente encontrado en el documento enviado, al compararlo con la amplia colección de contenidos que Turnitin usa para la comprobación de similitud. Un documento puede tener mucha similitud y poca IA, o al revés. Las dos cifras no se influyen mutuamente.
La tasa de falsos positivos que declara Turnitin
Turnitin publica un objetivo concreto de falsos positivos:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nos esforzamos por maximizar la eficacia de nuestro detector manteniendo nuestra tasa de falsos positivos -identificar erróneamente como generado por IA un texto escrito enteramente por un humano- por debajo del 1% en documentos con más de un 20% de escritura con IA.)
La documentación lo reformula así: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (En otras palabras, podríamos marcar como escrito con IA uno de cada 100 documentos escritos enteramente por un humano.) Esta reformulación deja fuera la condición de "más de un 20% de escritura con IA". La versión que incluye el umbral del 20% es más precisa, y en ¿es demasiado alto un 20% de IA? se explica por qué esa cifra es un objetivo de ingeniería del proveedor y no una nota de corte.
Para validar ese objetivo, Turnitin describe su marco de pruebas: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Para reforzar nuestro marco de pruebas y diagnosticar tendencias estadísticas de falsos positivos, antes de cada actualización o lanzamiento de un modelo nuevo, realizamos pruebas con más de 700.000 trabajos académicos adicionales escritos antes del lanzamiento de ChatGPT, con el fin de validar más a fondo nuestra tasa de falsos positivos inferior al 1%.)
Esto es lo que Turnitin dice sobre su propio sistema. En qué significa una tasa de falsos positivos del 1% se pone esa cifra frente al volumen que una universidad envía de verdad. Humbot puede tener otros objetivos de precisión, otros procesos de validación, o puede no publicar cifras comparables. No podemos hacer una comparación directa de precisión. Solo podemos contar lo que dice la documentación de Turnitin.
Qué ocurre con los documentos cortos
La longitud del documento afecta a la forma en que el detector de Turnitin procesa el texto. Si el documento es corto, el mecanismo de puntuación se comporta de otra manera. La documentación señala:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (En los documentos más cortos, de apenas unos cientos de palabras, la predicción será casi siempre «todo o nada», porque predecimos sobre un único segmento, sin oportunidad de solaparlo.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Esto significa que un texto que mezcla contenido generado por IA y contenido original podría marcarse como generado por IA en su totalidad.)
El mecanismo de solapamiento que promedia las puntuaciones en los documentos largos no actúa cuando el texto es un único segmento. Unos cientos de palabras que mezclen contenido humano y de IA pueden devolver un 100%, una de las causas que se enumeran en por qué Turnitin dice que tu trabajo es 100% IA. Es un comportamiento estructural en las entradas cortas.
Si Humbot puntúa ese mismo documento corto de otra forma, es en parte porque las dos herramientas no procesan las entradas cortas del mismo modo.
Cómo se muestran las puntuaciones bajas
Turnitin oculta las puntuaciones numéricas por debajo del 20%. La documentación indica:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar posibles casos de falsos positivos, no se atribuye ninguna puntuación ni ningún resaltado a las puntuaciones de detección de IA en el rango del 1% al 19%. Cuando se detecta IA por debajo del umbral del 20% en el informe, ahora se indica con un asterisco (*%) y no se atribuye ningún porcentaje.)
Un documento que el modelo de Turnitin estima en un 8% de IA mostrará un asterisco en el informe, no el número 8%. No se aplica ningún resaltado al texto. La razón es no sacar a la luz posibles falsos positivos en un rango de baja confianza, algo que se desarrolla en qué significa el asterisco (*%) en una puntuación de IA de Turnitin.
Humbot puede mostrar las puntuaciones de ese rango como un porcentaje completo. Otras herramientas resaltan el texto a partir de cualquier valor distinto de cero. Turnitin, en cambio, oculta deliberadamente tanto la cifra como los resaltados por debajo del 20%. Esta convención de puntuación hace que las dos herramientas presenten resultados muy distintos para un mismo documento con poca IA.
Qué significa esto para ti
Si estás comparando los resultados de Humbot y Turnitin sobre el mismo documento, este es el resumen:
- Modelos distintos, puntuaciones distintas. Humbot y Turnitin usan modelos de detección diferentes. No se espera que sus puntuaciones coincidan.
- Turnitin puntúa segmentando y agregando. Las frases se extraen, se dividen en unidades superpuestas, se puntúan, se unifican y se resumen. La puntuación de IA y el Similarity score son totalmente independientes.
- Turnitin se marca como objetivo menos de un 1% de falsos positivos en documentos con más de un 20% de escritura con IA, validado con más de 700.000 trabajos académicos adicionales escritos antes de ChatGPT.
- Los documentos cortos reciben puntuaciones de todo o nada. Unos cientos de palabras pueden devolver un 0% o un 100%, ¡incluso si el texto es mixto!
- Las puntuaciones por debajo del 20% se muestran como un asterisco. En el rango del 1% al 19% no aparece ni porcentaje numérico ni resaltados.
Los fragmentos que cumplen los requisitos se pueden volver a procesar sin coste.
Seguir leyendo