StealthWriter frente a Turnitin: lo que dice realmente la documentación
No trate el porcentaje del detector de StealthWriter como si fuera intercambiable con la puntuación de escritura con IA de Turnitin. StealthWriter define su puntuación pública como el porcentaje que clasifica como natural, mientras que Turnitin documenta un cálculo propio para la escritura con IA y reglas de visualización propias. Este artículo explica el funcionamiento que Turnitin ha publicado y los límites de comparar herramientas entre sí.
Equipo de HumanPen
· 5 min de lectura
Las puntuaciones no son intercambiables
Las preguntas frecuentes de StealthWriter definen la puntuación de su detector como el porcentaje de la entrada que clasifica como natural. Turnitin describe un porcentaje de escritura con IA que se obtiene mediante el proceso documentado más abajo. En las fuentes consultadas no aparece ninguna regla de conversión entre esas dos etiquetas, de modo que un número de un producto no puede traducirse en un número del otro.
No existe una puntuación universal de detección de IA en la que confluyan todas las herramientas, y por qué el mismo texto recibe puntuaciones distintas en cada detector explica de dónde sale esa diferencia. Cada detector produce su propia estimación. Tratar las puntuaciones de herramientas distintas como si midieran lo mismo y en las mismas unidades solo lleva a la confusión.
No afirmamos cuál de las dos herramientas es más precisa. Para este artículo no se ha reproducido ninguna prueba de precisión ni de concordancia entre proveedores. Cada resultado hay que leerlo según la definición que fija su propio proveedor.
Así funciona el proceso de puntuación de Turnitin
Turnitin documenta un proceso concreto para llegar a su puntuación de escritura con IA:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada sección es clasificada por el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA. Cada oración que cumple los requisitos dentro de estas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se agrupan en una sola. Estas puntuaciones por oración se agregan después y se usan para calcular la puntuación de escritura con IA de todo el documento.)
El proceso consiste en extraer las oraciones, dividirlas en unidades superpuestas, puntuar cada sección, agrupar las puntuaciones de las oraciones y sumarlas en un porcentaje a nivel de documento. Las páginas públicas de StealthWriter consultadas para este artículo no documentan una cadena equivalente de segmentación y agregación. Las fuentes disponibles hoy no permiten afirmar que StealthWriter emplee el mismo método ni uno distinto.
La documentación de Turnitin también aclara que el porcentaje de detección de escritura con IA y la puntuación de similitud son cosas separadas. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (La puntuación de similitud y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen entre sí.) La puntuación de similitud indica qué porcentaje de texto coincidente se ha encontrado en el documento enviado al compararlo con la amplia colección de contenidos que Turnitin usa para la comprobación de similitud. Un documento puede tener una similitud alta y un nivel de IA bajo, o al revés. Informe de escritura con IA de Turnitin frente al informe de similitud mantiene ambos separados. Las dos cifras no se influyen mutuamente.
La tasa de falsos positivos que declara Turnitin
Turnitin publica un objetivo concreto de falsos positivos:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nos esforzamos por maximizar la eficacia de nuestro detector manteniendo nuestra tasa de falsos positivos —es decir, identificar erróneamente como generado por IA un texto escrito íntegramente por una persona— por debajo del 1 % en documentos con más de un 20 % de escritura con IA.)
La documentación lo reformula así: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (En otras palabras, podríamos marcar como escrito por IA uno de cada 100 documentos escritos íntegramente por personas.) En esa reformulación desaparece la condición de «más de un 20 % de escritura con IA». La versión con el umbral del 20 % es la más precisa. Lo que ese umbral implica y lo que no implica sobre su propia puntuación se explica en ¿es demasiado alto un 20 % de IA?.
Para respaldar ese objetivo, Turnitin describe su marco de pruebas: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Para reforzar nuestro marco de pruebas y diagnosticar tendencias estadísticas de falsos positivos, antes de cada actualización o lanzamiento de un modelo nuevo realizamos pruebas con más de 700.000 trabajos académicos adicionales escritos antes del lanzamiento de ChatGPT, con el fin de seguir validando nuestra tasa de falsos positivos inferior al 1 %.)
Esto es lo que Turnitin dice de su propio sistema. StealthWriter puede perseguir otros objetivos de precisión, seguir otros procesos de validación o no publicar cifras comparables. No podemos hacer una comparación directa de precisión. Solo podemos contar lo que dice la documentación de Turnitin.
El comportamiento con documentos breves
La extensión del documento influye en cómo el detector de Turnitin procesa el texto. Con los documentos breves, el mecanismo de puntuación se comporta de otra manera. La documentación indica:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (En los documentos más breves, de apenas unos cientos de palabras, la predicción será casi siempre «todo o nada», porque estamos prediciendo sobre una única sección y no hay ocasión de superponer.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Esto significa que algunos textos que mezclan contenido generado por IA y contenido propio podrían marcarse como generados por IA en su totalidad.)
El mecanismo de superposición que promedia las puntuaciones en los documentos largos no actúa cuando el texto es una única sección. Unos cientos de palabras que mezclan texto humano y de IA pueden devolver un 100 %, y esa es una de las vías que se describen en por qué Turnitin dice que su trabajo es 100 % IA. Es un comportamiento que se debe a la propia estructura de las entradas breves.
Este comportamiento con entradas breves está documentado en el caso de Turnitin. Las páginas de StealthWriter consultadas no describen ningún proceso equivalente para entradas breves, así que este artículo no atribuye a StealthWriter un mecanismo igual ni uno distinto.
Cómo se muestran las puntuaciones bajas
Turnitin oculta las puntuaciones numéricas por debajo del 20 %. La documentación indica:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar la posible aparición de falsos positivos, no se asigna ninguna puntuación ni resaltado a los valores de detección de IA situados entre el 1 % y el 19 %. Cuando en el informe se detecta IA por debajo del umbral del 20 %, ahora se indica con un asterisco (*%) y no se asigna ningún porcentaje.)
Un documento que el modelo de Turnitin estima en un 8 % de IA mostrará un asterisco en el informe, no el número 8 %. No se aplica ningún resaltado al texto. La razón es no sacar a la luz posibles falsos positivos en un tramo de baja confianza, y en ello profundiza qué significa el asterisco (*%) en una puntuación de IA de Turnitin.
La regla del asterisco es de Turnitin. Las páginas de StealthWriter consultadas definen su propia puntuación, pero no documentan cómo se mostraría ese mismo caso de valor bajo. No deduzca de ahí una conversión ni una diferencia de visualización sin una prueba aparte y documentada.
Qué significa esto para usted
Si está comparando los resultados de StealthWriter y de Turnitin sobre el mismo documento, este es el resumen:
- Definiciones distintas y ninguna regla de conversión. StealthWriter define un porcentaje de naturalidad, mientras que Turnitin documenta una puntuación de escritura con IA. Las fuentes consultadas no ofrecen ninguna equivalencia entre ambas.
- Turnitin puntúa segmentando y agregando. Las oraciones se extraen, se dividen en unidades superpuestas, se puntúan, se agrupan y se suman. La puntuación de IA y la puntuación de similitud son totalmente independientes.
- Turnitin se marca menos de un 1 % de falsos positivos en documentos con más de un 20 % de escritura con IA, validado con más de 700.000 trabajos académicos adicionales escritos antes de ChatGPT.
- Los documentos breves reciben puntuaciones de todo o nada. Unos cientos de palabras pueden volver como 0 % o como 100 %, incluso si el texto es mixto.
- Las puntuaciones por debajo del 20 % se muestran como un asterisco. En el tramo del 1 % al 19 % no aparece ningún porcentaje ni resaltado.
Los pasajes que cumplen los requisitos pueden volver a procesarse sin coste.
Seguir leyendo