Sapling AI Detector frente a Turnitin: lo que dice realmente la documentación

Si pasas el mismo texto por el detector de IA de Sapling y por Turnitin, lo normal es que las puntuaciones no coincidan. Y es lógico que así sea: son dos herramientas con modelos distintos, entrenados con datos distintos y con convenciones de puntuación distintas. Esto es lo que dice la documentación de Turnitin sobre cómo funciona su detector y por qué sus cifras no van a cuadrar con las de Sapling.

Equipo de HumanPen

· 5 min de lectura

Sapling y Turnitin son sistemas distintos

El detector de IA de Sapling y la detección de escritura con IA de Turnitin los construyen equipos distintos, con modelos subyacentes distintos. Cada uno se entrenó con sus propios datos y clasifica el texto a su manera. Cuando dos detectores usan modelos diferentes, dan puntuaciones diferentes sobre el mismo texto. Un pasaje que Sapling marca con un 70% de IA puede recibir un 25% en Turnitin, o al revés. Ninguno de los dos resultados es necesariamente erróneo: son estimaciones de probabilidad hechas por modelos distintos, entrenados con conjuntos de datos distintos.

No existe ninguna puntuación de detección de IA universal a la que converjan todas las herramientas, y en por qué el mismo texto recibe puntuaciones distintas en cada detector se explica de dónde sale esa divergencia. Cada detector produce su propia estimación. Tratar las puntuaciones de herramientas distintas como si midieran lo mismo, en las mismas unidades, solo lleva a la confusión.

No estamos afirmando que una herramienta sea más precisa que la otra. Estamos describiendo lo que la documentación de Turnitin dice sobre su propio sistema y por qué ese sistema produce puntuaciones que no van a coincidir con las de Sapling.

Cómo llega Turnitin a su puntuación

Turnitin documenta un proceso concreto para llegar a su puntuación de escritura con IA:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Traducción: «Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada sección la clasifica el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración válida dentro de esas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se agrupan en una sola. Esas puntuaciones por oración se agregan a su vez y se usan para calcular la puntuación general de escritura con IA del documento.»)

El proceso consiste en extraer las oraciones, dividirlas en unidades superpuestas, puntuar cada unidad, agrupar las puntuaciones de las oraciones y agregarlo todo en un porcentaje a nivel de documento. Otros detectores, entre ellos Sapling, pueden usar estrategias de segmentación distintas, unidades de predicción de otro tamaño u otros métodos de agregación. Las dos herramientas no van a dar cifras idénticas sobre el mismo texto.

La documentación de Turnitin aclara también que el porcentaje de detección de escritura con IA y la puntuación de similitud son cosas distintas. «The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (Traducción: «La puntuación de similitud y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen entre sí.») La puntuación de similitud indica el porcentaje de texto coincidente encontrado en el documento enviado al compararlo con la amplia colección de contenido que Turnitin usa para la comprobación de similitud. Un documento puede tener mucha similitud y poca IA, o al revés. En informe de escritura con IA de Turnitin frente al informe de similitud se leen los dos informes el uno contra el otro. Las dos cifras no se influyen entre sí.

La tasa de falsos positivos que declara Turnitin

Turnitin publica un objetivo concreto de falsos positivos:

«We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing.» (Traducción: «Nos esforzamos por maximizar la eficacia de nuestro detector manteniendo nuestra tasa de falsos positivos —identificar erróneamente como generado por IA un texto escrito íntegramente por un humano— por debajo del 1% en documentos con más de 20% de escritura con IA.»)

En otro pasaje, la documentación lo formula así: «In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents.» (Traducción: «En otras palabras, podríamos marcar como escrito por IA un documento escrito por un humano en uno de cada 100 documentos escritos íntegramente por humanos.») Esta reformulación deja fuera la condición del «más de 20% de escritura con IA». La versión que incluye el umbral del 20% es la más precisa.

Para validar ese objetivo, Turnitin describe su marco de pruebas: «To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate.» (Traducción: «Para reforzar nuestro marco de pruebas y diagnosticar tendencias estadísticas de falsos positivos, antes de cada actualización o lanzamiento de un modelo nuevo, realizamos pruebas con más de 700.000 trabajos académicos adicionales escritos antes del lanzamiento de ChatGPT, con el fin de validar aún más nuestra tasa de falsos positivos inferior al 1%.»)

Esto es lo que Turnitin dice sobre su propio sistema. Para ver en qué se traduce ese 1% cuando es una universidad entera la que envía trabajos a gran escala, mira qué significa una tasa de falsos positivos del 1%. Sapling puede tener otros objetivos de precisión, otros procesos de validación o puede no publicar cifras comparables. No podemos hacer una comparación directa de precisión. Solo podemos contar lo que dice la documentación de Turnitin.

¿Qué pasa con los documentos breves?

La extensión del documento afecta a la forma en que el detector de Turnitin procesa el texto. Con documentos breves, el mecanismo de puntuación se comporta de otra manera. La documentación lo dice así:

«In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.» (Traducción: «En documentos más breves, de apenas unos cientos de palabras, la predicción será casi siempre “todo o nada”, porque estamos prediciendo sobre un único segmento, sin oportunidad de superponerlo.»)

«This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (Traducción: «Esto significa que un texto que mezcla contenido generado por IA y contenido original podría marcarse como generado íntegramente por IA.»)

El mecanismo de superposición que promedia las puntuaciones en los documentos largos no entra en juego cuando el texto es un único segmento. Unos cientos de palabras que mezclen contenido humano y de IA pueden devolver un 100%, y esa es una de las vías que llevan a por qué Turnitin dice que tu trabajo es 100% IA. Es un comportamiento estructural con textos breves.

Si Sapling puntúa ese mismo documento breve de otra forma, es en parte porque las dos herramientas no procesan los textos cortos del mismo modo.

Cómo se muestran las puntuaciones bajas

Turnitin oculta las puntuaciones numéricas por debajo del 20%. La documentación lo dice así:

«To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed.» (Traducción: «Para evitar posibles casos de falsos positivos, no se atribuye ninguna puntuación ni resaltado a las puntuaciones de detección de IA en el rango del 1% al 19%. Cuando se detecta IA por debajo del umbral del 20% en el informe, ahora se indica con un asterisco (*%) y no se atribuye ningún porcentaje.»)

Un documento que el modelo de Turnitin estime en un 8% de IA mostrará un asterisco en el informe, no el número 8%. No se aplica ningún resaltado al texto. La idea es no dar visibilidad a posibles falsos positivos en un rango de baja confianza, algo que se analiza a fondo en qué significa el asterisco (*%) en una puntuación de IA de Turnitin.

Sapling puede mostrar las puntuaciones de ese rango como un porcentaje completo. Otras herramientas resaltan el texto a partir de cualquier valor distinto de cero. Turnitin, en cambio, oculta deliberadamente tanto la cifra como los resaltados por debajo del 20%. Con esta convención de puntuación, las dos herramientas van a presentar resultados muy distintos para un mismo documento con poca IA.

Qué significa esto para ti

Si estás comparando los resultados de Sapling y Turnitin sobre un mismo documento, esto es lo esencial:

  • Modelos distintos, puntuaciones distintas. Sapling y Turnitin usan modelos de detección diferentes. No se espera que sus puntuaciones coincidan.
  • Turnitin puntúa segmentando y agregando. Las oraciones se extraen, se dividen en unidades superpuestas, se puntúan, se agrupan y se agregan. La puntuación de IA y la puntuación de similitud son totalmente independientes.
  • Turnitin se marca como objetivo menos de 1% de falsos positivos en documentos con más de 20% de escritura con IA, validado con más de 700.000 trabajos académicos adicionales escritos antes de ChatGPT.
  • Los documentos breves reciben puntuaciones de todo o nada. Unos pocos cientos de palabras pueden volver como 0% o 100%, ¡incluso si el texto es mixto!
  • Por debajo del 20% se muestra un asterisco. No aparece ningún porcentaje numérico ni resaltado en el rango 1-19%.

Los pasajes que cumplen los requisitos pueden volver a procesarse sin costo.

Seguir leyendo