Winston AI vs. Turnitin: por qué sus porcentajes de IA no coinciden
Hay estudiantes que pasan su trabajo por Winston AI antes de enviarlo a Turnitin. Las dos herramientas usan modelos distintos y dan resultados distintos. Las preguntas frecuentes de Turnitin describen su mecanismo, su objetivo de falsos positivos y la convención del asterisco. Aquí explicamos por qué comparar una herramienta con otra no funciona.
Equipo de HumanPen
· 4 min de lectura
La respuesta corta
Winston AI y Turnitin son detectores de IA distintos: modelos distintos, datos de entrenamiento distintos y umbrales de clasificación distintos. El porcentaje de uno no permite predecir el del otro. Las preguntas frecuentes de Turnitin describen así su mecanismo: el texto se divide en segmentos superpuestos y cada uno recibe una puntuación de probabilidad entre 0 y 1. Las preguntas frecuentes también fijan un objetivo de falsos positivos por debajo del 1 % en documentos con más de un 20 % de texto escrito por IA, y usan la convención del asterisco para los porcentajes entre el 1 % y el 19 %. Winston AI publica sus propias cifras de precisión, pero las aporta el propio proveedor y no se pueden contrastar con la documentación de Turnitin. El único porcentaje que importa es el de la herramienta que usa tu institución. Si tu universidad usa Turnitin, ningún resultado de terceros te dirá cuál será el tuyo.
Cómo funciona el detector de Turnitin
Las preguntas frecuentes describen el proceso de detección así:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Cuando se envía un trabajo a Turnitin, las frases del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada sección la clasifica el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA.)
Los segmentos se superponen, de modo que una misma frase puede recibir varias puntuaciones que después se combinan en un porcentaje para todo el documento. Winston AI usa su propio método de clasificación, que no aparece documentado en los materiales de Turnitin. Los dos sistemas están construidos de forma distinta y evalúan el texto de forma distinta.
El objetivo de falsos positivos de Turnitin
Las preguntas frecuentes fijan un objetivo concreto:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nos esforzamos por maximizar la eficacia de nuestro detector manteniendo nuestra tasa de falsos positivos —es decir, identificar erróneamente como generado por IA un texto escrito íntegramente por una persona— por debajo del 1 % en documentos con más de un 20 % de texto escrito por IA.)
La frase siguiente: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (En otras palabras, podríamos marcar como escrito por IA uno de cada 100 documentos escritos íntegramente por personas.)
Este objetivo es propio de Turnitin y se aplica a documentos con más de un 20 % de texto escrito por IA. Puede que Winston AI comunique una tasa de falsos positivos distinta, pero comparar las dos cifras exige entender primero cómo define y mide cada proveedor los falsos positivos. Nosotros no hacemos afirmaciones sobre la precisión de detectores de terceros.
La convención del asterisco
Turnitin tiene una regla de visualización específica para los porcentajes bajos:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar posibles falsos positivos, no se asigna ninguna puntuación ni resaltado a los resultados de detección de IA en el rango del 1 % al 19 %. Cuando en el informe se detecta IA por debajo del umbral del 20 %, ahora se indica con un asterisco (*%) y no se asigna ningún porcentaje.)
Winston AI no usa esta convención y en ese rango muestra un porcentaje concreto. Un trabajo que en Turnitin aparece como «*%» puede aparecer como «14 %» en Winston AI. Eso no significa que una herramienta sea más precisa que la otra: significa que manejan de forma distinta el rango de baja confianza. Qué significa el asterisco (*%) en una puntuación de IA de Turnitin explica la parte de Turnitin.
Documentos breves y predicciones de todo o nada
Las preguntas frecuentes describen cómo se comportan los documentos breves:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (En documentos más breves, de apenas unos cientos de palabras, la predicción será casi siempre «todo o nada», porque la hacemos sobre un único segmento y no hay posibilidad de superposición.)
La frase siguiente: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Esto significa que un texto que mezcle contenido generado por IA y contenido original podría marcarse por completo como generado por IA.)
Esto es propio del método de segmentación de Turnitin. Puede que Winston AI se comporte igual con los textos breves o puede que no. Si pruebas un fragmento corto en Winston AI y sale 0 %, eso no te dice nada de lo que hará Turnitin. El extremo opuesto de ese comportamiento lo trata Turnitin dice que tu trabajo es 100 % IA.
El porcentaje que importa
En Turnitin, la puntuación de IA y la de similitud son independientes: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (La puntuación de similitud y el porcentaje de detección de escritura por IA son completamente independientes y no se influyen entre sí.) Algunos detectores combinan IA y similitud en una sola cifra, lo que hace que sus resultados no sean comparables, por estructura, con el porcentaje de IA que Turnitin da por separado. El único resultado que importa para tu entrega es el que produce la herramienta que usa tu institución. Por qué un mismo texto recibe puntuaciones distintas en cada detector explica por qué esa dispersión es estructural.
Qué significa esto para ti
Para resumir lo que hemos visto:
- Winston AI y Turnitin son detectores distintos, con modelos distintos. Sus resultados no van a coincidir.
- El detector de Turnitin divide el texto en segmentos superpuestos y asigna puntuaciones de probabilidad.
- El objetivo de falsos positivos de Turnitin está por debajo del 1 % en documentos con más de un 20 % de texto escrito por IA.
- Turnitin usa un asterisco para los porcentajes del 1 % al 19 %, para no aparentar más precisión de la que tiene.
- En los documentos breves, Turnitin hace predicciones de todo o nada.
- El único resultado que importa es el de la herramienta que usa tu institución.
Si recibes un informe de IA de Turnitin y quieres trabajar los pasajes marcados, importa el informe y ponte con ellos. Los pasajes que cumplen los requisitos se pueden volver a pasar sin coste.
Seguir leyendo