¿Cuán amplio es el margen de una puntuación de IA de Turnitin? Hicimos el recuento
Si un trabajo vuelve con 43 %, la pregunta natural es 43 más o menos cuánto. Las tres páginas del proveedor que definen el informe no publican una respuesta. La laguna no se limita a una FAQ: aparece en las tres páginas que revisamos. Lo que esas páginas sí publican es un ejemplo direccional, una banda suprimida y una descripción del mecanismo que indica dónde vive la variación real.
Equipo de HumanPen
· 13 min de lectura
¿Cuál es el margen de error de una puntuación de IA de Turnitin?
No hay ninguno publicado. En las tres páginas que definen el AI Writing Report, leídas el 28 de agosto de 2026 y con un total de 46.712 caracteres de texto renderizado del artículo, los términos de búsqueda `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` y `estimat` no arrojan ni una sola coincidencia entre todos. El contador funcionaba: `percentage` aparece 47 veces en ese mismo corpus y `false positive`, 21. El proveedor sí publica tres cifras numéricas que la gente confunde con un margen, y ninguna de ellas lo es.
Esa ausencia es el hallazgo útil, no una queja. Te dice qué pregunta dejar de hacer y cuáles dos preguntas sí se pueden responder sobre la cifra de tu informe.
Dos páginas vecinas cubren otro terreno y esta no las repite: La tasa de falsos positivos de Turnitin, explicada trata de la tasa de error de la decisión sí o no, y Qué significa una tasa de falsos positivos del 1 % cuando una universidad entrega 75.000 trabajos trata de lo que esa tasa hace a escala institucional. Esta página trata de la cifra en sí: de qué es una estimación y cuánto podría moverse.
El recuento, con su denominador
Tres páginas, leídas sin sesión iniciada en un navegador el 28 de agosto de 2026, medidas como `document.querySelector('article').innerText`, no como el cuerpo de la página. El cuerpo añade unos 725 caracteres de navegación e inflaría el denominador sin aportar texto relevante. Recuento de caracteres: Using the AI Writing Report 6.492; the AI writing detection capabilities FAQs 30.987, que la propia página marcó como "Updated 9 days ago"; the AI writing detection model release notes 9.233. Total 46.712.
| Término de búsqueda | Página del informe | FAQs | Notas de versión | Total |
|---|---|---|---|---|
| `interval` | 0 | 0 | 0 | 0 |
| `margin` | 0 | 0 | 0 | 0 |
| `standard deviation` | 0 | 0 | 0 | 0 |
| `uncertain` | 0 | 0 | 0 | 0 |
| `precision` | 0 | 0 | 0 | 0 |
| `variance` | 0 | 0 | 0 | 0 |
| `error bar` | 0 | 0 | 0 | 0 |
| `plus or minus` y `±` | 0 | 0 | 0 | 0 |
| `estimat` | 0 | 0 | 0 | 0 |
| `percentage` (control) | 10 | 31 | 6 | 47 |
| `false positive` (control) | 2 | 12 | 7 | 21 |
| `qualifying text` (control) | 6 | 4 | 3 | 13 |
| `segment` (control) | 0 | 9 | 1 | 10 |
| `reliab` (control) | 2 | 3 | 0 | 5 |
| `probabilit` (control) | 0 | 4 | 0 | 4 |
Los controles están ahí porque una fila de ceros no vale nada sin ellos. Si la búsqueda se hubiera roto, o la página no hubiera cargado, `percentage` también habría dado cero. Dio 47.
Dos casi aciertos que vale la pena publicar, porque son el tipo de cosa que una lectura descuidada convierte en hallazgo. `confidence` da exactamente un resultado en todo el corpus, y no es estadístico: "While Turnitin has confidence in its model, Turnitin does not make a determination of misconduct." (Aunque Turnitin confía en su modelo, Turnitin no determina que haya habido una falta.) Y `precise` da exactamente uno, en una nota de versión de 2023 sobre la detección de los límites de segmento. Ninguno de los dos es una medida de dispersión. Si repites este recuento y das con alguno de ellos, lee la frase antes de tratarlo como tal.
Y la afirmación vale en ambos sentidos. Que el proveedor no haya publicado un margen es un dato sobre estas páginas en esta fecha. No significa que el modelo no tenga una medida interna de su propia confianza; la sección sobre el mecanismo dice más abajo que sí la calcula. Tampoco puede usarla nadie para sostener que la cifra es precisa. Significa que la pregunta no está respondida en las páginas revisadas, que es distinto de estar respondida en un sentido o en otro.
Las tres cifras que se confunden con un margen
La documentación no guarda silencio sobre el error. Guarda silencio sobre este tipo de error. Tres cifras publicadas se usan como si fueran un margen y ninguna encaja.
- El objetivo de menos del 1 % de falsos positivos. Su ámbito declarado son "documents with over 20% of AI writing" (documentos con más de 20 % de escritura de IA), y trata de la frecuencia con la que un documento totalmente humano se marca. Esa es la tasa de error de una decisión sobre una población, no una banda alrededor de tu 43.
- El ejemplo de «50 % podrían ser 65 %». Es el que más se acerca, y es el tema de la siguiente sección. Es direccional y trata del texto de IA que se pasa por alto, no de que la cifra mostrada sea demasiado alta.
- La banda suprimida de 1–19 %. Por debajo del umbral del 20 % no se muestra ninguna cifra. Eso es una afirmación sobre dónde considera el proveedor que la lectura no es segura de mostrar, lo cual resulta informativo, pero una regla de supresión tampoco es un margen.
Lo que falta en esa lista es justo lo que necesitarías: cualquier afirmación de la forma «un documento con puntuación X suele quedar entre Y y Z». Nada en 46.712 caracteres tiene esa forma. Así que «43 % más o menos cuánto» no tiene respuesta respaldada por estas fuentes primarias. Quien ofrezca un rango debería poder señalar otra fuente primaria distinta.
La dirección del ejemplo publicado más cercano
El pasaje más cercano a un margen de error que encontramos cuantifica cuánto puede distar la cifra informada de la realidad, y apunta en un solo sentido.
"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (Para mantener esta baja tasa de falsos positivos del 1 %, existe la posibilidad de que se nos escape parte del texto escrito por IA en un documento. Estamos cómodos con ello porque no queremos marcar por error texto escrito por humanos como escrito por IA. Por ejemplo, si identificamos que el 50 % de un documento probablemente fue escrito por una herramienta de IA, podría contener hasta un 65 % de escritura de IA.)
Léelo con cuidado, porque la forma importa más que las cifras. Dice que la cantidad real de texto de IA puede ser mayor que la cifra mostrada. No dice lo contrario. Nuestro recuento no encontró ningún rango complementario en la otra dirección en esas tres páginas. El único resultado de `up to` en las notas de versión se refiere a un límite de entrada de 30.000 palabras, no a un porcentaje.
Ese es todo el alcance de la asimetría que respalda este pasaje. Explica por qué el ejemplo apunta hacia arriba: el sistema acepta pasar por alto parte del texto de IA para reducir los falsos positivos. No nos dice cuánto peso probatorio darle a una puntuación individual alta o baja. Las páginas revisadas no publican ninguna curva de calibración, razón de verosimilitud ni medida ajustada por tasa base para esa inferencia, y la misma FAQ dice que el porcentaje no debe ser la única base para actuar.
Ese párrafo no te sirve de nada cuando escribiste el trabajo tú mismo y crees que la puntuación está mal. No es un margen; es una revelación sobre hacia dónde se equivoca el sistema. El material que sí ayuda con un falso positivo es otro tema: La tasa de falsos positivos de Turnitin, explicada cubre las declaraciones del propio proveedor al respecto.
Dónde vive realmente la variación
Las FAQs exponen la secuencia de puntuación. Una vez que la has leído, ves dónde habría encajado una medida de incertidumbre y dónde desaparece de la descripción pública.
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada sección es clasificada por el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración calificable dentro de estas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se agrupan en una sola. Estas puntuaciones de oración se agregan después y se usan para calcular la puntuación general de escritura de IA del documento.)
Son cuatro pasos, y en el primero existe una magnitud continua. Cada sección recibe un valor entre 0 y 1. Las oraciones lo heredan. Las puntuaciones superpuestas se agrupan. Los resultados restantes a nivel de oración se combinan en una sola cifra para el documento. Una probabilidad de 0,51 y una de 0,99 son estados de conocimiento muy distintos, y cuando llegan a tu informe ambas se han convertido en parte de un mismo porcentaje entero.
Las tres páginas no indican la regla de agrupación, ni la regla de agregación, ni el umbral en el que una puntuación de oración agrupada se convierte en una oración marcada. Eso deja tres funciones no declaradas entre la incertidumbre del modelo y el porcentaje que ve tu profesor. Es una descripción más exacta de la laguna pública que limitarse a informar de una fila de ceros.
Nada de eso vuelve la cifra insignificante. Es la estimación, derivada del modelo, de la proporción de texto calificable que probablemente fue generada por IA. La ausencia de la regla de agrupación, de la regla de agregación y del margen limita lo que puede inferirse de esa estimación; no borra su unidad publicada. La lectura cuidadosa de 43 % es por tanto «el modelo estimó 43 % del texto calificable», no «43 % de cada palabra de este documento, con una banda de error conocida».
La excepción documentada para documentos cortos
La documentación respalda una advertencia estrecha sobre la extensión, no una regla general que prediga la resolución de la puntuación a partir del número de palabras de un documento.
Las FAQs dicen: "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (En documentos más cortos, donde solo hay unos cientos de palabras, la predicción será mayormente «todo o nada» porque estamos prediciendo sobre un único segmento sin oportunidad de superposición. Esto significa que parte del texto que mezcla contenido generado por IA y contenido original podría marcarse como totalmente generado por IA.) Ese es un caso documentado de un solo segmento. Las páginas revisadas no publican una función general que muestre cómo cambia la resolución de la puntuación a medida que los documentos se hacen más largos.
Así que la pregunta práctica que hay que añadir no es un margen inventado, sino el contexto del informe: ¿cuánto texto calificable entró en la estimación, y es este el caso de un solo segmento de unos cientos de palabras sobre el que el proveedor advierte expresamente? No extrapoles ese comportamiento de los documentos cortos hasta convertirlo en una regla no publicada para un capítulo de 8.000 palabras. Documentos cortos y el problema del todo o nada en Turnitin analiza el caso corto documentado, y Qué se considera texto calificable en la detección de IA de Turnitin cubre qué entra y qué no entra en el denominador en primer lugar.
La banda donde el proveedor deja de mostrar una cifra
Hay un lugar donde Turnitin ha dicho en la práctica que la lectura no es bastante sólida como para imprimirla, y lo hizo quitando la cifra.
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Para evitar la posible incidencia de falsos positivos, no se atribuyen puntuaciones ni resaltados a los resultados de detección de IA en el rango del 1 % al 19 %. Cuando se detecta IA por debajo del umbral del 20 % en el informe, ahora se indica con un asterisco (*%) y no se atribuye ningún porcentaje.)
De ahí salen dos cosas que vale la pena llevarse. Primero: un asterisco no es una puntuación baja que te estén ocultando; es el proveedor negándose a atribuir una puntuación, y tampoco hay resaltados, así que no hay nada concreto sobre lo que nadie pueda señalar. Segundo: este es el lugar más claro de las tres páginas donde el proveedor retiene parte de su resultado por riesgo de falsos positivos. Es lo más parecido a una declaración de incertidumbre que encontramos, y adopta la forma de una regla en lugar de una cifra. Qué significa el asterisco (*%) en una puntuación de IA de Turnitin repasa lo que esa muestra significa realmente.
Cómo leer una cifra que viene sin margen
Con todo lo anterior, esto es lo que queda en pie como utilizable cuando alguien te pone un porcentaje delante.
- Deja de pedir el margen y pide el denominador. ¿De cuántas oraciones calificables salió esta cifra? Unos cientos de palabras significan una salida casi binaria según la propia descripción del proveedor.
- Fíjate en la dirección del ejemplo publicado. Un 50 informado podría ser 65. No encontramos ningún rango respaldado por fuentes en la otra dirección en las tres páginas revisadas.
- Trata el asterisco como ausencia de atribución, no como una cifra pequeña. Sin puntuación, sin resaltados.
- No conviertas la proporción estimada de texto calificable en una proporción de tus párrafos. Viene de una agrupación y una agregación no publicadas sobre segmentos, no de un recuento de oraciones que puedas localizar una a una.
- No le des importancia a un cambio entre versiones que el proveedor no ha definido. Las páginas revisadas no publican ningún umbral de significación para un cambio de unos pocos puntos. Mantén junto a la cifra el contexto de texto calificable y los resaltados de cada informe.
- Usa el propio marco del proveedor cuando te lo citen. Su FAQ dice que el porcentaje "should not be used as the sole basis for action or a definitive grading measure by instructors" (no debe usarse como única base para actuar ni como medida de calificación definitiva por parte del profesorado), y que su modelo "may not always be accurate" (puede no ser siempre exacto).
Si alguien te entrega un intervalo de confianza para una puntuación de IA de Turnitin, pregunta de dónde salió. Según la evidencia anterior, no salió de Turnitin.
Si de todos modos se van a reescribir pasajes concretos
Todo lo anterior trata de leer el informe en lugar de actuar sobre él, y las dos cosas deben seguir separadas. Pero hay una consecuencia práctica que vale la pena enunciar, porque se sigue directamente del problema de recuento: si un porcentaje no lleva publicada ninguna incertidumbre, perseguir el porcentaje es perseguir algo sin objetivo definido. Los pasajes resaltados sí tienen un objetivo definido. Son fragmentos concretos de texto que puedes mirar.
Esa es toda la razón por la que La herramienta HumanPen, que construimos nosotros, se organiza en torno a importar el informe y no la cifra que aparece en él. Lee esto como una descripción de primera parte. Entregas el AI Writing Report que ya tienes y los fragmentos marcados se convierten en el límite del trabajo; apruebas ese límite en pantalla, solo se reescriben los párrafos confirmados y todo lo demás queda intacto. Eso es una declaración sobre el alcance de la reescritura, no una afirmación sobre la subida, la transmisión o el almacenamiento. La razón para preferirlo a una pasada por todo el documento no es una cifra mejor, que nadie puede prometer. Cada párrafo modificado añade otra comprobación de fuentes antes de la entrega, así que un alcance estrecho mantiene corta esa cola de verificación. Cuando el archivo en sí es el resultado, qué pasa con las citas, las tablas y las ecuaciones en un humanizador de IA cubre qué revisar después.
Y la advertencia obvia, hacia la que esta página ha caminado durante ocho secciones: nadie puede decirte cuál será la próxima cifra, nosotros incluidos. Si escribiste el trabajo tú mismo, nada de esto se aplica. El argumento que hay que plantear trata de evidencia y proceso, no del texto.
Preguntas frecuentes
¿Publica Turnitin un margen de error para el porcentaje de IA? En las tres páginas que definen el informe, no. A lo largo de 46.712 caracteres leídos el 28 de agosto de 2026, `interval`, `margin`, `standard deviation`, `uncertain`, `precision`, `variance`, `error bar`, `plus or minus`, `±` y `estimat` dan todos cero, mientras que `percentage` da 47 y `false positive` da 21 sobre ese mismo texto.
¿Es 43 % realmente el 43 % de mi trabajo? Es la estimación derivada del modelo de que el 43 % del texto calificable probablemente fue generado por IA, no necesariamente el 43 % de todo el envío. Como no se publican las reglas de agrupación y agregación ni un margen, no puedes mapearlo uno a uno sobre párrafos visibles.
¿Podría la cantidad real de texto de IA ser mayor que la cifra mostrada? El proveedor lo dice directamente, con su propio ejemplo: identificar 50 % y el documento "could contain as much as 65% AI writing" (podría contener hasta un 65 % de escritura de IA). Ese ejemplo apunta hacia arriba. No encontramos ningún rango respaldado por fuentes en la dirección opuesta en las tres páginas revisadas.
¿Por qué un ensayo corto recibe una puntuación extrema? Porque puede haber un solo segmento. Las FAQs dicen que en documentos de unos cientos de palabras la predicción es "mostly 'all or nothing'" (mayormente «todo o nada»), y que por tanto el texto mixto puede marcarse como totalmente generado por IA.
¿Por qué mi informe muestra un asterisco en lugar de una cifra? Por debajo del umbral del 20 % el proveedor no atribuye puntuación ni resaltados, y muestra `*%` en su lugar, indicando que esto es para evitar la posible incidencia de falsos positivos.
¿Demuestra una puntuación baja o alta quién escribió mi documento? No. El ejemplo del proveedor dice que una proporción mostrada puede subestimar el texto de IA, pero las páginas revisadas no publican la información de calibración y de tasa base necesaria para convertir un porcentaje individual en peso probatorio. El proveedor también dice que el porcentaje no debe ser la única base para actuar.
Seguir leyendo