¿Por qué Turnitin marca mi trabajo como 100% de IA?
Si Turnitin dice 100% de IA en algo que escribiste tú mismo, la puntuación es real pero el veredicto no es lo que parece. Los documentos cortos, la estructura repetitiva y la paráfrasis sin ideas nuevas empujan el texto humano hacia el 100%. La propia documentación de Turnitin dice que las puntuaciones no deben usarse como única base para medidas adversas.
Equipo de HumanPen
· 9 min de lectura
La respuesta corta
Una puntuación del 100% no significa que Turnitin esté seguro de que tu texto sea generado por IA. Para documentos más cortos, unos cientos de palabras, la predicción es sobre todo «todo o nada» porque el sistema evalúa un único segmento sin superposición que permita promediar. El texto con poca variación estructural, repetición literal o paráfrasis sin ideas nuevas es más propenso a falsos positivos. Y el propio Turnitin dice, en tres documentos de ayuda distintos, que la puntuación no debe usarse como única base para medidas adversas contra un estudiante.
Ya hemos explicado cómo funciona la detección de IA de Turnitin en términos del clasificador y sus segmentos. Este artículo trata sobre qué pasa cuando ese sistema devuelve un 100% en un texto que sabes que escribiste tú mismo. Las causas son mecánicas, no arbitrarias, y están documentadas en las propias páginas de Turnitin.
El problema de los documentos cortos
Esta es la razón más común por la que un texto humano genuino obtiene una puntuación del 100%. Las preguntas frecuentes sobre las capacidades de detección de escritura con IA de Turnitin describen lo que ocurre con envíos cortos:
«In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.» (En documentos más cortos con solo unos cientos de palabras, la predicción será sobre todo «todo o nada» porque se predice sobre un único segmento sin la oportunidad de superponer.)
La siguiente frase es la que completa el cuadro:
«This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (Esto significa que un texto que es una mezcla de contenido generado por IA y contenido original podría marcarse como enteramente generado por IA.)
Lee esas dos frases juntas y la puntuación del 100% en un trabajo corto deja de parecer un veredicto. Parece un límite en la resolución del instrumento. Cuando solo hay un segmento, no hay nada contra lo que promediar. Un segmento de alta probabilidad se convierte en la puntuación de todo el documento. Si tu ensayo tiene 300 o 500 palabras, esta es la primera posibilidad que hay que comprobar.
Turnitin también señaló en una versión de diciembre de 2023 que «submissions that contain less than 300 words may result in an AI writing score that is likely less accurate.» (Los envíos que contienen menos de 300 palabras pueden dar como resultado una puntuación de escritura de IA que probablemente sea menos precisa.) Los documentos cortos son más difíciles de evaluar, y el sistema lo sabe.
Qué tipo de texto recibe marcas de falso positivo
La misma página de preguntas frecuentes enumera los tipos de texto en los que los falsos positivos son más probables:
«Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.» (A veces los falsos positivos (marcar incorrectamente texto escrito por un humano como generado por IA) pueden incluir contenido sin mucha variación estructural, texto que se repite literalmente o texto que se ha parafraseado sin desarrollar ideas nuevas.)
La siguiente frase importa tanto como la propia lista:
«If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.» (Si nuestro indicador muestra una cantidad mayor de escritura con IA en dicho texto, le aconsejamos que lo tenga en cuenta al mirar el porcentaje indicado.)
Eso es Turnitin diciendo a los instructores que descuenten el porcentaje cuando aparece en este tipo de texto. Si tu escritura es estructuralmente uniforme (párrafos de longitud similar, formas de oración similares, vocabulario recurrente), o si parafraseaste material de fuente de cerca sin añadir tu propio análisis, la puntuación puede subir aunque cada palabra sea tuya.
Esto no es un fallo. Es el clasificador leyendo la uniformidad como una señal. Los patrones estadísticos que parecen regulares pueden coincidir con lo que el modelo aprendió del texto de IA, incluso cuando el texto lo produjo un humano que resultó escribir en un registro consistente. A escala institucional eso se acumula, que es la aritmética de qué significa una tasa de falsos positivos del 1% cuando una universidad presenta 75 000 trabajos.
La puntuación del 100% es un agregado, no un veredicto
Para entender por qué un único segmento puede producir un 100%, ayuda ver cómo funciona la puntuación de principio a fin. Las preguntas frecuentes de Turnitin describen el proceso:
«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se segmentan en secciones superpuestas para el análisis de predicción. Cada segmento se clasifica mediante el modelo de detección de IA y se le asigna un valor entre 0 y 1, que denota la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración que cumpla los requisitos dentro de estos segmentos hereda la puntuación del segmento. Dado que los segmentos se superponen, algunas oraciones pueden tener múltiples puntuaciones, que luego se agrupan en una sola puntuación. Estas puntuaciones de oraciones se agregan aún más y se utilizan para calcular la puntuación general de escritura con IA del documento.)
En un documento más largo, hay muchos segmentos superpuestos. Una oración cerca del límite de un segmento también aparece dentro del siguiente. Las puntuaciones de ambos segmentos se agrupan. Un segmento que se lee como similar a la IA no domina, porque los segmentos vecinos tiran de la puntuación agrupada en otras direcciones.
En un documento corto, solo hay un segmento. Sin superposición. Sin agrupación entre ventanas. La clasificación de ese único segmento se convierte en la puntuación del documento. Si ese segmento se clasifica con una probabilidad de IA de 0,95, la puntuación del documento es del 100% (o a lo que la agregación lo asigne). El sistema no tiene una segunda opinión que consultar.
Esta es la razón mecánica por la que las puntuaciones del 100% se concentran en trabajos cortos. No es que los trabajos cortos tengan más probabilidad de ser generados por IA. Es que el instrumento tiene menos oportunidades de corregirse a sí mismo.
Lo que el propio Turnitin dice sobre el uso de las puntuaciones
La propia documentación de Turnitin es más cautelosa con sus puntuaciones de lo que tienden a ser las instituciones que las utilizan. La guía del AI Writing Report señala:
«Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student.» (Nuestro modelo de detección de escritura con IA puede no siempre ser preciso (puede identificar incorrectamente texto escrito por humanos, generado por IA y parafraseado por IA), por lo que no debe usarse como única base para medidas adversas contra un estudiante.)
La siguiente frase en esa misma guía:
«It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred.» (Se necesita un mayor escrutinio y juicio humano junto con la aplicación por parte de una organización de sus políticas académicas específicas para determinar si se ha producido una falta de integridad académica.)
Una guía de revisión aparte formula el mismo punto de manera diferente:
«It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy.» (No está diseñado para proporcionar respuestas definitivas de forma aislada. Más importante que cualquier herramienta es el educador que ve la puntuación y toma decisiones equilibrando esta información con su conocimiento personal de sus estudiantes, su trabajo y la política institucional.)
Y la frase después de esa:
«When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended.» (Cuando los educadores miran la puntuación de escritura con IA y la utilizan como un único punto de datos en lugar de una respuesta definitiva, entonces se está utilizando como se pretende.)
Estas son las palabras de Turnitin, no nuestras. La empresa que construyó el detector está diciendo a las personas que lo usan que una puntuación es un punto de datos, no una conclusión. Si tu institución trata el 100% como prueba definitiva, la institución está usando la herramienta de una manera que Turnitin dice que no se debe usar.
Pasos prácticos si obtuviste un 100% en tu propia escritura
Comprueba la longitud del documento. Si el envío tenía unos cientos de palabras, el comportamiento de «todo o nada» descrito en F9 es la explicación más probable. La puntuación refleja los límites de la predicción de un solo segmento, no una determinación sobre tu proceso de escritura.
Comprueba si tu texto coincide con el perfil de falso positivo. Poca variación estructural, repetición literal y paráfrasis sin ideas nuevas son las tres características que el propio Turnitin menciona. Si tu texto tiene alguna de estas, el consejo oficial es tenerlo en cuenta al leer el porcentaje. Eso es una cita que puedes llevar a una reunión.
Pregunta cuándo se generó el informe. En mayo de 2023, Turnitin cambió su lógica de detección para reducir los falsos positivos en la primera y la última oración de los documentos, que habían estado produciendo tasas de falsos positivos más altas. La corrección está documentada en sus notas de versión. Si el informe es anterior a esa corrección, puede reflejar un problema que ya se ha abordado. Los informes generados antes de julio de 2024 también pueden mostrar puntuaciones numéricas en el rango de 1 a 19 que los informes actuales muestran como un asterisco. El punto es: los informes antiguos se comportan de manera diferente a los nuevos, y la fecha importa.
Aporta evidencia de tu proceso de escritura. Historial de versiones, archivos de borrador con marcas de tiempo, historial del navegador que muestre actividad de investigación. Estos no son argumentos sobre la puntuación. Son el «further scrutiny and human judgment» (un escrutinio adicional y un juicio humano) que Turnitin dice debe acompañar a la puntuación.
Cita las propias palabras de Turnitin. La afirmación de que la puntuación «should not be used as the sole basis for adverse actions against a student» (no debe usarse como única base para medidas adversas contra un estudiante) aparece en tres documentos distintos de Turnitin. La afirmación de que la puntuación es «a single data point rather than a definitive response» (un único punto de datos en lugar de una respuesta definitiva) es cómo Turnitin dice que la herramienta debe usarse. Estas no son opiniones. Son las instrucciones de funcionamiento declaradas por el fabricante. Si estás redactando qué decir, marcado, pero lo escribiste tú mismo trata sobre cómo preparar esa respuesta.
Lo que nos llevamos de esto
La herramienta HumanPen es una herramienta de reescritura de documentos. La decisión de diseño relevante aquí es que reescribimos a nivel de pasaje, no a nivel de puntuación. No intentamos mover un número que no podemos ver. Tomamos los pasajes que el AI Writing Report marcó, cambiamos el lenguaje real de esos pasajes y dejamos el resto del documento intacto. La facturación cuenta solo las palabras reescritas, y si un informe nuevo sobre el texto reescrito sigue mostrando un 20% o más, la repetición de los pasajes aún marcados es gratuita.
No te diremos qué dirá tu próximo informe. No hacemos predicciones sobre puntuaciones de detección. Lo que hacemos es más limitado que eso: reescribimos el lenguaje específico en los pasajes específicos que el informe identificó y preservamos la estructura, las citas y el formato que los rodean.
Preguntas frecuentes
¿Puede equivocarse Turnitin sobre un 100% de IA? Sí. Las propias preguntas frecuentes de Turnitin dicen que los documentos cortos obtienen predicciones de «todo o nada» en un único segmento, y que el texto sin variación estructural o con paráfrasis cercana es más propenso a falsos positivos. La puntuación del 100% es un agregado de clasificaciones a nivel de segmento, y en un documento corto puede haber solo un segmento.
¿Significa 100% de IA que Turnitin está seguro? No. El porcentaje es la salida de un clasificador aplicado a segmentos superpuestos, agrupados y agregados. En un documento de un solo segmento, un segmento de alta probabilidad se convierte en toda la puntuación. Turnitin dice que la puntuación «should not be used as the sole basis for adverse actions against a student» (no debe usarse como única base para medidas adversas contra un estudiante) y es «a single data point rather than a definitive response.» (un único punto de datos en lugar de una respuesta definitiva).
¿Por qué mi ensayo corto obtuvo 100% pero mi trabajo largo no? Los documentos más largos tienen más segmentos superpuestos, por lo que las puntuaciones se agrupan entre ventanas y un solo segmento similar a la IA se diluye. Los documentos cortos tienen un segmento, sin superposición, sin dilución. Esta es una propiedad mecánica del proceso de puntuación, no un juicio sobre tu escritura.
¿Y si usé Grammarly? Las preguntas frecuentes de Turnitin dicen que los cambios de ortografía, gramática y puntuación de Grammarly «in most cases» (en la mayoría de los casos) no se marcan como IA. Pero las funciones generativas de Grammarly (generación de borradores, paráfrasis, resumen) son una categoría diferente, y el contenido producido por esas funciones «will likely be flagged as AI-generated.» (probablemente se marcará como generado por IA).
¿Puedo usar las propias palabras de Turnitin en mi defensa? Sí. La afirmación de que la puntuación no debe ser la única base para la acción aparece en tres documentos de Turnitin. La afirmación de que la puntuación es un único punto de datos aparece en su guía de revisión. Estas son las instrucciones de funcionamiento del fabricante, y son relevantes para cualquier conversación sobre lo que significa una puntuación.
Seguir leyendo