¿Es demasiado alto un 20% de IA? Por qué no existe un umbral absoluto

El 20% es el límite que usa Turnitin para mostrar un resultado numérico, no un criterio universal de mala conducta. El significado de cualquier informe depende del texto calificativo, los errores del modelo, la ubicación de los resaltados y las normas propias de cada institución.

Equipo de HumanPen

· 5 min de lectura

Nadie publica un umbral, ni siquiera Turnitin

No existe ningún corte establecido por la industria, ningún margen seguro aceptado y ninguna cifra de Turnitin que diga qué cuenta como demasiado. Las instituciones marcan sus propias prácticas y varían mucho: algunas ven cualquier alerta como motivo para hablar con el estudiante, otras ignoran el indicador y Vanderbilt lo desactivó por completo.

Así que la respuesta honesta a "¿es alto un 20 por ciento?" es que depende de una política que puedes ir a leer y no puede responderse solo con el número. Cualquier artículo que te ofrezca un porcentaje seguro se lo ha inventado.

La pregunta también esconde tres decisiones distintas. Turnitin elige una regla de informe sobre qué aparece en su interfaz. Una institución elige una regla de investigación sobre cuándo el personal revisa un trabajo. Un órgano disciplinario aplica un estándar probatorio al decidir si se incumplió una norma. El mismo número puede aparecer en las tres etapas, pero no las define por sí solo.

Un límite de informe del 20% no es una regla de mala conducta del 20%. Tratar ambos como intercambiables es el error central detrás de la mayoría de los consejos sobre "puntuación segura".

Además, dos informes del 20% no son necesariamente comparables. Un documento puede ser casi todo texto calificativo; otro puede estar dominado por tablas y anexos. Uno puede mostrar un único bloque concentrado; otro pasajes dispersos. El porcentaje comprime esos casos distintos en un solo titular, así que la interpretación empieza por el informe y la política, no por una tabla de colores universal.

El proveedor cambió cómo muestra el rango bajo

Hay un límite documentado, y es una regla de visualización. Desde julio de 2024, cuando el resultado de Turnitin cae del 1% al 19%, muestra un asterisco y ningún porcentaje numérico ni resaltados. Turnitin dice que sus pruebas encontraron una mayor incidencia de falsos positivos en el rango bajo y que ocultar el número reduce malas interpretaciones.

El asterisco es una advertencia sobre el rango bajo del modelo. No significa cero y no le dice a una institución qué conclusión disciplinaria alcanzar.

Un 20% visible y un 19% oculto caen en lados opuestos de la regla de interfaz, pero esa diferencia de un punto no crea un abismo científico. Cerca de cualquier umbral, pequeños cambios en el modelo o el texto pueden cambiar lo que ve el usuario. Por eso un informe del 20% debe leerse con contexto en lugar de tratarse como categóricamente distinto de un asterisco.

Los informes antiguos complican aún más la comparación. El cambio no fue retroactivo, así que un trabajo anterior al 8 de julio de 2024 puede seguir mostrando una puntuación numérica baja que un trabajo nuevo ocultaría. Guarda la fecha de creación, la versión del detector si está disponible y el PDF original o captura con el expediente del caso.

¿Qué pasó con la afirmación del 1 por ciento?

Cuando el detector se lanzó en abril de 2023, Turnitin promocionó una tasa de falsos positivos a nivel de documento de menos del 1 por ciento bajo sus condiciones de evaluación. En junio de 2023, el director de producto de la compañía le dijo a Inside Higher Ed que una cifra de falsos positivos a nivel de oración rondaba el 4 por ciento. Esas cifras usan unidades distintas y no deben presentarse como una simple revisión de 1 a 4.

Una tasa de falsos positivos también necesita un denominador y una población base. El error a nivel de oración pregunta con qué frecuencia las oraciones humanas se etiquetan incorrectamente; el error a nivel de documento pregunta con qué frecuencia un documento completamente humano cruza una regla de decisión. Ninguno puede multiplicarse por los 200 millones de trabajos revisados en su primer año de Turnitin para estimar acusaciones, porque se desconoce la mezcla de trabajos humanos, asistidos por IA, inelegibles y repetidos.

Vanderbilt usó sus aproximadamente 75.000 trabajos anuales para ilustrar la escala institucional: incluso una tasa reclamada pequeña puede implicar muchos casos que requieren revisión justa. No estableció que exactamente 750 estudiantes serían falsamente acusados. Una alerta puede nunca convertirse en una alegación y un trabajo puede contener muchas oraciones sin convertirse en un documento con falso positivo.

La tasa base importa por otra razón. Si el uso prohibido de IA es raro en una evaluación concreta, los falsos positivos pueden representar una parte sustancial de todas las alertas aunque la especificidad sea alta. Si el uso es común, el mismo detector puede tener un valor predictivo positivo distinto. Sin conocer la prevalencia, la sensibilidad, la especificidad y el proceso de revisión de la institución, un porcentaje mostrado no puede responder "¿cuál es la probabilidad de que este estudiante hiciera trampa?"

El porcentaje del detector, la tasa de falsos positivos y la probabilidad de mala conducta son tres cantidades distintas. Ninguna puede sustituir a otra.

Dónde se agrupan realmente los falsos positivos

Turnitin ha publicado un análisis de error más específico de pruebas que mezclaban oraciones escritas por humanos y por IA: el 54 por ciento de las oraciones con falso positivo observadas estaba inmediatamente junto a una oración escrita por IA, y otro 26 por ciento estaba a dos oraciones de distancia.

En esa evaluación, cuatro de cada cinco oraciones con falso positivo estaban a dos oraciones de texto con IA. Esto describe el comportamiento fronterizo en documentos mixtos; no muestra dónde caen los falsos positivos en un trabajo completamente humano y no debe generalizarse a cada versión posterior del modelo.

Esto tiene una consecuencia práctica. En un trabajo con algunos pasajes asistidos por IA, las oraciones de alrededor son las más propensas a ser marcadas por error y un porcentaje no puede decirte cuál es cuál. La distribución sí puede, por eso es el argumento para leer el informe mismo en lugar de su titular. Turnitin también informa una mayor incidencia de falsos positivos en las oraciones de apertura y cierre de un documento —introducciones y conclusiones— y cambió cómo las agrega por ello.

Por eso borrar o reescribir cada oración resaltada no es una respuesta diagnóstica sólida. Algunas oraciones fronterizas resaltadas pueden ser humanas; algunos pasajes no resaltados pueden estar asistidos por IA pero no detectados. El informe identifica áreas para revisión contextual. La evidencia de autoría sigue viniendo de borradores, fuentes, declaraciones de uso permitido y la capacidad del escritor para explicar el trabajo.

Preguntas mejores que "¿es esto alto"

  • ¿Qué hace mi institución con este número? Muchas lo tratan como un motivo para mirar, no como un hallazgo. El propio Turnitin dice que no determina mala conducta.
  • ¿Dónde están las alertas? Concentradas en métodos, definiciones y antecedentes —pasajes que se supone que deben leerse de forma formulaica— significa algo muy distinto de dispersas por tu argumento.
  • ¿Cuánto del documento se evaluó? El porcentaje cubre solo prosa. Un trabajo con muchas tablas, listas o bibliografía puede haber tenido mucho menos evaluado de lo que crees.
  • ¿Qué estado y fecha de informe estoy mirando? Asterisco, 0%, puntuación numérica y error de elegibilidad significan cosas distintas, y los informes anteriores a julio de 2024 siguen una regla de visualización antigua.
  • ¿Qué otra evidencia se requiere? Pregunta si los revisores examinan borradores, fuentes, historial de versiones, escritura previa y la explicación del estudiante en lugar de tratar el indicador como suficiente.

Para educadores, escribe este proceso antes de usar la función: quién puede ver el informe, qué desencadena una conversación, cómo los estudiantes reciben la evidencia, qué adaptaciones aplican y quién toma la decisión final. Para estudiantes, pide ese proceso por escrito y mantén el trabajo original sin cambios. Ambos pasos son más útiles que debatir si 20 es inherentemente "alto".