Turnitin sometió su propio detector a prueba para detectar sesgo contra quienes aprenden inglés. El resultado tiene dos mitades.

En entregas de más de 300 palabras, Turnitin informa de que la diferencia entre escritores L2 y L1 es pequeña y no estadísticamente significativa. En entregas de entre 150 y 300 palabras, la misma evaluación encontró una diferencia mayor, muy por encima de su propio objetivo del 1 %. Y Turnitin señala una limitación de su muestra que importa si escribes a nivel universitario.

Equipo de HumanPen

· 6 min de lectura

La respuesta corta, con sus dos mitades

Turnitin hizo su propia evaluación sobre esta pregunta y publicó el resultado. La respuesta tiene dos mitades y apuntan en direcciones opuestas.

En entregas de 300 palabras o más, comprobó que la diferencia en la tasa de falsos positivos (FPR) entre quienes escriben inglés como segunda lengua (L2) y quienes lo escriben como lengua materna (L1) era pequeña y no estadísticamente significativa. En entregas de entre 150 y 300 palabras, la misma evaluación encontró una diferencia mayor, muy por encima de su propio objetivo del 1 %.

Que el hallazgo tranquilizador te cubra o no depende, por tanto, de la extensión de lo que entregaste. También hay una limitación que Turnitin señala sobre su propia muestra; importa si escribes a nivel universitario y está más abajo.

Qué se probó

Turnitin reunió hasta 2,000 textos para cada combinación de dos variables: inglés L2 (aprendiz de inglés) frente a inglés L1 (lengua materna), y «demasiado corto» (entre 150 y 300 palabras) frente a «suficientemente largo» (300 palabras o más). Los conjuntos de datos no formaban parte del conjunto de entrenamiento de su detector.

El resultado que llega al titular

En los documentos que alcanzan el mínimo de 300 palabras, Turnitin informa de que la diferencia en la tasa de falsos positivos entre escritores L2 y L1 es pequeña y no estadísticamente significativa:

"For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target." (En los documentos que cumplen nuestro requisito mínimo de 300 palabras, la diferencia en la tasa de falsos positivos (FPR) entre escritores de inglés L2 (escritores ELL) y escritores de inglés L1 (angloparlantes nativos) es pequeña y no estadísticamente significativa, lo que demuestra que nuestro detector no está sesgado entre estos dos grupos de escritores. Además, aunque la FPR de cada grupo es algo superior a nuestro objetivo global de 0,01 (1 %), la FPR de ninguno de los grupos difiere significativamente de ese objetivo.)

«Not statistically significant» (no significativo estadísticamente) significa que la diferencia que encontraron podría ser ruido. No significa que la diferencia sea cero, y no significa que no exista sesgo. Y la tasa de falsos positivos de ambos grupos quedó por encima del objetivo del 1 %, solo que por un margen que la prueba no consideró relevante. «Slightly higher» (ligeramente superior) no es lo mismo que «at or below.» (en el objetivo o por debajo).

El resultado que no llega al titular

En los documentos de entre 150 y 300 palabras, la misma evaluación encontró la dirección contraria. La diferencia entre escritores L2 y L1 fue mayor y la tasa de falsos positivos quedó significativamente por encima del objetivo del 1 %:

"Conversely, for documents that are (Por el contrario, para los documentos que sean) "too short," (demasiado cortos:) we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum." (Encontramos una diferencia mayor en la FPR entre estos grupos de escritores, significativamente superior a nuestro objetivo de 0,01 FPR. Esto corrobora de nuevo nuestro hallazgo anterior: los detectores de escritura con IA necesitan muestras más largas para identificar correctamente el contenido generado por IA y mantener los falsos positivos al mínimo.)

El mismo estudio, sobre el mismo detector, dio un resultado para los textos largos y otro distinto para los cortos. El título del blog lleva el primero. El segundo está en el cuerpo.

Qué había realmente en la muestra

Esto es lo que dice Turnitin:

"Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation." (La mayoría de los documentos en inglés L2 son tareas de escritura breves, persuasivas o informativas, muy parecidas al corpus de redacciones de nivel secundario del Automated Scoring and Assessment Prize (ASAP). No se disponía de una colección comparable y pública de documentos universitarios completos escritos por autores L2 y L1 para esta evaluación.)

Los textos L2 de esta evaluación son sobre todo redacciones de nivel secundario. Si estás escribiendo un trabajo universitario, una revisión bibliográfica, un informe de laboratorio o un capítulo de tesis, eso no es lo que se probó. Turnitin dice que no encontraron una colección pública de textos universitarios completos de escritores L2 y L1 con la que hacer esta comparación. El hallazgo «not statistically significant» (no significativo estadísticamente) se aplica a redacciones cortas persuasivas o informativas de nivel secundario. Que valga también para el tipo de documento que entregas tú es algo que esta evaluación no puede responder.

La línea de las 300 palabras

Turnitin vincula el mínimo de 300 palabras directamente a esta investigación. Tras evaluar 800,000 documentos y comprobar que las entregas cortas elevaban la tasa de falsos positivos, pasaron a exigir 300 palabras:

"Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission." (Nuestra evaluación de 800,000 documentos, mencionada antes en este blog, muestra una tasa de falsos positivos algo más alta de lo deseable en las entregas cortas (menos de 300 palabras). Puede que en muestras tan breves no haya suficiente señal ni suficientes marcadores para identificar las diferencias de distribución que delatan la escritura con IA. Para asegurarnos de mantener nuestra tasa de falsos positivos por debajo del 1 %, actualizamos rápidamente la longitud mínima de entrega a 300 palabras para que nuestra función de detección de escritura con IA procese una entrega.)

El mínimo existe porque los textos cortos dieron problemas. El resultado tranquilizador solo se aplica por encima de ese mínimo. Por debajo, la misma evaluación encontró la diferencia que te interesaría conocer.

¿Y el estudio de Liang?

Puede que hayas visto titulares sobre un estudio de Liang. Turnitin lo aborda directamente:

"Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short." (La afirmación de Liang se apoya en una pequeña colección de apenas 91 redacciones de práctica del TOEFL (Test of English as a Foreign Language), todas de menos de 150 palabras. La detección de escritura con IA de Turnitin no se incluyó en esta evaluación, quizá en parte porque no hacemos predicciones sobre documentos tan cortos.)

Qué hacer con esto

Si tu entrega supera las 300 palabras, los datos del propio Turnitin dicen que la diferencia entre las tasas de falsos positivos de L2 y L1 es pequeña y no estadísticamente significativa. Eso no garantiza que no te marquen. Significa que la evaluación no encontró pruebas sólidas de que los escritores L2 estén sistemáticamente en peor situación, al menos no en la muestra que tenían.

Esto es lo que sí puedes usar:

Comprueba tu número de palabras antes de entregar. Si marcan una sección de menos de 300 palabras, la propia evaluación del detector dice que los textos cortos producen una diferencia mayor entre escritores L2 y L1 y una tasa de falsos positivos más alta en general. Puedes pedir a tu docente que ejecute la comprobación sobre el documento completo en lugar de sobre un fragmento corto.

Pregunta qué te marcó y con qué umbral. Si se usó Turnitin, el mínimo de 300 palabras y el detalle de «slightly higher than 1%» (ligeramente por encima del 1 %) son cosas concretas que puedes plantear a quien revise la marca.

Guarda tus borradores, notas y fuentes. Si te marcan y crees que tu escritura en L2 influyó, mostrar tu historial de revisiones y tus materiales de consulta es lo que resuelve la conversación. Discutir con tu profesor sobre significancia estadística probablemente no la resuelva.

Seguir leyendo