¿No eres hablante nativo y te han marcado por IA? Lo que dice la documentación
Escribir en una segunda lengua ya es bastante difícil sin que encima te marquen por IA. Según las preguntas frecuentes de Turnitin, los datos de entrenamiento incluyeron a estudiantes de inglés como segunda lengua para reducir el sesgo, pero no se aportan cifras. El detector sigue leyendo patrones de probabilidad de las palabras. Ciertos patrones de escritura académica habituales entre los hablantes no nativos pueden coincidir con las características que dan lugar a falsos positivos.
Equipo de HumanPen
· 4 min de lectura
La respuesta breve
Un hablante no nativo de inglés puede recibir una marca de IA en un texto escrito enteramente por una persona. Las preguntas frecuentes de Turnitin dicen que los datos de entrenamiento del modelo «took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries» (tuvieron en cuenta a grupos estadísticamente subrepresentados, como los estudiantes de inglés como segunda lengua y los usuarios de inglés de países de habla no inglesa) para reducir el sesgo. Esta es la afirmación de la propia empresa y no está verificada de forma independiente. El detector sigue funcionando clasificando patrones de probabilidad de las palabras en el texto. La escritura académica formal que se enseña a los hablantes no nativos, con su énfasis en plantillas estructuradas y transiciones estándar, puede dar lugar a un texto con poca variación estructural. Esa característica aparece en la propia lista de Turnitin de tipos de texto propensos a falsos positivos. Que te marquen no significa que tu inglés sea demasiado bueno ni demasiado robótico. Significa que el perfil estadístico de tu texto coincidió con los patrones que el modelo asocia con la IA.
Qué afirma Turnitin sobre la diversidad de sus datos de entrenamiento
Las preguntas frecuentes abordan el sesgo directamente:
"While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model." (Al crear nuestro conjunto de datos de muestra también tuvimos en cuenta a grupos estadísticamente subrepresentados, como los estudiantes de inglés como segunda lengua, los usuarios de inglés de países de habla no inglesa, los estudiantes de instituciones con matrícula diversa y las áreas de estudio menos habituales como antropología, geología, sociología y otras, con el fin de reducir el sesgo al entrenar nuestro modelo.)
Esta es la descripción que hace Turnitin de su metodología de entrenamiento. Lo que se afirma es que la escritura en segunda lengua estuvo representada en los datos de entrenamiento. Lo que la afirmación no incluye es ninguna cifra, resultado de prueba ni validación externa del rendimiento del modelo con textos escritos en segunda lengua. Las preguntas frecuentes no publican tasas de falsos positivos desglosadas entre hablantes nativos y no nativos. Se afirma, por tanto, que se usaron datos diversos, pero la eficacia de ese esfuerzo no se puede medir de forma independiente a partir de la documentación pública.
Cómo lee el detector la escritura en segunda lengua
El proceso de detección es el mismo para todos los textos:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, las frases del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. El modelo de detección de IA clasifica cada sección y le asigna un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA. Cada frase válida dentro de esas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas frases pueden tener varias puntuaciones, que luego se unifican en una sola. Estas puntuaciones por frase se agregan a su vez y se usan para calcular la puntuación de escritura por IA del documento completo.)
El detector no conoce tu origen lingüístico. Lee secuencias de palabras y las clasifica. Si tus patrones de escritura, moldeados por una enseñanza formal del inglés, producen secuencias de probabilidad que coinciden con lo que el modelo aprendió a asociar con el texto generado por IA, la puntuación puede ser más alta de lo que esperas. Qué miden los detectores de IA más allá de la perplejidad y la variación del estilo explica cuáles son esos patrones.
La coincidencia con las características de los falsos positivos
Las preguntas frecuentes enumeran los textos propensos a falsos positivos:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (En ocasiones los falsos positivos —es decir, marcar erróneamente como generado por IA un texto escrito por una persona— pueden afectar a contenidos con poca variación estructural, a textos que se repiten literalmente o a textos reformulados sin aportar ideas nuevas.)
La frase siguiente: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si nuestro indicador muestra una mayor cantidad de escritura por IA en ese tipo de texto, le recomendamos tenerlo en cuenta al mirar el porcentaje indicado.)
La enseñanza del inglés a hablantes no nativos suele insistir en las plantillas académicas estructuradas. Los estudiantes aprenden patrones de frase estándar, transiciones formales y estructuras de párrafo uniformes. Eso produce una escritura con el tipo de uniformidad que las preguntas frecuentes describen como propensa a falsos positivos. La coincidencia no es intencionada. Es consecuencia de cómo se enseña el inglés académico a los no nativos y de cómo el detector caracteriza un texto. Si la respuesta adecuada es escribir de otra manera, esa es otra pregunta: ¿deberías cambiar tu forma de escribir para evitar que te marquen.
Qué hacer si te marcan
Las preguntas frecuentes señalan:
"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors." (Por ello, debemos recalcar que el porcentaje del indicador de escritura por IA no debe usarse como única base para actuar ni como criterio de calificación definitivo por parte del profesorado.)
Si se marca tu texto escrito por ti, tienes argumentos para hablar con tu profesor. Puedes señalar las descripciones de textos propensos a falsos positivos de las preguntas frecuentes, explicar tu proceso de escritura y recordar que la puntuación es un dato más. También puedes citar la afirmación sobre la diversidad de los datos de entrenamiento, siendo honesto en que eso no garantiza inmunidad frente a los falsos positivos. Marcado, pero lo escribiste tú explica cómo armar ese caso.
Qué significa esto para ti
Para resumir lo que hemos visto:
- Turnitin afirma que sus datos de entrenamiento incluyeron a estudiantes de segunda lengua, pero no aporta cifras que permitan comprobar su eficacia.
- El detector lee patrones de probabilidad de las palabras, sea cual sea el origen lingüístico.
- La escritura académica formal habitual entre los hablantes no nativos puede coincidir con las características que provocan falsos positivos.
- Las preguntas frecuentes dicen que la puntuación no debe ser la única base para actuar.
- Si te marcan, tu proceso de escritura y las propias descripciones de falsos positivos de las preguntas frecuentes te dan argumentos para hablarlo.
Si tienes un informe de Turnitin que muestra qué pasajes se marcaron, importa el informe y trabaja esos pasajes concretos. Los pasajes que cumplen los requisitos se pueden volver a procesar sin coste.
Seguir leyendo