Estudiantes internacionales y las puntuaciones de IA: lo que debes saber sobre escribir en una segunda lengua

Escribir textos académicos en inglés siendo una segunda lengua ya es bastante difícil sin tener que preocuparse por los detectores de IA. Las preguntas frecuentes de Turnitin indican que los datos de entrenamiento incluyeron a estudiantes de segundas lenguas para minimizar el sesgo. Pero el detector sigue analizando patrones de probabilidad de palabras, y ciertas características de escritura son propensas a falsos positivos. Esto es lo que significa para los estudiantes internacionales.

Equipo de HumanPen

· 4 min de lectura

La respuesta corta

Las preguntas frecuentes de Turnitin dicen que los datos de entrenamiento del modelo «took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model» (tuvieron en cuenta grupos estadísticamente subrepresentados como estudiantes de segundas lenguas, usuarios de inglés de países no angloparlantes, estudiantes de colegios y universidades con matrículas diversas y áreas temáticas menos comunes como antropología, geología, sociología y otras para minimizar el sesgo al entrenar nuestro modelo). Esta es la afirmación de Turnitin, no una conclusión verificada de forma independiente. La inclusión en el conjunto de entrenamiento significa que el modelo estuvo expuesto a escritura de segundas lenguas durante el entrenamiento. Pero el detector sigue funcionando clasificando patrones de probabilidad de palabras en texto en prosa. Si tu escritura comparte patrones estadísticos con textos generados por IA en inglés, el detector puede marcarla aunque el inglés no sea tu primera lengua. Entender esta brecha entre la afirmación sobre el entrenamiento y el mecanismo de detección es clave para responder a una marca.

Lo que Turnitin afirma sobre el sesgo

Las preguntas frecuentes abordan el sesgo directamente:

«While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model.» (Al crear nuestro conjunto de datos de muestra, también tuvimos en cuenta grupos estadísticamente subrepresentados como estudiantes de segundas lenguas, usuarios de inglés de países no angloparlantes, estudiantes de colegios y universidades con matrículas diversas y áreas temáticas menos comunes como antropología, geología, sociología y otras para minimizar el sesgo al entrenar nuestro modelo.)

Esta es la declaración de la empresa sobre su metodología de entrenamiento. Dice que los datos de entrenamiento se diseñaron para incluir muestras de escritura diversas. Pero no proporciona números, resultados de pruebas ni validación externa de los niveles de sesgo. La afirmación es que la escritura de segundas lenguas estaba representada en el entrenamiento. Lo que la afirmación no dice es que la escritura de segundas lenguas sea inmune a los falsos positivos. El modelo se entrenó con datos diversos, pero sigue clasificando por patrones de probabilidad de palabras. El artículo Por qué los detectores de IA marcan más a menudo a escritores de inglés no nativos analiza la investigación sobre esa brecha.

Cómo el detector lee tu texto

El proceso de detección funciona igual sin importar quién escribió el texto:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Cuando se envía un trabajo a Turnitin, se extraen oraciones del envío y se segmentan en secciones superpuestas para el análisis de predicción. El modelo de detección de IA clasifica cada segmento y le asigna un valor entre 0 y 1, que denota la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración que califica dentro de estos segmentos hereda la puntuación del segmento. Como los segmentos se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se combinan en una sola. Estas puntuaciones de oraciones se agregan aún más y se utilizan para calcular la puntuación general de escritura con IA del documento.)

El detector no conoce tu formación lingüística. No ajusta su clasificación según si eres hablante nativo o no nativo de inglés. Lee las características estadísticas de tus secuencias de palabras y las clasifica. Si tus patrones de escritura en inglés, quizás influenciados por una instrucción formal que enfatiza ciertas frases y estructuras académicas, coinciden con los patrones que el modelo asocia con texto generado por IA, la puntuación puede ser más alta de lo que esperas.

Falsos positivos y escritura en segunda lengua

Las preguntas frecuentes enumeran características de texto propensas a falsos positivos:

«Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.» (A veces los falsos positivos (marcar incorrectamente texto escrito por humanos como generado por IA) pueden incluir contenido sin mucha variación estructural, texto que se repite literalmente o texto que ha sido parafraseado sin desarrollar ideas nuevas.)

La siguiente oración: «If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.» (Si nuestro indicador muestra una cantidad mayor de escritura con IA en ese tipo de texto, le aconsejamos tenerlo en cuenta al observar el porcentaje indicado.)

Algunas de estas características pueden ser más comunes en la escritura académica en segunda lengua. Los hablantes no nativos suelen aprender inglés mediante plantillas estructuradas y frases académicas repetidas, lo que puede producir escritura con menos variación estructural. Conectores como «moreover», «furthermore» e «in addition» se enseñan como conectores estándar, y su uso repetido puede producir el tipo de estructura uniforme que describen las preguntas frecuentes. Esto no significa que la escritura en segunda lengua siempre sea marcada. Significa que las características asociadas con falsos positivos pueden coincidir con patrones comunes en la escritura instruida en segunda lengua. Si la respuesta es escribir de manera diferente es otra pregunta: ¿deberías cambiar tu forma de escribir para evitar marcas de IA.

No puedes ver tu propia puntuación

Una cosa más que los estudiantes internacionales deben saber. Las preguntas frecuentes indican: «only instructors and administrators are able to see the indicator» (solo los instructores y administradores pueden ver el indicador). Los estudiantes no pueden consultar su propia puntuación de IA. Las preguntas frecuentes continúan: «However, with the PDF download feature, instructors can download and share the AI report with students.» (Sin embargo, con la función de descarga en PDF, los instructores pueden descargar y compartir el informe de IA con los estudiantes.) Si te preocupa tu puntuación, la única forma de verla es pedirle a tu instructor que comparta contigo el informe en PDF. No puedes ejecutar la misma verificación tú mismo desde una cuenta de estudiante. Una vez que tengas el PDF, el siguiente paso es cómo leer un informe de escritura con IA de Turnitin.

Qué hacer si te marcan

Para resumir lo que hemos cubierto:

  • Turnitin afirma que sus datos de entrenamiento incluyeron estudiantes de segundas lenguas para minimizar el sesgo, pero no proporciona números que verifiquen esta afirmación.
  • El detector analiza patrones de probabilidad de palabras sin importar quién escribió el texto o cuál es su lengua materna.
  • Las características propensas a falsos positivos, como la baja variación estructural, pueden coincidir con patrones comunes en la escritura académica en segunda lengua.
  • Los estudiantes no pueden ver su propia puntuación de IA. Solo los instructores pueden, pero pueden compartir el PDF.
  • La puntuación de IA y la puntuación de similitud son mediciones independientes.

Si tienes un informe de Turnitin que muestra qué pasajes fueron marcados, importa el informe y trabaja en esos pasajes específicos. Los pasajes elegibles pueden volverse a ejecutar sin costo.

Seguir leyendo