¿Turnitin marca los ensayos de reflexión como IA? Falsos positivos explicados
Los ensayos de reflexión se sitúan en la intersección entre la voz personal y la estructura genérica. La propia documentación de Turnitin describe los tipos de texto que desencadenan falsos positivos, y los ensayos de reflexión encajan en varias de esas descripciones. Los ensayos cortos se enfrentan a un problema de puntuación del tipo "todo o nada". Esto es lo que dice la documentación y qué hacer con la puntuación.
Equipo de HumanPen
· 5 min de lectura
Por qué los ensayos de reflexión despiertan sospechas
Los ensayos de reflexión piden a los estudiantes que escriban sobre sus propias experiencias, pero la estructura tiende a ser repetitiva. Presentas la experiencia, describes lo que ocurrió y extraes una enseñanza. El formato introspectivo hace que las frases sigan patrones similares entre diferentes estudiantes. La documentación de Turnitin describe los tipos de texto que producen falsos positivos:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A veces los falsos positivos, es decir, marcar incorrectamente texto escrito por humanos como generado por IA, pueden incluir contenido sin mucha variación estructural, texto que literalmente se repite, o texto que ha sido parafraseado sin desarrollar ideas nuevas.)
La frase siguiente: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si nuestro indicador muestra una cantidad mayor de escritura con IA en dicho texto, le aconsejamos que lo tenga en cuenta al observar el porcentaje indicado.)
Los ensayos de reflexión suelen tener estas tres características. La variación estructural es baja porque el formato introspectivo sigue un arco predecible. La redacción se repite porque los estudiantes usan vocabulario similar para describir crecimiento, desafíos y aprendizaje. Las ideas están parafraseadas del material del curso sin necesariamente desarrollar argumentos nuevos. Nada de esto significa que el texto fue generado por IA. Significa que el texto coincide con el perfil de texto que el propio Turnitin dice que puede producir falsos positivos, lo cual se entiende mejor cuando sabes qué miden los detectores de IA.
Cómo el detector procesa tu texto
Para entender por qué un ensayo de reflexión recibe una puntuación alta, debemos ver cómo funciona el detector:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, las frases de la entrega se extraen y segmentan en secciones superpuestas para el análisis de predicción. Cada segmento es clasificado por el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA. Cada frase que cumple los requisitos dentro de estos segmentos hereda la puntuación del segmento. Como los segmentos se superponen, algunas frases pueden tener múltiples puntuaciones, que luego se combinan en una única puntuación. Estas puntuaciones de frases se agregan y se usan para calcular la puntuación general de escritura con IA del documento.)
Cada frase recibe una puntuación de probabilidad. Las puntuaciones se combinan y agregan en un porcentaje a nivel de documento. Un ensayo de reflexión con patrones de frases consistentemente similares podría recibir puntuaciones altas en todos los segmentos, y esas puntuaciones se acumulan hasta dar un porcentaje general alto.
Qué analiza realmente el detector
El detector no procesa cada palabra de la entrega. Solo procesa texto que cumple los requisitos:
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (El modelo no detecta de forma fiable texto generado por IA en forma de texto que no sea prosa, o código, ni tampoco detecta escritura corta/no convencional como viñetas (estructuras cortas que no son frases).)
La frase siguiente: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Esto significa que un documento que contiene varios tipos de escritura diferentes daría como resultado una disparidad entre el porcentaje y los pasajes resaltados.)
La misma documentación aclara qué cuenta:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto que cumple los requisitos incluye únicamente frases de prosa, lo que significa que solo analizamos bloques de texto escritos en frases gramaticales estándar y que no incluyen otros tipos de escritura como listas, viñetas (estructuras cortas que no son frases) u otras estructuras que no sean frases.)
La frase siguiente: "This percentage is not necessarily the percentage of the entire submission." (Este porcentaje no es necesariamente el porcentaje de toda la entrega.)
En los ensayos de reflexión, la mayor parte del texto son frases de prosa, así que el texto que cumple los requisitos abarca casi todo el documento. El problema de la disparidad es menos preocupante aquí que en documentos de formato mixto. El porcentaje que ves está cerca del porcentaje de la prosa real.
El problema del documento corto
Los ensayos de reflexión suelen ser cortos. Un ensayo de 500 palabras es común, y la documentación advierte precisamente sobre este escenario:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (En documentos más cortos donde solo hay unos pocos cientos de palabras, la predicción será en su mayoría de "todo o nada" porque estamos prediciendo sobre un único segmento sin oportunidad de superposición.)
La frase siguiente: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Esto significa que algún texto que es una mezcla de contenido generado por IA y original podría ser marcado como enteramente generado por IA.)
En un ensayo de reflexión corto, el detector puede tener solo un segmento que puntuar. No hay superposición que suavice la predicción. Si ese único segmento recibe una puntuación alta, todo el trabajo queda marcado. Un documento mixto que es en parte original y en parte asistido por borrador podría reportarse como 100% generado por IA, que es una de las vías por las que Turnitin dice que tu trabajo es 100% IA. La longitud corta elimina el efecto de promediado del que se benefician los documentos más largos.
No trates la puntuación como única prueba
La documentación de Turnitin es explícita sobre cómo debe y no debe usarse la puntuación:
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Nuestro modelo de detección de escritura con IA puede no ser siempre preciso, puede identificar erróneamente texto escrito por humanos, generado por IA y parafraseado por IA, por lo que no debe usarse como única base para tomar medidas adversas contra un estudiante.)
La frase siguiente: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Se requiere un escrutinio adicional y juicio humano junto con la aplicación por parte de la organización de sus políticas académicas específicas para determinar si ha ocurrido una mala conducta académica.)
Una fuente separada de Turnitin refuerza esta posición:
"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy." (No está diseñado para ofrecer respuestas definitivas de forma aislada. Más importante que cualquier herramienta es el educador que ve la puntuación y toma decisiones equilibrando esta información con su conocimiento personal de sus estudiantes, su trabajo y la política institucional.)
La frase siguiente: "When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended." (Cuando los educadores observan la puntuación de escritura con IA y la utilizan como un único punto de datos en lugar de una respuesta definitiva, entonces se está usando como estaba previsto.)
Si tu ensayo de reflexión recibe una puntuación alta de IA, la puntuación es un único punto de datos. No es una prueba. La documentación dice que el modelo puede identificar erróneamente el texto, y pide juicio humano junto con la política institucional. Si eres tú quien tiene que responder por la puntuación, marcado, pero lo escribiste tú cubre cómo preparar esa respuesta.
Qué significa esto para ti
Para resumir lo que hemos cubierto:
- Los ensayos de reflexión coinciden con varios patrones de falsos positivos descritos en la documentación de Turnitin, incluyendo baja variación estructural, redacción repetitiva e ideas parafraseadas.
- Turnitin aconseja: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si nuestro indicador muestra una cantidad mayor de escritura con IA en dicho texto, le aconsejamos que lo tenga en cuenta al observar el porcentaje indicado.)
- El detector segmenta el texto y puntúa cada segmento. Los trabajos cortos pueden tener solo un segmento, lo que crea un resultado de todo o nada.
- Los ensayos de reflexión cortos (unos pocos cientos de palabras) enfrentan el mayor riesgo de una puntuación binaria.
- La puntuación no debe usarse como única base para tomar medidas adversas. Es un único punto de datos que requiere juicio humano.
Si recibes un informe de IA de Turnitin sobre un ensayo de reflexión y quieres abordar los pasajes marcados, importa el informe y trabaja en ellos. Los pasajes elegibles pueden volver a ejecutarse sin cargo.