Cómo trata Turnitin las ecuaciones matemáticas y el contenido que no es prosa

Si estudias matemáticas o ingeniería, es normal que te preguntes si las ecuaciones y las fórmulas afectan a tu puntuación de IA. Las preguntas frecuentes de Turnitin dicen que el modelo solo analiza frases de prosa calificable y que no detecta de forma fiable el contenido que no es prosa. También dicen que Turnitin no está trabajando en la detección de código. Esto es lo que cuenta como texto calificable y lo que no.

Equipo de HumanPen

· 4 min de lectura

La respuesta corta

Las ecuaciones matemáticas, las fórmulas y los bloques de código no los analiza el detector de IA de Turnitin. Las preguntas frecuentes dicen: «This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Este texto calificable incluye únicamente frases de prosa, lo que significa que solo analizamos bloques de texto escritos con frases gramaticalmente correctas y estándar, y que no incluimos otros tipos de escritura como listas, viñetas —estructuras cortas que no son frases— u otras estructuras que no son frases.) Del modelo se dice además que «does not reliably detect AI-generated text in the form of non-prose, or code.» (no detecta de forma fiable el texto generado por IA en forma de contenido que no sea prosa o de código.) Y añaden: «In addition, we are not pursuing ChatGPT code detection at this time.» (Además, por ahora no estamos trabajando en la detección de código de ChatGPT.) Esto significa que tus ecuaciones y fórmulas no influyen directamente en tu puntuación de IA. La puntuación refleja únicamente las partes de prosa de tu documento. Si tu trabajo son sobre todo ecuaciones con algún texto explicativo breve, el detector de IA está evaluando muy poco texto, y eso hace que la puntuación diga menos.

Qué se considera texto calificable

Las preguntas frecuentes definen qué es lo que examina el modelo:

«This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Este texto calificable incluye únicamente frases de prosa, lo que significa que solo analizamos bloques de texto escritos con frases gramaticalmente correctas y estándar, y que no incluimos otros tipos de escritura como listas, viñetas —estructuras cortas que no son frases— u otras estructuras que no son frases.)

La frase siguiente: «This means that a document containing several different writing types would result in a disparity between the percentage and the highlights.» (Esto significa que un documento que contenga varios tipos de escritura distintos daría lugar a una discrepancia entre el porcentaje y los fragmentos resaltados.)

Para un trabajo de matemáticas o de ingeniería, esto significa que las ecuaciones en sí no se evalúan. Solo quedan sujetas a la detección de IA las frases de prosa que las rodean: las explicaciones, las introducciones y las discusiones. Si tienes una página llena de ecuaciones con dos frases de explicación, esas dos frases son exactamente lo que evalúa el detector. Y si reescribes, surge la pregunta inversa: qué pasa con las citas, las tablas y las ecuaciones en un humanizador de IA.

El código y el contenido que no es prosa

Las preguntas frecuentes son directas sobre el contenido que no es prosa:

«The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures).» (El modelo no detecta de forma fiable el texto generado por IA en forma de contenido que no sea prosa o de código, y tampoco detecta escritos breves o poco convencionales como las viñetas —estructuras cortas que no son frases—.)

Las preguntas frecuentes también dicen: «In addition, we are not pursuing ChatGPT code detection at this time.» (Además, por ahora no estamos trabajando en la detección de código de ChatGPT.)

Esto tiene una consecuencia práctica para los trabajos de ciencias e ingeniería. Si usaste una herramienta de IA para generar código o ecuaciones, el detector de IA no está diseñado para captar eso. Lo que evalúa es la prosa que rodea al código, no el código ni las matemáticas en sí.

Cómo funciona el mecanismo con la prosa

El modelo de detección procesa el texto calificable dividiéndolo en segmentos que se solapan:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated.» (Cuando se envía un trabajo a Turnitin, las frases del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. El modelo de detección de IA clasifica cada sección y le asigna un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o esté generado por IA.)

Los segmentos se solapan, así que una frase puede recibir varias puntuaciones que después se combinan. En un trabajo con muchas ecuaciones y poca prosa, esa ventaja del solapamiento se pierde, porque hay menos frases de prosa que dividir. La puntuación se vuelve menos estable: el modelo tiene menos datos con los que trabajar.

¿Y qué pasa con las tablas y los datos?

Una nota de versión de agosto de 2023 describe cómo maneja el modelo las tablas:

«We are now able to process long-form prose text in tables.» (Ahora podemos procesar texto de prosa extenso dentro de tablas.)

La frase siguiente: «Resubmit to reprocess existing submissions that contain tables.» (Vuelve a enviar el trabajo para reprocesar los envíos existentes que contengan tablas.)

Esto significa que, si tu tabla contiene frases de prosa extensas, esas frases sí se analizan hoy. Pero los datos en bruto, los números y las etiquetas cortas de las tablas no son frases de prosa y quedan fuera de la definición de texto calificable. Las bibliografías también quedan excluidas: la misma nota de versión dice «Bibliographies are now excluded when processing the AI writing report.» (Las bibliografías ahora se excluyen al procesar el informe de escritura con IA.) La frase siguiente vuelve a exigir un reenvío para los trabajos ya entregados, y por eso un informe antiguo puede seguir pareciendo un caso en el que Turnitin marcó tus referencias.

La puntuación de IA y la de similitud son cosas distintas

Una confusión habitual es pensar que el contenido matemático marcado en la revisión de similitud también afecta a la puntuación de IA. No es así. Las preguntas frecuentes dicen:

«The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (La puntuación de similitud y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen entre sí.)

Si tus ecuaciones coinciden con una fuente de la base de datos de similitud, eso afecta a tu puntuación de similitud, no a la de IA. El detector de IA solo examina la prosa en busca de patrones de texto generado por IA, sin importar lo que encuentre la revisión de similitud. El error que conviene evitar aquí es tomar las dos puntuaciones por lo mismo.

Qué significa esto para ti

Para resumir lo que hemos visto:

  • Las ecuaciones y fórmulas matemáticas no las analiza el detector de IA. Solo cuentan las frases de prosa calificable.
  • Según las preguntas frecuentes, el modelo no detecta de forma fiable el contenido que no es prosa ni el código, y no está trabajando en la detección de código.
  • Las tablas con prosa extensa sí se procesan hoy, pero los datos en bruto y las etiquetas cortas no.
  • Las bibliografías quedan excluidas del procesamiento de la detección de IA.
  • La puntuación de IA y la de similitud son completamente independientes y no se influyen entre sí.
  • Los trabajos con muchas ecuaciones y poca prosa dejan al modelo menos texto que evaluar, y eso puede hacer que la puntuación sea menos estable.

Si recibes un informe de Turnitin sobre un trabajo de ciencias o ingeniería y quieres ocuparte de los fragmentos de prosa marcados, importa el informe y trabaja sobre ellos. Los fragmentos que cumplen los requisitos se pueden volver a pasar sin coste.

Seguir leyendo