Detección AIGC en artículos en inglés: qué significa y cómo funciona

«Detección AIGC» es el término que usan muchos investigadores chinos para referirse a la detección de escritura con IA en artículos en inglés. El mecanismo de detección es el mismo, se llame como se llame. Las preguntas frecuentes de Turnitin describen un proceso que clasifica segmentos de texto superpuestos según la probabilidad de las palabras. Entender el mecanismo te ayuda a leer tu informe con precisión.

Equipo de HumanPen

· 4 min de lectura

La respuesta breve

La detección AIGC en artículos en inglés se refiere al mismo proceso que la detección de escritura con IA. El detector de Turnitin divide tu texto en segmentos superpuestos, clasifica cada segmento según la probabilidad de que sea humano o generado por IA y agrupa esas puntuaciones en un porcentaje a nivel de documento. El término «AIGC» (AI-generated content, contenido generado por IA) es habitual en el ámbito académico chino, pero el mecanismo de detección es el mismo, se llame como se llame. El detector no busca firmas ni marcas de agua de herramientas de IA concretas. Lee patrones estadísticos en la elección de palabras, en concreto patrones de probabilidad de palabras aprendidos durante el entrenamiento. La puntuación de IA es completamente independiente de la puntuación de similitud (plagio), y solo el profesorado o el personal administrativo puede ver el indicador de IA.

Cómo funciona la detección AIGC

Las preguntas frecuentes de Turnitin describen el proceso de detección:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada segmento lo clasifica el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración válida dentro de esos segmentos hereda la puntuación del segmento. Como los segmentos se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se agrupan en una sola. Estas puntuaciones de oración se agregan a su vez y se usan para calcular la puntuación global de escritura con IA del documento.)

El detector no busca frases concretas que «parezcan de IA». Clasifica segmentos de texto con un modelo que aprendió patrones estadísticos de los datos de entrenamiento. Cada segmento recibe una probabilidad, y esas probabilidades se agrupan y se condensan en un único porcentaje. El porcentaje representa la proporción del texto válido que el modelo clasifica como probablemente generado por IA.

Qué lee el modelo

Dos afirmaciones de las preguntas frecuentes aclaran el enfoque del modelo. Primera: «Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.» (Nuestro modelo no está programado explícitamente para evaluar señales específicas como 'burstiness', 'perplexity' u otras métricas individuales que a veces se mencionan en debates públicos.) La frase siguiente: «Instead, it learns statistical patterns from our training data.» (En cambio, aprende patrones estadísticos a partir de nuestros datos de entrenamiento.) Segunda: «Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.» (Nuestros clasificadores están entrenados para detectar esas diferencias en la probabilidad de las palabras y conocen bien las secuencias particulares de probabilidad de palabras de los escritores humanos.)

El modelo no calcula métricas con nombre como la burstiness o la perplexity. Pero está entrenado con datos de probabilidad de palabras. Los patrones que aprende se expresan en cómo se eligen y se encadenan las palabras, no en rasgos superficiales como la variación en la extensión de las oraciones o la diversidad de vocabulario. Por eso los retoques superficiales —cambiar algunas palabras o añadir transiciones— pueden no modificar la puntuación. El detector lee rasgos estadísticos más profundos de las secuencias de palabras, que es el tema de qué miden los detectores de IA más allá de la perplexity y la burstiness.

Solo se analiza la prosa

Las preguntas frecuentes especifican qué cuenta como texto analizable:

«This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Este texto válido incluye únicamente oraciones en prosa, es decir, solo analizamos bloques de texto escritos en oraciones gramaticales estándar y que no incluyen otros tipos de escritura como listas, viñetas (estructuras cortas que no son oraciones) u otras estructuras que no son oraciones.)

La frase siguiente: «This percentage is not necessarily the percentage of the entire submission.» (Este porcentaje no es necesariamente el porcentaje de todo el envío.)

Para los artículos académicos en inglés, esto significa que las tablas de metodología, los bloques de ecuaciones, los pies de figura y la lista de referencias quedan en gran parte fuera del análisis de IA. El porcentaje se aplica solo a las partes en prosa del manuscrito. Un artículo con muchas tablas y ecuaciones tiene menos texto válido, lo que significa que el porcentaje de IA representa una parte menor del documento de lo que parece. En cómo leer un informe de escritura con IA de Turnitin se explica paso a paso dónde aparece esa diferencia en la página.

Puntuación AIGC frente a puntuación de similitud

Las dos puntuaciones son mediciones distintas:

«The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (La puntuación de similitud y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen mutuamente.)

Tu puntuación de similitud refleja cuánto de tu texto coincide con fuentes existentes en la base de datos. Tu puntuación AIGC refleja cuánto de tu texto clasifica el modelo como probablemente generado por IA. Un artículo puede tener una similitud alta (por fuentes correctamente citadas) y una puntuación AIGC baja, o una similitud baja y una puntuación AIGC alta. Trabajar en una puntuación no afecta a la otra. Si intentas bajar tu puntuación AIGC, bajar la de similitud no te servirá, y viceversa; tomar ambas puntuaciones como si fueran lo mismo es el error más habitual.

Qué hacer si tu puntuación AIGC es alta

Para resumir lo que hemos visto:

  • La detección AIGC en artículos en inglés funciona igual que la detección de escritura con IA: clasifica patrones de probabilidad de palabras en segmentos de prosa.
  • El modelo no calcula la burstiness ni la perplexity como métricas con nombre, pero está entrenado con datos de probabilidad de palabras.
  • Solo se analizan las oraciones en prosa. Las tablas, las ecuaciones y las listas de referencias quedan en gran parte excluidas.
  • La puntuación AIGC y la de similitud son completamente independientes. Modificar una no afecta a la otra.
  • Solo el profesorado y el personal administrativo pueden ver el indicador de IA. El alumnado puede pedir la versión en PDF a su profesor o profesora.

Si tienes un informe de Turnitin o iThenticate que muestra qué pasajes se marcaron, importa el informe y trabaja sobre esos pasajes concretos. Los pasajes que cumplen los requisitos pueden volver a procesarse sin coste.

Seguir leyendo