Revisiones sistemáticas y detección de IA: por qué los apartados de metodología suelen marcarse
Las revisiones sistemáticas siguen plantillas metodológicas rígidas. La sección de metodología repite los mismos verbos y estructuras de oración en todos los estudios, lo cual coincide con los patrones de falsos positivos que describe Turnitin. El detector no mide burstiness ni perplexity. Es un clasificador de probabilidad léxica. Esto es lo que dice la documentación sobre cómo se genera la puntuación y cómo interpretarla.
Equipo de HumanPen
· 6 min de lectura
Por qué los apartados de metodología coinciden con patrones de falsos positivos
Las revisiones sistemáticas exigen una sección de metodología estandarizada. Describes las bases de datos consultadas, las cadenas de búsqueda, los criterios de inclusión y exclusión, y el proceso de cribado. El lenguaje es necesariamente repetitivo porque la lista de verificación PRISMA exige elementos de notificación específicos. La documentación de Turnitin describe los tipos de texto que producen falsos positivos:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A veces los positivos falsos (marcar incorrectamente texto escrito por humanos como generado por IA) pueden incluir contenido sin mucha variación estructural, texto que literalmente se repite, o texto que ha sido parafraseado sin desarrollar ideas nuevas.)
La frase siguiente reza: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si nuestro indicador muestra una mayor cantidad de escritura con IA en ese tipo de texto, le aconsejamos que lo tenga en cuenta al observar el porcentaje indicado.)
Un apartado de metodología cumple los tres criterios, por eso que Turnitin marcó toda mi sección de metodología sea una queja tan frecuente. La variación estructural es baja porque todas las revisiones sistemáticas reportan los mismos pasos. La redacción se repite ("buscamos", "identificamos", "cribamos"). El texto es una paráfrasis de descripciones de protocolo sin desarrollar ideas nuevas. La documentación dice que se debe considerar el porcentaje cuando el texto coincide con estos patrones, no aceptarlo como definitivo.
Cómo el detector calcula la puntuación
El pipeline de detección divide el texto elegible en segmentos y puntúa cada uno:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y segmentan en secciones superpuestas para análisis de predicción. Cada segmento es clasificado por el modelo de detección de IA y recibe un valor entre 0 y 1, que denota la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración elegible dentro de estos segmentos hereda la puntuación del segmento. Como los segmentos se superponen, algunas oraciones pueden tener múltiples puntuaciones, que luego se combinan en una sola. Estas puntuaciones por oración se agregan y se usan para calcular la puntuación general de escritura con IA del documento.)
En una revisión sistemática, los patrones repetitivos del apartado de metodología pueden generar puntuaciones altas de segmento en múltiples segmentos superpuestos. Esas puntuaciones se agregan en un porcentaje a nivel de documento. Un apartado de metodología de 800 palabras puede elevar la puntuación de toda una revisión de 5000 palabras. Si terminas revisándolo, lo que puedes reformular y lo que debe mantenerse exacto señala las líneas que no puedes mover.
Lo que realmente mide el detector
El detector no evalúa burstiness, perplexity ni otras métricas nombradas, una afirmación que se examina en usa Turnitin perplejidad y burstiness para detectar IA:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Nuestro modelo no está programado explícitamente para evaluar señales específicas como 'burstiness', 'perplexity' u otras métricas individuales a las que a veces se hace referencia en debates públicos.)
La frase siguiente reza: "Instead, it learns statistical patterns from our training data." (En cambio, aprende patrones estadísticos de nuestros datos de entrenamiento.)
La misma fuente explica lo que realmente hace el modelo:
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nuestros clasificadores están entrenados para detectar estas diferencias en probabilidad léxica y son expertos en las secuencias particulares de probabilidad de palabras de escritores humanos.)
El detector evalúa secuencias de probabilidad léxica. Comprueba si las palabras de un segmento coinciden con patrones aprendidos de escritura humana o de texto generado por IA. En un apartado de metodología, la secuencia de palabras viene determinada por la plantilla de informe. Frases como "buscamos en las siguientes bases de datos" y "los estudios se incluyeron si" aparecen en miles de trabajos. Estas secuencias pueden alinearse más estrechamente con patrones estadísticos de los datos de entrenamiento que con las elecciones léxicas de un escritor individual. Esa alineación puede producir una puntuación de probabilidad alta sin intervención de IA.
Qué se considera texto analizado
El detector solo procesa texto de calificación:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto elegible incluye solo oraciones en prosa, lo que significa que solo analizamos bloques de texto escritos en oraciones gramaticales estándar y que no incluyen otros tipos de escritura como listas, viñetas (estructuras cortas que no son oraciones) u otras estructuras que no son oraciones.)
La frase siguiente reza: "This percentage is not necessarily the percentage of the entire submission." (Este porcentaje no es necesariamente el porcentaje de todo el envío.)
Las revisiones sistemáticas contienen tablas (diagramas de flujo PRISMA, tablas de extracción) y listas estructuradas (criterios de inclusión y exclusión). Esto no es prosa elegible. El porcentaje cubre solo oraciones en prosa. Si tu apartado de resultados consiste principalmente en tablas, el porcentaje se inclina hacia secciones ricas en prosa como la metodología. La documentación también señala:
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (El modelo no detecta de forma fiable texto generado por IA en forma de no prosa o código, ni detecta escritura corta/no convencional como viñetas (estructuras cortas que no son oraciones).)
La frase siguiente reza: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Esto significa que un documento que contiene varios tipos de escritura diferentes daría lugar a una disparidad entre el porcentaje y los resaltados.)
Una revisión sistemática es un documento multiformato. La disparidad entre el porcentaje y los resaltados es un comportamiento esperado.
Segmentos cortos
Los apartados de metodología a veces se dividen en subsecciones cortas. Una subsección de estrategia de búsqueda puede tener solo 200 palabras. La documentación advierte:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (En documentos más cortos donde solo hay unos pocos cientos de palabras, la predicción será principalmente de 'todo o nada' porque estamos prediciendo sobre un solo segmento sin oportunidad de superposición.)
La frase siguiente reza: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Esto significa que algún texto que es una mezcla de contenido generado por IA y original podría marcarse como totalmente generado por IA.)
Para una subsección corta, el detector puede predecir sobre un solo segmento sin superposición que module la puntuación. Una subsección escrita por humanos pero que sigue una plantilla podría recibir una puntuación alta de todo o nada.
Mejora de límites de Turnitin
En 2023, Turnitin también abordó los falsos positivos en los límites del documento:
"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (Desde el lanzamiento, hemos observado una mayor incidencia de detección de falsos positivos en las primeras o últimas oraciones de un documento. Muchas veces estas oraciones consisten en contenido de introducción o conclusión escrito de forma genérica. Como resultado, hemos cambiado nuestra lógica de detección para ayudar a reducir estos falsos positivos.)
La frase siguiente reza: "We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (También trabajamos en hacer más precisa la detección de límites de segmentos, lo que podría llevar en algunos casos raros a un cambio de límites en comparación con una versión anterior.)
Esta fue una mejora de 2023. Las introducciones y conclusiones de revisiones sistemáticas siguen plantillas (antecedentes, brecha, objetivo, resumen de hallazgos). El cambio de lógica abordó este patrón.
No tomes la puntuación como única prueba
La documentación de Turnitin es explícita sobre las limitaciones:
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Nuestro modelo de detección de escritura con IA puede no ser siempre preciso (puede identificar incorrectamente texto escrito por humanos, generado por IA y parafraseado con IA), por lo que no debe usarse como única base para acciones adversas contra un estudiante.)
La frase siguiente reza: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Requiere un escrutinio adicional y juicio humano junto con la aplicación por parte de una organización de sus políticas académicas específicas para determinar si ha ocurrido mala conducta académica.)
Una revisión sistemática con una puntuación alta de IA en su apartado de metodología no es prueba de mala conducta. El apartado de metodología coincide con patrones de falsos positivos. El detector es un clasificador de probabilidad léxica. La puntuación requiere juicio humano y política institucional. Qué se le indica a tu instructor hacer cuando tu porcentaje de IA es alto es la orientación con la que trabaja el evaluador.
Qué significa esto para ti
En resumen:
- Los apartados de metodología coinciden con patrones de falsos positivos: baja variación estructural, redacción repetitiva y texto parafraseado sin ideas nuevas.
- El detector es un clasificador de probabilidad léxica, no un evaluador de burstiness ni perplexity.
- Solo se analiza la prosa elegible. Las tablas, listas y viñetas se excluyen.
- Las subsecciones cortas de metodología enfrentan un problema de puntuación de todo o nada.
- En 2023, Turnitin mejoró la lógica de detección para reducir falsos positivos en los límites del documento.
- La puntuación no debe usarse como única base para acciones adversas. Requiere juicio humano.
Si recibes un informe de IA de Turnitin sobre una revisión sistemática y quieres abordar los pasajes marcados, import the report y trabaja en ellos. Los pasajes elegibles pueden volver a ejecutarse sin Cargo.
Seguir leyendo