Informes de ensayos aleatorizados y detección de IA: lo que CONSORT 2025 decidió antes de que escribieras

Un informe de ensayo aleatorizado se escribe dos veces antes de que nadie lo lea: una vez como protocolo y otra como artículo, en ambos casos contra listas de verificación numeradas del mismo grupo. La lista publicada llega hasta una sola palabra de tu título. Conviene saberlo antes de decidir qué frases cambiar porque un detector las marcó.

Equipo de HumanPen

· 15 min de lectura

¿Por qué un informe de ensayo aleatorizado vuelve con una puntuación de IA alta si los datos son míos?

Porque la mayor parte de un informe de ensayo está especificada de antemano y gran parte de él es un segundo relato de algo que ya escribiste. CONSORT 2025 enumera treinta elementos que el informe debe cubrir, te dice que pongas una palabra concreta en el título y desplaza los recuentos de participantes a un diagrama de flujo y las características basales a una tabla. Lo que queda en prosa continua son la narrativa de Métodos y la Discusión, y la narrativa de Métodos es un relato condensado de un protocolo registrado. Turnitin, en documentos que no mencionan en absoluto los ensayos clínicos, dice que solo mide frases en prosa y que sus propios falsos positivos pueden afectar a texto con poca variación estructural o texto parafraseado sin ideas nuevas. Un marcador en una sección de Métodos no es prueba de nada sobre cómo se escribió esa sección, y recortar contenido de la lista de verificación para que parezca menos uniforme empeora el informe.

Nada en el lado del proveedor dice nada de esto sobre los ensayos. Leímos las tres páginas que definen el AI Writing Report (Using the AI Writing Report, las AI writing detection capabilities FAQs y File requirements for an AI Writing Report) el 27 de agosto de 2026, 38.174 caracteres de texto de artículo renderizado en total, y buscamos: `CONSORT` 0 resultados, `clinical` 0, `trial` 0, `randomis` 0, `randomiz` 0, `protocol` 0, `checklist` 0, `registr` 0. El instrumento funcionaba en la misma pasada: `prose` 12 resultados, `qualifying` 12.

La otra dirección es la que más fácilmente se interpreta mal, así que también la contamos. En las trece páginas de contenido listadas en el mapa del sitio de SPIRIT-CONSORT, más la lista de verificación CONSORT 2025 y su versión ampliada de doce páginas, 61.768 caracteres en total: `detection` 0 resultados, `detector` 0, `Turnitin` 0, `generative` 0, `large language` 0, `ChatGPT` 0, `plagiarism` 0. Comprobación de sensibilidad en la misma pasada: `consort` 107, `trial` 167, `randomis` 36. `Artificial intelligence` devuelve exactamente un resultado, en la página de extensiones, donde nombra una extensión SPIRIT para ensayos cuya intervención es un sistema de IA. Eso es un estándar para informar sobre un ensayo de una herramienta de IA, que es un asunto distinto de que un autor use una. Así que la conexión que se traza abajo es nuestra, armada a partir de dos conjuntos de documentos que nunca se han referido el uno al otro.

La guía pone nombre a una palabra de tu título

El elemento 1a de la lista de verificación CONSORT 2025 dice `Identification as a randomised trial` (Identificación como ensayo aleatorizado). La lista ampliada, que es donde el grupo desarrolla cada elemento, lo dice sin rodeos:

`Use the word "randomised" in the title` (Usa la palabra «aleatorizado» en el título)

Es una guía de publicación que llega hasta una sola palabra de una sola línea. Es una buena norma y existe por una buena razón: quienes indexan y quienes hacen revisiones sistemáticas necesitan encontrar tu ensayo. También significa que la primera línea de todos los informes de este género, en todo el mundo, lleva el mismo término.

El elemento 1b especifica después el resumen. Su lista de contenidos obligatorios tiene siete viñetas, tres de las cuales se abren en diez más, y entre todas nombran catorce cosas que el resumen debe llevar: objetivos, diseño y marco del ensayo, criterios de elegibilidad y entornos, intervenciones y comparadores, resultados primarios, cómo se asignó a los participantes, quién fue cegado, cifras aleatorizadas por grupo, cifras analizadas por grupo, un resultado por grupo con tamaño del efecto y precisión, daños importantes, una interpretación general, el nombre y el número del registro y las fuentes de financiación. Debajo de la lista hay una instrucción más, impresa con asteriscos en el original:

`Do not report information that does not appear in the body of the paper` (No informes de información que no aparezca en el cuerpo del artículo)

Leída como una restricción de escritura, es insólita: se exige que tu resumen sea una compresión de tu propio artículo y se exige que no contenga nada nuevo. En el lado del proveedor hay una frase para eso, en el párrafo donde Turnitin describe cómo suelen ser sus falsos positivos, y es `text that has been paraphrased without developing new ideas` (texto que se ha parafraseado sin desarrollar ideas nuevas). Nadie afirma que esos dos documentos hablen de lo mismo. No lo hacen. Pero un resumen escrito según el elemento 1b encaja en esa descripción por construcción y, aparte de sus encabezados de sección, es frases en prosa de la primera palabra a la última.

La sección de Métodos es la segunda vez que la escribiste

Esta es la parte que no tiene equivalente en casi ningún otro género, y es la razón por la que un informe de ensayo es un problema distinto de un artículo con una lista de verificación pegada.

Antes de que el ensayo se llevara a cabo, hubo un protocolo. El elemento 3 de CONSORT exige que digas dónde está: `Where the trial protocol and statistical analysis plan can be accessed` (Dónde se puede acceder al protocolo del ensayo y al plan de análisis estadístico), y la lista ampliada pide una URL de su ubicación. El elemento 2 exige el nombre del registro, el número identificativo, la URL y la fecha de registro. El elemento 10 exige que informes de `Important changes to the trial after it commenced including any outcomes or analyses that were not prespecified, with reason` (cambios importantes en el ensayo después de su inicio, incluidos los resultados o análisis que no estaban preespecificados, con el motivo).

Apila esos tres y describen una situación concreta: tus criterios de elegibilidad, tu método de aleatorización, tu ocultación de la asignación, tus procedimientos de cegamiento y tus análisis planificados quedaron escritos en un documento al que tu artículo señala públicamente, y el artículo vuelve a informar del mismo contenido en forma más breve. Eso no es un atajo. Es el sentido del registro prospectivo.

El lado del protocolo tiene su propia guía del mismo grupo, SPIRIT 2025, una lista de 34 elementos publicada junto a CONSORT y financiada con la misma subvención. Los dos documentos comparten por tanto algo más que su temática. Se escribieron contra listas numeradas emparejadas que se revisan juntas.

Si alguna vez has sentido que tu sección de Métodos parece un formulario, esta es la razón. Dos de los documentos más especificados de la publicación académica describen los mismos procedimientos, uno tras otro, según dos listas de verificación alineadas.

Las cifras se sacaron de la prosa a propósito

CONSORT va más allá de decir qué hay que informar. Para varios de los elementos más pesados dice también en qué forma hay que hacerlo.

Elemento CONSORT 2025Forma exigidaQué implica eso para una medición que solo lee prosa
22a, participantes asignados al azar, que recibieron la intervención, analizados`In a flow diagram, the number of participants:` (En un diagrama de flujo, el número de participantes) seguido de una lista con viñetas de recuentosUn diagrama de recuentos no contiene frases en prosa
22b, pérdidas y exclusiones tras la aleatorización con motivosTambién `In a flow diagram` (En un diagrama de flujo)Igual
25, características demográficas y clínicas basales`A table showing baseline demographic and clinical characteristics for each group` (Una tabla con las características demográficas y clínicas basales de cada grupo)Una cuadrícula de medias, desviaciones típicas y porcentajes
27, todos los daños o eventos no intencionados`For each group preferably in a table with the number of participants at risk` (Para cada grupo, preferiblemente en una tabla con el número de participantes en riesgo)Sobre todo tabular, con algo de prosa alrededor
2, registro del ensayoNombre del registro, número, URL, fechaLíneas cortas en lugar de frases
5a y 5b, financiación y conflictosFinanciadores nombrados, roles, intereses declaradosA menudo un bloque de declaraciones con entradas cortas

Ahora pon a su lado la definición que da Turnitin de lo que lee:

`This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.` (Este texto calificable incluye únicamente oraciones en prosa, lo que significa que solo analizamos bloques de texto escritos en oraciones gramaticales estándar y no incluimos otros tipos de escritura como listas, viñetas (estructuras cortas que no son oraciones) u otras estructuras que no son oraciones.)

Y la frase que la sigue en la misma página:

`This percentage is not necessarily the percentage of the entire submission.` (Este porcentaje no es necesariamente el porcentaje de todo el envío.)

La lista de referencias también queda fuera, según la propia nota de lanzamiento del proveedor de agosto de 2023, que dice que se corrigió un error que marcaba escritura con IA dentro de las referencias bibliográficas y que `Bibliographies are now excluded when processing the AI writing report.` (Las bibliografías ahora se excluyen al procesar el informe de escritura con IA). Esa nota añade que un envío debe volver a enviarse antes de que el cambio se le aplique.

Así que resta el diagrama de flujo, la tabla basal, la tabla de daños, la línea de registro y la lista de referencias. Lo que queda en la medición es la introducción, la narrativa de Métodos, la narrativa de resultados alrededor de las tablas y la Discusión. Es decir: las partes que CONSORT especifica con más detalle, menos casi todas las partes que llevan tus cifras reales. Qué es el texto calificable en la detección de IA de Turnitin cubre la regla general y ¿Lee Turnitin el texto dentro de las tablas? cubre el caso de las tablas, incluida la parte de esa nota de lanzamiento sobre la prosa larga dentro de las celdas de una tabla.

Hay una segunda consecuencia que conviene señalar. Un informe corto cuya prosa analizada apenas llega a unos cientos de palabras cae en el comportamiento que Turnitin describe como `mostly "all or nothing" because we're predicting on a single segment without the opportunity to overlap` (sobre todo «todo o nada», porque predecimos sobre un único segmento sin oportunidad de solapamiento), y la frase siguiente dice `some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated` (un texto que mezcla contenido generado por IA y contenido original podría marcarse por completo como generado por IA). Un informe de ensayo con un diagrama grande, tres tablas y cuarenta referencias es más corto, en el sentido que se mide, de lo que sugiere su número de páginas. Documentos cortos y el problema del todo o nada en Turnitin lo desarrolla.

Donde la lista de verificación decide también sobre tu redacción, no solo sobre tu contenido

Dos elementos van más allá de enumerar contenido, y ambos son fáciles de pasar por alto porque aparecen como una sola línea dentro de una tabla larga.

El elemento 22b, sobre pérdidas y exclusiones tras la aleatorización, añade esto:

`The wording "protocol deviation" is not sufficiently explicit and exact reasons should be reported` (La expresión «desviación del protocolo» no es suficientemente explícita y deben informarse motivos exactos)

Que una guía de publicación nombre una expresión y la rechace es poco frecuente. La razón de que importe aquí no tiene que ver con ningún detector. Si durante una revisión sustituyes un motivo concreto por una expresión resumen ordenada, has incumplido el elemento 22b. Ese fallo es invisible para quien corrige el texto y evidente para un revisor que conoce la lista.

El elemento 29, sobre la interpretación, es el otro:

`Avoid overinterpretation ('spin')` (Evita la sobreinterpretación, «spin»)

La Discusión se suele describir como la parte libre de un artículo. En este género viene con una instrucción sobre hasta dónde pueden llegar tus afirmaciones, junto con requisitos de relacionar los resultados con la evidencia existente y de sopesar beneficios frente a daños. El elemento 30 nombra después las cuatro cosas que tu párrafo de limitaciones debe abordar: limitaciones metodológicas, imprecisión, generalizabilidad y multiplicidad de análisis cuando proceda.

Lo que la lista de verificación nunca toca

Aquí está la distinción que decide lo que haces a continuación, y no es la que ofrece la mayoría de los consejos de revisión.

CONSORT especifica qué debe aparecer, en varios lugares en qué forma debe aparecer y en dos lugares qué expresión evitar. No escribe tus frases. Nada en la lista te dice cómo formular por qué importaba la pregunta.

Fijo, y rastreable hasta un número. Lo útil aquí no es una advertencia general sobre lo que no hay que tocar. Es que cada uno de estos elementos tiene un número al que puedes señalar. Los recuentos del diagrama de flujo son 22a y 22b. El nombre del registro, el número, la URL y la fecha son el elemento 2. La elegibilidad tal como se aplicó realmente es 12a. Quién generó la secuencia de asignación y con qué método es 17a. Quién fue cegado y cómo se logró el cegamiento son 20a y 20b. El resultado por grupo con tamaño del efecto y precisión, y los efectos tanto absolutos como relativos para resultados binarios, es el elemento 26. Eso cambia la forma de una conversación, porque «no puedo quitar esto» se recibe de otro modo cuando lleva una cita adjunta. Para la disciplina general de separar la expresión del contenido científico, en CONSORT, STROBE y PRISMA en conjunto, véase Métodos y resultados: qué puedes reformular y qué debe permanecer exacto.

Tuyo, y normalmente poco aprovechado. El elemento 6 pide `Importance of the research question` (Importancia de la pregunta de investigación) y `Why a new trial is needed in the context of available evidence` (Por qué se necesita un nuevo ensayo en el contexto de la evidencia disponible), con subelementos sobre cómo podría funcionar la intervención y por qué elegiste ese comparador. El elemento 29 pregunta cómo se relacionan tus resultados con la evidencia existente. Eso son argumentos, y los argumentos varían de forma porque varía el pensamiento que hay en ellos. Si tu introducción pudiera intercambiarse con la introducción de cualquier otro ensayo de tu campo, eso es costumbre y no la guía, y es el único lugar del informe donde la variación no te cuesta nada.

La propia lista tampoco pretende cubrir todos los diseños. Su página de extensiones enumera veintidós extensiones CONSORT construidas sobre la lista de 2010 y una construida sobre la de 2025, y dice con sus propias palabras que la lista `is by no means exhaustive` (no es en absoluto exhaustiva). Clúster, cruzado, escalonado en cuña, piloto, pragmático, de no inferioridad, daños, resultados comunicados por pacientes, cada uno con sus propios elementos adicionales. Si tu ensayo es uno de esos, la fracción especificada de tu artículo es mayor, no menor.

Si los Métodos o el resumen volvieron marcados

  1. Mira dónde está el marcador antes de mirar la cifra. Que una sección de Métodos llegue como un bloque continuo tiene una explicación mecánica que conviene entender primero: Turnitin marcó toda mi sección de metodología.
  2. Cuenta la prosa analizada, no las páginas. Quita el diagrama de flujo, las tablas y la lista de referencias, y mira cuánta prosa continua queda. Esa cifra, y no el número de páginas, es a la que se aplica el comportamiento de todo o nada.
  3. Marca el contenido de la lista de verificación antes de tocar ninguna redacción. Abre la lista ampliada junto a tu manuscrito y marca cada frase que existe porque un elemento la exigía. Decide eso primero, en frío, y no mientras reescribes.
  4. Lleva a la conversación la posición del propio proveedor. Sus preguntas frecuentes dicen que el porcentaje `should not be used as the sole basis for action or a definitive grading measure by instructors` (no debe usarse como única base para actuar ni como medida de calificación definitiva por parte del profesorado), y el párrafo sobre falsos positivos termina aconsejando al lector que tenga en cuenta la naturaleza del texto al leer el porcentaje. Qué se le dice a tu profesor que haga cuando tu porcentaje de IA es alto recoge esa orientación.
  5. Si alguien te lanza un umbral, ¿Es demasiado alto un 20 % de IA? explica por qué ninguna cifra publicada sirve como nota de corte.
  6. Comprueba tu declaración por separado. Si tienes que declarar una revisión asistida por IA es una cuestión de la revista, no del detector, y Políticas de declaración de IA de las editoriales, comparadas pone las principales unas al lado de otras.

Si la redacción va a cambiar de todos modos

Revisar un informe de ensayo tiene un coste específico que poco tiene que ver con escribir. Cada párrafo que abres debe releerse después contra otros tres documentos: la lista de verificación cumplimentada, el protocolo registrado y el plan de análisis estadístico cuyo paradero el elemento 3 dijo al mundo dónde encontrar. Si abres el manuscrito entero, te has comprometido a volver a verificar el manuscrito entero. Una comprobación omitida aquí no es una errata. Es una afirmación publicada sobre lo que les ocurrió a personas que aceptaron participar en un estudio.

Y esa es la razón para preocuparse por el alcance. HumanPen es nuestro, así que toma las siguientes frases como una descripción de primera mano de cómo funciona el límite, y no como una recomendación. El alcance se traza antes de que se ejecute nada: o añades tú los pasajes, o importas un informe de detección y dejas que los pasajes marcados los definan. El sitio lo formula así: un párrafo es la unidad más pequeña que reescribe el motor. Si marcas la mitad de uno, el límite crece hasta el borde del párrafo, y la versión ya crecida es la que se te muestra para que la apruebes. Nada más allá de ahí se abre. La facturación sigue el mismo límite y cuenta solo las palabras realmente reescritas. Lo que vuelve es un documento editable, con el significado, la estructura, la terminología, las citas, la maquetación y los estilos entre las cosas que la reescritura busca preservar, y el propio consejo del sitio es revisar los documentos complejos después de descargarlos. Cuando un pasaje cumple los requisitos y aun así sigue marcado, puede volver a procesarse sin coste. Reescribir solo los párrafos que marcó un informe de Turnitin recorre la versión de eso basada en el informe.

Cómo quedará una puntuación después no es algo que nadie pueda prometer de antemano, nosotros incluidos. Sea lo que sea lo que uses, pon los párrafos de Métodos devueltos al lado del protocolo y los tamaños del efecto devueltos al lado de la salida de tu análisis antes de volver a enviar. Un intervalo de confianza que ha perdido un dígito es un problema peor que una frase marcada.

Preguntas frecuentes

¿Seguir CONSORT sube mi puntuación de IA? Nada de lo que publica el proveedor lo dice, y en la lectura descrita arriba sus tres páginas del informe no mencionan ensayos, protocolos ni guías de publicación en absoluto. Lo que sí publica es que sus falsos positivos pueden afectar a contenido sin mucha variación estructural, y CONSORT elimina deliberadamente la variación estructural de partes de un informe de ensayo.

Mi sección de Métodos repite mi protocolo registrado. ¿Es un problema? Para informar, no. El protocolo es lo que hace prospectivo el ensayo, el elemento 3 exige que digas dónde está y el elemento 10 exige que informes de cualquier desviación respecto a él. Es un problema solo en el sentido estrecho de que un segundo relato de tu propio documento es prosa densa y uniforme, que es la forma más expuesta a la medición.

¿Cuentan el diagrama de flujo y la tabla basal para el porcentaje? Solo se analiza texto calificable en forma de frases en prosa, y un diagrama de recuentos y una cuadrícula de medias no son frases en prosa. Una nota de lanzamiento de agosto de 2023 sí dice que se procesa la prosa larga dentro de las celdas de una tabla, y que los envíos existentes deben volver a enviarse para reprocesarse, así que una tabla llena de frases completas es un caso distinto de una tabla de cifras.

¿Puedo reformular la narrativa del flujo de participantes para bajar la puntuación? Puedes mover frases, pero el elemento 22b exige motivos exactos para las exclusiones y rechaza explícitamente `protocol deviation` como redacción suficiente. Si una revisión sustituye un motivo por una expresión resumen, el informe queda ahora menos conforme que el que enviaste, y ninguna puntuación compensa eso.

Me han marcado el resumen entero. Un resumen escrito según el elemento 1b tiene catorce contenidos obligatorios, la instrucción de no incluir nada que no esté en el cuerpo y ninguna tabla, lista o referencia que lo rompa. Es el texto calificable más denso del documento. La orientación del proveedor es que el porcentaje no es una base única para actuar, y su párrafo sobre falsos positivos es lo que hay que poner delante de quien esté preguntando.

¿Se aplica esto a los artículos de CONSORT 2010 o a los estudios observacionales? Los elementos citados arriba son de CONSORT 2025, publicado en 2025 con una lista de 30 elementos. Los estudios observacionales siguen una guía completamente distinta. El movimiento general se sostiene en ambos casos: averigua cuáles de tus frases especificó un estándar de publicación antes de decidir cuáles cambiar.

Seguir leyendo