Overleaf, LaTeX y Turnitin: qué puede cambiar un PDF compilado

El archivo `.tex` y el PDF compilado son objetos distintos. Nuestro caso de prueba fijo muestra cuánto depende tanto del compilador como del extractor: las cifras de palabras cambiaron, las particiones por salto de línea cambiaron, las ligaduras aparecieron en dos herramientas y no en una tercera, y una oración visualmente intacta quedó cortada por una nota al pie, un número de página, una tabla y una figura.

Equipo de HumanPen

· 11 min de lectura

¿Escribir en LaTeX cambia lo que ve un informe de IA de Turnitin?

Turnitin acepta PDF, pero eso no revela qué ve su extractor privado. En nuestro caso reproducible, mutool y PyMuPDF devolvieron cada uno 694 palabras delimitadas por espacios a partir de un mismo archivo pdfTeX a dos columnas; pypdf devolvió 692. Tanto la compilación como el extractor dieron forma al flujo de texto. Eso sí es medible. Un efecto sobre la entrada o la puntuación de Turnitin no lo es.

Ese límite es el artículo entero. El código fuente, tres PDF, nueve flujos de extracción sin procesar y el script de medición se conservan con el paquete de evidencia; la comprobación de cinco minutos que aparece casi al final es la que debes ejecutar sobre tu propio trabajo.

Qué compilamos y con qué lo leímos

Un único archivo `.tex`: la clase estándar `article`, `twocolumn`, 10pt. Contiene un resumen, cuatro secciones numeradas, matemáticas en línea y en bloque, una lista `itemize`, un entorno `algorithm` con líneas de pseudocódigo numeradas, un flotante `table`, un flotante `figure` con un pie escrito como una oración completa, una nota al pie lo bastante larga como para ocupar una segunda línea, y dos llamadas a `\cite` que se resuelven en una bibliografía numerada. Las compilaciones a dos columnas producen dos páginas; el control de una columna produce tres.

Compilado con pdfTeX 3.141592653-2.6-1.40.26, TeX Live 2024. Leído con tres extractores independientes: mutool 1.25.6, PyMuPDF 1.26.0 y pypdf 6.4.0.

Tras reducir cada serie de espacios a uno solo, mutool y PyMuPDF devolvieron cada uno 694 palabras del PDF pdfTeX a dos columnas. Pypdf devolvió 692. Los tres flujos conservan el mismo orden general de las secciones, pero la diferencia de dos palabras basta para rechazar la cómoda afirmación de que extractores independientes ven un objeto idéntico.

El orden de lectura a dos columnas se mantuvo

La advertencia más repetida sobre enviar un PDF a dos columnas es que el extractor lee de forma seguida por ambas columnas y convierte tu trabajo en un galimatías intercalado. Aquí no ocurrió. La última oración del resumen, al pie de la primera columna, llega inmediatamente antes de la primera oración de la Introducción, en la cabecera de la segunda columna. El orden se mantiene intacto en todo el documento.

Un diseño, una clase, tres extractores, una máquina. Esa es la magnitud de la afirmación. La `.cls` propia de una revista, con una colocación inusual de los flotantes o una barra lateral, podría comportarse de otro modo, y por eso precisamente la comprobación del final de este artículo merece cinco minutos en tu archivo real y no en el nuestro.

En cambio se rompió otra cosa, y de eso se habla mucho menos.

Flotantes, notas al pie y números de página que se meten en medio de las oraciones

Aquí tienes un fragmento literal del flujo de PyMuPDF, con los espacios normalizados y sin eliminar nada entre los extremos citados:

"…justification for treating a visually correct page as a reliable 1This footnote is deliberately long enough to wrap onto a second line so that its position in the extracted stream can be observed and compared with nearby prose. 1 Table 1: Primary outcome by condition. Condition Mean SD Control 12.4 3.1 Intervention 18.9 2.7 Figure 1: The framed area is a fixture rather than a reported empirical result. text stream…" (…justificación para tratar una página visualmente correcta como un fiable 1Esta nota al pie es deliberadamente lo bastante larga como para ocupar una segunda línea, de modo que su posición en el flujo extraído pueda observarse y compararse con la prosa cercana. 1 Tabla 1: Resultado principal por condición. Condición Media DE Control 12.4 3.1 Intervención 18.9 2.7 Figura 1: El área enmarcada es un elemento del montaje de prueba y no un resultado empírico comunicado. flujo de texto…)

En el código fuente, `reliable text stream` es una sola expresión. En esta extracción, la nota al pie, un número de página sin más, el pie de tabla con sus celdas y el pie de figura acaban todos entre `reliable` y `text stream`. El marcador de nota también se adhiere en otros puntos a la puntuación anterior, como `follows:1`.

El `1` desnudo de esa cita es el número de página. Si se unen los flujos de las páginas, queda entre la nota al pie y la tabla, aunque ningún lector lo perciba como parte de ninguno de los dos pasajes.

Nada de eso es un daño visible en el PDF. Es lo que devolvió este extractor local concreto, y muestra por qué «la oración anterior» y «la oración posterior» no son conceptos estables hasta que se conoce el método de extracción.

De veintidós particiones por salto de línea a cinco

LaTeX puede dividir palabras con guion al final de la línea, y una columna estrecha crea más oportunidades. PyMuPDF encontró 22 tokens divididos en nuestra compilación pdfTeX a dos columnas. Estos son seis de ellos:

Por ejemplo: ex- poses · differ- ences · specifica- tions · observa- tions · justifica- tion · partici- pants

Después compilamos el mismo código fuente en una sola columna y cambiamos únicamente la opción de clase. PyMuPDF devolvió 678 palabras normalizadas y cinco tokens divididos en lugar de 22: `or- dinary`, `extrac- tion`, `jus- tification`, `partici- pants`, `par- ticular`.

Mismo código fuente, un solo cambio de diseño y un conjunto distinto de particiones. Esto es un caso concreto y no una regla para todas las clases, pero basta para justificar que revises el archivo compilado en lugar de suponer que la tokenización del código sobrevivió.

El compilador que elegiste cambió los caracteres

Compilamos el mismo código una tercera vez con XeLaTeX, con el mismo diseño a dos columnas y las mismas palabras en la página.

En la compilación con pdfLaTeX, las tres herramientas no expusieron ningún token que contuviera los puntos de código de ligadura `ff`, `fi`, `fl`, `ffi` or `ffl`. In the XeLaTeX build, PyMuPDF and pypdf each exposed six: `affiliated`, `affiliation`, `difficult`, `efficiency`, `insufficient`, `office` (en la compilación con XeLaTeX, PyMuPDF y pypdf expusieron seis cada uno). Mutool no expuso ninguno porque normalizó esos glifos de nuevo hasta convertirlos en letras corrientes. Por tanto, una búsqueda ingenua de `efficiency` acierta en un flujo y falla en otro.

La ecuación cambió en la otra dirección. En el archivo pdfTeX, mutool devolvió un carácter de reemplazo Unicode para el signo de sumatoria, mientras que PyMuPDF y pypdf devolvieron una `X` mayúscula. In the XeLaTeX file, all three exposed the actual `∑` (en el archivo XeLaTeX, las tres expusieron el carácter real). Tanto el compilador como el extractor importaron.

Las páginas de Turnitin citadas aquí no identifican su extractor ni describen estas transformaciones, y no afirmamos que nada de esto mueva una puntuación. Afirmamos algo más limitado y comprobable: la capa de texto es un producto de la compilación, y distintos extractores pueden exponer caracteres distintos a partir del mismo PDF.

Lo que Turnitin sí dice sobre un trabajo con esta forma

Cuatro pasajes de la propia documentación del proveedor afectan directamente a un trabajo con esta forma. En esas páginas hay más; estos son los cuatro que tocan de cerca un envío en LaTeX.

El formato se acepta. Los requisitos de archivo de Turnitin para un AI Writing Report enumeran `.docx, .pdf, .txt, .rtf`. Eso demuestra que un PDF puede procesarse; no dice nada sobre qué cadena de extracción se utiliza. ¿Detecta Turnitin la IA en un PDF? recorre la parte documentada de esa pregunta.

Solo cuenta la prosa. Las preguntas frecuentes definen qué se analiza como texto calificable:

«This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Este texto calificable incluye únicamente oraciones en prosa, es decir, analizamos solo bloques de texto escritos en oraciones gramaticales estándar que no incluyen otros tipos de escritura como listas, viñetas (estructuras cortas que no son oraciones) u otras estructuras que no son oraciones.)

La oración siguiente es la que conviene recordar: «This percentage is not necessarily the percentage of the entire submission.» (Este porcentaje no es necesariamente el porcentaje de todo el envío.) Tus viñetas de `itemize` y tus líneas de `algorithm` no son oraciones. Tampoco lo es una fila de celdas de una tabla. Cómo gestiona Turnitin las ecuaciones matemáticas y el contenido que no es prosa explica qué significa esto para un trabajo compuesto sobre todo por fórmulas. Fíjate, eso sí, en lo que sí cuenta: un pie escrito con `\caption` como una oración gramatical completa, que es como escribe los pies la mayoría de la gente, llega al flujo exactamente igual que el texto del cuerpo.

Las bibliografías quedan excluidas. Una nota de versión fechada el 9 de agosto de 2023 indica que se corrigió un error que resaltaba escritura con IA dentro de las referencias, y «Bibliographies are now excluded when processing the AI writing report» (las bibliografías ahora quedan excluidas al procesar el informe de escritura con IA), y la misma nota añade que los envíos existentes deben volver a enviarse antes de que esto se les aplique. Lo que el proveedor no publica es cómo se identifica una bibliografía dentro de un flujo de texto aplanado, y nuestra extracción tampoco da ninguna pista: `References` llega como una palabra corriente, seguida de `[1] J. Smith, "A study of things," Journal of Testing, vol. 4, no. 2, pp. 100–110, 2019.`, sin nada que marque el límite. No construyas tu plan sobre ninguna de las dos lecturas. Qué cubren realmente las exclusiones de referencias explica qué está documentado y qué no.

Los trabajos cortos se comportan de otra manera. Cuando un documento se reduce a unos cientos de palabras, la formulación del propio proveedor es que la predicción se vuelve «mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap» (sobre todo «todo o nada», porque hacemos la predicción sobre un único segmento sin oportunidad de solapamiento), y su oración siguiente añade que allí el contenido mixto puede marcarse como enteramente generado por IA. Un artículo de conferencia de seis páginas que en su mitad son ecuaciones puede no tener apenas texto calificable. Documentos cortos y el problema del todo o nada explica el mecanismo.

Para cuando alguien lo lee, un comando de cita ya es solo un corchete y un dígito

`\cite{smith2019,jones2020}` llegó a la extracción como los cuatro caracteres `[1, 2]`. `\ref{sec:method}` llegó como `2`. `\label` no dejó absolutamente nada. Los títulos de sección llegaron con su número y su título separados, así que `2 Method` queda en el flujo justo después de la oración anterior, y la referencia cruzada anterior `Section 2 describes the method.` se lee como prosa que contiene un dígito perdido.

Eso significa que todo plan basado en el formato de las citas actúa sobre algo que no está ahí. En el texto extraído no existe ningún objeto de cita, solo corchetes y dígitos, y la descripción publicada por Turnitin del cálculo no menciona una cita en ninguno de sus pasos. Por qué Turnitin marcó mis referencias enumera las ediciones concretas que se derivan de esto y por qué cada una de ellas no tiene nada sobre lo que actuar.

La comprobación de cinco minutos, en tu trabajo y no en el nuestro

No necesitas ninguna de las herramientas que usamos. Abre tu PDF compilado en cualquier visor que tengas, selecciona todo y pégalo en un editor de texto plano. Es una vía de extracción más, no un sustituto de Turnitin, pero puede revelar problemas en la capa de texto que realmente estás enviando.

Revísalo buscando esto, en este orden:

  1. Palabras divididas. Busca un guion seguido de un salto de línea. Cada coincidencia es una palabra que ha dejado de ser una sola palabra.
  2. Dónde acabaron tus flotantes. Localiza el pie de una tabla y lee las dos oraciones que lo rodean. Si el pie y sus celdas han acabado dentro de un párrafo, ese es ahora el orden de lectura de ese párrafo.
  3. Tus pies de figura. Si un pie es una oración gramatical completa, parece prosa, porque es prosa.
  4. Las matemáticas. Lee una ecuación en bloque en el texto pegado. Lo que veas es lo que obtuvo un extractor. Si faltan caracteres o son incorrectos, eso dice algo de la incrustación de tus fuentes, no de tu álgebra.
  5. El inicio de la bibliografía. Comprueba si algo en el texto plano marca dónde empieza la lista de referencias. En el nuestro, nada lo hacía.
  6. Tu nombre y tu filiación. También están en la capa de texto, y eso importa si envías a algún sitio que espera anonimato.

Si guardas tu `.tex` en Git o en Overleaf, haz esto una vez por revisión importante y no una sola vez al final. Y sobre la cuestión aparte de si el historial de escritura en Overleaf vale algo como registro, dónde vive el historial de versiones en Word, Google Docs y Overleaf explica las reglas de conservación del plan gratuito y qué hacer al respecto, que son más específicas de lo que la mayoría espera.

Si las oraciones tienen que cambiar

Para un trabajo en LaTeX la respuesta es aburrida y correcta: cambia el código fuente, vuelve a compilar y nunca edites el PDF. La oración vive en el archivo `.tex`. Todo lo demás es una representación de él.

La cadena se vuelve incómoda cuando no termina en un PDF. Un director puede querer control de cambios, una revista puede exigir un manuscrito en Word, o alguien puede devolverte un informe de escritura con IA basado en el PDF compilado y preguntar qué pasajes cambiarán. Ahora tienes el mismo trabajo en dos formatos.

Para una versión DOCX en inglés, La herramienta HumanPen puede limitar una reescritura a los pasajes que selecciones o a los pasajes coincidentes de un informe de Turnitin o iThenticate. Humanize funciona actualmente solo en inglés; no acepta `.tex` ni un PDF compilado como fuente editable. Confirma el alcance a nivel de párrafo, mantén el código LaTeX como fuente maestra y vuelve a revisar el documento convertido tras la descarga. Los pasajes que cumplen los requisitos pueden volver a procesarse sin coste.

Preguntas frecuentes

¿Debería enviar el archivo `.tex` en lugar del PDF? Envía lo que pida la tarea o la revista. Un archivo `.tex` es texto plano con marcado, y cada comando llegaría como caracteres literales, así que no es una versión más limpia de tu trabajo para ningún lector, humano o de otro tipo.

¿Mis ecuaciones suben mi puntuación de IA? No son oraciones en prosa, así que según la propia definición del proveedor quedan fuera del texto calificable. Las oraciones explicativas que las rodean sí están dentro. En un trabajo compuesto sobre todo por ecuaciones, eso significa que la cifra se calcula sobre una porción pequeña de las páginas.

¿El formato a dos columnas causa problemas por sí mismo? El orden general de las secciones se mantuvo en este caso. Bajo PyMuPDF, la compilación a dos columnas tuvo 22 particiones por salto de línea y la de una columna tuvo 5. Esa es una diferencia medida para esta clase, no una regla para todas las plantillas de revista.

Mi institución quiere un archivo de Word y yo escribo en LaTeX. Entonces tienes un paso de conversión, y ese paso es donde es más probable que se rompan la numeración, las referencias cruzadas y los campos de cita. Convierte una sola vez, al final, y revisa los tipos de objeto en lugar de leer las dos primeras páginas.

¿Puedo usar el historial de Overleaf para mostrar cómo se escribió el trabajo? Es un registro, no un veredicto, y en el plan gratuito la mayor parte desaparece al cabo de un día, salvo que etiquetes las versiones. El artículo enlazado arriba explica la regla exacta y el hábito de etiquetado que lo resuelve.

Seguir leyendo