Las marcas de integridad en un Similarity Report: texto oculto y caracteres sustituidos

En el informe hay una segunda pestaña que no tiene nada que ver con cuánto coincide tu texto. Conviene entenderla antes de acercar cualquier herramienta a un manuscrito que estás a punto de enviar.

Equipo de HumanPen

· 7 min de lectura

La respuesta breve

El Similarity Report tiene una pestaña Flags separada del porcentaje. Marca dos patrones documentados: texto oculto — caracteres en blanco sobre blanco, comillas camufladas — y caracteres sustituidos, donde las letras se cambian por otras parecidas de alfabetos distintos. La documentación indica que los caracteres parecidos se reemplazan automáticamente de vuelta antes del análisis, así que la coincidencia ocurre de todos modos. Una marca no es, explícitamente, una constatación de falta alguna, pero sí pone un señalador rojo en tu envío para que una persona lo mire.

Qué es la pestaña Flags

La guía lo describe en una frase: «Turnitin's algorithms look deeply at a document for any inconsistencies that would set it apart from a normal submission. If we notice something strange, we Flag it for you to review.» (Los algoritmos de Turnitin examinan a fondo un documento en busca de cualquier inconsistencia que lo distinga de un envío normal. Si notamos algo extraño, lo marcamos para que lo revises.)

Si se detecta algo, aparece un número junto a la pestaña Flags, encima del envío: 1 si hay un tipo de marca y 2 si están los dos. Al abrir la pestaña aparece un panel Integrity Flags for Review, y en el propio documento «a red flag with a number inside indicating the flag type and red boxes around all suspicious text related to that flag.» (una bandera roja con un número dentro que indica el tipo de marca y recuadros rojos alrededor de todo el texto sospechoso relacionado con esa marca.)

La salvedad está ahí mismo, en la fuente, y importa en ambos sentidos: «A flag is not necessarily an indicator of a problem. However, we recommend you focus your attention there for further review.» (Una marca no es necesariamente un indicio de que haya un problema. Sin embargo, te recomendamos que centres ahí tu atención para revisarlo más a fondo.)

No es una acusación, entonces. Es un recuadro rojo alrededor de una parte de tu manuscrito, con la instrucción para quien revisa de mirar con más atención justo esa parte.

Texto oculto

La documentación es inusualmente directa sobre de dónde viene esto: «Paper mills and authors looking to hinder similarity matching abuse text manipulation techniques by trying to pass plagiarized content off as genuine. These techniques are commonly found on YouTube and social media platforms as ways of 'cheating Turnitin'.» (Las fábricas de artículos y los autores que quieren dificultar la detección de coincidencias abusan de técnicas de manipulación del texto para hacer pasar contenido plagiado por original. Estas técnicas circulan habitualmente por YouTube y las redes sociales como formas de engañar a Turnitin.)

Se dan dos ejemplos.

Comillas ocultas. Comillas que están en el archivo pero no se ven al mostrarlo. La consecuencia documentada es concreta: «could influence the amount of quoted material recognized in a document. When a user excludes well-referenced matches using the Exclude Quotes functionality, in a manipulated document this would also hide plagiarized content.» (podrían influir en la cantidad de material citado que se reconoce en un documento; y cuando un usuario excluye coincidencias bien referenciadas con la función Exclude Quotes, en un documento manipulado eso también ocultaría contenido plagiado.)

Texto blanco sobre fondo blanco. «A user may set the color of a block to text to white rendering it invisible on the white background of the paper. This can be to manipulate the word count or break up plagiarized text with hidden characters.» (Un usuario puede poner en blanco el color de un bloque de texto, dejándolo invisible sobre el fondo blanco del papel. Eso puede servir para manipular el recuento de palabras o para fragmentar texto plagiado con caracteres ocultos.)

Fíjate en la segunda mitad de esa frase. Caracteres ocultos, usados para fragmentar el texto y que el motor de coincidencias deje de ver una secuencia de palabras. La guía no dice en qué parte del texto van esos caracteres, y no vamos a inventarlo por ella. Lo que sí dice es que esto es algo que el programa busca, no algo que se le escapa.

Caracteres sustituidos, y por qué el truco fracasa dos veces

Este es el punto que conviene leer con cuidado, porque es la técnica que más probablemente esté dentro de una herramienta y no escrita por una persona.

«Some characters in different alphabets can look similar enough that to the naked eye, it is difficult, if not impossible, to tell them apart.» (Algunos caracteres de alfabetos distintos pueden parecerse lo bastante como para que a simple vista sea difícil, o imposible, distinguirlos.) Un carácter cirílico que se ve igual que uno latino, metido en medio de una palabra, rompe la cadena que busca el motor de coincidencias mientras la página sigue viéndose normal.

La respuesta documentada tiene dos partes, y la primera es la que nadie menciona:

«Turnitin automatically swaps these characters out when scanning a submission so they will not affect the Similarity Report. However, by replacing characters, the intent is to try and interrupt a similarity match.» (Turnitin sustituye automáticamente estos caracteres al analizar un envío, de modo que no afectan al Similarity Report. Sin embargo, al reemplazar caracteres, la intención es intentar interrumpir una coincidencia.)

La sustitución se revierte antes de la comparación — la coincidencia sigue ocurriendo — y el intento se levanta como marca. La técnica no reduce el número al que apuntaba, y añade un señalador que antes no estaba.

Es algo poco frecuente: poder decirlo con una cita y no con una opinión. Una técnica de evasión documentada de la que también está documentado que no funciona.

Por qué esto es una pregunta sobre herramientas, no sobre personas

La mayoría de los autores no se sienta a pegar una 'о' cirílica en cada tercera palabra. Pero un programa sí lo hace, de forma invisible, en un segundo, a lo largo de todo un manuscrito, y tú no lo verás, porque justamente la gracia de la técnica es que se ve igual.

Eso convierte esto en una pregunta que hacer antes de entregarle un archivo a cualquier cosa: lo que vuelve, ¿contiene caracteres que no estaban en lo que entró?

Puedes comprobarlo sin ninguna herramienta especial. Primero, eso sí, descarta la versión de la comprobación que suena obvia y no funciona.

Contar cuántas veces aparece una letra común no te dice nada. Reescribir tiende a alargar el texto, y las letras suben con él. En nuestros propios archivos de antes y después, la «a» latina pasó de 4.631 a 5.092 y la «e» de 6.970 a 8.005, sin que se sustituyera ningún carácter en ningún sitio. Cuentas letras, encuentras más y lo único que has aprendido es que el documento se hizo más largo.

Compara inventarios en vez de recuentos. Exporta el texto plano del archivo que enviaste y el del archivo que recibiste, haz una lista de los caracteres distintos que aparecen en cada uno y busca cualquier cosa que esté en la segunda lista y falte en la primera. Letras cirílicas y griegas que parecen latinas. Espacios de ancho cero. Guiones suaves. Que cambien los recuentos es normal. Que aparezca un carácter que nunca estuvo en tu archivo, no lo es.

Y dos puntos estructurales sobre quién asume la consecuencia. La marca recae en el envío, y ahí va tu nombre. Y la herramienta que introdujo los caracteres no está en la sala cuando se lee el informe.

Qué hacemos y qué no hacemos con tus caracteres

Estamos en la categoría donde vive esta técnica, así que lo honesto es decirlo claramente en vez de dejarlo sin decir.

La herramienta HumanPen reescribe frases. No inserta caracteres invisibles, no cambia letras por otras parecidas de alfabetos distintos y no pinta el texto de blanco. No tendría sentido: la documentación de arriba dice que la sustitución se revierte antes de la comparación y se marca al pasar, así que lo único que esa técnica produce de forma fiable es un recuadro rojo en tu manuscrito.

Hicimos la comparación de inventarios sobre nuestra propia salida antes de publicar esto, con cuatro pares de antes y después. El conjunto de caracteres distintos de cada salida fue, en todos los casos, un subconjunto del conjunto de la entrada. Nada nuevo, ni cirílico, ni griego, ni nada de ancho cero. El número de caracteres no ASCII bajó en vez de subir: guiones largos de 58 a 13 en un archivo, apóstrofos curvos de 41 a 6. También comprobamos que la comparación ve lo que busca, introduciendo una «о» cirílica y un espacio de ancho cero en una copia de la salida y volviéndola a ejecutar; listó los dos.

Son nuestros archivos y no publicamos el corpus, así que toma los números como nuestros y el procedimiento como tuyo. Ejecútalo con tu propio par. También con cualquier cosa que te devolvamos.

Preguntas frecuentes

¿Significa una marca que se me acusa de algo? No. La documentación dice que una marca «is not necessarily an indicator of a problem» (no es necesariamente un indicio de que haya un problema), y al mismo tiempo recomienda que quien revisa concentre ahí su atención. Es una invitación a mirar, no un hallazgo.

¿Bajan el índice de similitud los caracteres parecidos? Según la documentación, no: dice que esos caracteres se sustituyen automáticamente al analizar un envío, de modo que no afectarán al Similarity Report. Además, el intento se levanta como marca.

¿Cuántos tipos de marca hay? Hay dos documentados: texto oculto y caracteres sustituidos. La pestaña muestra un 1 o un 2 según cuántos tipos se hayan detectado.

¿Puedo revisar yo mismo mi archivo antes de enviarlo? No a través del informe, que se genera del lado de quien revisa. Puedes inspeccionar el archivo. Haz una lista de los caracteres distintos en la versión que enviaste y en la que volvió, y busca cualquier carácter que esté en la segunda lista y no en la primera. No cuentes letras en su lugar: reescribir alarga el texto, así que los recuentos de letras suben por sí solos. Revisa también si hay texto en blanco o en un color igual al del fondo.

Seguir leyendo