Quién ejecuta la revisión de similitud de tu manuscrito y contra qué lo compara

Los autores suelen imaginarse la revisión como un buscador que rastrea sus frases en la web abierta. El dispositivo que hay detrás es bastante más concreto, y algunos de sus detalles cambian lo que realmente significa un pasaje coincidente.

Equipo de HumanPen

· 7 min de lectura

La respuesta breve

Si tu revista pertenece a Crossref y usa Similarity Check, la revisión es un servicio que Crossref presta a sus miembros a precio reducido y que funciona sobre iThenticate, de Turnitin. Que tu manuscrito pase por esta revisión en concreto depende de que la editorial participe, así que eso es lo primero que hay que averiguar. Donde sí se aplica: el editor sube el manuscrito y recibe un informe, tú no la ejecutas y normalmente no la ves salvo que te la envíen. Y Crossref afirma que los miembros participantes obtienen acceso de solo lectura al texto completo de los artículos de la base de datos de Similarity Check con fines de comparación, y describe esa base como un conjunto de más de 78 million documentos académicos a texto completo.

Quién la ejecuta en realidad

Crossref describe el servicio en una sola frase: "A service provided by Crossref and powered by iThenticate—Similarity Check provides editors with a user-friendly tool to help detect plagiarism." (Un servicio prestado por Crossref y basado en iThenticate: Similarity Check ofrece a los editores una herramienta fácil de usar para ayudar a detectar plagio.)

Dos palabras de esa frase cargan con casi todo el significado para un autor.

Editores. La herramienta se describe como algo pensado para los editores, que «suben un artículo» y reciben a cambio "a report highlighting potential matches and indicating if and how the paper overlaps with other work" (un informe que señala las coincidencias potenciales e indica si el artículo se solapa con otros trabajos y cómo). El propósito declarado es "assess the originality of the work before they publish it" (evaluar la originalidad del trabajo antes de publicarlo). Tú no eres usuario de este software: eres su objeto.

Miembros. Similarity Check es un servicio para miembros de Crossref. Crossref dice que el acuerdo da a los miembros "reduced-rate access to the iThenticate text comparison software from Turnitin" (acceso con tarifa reducida al software de comparación de textos iThenticate, de Turnitin), y que "Only Similarity Check members benefit from this tailored iThenticate experience" (solo los miembros de Similarity Check se benefician de esta experiencia de iThenticate hecha a su medida). Que tu manuscrito pase o no por esta revisión depende de si la editorial participa, y eso es un dato sobre la editorial, no sobre tu campo de estudio.

Eso también significa que la frase «la revista hizo una revisión de plagio» describe al menos dos situaciones distintas: una editorial dentro de este sistema y una editorial que usa algo completamente diferente. Si te dan una cifra, es legítimo preguntar cuál de las dos la produjo.

Una cosa conviene tener presente al leer todo lo anterior: Crossref es la organización que presta este servicio a sus miembros, y lleva aparejadas tarifas de revisión con descuento. Sus descripciones son exactas en cuanto a cómo es el acuerdo, y no son una valoración independiente de si la revisión merece la pena. Todas las citas de este artículo describen el mecanismo, no lo evalúan.

Contra qué se compara

El conjunto de comparación es la parte que los autores más veces calculan mal.

Crossref describe la base de datos como un conjunto de "over 78 million full-text scholarly content items" (más de 78 million documentos académicos a texto completo), y describe lo que la membresía incluye como "read-only access to the full text of articles in the Similarity Check database for comparison purposes" (acceso de solo lectura al texto completo de los artículos de la base de datos de Similarity Check con fines de comparación).

Texto completo, no resúmenes ni metadatos. La documentación de iThenticate describe los objetivos de búsqueda de forma aún más amplia: según la configuración elegida, pueden incluir "billions of pages of active (and archived) internet information, previously submitted works" (miles de millones de páginas de información de internet activa y archivada, y trabajos ya enviados) y "tens of thousands of periodicals, journals, and publications" (decenas de miles de publicaciones periódicas, revistas académicas y otros medios).

Dos consecuencias que conviene retener:

  • Un artículo de pago está dentro del conjunto de comparación. Que tú no puedas leer algo no dice nada sobre si tus frases se compararán con ello.
  • El conjunto se elige en cada revisión. Los objetivos de búsqueda se describen como seleccionados para el encargo, de modo que dos editores que revisan el mismo manuscrito pueden estar comparándolo con objetivos distintos. Una cifra de uno no predice la cifra del otro.

Para qué sirve el informe y para qué no

La guía de iThenticate empieza advirtiendo de que un resaltado es una afirmación sobre solapamiento de texto y nada más: se espera que se ilumine un pasaje correctamente citado o una entrada de tu bibliografía.

El porcentaje en sí es aritmética, y la documentación lo dice: cuenta las palabras que coincidieron con algo y divídelas entre las palabras que tiene el manuscrito. La fórmula no descuenta nada por estar atribuido.

Que no es lo mismo que decir que tu bibliografía va a inflarlo por fuerza. Lo que decide eso es un filtro, y la guía de iThenticate sobre los filtros describe un ajuste de exclusión de bibliografía que "automatically identifies and ignores reference lists or bibliographic sections so they don't inflate the similarity percentage" (identifica y ignora automáticamente las listas de referencias o las secciones bibliográficas para que no inflen el porcentaje de similitud), además de interruptores separados para el texto entre comillas y para el texto citado. El mismo manuscrito puede dar un porcentaje con la bibliografía dentro o un porcentaje con la bibliografía fuera, y la cifra en sí no te dice cuál de los dos tienes delante. Es lo primero que hay que preguntar sobre cualquier número que alguien te cite.

Por eso el informe agrupa las coincidencias según si detectó comillas y una cita en el texto alrededor: un paso de reconocimiento con sus propios límites documentados, y la razón por la que dos manuscritos con el mismo porcentaje pueden significar cosas completamente distintas.

Dónde encaja tu propio trabajo publicado

La base de datos se construye con el contenido registrado por los miembros. Crossref no explica la consecuencia para los autores en ninguna de sus dos páginas de Similarity Check, así que toma el paso siguiente como una inferencia y no como una cita: si has publicado con un miembro participante, cabe esperar que tus propios artículos estén en el corpus contra el que se comparan los manuscritos posteriores, incluido el tuyo próximo.

Esa es la explicación normal de un rompecabezas con el que los autores se topan la segunda vez: un trozo de tu artículo nuevo coincide con un artículo que escribiste tú. No es un defecto de la revisión. Es la revisión funcionando sobre un corpus en el que tú estás.

Nada de eso decide si reutilizar tu propio texto es aceptable en tu campo. Solo significa que el informe lo mostrará y que deberías contar con explicarlo en lugar de sorprenderte.

La cuestión de la versión, en breve

La documentación de Crossref enumera rutas de configuración para iThenticate v1 e iThenticate 2.0, incluido el uso de 2.0 directamente en el navegador y mediante la integración con un sistema de seguimiento de manuscritos, más una ruta para actualizar de v1 a 2.0.

Eso significa que el informe que te enseñen puede venir de una de varias interfaces, con distintas funciones disponibles. Si alguien te cita una cifra de un «informe de Similarity Check», tanto la versión como los ajustes de exclusión que hay detrás son preguntas legítimas, y son preguntas que cambian lo que significa el número.

Qué puedes hacer realmente con todo esto

  1. Averigua si la revista a la que apuntas participa y en qué. Es un dato a nivel de editorial y suele figurar en las normas para autores.
  2. Cuenta con texto completo, no con resúmenes. Todo lo que parafrasees de cerca a partir de un artículo del que solo ves el resumen sigue estando en el conjunto de comparación.
  3. Espera que aparezca tu trabajo anterior y prepárate para decir qué partes se reutilizan y por qué.
  4. Pregunta cuáles fueron los ajustes antes de tratar ningún porcentaje como una propiedad de tu manuscrito. Es una propiedad de una comparación, y la comparación tiene parámetros.
  5. No trates la cifra como el hallazgo. La guía dice explícitamente que una coincidencia no es por sí misma un hallazgo; lo útil es la lista de coincidencias y cómo se atribuye cada una.

Si el informe trae una segunda cifra

Algunos manuscritos vuelven con un indicador de escritura con IA junto a la cifra de similitud, cuando la licencia de la editorial lo incluye. Es una medición distinta con un significado distinto, y ninguna cantidad de trabajo de citación la mueve.

La herramienta HumanPen se ocupa solo de esa segunda cifra. Dale el manuscrito y el informe, y todo lo que quedó resaltado es la totalidad del trabajo.

Para el lado de la similitud, el consejo honesto es el aburrido: atribuye, cita correctamente, pregunta cuáles fueron los ajustes de exclusión y prepárate para explicar la reutilización. Ningún producto de reescritura debería vendérsete como la solución a una lista de referencias que coincide.

Preguntas frecuentes

¿Puedo ejecutar Similarity Check sobre mi propio manuscrito? Por esta vía, no. Crossref lo describe como un servicio para miembros, que proporciona a los editores una herramienta para revisar artículos; el acceso está ligado a las organizaciones miembro y no a autores individuales.

¿Solo compara con artículos de acceso abierto? No. Crossref describe que los miembros tienen acceso de solo lectura al texto completo de los artículos de la base de datos de Similarity Check con fines de comparación, y afirma que la base contiene más de 78 million documentos académicos a texto completo.

¿Aparecerá mi propio artículo anterior como coincidencia? Puede. El corpus de comparación se construye con el contenido registrado por los miembros, así que lo ya publicado —incluido lo tuyo— forma parte de aquello contra lo que se compara un manuscrito nuevo.

Dos editores me dieron porcentajes distintos para el mismo manuscrito. ¿Cuál es correcto? Potencialmente, los dos. Los objetivos de búsqueda se seleccionan en cada revisión y el informe tiene ajustes de exclusión, así que el porcentaje describe una comparación concreta y no una propiedad fija de tu archivo.

Seguir leyendo