Por qué tu texto entre comillas y con su cita sigue apareciendo en el Similarity Report

Un bloque bien entrecomillado y bien citado que aparece como coincidencia parece un fallo. Casi nunca lo es. En medio hay un paso de reconocimiento documentado, y es justo el que puede fallar.

Equipo de HumanPen

· 8 min de lectura

La respuesta corta

Cada coincidencia se clasifica en uno de cuatro grupos según si el software detectó comillas y una cita en el texto a su alrededor: sin cita ni comillas, faltan comillas, falta la cita, o citado y entre comillas. Esa detección es un modelo de aprendizaje automático con límites publicados: está entrenado en inglés, su reconocimiento de citas cubre cuatro formatos concretos, reconoce siete formas específicas de comillas y puede pasar por alto una cita situada lejos del texto coincidente. Un pasaje correctamente atribuido pero con la forma equivocada acaba en el grupo equivocado.

Primero el porcentaje, porque no es lo que la gente supone

La cifra global de similitud tiene una definición que puedes retener en la cabeza: palabras coincidentes divididas por el total de palabras del documento. La fórmula no pondera nada ni descuenta nada por el hecho de que el texto esté atribuido.

Lo que mueve esa cifra es un mecanismo completamente distinto, y no te corresponde a ti ajustarlo. El mismo sitio de ayuda tiene una guía de filtros de exclusión y enumera cinco: exclude bibliography (excluir la bibliografía), exclude quoted text (excluir el texto entre comillas), exclude cited text (excluir el texto citado), exclude small matches (excluir las coincidencias pequeñas), exclude small sources (excluir las fuentes pequeñas). El que más importa aquí es el segundo. «ignores text enclosed in quotation marks or formatted as block quotes, preventing properly quoted material from appearing as matches» (ignora el texto entre comillas o con formato de cita en bloque, lo que evita que el material correctamente citado aparezca como coincidencia), y también cubre los bloques con sangría cuando el archivo es .doc o .docx.

Eso ya es media respuesta a la pregunta del título. A veces un párrafo correctamente citado aparece porque nadie activó ese filtro. Si estaba activado o no lo decidió quien ejecutó la revisión, y eso no consta en la cifra que te envían.

Conviene fijar el denominador, porque el indicador de escritura con IA de la misma plataforma no usa ese. Su porcentaje se calcula sobre la prosa que cumple los requisitos, no sobre todo tu archivo, y por eso esa cifra y sus resaltados pueden parecer desproporcionados entre sí. Dos números, dos denominadores. Los pusimos uno al lado del otro en leer una puntuación de Similarity junto a una puntuación de escritura con IA.

Un umbral que conviene conocer antes que nada: una entrega necesita al menos 20 palabras para que se genere siquiera un Similarity Report.

Y la frase de encuadre con la que abre la documentación, que es fácil pasar por alto: «Highlighted matches are instances of text similarity; they do not always indicate plagiarism. The match could be a quote or cited material listed in a bibliography.» (Las coincidencias resaltadas son casos de similitud textual; no siempre indican plagio. La coincidencia podría ser una cita o material citado incluido en una bibliografía.)

Los cuatro grupos

Los Match Groups dividen la similitud total según cómo estaba atribuido el texto coincidente. Con las palabras de la propia documentación:

  • Not Cited or Quoted (sin cita ni comillas): coincide con «that are not written as a quotation or has no citation to its original source» (que no están escritos como cita o que no remiten a su fuente original).
  • Missing Quotations (faltan las comillas): «This text is cited, but the match is so exact that it may also require quotation marks.» (Este texto está citado, pero la coincidencia es tan exacta que quizá también necesite comillas.)
  • Missing Citation (falta la cita): «This text is written as a quote, but lacks a citation to its original source.» (Este texto está escrito como cita, pero no lleva la referencia a su fuente original.)
  • Cited and Quoted (citado y entre comillas): «This text contains a quotation and is cited to a source.» (Este texto contiene una cita textual y remite a una fuente.)

El propósito declarado es permitir que quien revisa «distinguish between integrity issues, teachable moments, and properly-included source text» (distinga entre problemas de integridad, oportunidades de enseñanza y texto de fuente incluido correctamente). Eso significa que el grupo en el que cae una coincidencia influye de verdad en cómo lee alguien tu manuscrito: más, se podría argumentar, que el porcentaje de cabecera.

Así que la pregunta práctica deja de ser «por qué aparece esta coincidencia» y pasa a ser «en qué grupo ha caído esta coincidencia, y si ese es el grupo correcto».

Cómo lo decide, y dónde falla

Esta es la parte que está documentada y que casi nadie repite en ningún otro sitio.

El reconocimiento de citas y comillas es un modelo entrenado, no una regla: la guía dice que se usa tecnología de aprendizaje automático «to recognize in-text citations and quotation marks associated with matched text» (para reconocer las citas en el texto y las comillas asociadas al texto coincidente). Y el proveedor enuncia su propio margen de error en lenguaje llano: «Since there are innumerable ways to include in-text citations and quotation marks, the Similarity Report won't get it right every time.» (Como hay innumerables formas de incluir citas en el texto y comillas, el Similarity Report no lo acierta siempre.)

De ahí se derivan tres límites documentados.

Solo funciona en inglés. «The technology that powers Match Groups is trained on English content, and this functionality is currently only available for submissions in English.» (La tecnología que da soporte a Match Groups se ha entrenado con contenido en inglés, y esta función solo está disponible ahora mismo para entregas en inglés.)

Su entrenamiento de citas cubre cuatro formatos. «Citation recognition models have been trained on citations in certain formats: APA, MLA, Turabian, and IEEE numbered citations and references. If a citation is included for a match but is not in one of these formats, the report may--but is less likely to--recognize those as citations.» (Los modelos de reconocimiento de citas se han entrenado con citas en determinados formatos: APA, MLA, Turabian y citas y referencias numeradas de IEEE. Si una coincidencia lleva una cita que no está en uno de estos formatos, el informe puede reconocerla como tal, aunque es menos probable.)

Lee esa lista en contraste con tu propia disciplina. Vancouver, Chicago autor-fecha, Harvard y sus muchas variantes de cada casa no están ahí. Eso no significa que nunca se reconozcan: la redacción es «less likely» (menos probable); pero si escribes en un estilo que no es uno de esos cuatro, está documentado que bajan las probabilidades de que tu cita atribuida se lea como atribuida. A qué estilo te exigen de verdad es un lío aparte, y lo repasamos en qué estilo de referencias Harvard es el tuyo y en cómo elegir un estilo de citación según la disciplina.

La distancia importa. «Citations may not be recognized if they are placed very far from the matched text.» (Puede que las citas no se reconozcan si están situadas muy lejos del texto coincidente.) Una cita en bloque cuya referencia está al final del párrafo siguiente es exactamente ese caso.

Las comillas que reconoce

Siete formas, enumeradas explícitamente en la página de Match Groups:

  • Comillas dobles rectas: "…"
  • Comillas simples curvas: ‘…’
  • Comillas latinas: «…»
  • Comillas latinas invertidas: »…«
  • Comillas dobles bajas y altas: „…“
  • Corchetes blancos: 『…』
  • Corchetes de vértice: 「…」

Copia esa lista con cuidado, porque la entrada de las comillas dobles es la recta y la de las comillas simples es el par curvo. Y la guía de filtros de exclusión del mismo sitio de ayuda imprime otra lista distinta: ocho entradas, con comillas simples rectas en lugar de curvas, con 《…》 y 〈…〉 añadidos y con 「…」 fuera. Dos listas publicadas en un mismo sitio de ayuda, diez formas distintas entre ambas, y ninguna de las dos páginas menciona a la otra.

No lo conviertas en una regla sobre qué forma usar. Conviértelo en una regla sobre no permitir que nada cambie tus comillas entre el borrador que revisaste y el archivo que subes.

Y hay un modo de fallo que se enuncia sin rodeos: «Quotation marks are not recognized if they are separated from the text by a space (for example, " this improperly quoted text").» (Las comillas no se reconocen si están separadas del texto por un espacio; por ejemplo: " este texto entrecomillado de forma incorrecta".)

Esto es lo más fácil de comprobar de todo el artículo. Un espacio perdido detrás de una comilla de apertura —de los que sobreviven a un copia y pega desde un PDF, o aparecen cuando se recompone un párrafo— basta para mover una coincidencia de Cited and Quoted a Missing Quotations.

Cuando las comillas no se reconocen, la coincidencia cae en «Missing Quotations» (faltan las comillas) o en «Not Cited or Quoted» (sin cita ni comillas), según si se detectó una cita. Los dos fallos se acumulan.

Qué fuente se nombra cuando coinciden varias

Cuando las mismas palabras coinciden con más de una fuente, el informe elige una para mostrarla primero, y el orden de prioridad está publicado: Internet, después Publications y después Submitted Works.

Ese orden puede resultar contraintuitivo cuando miras tu propio trabajo. Una frase que tomaste correctamente de un artículo publicado puede atribuirse en la tarjeta a un sitio web que reprodujo ese artículo. Hay un control «Show overlapping sources» (mostrar las fuentes superpuestas) que revela el resto, y una acción View other sources (ver otras fuentes) en cada tarjeta.

Conviene saberlo antes de discutir con una coincidencia: la fuente nombrada en la tarjeta es la coincidencia más fuerte, no necesariamente la fuente que usaste.

Un repaso de veinte minutos a tu propio manuscrito

Nada de esto requiere acceso al informe. Puedes hacerlo en el archivo que estás a punto de entregar.

  1. Localiza todas las citas textuales y comprueba que la comilla de apertura esté pegada al primer carácter, sin ningún espacio entre medias. Busca una comilla seguida de un espacio.
  2. Revisa las formas de las comillas, y revísalas otra vez después de cualquier conversión. Un viaje de ida y vuelta por una plantilla, un PDF o el editor de un coautor cambia las rectas por curvas sin avisarte. En un manuscrito traducido puedes tener formas que no aparecen en ninguna de las dos listas publicadas.
  3. Acerca las citas. Si la referencia de una cita textual está al final de la frase o del párrafo siguiente, ponla junto al material citado.
  4. Anota tu estilo de citación. Si no es APA, MLA, Turabian o IEEE numerado, espera un reconocimiento menos fiable y prepárate para explicar una coincidencia en lugar de suponer que el informe la clasificará por ti.
  5. Para todo lo que siga coincidiendo, revisa la tarjeta de la fuente en lugar del color del resaltado, porque la fuente nombrada es la coincidencia más fuerte y puede no ser tu fuente real.

La línea entre las dos mitades de un informe

El lado de la similitud de un informe no es nuestro terreno, y reescribir no es lo que lo arregla. Si un pasaje coincidió porque es una cita textual, la respuesta es la atribución. Cambiar las palabras de una cita solo la convierte en una cita peor.

La herramienta HumanPen trabaja sobre el otro indicador. Cuando un manuscrito vuelve con un porcentaje de escritura con IA y con pasajes concretos resaltados, importar ese informe es lo que le indica qué párrafos abrir.

Si tu informe lleva las dos cifras, son dos problemas distintos con dos arreglos distintos, y tratarlos como uno solo es la forma en que la gente acaba reescribiendo citas que únicamente necesitaban que se moviera un par de comillas.

Preguntas frecuentes

Mi cita está correctamente referenciada y aun así aparece como coincidencia. ¿Es un error? No necesariamente. La documentación afirma que las coincidencias resaltadas son casos de similitud textual y que no siempre indican plagio, y existe un filtro de exclusión aparte para el texto entre comillas que alguien tiene que activar. Con él apagado, es de esperar que el material correctamente citado coincida. Lo que importa entonces es en cuál de los cuatro grupos de coincidencias cae.

¿Entiende el informe mi estilo de citación? Está documentado que el reconocimiento de citas se entrenó con los formatos APA, MLA, Turabian e IEEE numerado. Otros formatos pueden reconocerse igualmente, pero la guía dice que es menos probable.

¿Por qué no contaron mis comillas? Las formas reconocidas están enumeradas, y hay un fallo explícito: las comillas separadas del texto por un espacio no se reconocen. Busca un espacio justo después de una comilla de apertura.

¿Se aplica todo esto a un manuscrito que no esté escrito en inglés? Está documentado que los Match Groups se entrenaron con contenido en inglés y que solo están disponibles para entregas en inglés.

Seguir leyendo