Pourquoi votre texte entre guillemets et correctement cité apparaît quand même dans le Similarity Report

Un bloc bien entre guillemets et bien cité qui apparaît comme correspondance a des airs de bug. Ce n’est généralement pas le cas. Il y a entre les deux une étape de reconnaissance documentée, et c’est précisément elle qui peut passer à côté.

L'équipe HumanPen

· 8 min de lecture

La réponse courte

Chaque correspondance est rangée dans l’un de quatre groupes selon que le logiciel a détecté des guillemets et une citation dans le texte autour : ni cité ni entre guillemets, guillemets manquants, citation manquante, ou cité et entre guillemets. Cette détection est un modèle d’apprentissage automatique dont les limites sont publiées : il est entraîné sur l’anglais, sa reconnaissance des citations couvre quatre formats nommément cités, il reconnaît sept formes précises de guillemets, et il peut manquer une citation placée loin du texte correspondant. Un passage correctement attribué mais avec la mauvaise forme atterrit dans le mauvais groupe.

Le pourcentage d’abord, parce qu’il n’est pas ce qu’on croit

Le chiffre de similarité global a une définition qu’on peut garder en tête : les mots correspondants divisés par le nombre total de mots du document. La formule ne pondère rien et ne déduit rien au motif qu’un passage est attribué.

Ce qui fait bouger ce chiffre est un mécanisme entièrement différent, et il ne vous appartient pas de le régler. Le même site d’aide propose un guide des filtres d’exclusion et en liste cinq : exclude bibliography (exclure la bibliographie), exclude quoted text (exclure le texte entre guillemets), exclude cited text (exclure le texte cité), exclude small matches (exclure les petites correspondances), exclude small sources (exclure les petites sources). Celui qui compte le plus ici est le deuxième. Il « ignores text enclosed in quotation marks or formatted as block quotes, preventing properly quoted material from appearing as matches » (ignore le texte placé entre guillemets ou mis en forme comme une citation en bloc, ce qui empêche le matériel correctement cité d’apparaître comme correspondance), et il couvre aussi les blocs en retrait lorsque le fichier est au format .doc ou .docx.

Ce qui est déjà une moitié de réponse à la question du titre. Parfois, un paragraphe correctement cité apparaît parce que personne n’a activé ce filtre. Qu’il ait été activé ou non est une décision de celui qui a lancé la vérification, et cela ne figure pas sur le chiffre qu’on vous transmet.

Le dénominateur mérite d’être cerné, car l’indicateur d’écriture IA de la même plateforme n’utilise pas celui-là. Son pourcentage est calculé sur la prose éligible plutôt que sur l’ensemble de votre fichier, ce qui explique que ce chiffre et ses surlignages puissent sembler disproportionnés l’un par rapport à l’autre. Deux chiffres, deux dénominateurs. Nous les avons mis côte à côte dans lire un score de Similarity à côté d’un score d’écriture IA.

Un seuil à connaître avant tout le reste : un dépôt doit comporter au moins 20 mots pour produire ne serait-ce qu’un Similarity Report.

Et la phrase de cadrage par laquelle s’ouvre la documentation, qu’on parcourt facilement sans s’y arrêter : « Highlighted matches are instances of text similarity; they do not always indicate plagiarism. The match could be a quote or cited material listed in a bibliography. » (Les correspondances surlignées sont des cas de similarité textuelle ; elles n’indiquent pas toujours un plagiat. La correspondance peut être une citation ou un matériel cité figurant dans une bibliographie.)

Les quatre groupes

Les Match Groups répartissent la similarité globale selon la façon dont le texte correspondant était attribué. Dans les propres mots de la documentation :

  • Not Cited or Quoted (ni cité ni entre guillemets) : correspond à « that are not written as a quotation or has no citation to its original source » (des textes qui ne sont pas écrits comme une citation ou qui ne renvoient pas à leur source d’origine).
  • Missing Quotations (guillemets manquants) : « This text is cited, but the match is so exact that it may also require quotation marks. » (Ce texte est cité, mais la correspondance est si exacte qu’il pourrait aussi exiger des guillemets.)
  • Missing Citation (citation manquante) : « This text is written as a quote, but lacks a citation to its original source. » (Ce texte est écrit comme une citation, mais il ne renvoie pas à sa source d’origine.)
  • Cited and Quoted (cité et entre guillemets) : « This text contains a quotation and is cited to a source. » (Ce texte contient une citation et renvoie à une source.)

L’objectif affiché est de permettre à un relecteur de « distinguish between integrity issues, teachable moments, and properly-included source text » (distinguer les problèmes d’intégrité, les occasions d’apprentissage et le texte source correctement intégré). Autrement dit, le groupe dans lequel tombe une correspondance pèse réellement sur la façon dont une personne lit votre manuscrit : davantage, sans doute, que le pourcentage affiché en tête.

La question pratique cesse donc d’être « pourquoi cette correspondance » et devient « dans quel groupe cette correspondance est-elle tombée, et est-ce le bon groupe ».

Comment il décide, et là où il passe à côté

C’est la partie qui est documentée et qui n’est presque jamais reprise ailleurs.

La reconnaissance des citations et des guillemets est un modèle entraîné, pas une règle : la documentation indique que la technologie d’apprentissage automatique est utilisée « to recognize in-text citations and quotation marks associated with matched text » (pour reconnaître les citations dans le texte et les guillemets associés au texte correspondant). Et l’éditeur énonce lui-même son taux d’erreur en termes clairs : « Since there are innumerable ways to include in-text citations and quotation marks, the Similarity Report won't get it right every time. » (Comme il existe d’innombrables façons d’insérer des citations dans le texte et des guillemets, le Similarity Report ne tombe pas juste à chaque fois.)

Trois limites documentées en découlent.

Cela ne vaut que pour l’anglais. « The technology that powers Match Groups is trained on English content, and this functionality is currently only available for submissions in English. » (La technologie qui alimente Match Groups est entraînée sur des contenus anglais, et cette fonctionnalité n’est actuellement disponible que pour les dépôts en anglais.)

Son entraînement sur les citations couvre quatre formats. « Citation recognition models have been trained on citations in certain formats: APA, MLA, Turabian, and IEEE numbered citations and references. If a citation is included for a match but is not in one of these formats, the report may--but is less likely to--recognize those as citations. » (Les modèles de reconnaissance des citations ont été entraînés sur des citations dans certains formats : APA, MLA, Turabian, ainsi que les citations et références numérotées IEEE. Si une citation accompagne une correspondance sans être dans l’un de ces formats, le rapport peut la reconnaître comme telle, mais c’est moins probable.)

Lisez cette liste à l’aune de votre propre discipline. Vancouver, Chicago auteur-date, Harvard et ses nombreuses variantes maison n’y figurent pas. Cela ne signifie pas qu’ils ne sont jamais reconnus : la formulation est « less likely » (moins probable) ; mais si vous écrivez dans un style qui n’est pas l’un de ces quatre, il est documenté que la probabilité que votre citation attribuée soit lue comme attribuée est plus faible. Le style auquel on vous tient réellement est un casse-tête en soi, et nous l’avons parcouru dans quel style de référencement Harvard est le vôtre et choisir un style de citation par discipline.

La distance compte. « Citations may not be recognized if they are placed very far from the matched text. » (Les citations peuvent ne pas être reconnues si elles sont placées très loin du texte correspondant.) Une citation en bloc dont la référence se trouve à la fin du paragraphe suivant est exactement ce cas.

Les guillemets qu’il reconnaît

Sept formes, énumérées explicitement sur la page Match Groups :

  • Guillemets doubles droits : "…"
  • Guillemets simples courbes : ‘…’
  • Chevrons doubles : «…»
  • Chevrons doubles inversés : »…«
  • Guillemets doubles bas-haut : „…“
  • Crochets blancs : 『…』
  • Crochets d’angle : 「…」

Recopiez cette liste avec attention, car l’entrée pour les guillemets doubles est la forme droite et celle pour les guillemets simples est la paire courbe. Et le guide des filtres d’exclusion du même site d’aide imprime encore une autre liste : huit entrées, avec des guillemets simples droits plutôt que courbes, 《…》 et 〈…〉 en plus, et 「…」 en moins. Deux listes publiées sur un même site d’aide, dix formes distinctes à elles deux, et aucune des deux pages ne mentionne l’autre.

N’en faites pas une règle sur la forme à utiliser. Faites-en une règle sur le fait de ne laisser quoi que ce soit modifier vos guillemets entre la version que vous avez relue et le fichier que vous déposez.

Et un mode de défaillance est énoncé sans détour : « Quotation marks are not recognized if they are separated from the text by a space (for example, " this improperly quoted text"). » (Les guillemets ne sont pas reconnus s’ils sont séparés du texte par une espace — par exemple : " ce texte mal placé entre guillemets".)

C’est l’élément le plus vérifiable de tout cet article. Un espace égaré après un guillemet ouvrant — du genre de celui qui survit à un copier-coller depuis un PDF, ou qui apparaît lorsqu’un paragraphe est recomposé — suffit à faire passer une correspondance de Cited and Quoted à Missing Quotations.

Là où les guillemets ne sont pas reconnus, la correspondance tombe dans « Missing Quotations » (guillemets manquants) ou « Not Cited or Quoted » (ni cité ni entre guillemets), selon qu’une citation a été détectée ou non. Les deux défaillances se cumulent.

Quelle source est nommée quand plusieurs correspondent

Lorsque les mêmes mots correspondent à plusieurs sources, le rapport en choisit une à afficher en premier, et l’ordre de priorité est publié : Internet, puis Publications, puis Submitted Works.

Cet ordre peut être contre-intuitif lorsqu’on regarde son propre travail. Une phrase que vous avez prise, à juste titre, dans un article publié peut être attribuée sur la fiche à un site web qui a reproduit cet article. Il existe une commande « Show overlapping sources » (afficher les sources en chevauchement) qui révèle le reste, et une action View other sources (voir d’autres sources) sur chaque fiche.

Bon à savoir avant de contester une correspondance : la source nommée sur la fiche est la correspondance la plus forte, pas nécessairement la source que vous avez utilisée.

Une passe de vingt minutes sur votre propre manuscrit

Rien de tout cela n’exige l’accès au rapport. Vous pouvez le faire dans le fichier que vous vous apprêtez à déposer.

  1. Repérez chaque citation textuelle et vérifiez que le guillemet ouvrant est collé au premier caractère, sans espace entre les deux. Cherchez un guillemet suivi d’un espace.
  2. Vérifiez les formes des guillemets, et revérifiez-les après toute conversion. Un aller-retour par un modèle, un PDF ou l’éditeur d’un coauteur remplace les droits par des courbes sans vous le dire. Dans un manuscrit traduit, vous pouvez avoir des formes qui ne figurent sur aucune des deux listes publiées.
  3. Rapprochez les citations. Si la référence d’une citation se trouve à la fin de la phrase ou du paragraphe suivant, placez-la à côté du matériel cité.
  4. Notez votre style de citation. S’il ne s’agit pas d’APA, MLA, Turabian ou IEEE numéroté, attendez-vous à une reconnaissance moins fiable et tenez-vous prêt à expliquer une correspondance plutôt qu’à supposer que le rapport la classera pour vous.
  5. Pour tout ce qui correspond encore, consultez la fiche de la source plutôt que la couleur du surlignage, puisque la source nommée est la correspondance la plus forte et peut ne pas être votre source réelle.

La ligne entre les deux moitiés d’un rapport

Le versant similarité d’un rapport n’est pas notre domaine, et la réécriture n’est pas ce qui le corrige. Si un passage a été signalé parce que c’est une citation, la réponse est l’attribution. Changer les mots d’une citation ne fait qu’en faire une citation plus mauvaise.

L’outil HumanPen travaille sur l’autre indicateur. Lorsqu’un manuscrit revient avec un pourcentage d’écriture IA et des passages précis surlignés, c’est l’importation de ce rapport qui lui indique quels paragraphes ouvrir.

Si votre rapport porte les deux chiffres, ce sont deux problèmes distincts avec deux correctifs distincts, et les traiter comme un seul est la façon dont on finit par réécrire des citations qui auraient seulement eu besoin qu’on déplace une paire de guillemets.

Questions fréquentes

Ma citation est correctement référencée et elle apparaît quand même comme correspondance. Est-ce une erreur ? Pas nécessairement. La documentation indique que les correspondances surlignées sont des cas de similarité textuelle et n’indiquent pas toujours un plagiat, et il existe un filtre d’exclusion distinct pour le texte entre guillemets, que quelqu’un doit activer. S’il est désactivé, il est normal que le matériel correctement cité corresponde. Ce qui compte alors, c’est le groupe parmi les quatre dans lequel il tombe.

Le rapport comprend-il mon style de citation ? Il est documenté que la reconnaissance des citations a été entraînée sur les formats APA, MLA, Turabian et IEEE numéroté. D’autres formats peuvent malgré tout être reconnus, mais la documentation précise que c’est moins probable.

Pourquoi mes guillemets n’ont-ils pas été pris en compte ? Les formes reconnues sont listées, et une défaillance est explicite : les guillemets séparés du texte par une espace ne sont pas reconnus. Cherchez une espace juste après un guillemet ouvrant.

Tout cela s’applique-t-il à un manuscrit non rédigé en anglais ? Il est documenté que les Match Groups sont entraînés sur des contenus anglais et disponibles uniquement pour les dépôts en anglais.

CONTINUER LA LECTURE