Les indicateurs d’intégrité d’un Similarity Report : texte masqué et caractères substitués

Le rapport comporte un second onglet qui n’a rien à voir avec le pourcentage de correspondance de votre texte. Il vaut la peine de le comprendre avant de confier à un outil un manuscrit que vous vous apprêtez à soumettre.

L'équipe HumanPen

· 7 min de lecture

La réponse courte

Le Similarity Report possède un onglet Flags distinct du pourcentage. Il signale deux schémas documentés : le texte masqué — caractères en blanc sur blanc, guillemets dissimulés — et les caractères substitués, où des lettres sont remplacées par des caractères similaires d’autres alphabets. La documentation indique que ces caractères sont automatiquement rétablis avant l’analyse : la correspondance a donc bien lieu malgré tout. Un flag n’est explicitement pas un constat de faute, mais il pose tout de même un repère rouge sur votre dépôt pour qu’un être humain y regarde.

Ce qu’est l’onglet Flags

La documentation le décrit en une phrase : « Turnitin's algorithms look deeply at a document for any inconsistencies that would set it apart from a normal submission. If we notice something strange, we Flag it for you to review. » (Les algorithmes de Turnitin examinent un document en profondeur pour y repérer toute incohérence qui le distinguerait d’un dépôt normal. Si nous remarquons quelque chose d’étrange, nous le signalons pour que vous l’examiniez.)

Si quelque chose est détecté, un chiffre apparaît à côté de l’onglet Flags, au-dessus du dépôt : 1 lorsqu’un type de flag est présent, 2 lorsque les deux le sont. En ouvrant l’onglet, vous obtenez un panneau Integrity Flags for Review, et dans le document lui-même « a red flag with a number inside indicating the flag type and red boxes around all suspicious text related to that flag. » (un drapeau rouge avec un chiffre à l’intérieur qui indique le type de flag, et des cadres rouges autour de tout le texte suspect lié à ce flag.)

La réserve figure là, dans la source, et elle compte dans les deux sens : « A flag is not necessarily an indicator of a problem. However, we recommend you focus your attention there for further review. » (Un flag n’est pas nécessairement le signe d’un problème. Nous vous recommandons toutefois d’y concentrer votre attention pour un examen plus poussé.)

Ce n’est donc pas une accusation. C’est un cadre rouge tracé autour d’une partie de votre manuscrit, avec pour consigne à la personne qui évalue de regarder cette partie de plus près.

Le texte masqué

La documentation est étonnamment directe sur l’origine de ces pratiques : « Paper mills and authors looking to hinder similarity matching abuse text manipulation techniques by trying to pass plagiarized content off as genuine. These techniques are commonly found on YouTube and social media platforms as ways of 'cheating Turnitin'. » (Les usines à articles et les auteurs qui cherchent à entraver la détection des similarités abusent de techniques de manipulation du texte pour faire passer un contenu plagié pour authentique. On trouve couramment ces techniques sur YouTube et les réseaux sociaux, présentées comme des moyens de tromper Turnitin.)

Deux exemples sont donnés.

Guillemets invisibles. Des guillemets présents dans le fichier mais invisibles à l’affichage. La conséquence documentée est précise : « could influence the amount of quoted material recognized in a document. When a user excludes well-referenced matches using the Exclude Quotes functionality, in a manipulated document this would also hide plagiarized content. » (ces guillemets pourraient influencer la quantité de texte cité reconnue dans un document ; et lorsqu’un utilisateur exclut les correspondances bien référencées à l’aide de la fonctionnalité Exclude Quotes, cela masquerait aussi, dans un document manipulé, le contenu plagié.)

Texte blanc sur fond blanc. « A user may set the color of a block to text to white rendering it invisible on the white background of the paper. This can be to manipulate the word count or break up plagiarized text with hidden characters. » (Un utilisateur peut régler en blanc la couleur d’un bloc de texte, le rendant invisible sur le fond blanc de la page. Cela peut servir à manipuler le nombre de mots ou à morceler un texte plagié avec des caractères cachés.)

Notez la seconde moitié de cette phrase. Des caractères cachés, utilisés pour morceler le texte afin que le moteur de correspondance cesse de voir une suite de mots. Le guide ne dit pas où ces caractères se trouvent dans le texte, et nous n’allons pas le préciser à sa place. Ce qu’il dit, c’est que c’est quelque chose que le logiciel recherche, pas quelque chose qui lui échappe.

Les caractères substitués, et pourquoi l’astuce échoue deux fois

C’est le point à lire attentivement, car c’est la technique la plus susceptible de se trouver dans un outil plutôt que d’être tapée par une personne.

« Some characters in different alphabets can look similar enough that to the naked eye, it is difficult, if not impossible, to tell them apart. » (Certains caractères d’alphabets différents peuvent se ressembler au point qu’à l’œil nu il est difficile, voire impossible, de les distinguer.) Un caractère cyrillique qui s’affiche comme son équivalent latin, glissé au milieu d’un mot, brise la chaîne que recherche le moteur de correspondance, alors que la page garde un aspect normal.

La réponse documentée comporte deux volets, et le premier est celui que personne ne mentionne :

« Turnitin automatically swaps these characters out when scanning a submission so they will not affect the Similarity Report. However, by replacing characters, the intent is to try and interrupt a similarity match. » (Turnitin remplace automatiquement ces caractères lors de l’analyse d’un dépôt, afin qu’ils n’affectent pas le Similarity Report. Toutefois, en remplaçant des caractères, l’intention est d’essayer d’interrompre une correspondance.)

La substitution est donc annulée avant la comparaison — la correspondance a quand même lieu — et la tentative est signalée par un flag. La technique ne réduit pas le chiffre qu’elle visait, et elle ajoute un repère qui n’existait pas auparavant.

C’est une chose rare à pouvoir affirmer avec une citation plutôt qu’avec une opinion : une technique de contournement documentée dont il est également documenté qu’elle ne fonctionne pas.

Pourquoi c’est une question d’outils, pas de personnes

La plupart des auteurs ne vont pas s’asseoir et coller un 'о' cyrillique dans un mot sur trois. Mais un logiciel le fera, invisiblement, en une seconde, sur tout un manuscrit — et vous ne le verrez pas, puisque toute l’astuce consiste justement à ce que le rendu soit identique.

Voilà qui en fait une question à poser avant de confier un fichier à quoi que ce soit : ce qui revient contient-il des caractères qui n’étaient pas dans ce qui est parti ?

Vous pouvez le vérifier sans outil particulier. Commencez toutefois par écarter la version de la vérification qui paraît évidente et qui ne fonctionne pas.

Compter le nombre d’occurrences d’une lettre courante ne vous apprend rien. La réécriture a tendance à allonger le texte, et les lettres augmentent avec lui. Sur nos propres fichiers avant/après, le « a » latin est passé de 4 631 à 5 092 et le « e » de 6 970 à 8 005, sans qu’aucun caractère n’ait été substitué nulle part. Vous comptez les lettres, vous en trouvez davantage, et tout ce que vous avez appris, c’est que le document s’est allongé.

Comparez des inventaires plutôt que des comptages. Exportez le texte brut du fichier envoyé et celui du fichier reçu, listez les caractères distincts présents dans chacun et cherchez tout ce qui figure dans la seconde liste et manque dans la première. Des lettres cyrilliques et grecques qui ressemblent à des latines. Des espaces sans chasse. Des traits d’union conditionnels. Que les comptages changent, c’est attendu. Qu’apparaisse un caractère qui n’a jamais figuré dans votre fichier, ça ne l’est pas.

Et deux points structurels sur qui porte la conséquence. Le flag atterrit sur le dépôt, et votre nom y figure. Et l’outil qui a introduit les caractères n’est pas dans la pièce quand le rapport est lu.

Ce que nous faisons et ne faisons pas de vos caractères

Nous appartenons à la catégorie où cette technique se pratique ; la démarche honnête consiste donc à le dire explicitement plutôt que de le passer sous silence.

L’outil HumanPen réécrit des phrases. Il n’insère pas de caractères invisibles, il ne remplace pas des lettres par des caractères similaires d’autres alphabets et il ne colore pas le texte en blanc. Cela n’aurait aucun sens : la documentation citée plus haut indique que la substitution est annulée avant la comparaison et signalée au passage, si bien que la seule chose qu’une telle technique produise de façon fiable est un cadre rouge sur votre manuscrit.

Nous avons effectué la comparaison d’inventaires sur notre propre production avant de publier ceci, sur quatre paires avant/après. L’ensemble des caractères distincts de chaque sortie a été chaque fois un sous-ensemble de celui de l’entrée. Rien de nouveau, pas de cyrillique, pas de grec, pas d’espace sans chasse. Le nombre de caractères non ASCII a diminué plutôt qu’augmenté : tirets cadratins de 58 à 13 dans un fichier, apostrophes courbes de 41 à 6. Nous avons aussi vérifié que la comparaison voit bien ce qu’elle cherche, en glissant un « о » cyrillique et une espace sans chasse dans une copie de la sortie et en la relançant : les deux ont été listés.

Ce sont nos fichiers et nous ne publions pas le corpus : prenez donc les chiffres comme les nôtres et la procédure comme la vôtre. Lancez-la sur votre propre paire. Y compris sur tout ce que nous vous rendons.

Questions fréquentes

Un flag signifie-t-il que l’on m’accuse de quelque chose ? Non. La documentation indique qu’un flag « is not necessarily an indicator of a problem » (n’est pas nécessairement le signe d’un problème), tout en recommandant que la personne qui évalue y concentre son attention. C’est une invitation à regarder, pas un constat.

Les caractères similaires font-ils baisser un score de similarité ? Pas selon la documentation, qui indique que ces caractères sont automatiquement remplacés lors de l’analyse d’un dépôt afin de ne pas affecter le Similarity Report. La tentative est en outre signalée par un flag.

Combien de types de flags existe-t-il ? Deux sont documentés — le texte masqué et les caractères substitués — et l’onglet affiche un 1 ou un 2 selon le nombre de types détectés.

Puis-je vérifier mon propre fichier avant de le soumettre ? Pas par le rapport, qui est généré du côté de la personne qui évalue. Vous pouvez inspecter le fichier lui-même. Listez les caractères distincts de la version envoyée et de la version revenue, et cherchez tout caractère présent dans la seconde liste et absent de la première. Ne comptez pas les lettres à la place : la réécriture allonge le texte, si bien que les comptages de lettres augmentent d’eux-mêmes. Vérifiez aussi la présence de texte en blanc ou dans une couleur identique au fond.

CONTINUER LA LECTURE