Présentations par affiche et détection d’IA : pourquoi les scores deviennent peu fiables
Les présentations par affiche sont construites à partir de puces, d’étiquettes courtes et d’entrées de tableau. La FAQ de Turnitin indique que le modèle ne détecte pas de manière fiable l’IA dans les puces ou le contenu non prosaïque. Un article d’aide ajoute les tableaux à la liste des éléments non fiables. Il en résulte un écart important entre le pourcentage et ce qui est surligné. Voici comment le mécanisme fonctionne sur les documents au format affiche et pourquoi les scores peuvent être trompeurs.
L'équipe HumanPen
· 5 min de lecture
La réponse courte
Les affiches ne sont pas rédigées de la même manière que les dissertations ou les articles universitaires. Elles reposent sur des puces, des phrases courtes et des éléments visuels. La documentation de Turnitin indique que le modèle analyse uniquement les phrases en prose qualifiées et ne détecte pas de manière fiable l’IA dans les formats non prosaïques. Lorsqu’une affiche est soumise en tant que document, le pourcentage peut refléter une infime partie de la prose tandis que les surlignages ne montrent presque rien. L’écart entre les deux est un comportement connu, pas un bug.
Les puces ne sont pas du texte qualifié
La FAQ est claire sur ce qui compte comme texte qualifié :
« This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. (Ce texte qualifié comprend uniquement des phrases en prose, ce qui signifie que nous analysons uniquement les blocs de texte rédigés dans des phrases grammaticales standard et n’incluant pas d’autres types d’écriture tels que les listes, les puces (structures courtes non phrastiques) ou d’autres structures non phrastiques.) »
La FAQ indique également :
« The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures). (Le modèle ne détecte pas de manière fiable le texte généré par IA sous forme de non-prose ou de code, ni l’écriture de forme courte ou non conventionnelle telle que les puces (structures courtes non phrastiques).) »
La phrase suivante explique la conséquence :
« This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. (Cela signifie qu’un document contenant plusieurs types d’écriture différents entraînerait un écart entre le pourcentage et les surlignages.) »
Pour une affiche, cet écart est extrême. La majeure partie du texte d’une affiche se compose de puces ou d’étiquettes courtes. Si vous soumettez une affiche en tant que document et obtenez un pourcentage d’IA élevé, ce pourcentage peut reposer sur seulement quelques paragraphes de prose qualifiée, tandis que les puces qui constituent l’essentiel de l’affiche sont invisibles pour le détecteur.
Un article d’aide ajoute les tableaux à la liste
L'article d'aide de Turnitin Using the AI Writing Report indique que les limites du modèle vont plus loin que la liste de la FAQ :
« The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies. (Le modèle ne détecte pas de manière fiable le texte généré par IA sous forme de non-prose, telle que la poésie, les scripts ou le code, ni l’écriture de forme courte ou non conventionnelle telle que les puces, les tableaux ou les bibliographies annotées.) »
La phrase suivante de cet article :
« This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. (Cela signifie qu’un document contenant plusieurs types d’écriture différents entraînerait un écart entre le pourcentage et les surlignages.) »
Les affiches utilisent fréquemment des tableaux pour les résultats, les comparaisons et les chronologies. Si les tableaux figurent parmi les éléments non détectés de manière fiable, une part importante du contenu de l’affiche échappe à la couverture fiable du modèle. Le pourcentage que vous voyez peut être calculé à partir des quelques paragraphes de prose pris en sandwich entre les tableaux et les listes à puces.
Ce qui s’est passé avec les tableaux en 2023
Il y a une mise à jour importante d’août 2023. Une note de version indique :
« We are now able to process long-form prose text in tables. (Nous sommes désormais en mesure de traiter le texte en prose de forme longue dans les tableaux.) »
La phrase suivante est :
« Resubmit to reprocess existing submissions that contain tables. (Soumettez à nouveau pour retraiter les soumissions existantes qui contiennent des tableaux.) »
Cela signifie que les tableaux contenant des phrases en prose de forme longue (des phrases grammaticales complètes dans des cellules de tableau) sont désormais traités. Les étiquettes courtes, les chiffres et les entrées de données dans les tableaux restent non prosaïques et hors de l’analyse du modèle. Pour les affiches, c’est une amélioration partielle. Un tableau de résultats avec des phrases complètes dans chaque cellule serait désormais analysé. Un tableau avec de simples chiffres et des étiquettes courtes, non.
Le mécanisme de détection et le contenu de l’affiche
La FAQ décrit comment les soumissions sont traitées :
« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. (Lorsqu’un travail est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections chevauchantes pour l’analyse de prédiction. Chaque segment est classifié par le modèle de détection d’IA et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit probablement humain ou généré par IA. Chaque phrase qualifiée au sein de ces segments hérite du score du segment.) »
Seules les phrases en prose qualifiées sont extraites. L’agrégation produit ensuite le score au niveau du document :
« These sentence scores are further aggregated and used to compute the overall document AI writing score. (Ces scores de phrases sont ensuite agrégés et utilisés pour calculer le score global de rédaction par IA du document.) »
Pour une affiche, l’étape d’extraction peut ne récupérer que très peu de phrases. Les rares paragraphes de prose d’une affiche pourraient être le résumé, une brève introduction et une remarque de conclusion. Tout le reste se compose de puces et d’entrées de tableau. Le score est calculé à partir de ce petit ensemble de prose, ce qui signifie qu’il reflète un échantillon restreint. Comment lire un rapport de rédaction par IA Turnitin part du même écart entre le chiffre et la page.
Documents courts et le problème du tout ou rien
Les affiches soumises en tant que documents sont courtes. La FAQ met en garde à ce sujet :
« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. (Dans les documents plus courts où il n’y a que quelques centaines de mots, la prédiction sera principalement « tout ou rien » car nous prédisons sur un seul segment sans possibilité de chevauchement.) »
La phrase suivante :
« This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. (Cela signifie qu’un texte qui est un mélange de contenu généré par IA et de contenu original pourrait être signalé comme entièrement généré par IA.) »
Une affiche avec seulement 300 ou 400 mots de prose qualifiée se situe clairement dans cette plage. Avec si peu de segments, il n’y a pas d’effet de moyenne. Un seul segment avec un score élevé peut étiqueter l’ensemble du document comme généré par IA. La propre phrase suivante de la FAQ sur l’écart entre le pourcentage et les surlignages devient très visible ici. Vous pourriez voir un pourcentage élevé mais presque aucun texte surligné sur l’affiche elle-même, ce qui est l’un des cas de pourquoi votre score de rédaction par IA est manquant, incohérent ou ne se télécharge pas.
Faux positifs et langage répétitif des affiches
La FAQ décrit ce qui tend à déclencher des faux positifs :
« Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. (Parfois, les faux positifs (signaler incorrectement un texte écrit par un humain comme généré par IA) peuvent inclure du contenu sans beaucoup de variation structurelle, du texte qui se répète littéralement, ou du texte qui a été paraphrasé sans développer de nouvelles idées.) »
La prose des affiches a tendance à être répétitive. Les mêmes conclusions clés apparaissent dans le résumé, la section des résultats et la conclusion. Le langage est comprimé et uniforme parce que l’espace est limité, et l’uniformité est proche de ce que ce que mesurent les détecteurs d’IA indique que le classificateur capte. La FAQ continue :
« If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. (Si notre indicateur montre une quantité plus importante d’écriture par IA dans un tel texte, nous vous conseillons d’en tenir compte lors de l’examen du pourcentage indiqué.) »
Pour les affiches, ce conseil est doublement pertinent. La prose est courte, répétitive et structurellement uniforme. Les trois facteurs cumulent le risque d’un score trompeur.
Ce que cela signifie pour vous
Si votre présentation par affiche a reçu un score d’IA Turnitin, voici ce qu’il faut garder à l’esprit :
- Les puces et les étiquettes courtes ne sont pas du texte qualifié. Le score ne les reflète pas.
- Un article d’aide de Turnitin indique que les tableaux ne sont pas non plus détectés de manière fiable, bien que la prose de forme longue dans les tableaux soit traitée depuis août 2023.
- L’écart entre le pourcentage et les surlignages est un comportement attendu pour les documents à format mixte.
- La prose qualifiée courte déclenche des prédictions « tout ou rien » avec un chevauchement minimal des segments.
- La prose des affiches est répétitive et uniforme, ce qui correspond au profil de faux positif décrit par la FAQ.
- Un pourcentage élevé avec peu de surlignages doit être traité avec prudence, pas comme un verdict définitif.
Si vous souhaitez traiter les passages signalés, importez votre rapport Turnitin et travaillez-les. Les passages éligibles peuvent être retraités sans frais.
CONTINUER LA LECTURE