Comment Turnitin traite les équations mathématiques et les contenus qui ne sont pas de la prose

Les étudiants en mathématiques et en ingénierie se demandent souvent si les équations et les formules pèsent sur leur score d’IA. La FAQ de Turnitin indique que le modèle n’analyse que les phrases de prose éligibles et qu’il ne détecte pas de façon fiable les contenus qui ne sont pas de la prose. Elle précise aussi que Turnitin ne cherche pas à détecter le code. Voici ce qui compte comme texte éligible, et ce qui n’en fait pas partie.

L'équipe HumanPen

· 4 min de lecture

La réponse courte

Les équations mathématiques, les formules et les blocs de code ne sont pas analysés par le détecteur d’IA de Turnitin. La FAQ indique : « This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. » (Ce texte éligible ne comprend que des phrases de prose, ce qui signifie que nous n’analysons que des blocs de texte rédigés en phrases grammaticales standard et que nous excluons d’autres formes d’écriture comme les listes, les puces — structures courtes qui ne sont pas des phrases — ou d’autres structures qui ne sont pas des phrases.) Du modèle, la FAQ dit aussi qu’il « does not reliably detect AI-generated text in the form of non-prose, or code. » (ne détecte pas de façon fiable le texte généré par IA lorsqu’il se présente sous forme de non-prose ou de code.) Et elle ajoute : « In addition, we are not pursuing ChatGPT code detection at this time. » (En outre, nous ne cherchons pas, à l’heure actuelle, à détecter le code produit par ChatGPT.) Concrètement, vos équations et vos formules ne pèsent donc pas directement sur votre score d’IA. Le score ne reflète que les parties rédigées de votre document. Si votre travail se compose surtout d’équations avec quelques phrases d’explication, le détecteur d’IA n’évalue que très peu de texte, ce qui rend le score moins significatif.

Ce qui compte comme texte éligible

La FAQ définit ce que le modèle examine :

« This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. » (Ce texte éligible ne comprend que des phrases de prose, ce qui signifie que nous n’analysons que des blocs de texte rédigés en phrases grammaticales standard et que nous excluons d’autres formes d’écriture comme les listes, les puces — structures courtes qui ne sont pas des phrases — ou d’autres structures qui ne sont pas des phrases.)

La phrase suivante : « This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. » (Cela signifie qu’un document contenant plusieurs types d’écriture différents peut donner lieu à un écart entre le pourcentage et les passages surlignés.)

Pour un travail de mathématiques ou d’ingénierie, cela signifie que les équations elles-mêmes ne sont pas évaluées. Seules les phrases de prose qui les entourent — les explications, les introductions, les discussions — passent à la détection d’IA. Si vous avez une page remplie d’équations avec deux phrases d’explication, ce sont ces deux phrases que le détecteur évalue. Et si vous réécrivez le texte, la question miroir se pose : ce qu’un humaniseur de texte IA fait des citations, des tableaux et des équations.

Le code et les contenus qui ne sont pas de la prose

La FAQ est directe au sujet des contenus non rédactionnels :

« The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures). » (Le modèle ne détecte pas de façon fiable le texte généré par IA sous forme de non-prose ou de code, et il ne détecte pas non plus les écrits courts ou atypiques comme les puces — structures courtes qui ne sont pas des phrases.)

La FAQ indique également : « In addition, we are not pursuing ChatGPT code detection at this time. » (En outre, nous ne cherchons pas, à l’heure actuelle, à détecter le code produit par ChatGPT.)

Cela a une conséquence pratique pour les travaux scientifiques et techniques. Si vous avez utilisé un outil d’IA pour produire du code ou des équations, le détecteur d’IA n’est pas conçu pour repérer cela. Il évalue la prose qui l’entoure, pas le code ni les mathématiques elles-mêmes.

Comment le mécanisme fonctionne sur la prose

Le modèle de détection traite le texte éligible en le découpant en segments qui se chevauchent :

« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. » (Lorsqu’un devoir est soumis à Turnitin, les phrases de la soumission sont extraites puis découpées en sections se chevauchant, en vue de l’analyse prédictive. Chaque section est classée par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit d’origine humaine ou généré par IA.)

Les segments se chevauchent, ce qui veut dire qu’une phrase peut recevoir plusieurs valeurs, ensuite regroupées. Dans un travail dense en équations et pauvre en prose, cet avantage du chevauchement s’amenuise, car il y a moins de phrases de prose à découper. Le score devient alors moins stable : le modèle dispose de moins de points de données.

Et les tableaux et les données ?

Une note de mise à jour d’août 2023 décrit la façon dont le modèle traite les tableaux :

« We are now able to process long-form prose text in tables. » (Nous sommes désormais en mesure de traiter les textes de prose longs contenus dans les tableaux.)

La phrase suivante : « Resubmit to reprocess existing submissions that contain tables. » (Soumettez à nouveau le travail pour retraiter les soumissions existantes qui contiennent des tableaux.)

Cela signifie que, si votre tableau contient de longues phrases de prose, ces phrases sont aujourd’hui analysées. En revanche, les données brutes, les nombres et les libellés courts des tableaux ne sont pas des phrases de prose et sortent du champ de la définition du texte éligible. Les bibliographies sont également exclues : la même note de mise à jour indique « Bibliographies are now excluded when processing the AI writing report. » (Les bibliographies sont désormais exclues lors du traitement du rapport d’écriture IA.) La phrase suivante exige de nouveau une nouvelle soumission pour les travaux déjà déposés, et c’est pour cette raison qu’un ancien rapport peut encore donner l’impression que Turnitin a signalé vos références.

Score d’IA et score de similarité sont deux choses distinctes

Une confusion fréquente consiste à se demander si un contenu mathématique signalé par le contrôle de similarité pèse aussi sur le score d’IA. Ce n’est pas le cas. La FAQ indique :

« The Similarity score and the AI writing detection percentage are completely independent and do not influence each other. » (Le score de similarité et le pourcentage de détection d’écriture IA sont totalement indépendants et ne s’influencent pas l’un l’autre.)

Si vos équations correspondent à une source de la base de similarité, cela pèse sur votre score de similarité, pas sur votre score d’IA. Le détecteur d’IA n’examine que la prose, à la recherche de schémas propres à un texte généré, quels que soient les résultats du contrôle de similarité. L’erreur à éviter ici, c’est de prendre les deux scores pour une seule et même chose.

Ce que cela change pour vous

Pour résumer ce que nous avons vu :

  • Les équations et formules mathématiques ne sont pas analysées par le détecteur d’IA. Seules les phrases de prose éligibles comptent.
  • Selon la FAQ, le modèle ne détecte pas de façon fiable la non-prose ni le code, et il ne cherche pas à détecter le code.
  • Les tableaux contenant de longues phrases de prose sont aujourd’hui traités, mais pas les données brutes ni les libellés courts.
  • Les bibliographies sont exclues du traitement de la détection d’IA.
  • Le score d’IA et le score de similarité sont totalement indépendants et ne s’influencent pas l’un l’autre.
  • Les travaux denses en équations et pauvres en prose laissent moins de texte à évaluer au modèle, ce qui peut rendre le score moins stable.

Si vous recevez un rapport Turnitin sur un travail scientifique ou technique et que vous souhaitez reprendre les passages de prose signalés, importez le rapport et travaillez dessus. Les passages éligibles peuvent être relancés gratuitement.

CONTINUER LA LECTURE