Pourquoi Turnitin signale-t-il mon travail comme 100 % d’IA ?
Si Turnitin indique 100 % d’IA sur quelque chose que vous avez écrit vous-même, le score est réel mais le verdict n’est pas ce qu’il paraît. Les documents courts, la structure répétitive et la paraphrase sans nouvelles idées poussent le texte humain vers 100 %. La propre documentation de Turnitin dit que les scores ne doivent pas être utilisés comme seule base pour des actions défavorables.
L'équipe HumanPen
· 9 min de lecture
La réponse courte
Un score de 100 % ne signifie pas que Turnitin est certain que votre texte est généré par IA. Pour les documents plus courts, quelques centaines de mots, la prédiction est surtout « tout ou rien » parce que le système évalue un seul segment sans chevauchement pour moyenner. Le texte avec peu de variation structurelle, de répétition littérale ou de paraphrase sans nouvelles idées est plus sujet aux faux positifs. Et Turnitin lui-même dit, dans trois documents d’aide distincts, que le score ne doit pas être utilisé comme seule base pour des actions défavorables envers un étudiant.
Nous avons expliqué comment fonctionne la détection d’IA de Turnitin en termes de classificateur et de ses segments. Cet article porte sur ce qui se passe quand ce système renvoie 100 % sur un texte que vous savez avoir écrit vous-même. Les causes sont mécaniques, non arbitraires, et elles sont documentées dans les propres pages de Turnitin.
Le problème des documents courts
C’est la raison la plus courante pour laquelle un véritable texte humain obtient un score de 100 %. La FAQ sur les capacités de détection d’écriture par IA de Turnitin décrit ce qui se passe avec les soumissions courtes :
« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » (Dans les documents plus courts où il n’y a que quelques centaines de mots, la prédiction sera surtout « tout ou rien » parce que nous prédisons sur un seul segment sans la possibilité de chevauchement.)
La phrase suivante est celle qui complète le tableau :
« This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu’un texte qui est un mélange de contenu généré par IA et de contenu original pourrait être signalé comme entièrement généré par IA.)
Lisez ces deux phrases ensemble et le score de 100 % sur un court document cesse de ressembler à un verdict. Cela ressemble à un plafond sur la résolution de l’instrument. Quand il n’y a qu’un seul segment, il n’y a rien contre quoi moyenner. Un segment à forte probabilité devient le score du document entier. Si votre dissertation fait 300 ou 500 mots, c’est la première possibilité à vérifier.
Turnitin a également noté dans une version de décembre 2023 que « submissions that contain less than 300 words may result in an AI writing score that is likely less accurate. » (les soumissions contenant moins de 300 mots peuvent donner un score d’écriture d’IA probablement moins précis.) Les documents courts sont plus difficiles à évaluer, et le système le sait.
Quel type de texte est signalé par erreur
La même page de FAQ liste les types de texte où les faux positifs sont plus susceptibles de se produire :
« Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. » (Parfois, les faux positifs (signaler incorrectement un texte écrit par un humain comme généré par IA) peuvent inclure du contenu sans beaucoup de variation structurelle, du texte qui se répète littéralement, ou du texte qui a été paraphrasé sans développer de nouvelles idées.)
La phrase suivante compte autant que la liste elle-même :
« If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur montre une quantité plus importante d’écriture par IA dans un tel texte, nous vous conseillons d’en tenir compte lors de l’examen du pourcentage indiqué.)
C’est Turnitin qui dit aux instructeurs de discounter le pourcentage quand il apparaît sur ce type de texte. Si votre écriture est structurellement uniforme (paragraphes de longueur similaire, formes de phrases similaires, vocabulaire récurrent), ou si vous avez paraphrasé des sources de près sans ajouter votre propre analyse, le score peut grimper même si chaque mot est le vôtre.
Ce n’est pas un bug. C’est le classificateur qui lit l’uniformité comme un signal. Les motifs statistiques qui semblent réguliers peuvent correspondre à ce que le modèle a appris du texte d’IA, même lorsque le texte a été produit par un humain qui se trouvait écrire dans un registre cohérent. À l’échelle institutionnelle, cela s’accumule, ce qui est l’arithmétique de ce que signifie un taux de faux positifs de 1 % lorsqu’une université soumet 75 000 travaux.
Le score de 100 % est un agrégat, pas un verdict
Pour comprendre pourquoi un seul segment peut produire 100 %, il est utile de voir comment la notation fonctionne de bout en bout. La FAQ de Turnitin décrit le pipeline :
« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score. » (Lorsqu’un travail est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections chevauchantes pour l’analyse de prédiction. Chaque segment est classifié par le modèle de détection d’IA et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit vraisemblablement humain ou généré par IA. Chaque phrase qualifiée au sein de ces segments hérite du score du segment. Étant donné que les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul score. Ces scores de phrases sont ensuite agrégés et utilisés pour calculer le score global d’écriture d’IA du document.)
Dans un document plus long, il y a de nombreux segments chevauchants. Une phrase près de la limite d’un segment apparaît aussi dans le suivant. Les scores des deux segments sont regroupés. Un segment qui se lit comme de l’IA ne domine pas, car les segments voisins tirent le score regroupé dans d’autres directions.
Dans un document court, il n’y a qu’un seul segment. Pas de chevauchement. Pas de regroupement entre fenêtres. La classification du segment unique devient le score du document. Si ce segment est classé avec une probabilité d’IA de 0,95, le score du document est de 100 % (ou ce à quoi l’agrégation le mappe). Le système n’a pas de second avis à consulter.
C’est la raison mécanique pour laquelle les scores de 100 % se concentrent sur les courts documents. Ce n’est pas que les courts documents sont plus susceptibles d’être générés par IA. C’est que l’instrument a moins d’occasions de se corriger.
Ce que Turnitin lui-même dit sur l{APOS}utilisation des scores
La propre documentation de Turnitin est plus prudente sur ses scores que ne tendent à l’être les institutions qui les utilisent. Le guide du AI Writing Report indique :
« Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student. » (Notre modèle de détection d’écriture par IA peut ne pas toujours être précis (il peut mal identifier les textes écrits par des humains, générés par IA et paraphrasés par IA), il ne doit donc pas être utilisé comme seule base pour des actions défavorables envers un étudiant.)
La phrase suivante dans ce même guide :
« It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred. » (Il faut un examen plus approfondi et un jugement humain conjointement à l’application par une organisation de ses politiques académiques spécifiques pour déterminer s’il y a eu faute académique.)
Un guide de révision séparé formule le même point différemment :
« It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy. » (Il n’est pas destiné à fournir des réponses définitives de manière isolée. Plus important que tout outil est l’éducateur qui voit le score et prend des décisions en équilibrant cette information avec sa connaissance personnelle de ses étudiants, de leur travail et de la politique institutionnelle.)
Et la phrase qui suit :
« When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended. » (Lorsque les éducateurs regardent le score d’écriture par IA et l’utilisent comme un point de données unique plutôt que comme une réponse définitive, alors il est utilisé comme prévu.)
Ce sont les mots de Turnitin, pas les nôtres. L’entreprise qui a construit le détecteur dit aux personnes qui l’utilisent qu’un score est un point de données, pas une conclusion. Si votre institution traite 100 % comme une preuve définitive, l’institution utilise l’outil d’une manière que Turnitin dit ne pas devoir être utilisée.
Étapes pratiques si vous avez obtenu 100 % sur votre propre écrit
Vérifiez la longueur du document. Si la soumission faisait quelques centaines de mots, le comportement de tout ou rien décrit en F9 est l’explication la plus probable. Le score reflète les limites de la prédiction sur un seul segment, pas une détermination sur votre processus d’écriture.
Vérifiez si votre texte correspond au profil de faux positifs. Une faible variation structurelle, la répétition littérale et la paraphrase sans nouvelles idées sont les trois caractéristiques que Turnitin lui-même nomme. Si votre texte présente l’une d’entre elles, le conseil officiel est d’en tenir compte lors de la lecture du pourcentage. C’est une citation que vous pouvez apporter à une réunion.
Demandez quand le rapport a été généré. En mai 2023, Turnitin a modifié sa logique de détection pour réduire les faux positifs dans les premières et dernières phrases des documents, qui produisaient des taux de faux positifs plus élevés. La correction est documentée dans ses notes de version. Si le rapport est antérieur à cette correction, il peut refléter un problème qui a depuis été résolu. Les rapports générés avant juillet 2024 peuvent également afficher des scores numériques dans la plage de 1 à 19 que les rapports actuels affichent sous forme d’astérisque. L’essentiel est : les anciens rapports se comportent différemment des nouveaux, et la date compte.
Apportez des preuves de votre processus d’écriture. Historique des versions, fichiers de brouillon avec horodatage, historique de navigation montrant l’activité de recherche. Ce ne sont pas des arguments sur le score. Ils constituent l’« further scrutiny and human judgment » (un examen plus approfondi et le jugement humain) que Turnitin dit devoir accompagner le score.
Citez les propres mots de Turnitin. L’affirmation que le score « should not be used as the sole basis for adverse actions against a student » (ne doit pas être utilisé comme seule base pour des actions défavorables envers un étudiant) apparaît dans trois documents distincts de Turnitin. L’affirmation que le score est « a single data point rather than a definitive response » (un point de données unique plutôt qu’une réponse définitive) est comment Turnitin dit que l’outil doit être utilisé. Ce ne sont pas des opinions. Ce sont les instructions de fonctionnement déclarées par le fabricant. Si vous préparez ce que vous allez dire, signalé, mais écrit par vous-même traite de la préparation de cette réponse.
Ce que nous en retenons
L’outil HumanPen est un outil de réécriture de documents. La décision de conception pertinente ici est que nous réécrivons au niveau du passage, pas au niveau du score. Nous n’essayons pas de déplacer un nombre que nous ne pouvons pas voir. Nous prenons les passages que le AI Writing Report a signalés, changeons le langage réel de ces passages et laissons le reste du document intact. La facturation ne compte que les mots réécrits, et si un nouveau rapport sur le texte réécrit revient encore à 20 % ou au-dessus, la réexécution des passages encore signalés est gratuite.
Nous ne vous dirons pas ce que dira votre prochain rapport. Nous ne faisons pas de prédictions sur les scores de détection. Ce que nous faisons est plus limité que cela : nous réécrivons le langage spécifique dans les passages spécifiques que le rapport a identifiés, et nous préservons la structure, les citations et la mise en forme qui les entourent.
Questions fréquentes
Turnitin peut-il se tromper sur un 100 % d’IA ? Oui. La propre FAQ de Turnitin dit que les documents courts obtiennent des prédictions « tout ou rien » sur un seul segment, et que le texte sans variation structurelle ou avec paraphrase proche est plus sujet aux faux positifs. Le score de 100 % est un agrégat de classifications au niveau des segments, et dans un document court il peut n’y avoir qu’un seul segment.
100 % d’IA signifie-t-il que Turnitin est sûr ? Non. Le pourcentage est la sortie d’un classificateur appliqué à des segments chevauchants, regroupés et agrégés. Dans un document à un seul segment, un segment à forte probabilité devient tout le score. Turnitin dit que le score « should not be used as the sole basis for adverse actions against a student » (ne doit pas être utilisé comme seule base pour des actions défavorables envers un étudiant) et est « a single data point rather than a definitive response. » (un point de données unique plutôt qu’une réponse définitive).
Pourquoi mon court essai a obtenu 100 % mais mon long travail non ? Les documents plus longs ont plus de segments chevauchants, donc les scores sont regroupés entre fenêtres et un seul segment semblable à l’IA est dilué. Les documents courts ont un segment, pas de chevauchement, pas de dilution. C’est une propriété mécanique du pipeline de notation, pas un jugement sur votre écriture.
Et si j’ai utilisé Grammarly ? La FAQ de Turnitin dit que les modifications d’orthographe, de grammaire et de ponctuation de Grammarly « in most cases » (dans la plupart des cas) ne sont pas signalées comme IA. Mais les fonctions génératives de Grammarly (génération de brouillons, paraphrase, résumé) sont une catégorie différente, et le contenu produit par ces fonctions « will likely be flagged as AI-generated. » (sera probablement signalé comme généré par IA).
Puis-je utiliser les propres mots de Turnitin dans ma défense ? Oui. L’affirmation que le score ne doit pas être la seule base pour l’action apparaît dans trois documents de Turnitin. L’affirmation que le score est un point de données unique apparaît dans leur guide de révision. Ce sont les instructions de fonctionnement du fabricant, et elles sont pertinentes pour toute conversation sur ce que signifie un score.
CONTINUER LA LECTURE