Turnitin a signalé toute ma section méthodologie
La vraie question n'est pas de savoir pourquoi le modèle pense que vous avez triché au chapitre trois. Elle est de comprendre pourquoi le surlignage forme un seul bloc continu, et à quoi correspond exactement ce pourcentage.
L'équipe HumanPen
· 13 min de lecture
La réponse courte
Parce que le score n'atteint pas vos phrases une par une. Turnitin explique lui-même qu'une soumission est découpée en segments qui se chevauchent, chacun reçoit une probabilité, et chaque phrase qualifiée hérite du score des segments où elle se trouve. Soumettez un texte de deux mille mots qui garde le même registre, les mêmes tournures et le même vocabulaire du début à la fin, et les segments voisins n'ont guère de raison de diverger. Le surlignage apparaît alors comme une bande plutôt que comme des points dispersés. La section méthodes et matériels est justement celle qui s'écrit ainsi par nature, et la description officielle des faux positifs de Turnitin cite deux caractéristiques que ce genre est censé avoir par convention. Cela ne veut pas dire que le chiffre est faux. Cela veut dire qu'un mur rouge couvrant une section ne représente pas quarante verdicts indépendants sur quarante phrases, et le lire comme tel vous conduirait à corriger la mauvaise chose.
Pourquoi cela apparaît comme un bloc
Ce que les gens décrivent est toujours la même chose. La revue de littérature est propre. La discussion est propre. Puis le chapitre des méthodes s'ouvre et le surlignage commence dès la première phrase sous le titre pour ne s'arrêter qu'à la fin du chapitre. On dirait moins un modèle qui repère des passages suspects qu'un modèle qui trouve un chapitre suspect, et c'est précisément ce qui rend la chose si troublante.
Turnitin publie la façon dont un score est attribué à une phrase, et il vaut la peine de lire les deux phrases centrales de cette description plutôt que son résumé :
"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score." (Chaque phrase admissible dans ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul score.)
Ainsi, l'unité classifiée est une fenêtre de texte, pas une phrase. Une phrase est notée par le voisinage dans lequel elle s'inscrit. Ce qu'on peut en déduire, c'est notre interprétation, pas quelque chose que Turnitin publie : lorsque des phrases consécutives partagent des fenêtres et que ces fenêtres se ressemblent, les scores qu'elles produisent ont peu de raison de diverger, et le surlignage qui en découle sort contigu. Une bande est le rendu attendu d'une étendue uniforme. Ce n'est pas un décompte de constats indépendants.
Cela a une conséquence pratique : la première phrase surlignée de votre chapitre des méthodes n'est pas forcément là où quoi que ce soit a commencé, car un segment qui enjambe le titre contient le dernier paragraphe de ce qui le précédait. Les gens passent beaucoup de temps à fixer la première phrase signalée pour comprendre ce qui ne va pas spécifiquement dans celle-là. Selon la description officielle, il se peut qu'il n'y ait rien de spécial à lui reprocher.
Cela signifie aussi que le calcul intuitif n'existe pas. On ne peut pas diviser une bande par ses phrases pour obtenir un coût par phrase, ni soustraire une phrase pour prédire ce qui change. On a décortiqué cette idée face aux trois versions les plus répandues dans si je réécris une phrase signalée, le score baisse-t-il.
La limite honnête de tout ceci : Turnitin a publié l'architecture du pipeline, pas la fonction de regroupement, ni l'agrégation, ni la longueur des segments. Tout ce qui précède est ce que la description officielle implique sur la distribution. Rien de tout cela ne permet à qui que ce soit de prédire un chiffre.
Quelle partie de votre chapitre de méthodes est réellement évaluée
La deuxième chose à établir est le dénominateur, car deux chapitres de méthodes contenant les mêmes informations peuvent présenter au modèle des quantités de texte complètement différentes. Turnitin n'analyse que ce qu'il appelle le texte admissible :
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." La phrase qui suit est celle qui importe ici : "This percentage is not necessarily the percentage of the entire submission." (Ce texte admissible ne comprend que des phrases en prose, c'est-à-dire que nous analysons uniquement les blocs de texte écrits dans des phrases grammaticalement standard et n'incluant pas d'autres types d'écriture tels que des listes, des puces (structures courtes non phrastiques) ou d'autres structures non phrastiques. Le pourcentage n'est pas nécessairement le pourcentage de l'ensemble de la soumission.)
Regardez maintenant comment votre discipline écrit cette section. Un protocole de laboratoire de biologie se présente sous forme d'étapes numérotées, d'un tableau des réactifs, d'une liste d'instruments et d'un bloc de réglages. Un chapitre de méthodes en psychologie ou en éducation se présente sous forme de paragraphes continus : participants, matériel, procédure, analyse, chacun étant une suite de phrases complètes. Pour l'analyse, ce sont deux soumissions différentes, et c'est la seconde qui revient entièrement signalée.
| Comment la section est présentée | Ce qui entre dans le texte admissible | À quoi correspond alors le pourcentage |
|---|---|---|
| Étapes numérotées, tableaux de paramètres, listes d'équipements, équations | Peu, car la plupart ne sont pas des phrases grammaticalement standard | Surtout la prose ailleurs dans le fichier, pas cette section |
| Paragraphes continus décrivant les participants, le matériel et la procédure | Presque tout | Un échantillon composé presque entièrement de prose procédurale conventionnelle |
| Prose de longue forme dans une cellule de tableau | Elle est traitée. Une note de publication du 9 août 2023 a annoncé que le modèle pouvait gérer du texte en prose de longue forme dans les tableaux, et a précisé que les soumissions existantes doivent être resoumises pour être retraitées | La même chose que les paragraphes ordinaires, ce qui surprend ceux qui ont déplacé du texte dans un tableau pour d'autres raisons |
Il y a une conséquence contre-intuitive dans la ligne centrale. Être exclu du texte admissible n'est pas un avantage. Cela supprime les étapes numérotées et les tableaux de valeurs, qui n'auraient de toute façon pas ressemblé à de la prose générée, et ne laisse que la partie la plus conventionnelle de votre écriture. Plus l'échantillon admissible est restreint, plus le chiffre évalue spécifiquement vos paragraphes procéduraux.
Une exclusion fonctionne dans l'autre sens et vaut la peine d'être connue car elle élimine une fausse alerte courante : la même note de publication de 2023 indique que le surlignage dans une bibliographie était un bug, que les bibliographies sont désormais exclues lors du traitement de l'AI writing report, et que les soumissions avec des sections de références surlignées doivent être resoumises pour être retraitées. Si vous consultez un ancien rapport avec la liste des références illuminée, c'est cela que vous observez.
L'écart entre le chiffre et la quantité de surlignage sur la page découle de tout cela, et Turnitin l'affirme directement plutôt que de le laisser deviner. Comment lire un rapport d'écriture IA Turnitin explique cet écart ; Turnitin peut-il vérifier une thèse complète couvre ce qui se passe aux limites de longueur, là où se situent les soumissions au niveau des chapitres.
Le genre correspond à la propre liste du fournisseur
Turnitin publie un compte rendu de ce que ses faux positifs ont tendance à avoir en commun. Textuellement :
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Parfois, les faux positifs (signalant incorrectement du texte écrit par un humain comme généré par l'IA) peuvent inclure du contenu sans beaucoup de variation structurelle, du texte qui se répète littéralement, ou du texte qui a été paraphrasé sans développer de nouvelles idées.)
La phrase qui suit ne vous est pas du tout adressée :
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si notre indicateur affiche une quantité plus élevée d'écriture IA dans ce type de texte, nous vous conseillons d'en tenir compte lors de l'examen du pourcentage indiqué.)
Deux des trois éléments de cette liste décrivent des choses qu'une section méthodes est censée faire. La variation structurelle, c'est ce qu'une liste de vérification cherche à éliminer : le même cadre pour chaque mesure, le même ordre de sous-sections, la même tournure pour chaque instrument afin que deux procédures décrites identiquement puissent être comparées. La répétition littérale, c'est la façon de signaler que deux conditions ont réellement été traitées de la même manière. C'est la seule section d'une thèse où écrire onze fois la même forme de phrase est correct, et c'est aussi la section où le faire coûte cher à défaire. Ce qu'on peut et ne peut pas reformuler en toute sécurité là-bas est un problème séparé avec ses propres règles, dans ce qu'on peut reformuler dans les méthodes et résultats, et la question plus large de savoir s'il faut ajuster son écriture se trouve dans faut-il changer sa façon d'écrire.
Si vous avez vérifié la section seule, vous avez mesuré autre chose
Une grande partie de la panique dans cette situation vient d'un auto-contrôle plutôt que d'un rapport institutionnel : le chapitre est collé quelque part, ou soumis seul à un devoir de vérification de brouillon, et revient avec un chiffre que personne ne veut voir.
Turnitin décrit que les soumissions courtes se comportent différemment dans leur nature, pas seulement dans leur degré :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." Et la phrase qui suit : "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Dans les documents plus courts de quelques centaines de mots, la prédiction sera surtout « tout ou rien » car nous prédisons sur un seul segment sans possibilité de chevauchement. Cela signifie que du texte mélangeant contenu généré par l'IA et contenu original peut être signalé comme entièrement généré par l'IA.)
Un chapitre de méthodes soumis seul est candidat pour cette zone, et plus encore que ne le suggère son nombre de mots, car les étapes numérotées et les tableaux sortent d'abord du dénominateur. Il y a aussi un seuil minimum : un AI writing report nécessite au moins 300 mots de prose en format longue forme, donc une section de méthodes courte seule peut ne produire aucun rapport plutôt qu'un faible. En dessous du seuil d'affichage, il n'y a rien à lire : les résultats supérieurs à 0 % et inférieurs à 20 % sont montrés comme un astérisque sans chiffre ni surlignages, ce qui signifie qu'une vraie amélioration et aucune amélioration paraissent identiques depuis votre point de vue.
Ce qu'une section rouge ne tranche pas
On est tenté de prendre le mécanisme ci-dessus comme un constat en sa faveur. Ce n'en est pas un. Tout sur cette page explique ce que le chiffre mesure. Rien de tout cela n'est une preuve sur qui a écrit votre chapitre, et cela va dans les deux sens : une bande sur votre section méthodes n'est une preuve de rien, pas plus qu'une explication de pourquoi les bandes se forment.
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." La phrase suivante est celle qui porte le poids : "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Notre modèle de détection de l'écriture IA peut ne pas toujours être précis (il peut identifier incorrectement des textes écrits par un humain, générés par l'IA ou paraphrasés par l'IA), il ne doit donc pas être utilisé comme seul fondement pour des mesures défavorables contre un étudiant. Il faut un examen plus approfondi et un jugement humain conjugués à l'application par l'établissement de ses politiques académiques spécifiques pour déterminer s'il y a eu inconduite académique.)
- Une bande est une distribution, pas un décompte. Elle vous indique que les scores du modèle étaient uniformes sur cette étendue. Elle ne vous dit pas à quel point chacun était sûr.
- Le pourcentage porte sur la prose admissible, il n'est donc pas comparable entre deux chapitres présentés différemment, et additionner les pourcentages de chapitres donne un chiffre qui ne correspond à rien.
- Le rapport est généré par un système dont le fournisseur lui-même dit qu'il peut identifier incorrectement du texte, ce qui est une raison pour qu'une personne regarde, pas une raison d'écarter le résultat.
- Rien de tout cela n'est vérifiable par vous dans la plupart des configurations. L'indicateur et le rapport ne sont pas visibles pour les étudiants, bien qu'un instructeur puisse télécharger le rapport en PDF et le partager.
N'emportez pas cet article dans une réunion comme argument. Expliquer un classifieur à quelqu'un qui a déjà lu les mêmes pages d'aide a l'air d'une préparation plutôt que d'une réponse, et fait basculer la conversation sur un terrain où vous argumentez à propos d'un modèle au lieu de parler de votre travail. Ce qui compte vraiment, c'est la provenance : brouillons, protocole, fichier d'analyse, dates. Signalé, mais vous l'avez écrit couvre quelles preuves rassembler, la conversation après un signal IA couvre le déroulement procédural de la réunion, et l'historique de version comme preuve couvre où se trouve l'enregistrement si vous n'y avez pas pensé avant.
Si la section doit être révisée de toute façon
Parfois la décision est déjà prise, par un superviseur ou par vous, et la question devient de le faire sans rien casser. La section méthodes est la pire section d'une thèse à reformuler à la légère. L'ordre, le timing, la dose, l'équipement, les réglages, les règles de décision, la population d'analyse et les exclusions sont le contenu, et une phrase fluide qui en laisse tomber un discrètement est un vrai défaut là où une phrase raide ne l'était pas.
Le coût que les gens sous-estiment n'est pas la réécriture. C'est la revérification. Chaque paragraphe touché est un paragraphe que vous devez maintenant relire contre le protocole, le code d'analyse et les tableaux. Un plan qui touche tout un chapitre a créé un travail de relecture de la taille d'un chapitre, c'est pourquoi l'étendue du changement compte plus que la méthode utilisée pour le faire.
C'est autour de cela que HumanPen est construit. Importez l'AI Writing Report Turnitin ou iThenticate pour cette soumission et les passages qu'il marque deviennent le périmètre : seul ce texte est réécrit, tout le reste reste figé, et la propre description du site concernant la règle de paragraphe est que "a paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm". Les formules, figures et structures de tableaux ne font pas partie de la réécriture de texte, ce qui compte plus dans cette section que partout ailleurs dans le document. La facturation compte les mots réellement réécrits plutôt que le fichier que vous avez téléchargé. Les résultats éligibles peuvent continuer à réduire l'IA gratuitement.
Rien de tout cela n'est une prédiction. Le modèle de Turnitin change, les règles d'affichage ont changé avant, et nous n'avons aucun moyen de vous dire ce que votre prochain rapport dira. Les affirmations ci-dessus portent sur quels mots sont touchés et quels mots sont facturés, ce qui sont les deux choses que nous pouvons réellement contrôler.
Questions fréquemment posées
Pourquoi toute ma section méthodologie est surlignée alors que j'ai écrit chaque mot ? Parce que l'unité de classification est un segment qui se chevauche, pas une phrase, et que les phrases héritent et regroupent les scores des segments qui les contiennent. Une longue étendue écrite dans un seul registre laisse aux segments adjacents peu de quoi se différencier, donc le résultat tend à être contigu. C'est une description de la façon dont une bande se forme, pas une constatation que votre bande particulière est un faux positif.
Un bloc solide de surlignage signifie-t-il que chaque phrase a été jugée comme IA ? Non, et la description officielle est la raison. Une phrase porte un score hérité des segments où elle se trouve, possiblement plus d'un, regroupés. Lire une bande comme une liste de verdicts individuels est l'erreur qui mène à des plans de modification phrase par phrase.
Ma section de méthodes est surtout des étapes numérotées et un tableau de paramètres. Pourquoi le pourcentage est-il quand même élevé ? Cela ne fait peut-être même pas partie de l'analyse. Turnitin analyse le texte admissible, c'est-à-dire la prose écrite en phrases grammaticalement standard, et indique que le pourcentage n'est pas nécessairement le pourcentage de l'ensemble de la soumission. Exclure les étapes et les tableaux laisse les paragraphes conventionnels comme échantillon que le chiffre décrit.
Dois-je ajouter de la variété à ma section méthodes pour qu'elle paraisse moins répétitive ? C'est d'abord une question sur les normes de rapport de votre discipline avant d'être une question sur un détecteur, et la répétition dans une section méthodes remplit généralement une fonction. Le conseil du fournisseur lui-même concernant du texte avec ces propriétés s'adresse à la personne qui lit le rapport, pas à celle qui l'a écrit.
J'ai fait passer le chapitre seul dans un vérificateur et obtenu un chiffre très élevé. Est-ce le chiffre que voit mon superviseur ? Pas nécessairement, car c'est une soumission différente. Turnitin dit que les prédictions sur des documents de quelques centaines de mots sortent surtout tout ou rien, puisqu'il n'y a qu'un seul segment sans chevauchement, et que du contenu mixte dans cette situation peut être signalé comme entièrement généré par l'IA. Un chapitre est aussi un dénominateur différent d'un fichier complet.
Puis-je citer la liste des faux positifs du fournisseur comme défense ? C'est une déclaration publiée sur les modes d'erreur de l'outil et elle vise celui qui lit le pourcentage, donc c'est légitime de savoir qu'elle existe. Ce n'est pas une preuve sur votre document, et amener un mécanisme dans une conversation sur l'inconduite comme argument tend à jouer contre vous. Apportez les brouillons et le protocole.