Pourquoi les introductions et conclusions sont signalées comme IA (et que faire)

De nombreux étudiants remarquent que leurs sections d'introduction et de conclusion sont les plus souvent signalées comme IA. Ce n'est pas un hasard. Les notes de version de Turnitin de mai 2023 décrivent un schéma où les premières et dernières phrases d'un document présentaient une incidence plus élevée de détections faussement positives. La logique de détection a été modifiée pour réduire ce phénomène, mais le schéma sous-jacent d'une rédaction générique dans les introductions et conclusions persiste.

L'équipe HumanPen

· 4 min de lecture

La réponse courte

Les introductions et conclusions sont plus susceptibles d'être signalées comme IA que les paragraphes du corps du texte. Les notes de version de Turnitin de mai 2023 indiquent : "Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way." (Depuis le lancement, nous avons observé une incidence plus élevée de détections faussement positives dans les premières ou dernières phrases d'un document. Souvent, ces phrases consistent en un contenu d'introduction ou de conclusion rédigé de manière générique.) La logique de détection a été mise à jour pour réduire ces faux positifs, mais le schéma d'une rédaction générique et stéréotypée dans les introductions et conclusions persiste. Si votre introduction commence par une affirmation très générale et que votre conclusion reformule votre thèse dans un langage prévisible, ces passages peuvent produire des profils de probabilité de mots qui se chevauchent avec du texte généré par IA, même après l'amélioration de 2023.

Ce que disent les notes de version

La note de version de mai 2023 décrit le schéma et la réaction :

"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (Depuis le lancement, nous avons observé une incidence plus élevée de détections faussement positives dans les premières ou dernières phrases d'un document. Souvent, ces phrases consistent en un contenu d'introduction ou de conclusion rédigé de manière générique. Par conséquent, nous avons modifié notre logique de détection pour aider à réduire ces faux positifs.)

La phrase suivante : "We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (Nous avons également travaillé à rendre notre détection des limites de segments plus précise, ce qui pourrait dans certains cas rares entraîner un changement de limites par rapport à une version précédente.)

Il s'agissait d'une amélioration de 2023, pas d'une description d'un défaut actuel. La logique de détection a été modifiée pour aider à réduire les faux positifs dans ces positions. Mais la note nous indique quelque chose d'important : les premières et dernières phrases d'un document étaient intrinsèquement plus sujettes aux faux positifs. L'amélioration a réduit le problème. Elle ne l'a pas éliminé.

Pourquoi les introductions et conclusions partagent des schémas IA

La note de version pointe vers "introduction or conclusion content written in a generic way" (un contenu d'introduction ou de conclusion rédigé de manière générique). Le contenu générique est le tissu conjonctif ici. Les introductions commencent souvent par un contexte large : "In recent years, X has become an important topic." (Ces dernières années, X est devenu un sujet important.) Les conclusions reformulent souvent la thèse : "This paper has shown that X leads to Y." (Cet article a démontré que X conduit à Y.) Ces constructions sont prévisibles, stéréotypées et structurellement uniformes. La FAQ de Turnitin liste "content without a lot of structural variation" (un contenu sans beaucoup de variation structurelle) comme caractéristique propice aux faux positifs. Les introductions et conclusions génériques correspondent exactement à ce type de contenu. Les schémas de probabilité de mots dans ces sections ont tendance à être plus prévisibles que dans les paragraphes du corps, où l'argumentation est plus spécifique et le langage plus varié. Vous trouverez une vue d'ensemble de ce phénomène dans pourquoi les essais bien rédigés sont signalés.

Comment le détecteur traite les limites du document

Le pipeline de détection fonctionne en segmentant le texte :

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score." (Lorsqu'un article est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections se chevauchant pour l'analyse de prédiction. Chaque segment est classifié par le modèle de détection IA et se voit attribuer une valeur entre 0 et 1, indiquant la probabilité que le texte soit probablement humain ou généré par IA. Chaque phrase qualifiante au sein de ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un score unique.)

La note de version mentionne également "segment boundaries detection" (détection des limites de segments). Les premières et dernières phrases d'un document se situent en bordure de la structure de segments. Avant l'amélioration de 2023, ces positions présentaient un taux de faux positifs plus élevé. L'amélioration a rendu la détection des limites de segments plus précise, ce qui a aidé. Mais le contenu lui-même, s'il est rédigé de manière générique, peut toujours produire des schémas de probabilité de mots qui déclenchent une classification comme IA. Vous trouverez plus de détails sur ces schémas dans Turnitin utilise-t-il la perplexité et l'éclatement.

Les documents courts amplifient le problème

La FAQ de Turnitin note également :

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents plus courts ne comptant que quelques centaines de mots, la prédiction sera principalement « tout ou rien » car nous faisons une prédiction sur un seul segment sans possibilité de chevauchement.)

La phrase suivante : "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Cela signifie que certains textes mêlant contenu généré par IA et contenu original pourraient être signalés comme entièrement générés par IA.)

Dans un essai court, l'introduction et la conclusion peuvent représenter une grande proportion du texte total. Si les deux sont signalées, le comportement tout-ou-rien des documents courts signifie que le document entier pourrait être classifié comme généré par IA. Il s'agit d'un résultat extrême, mais cela aide à expliquer pourquoi un essai court avec une introduction et une conclusion génériques peut recevoir un score étonnamment élevé. Pourquoi Turnitin indique que votre travail est 100 % IA traite ce cas extrême de bout en bout.

Que faire à ce sujet

Pour résumer ce que nous avons couvert :

  • Les notes de version de Turnitin de mai 2023 décrivent un schéma de faux positifs plus élevés dans les premières et dernières phrases des documents.
  • La logique de détection a été mise à jour en 2023 pour réduire ce phénomène, mais le schéma sous-jacent d'une rédaction générique dans les introductions et conclusions persiste.
  • Les introductions et conclusions génériques partagent la caractéristique de « faible variation structurelle » que la FAQ liste comme propice aux faux positifs.
  • Les documents courts amplifient le problème car l'introduction et la conclusion représentent une plus grande proportion du texte total.
  • Rendre votre introduction et votre conclusion plus spécifiques, moins stéréotypées et plus variées dans leur structure peut aider à résoudre le schéma.

Si vous avez un rapport Turnitin montrant quels passages ont été signalés, importez le rapport et travaillez sur ces passages spécifiques. Les passages éligibles peuvent être réexécutés sans frais.