Revue systématique et détection IA : pourquoi la section méthodologique est souvent signalée
Les revues systématiques suivent des modèles méthodologiques rigides. La section méthodologie répète les mêmes verbes et structures de phrases d'une étude à l'autre, ce qui correspond aux motifs de faux positifs que décrit Turnitin. Le détecteur ne mesure pas le burstiness ou le perplexity. C'est un classifieur de probabilité lexicale. Voici ce que dit la documentation sur la façon dont le score est calculé et comment l'interpréter.
L'équipe HumanPen
· 6 min de lecture
Pourquoi les sections méthodologiques correspondent aux motifs de faux positifs
Les revues systématiques exigent une section méthodologique standardisée. Vous décrivez les bases de données consultées, les chaînes de recherche, les critères d'inclusion et d'exclusion, ainsi que le processus de sélection. Le langage est nécessairement répétitif car la checklist PRISMA impose des éléments de rapport spécifiques. La documentation de Turnitin décrit les types de texte qui produisent des faux positifs :
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Parfois, les faux positifs – qui signalent à tort un texte écrit par un humain comme étant généré par IA – peuvent inclure du contenu sans grande variation structurelle, des textes qui se répètent littéralement, ou des textes paraphrasés sans développer de nouvelles idées)
La phrase suivante : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur montre une plus grande quantité d'écriture IA dans ce type de texte, nous vous conseillons d'en tenir compte lorsque vous examinez le pourcentage indiqué)
Une section méthodologique coche les trois critères, ce qui explique pourquoi « Turnitin a signalé toute ma section méthodologie » (Turnitin a signalé toute ma section méthodologique) est une plainte si courante. La variation structurelle est faible car chaque revue systématique rapporte les mêmes étapes. La formulation se répète (« we searched » / nous avons recherché, « we identified » / nous avons identifié, « we screened » / nous avons filtré). Le texte est paraphrasé à partir de descriptions de protocole sans développer de nouvelles idées. La documentation indique de prendre le pourcentage en considération lorsque le texte correspond à ces motifs, pas de l'accepter comme définitif.
Comment le détecteur calcule le score
Le pipeline de détection découpe le texte qualifiable en segments et attribue un score à chacun :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu'un document est soumis à Turnitin, les phrases de la soumission sont extraites et découpées en sections qui se chevauchent pour l'analyse de prédiction. Chaque segment est classifié par le modèle de détection IA et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit probablement humain ou généré par IA. Chaque phrase qualifiable dans ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul score. Ces scores de phrases sont davantage agrégés et utilisés pour calculer le score global d'écriture IA du document)
Dans une revue systématique, les motifs répétitifs de la section méthodologique peuvent produire des scores de segment élevés sur plusieurs segments qui se chevauchent. Ces scores s'agrègent en un pourcentage élevé au niveau du document. Une section méthodologique de 800 mots peut faire grimper le score d'une revue entière de 5000 mots. Si vous finissez par la réviser, « ce que vous pouvez reformuler et ce qui doit rester exact » (ce que vous pouvez reformuler et ce qui doit rester exact) indique les lignes que vous ne pouvez pas modifier.
Ce que le détecteur mesure réellement
Le détecteur n'évalue pas le burstiness, le perplexity ou d'autres métriques nommées, une affirmation examinée dans « Turnitin utilise-t-il la perplexité et la burstiness pour détecter l'IA » (Turnitin utilise-t-il le perplexity et le burstiness pour détecter l'IA) :
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Notre modèle n'est pas explicitement programmé pour évaluer des signaux spécifiques tels que le « burstiness », le « perplexity » ou d'autres métriques individuelles parfois évoquées dans les discussions publiques)
La phrase suivante : « Instead, it learns statistical patterns from our training data. » (Au lieu de cela, il apprend des motifs statistiques à partir de nos données d'entraînement)
La même source explique ce que le modèle fait réellement :
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nos classifieurs sont entraînés à détecter ces différences de probabilité lexicale et sont compétents pour reconnaître les séquences de probabilité de mots particulières aux rédacteurs humains)
Le détecteur évalue les séquences de probabilité lexicale. Il vérifie si les mots d'un segment correspondent aux motifs appris à partir de l'écriture humaine ou du texte généré par IA. Dans une section méthodologique, la séquence de mots est dictée par le modèle de rapport. Des phrases comme « we searched the following databases » (nous avons recherché dans les bases de données suivantes) et « studies were included if » (les études étaient incluses si) apparaissent dans des milliers d'articles. Ces séquences peuvent s'aligner plus étroitement avec les motifs statistiques des données d'entraînement qu'avec les choix de mots d'un rédacteur individuel. Cet alignement peut produire un score de probabilité élevé sans implication d'IA.
Ce qui est considéré comme texte analysé
Le détecteur ne traite que le « texte qualifiant » (texte qualifiable) :
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Ce texte qualifiable comprend uniquement des phrases en prose, ce qui signifie que nous analysons seulement des blocs de texte rédigés dans des phrases grammaticalement standards et n'incluant pas d'autres types d'écriture tels que des listes, des puces – structures courtes non phrastiques – ou d'autres structures non phrastiques)
La phrase suivante : « This percentage is not necessarily the percentage of the entire submission. » (Ce pourcentage n'est pas nécessairement le pourcentage de l'ensemble de la soumission)
Les revues systématiques contiennent des tableaux (diagrammes de flux PRISMA, tableaux d'extraction) et des listes structurées (critères d'inclusion et d'exclusion). Ce ne sont pas de la prose qualifiable. Le pourcentage ne couvre que les phrases en prose. Si votre section résultats comporte principalement des tableaux, le pourcentage est pondéré vers les sections riches en prose comme la méthodologie. La documentation note également :
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (Le modèle ne détecte pas de manière fiable le texte généré par IA sous forme de non-prose ou de code, et ne détecte pas non plus les écritures courtes/non conventionnelles telles que les puces – structures courtes non phrastiques)
La phrase suivante : « This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. » (Cela signifie qu'un document contenant plusieurs types d'écriture différents entraînerait une disparité entre le pourcentage et les passages surlignés)
Une revue systématique est un document multi-format. La disparité entre le pourcentage et les passages surlignés est un comportement attendu.
Segments courts
Les sections méthodologiques sont parfois découpées en courtes sous-sections. Une sous-section sur la stratégie de recherche peut ne faire que 200 mots. La documentation met en garde :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents plus courts qui ne contiennent que quelques centaines de mots, la prédiction sera surtout du « tout ou rien » car nous prédisons sur un seul segment sans possibilité de chevauchement)
La phrase suivante : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie que certains textes qui sont un mélange de contenu généré par IA et de contenu original pourraient être signalés comme entièrement générés par IA)
Pour une courte sous-section, le détecteur peut prédire sur un seul segment sans chevauchement pour modérer le score. Une sous-section écrite par un humain mais suivant un modèle peut recevoir un score élevé de type tout ou rien.
L'amélioration des limites par Turnitin
En 2023, Turnitin a également abordé les faux positifs aux limites des documents :
"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (Depuis le lancement, nous avons observé une incidence plus élevée de détections faussement positives dans les premières ou dernières phrases d'un document. Souvent, ces phrases consistent en un contenu d'introduction ou de conclusion rédigé de manière générique. En conséquence, nous avons modifié notre logique de détection pour aider à réduire ces faux positifs)
La phrase suivante : « We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version. » (Nous avons également travaillé à rendre notre détection des limites de segments plus précise, ce qui pourrait conduire dans certains cas rares à un changement de limites par rapport à une version précédente)
Il s'agissait d'une amélioration de 2023. Les introductions et conclusions de revues systématiques suivent des modèles (contexte, lacune, objectif, résumé des résultats). Le changement de logique a abordé ce motif.
Ne pas traiter le score comme seule preuve
La documentation de Turnitin est explicite sur les limites :
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Notre modèle de détection d'écriture IA peut ne pas toujours être exact – il peut identifier à tort du texte écrit par un humain, généré par IA ou paraphrasé par IA – il ne devrait donc pas être utilisé comme seule base pour des mesures défavorables contre un étudiant)
La phrase suivante : « It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred. » (Il faut un examen plus approfondi et un jugement humain, conjugués à l'application par un établissement de ses politiques académiques spécifiques, pour déterminer s'il y a eu inconduite académique)
Une revue systématique avec un score IA élevé sur sa section méthodologique n'est pas une preuve d'inconduite. La section méthodologique correspond aux motifs de faux positifs. Le détecteur est un classifieur de probabilité lexicale. Le score nécessite un jugement humain et une politique institutionnelle. « Ce que votre instructeur doit faire lorsque votre pourcentage IA est élevé » (Ce que votre instructeur doit faire lorsque votre pourcentage IA est élevé) correspond aux directives selon lesquelles l'évaluateur travaille.
Ce que cela signifie pour vous
Pour résumer :
- Les sections méthodologiques correspondent aux motifs de faux positifs : faible variation structurelle, formulation répétitive et texte paraphrasé sans nouvelles idées.
- Le détecteur est un classifieur de probabilité lexicale, pas un évaluateur de burstiness ou de perplexity.
- Seule la prose qualifiable est analysée. Les tableaux, listes et puces sont exclus.
- Les courtes sous-sections méthodologiques font face à un problème de notation tout ou rien.
- En 2023, Turnitin a amélioré la logique de détection pour réduire les faux positifs aux limites des documents.
- Le score ne doit pas être utilisé comme seule base pour des mesures défavorables. Il nécessite un jugement humain.
Si vous recevez un rapport AI Turnitin sur une revue systématique et souhaitez traiter les passages signalés, « import the report » (importez le rapport) et travaillez dessus. Les passages éligibles peuvent être réexécutés sans frais.
CONTINUER LA LECTURE