Comment réduire le taux d'IA dans un article en anglais ? Comprendre ce que vérifie Turnitin
Pour faire baisser votre taux d'IA, il faut d'abord savoir ce que le détecteur analyse. Turnitin n'examine que les phrases en prose standard. Son modèle classe les textes selon la probabilité des mots, pas selon la burstiness ou la perplexité. Les textes structurellement uniformes ou répétitifs sont plus susceptibles d'être faussement signalés.
L'équipe HumanPen
· 4 min de lecture
Quels textes sont faussement signalés
Avant de commencer la réécriture, comprenez ceci : certains textes signalés ne sont pas générés par l'IA, mais leurs caractéristiques déclenchent des faux positifs. La FAQ de Turnitin indique :
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Parfois, les faux positifs – c'est-à-dire quand un texte écrit par un humain est incorrectement signalé comme généré par l'IA – peuvent concerner des contenus sans grande variation structurelle, des textes qui se répètent littéralement, ou des textes paraphrasés sans développer de nouvelles idées.)
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si notre indicateur affiche un taux d'écriture IA élevé dans ce type de texte, nous vous conseillons d'en tenir compte lorsque vous examinez le pourcentage indiqué.)
Autrement dit, si votre écriture manque de variation structurelle, contient des répétitions littérales ou a été paraphrasée sans apporter de nouvelles idées, le détecteur peut afficher un pourcentage d'IA gonflé. Cela ne signifie pas que vous avez utilisé l'IA. Cela signifie que ces caractéristiques se rapprochent des modèles statistiques propres aux textes générés par l'IA.
Cette phrase de la FAQ vous donne trois éléments à vérifier dans votre propre brouillon, et tous trois sont des propriétés du paragraphe fini : la structure varie-t-elle, y a-t-il des répétitions, et chaque paragraphe fait-il avancer l'argumentation par rapport au précédent ? En revanche, la phrase n'indique rien sur les edits utilisées pour y parvenir. Les edits qui changent réellement les statistiques, c'est notre tentative de traiter cet aspect manuellement.
Turnitin n'analyse que les phrases en prose
Tout ce qui se trouve dans votre article n'est pas analysé. La FAQ précise :
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Ce texte qualificatif inclut uniquement les phrases en prose, c'est-à-dire que nous analysons seulement les blocs de texte rédigés en phrases grammaticalement standards et n'incluons pas d'autres types d'écriture tels que les listes, les puces (structures courtes non rédigées en phrases) ou autres structures non phrastiques.)
Les listes, puces et structures courtes non phrastiques échappent au champ d'analyse. Si votre rapport affiche un pourcentage, ce pourcentage est calculé uniquement à partir des phrases en prose, et non sur l'ensemble du document.
Cela indique aussi une stratégie : si vos arguments se trouvent dans des paragraphes en prose, ce sont ces paragraphes que le détecteur examine. Lors de la réécriture, concentrez vos efforts sur ces paragraphes. Inutile de vous soucier de la détection IA pour les listes et les tableaux. Savoir quelles phrases à l'intérieur de ces paragraphes doivent rester inchangées est une autre question : ce que vous pouvez reformuler et ce qui doit rester exact.
Comment le classificateur attribue les scores
Comprendre comment le détecteur attribue les scores aide à expliquer pourquoi certaines révisions fonctionnent et d'autres non. Turnitin décrit le processus ainsi :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Lorsqu'un article est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections qui se chevauchent pour l'analyse de prédiction. Chaque segment est classifié par le modèle de détection d'IA et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit d'origine humaine ou généré par l'IA.)
Chaque segment reçoit une valeur entre 0 et 1, représentant la probabilité qu'il soit généré par l'IA. Mais le modèle ne fonctionne pas selon les métriques que vous voyez souvent dans les articles de blog :
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Notre modèle n'est pas explicitement programmé pour évaluer des signaux spécifiques tels que la 'burstiness', la 'perplexity' ou d'autres métriques individuelles parfois évoquées dans les discussions publiques.)
"Instead, it learns statistical patterns from our training data." (Au lieu de cela, il apprend des modèles statistiques à partir de nos données d'entraînement.)
Le signal principal est la probabilité des mots :
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nos classificateurs sont entraînés à détecter ces différences de probabilité des mots et sont compétents pour reconnaître les séquences de probabilité de mots propres aux auteurs humains.)
Pour revenir aux faux positifs : les textes structurellement uniformes et répétitifs sont signalés non pas parce qu'ils « ressemblent à de l'IA » d'une manière superficielle, mais parce que leurs séquences de probabilité de mots ressemblent à celles des textes générés par l'IA. L'écriture humaine tend à avoir plus d'imprévisibilité dans le choix des mots, tandis que les textes générés par l'IA ont tendance à sélectionner des mots à haute probabilité. Ce que mesurent les détecteurs d'IA au-delà de la perplexity et de la burstiness en donne une explication plus détaillée.
Conseils pratiques pour réduire votre taux d'IA
En regroupant ce qui précède :
- Révisez les paragraphes en prose, pas les listes. Le détecteur n'analyse que les phrases en prose standard. Les listes, puces et structures courtes dans les tableaux échappent au champ d'analyse.
- Augmentez la variation structurelle. Le manque de variation structurelle est une cause fréquente de faux positifs. Si tous vos paragraphes ont une longueur et une structure de phrases similaires, essayez de varier la longueur des phrases et les modèles syntaxiques.
- Réduisez les répétitions. La répétition littérale fait augmenter le score IA. Si deux paragraphes disent la même chose, fusionnez-les ou faites en sorte que le second fasse vraiment avancer l'argumentation.
- Développez l'idée, pas seulement la formulation. Ce que la FAQ nomme, c'est la paraphrase « sans développer de nouvelles idées », donc le test implicite est de savoir si le paragraphe apporte maintenant quelque chose qu'il n'apportait pas avant. Elle ne dit rien sur les edits que vous faites en cours de route, et choisir un mot plus clair fait partie normale de la révision de n'importe quel texte.
- Comprenez l'unité de notation. Chaque segment est noté individuellement, donc un paragraphe signalé ne signifie pas que tout l'article est généré par l'IA. Le rapport vous donne des probabilités par segment, pas un jugement global unique.
Ce que cela signifie pour vous
Réduire votre taux d'IA ne consiste pas à trouver le bon outil ou le bon prompt. Cela commence par comprendre ce que le détecteur examine. Turnitin n'analyse que les phrases en prose. Les listes et structures courtes échappent au champ d'analyse. Le modèle classe selon les séquences de probabilité de mots, pas selon la burstiness ou la perplexity, et chaque segment est noté indépendamment. Les textes avec peu de variation structurelle, des répétitions littérales ou des paraphrases qui ne développent pas de nouvelles idées sont plus susceptibles d'être faussement signalés.
Après avoir obtenu votre rapport, regardez quels paragraphes en prose sont signalés et travaillez dessus : variez la structure, réduisez les répétitions et développez des arguments substantiels. Inutile de toucher aux listes, tableaux ou citations. Garder intact le texte qui n'a pas besoin d'être retouché, c'est toute l'idée derrière la réécriture uniquement des paragraphes signalés par un rapport Turnitin.
CONTINUER LA LECTURE