Pourquoi les instructions dans les prompts ne font pas baisser votre taux AI de façon fiable
Rechercher des « instructions pour faire baisser le taux AI » part du principe que le bon prompt peut modifier les statistiques que lit le détecteur. Or un prompt est traité par un modèle d'IA, qui produit du texte avec ses propres motifs de probabilité lexicale. La FAQ de Turnitin indique qu'il peut détecter les textes modifiés par des outils de paraphrase et des contourneurs. Ce mécanisme explique pourquoi les prompts seuls ne constituent pas une solution fiable.
L'équipe HumanPen
· 4 min de lecture
En bref
Un prompt est une instruction textuelle traitée par un modèle d'IA. Quand vous demandez à une IA de « réécrire ceci pour que ça sonne plus humain » ou d'« ajouter de la burstiness et de la perplexity », le modèle génère un nouveau texte à partir de cette instruction. Ce nouveau texte possède lui aussi des motifs de probabilité lexicale, et c'est exactement ce que lit le classificateur de Turnitin. Le détecteur ne voit pas votre prompt. Il ne voit que le résultat. Que le résultat obtienne un score plus faible dépend de la question suivante : son profil de probabilité lexicale diffère-t-il suffisamment de ce que le modèle a appris à associer au texte généré par IA ? Et ça, vous ne pouvez pas le contrôler en écrivant une meilleure instruction. C'est le modèle qui décide des choix de mots, et ce sont ces choix que le détecteur a été entraîné à reconnaître.
Ce que lit le détecteur
La FAQ de Turnitin décrit le processus ainsi :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu'un document est soumis à Turnitin, des phrases sont extraites et découpées en segments chevauchants pour analyse prédictive. Chaque segment est classé par le modèle de détection IA et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit humain ou généré par IA. Chaque phrase éligible dans ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul. Ces scores par phrase sont agrégés pour calculer le score global IA du document.)
Le détecteur analyse les caractéristiques statistiques des séquences de mots dans votre texte. Il ne voit pas le prompt que vous avez utilisé. Il ne sait pas si le texte a été généré, réécrit ou édité par un humain. Il voit les séquences de mots finales et les classe.
Pourquoi « ajuster la burstiness » n'est pas un levier
Un type courant d'instruction demande à l'IA d'« increase burstiness » ou de « vary perplexity ». La FAQ de Turnitin indique :
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Notre modèle n'est pas explicitement programmé pour évaluer des signaux spécifiques tels que la « burstiness », la « perplexity » ou d'autres mesures individuelles parfois mentionnées dans les discussions publiques.)
La phrase suivante précise : « Instead, it learns statistical patterns from our training data. » (Au lieu de cela, il apprend des motifs statistiques à partir de nos données d'entraînement.)
Et sur cette même page, on lit : « Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers. » (Nos classificateurs sont entraînés à détecter ces différences de probabilité lexicale et sont aptes à identifier les séquences de probabilité de mots propres aux rédacteurs humains.)
Le modèle ne calcule pas une métrique appelée « burstiness » pour la comparer à un seuil. Demander à une IA d'« augmenter la burstiness » revient donc à lui demander d'ajuster quelque chose que le détecteur ne mesure peut-être pas de la façon dont vous l'imaginez. Ce que le détecteur mesure, ce sont les motifs de probabilité lexicale appris à partir des données d'entraînement. Qu'une IA générant du texte avec « plus de burstiness » déplace réellement ces motifs dans une direction favorable, vous ne pouvez pas le vérifier en lisant simplement le résultat. La question détaillée est traitée ici : Turnitin utilise-t-il la perplexité et la burstiness ?.
L'IA qui réécrit de l'IA produit du texte détectable
Il y a un problème plus fondamental. Si vous utilisez une IA pour réécrire un texte signalé comme généré par IA, vous produisez du texte qui a été modifié par un outil d'IA. La FAQ de Turnitin indique :
"Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection." (De plus, il peut également identifier les cas où un texte généré par IA a été modifié par des outils de paraphrase IA ou des contourneurs (également appelés humaniseurs) pour éviter la détection.)
Le détecteur ne cherche pas seulement du texte brut généré par IA. Il cherche aussi du texte qui a été traité par un outil de paraphrase ou un contourneur. Quand vous demandez à une IA de réécrire la sortie d'une autre IA, le résultat est fonctionnellement une sortie de paraphraseur. Le détecteur est entraîné à identifier ce type de texte. Ce scénario a fait l'objet d'un article séparé : J'ai paraphrasé du texte IA avec une autre IA et Turnitin l'a quand même signalé.
Quand la réécriture tourne mal
La FAQ de Turnitin liste aussi les textes sujets aux faux positifs :
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Parfois, les faux positifs (qui signalent à tort un texte écrit par un humain comme généré par IA) peuvent inclure du contenu sans grande variation structurelle, un texte qui se répète littéralement, ou un texte qui a été paraphrasé sans développer de nouvelles idées.)
La phrase suivante précise : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur montre une quantité plus élevée d'écriture IA dans ce type de texte, nous vous conseillons d'en tenir compte lorsque vous examinez le pourcentage indiqué.)
C'est le troisième élément qu'il faut remarquer. « Paraphrasé sans développer de nouvelles idées » décrit ce qui se passe quand une IA réécrit un texte en remuant les mots sans ajouter de fond. Le détecteur voit une structure uniforme et des motifs lexicaux qui ressemblent à une paraphrase générée par machine. Ainsi, une réécriture par IA qui ne change que la formulation de surface tout en conservant la même structure peut rapprocher le texte du profil de faux positif, au lieu de l'en éloigner. Consultez Les modifications qui changent vraiment les statistiques pour voir à quoi ressemble l'alternative faite à la main.
Ce qui change réellement le score
Pour résumer ce que nous avons vu :
- Un prompt est traité par un modèle d'IA, qui produit du texte avec ses propres motifs de probabilité lexicale. Le détecteur voit le résultat, pas l'instruction.
- Le modèle ne calcule pas la burstiness ou la perplexity comme des métriques nommées, donc demander à une IA de les « ajuster » peut ne pas affecter ce que lit le détecteur.
- Turnitin détecte activement les textes modifiés par des outils de paraphrase et des contourneurs, ce qui est exactement le résultat d'une IA qui réécrit de l'IA.
- Une réécriture qui se contente de remuer les mots sans ajouter de fond peut rapprocher le texte du profil de faux positif.
- Ce qui change le score, c'est de modifier le profil de probabilité lexicale des passages signalés, pas d'écrire un meilleur prompt.
Si vous avez un rapport Turnitin montrant quels passages ont été signalés, importez-le et travaillez spécifiquement sur ces passages. Les passages éligibles peuvent être re-testés sans frais.
CONTINUER LA LECTURE