Comment lire un test de humaniseur d’IA tiers

Un article qui imprime ses entrées et ses sorties vous donne des preuves vérifiables. Une partie du verdict peut être reconstituée à partir de la page et une autre partie dépend de matériel ou de jugements que la page ne rend pas reproductibles. Savoir distinguer ces deux parties est la compétence utile.

L'équipe HumanPen

· 10 min de lecture

La réponse courte

Lisez un test publié deux fois. La première passe vous dit ce que le critique a conclu. La seconde demande quelles conclusions vous pourriez tirer des preuves imprimées sur la page. Dans l’article de Tom’s Guide d’août 2026, un constat est directement vérifiable : un outil de réécriture a transformé « il y a au moins 15,000 ans » en « il y a des siècles », et les deux phrases sont imprimées. Les jugements sur le rythme et le naturel sont différents. Vous pouvez être d’accord avec eux, mais l’article ne donne aucune règle explicite pour appliquer ce jugement à un autre fichier.

L’article est J’ai testé des humaniseurs d’IA populaires — et ils ont rendu mon écriture bien pire, par Amanda Caswell, publié le 21 août 2026. J’ai vérifié la page le 28 août 2026. Chaque citation attribuée à l’article ci-dessous provient de son article rendu ; les citations dans la section HumanPen sont identifiées comme du texte de la page produit de première partie.

Une chose doit être sur la table avant toute autre. Nous vendons un outil de réécriture de documents, donc nous avons un intérêt dans la façon dont cette catégorie est discutée. Gardez cet intérêt en vue. Le décompte ci-dessous utilise des paragraphes imprimés par une autre publication, ce qui signifie que vous pouvez le refaire sans avoir à nous faire confiance.

Ce que le test était réellement

L’article imprime assez de sa configuration pour qu’un lecteur puisse inspecter un exemple avant-après.

  • Le texte source a été généré : le critique « a demandé à ChatGPT d’écrire un court essai sur la domestication des chiens », et l’introduction de cet essai est imprimée en intégralité. Elle compte 65 mots selon un simple découpage par espaces.
  • Ce paragraphe a été passé dans des outils de réécriture, et trois des versions renvoyées sont imprimées en intégralité : le Humanizer de Grammarly, Rehumanize.io et Ace.ai.
  • Deux détecteurs sont nommés sur la page, GPTZero et Pangram, et un verdict est rapporté : Pangram a marqué la sortie d’Ace.ai comme générée par IA.
  • L’article dit que « plusieurs » outils ont été essayés et que le même problème est apparu « avec des scores de référence et des numéros de version quand j’ai lancé le test sur du contenu plus technique. » Ces exécutions supplémentaires sont décrites mais non imprimées.

Le corpus visible est donc quatre paragraphes : une entrée et trois sorties, tous sur un même sujet et tous en anglais. C’est un petit corps de preuve, mais inspectable. La page ne révèle pas quand les exécutions ont eu lieu, combien de temps elles ont pris, ni les paramètres utilisés.

Trois constats, et ce ne sont pas le même type de chose

L’article rapporte trois problèmes, et ils se comportent complètement différemment dès que vous essayez de les emmener ailleurs.

Ce que l’article rapporteCe que la page vous donne pour le vérifierPouvez-vous le reconstituer vous-même ?
« the rhythm became choppy and unnatural » (le rythme est devenu haché et artificiel)les quatre paragraphes, imprimés en intégralitéPas par une règle fixe fournie sur la page. Vous pouvez lire les quatre et former votre propre opinion, mais l’article ne publie pas de règle de notation pour appliquer ce jugement à un autre document
« the tools changed facts or stripped away important context » (les outils ont modifié des faits ou supprimé un contexte important)la phrase d’entrée et la phrase de sortie, toutes deux littéralesOui. Les deux textes contiennent un changement factuel directement vérifiable
« processing a draft through a humanizer actually increased its probability of being flagged » (le traitement d’un brouillon par un humaniseur a en réalité augmenté sa probabilité d’être signalé)une phrase, plus un verdict de détecteur nommé sur une sortiePartiellement. Le verdict unique est exprimé. Les plusieurs exécutions derrière la phrase ne sont pas imprimées

Les résultats des détecteurs sont en dehors de ce dont traite cet article, et je ne vais rien construire sur la troisième ligne. Elle est incluse pour marquer la frontière des preuves : la page rapporte un verdict nommé, tandis que les autres exécutions derrière la phrase plus large ne sont pas imprimées. Cette phrase ne devrait pas être transformée en un taux.

Reconstituer le seul constat que vous pouvez reconstituer

Voici ma règle, pour que vous puissiez en discuter. Un token numérique est une séquence maximale de chiffres avec des virgules internes optionnelles, trouvée par le motif `\d[\d,]*`. Le corpus est les quatre paragraphes tels qu’imprimés sur cette page et rien d’autre. Un numéral survit si le token identique apparaît quelque part dans la sortie correspondante. Je n’ai pas jugé le sens ; j’ai comparé des chaînes.

Entrée : « des preuves génétiques et archéologiques suggèrent que les chiens descendent d’une ancienne population de loups il y a au moins 15,000 ans. » · Sortie Rehumanize.io : « d’après la génétique et les anciennes découvertes, il semble que les chiens proviennent d’un ancien groupe de loups il y a des siècles. » La propre ligne de l’article : « Nous sommes passés de 15,000 ans à ‘siècles.’ »

Le paragraphe d’entrée contient deux tokens numériques, `15,000` et `30,000`. Trois sorties imprimées offrent six chances à ces deux tokens de revenir, et cinq des six l’ont fait. Celui qui ne l’a pas fait est `15,000` dans la sortie Rehumanize.io, qui est la dérive que l’article nomme. Les deux autres sorties ont renvoyé les deux tokens. Vérification de sensibilité sur les mêmes paragraphes extraits : un comptage insensible à la casse du mot entier `dogs` renvoie deux correspondances dans chaque paragraphe, donc la vérification lisait bien les quatre plutôt que de rester bloquée sur un seul.

Maintenant la partie honnête sur ce nombre. Six, c’est deux numéraux fois trois sorties imprimées, tous dérivés de l’entrée de 65 mots montrée sur la page. Cela vérifie un exemple nommé rapporté dans un article avec une date de publication. Ce n’est pas du tout suffisant pour un taux, un classement ou une attente concernant votre propre fichier. La ligne à retenir de l’article est celle du critique lui-même : « on ne peut pas faire confiance à la sortie sans la vérifier ligne par ligne par rapport à l’original. Tout le temps que l’outil pourrait faire gagner disparaît rapidement. »

Pourquoi ce type d’erreur survit à une relecture

« Il y a des siècles » n’est pas une faute de frappe. C’est grammaticalement correct, mais l’affirmation qu’il porte n’est pas l’affirmation de la phrase source. Un correcteur orthographique ne compare pas ces affirmations. Une comparaison exacte avant-après, si.

La page ne révèle pas comment l’un des trois outils fonctionne en interne, donc elle ne peut pas nous dire pourquoi ce changement s’est produit. Ce que la paire visible montre est plus étroit : une valeur spécifique est devenue un label temporel large tandis que la phrase restait grammaticale. Le critique nomme les scores de référence et les numéros de version comme deux exemples de plus et écrit que « les détails comme les données ne sont pas interchangeables de la façon dont certains mots le sont. » Dans un document académique, la même comparaison peut couvrir les tailles d’échantillon, les valeurs p, les doses, les numéros d’article et de section, les dates, les mots à l’intérieur des guillemets et la paire auteur-année à l’intérieur d’une citation.

Dans cet exemple, la façon directe de repérer le changement est de comparer la phrase renvoyée avec la source. Si vous voulez une cartographie plus large des risques, ce qui arrive aux citations, tableaux et équations dans un humaniseur d’IA couvre les éléments qui nécessitent des vérifications séparées. Si quelque chose est déjà revenu de façon erronée, Un humaniseur d’IA a ruiné mon document ? Restaurer les citations et la mise en forme couvre l’ordre de récupération.

Ce qu’un test d’article ne peut pas vous dire sur votre document

Un article de magazine n’est pas un benchmark et n’a jamais prétendu l’être, donc rien de tout cela n’est une plainte. C’est la liste que vous devriez avoir en tête avant de citer l’article devant quiconque, y compris vous-même.

  • Un taux. Un paragraphe, trois sorties imprimées. Il n’y a pas ici de dénominateur qui soutienne « N % des outils font cela. »
  • Comment se comporte un autre outil. L’avant-après visible nomme trois produits. Il ne peut pas établir comment se comporte un produit non montré sur la page.
  • Ce qui arrive à un document. Les quatre paragraphes imprimés ne contiennent aucune note de bas de page, tableau numéroté, renvoi ou liste de références. L’article mentionne des exécutions supplémentaires sur du contenu technique sans les imprimer, donc le corpus visible ne peut pas répondre à une question au niveau du fichier.
  • Quand les exécutions visibles ont eu lieu. Le 21 août 2026 est la date de publication de l’article. La page ne révèle pas les dates des exécutions du produit, donc elle ne peut pas rattacher les sorties à ce jour.
  • Ce qui se passe dans votre langue. Les quatre paragraphes sont en anglais.

Ce qu’il vous donne, c’est des preuves d’une publication tierce plutôt que d’une page produit : un avant et un après imprimés avec un changement factuel visible. Cela suffit pour construire un contrôle, pas un classement. Pour une méthode séparée visant les affirmations de format de document et les données de test téléchargeables, voir comment vérifier l’affirmation d’un humaniseur d’IA de « préserver votre format ».

Revérifiez vous-même l’exemple publié

Vous pouvez reproduire le décompte ci-dessus sans soumettre de texte à aucun outil. Cela vérifie ce que l’article imprime, pas une exécution non imprimée derrière son verdict plus large.

  1. Ouvrez l’article et localisez les quatre paragraphes imprimés : l’entrée sur la domestication des chiens et les sorties de Grammarly, Rehumanize.io et Ace.ai.
  2. Extrayez les tokens numériques de la source avec la règle exprimée, une séquence maximale de chiffres avec des virgules internes optionnelles. L’entrée devrait donner `15,000` et `30,000`.
  3. Vérifiez chaque sortie pour ces chaînes exactes. Notez présent ou absent dans une grille à deux colonnes. Cela crée six cellules plutôt qu’un pourcentage.
  4. Gardez les affirmations non imprimées dans une colonne séparée. Les exécutions sur du contenu technique, les paramètres du produit, les dates d’exécution et les valeurs du détecteur sont rapportés par l’article mais ne peuvent pas être reconstitués à partir des paragraphes visibles.

Votre grille devrait contenir cinq cellules présentes et une cellule absente. Si ce n’est pas le cas, comparez les ancres de paragraphe et la règle de token avant de tirer une conclusion. Pour tester un document personnel, utilisez un protocole séparé au niveau du fichier : comment vérifier l’affirmation d’un humaniseur d’IA de « préserver votre format » couvre un échantillon délibérément difficile, et comment réviser un document Word humanisé avant soumission couvre le fichier renvoyé.

Où la frontière est tracée

Puisque j’ai déclaré l’intérêt au début, voici la partie de première partie, limitée à ce que notre propre page dit. HumanPen prend le fichier plutôt qu’une zone de texte, et la portée est quelque chose que vous définissez avant que quoi que ce soit ne s’exécute : vous pouvez ajouter des passages directement ou importer un rapport Turnitin ou iThenticate, et la page affirme qu’un paragraphe est la plus petite unité que le moteur réécrit, de sorte qu’une sélection couvrant une partie d’un « is expanded to the full paragraph and shown that way for you to confirm. Everything else is left untouched. » (est étendue au paragraphe complet et vous est présentée ainsi pour confirmation. Tout le reste est laissé intact.) L’objectif exprimé pour ce qui est à l’intérieur de la portée est de « preserve meaning, structure, terminology, citations, layout, and styles while rewriting only the necessary language. » (préserver le sens, la structure, la terminologie, les citations, la mise en page et les styles tout en ne réécrivant que le langage nécessaire.) Les résultats éligibles peuvent continuer à réduire l’IA gratuitement.

C’est une description de l’endroit où se situe une frontière, pas une affirmation sur ce qui revient à l’intérieur. Notre propre FAQ termine la réponse pertinente par « Review complex documents after download, » (Vérifiez les documents complexes après le téléchargement,) et je ne voudrais pas que cette ligne soit supprimée, car tout cet article est un argument en sa faveur.

Rien dans un flux de travail ne supprime l’étape quatre ci-dessus. Une portée plus réduite signifie une liste plus courte de paragraphes à comparer, ce qui est une économie réelle quand l’alternative est une thèse entière. Ce n’est pas une raison pour sauter la comparaison sur les paragraphes qui étaient dans la portée.

Questions fréquemment posées

Avez-vous vérifié tout le test de Tom’s Guide ? Non. J’ai reconstitué l’avant-après visible et trouvé le changement exprimé de `15,000` à « siècles ». La page n’imprime pas les autres exécutions techniques, paramètres, dates ou valeurs de détecteur, donc cet article ne vérifie pas ces parties de l’article.

Pourquoi ne pas simplement répéter le verdict global du critique comme le vôtre ? Parce que l’entrée visible est une introduction d’essai générée de 65 mots sans citations, tableau ou liste de références, tandis que l’article mentionne aussi des exécutions techniques qu’il n’imprime pas. Vous pouvez vérifier indépendamment le changement factuel imprimé. Le verdict plus large reste le récit du critique sur un ensemble plus large d’exécutions partiellement non divulguées.

Cela signifie-t-il que les nombres sont toujours modifiés ? Non. Cinq des six retours numériques sur la page sont revenus intacts. L’exemple visible établit que ce type de changement s’est produit une fois et qu’une comparaison exacte le détecte. Il n’établit pas si une lecture normale le détecterait, ni si le problème est courant ou rare.

Par où commencer si je veux tester mon propre fichier ? Utilisez le protocole séparé de préservation du format lié ci-dessus. Il couvre déjà la construction d’un échantillon délibérément difficile et la comparaison de l’artefact renvoyé, tandis que cette page en reste à la reconstitution des preuves imprimées dans un article publié.

Que devrais-je demander à un fournisseur après avoir lu un test comme celui-ci ? Demandez un avant et un après construits à partir d’un matériel semblable au vôtre, puis séparez ce que l’exemple prouve visiblement de ce que le fournisseur dit à son sujet. Si un décompte apparaît, demandez ce qui a été compté, quel était le dénominateur, et quelle règle a produit le nombre.

CONTINUER LA LECTURE