一份第三方改写工具实测该怎么读

一份把输入和输出完整印出来的实测,给了读者可以亲自检查的证据。评测结论有一部分能从页面上重新核算,另一部分依赖页面没有公开的材料或判断规则。把两者分开,才知道自己真正核到了什么。

HumanPen 团队

· 10 分钟

先说结论

一份公开实测要读两遍。第一遍看评测者得出了什么结论,第二遍问:哪些结论能直接从页面上的证据得出。Tom's Guide 2026 年 8 月这篇里,有一条能直接核:某个改写工具把「at least 15,000 years ago」变成了「centuries ago」,改写前后两句都印在页面上。关于节奏和自然度的判断属于另一类。你可以同意,但文章没有给出一条能搬到其他文档上复用的判断规则。

那篇文章是 I tested popular AI humanizers — and they made my writing much worse,作者 Amanda Caswell,发表于 2026 年 8 月 21 日。我在 2026 年 8 月 28 日核对了渲染后的文章页。下文归给这篇评测的引文都来自该页;HumanPen 一节里的引文会明确标成我们自己的产品页文字。

有件事先摆在明面上:我们自己就卖文档改写工具,所以我们对这个品类怎么被讨论有立场。读下文时请把这层关系算进去。下面的清点使用另一家媒体已经印出的段落,你不需要相信我们,可以自己重算。

那次实测到底测了什么

这篇文章公开了足够多的设置,让读者可以检查其中一组改写前后对照。

  • 原文是生成的:评测者「had ChatGPT write a short essay about the domestication of dogs」,也就是让 ChatGPT 写了一篇关于狗被驯化的短文,其中导语段完整印在文章里。按空格切词是 65 个词。
  • 就这一段,被送进了几个改写工具,其中三个返回的版本完整印了出来:Grammarly 的 Humanizer、Rehumanize.io、Ace.ai。
  • 页面上点名了两个检测器,GPTZero 和 Pangram,并报告了一次判定结果:Pangram 把 Ace.ai 的那一版判为 AI 写作。
  • 文章说试了「several」个工具,还说在更技术性的内容上出现了同样的问题——「benchmark scores and version numbers」,也就是跑分数字和版本号。这些额外的跑次只被提到,没有印出来。

所以能看见的语料一共四段:一段输入、三段输出,同一个题目、同一种语言。这个体量很小,但它可以被检查。页面没有公开这些跑次发生的日期、耗时或具体设置。

三条结论,性质完全不同

文章报告了三个问题。一旦你想把它们带去别的地方用,它们的表现天差地别。

文章报告了什么页面上给了你什么去核它你能自己重数一遍吗
「the rhythm became choppy and unnatural」(节奏变得断续、不自然)四段原文,完整印出不能按页面给出的一条固定规则复算。你可以四段都读一遍、形成自己的判断,但文章没有公开一套能用在另一份文档上的评分规则
「the tools changed facts or stripped away important context」(工具改动了事实、或删掉了重要背景)输入句和输出句,两边都逐字给出能。两段文本里有一处可以直接确认的事实变化
「processing a draft through a humanizer actually increased its probability of being flagged」(跑完改写后被标记的概率反而升高了)一句话,加上对某一版输出的一次具名检测判定部分能。那一次判定写出来了,但支撑这句话的那几次跑并没有印出来

检测结果不在这篇文章的范围里,第三行我不会拿来搭任何结论。把它列出来只是为了划清证据边界:页面公开了一次具名判定,却没有印出支撑那句概括的其余跑次。因此不能把那句话换算成比例。

把那条能重数的结论重数一遍

先把规则写出来,方便你不同意。数字词元的定义是:一段连续的阿拉伯数字,中间允许有逗号,正则写作 `\d[\d,]*`。语料就是那一页上印出来的四段,别的都不算。所谓「保住了」,指同一个词元原样出现在对应的输出里。我没有判断语义,只做了字符串匹配。

输入:「genetic and archaeological evidence suggests that dogs descended from an ancient population of wolves at least 15,000 years ago.」 · Rehumanize.io 的输出:「based on genetics and old discoveries, it looks like dogs came from an ancient wolf group centuries ago.」 文章自己的那句话:「We went from 15,000 years to 'centuries.'」

输入段里有两个数字词元,`15,000` 和 `30,000`。三段印出来的输出给了这两个词元六次回来的机会,六次里回来了五次。没回来的那一次是 Rehumanize.io 那一版里的 `15,000`,也就是文章点名的那处漂移;另外两版把两个数字都带回来了。同一批已抽取段落上的灵敏度对照:对 `dogs` 做不区分大小写的整词计数,四段各命中 2 次,说明检查确实读到了四段,而不是卡在其中一段。

接下来要把这个数字的边界说清。六等于两个数字乘三段公开输出,全部来自页面展示的那一段 65 词输入。它只核实了一个具名例子,而且文章有明确发布日期。它远远不足以支撑一个比例、一份排名,或者对你自己那份文档的任何预期。真正该带走的是评测者自己那句话:「you can't trust the output without checking it against the original line by line.」——不逐行对照原文,你就没法信任输出。

这类错误为什么能躲过校对

「centuries ago」不是错别字。它语法正确,但它陈述的已经不是原句里的那件事。拼写检查不会比较两句话的事实,一份逐项的前后对照会。

页面没有公开三家工具的内部实现,所以它不能告诉我们这次改动为什么发生。可见的前后对照只支持一个更窄的观察:一个具体数值被换成了宽泛的时间说法,而句子仍然合乎语法。评测者还点名了跑分数字和版本号,并写道「details like data are not interchangeable the way certain words are」。放到中文的学位论文和期刊稿里,同样的对照可以覆盖样本量、p 值、剂量、条款序号、年份、引号里的原话、参考文献编号,以及作者—年份这一对。

在这个例子里,最直接的检查就是把返回句与原句逐项对照。想看更广的风险地图,改写工具会把引用、表格和公式改成什么样? 讲的是还要分别检查哪些元素。如果东西已经改坏了,AI Humanizer 改坏了论文?恢复引用和 Word 格式 讲的是抢救顺序。

一次专栏实测告诉不了你什么

一篇科技媒体专栏不是基准测试,它也从没说自己是。所以下面这些不是挑刺,而是你在把这篇文章拿去说服别人(包括说服自己)之前,脑子里该有的清单。

  • 比例。 一段文字、三段印出来的输出。这里没有任何分母撑得起「百分之多少的工具会这样」。
  • 另一个工具怎么表现。 可见的前后对照点名了三个产品,不能据此判断页面没有展示的产品。
  • 文档层会发生什么。 页面印出的四段没有脚注、编号表格、交叉引用或参考文献表。文章还提到没有印出来的技术内容跑次,所以可见语料不足以回答文件层问题。
  • 可见跑次发生在什么时候。 2026 年 8 月 21 日是文章发布日期。页面没有公开产品跑次的日期,因此不能把输出状态钉在这一天。
  • 换成中文会怎样。 四段全是英文。中文的数字还多一层——「一万五千年」这种写法根本不含阿拉伯数字,上面那条正则一个都数不到。

它能给你的,是第三方媒体而非厂商页面提供的证据:改写前后原样印出,而且其中有一处肉眼可核的事实变化。这足够拿来设计检查,不足以排榜单。另一套面向文档格式声明与可下载测试数据的方法,在 怎么核一个改写工具的「保留你的排版」声明 里。

自己复核页面上那组公开对照

你不需要向任何工具提交文字,就能复算上面的计数。这一步只检查页面印出来的内容,不检查支撑评测者整体判断的那些未公开跑次。

  1. 打开原文,找到四段公开文字:狗驯化主题的输入段,以及 Grammarly、Rehumanize.io、Ace.ai 三段输出。
  2. 按本文给出的规则抽取输入里的数字词元:连续的阿拉伯数字,中间允许逗号。结果应当是 `15,000` 和 `30,000`。
  3. 去三段输出里逐项找这两个完整字符串。 每一项只记「有」或「无」,得到六个格子,不换算成百分比。
  4. 把未公开的内容单列。 技术内容跑次、产品设置、运行日期和检测器数值是评测者的报告,但无法从四段可见文字重建。

最后应当得到五个「有」和一个「无」。如果不是,先核对四段开头和数字词元规则,不要急着下结论。要测试自己的文档,请走另一套文件级流程:怎么核一个改写工具的「保留你的排版」声明 已经提供了难例样本,Word 文档改写后怎么验收 则检查返回文件。

边界画在哪里

开头既然把立场说了,这里就把第一人称的那部分也说完,只讲我们自己页面上写着的东西。HumanPen 收的是文件而不是文本框,而范围是你在任何东西开跑之前自己定的:你可以直接添加片段,也可以导入 Turnitin 或 iThenticate 的报告;页面上写明段落是引擎能改的最小单位,所以只圈了半段的选区会「is expanded to the full paragraph and shown that way for you to confirm. Everything else is left untouched.」——扩成整段、摆在屏幕上等你确认,范围之外的一个字不动。对范围之内,页面写的目标是「preserve meaning, structure, terminology, citations, layout, and styles while rewriting only the necessary language.」符合条件时可以免费继续降 AI。

这是在描述边界画在哪儿,不是在承诺边界之内会返回什么。我们自己的常见问题里,那一条的结尾写着「Review complex documents after download」——复杂文档下载后要复核。这句话我不想拿掉,因为这整篇文章就是在论证它。

上面第四步不会因为用了什么工具就可以跳过。范围小,意味着要对照的段落少,当替代方案是一整本学位论文时这是实打实的省事。但它不是「范围内那几段也不用对了」的理由。

常见问题

你核完了 Tom's Guide 的整次实测吗? 没有。我重数了页面上可见的前后对照,确认了 `15,000` 变成「centuries」这一处。页面没有印出其它技术内容跑次、设置、日期或检测器数值,所以本文不审计那些部分。

为什么不能把评测者的总体判断直接当成自己的结论? 页面展示的输入是一段 65 词的生成短文导语,没有引用、表格或参考文献表;文章还提到一些没有印出来的技术内容跑次。读者可以独立核对那处可见的事实变化,更广的判断仍是评测者对一组没有完全公开的跑次所作的报告。

这是不是说数字一定会被改掉? 不是。那一页六次数字回归里,有五次原样回来。可见例子只证明这类变化发生过一次,而且逐项对照能抓住它;它不能证明普通通读一定能或不能发现,也不能说明问题常见或罕见。

如果要测试自己的文件,该从哪儿开始? 用上文链接的格式保留性测试。那一篇已经包含如何造一份故意很难的样本、如何检查返回文件;本页只负责重建一篇公开评测印出来的证据。

读完这类实测,该拿什么问题去问厂商? 请对方给出一组与你材料相近的改写前后对照,再把例子本身能证明的东西与厂商自己的解释分开。如果出现计数,就追问数的是什么、分母是什么、按哪条规则得出的。

继续阅读