怎么核一个改写工具的「保留你的排版」声明
这个品类里每一家都说自己能保住你的排版,几乎没有一家说清楚自己数的是什么。四个问题,就能把那句话变成一个下午之内可以自己验证的东西。
HumanPen 团队
· 8 分钟
先说结论
一条排版声明能不能被核,取决于它有没有说清四件事:哪个元素、在文件的哪一层、分母是多少、怎么数的。「保留你的引用」四件一件都没说。「输入里存在的 Markdown 标题,552 个中有 291 个活了下来」四件都说了,而且你可以反驳它。
剩下的部分就是这套测试:先用在这个品类里我能找到的唯一一份公开数据集上——它的发布方结果是一家竞品,但它仍然是这里最可核的东西——然后再用在我们自己的数字上,连同缺口一起。
四个问题
| 问题 | 含糊的声明会说 | 可核的声明会说 |
|---|---|---|
| 哪个元素? | 「你的排版」 | 标题、加粗片段、正文内引用标记、脚注引用、表格单元格、交叉引用域 |
| 哪一层? | 「文档」 | 纯文本里的 Markdown 字符,或者 DOCX 的样式与域代码。这是两个不同的测试 |
| 分母是多少? | 「99%」 | 552 个里的 291 个,并且输入里原本有什么也一并给出 |
| 怎么数的? | 什么也没说 | 一个点名的脚本、一条写明「怎样算活下来」的规则、一份别人能自己打开的数据集 |
被跳过的总是「哪一层」这个问题,而它恰恰决定了一个数字对一篇学位论文有没有意义。一行开头的一个 `#`,和 `word/document.xml` 里的一个「标题 2」样式,是两种不同的对象,坏掉的方式也不一样。一个工具完全可以在其中一层做到满分,在另一层一塌糊涂。
把它用在那份唯一的公开数据集上
先看是谁在发布,因为一条声明会继承发布者的利益关系。
这个品类里人人都在引的那份数据集叫 HumanizerBench,它的关于页面上有一句话,换成别的基准多半会埋起来:"We're operated by WriteHuman, which sells one of the humanizers on this leaderboard."(我们由 WriteHuman 运营,而 WriteHuman 就在这份榜单上卖着其中一款工具。)站内每一页的页脚都写着同样的自认,而在下面引用的那一期里,WriteHuman 是第一名。所以它不是一个独立基准,把它称作独立基准的引用,是漏了一步。
它是另一种更少见的东西:它把文件公开了。2026 年 8 月那一期的每一份输入、每一份输出、每一个检测器判定,都在一个 CC BY 4.0 授权的公开仓库里。一个由竞品运营、但交出原始数据的基准,陌生人能去核;一份听起来很中立、却什么都下载不到的横评,核不了。这两半必须一起走,而后一半正是下面这些数字还值点钱的原因。
这一期是 12 家工具 × 33 个样本,396 次完成的测试。统计口径是「输入里存在、并且在对应输出里回来了」的元素:
| 元素 | 存活 | 比例 |
|---|---|---|
| Markdown 标题 | 552 个中 291 个 | 52.7% |
| 加粗片段 | 792 个中 319 个 | 40.3% |
现在回到那四个问题。元素:点名了。分母:公开了。计数方法:一条你自己就能套用的规则——以 `#` 开头的行算标题,两个星号之间的文字算加粗片段,而存活数以输入实际有的数量为上限,所以没有工具能靠凭空生成一个原本不存在的标题得分。把这一期下载下来,套用这条规则,你要么落到这两个数字上,要么找出我哪里算错了。层:纯文本里的 Markdown 字符。那份数据集里的一切都是粘进框里、再粘出来的,全程没有任何 `.docx` 参与。
最后那句不是在批评这个基准,它从没声称过别的。这是当某个厂商拿它来跟你说事时,你必须一起带着的东西。
把它用在我们自己的数字上
同样四个问题,对准我们自己。而第一件要说的,正是决定这些数字该有多少分量的那件事:我们测的是我们自己的输出,用的是我们自己挑的文件、我们自己的脚本。这是一个厂商在测它自己。
我们取了三对改写前后的文件,把每个文件当 zip 打开,逐个走 `word/document.xml`。三份的段落数回来后都完全一致(分别是 345、403 和 405)。整组文件里带标题样式的段落,进去 152 个,出来 152 个。语料里唯一那张表保持 7 行 14 格未变。
元素:段落、标题样式、表格行与单元格。层:DOCX。分母:写明了。计数方法:一个直接读 XML 的脚本,而不是去问产品自己做了什么。
以及你核不了的那部分:文件是我们自己的,我们不会公开,所以公司外面没有任何人能靠重数一遍得到 152。这是这个数字实打实的弱点,与其把它包装过去,我更愿意直接点出来。真正能迁移的是过程——下面那六步,跑在一份你自己的文档上,而不是我们挑的那份。
接下来是营销页面会略去的部分。
标题的措辞不在那个数字的覆盖范围里。在那份有 46 个标题的文档上,有 18 个标题在均衡档下换了措辞回来,样式仍然挂着。「作为标题活了下来」和「原封不动地活了下来」是两条不同的声明,上面测到的只有第一条。
有几类元素我们根本没测过,因为语料里一个都没有。在这三个包里搜目录域、交叉引用和脚注的标记,三份全是零命中。这意味着我们的统计恰恰对学位论文最依赖的那几样元素保持沉默。「那张表活下来了」是一次测量;「交叉引用会活下来」则是一次推断——这条区分请套用到任何人写的这句话上,包括我们的版本。
要提防的把戏,是一个脱离了自己那一列的数字
下面是我们在自己的调研里抓到的一次翻车,也正是我更信这四个问题、而不信任何人的总结的原因。
一份关于那个公开数据集的内部整理里,有一句话说四家被点名的工具在标题存活上都是 0%。回到原始数据重数之后:名单是对的,但它属于加粗那一列。在标题这一列上,那四家里有一家是 58.7%。这句话要是发出去,我们就等于对一家公开数据明明写着别的数字的公司发布了一个 0%,而任何人下载同一份文件、五分钟就能把它拆穿。
那个数字本身是真的。它只是在离源头一份文档的距离上,就已经和自己测的东西脱钩了。
于是你有了第五个问题,也是成本最低的一个:从这里我能不能回到原始数据,以及它是谁产出的?如果答案是一篇博客引另一篇博客,那这个数字已经走得比它安全承受的距离更远了。如果原始数据只有一次点击的距离、但发布它的人在同一张表里卖着一款工具,你照样可以用它——只是每一次都必须把这两件事一起说出来。
半小时左右,自己跑一遍这个测试
要核一个你正在考虑的工具,你不需要一个基准。你需要的是一份故意做得很难缠的文件。
- 造一份「每样来一个」的测试文档:两级标题、一个自动生成的目录、一处指向带编号图的交叉引用、一个脚注、一个编号列表、一张两列表格且其中一格是数字加单位、一句带引号的引文,以及三条来自你的文献管理器的正文内引用。
- 上传之前先把各项数量记下来。参考文献、脚注、表格行数与格数、标题、列表项。
- 把它送进那个工具。
- 打开结果,全选,刷新域(Ctrl+A,然后 F9)。活的域会当着你的面更新;被变成普通字符的域看起来一模一样,却什么也不会发生——这就是不打开 XML、两秒钟分辨两者的办法。
- 重数一遍,然后把措辞和结构分开比。一个仍然是标题、但说法变了的标题,是一个结果,不是一次失败;但你得知道自己拿到的是哪一种。
- 读那句引文,和那个装着数字的单元格。流畅的改写造成的、你扫读时看不见的损伤,就藏在这两处。
花上半小时,你对自己这份文件的了解,会超过这个品类里任何一个对比页能给你的,包括我们的对比页。对比页——我们的和别人的一样——写的都是别人的文档。
我们声称什么,不声称什么
HumanPen 是个文档工具,所以我们在意的就是文件这一层,上面那些数字是我们在这一层上测到的。还有四类元素我们没有测过,它们被写进了这篇文章,而不是被略去。
属于设计决定、而不是测量结果的那部分:比一个完整段落更小的东西永远不会被改写,选区落在段落中间时会被扩展到整段,并先摆到你面前让你确认。这条边界也可以由导入的报告来定,而不是由你。计费从被改写的那些词本身算出来——这是一条定价事实,不是保留性声明;我把它列在这里,只是因为这两件事经常被当成一句话卖。我们自己的 FAQ 末尾仍然写着 "Review complex documents after download"(复杂文档下载后请自行检查),这是正确的提示,我们也不打算把它说软。
这条声明是故意做窄的:被改动的段落越少,出问题的地方就越少。
常见问题
这件事上有独立的第三方基准吗? 我找不到。有一份公开数据集,HumanizerBench,以 CC BY 4.0 发布——但它由 WriteHuman 运营,而 WriteHuman 自己就卖着这份榜单上的一款工具,所以「独立」是个用错了的词。它是可核的,不是独立的,这是两个不同的属性:原始文件可以下载,这一点已经强过这个品类的大多数。另外它测的是纯文本里的 Markdown 排版,不是 `.docx` 内部的任何东西。针对文档这一层,我根本没找到任何公开数据集——这也正是上面那份自制文件值得花半小时的原因。
某个工具说自己有 99% 的保留率,这算好吗? 照这个写法根本无法回答。去问:哪个元素、在文件的哪一层、分母是多少、怎么数的。一个没有分母、也没点名元素的比率,不是一次测量。
最快的那一个检查是什么? 在 Word 里按 Ctrl+A 再按 F9。它能把活的域和只是长得像域的文字分开,只要两秒。
为什么标题活了下来,参考文献表有时候却没有? 机制不同。标题是挂在段落上的一个样式,段落里的文字被改写它照样存在。参考文献表是内容,所以它会不会变,完全取决于它一开始在不在改写范围之内。
继续阅读