改写工具会把引用、表格和公式改成什么样?

这个问题通常被当成「会不会影响分数」来问。不是。AI 检测率只在正文句子上算,参考文献表根本不在计算范围里。真正有风险的是你交上去的那个文件。

HumanPen 团队

· 11 分钟

先说结论

Turnitin 处理 AI 检测报告时会排除参考文献表,报告本身也只分析正文句子,所以改写参考文献表对那个数字没有任何影响。但它照样能让你损失参考文献本身。句子被合并或拆开时引用标记会错位,文献管理器插入的域会被压成再也不会更新的死文本,而有一份录屏评测显示:某个工具改写了参考文献表,并且在输出里生成了一条输入中根本不存在的引用。

下面整篇讲的都是第二句话,因为没人把它算进成本里。

两种完全不同的东西,被叫成了同一个名字

改写工具有两种形态,出问题的方式也完全不同。

第一种给你一个文本框。你粘进去,它改写,你再粘回来。工具从头到尾没见过你的文档,所以一切关于表格和域的问题,其实问的都是你在粘贴前后做了什么。文件里原本有的结构,是你亲手拆掉的,接下来也得你亲手装回去。

第二种接收文件本身。它打开文档,找到里面的文字块,改写其中一部分,再把文档写回去。这种工具有能力保住结构,同样也有能力在你手工绝不可能达到的规模上破坏结构——因为它一趟就把每一段都摸了一遍。

两种形态都不是默认安全的。真正决定结果的是范围:文档里有多少内容进了改写,以及在它跑起来之前你有没有看到这条边界。

引用标记错位,是因为句子动了

Turnitin 自己对检测机制的描述值得读一遍,因为它解释了为什么在检测器这一侧,你的引用没有受到任何保护。提交的文本被切成互相重叠的片段;每个片段拿到一个 0 到 1 之间的分值;一个合格句子会继承覆盖它的那些片段的值;这些值再汇总成报告上的那个百分比(AI writing detection FAQs)。这一串流程里没有任何一步认得出「这是一条引用」。

在改写工具那一侧,同样的盲区反过来生效。对一个正在改写正文的模型来说,`(Smith, 2019)` 只是句子里的一串字符,没有任何标记告诉它这串字符是承重的。把两句合成一句,标记就留在了一个它的来源从没支持过的结论后面。把一句拆成两句,一半带着标记,另一半变成了一句读起来毫无问题、却没有任何来源支撑的陈述。

这种问题校对是看不出来的,因为语法没错、也没有东西缺失。句子自己站得住,只是它不再是来源说过的那句话了。怎么逐条把这层对应关系查一遍,我们在改文献综述又不弄断证据链里写过。

第二类问题是机械性的,不是语义性的。如果你的引用是从 Zotero、Mendeley 或 EndNote 出来的,它们就不是文字,而是域;一趟纯文本往返之后,它们会变成看上去一模一样、却再也不会更新的字符。这在长文档里要付什么代价,Word 的域、目录与交叉引用那篇讲得比较细。

有一份录屏拍到了工具在改写参考文献表

这不是假设。比起我自己下断言,我更愿意指向别人的录屏。

Tadhg Blommerde 在英国诺森比亚大学(Northumbria University)任教,手上有 Turnitin 的教师端权限,并在他每期评测的视频描述里写明:无赞助、无联盟链接。

让这个结论可核的,是他在 2025 年 2 月那期评测里的做法。测试稿不是他自己写的,是他让 ChatGPT 写的——原话是 "1,500 words in UK English"(1500 词、英式英语),并且要 "intext citations and a reference list in the APA style"(正文内引用加一份 APA 格式的参考文献表)——所以在任何工具碰它之前,屏幕上已经存在一份已知的输入。这份文件随后过了 Walter Writes,他的说法是它 "even humanized the reference list"(连参考文献表都一起改写了)。他还在输出的某条引用上停了下来,说了那句关键的话:这条引用不在 ChatGPT 那一版里。

所以第二个发现比第一个值钱。参考文献被改乱,是一个你迟早会发现的错误;而一条没有任何人写过的引用,是一份伪造来源,它此刻正躺在一份你即将签上自己名字的文档里。而唯一能让人说出「这是伪造的」的原因,是输入先在视频里生成过、可以和输出逐行比对。

那个公开基准测了什么,又没测什么

在这件事上我能找到的唯一一份公开数据集,是带着一条披露一起来的,而这条披露必须跟着数字一起走。这个基准叫 HumanizerBench,运营方是 WriteHuman——它自己就是这份榜单上十二家工具中的一家,而且正是我下面要引用的那一期的第一名。这不是我推出来的:他们自己在关于页面上写着,站内每一页的页脚也再写一遍。所以「独立」这个词安不到它头上,不管引用它的人怎么称呼它。

它真正少见的地方在于:它把文件交出来了。2026 年 8 月那一期的每一份输入和输出,都放在一个 CC BY 4.0 授权的公开仓库里。这才是它在「谁在运营」之外仍然可用的原因:任何人对它的总结——包括这一篇——你都可以打开同一份文件、自己数一遍来反驳。

那么值得数的部分是这样,规则也就是字面这么简单——Markdown 里的标题是以 `#` 开头的一行,改写之后它要么还在,要么不在。在那一期的十二家工具里,有四家交回的输出里一个标题都不剩,另有三家把输入里的标题全数还了回来。「这类工具都会毁掉你的排版」是个让人舒服的判断,但公开出来的文件并不支持它。这个品类内部的差距,就是从零到满。

然后是这次测量的边界,它比任何一个百分比都重要。被数的是纯文本里一行开头的一个 `#` 字符。那份数据集里的每一家都是粘进去、粘出来,全程没有任何 `.docx` 经手。样式、编号定义、表格对象、脚注部件、交叉引用书签和目录域都活在另一层,而针对那一层的公开数据集,我一份也没找到。

DOCX 那一层,我们自己数了什么

所以我们自己数了一遍,数的是我们自己的输出。这是我们在测我们自己——三对改写前后的文件,都来自我们自己的运行记录,用一个直接打开 `word/document.xml` 的脚本来读,而不是去信产品自己报告的任何数字。拿三份里最大的那份:405 个非空段落、46 个带标题样式的段落、一张 7 行 14 格的表格。跑完之后,这三个数一个没变。

两条限定,第二条才是重要的那条。

标题作为标题活下来,不等于它的文字活下来了。那 46 个标题里,有 18 个在均衡档下换了措辞回来,样式仍然挂着。「被改了措辞」和「被压成正文」是两件事,而上一节数的 Markdown 标题,抓的是第二件。

更大的限制是这批语料里没有的东西:没有目录域、没有交叉引用、没有脚注——整个包里 `fldChar` 为零、锚点为零、找不到 `footnotes.xml`。而这几样恰恰是最容易无声损坏的部分,因为它们都不和自己所属的文字存在一起:脚注标记和脚注正文分别躺在包内不同的文件里,只靠一个编号连着。所以那次测量诚实的适用范围,就是段落、标题样式和一张表,在我们自己挑的三份文档上。

我们的数字你复现不了。文件不是我们能公开的,而且一个厂商在自家语料上得到的数字,值多少你大概心里有数。你能复现的是过程,在你真正在意的那份文档上,一个下午就够:把 `.docx` 复制一份,把副本改名成 `.zip`,打开 `word/document.xml`,数非空的 `<w:p>` 元素,数其中有多少个挂着以 `Heading` 开头的段落样式(中文版 Word 建的文件里,这个样式名是「标题」),再在包里搜 `fldChar` 和 `footnotes.xml`。你在考虑的任何工具,包括我们,都在跑之前和跑之后各做一遍——这样得到的数字讲的是你的论文,而不是我们那三份文件。

谁跟你说他们的工具能保住交叉引用,包括我们,都该被追问一句:你数的是什么?

表格在检测器的范围之内

Turnitin 的 AI writing detection model 页面挂着版本更新记录,2023 年 8 月 9 日那一条写的是模型现在能处理表格中的长篇正文("long-form prose text in tables")。同一条还补了一句:已提交过、且含表格的稿件,要重新提交才会被重新处理。

由此有两件事。表格单元格里的正文是可能被标成 AI 的,所以「它在表格里,不算数」这个说法已经过时三年了。而这也把表格一并放进了改写工具的范围:既然单元格计入分数,一个文件级的工具就有理由钻进去,一格一格地改。

不同工具在单元格里到底做了什么,我没有测过,所以这段接下来的内容请当成「该往哪看」,不是结论。原本装着两个段落的单元格值得重新打开看看。因为文字变长而行高变高的那一行也是。而在结果表里,第一个该查的,是那种数字后面跟着单位的单元格——表格里最像一个句子的内容就是它。

公式、数字和引文

公式这块我拿不出任何测量结果,与其用一段自信的话把这个空填上,我宁愿直说:我们的语料里一个公式都没有。

我能给你的是那条真正要紧的边界,而它其实和公式关系不大,它关乎的是所有「值本身就是全部」的东西。一句引文必须带着引号里原封不动的字回来,否则它就不再是引文。样本量、p 值、置信区间、单位、日期、专有名词,全都得一个字符不差地活下来。正文可以动,这些不行。

方法和结果里哪些能改写、哪些必须一字不动把一篇论文按这两栏分得比较清楚。

十分钟的检查,按这个顺序

  1. 在 Word 里打开文件,按 Ctrl+A,再按 F9。 活下来的域会刷新,被压平的域会杵在那儿一动不动——这就是你把它们找出来的方法。
  2. 改写前后各数一遍参考文献条数。 条数变了是最响的一个信号,而这一步只要十秒。
  3. 在输出里搜出每一个正文内引用标记,逐个确认它现在所在的那句话仍然在做那个论断。 这是最慢的一步,也是唯一能抓到「伪造出来的支撑」的一步。
  4. 每一个含数字的表格单元格都读一遍。 不是读它周围的正文,是读那一格。
  5. 把引文做一次差异比对。 引号之间的任何内容都应当和来源完全一致。

这套检查的完整版,连同让它可重复的文件版本管理做法,在改写后的 Word 文档在交之前怎么验收里。

我们把边界划在哪

HumanPen 的前提是:「到底哪些内容被动过」应该是你给出的答案,而不是事后在 Word 里发现的结果。

引擎不会改写比一个段落更小的东西。选区停在一段中间,被改写的就是整段,而且这条边界会在任何东西跑起来之前画给你看。你可以自己划这条边界,也可以导入 Turnitin 或 iThenticate 的报告、让报告标红的位置来划,这种情况下只有被标红的文字会被改写。积分按真正被改写的词数计,所以一个只圈了四段的任务,按四段计价,不按一整篇论文计价。符合条件时可以免费继续降 AI。

我们自己的 FAQ 在那一节末尾写的是 "Review complex documents after download"(复杂文档下载后请自行检查),这句我不会删掉。复杂文档的改写结果,就是需要你检查的。范围帮你换来的,是一份短得多的待查清单。

常见问题

改写工具会改动我的参考文献表吗? 完全取决于参考文献表在不在改写范围内。参考文献表对你的 AI 检测率毫无帮助,因为 Turnitin 的更新记录写着处理 AI 检测报告时会排除参考文献表,所以它本来就没有理由被放进范围。但确实有一份录屏评测显示,某个工具照样把参考文献表改写了。

改写之后,正文里的引用还对得上参考文献表吗? 标记作为字符通常是活着的。断掉的是标记和论断之间的对应关系——发生在它周围的句子被合并或拆开的时候。要查的是那句话,不是那个括号。

表格会被改写吗? 可能会。而且 Turnitin 确实会分析表格里的长篇正文,所以工具有理由进去。装着数字、单位和短标签的单元格是最该先看的。

我的目录为什么坏了? 几乎总是因为文档中间经过了一道纯文本环节。目录是域,不是文字;把文档压成一个字符串,域就没了,尽管页面上那些字看着还在。

继续阅读