只改写 Turnitin 报告标红的那几段

按报告选段改写,指的是导入 Turnitin 或 iThenticate 的 AI 检测报告,把报告里高亮的段落对回你的源文件,然后只改写你确认过的段落。你没确认的,不会被改。做这件事的工具是存在的,我就在做其中一个(HumanPen)。而工程量的大头,其实花在「弄清楚报告到底指的是哪几段」上。

HumanPen 团队

· 8 分钟

为什么「整篇改写」是个错误的默认值

我在做 HumanPen,它干的就是下面要讲的这件事,所以这篇不是中立测评。但这套机制本身值得写下来——哪怕你打算全部手工来做。

整篇改写的工具,跑起来便宜,验起来贵。

真正落到你身上的成本是复核,而复核量取决于「改了多少」,不是「原本错了多少」。凡是被改过的地方,你都得重新确认:数字有没有变、术语跟前一节还一致吗、文中引用是不是还挂在它支撑的那句话上、"见表 2"指的还是不是表 2、原本留有余地的表述有没有被写死。最让我紧张的是「相关」被改写成「因果」——因为改完之后,那句话读起来完全通顺。

而没人动过的段落,你一个字都不用复核。

拿我们在竞品对比记录里用的那个例子:一篇一万词的论文,2,800 词被标红。整篇改写,你就要为同一处问题重读一万词,而其中 7,200 词你本来没有任何理由怀疑。

第二笔成本要过一阵才显现。一旦整篇改写把原本干净的段落也改了,下一份报告就不再能和第一份对比。如果有新的地方被标红,你无法判断它上一轮是不是也被标红过——因为它底下那段文字,已经不是第一份报告看过的那段了。选段改写把未标红的部分留作了对照组。

导入哪份报告:AI 检测报告,不是查重报告

Turnitin 的文档说得很直接:AI 检测指标与相似度分数彼此独立,而且 AI 检测的高亮根本不会出现在查重报告里(Using the AI Writing Report)。查重报告高亮的是与已有来源的重合。把它喂进按报告选段的流程,你会去处理一堆根本没人判为 AI 写作的段落。HumanPen 不会把查重报告当作 AI 检测报告来读。

还有两件事会改变你读报告的方式:

  • 低于 20% 时根本没有数字。 对 1 到 19 这一档,Turnitin 显示星号而不是百分比,理由是这一档误报率更高。所以百分比不是你总能拿到的东西,高亮才是。
  • 这个百分比不是全文的占比。 Turnitin 只分析它所说的合格文本,即由标准语法句子构成的长篇散文;列表、项目符号和其它非句子结构不在分析范围内。对由此产生的后果,Turnitin 自己的措辞是「a document containing several different writing types would result in a disparity between the percentage and the highlights」(一份包含多种写作类型的文档,其百分比与高亮之间会出现落差)。所以高亮和百分比不总是对得上,而差多远,取决于你文档里有多少内容不是散文。

报告里你能据以行动的部分是那些高亮区间,不是那个数字。

这套机制实际需要做什么

改写是简单的那一半。

  1. 从一份根本不是为解析而生的文档里,把高亮取出来。 在 Turnitin 里,只有教师和管理员能看到 AI 检测指标;教师可以下载报告的 PDF 分享给学生,所以到作者手上的通常是一份 PDF,不是一条数据接口。而 PDF 报告是一次渲染的结果:它的文本层是按行排布的字形块,高亮是画在这个版面之上的一个色块。文件里没有任何地方写着「这些字符被标红了」。要把它还原出来,就得把高亮的几何区域与文本层的几何位置求交,读出落在里面的是哪些字形。
  2. 把取出来的东西归一化,因为那不是你写的原文。 单词会因换行被插入源文里根本没有的连字符;你敲的两个字母,取出来可能是一个连字;直的撇号变成了弯的;页眉、页码和页脚会交织进抽取出的文本流,于是一段话里可能夹着期刊名。这些每一条都会让精确字符串匹配失败,而唯一的症状是匹配器悄无声息地什么也没返回。
  3. 用同一套归一化规则,把它匹配回源文件。 你是在拿一段话的有损渲染去比对这段话本身,所以这天然是一次模糊匹配——而模糊匹配的结果,是必须拿给人看的。
  4. 把匹配结果扩展到整个段落。 高亮没有义务和段落对齐,而决定设计的恰恰是它们不对齐的情形:高亮从段落中间某处开始,在半句话处结束。如果你只改写被高亮的那些字符,段落的一半会以另一种语域回来,剩下的句子还依赖着没人动过的那半段里引入的代词和已定义术语。这就是为什么段落是最小改写单位:部分高亮会被扩展成完整段落,而扩展后的这份清单,正是拿给作者确认的东西。
  5. 在文件内部原地改写。 不是抽出来、改完、再粘回去。每个改写后的段落回到它原来的位置,途中有一组内容被保护、不参与改写:引用标记、参考文献条目、公式、代码、图表题注、图号、脚注、表格单元格、交叉引用域和目录。

为什么范围必须在动手之前先给你看

第 3 步是启发式的,而启发式有时候会错。

一句在文档里出现两次的高亮句子(方法部分的套话就经常这样)可能匹配到错误的那一处。你在生成报告之后编辑过的段落,可能根本匹配不上。题注或表格单元格看起来可能很像正文散文。如果工具在匹配错误时默默照做,它就会改写一段报告从未标红的文字,而你永远不会知道——这恰恰是这套做法存在的意义所要避免的事。

所以匹配到的段落会在任务开始之前先展示出来。你可以往里加,也可以往外删,凡是你没确认的都留在范围之外。范围同时也是价格——计费按实际改写的词数走,所以那个界面同时就是报价单。

整篇改写 vs 按报告选段改写

对比项整篇改写按报告选段改写
由谁决定范围工具。默认全文都在范围内报告的高亮,再加上你的确认
你需要复核的词数全部只有被标红的段落
未被标红的文字一并被改写除非你自己把它加进范围,否则保持不动,因而还能当作下一份报告的基线
需要的输入文档文档,外加 AI 检测报告 PDF
最小改动单位各家不同段落
什么情况下不适用你没有余力去复核那些没人标红的文字,或者你希望下一份报告仍能与这一份对比报告相对文件已经过期,或者这个文件不是当初提交的那一版
按报告选段,只有在你确实有一份报告时才成立。没有报告的话,整篇处理或者自己挑段落才是诚实的答案——这两条路我们也都提供。

诚实的局限

输出需要人过一遍。自动改写会产生一些需要修正的细节;而拒绝故意植入语法或拼写错误,本身并不能让结果直接可交。

匹配跑的是你上传的那个文件。所以如果你在生成报告之后大改过,匹配数会更少,提议的范围也会更短。如果你看到的范围明显比报告里的高亮少,通常就是这个原因。

这篇里没有任何检测分数对比,这是刻意的。Turnitin 明说它不会公布其检测器覆盖了哪些改写与绕过工具的名字,因为公开清单会帮助别人规避(AI writing detection FAQs)。这意味着 Turnitin 之外的任何人都无法核实「我们打败了某某检测器」这类说法,所以我不打算说。Turnitin 还表示,其指标不应成为对学生采取行动的唯一依据——当一个数字比你预期的高时,这句话值得记着。

如果新报告仍有符合条件的标记片段,可以免费继续降 AI。这是后续支持,不是对最终数字的承诺。

常见问题

有没有工具只改写 Turnitin 报告里被标红的段落? 有。HumanPen 导入 Turnitin 或 iThenticate 的 AI 检测报告,把高亮段落对回你的源文件,把匹配到的段落展示给你,然后只改写你确认的那些。文件以进来时的格式返回。

我能不能自己手工做? 能,而且如果只有五六段被标红,完全合理。把报告和文档并排打开,逐个找到高亮,自己重写那一段,其余不动,你照样拿到了缩小范围的好处。工具帮你省的是在长 PDF 里做匹配,以及事后不用重新拼装文件。

iThenticate 也支持吗? 支持。两者都会产出 AI 检测报告,都可以用。不能互换的是查重报告——它测的完全是另一回事。

我怎么验证一个工具是不是真的这么做? 在你的报告里找一处从句子中间开始的高亮,把报告喂给工具,看它提议的范围。它应当包含那一整段,而且不应包含前后段落——除非那些段落也被标红了。如果一个工具提议的正好是被高亮的那个片段,它交回来的会是一段由两个人写的文字;而如果它提议的是整节,那它其实并没有在按报告工作。

继续阅读