改完之后 AI 率反而升上来了
那个百分比不是把逐句判定加起来得到的,所以它没有理由跟着「你改好了几句」一起往下走。三条已公开的计算细节,任何一条都能在你改对方向的同时把数字推高。
HumanPen 团队
· 20 分钟
先给结论
第二份报告比第一份高,并不是对你这轮修改的打分。Turnitin 公开过的计算过程里,有三处各自就能把百分比推上去。第一,句子是在互相重叠的片段里被打分的,所以你改一句,会改变它旁边那些句子所处的片段,影响范围不受你改动位置的限制。第二,百分比只在合格散文(qualifying text)上计算,所以一轮把散文搬出正文的修改会让分母变小,而被标记的那部分一动没动。第三,你数得出来的高亮和封面上的那个数字是两个量,同一份报告里它们完全可以朝相反方向走。
这些都不等于「改错了」,也不等于文字变差了。它说的是:被报出来的这个量,并不像「百分比」这个词让人以为的那样可加。下面把三条机制各自摆在它的出处旁边,再加一条只在「这轮修改同时把篇幅砍短了」时才发作的,最后说一个数字往上走能证明什么、不能证明什么。
你改的地方,影响从来不止那一处
先看一句话是怎么拿到分的——答案是它并没有自己的分。Turnitin 的 FAQ 用一段话描述了整条流水线,原话的意思是这样:
提交进来之后,句子会被抽出来、切成互相重叠的片段送去预测;每个片段由模型判一个 0 到 1 之间的值,表示这段更像人写还是更像 AI 生成;片段里的每个合格句子继承所在片段的分数;因为片段互相重叠,有些句子会同时拿到多个分数,再池化成一个;这些句子分数再被汇总,算出整篇文档的 AI 写作分。
这段里真正要命的是两个词:重叠,和池化。一个句子同时落在不止一个片段里,而片段是整块判的。所以一句话身上带的每一个分数,都有它左右邻居的贡献在里面。
于是你改写一句,就等于改动了它前后几句的打分输入——不管你有没有碰那几句。你特意没动的一段,可能因为包含它的片段里换了别的文字而这次被标红;反过来的情况也会发生,只是没人会为这种情况来提问。
片段的边界本身,在厂商自己的叙述里也是会动的。在 2023 年 5 月 24 日的一条 release note 里,Turnitin 说明了它为减少文档首尾误报所做的改动,然后补了一句:
我们同时改进了片段边界的识别精度,这在少数情况下会导致边界与上一个版本相比发生变化。
那是 2023 年的一次改进,不是在描述现在的缺陷;引它只为一个很窄的用途:片段边界是计算过程的一部分,而且 Turnitin 公开记录过自己会调整它。FAQ 也明确公开了池化与汇总这两步的存在。没有公开的是具体池化规则、权重和汇总算法。所以在提交之前,没有办法推算某一处改动会牵动哪些邻居、往哪个方向牵动。
分母会在你没看的地方挪动
第二条机制跟「判得准不准」毫无关系,它是算术,而且是最容易造成意外的那一条。
合格文本只包含散文句子,也就是说我们只分析那些以标准语法句子写成的文本块,不包含列表、项目符号(短的非句子结构)以及其它非句子结构。这个百分比不一定是整份提交内容的百分比。
代进数字看一遍。假设第一版有 6,000 词合格散文,其中 1,800 词被标记,就是 30%。第二版你改写了 300 词被标记的内容,它们不再被标记,剩 1,500 词。同一次修改里,因为导师说讨论部分读起来吃力,你把其中 2,400 词改成了要点列表加一张数据表。现在合格散文只剩 3,600 词。1,500 除以 3,600 差一点到 42%。这一轮修改里,被标记的文字比上一版更少、也没有任何新增的标记,分数却涨了十二个点。
| 你可能做过的改动 | 它对合格散文做了什么 |
|---|---|
| 把三段正文改成了要点列表 | 这些词离开了分析范围。Turnitin 明确把项目符号等短的非句子结构列为不分析的对象 |
| 把一段描述搬进了表格 | 取决于搬进去的是什么。2023 年 8 月的一条 release note 说表格里的长文散文现在会被处理;而一张数字表本来就不是散文 |
| 又补了二十条参考文献 | 什么都没发生。同一条 release note 说,生成 AI 写作报告时参考书目被整体排除 |
| 为了压字数删掉了 1,500 词没被标记的正文 | 分母变小,被标记的占比上升,而被标记的那些字一个都没改 |
这两条 release note 的结尾是同一句话:已有的提交需要重新提交,改动才对它生效——所以它们讲的是现在的报告怎么生成,而不是旧报告当时怎么算的。另外,上面这张表不是建议。其中两行描述的是把文档改得更难读,而收到一份用要点列表写成的讨论章节的老师是看得出来的。知道这张表的用处是诊断:如果其中一行正好描述了你这轮改动,那么数字的移动就有了一个与「你的句子读起来像不像 AI」无关的解释。参考文献那一栏另有一团乱麻,我们在为什么 Turnitin 把我的参考文献标红了里拆过。
高亮变少,和数字变小,是两件事
大多数人先看高亮,因为「标红的段落变少了」是最有进展感的那部分。而 Turnitin 直接写明了这两者可以对不上:
这意味着,一份包含多种写作类型的文档,会出现百分比与高亮不一致的情况。
所以「我这次标红的段落比上次少,数字反而更高了」不是一个需要解释的矛盾,它只是两个分母不同的量被当成了同一个来读。而在 20% 这条线以下,根本没有东西可数:1% 到 19% 区间里,Turnitin 既不给分数也不给高亮,所以一份看不到任何高亮的报告,不等于一份什么都没被标记的报告。整份报告有哪些部件、各自怎么读,我们在怎么读一份 Turnitin AI 检测报告里逐项过了一遍。
篇幅越短,结果越不稳
如果这轮修改同时也是一次删减,那还有第四条机制,而且它专挑短文出手:
在只有几百词的短文档里,预测会趋近于「全有或全无」,因为我们是在单个片段上预测,没有重叠的机会。这意味着,一些混合了 AI 生成内容与原创内容的文本,可能被整体判定为 AI 生成。
长文里那种把噪声抹平的重叠,在短文里不存在;而 Turnitin 描述的这种失效方向是往上走的:混合内容被整篇判成 AI。再往下还有一条地板线——文件要求写着至少要有 300 词散文才会生成报告,这一段我们放在Turnitin 能查一整篇学位论文吗里讲过。夹在这两者之间的是:一次把篇幅改短的修改和一次把文字改掉的修改,等于同时做了两个实验,而报告只还给你一个数。
数字往上走,能证明什么、不能证明什么
报告里没有任何地方记录了你改过什么。它没有一个字段把这次移动归因到某一处改动。所以这次上升是关于两个文件的一次观测,不是对这中间那段工作的评价。
- 它不能证明你的改动让文字更像 AI 了。按上面几条机制,完全可能出现「你改写过的每一句这次都干净了,而数字反而更高」。
- 它不能证明第一个数字才是可信的那个。两份报告是两次独立输出,谁也没有解释自己为什么与另一份不同。
- 它不能证明下一步该再改一轮文字。如果动的是分母,那么再在散文上改一轮,只动得了分子。
Turnitin 的 FAQ 上还有一句话属于这个话题,而它被引用时通常只剩前半句:
有时候误报(把人写的文本错误地标为 AI 生成)会出现在这类内容上:结构变化不多的内容、字面上自我重复的文本、或者只做了改写而没有产生新想法的文本。如果我们的指标在这类文本上显示了较高的 AI 写作占比,我们建议你在看这个百分比时把这一点考虑进去。
读到最后一句就会发现,这不是冲着你来的指控。这是厂商在点名它自己的模型可能误判的几类人类写作,然后提醒拿着报告的人在看百分比时把这种可能性考虑进去。如果现在有位老师正盯着一个升上去的数字,这条提醒就印在同一页上。基于前半句展开的手改清单在不用工具怎么给 AI 文本去味,把两份报告逐段对照而不是拿总数比总数的做法在重查之后还是被标红。
按报告圈定范围的改写,位置在哪
上面讲的全部指向同一件事:范围。既然改一句会改变它邻居所处的片段,那么可改的最小单位就比一个句子要大;而你自己满意的那些段落,值得原封不动地留在那儿。
HumanPen 的公开报告页描述的就是这种范围:上传 DOCX 时附上 Turnitin 或 iThenticate 的 AI 报告,由被标记的片段界定改写内容,其余部分保持不动。公开 humanize 页面还写明,费用按实际被改写的词数计算,不按整份文件的大小计算。
如果后续报告仍有符合条件的标记片段,可以免费继续降 AI。这条服务规则不是对结果的预测:它没有说下一份报告会是多少,而 Turnitin 也没有公开某处改动与分数移动之间的对应关系。
常见问题
改完重查,Turnitin 的 AI 率真的会变高吗? 会,而且没什么反常的。这个百分比不是由逐句判定拼起来的,所以它没有理由跟着「修好了几句」走。重叠片段、合格散文总量的变化、以及文档变短,任何一条单独就能把它推上去。
数字变高是不是说明我越改越糟? 单凭这个不能。报告里既没有记录你改了什么,也没有把这次移动归因到任何一处改动。一个上升的数字,和「改动生效了」「改动没起作用」「文档结构在计算底下变了」这三种情况都相容。
标红的句子比上次少了,百分比却更高,哪个是准的? 都准,因为它们不是同一个量的两种看法。Turnitin 说过,包含多种写作类型的文档会出现百分比与高亮不一致:百分比只在合格散文上算,而高亮标在整份文件上。
我为了压字数删了很多内容,分数就跳上去了,为什么? 多半是分母。百分比在合格散文上计算,删掉没被标记的散文会抬高被标记部分的占比,而被标记的文字一个字没动。如果删完只剩几百词,Turnitin 还说过短文档的预测趋近于全有或全无。
是不是干脆整篇重写算了? 这是那个数字最容易诱使人做的反应,而证据通常撑不起它。先把两份报告里高亮的位置对一遍,再决定动多少;数字、引文、定义、方法步骤这类靠精确措辞承载意义的地方,应当冻住不动。
继续阅读