为什么改写降重之后 Turnitin 的 AI 率反而升高了?

降相似度和降 AI 是两个方向相反的目标,改写工具换上去的词恰好往检测器读的方向走。

HumanPen 团队

· 18 分钟

简短回答

改写工具是为降相似度分设计的,它通过把你原来的词换成意思相同但不再匹配数据库的词来工作。换上去的词往往是高频表达,也就是 AI 生成器默认选的那类语言。Turnitin 的检测器读的是词概率分布,当你的改写文本在这个分布上向 AI 生成的方向靠拢,AI 分就升了。这不是故障,是机制在一个和你目标不同的对象上正常运行。

Turnitin 自己的话说得很清楚:相似度分和 AI 分"完全独立,互不影响"。它们测量的是不同的东西,由不同的流程计算,你对其中一个做的任何操作都不能保证帮到另一个。当它们朝相反方向拉的时候,你用来修第一个的改写工具可能把你推到第二个里。

两个分数,两个目标,一份文档

Turnitin 在检测 FAQ 里直接写了:"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." 相似度分告诉你文本有多少匹配了数据库里的已有内容。AI 分告诉你文本有多少看起来像机器写的。这两个分数不是同一个属性的两面。

改写工具瞄准的是第一个目标。它拿到一个匹配了已有内容的句子,改写成不再匹配的样子。这会降相似度分。但工具实现这一点的方式,是把你原来的用词换成其他词,而那些替代词是从每个意思最常见、概率最高的表达里挑出来的。你原来的措辞可能带个人痕迹,换上去的恰恰是去掉个人痕迹之后的平均结果。

AI 分则是从另一套计算里来的。我们曾在 AI 检测器到底在测什么 里拆过这套流程,简单说就是检测器把文本切成重叠片段,给每段一个概率分,再汇总成文档级数字。改写工具挑的词,现在就是被评分的词。如果这些词恰好聚集在高概率区域,分数就上去了。

检测器实际在读什么

很多人说 Turnitin 的检测器测的是"困惑度"(perplexity)和"突发性"(burstiness)。这个说法不够准确。Turnitin 的 FAQ 写道:"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." 同一段的下一句是:"Instead, it learns statistical patterns from our training data."

但同一页 FAQ 在另一节写了这样的话:"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." 也就是说,模型不是算一个叫"困惑度"的分数然后叫这个名字,它确实在读词概率。困惑度本身就是词概率的一种度量。这个区分很重要,因为只引第一句会让人觉得检测器不看词概率,但第二句会当面推翻这个印象。为什么不同检测器给的分不一样 讲的就是不同工具对同一文本打出不同分的原因,词概率建模是其中的核心。

这对改写意味着什么,其实很简单。你原来的句子有一个词概率分布,那个分布是你自己的词汇、写作习惯、你碰巧读过的东西共同塑造的。改写后的版本有一个新的分布,由工具选的词决定,而工具是从分布的中心选词,不是从边缘选。检测器被训练来读词概率,它看到的改写句子比你的原句更像机器产物。不是因为你用了 AI,而是因为改写后的句子的统计足迹更接近一个。

Turnitin 自己列出的误报形态

这里就不那么舒服了。Turnitin 的 FAQ 列了几种容易产生误报的文本,这个描述读起来像是为改写工具的产出写的规格书:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."

紧跟着的下一句才是关键:"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." Turnitin 在告诉教师:如果这类文本的 AI 分偏高,要打折看待。

改写工具的设计就是只改写、不加新想法。它拿你已有的想法换一种说法。它也倾向于减少结构变化,因为它在全文做风格平滑,而不是引入新的句式。工具不是要让你的文本更多样,而是要让它更不匹配。这两个目标不对齐,而第二个目标把文本推向的恰好是 Turnitin 说的误报易发形态。

我们在 打磨过的文章为什么被标记 里更详细地讲过这个机制,那里讲的和这里是同一件事。平滑本身就是一个统计信号。

检测器的倾斜方向

Turnitin 表态过,它宁可漏检 AI 文本,也不愿误标人类写作。FAQ 写道:"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written."

这个倾斜是真的,也是一篇完全人类写的文档被标记概率低的原因。但它不能像很多人以为的那样保护改写文本。1% 误报率适用的是不符合误报形态的文本。符合那个形态的文本,也就是 Turnitin 自己描述的那种,不在这个 1% 的测量范围内。检测器整体偏向谨慎,但它触发倾斜的那个特征列表,恰好是改写工具装上去的。

如果你用的不是简单的同义词替换,而是 AI 驱动的改写工具,那走的是另一条路。Turnitin 说它 "can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection." 这不是误报,是在另一个信号上的真报,检测器有对应的命名能力。改写了还是被标记 讲的就是你用的工具本身是 AI 模型在做改写时会发生什么。

不是所有改写工具都一样

语法检查器帮你修拼写,和生成式工具帮你重写句子,这两件事有本质区别。Turnitin 自己画了这条线。关于 Grammarly,FAQ 写道:"Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector." 关键的限定词是"in most cases"——这个豁免不是绝对的。

FAQ 接着写:"Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector." 拼写和标点修正是一类,改写和重写是另一类。第二类是 AI 分升高的地方。

Turnitin 不公开它被训练和测试过的改写器和绕过工具名单。FAQ 写道:"However, to safeguard the integrity of our solution and its effectiveness in maintaining academic honesty, we're unable to disclose the names of these tools." 所以 Turnitin 以外没有人能告诉你哪个具体工具被检测、哪个不被检测,任何宣称某个具名工具"能过"检测器的说法,都是无法对照 Turnitin 自有测试来验证的说法。我们不做这种声称,也不建议你信任做这种声称的人。

什么能真正降 AI 分

AI 分下降的前提,是你的文本的词概率分布离开检测器关联到机器产出的那个区域。这件事发生在你引入生成器不会自己选的词汇、句式和想法的时候。只改写不加新想法做的是相反的事,它把分布往中心推。

如果你已经把文本跑了一遍改写工具,AI 分升了,解决办法不是再跑一遍。再跑一遍是用一组高频词换另一组高频词,分布不移动。你需要用你自己的用词、你自己的句式、最好还有你自己的额外分析或例子来重写被标记的段落。这才是让检测器读到的概率分布发生位移的东西。

带着报告操作的具体版,在 怎么读 Turnitin AI 写作报告 里。报告会告诉你哪些片段被标记,那些就是你需要让用词从平均值回到你自己的段落。

我们的边界

HumanPen 是一个文档改写器,这里相关的设计选择是关于什么被改写、什么不被改写。你可以连同 AI 写作报告一起上传文档,只有被报告标记的段落会被改写,其余部分保持原样。

这对本文的意义在于:全文改写是上述机制的最坏情况。它改写所有内容,包括没有被标记的段落,并把所有段落都推向高频中心。限定范围的改写只碰检测器已经标记的片段,目标是移动它们的词概率分布,而不是进一步平滑。

计费只算实际改写的词。如果后续报告仍有段落被标记,那些段落可以免费重跑。我们不会告诉你下一份报告会说什么,因为没有人能。但机制就是机制,限定范围的改写是顺着它工作,不是逆着它。

常见问题

改写一定会升 AI 分吗? 不一定,但频率高到这个模式有名字。Turnitin 把"paraphrased without developing new ideas"(只改写没产生新想法)列为误报易发形态之一。这个形态看的是有没有产生新的分析,而不是句子由哪些编辑动作改出来的。停留在原有想法之内的文本,词概率分布仍然落在检测器被训练去关联 AI 产出的那一侧。你的具体分数会不会升,取决于你原来的文本长什么样、工具换上了什么。

我用 Grammarly 修拼写会升 AI 分吗? Turnitin 说在多数情况下,Grammarly 等语法检查工具的修改"were not flagged as AI-written by our detector"。注意"in most cases"这个限定词。如果你用了 Grammarly 的生成式功能(改写、摘要、起草等),FAQ 说这些内容"will likely be flagged as AI-generated"。

为什么相似度降了但 AI 率升了? 因为它们测的是不同的东西。Turnitin 说两个分数"completely independent and do not influence each other"。改写通过消除匹配文本来降相似度,替换上去的词可能升 AI 分,因为它们倾向于高频表达,而检测器读的词概率分布和 AI 生成文本的分布有重叠。

再跑一遍改写工具能降 AI 分吗? 再跑一遍是用一组常见词换另一组常见词,词概率分布不会朝有用的方向移动。能移动分布的是用你自己的词汇、句式和额外想法重写被标记的段落。

Turnitin 能检测出我用了哪个改写工具吗? Turnitin 说它"trained and tested to detect leading paraphraser and bypasser tools",但不公开名单。FAQ 说公布名单"would make it easier for students to evade our system"。Turnitin 以外没有人能验证某个具体工具是否在名单上。

继续阅读