AI 检测器实际在测什么:困惑度与突发性
两个统计量,哪一个都回答不了"这是谁写的"。而且被引用最多的那个检测器,2023 年就已经不再用这两个指标了——这改变了你能从一个分数里推出什么。
HumanPen 团队
· 7 分钟
那两个统计量
困惑度(perplexity)衡量你的用词对语言模型来说有多意外。让这个词流行起来的 GPTZero,把它表述为语言模型有多大可能选出文档里完全相同的那些词。如果下一个词正好是模型会预测的那个,困惑度就低。他们当时公布的经验值是:困惑度高于 85,更可能出自人类。
突发性(burstiness)衡量变化幅度。人类会让句子结构起伏——一个长复句,接一个短平句,再来一个不完整句。而语言模型——按 GPTZero 的说法——写出来的"AI 相似度非常稳定",所以突发性偏低。
基于这两个指标的检测器逐句计算它们,通常是把你的文本喂进一个较小的开源模型(比如 GPT-2),问它这段有多可预测。
两个统计量都是文本的属性,都不是写作者的属性。整个计算过程无从知道是谁在键盘前。
为什么"低困惑度"不等于"AI 写的"
低困惑度意味着用词可预测。而用词可预测有很多种原因,"由模型生成"只是其中一种。
- 用第二语言写作。 只用自己有把握的词是合理的策略,而它产生的正是这个特征——这就是为什么七个检测器把 61% 的人类撰写 TOEFL 作文判成了 AI。
- 写在一个惯例固定的文体里。 方法部分、法律定义、实验步骤。在这些地方,程式化的表述本来就是对的写法,不是破绽。
- 为清晰而修改。 删掉不寻常的结构、抹平不规则的节奏,正是认真修订在做的事。它把两个统计量都压低了。
第三条有个让人不舒服的推论:把文章改得更精致,可能让它更像机器写的。 这不是假设。在 HumanizerBench 榜单上,Grammarly 的保义分是全场最高的 94.3、可读性满分 100.0,而 bypass 分是 0.0——它改得保守而干净,也正因如此,它的输出在检测器眼里像机器。
你刚读到的解释,对提出它的那个工具已经过时了
这是大多数讲检测器的文章会漏掉的部分。GPTZero 在自己那篇解释文章的开头明确写着:自 2023 年秋起,它已不再使用困惑度与突发性,转向了深度学习架构。这两个统计量降级为七个信号中的一个组件,不再是机制本身。
而 Turnitin 从未公布过自己的方法。
所以现状是:关于检测器如何工作的标准解释,描述的是最知名的那个检测器已经放弃的做法;而部署最广的那个检测器,从来没有描述过自己的做法。
这个区别是实打实的。如果机制还是两个公开的统计量,你至少可以推理什么会、什么不会触发标记。面对未公开的深度学习分类器,你推理不了——读你分数的那个人同样推理不了。
由此能推出什么
从这里能学到的写作技巧不多;真正能得出的结论,是这么一个分数到底值不值得当真。
你拿到的那个分数,是一个没有公开过原理的分类器算出来的;它的训练数据里有没有你这类写作者,谁也不知道。这个分数只能说明"这篇文档在统计上有某些特征",说明不了作者是谁。
想看这件事的后果——不同厂商跑同一段文字会发生什么——见为什么同一段文字在不同检测器上分数差很多。如果你手上已经有一份报告,怎么读一份 Turnitin AI 检测报告讲的是那个具体数字在测什么。
继续阅读