困惑度与突发性之外,AI 检测器还在测什么
困惑度与突发性可以解释第一代公开检测器,却不是作者身份测试,也已经不足以描述今天的完整系统。现代分类器加入了更多学习信号,但分数该如何解释的问题并没有消失。
HumanPen 团队
· 6 分钟
困惑度与突发度分别衡量什么
困惑度(perplexity)衡量你的用词对语言模型来说有多意外。让这个词流行起来的 GPTZero,把它表述为语言模型有多大可能选出文档里完全相同的那些词。如果下一个词正好是模型会预测的那个,困惑度就低。他们当时公布的经验值是:困惑度高于 85,更可能出自人类。
突发性(burstiness)衡量变化幅度。人类会让句子结构起伏——一个长复句,接一个短平句,再来一个不完整句。而语言模型——按 GPTZero 的说法——写出来的"AI 相似度非常稳定",所以突发性偏低。
统计型检测器可以在句子或段落层面计算这些值:把文本送进一个参照语言模型,问它有多可预测。选哪个模型非常重要——不同模型的训练语料与分词方式不同,对一个模型意外的短语,对另一个可能平平无奇。
两个统计量都是文本的属性,都不是写作者的属性。整个计算过程无从知道是谁在键盘前。
困惑度不是"AI 作者概率"。它通常由下一个 token 的概率经变换、平均得到,绝对数值依赖参照模型。突发性更没有统一口径:厂商可能计算句子困惑度、长度、句法的变化,也可能用自有组合。两个工具都写着同一个词,背后算的可能不是同一件事。
完整检测器还需要决策规则:把句子得分聚合成文档结果、要求最低散文长度、平滑相邻句子,再选择一个兼顾误判与漏判的阈值。即使底层文本特征相同,这些产品选择也足以改变最终显示。
为什么"低困惑度"不等于"AI 写的"
低困惑度意味着用词可预测。而用词可预测有很多种原因,"由模型生成"只是其中一种。
- 用第二语言写作。 只用自己有把握的词是合理的策略,而它产生的正是这个特征——这就是为什么七个检测器把 61% 的人类撰写 TOEFL 作文判成了 AI。
- 写在一个惯例固定的文体里。 方法部分、法律定义、实验步骤。在这些地方,程式化的表述本来就是对的写法,不是破绽。
- 为清晰而修改。 删掉不寻常的结构、抹平不规则节奏,可能让措辞更可预测;实际影响取决于检测器与具体段落。
- 引用或严格遵循模板。 伦理声明、报告清单、标准定义本来就会重复稳定用语。作者原创并不会让这些固定表述在统计上变得新奇。
- 样本过短。 上下文越少,一个程式化段落越容易支配结果。一些厂商因此设置最低长度,而不是假装每个短片段都同样可测。
这里有个让人不舒服的可能性:保守润色可以提高可读性,却不一定改善检测结果。HumanizerBench 榜单提供了一个例子:在其公开测试里,Grammarly 的保义与可读性很高,bypass 率却是 0.0。这项基准不能证明检测器为什么这样反应,也不能推广到样本之外;它能说明的是,写作质量与规避检测是两条不同的评价轴。
可预测不等于抄袭、学术不端或自动生成。清楚、规范、认真修改过的人类文本同样可能很可预测。
检测器更新后,仅靠两个指标已不足以解释结果
这是很多检测器文章会漏掉的部分。GPTZero 在自家页面开头写着:自 2023 年秋起,它已不再使用困惑度与突发性来检测,因为产品转向了深度学习架构;但同一页面后文又把统计方法称为更大系统里的指标。这个表述张力本身就在提醒我们:不能拿两个公开术语概括一个持续变化的产品。
Turnitin 公布了报告分类、适用条件和限制,却没有公开足以复现分类器的模型权重、训练语料与特征流水线。其他商业厂商披露程度各不相同。"深度学习"只是一类方法的名称,不等于测量过程透明。
困惑度与突发性是理解检测器行为的历史模型,不是预测当代商业分数的可靠配方。
深度分类器可能学习到句法、语义和长距离结构的组合,很难逐一命名;它们还可能更新,而旧报告不重新计算。因此,检测器版本、语言覆盖和报告日期都是证据的一部分。缺少这些信息的分数,远没有表面上那么可复现。
这也堵住了一个常见推理:一段话得高分,不会只是因为一个可见习惯,比如重复转折词或常用破折号。删掉某个习惯可能毫无变化,普通修改反而可能移动分数。所谓"AI 词汇清单"既不是分类器解释,也不是可靠的修改建议。
模型更新还会带来双向分布漂移。一个为区分 2023 年人类作文与 2023 年模型输出而训练的检测器,后来会面对新模型、新改写器和变化中的人类写作习惯。重新校准可能改善一个文体,却让另一个变差。因此当前性能必须用当前输出与留出的人类写作重新测量,不能从上线基准或架构名称推出来。
由此能推出什么
从这里能学到的写作技巧不多;真正能得出的结论,是这么一个分数到底值不值得当真。
你拿到的分数来自一个在特定分布上训练和校准的文本分类器。视厂商而定,显示百分比可能表示合格文本中被归入某类的比例,而不是"作者使用 AI 的概率"。它能说明这套系统如何标记这份文档,不能直接说明作者是谁。
- 先看分母。 这是句子置信度、文档置信度,还是符合检测条件的正文占比?三者不是同一个量。
- 再看运行条件。 语言、最低长度、文件类型和排除内容,决定模型到底评估了什么。
- 记录版本与日期。 厂商更新后,同一段文字可能换分类。
- 确认决策规则。 学校拿结果做初筛、谈话还是正式认定?还要求哪些佐证?
对写作者,耐用的建议仍然是普通的作者责任:留草稿、核对来源、保留自己的推理,并为目标读者修改。优化一个隐藏分类器,只是用不稳定目标替换这些真正目标。
对决策者,校准与排序能力同样重要。分类器可能能把生成段落大致排在人类段落之前,却给出与现实概率不对应的百分比。把分数用于实际流程前,应先问百分比代表什么、如何校准、基于哪个人群、在所选阈值上性能怎样变化。缺少这些答案,小数位增加的是界面精度,不是结论确定性。
想看这件事的后果——不同厂商跑同一段文字会发生什么——见为什么同一段文字在不同检测器上分数差很多。如果你手上已经有一份报告,怎么读一份 Turnitin AI 检测报告讲的是那个具体数字在测什么。
继续阅读