为什么同一段文字在不同检测器上分数差很多
在斯坦福那项研究里,91 篇作文中有 89 篇被至少一个检测器标记,却只有 18 篇被全部七个标记。同一批作文、同一天——七个工具在其中 71 篇上各执一词。
HumanPen 团队
· 6 分钟
分歧是可测量的,而且很大
最清楚的公开数字来自那项关于非母语写作者的斯坦福研究,人们引用它通常是为了那个 61% 的误判率。但真正值得看的是下面两个数。
- 91 篇中的 89 篇(97.80%)被七个检测器中的至少一个判为 AI。
- 91 篇中的 18 篇(19.78%)被全部七个判为 AI。
中间差的 71 篇——语料里五分之四——是检测器彼此意见不一致的。同一段文字、同样七个工具、同一次运行。
如果你交的是那 71 篇之一,你会不会被指控,取决于你们学校买的是哪一家。
它们为什么会分歧
因为它们不是同一种测量的不同实现。它们是不同的产品。
- 底层模型不同。 一个用 GPT-2 算困惑度,另一个跑专门训练的深度学习分类器——两个检测器面对同一个句子,问的根本不是同一个问题。
- 架构随时间分岔。 GPTZero 在 2023 年秋放弃了困惑度与突发性,其他家没有。跨厂商比较,某种程度上是在比较不同世代的方法。
- 训练分布不同。 "什么算平平无奇的人类写作"取决于分类器见过谁的写作。这正是 ESL 偏差的成因,而它逐家不同。
- 阈值与呈现规则不同。 Turnitin 现在对 20% 以下不给任何数字,别家在每个档位都报数。同一个底层判断,在你看到之前就已经被呈现成不同的样子。
有些检测器几乎不输出连续刻度
还有一层,任何想比较分数的人都会撞上。有几个检测器实际上并不产出连续概率——它们把输出推向 0 或 1,于是一段文字要么没事、要么被判死刑,中间几乎没有过渡。
HumanizerBench 对每个样本跑五个商业检测器,而它取中位数而不是平均数,理由正是这个:集合里有二值化的检测器时,一个离群值能把均值挪动 0.25。它的方法论页面直接这么写。
所以"几个检测器的平均值"并不比单个检测器更可靠。把一个连续刻度和一个非此即彼的判定放在一起求平均,在统计上本来就没有意义;把文稿过几个工具看"大多数怎么说",并不能得到它看上去能给的那种安心。
那该怎么办
由此有三条推论,都与写作技巧无关。
- 只有一份报告是要紧的:你们学校跑的那一份。 拿自己的稿子去另一家检测器上试,得到的是那一家的看法。考虑到上面的分歧率,它无法预测最终挂在你名字上的那个分数。
- 第二意见判你没事不等于洗清,判你有事也不等于证据。 两者都只是某一个分类器的输出,而同一份文本,另外几个分类器读出来是别的结果。
- 问清楚这个分数被用来做什么。 Turnitin 声明它不判定学术不端,只提供数据供教师判断。一个七个工具能给出七种读数的东西,只是开启对话的依据,不是对话的结论。
想知道这个数字一开始在测什么,见AI 检测器实际在测什么。如果你已经有一份 Turnitin 报告,导入它就能从它真正标记的段落看起,而不是从那个总百分比看起。
继续阅读