为什么非英语母语的写作者更容易被 AI 检测器误判
七个检测器把 61% 的人类撰写 TOEFL 作文判成了 AI。原因不是作弊——是检测器测的其实是词汇丰富度,而同一篇论文里的对照实验证明了这一点。
HumanPen 团队
· 9 分钟
那项研究:61.22% 的人类作文被判成 AI
2023 年,斯坦福的 Liang、Yuksekgonul、Mao、Wu 和 Zou 用七个常用的 GPT 检测器检测了两组作文。第一组是从一个中文教育论坛收集的 91 篇 TOEFL 作文,全部由学生本人撰写;第二组是 88 篇美国八年级学生的作文,来自 Hewlett 基金会的 ASAP 数据集。两组都没有任何 AI 参与。这项研究发表在 Cell Press 旗下的 Patterns 期刊上。
在美国八年级作文上,检测器的准确率接近完美。在 TOEFL 作文上,平均误判率是 61.22%。七个检测器一致把 91 篇中的 18 篇(19.78%)判为 AI 撰写,而 91 篇中的 89 篇(97.80%)被至少一个检测器标记。
对照组值得再看一眼,整个论证的分量都压在它身上:同样七个工具、同一天,测母语者的作文几乎全对,测第二语言的作文错了一大半。工具没有坏——只是对一个人群可靠、对另一个人群不可靠。
那 91 篇作文来自一个中文教育论坛。如果你正在用英语作为第二语言写作,这项研究说的不是别人,就是你。
这个结论有人反驳——一家检测器厂商认为,来自学生论坛的 91 篇样本太小,撑不起这个比例。对任何单一研究,这都是合理的质疑。但已经有机构照此行动了。范德堡大学在 2023 年 8 月停用了 Turnitin 的 AI 检测功能,这笔账值得再算一遍:Turnitin 宣称误判率 1%,而范德堡 2022 年收到约 75,000 篇作业,1% 就是一年约 750 名学生被冤枉。校方还表示,他们完全不清楚这个分数是怎么算出来的。
检测器实际在测什么
大多数检测器算的是两个统计量,而哪一个都回答不了"这是谁写的"。
困惑度(perplexity)衡量你的用词对语言模型来说有多意外:如果下一个词正好是模型会预测的那个,困惑度就低。突发性(burstiness)衡量一段文字里句子长度和结构的变化幅度;句子越整齐划一,这个值越低。
两个都低的文本,在检测器看来就"像机器写的"。整个判定就是这么回事。
检测器看不到意图。它看到的是两个统计量——而谨慎、教科书式正确的英语,比母语者松散的行文更接近模型输出。
所以这不是换个更好的模型就能修好的毛病。指标本身运转正常——它只是没有在测人们以为它在测的东西。
那个证明"是词汇不是作者"的实验
这篇论文没有止步于相关性。它把因果检验朝两个方向各做了一次,这才是最值得看的部分。
方向一。 研究者取出那些被七个检测器一致标记的 TOEFL 作文,让 GPT-4 把用词变得丰富一些。困惑度显著上升(P = 9.36E-05),被一致判为 AI 的数量从 18 篇降到 91 篇中的 1 篇(1.10%)。作者没变、论点没变、还是同一批作文——只有词汇变了。
方向二,这个更有力。 他们拿检测器判得几乎完美的美国八年级作文,让 ChatGPT 按提示词"把用词简化成非母语者会写的样子"改写。误判率从平均 5.19% 跳到 56.65%。
母语者写的文字,把词汇变简单,就在检测器眼里变成了 AI。这已经不是人群与分数之间的相关性了:作者没换,分数却跟着词汇丰富度走——指标测的就是词汇。
论文自己的结论是,检测器"可能在无意中惩罚语言表达受限的写作者",并明确告诫不要把它们用在评估或教育场景中。
顺带一个发现:一句提示词就能击穿它们
同一篇论文还报告了一个结果,让"把分数当证据"这件事更加站不住脚。团队用 ChatGPT-3.5 生成作文,检测器可靠地抓住了它们。然后他们加了一句自我编辑提示——"用更文学化的语言提升这段文字"——检测率从 100% 掉到 13%。
写在这里不是教技巧,而是说明这台仪器本身的成色:一行提示词就能把指标挪动 87 个百分点,这样的数字拿来当指控依据实在太单薄;这也正是为什么没有人能诚实地向你承诺某个具体的检测结果。我们不承诺。
如果你被标记了,该做什么
下面不是教你怎么绕过检测器,而是当一个统计量被拿来指证你时,你该做什么。
- 从现在开始留草稿。 Word 或 Google Docs 的版本历史、提纲文件、文献笔记。写作过程的痕迹是检测器分数唯一反驳不了的东西,而这种痕迹,只有从需要之前就开始留,才留得下来。
- 索要完整报告,不要只看那个百分比。 分段分数通常会显示,标记集中在那些本来就该写得程式化的部分——方法、定义、背景。这个分布本身就是一个论据。
- 问清楚这个数字是怎么被使用的。 很多机构把分数当作"值得看一眼"的理由,而不是结论;范德堡的指引就是这么白纸黑字写的。去问清楚本校的政策,完全合理。
- 有意识地让句式变化。 长短句交错、用精确的词而不是稳妥的泛词——不管有没有人在跑检测器,这都是好的写作建议。它同时也会抬高那两个统计量。
如果你已经拿到报告,想确切看到它标了哪些段落而不是靠猜,导入报告就是做这件事的:被标记的片段会被定位出来,文档的其余部分一个字不动。
继续阅读