为什么非英语母语的写作者更容易被 AI 检测器误判

一项研究中,七个检测器平均将约 61% 的人工撰写 TOEFL 作文样本误判为 AI 生成。研究还发现,保持作者和论点不变、只调整词汇,就能改变检测结果;这一样本不能代表所有非英语母语写作者。

HumanPen 团队

· 8 分钟

那项研究:61.22% 的人类作文被判成 AI

2023 年,斯坦福的 Liang、Yuksekgonul、Mao、Wu 和 Zou 用七个常用的 GPT 检测器检测了两组作文。第一组是从一个中文教育论坛收集的 91 篇 TOEFL 作文,全部由学生本人撰写;第二组是 88 篇美国八年级学生的作文,来自 Hewlett 基金会的 ASAP 数据集。两组都没有任何 AI 参与。这项研究发表在 Cell Press 旗下的 Patterns 期刊上。

在美国八年级作文上,检测器的准确率接近完美。在 TOEFL 作文上,平均误判率是 61.22%。七个检测器一致把 91 篇中的 18 篇(19.78%)判为 AI 撰写,而 91 篇中的 89 篇(97.80%)被至少一个检测器标记。

真正重要的是两组之间的落差。同样七个工具,在美国八年级作文上的表现远好于 TOEFL 样本。这不能给所有多语写作者或今天的所有检测器定出误判率,却足以说明:一个漂亮的总体准确率,可能掩盖某类写作人群糟糕得多的结果。

61.22% 是这批样本和七个 2023 年检测器的结果,不是你个人被标记的概率。这项研究警示的是误差不平等,不能拿来给每个人算命。

这个结论有人反驳。一家检测器厂商认为,91 篇作文全部来自同一个学生论坛,样本太小、来源太窄,不能推出普遍比例。这些限制确实存在:它是便利样本,两组学生除了语言背景,年龄也不同;检测器产品从 2023 年至今也已经更新。因此,站得住的结论应当比标题窄一些:研究发现了巨大的群体差异,机构不能假定它不存在。

一些机构从风险角度得出了同样谨慎的选择。范德堡大学在 2023 年 8 月停用了 Turnitin 的 AI 检测功能。校方指出,即使按厂商宣称的 1% 文档级误判率计算,面对每年约 75,000 份提交,也会产生沉重的复核负担。这笔账只是规模示意,不是说必然有 750 名学生受指控:并非每份作业都符合检测条件,实际基准率未知,一次标记也不必然变成处分。真正的结论是,小比例到了机构规模,仍然需要公平的程序承接。

什么样的证据会更强?需要更大规模、预注册的研究,覆盖不同第一语言、语言水平、学科与作业类型;对照组年龄相匹配;按检测器版本分别报告;同时给出误判和漏判。只有总体准确率远远不够。准备部署的机构应当问:厂商是否测过自己真正面对的学生人群,能否提供分组结果,而不是把另一个语料上的标题数字直接搬过来。

落到个人报告上,斯坦福的数字和厂商基准都不能直接定案。相关的是本地证据:哪些文字符合检测条件、高亮在哪里、运行的是哪个模型版本、作业允许什么、学生草稿如何形成。群体研究告诉复核者应当认真考虑哪一种故障,却不能替代对具体作品的审查。

检测器实际在测什么

早期公开的检测器说明主要围绕两个统计信号:困惑度与突发性。今天的商业系统可能组合许多学习到的信号,内部机制通常也不公开,所以这两个词更适合用来理解问题,而不是当作所有现行产品的完整说明。

困惑度(perplexity)衡量你的用词对语言模型来说有多意外:如果下一个词正好是模型会预测的那个,困惑度就低。突发性(burstiness)衡量一段文字里句子长度和结构的变化幅度;句子越整齐划一,这个值越低。

在使用这类信号的检测器里,低困惑度与低变化度可能推动文本被判得更像机器。但这不是通用测试;同一段话换一个参照模型,困惑度就可能不同。分类器还要组合各个信号,并选定在哪个阈值上给出标签。

检测器观察不到作者身份和写作意图。它只能读取提交文本的特征,再与训练数据里学到的模式比较。

这个区别对第二语言写作尤其重要。工作词汇量较小、重复使用有把握的句型、严格遵循课堂范文,都可能接近生成文本的一些表面特征。更好的分类器或许能降低误差,但再好的架构也不能把"文本相似"变成对"谁写的"直接观察。

阈值同样关键。阈值调低,会抓到更多生成文本,也会放进更多人类文本;调高则相反。厂商公布的准确率,只描述某个数据集、某个工作点,不能保证它在不同语言水平、学科、文档长度和后续模型版本上同样有效。

实验发现:只调整词汇也会改变检测结果

这篇论文没有停在两组人群的相关性上,而是朝两个方向改动语言,同时保留原作文和论证。这让作者提出的机制更有说服力;不过,模型改写的不一定只有词汇,因此它仍然没有把词汇与所有其他文体变化完全隔离开。

方向一。 研究者取出那些被七个检测器一致标记的 TOEFL 作文,让 GPT-4 把用词变得丰富一些。困惑度显著上升(P = 9.36E-05),被一致判为 AI 的数量从 18 篇降到 91 篇中的 1 篇(1.10%)。作者没变、论点没变、还是同一批作文——只有词汇变了。

方向二,这个更有力。 他们拿检测器判得几乎完美的美国八年级作文,让 ChatGPT 按提示词"把用词简化成非母语者会写的样子"改写。误判率从平均 5.19% 跳到 56.65%

底层作文的作者没有改变,分类却大幅改变。这支持表层语言,尤其是词汇多样性,对结果存在因果作用,而不是检测器能看到某个写作者的人口标签。不过 GPT-4 和 ChatGPT 还可能改变句法、节奏和措辞,因此把结论写成"词汇是唯一原因"仍然过头。

论文自己的结论是,检测器"可能在无意中惩罚语言表达受限的写作者",并明确告诫不要把它们用在评估或教育场景中。

这个结果也解释了为什么要求多语写作者"写得更正式"有时会适得其反。学术写作训练常常奖励标准衔接、保守词汇和整齐句式,这些选择可能有利于清晰,却恰好减少了旧式统计检测器视为人类证据的变化。解决办法不是硬塞华丽词汇,而是不要把检测器当成作者身份测试。

顺带一个发现:一句提示词就能击穿它们

同一篇论文还报告了一个结果,让"把分数当证据"这件事更加站不住脚。团队用 ChatGPT-3.5 生成作文,检测器可靠地抓住了它们。然后他们加了一句自我编辑提示——"用更文学化的语言提升这段文字"——检测率从 100% 掉到 13%

写在这里不是教技巧,而是说明这台仪器本身的成色:一行提示词就能把指标挪动 87 个百分点,这样的数字拿来当指控依据实在太单薄;这也正是为什么没有人能诚实地向你承诺某个具体的检测结果。我们不承诺。

这个结果也有两个边界。第一,它描述的是 2023 年受测的七个检测器和当时的模型输出,不代表 2026 年所有产品。第二,"不容易被绕过"和"对人类写作者公平"是两个不同属性:检测器可以变得更难规避,同时仍然保留不均等的误判。今天做评估,必须在真实使用的人群与文体上同时检验这两点。

检测器可以适合做初筛,却未必可靠到足以裁决。后果越严重,越需要独立证据和程序复核。

如果你被标记了,该做什么

下面不是教你怎么绕过检测器,而是当一个统计量被拿来指证你时,你该做什么。

  • 从现在开始留草稿。 保留 Word 或 Google Docs 的版本历史、提纲、文献笔记和导师反馈。这些材料能显示作品如何逐步形成,比另一个检测器的截图更接近作者身份问题。
  • 索要完整报告,不要只看那个百分比。 段落高亮能显示标记是否集中在方法、定义或背景等惯例化部分。除非报告真的给了分段概率,不要把高亮误称为"分段分数"。
  • 问清楚这个数字是怎么被使用的。 索要课程或学校政策、检测器与版本,以及分数之外还考虑了哪些证据。很多机构只把标记当作复核起点。
  • 按含义与作者责任修改。 删掉你自己不会使用的说法,核对每条事实与引文,并确保能解释论证。不要为了制造句长变化而扭曲本来清楚的文字。

如果正式程序已经启动,保留提交文件原样,只在副本上做标注。写一条简单时间线:何时检索、起草、收到反馈、完成修改。要求获得足够时间审阅证据;规则允许时,请学生顾问或代表陪同。关于正式回应的准备,可继续看被误判后怎么准备申辩

如果你是教师,不要等学生先提出偏差问题。提前规定由谁复核标记、需要哪些佐证、如何考虑语言背景与残障,以及怎样向学生提供底层报告。只有当人的流程真的能够否定工具时,工具才可能只是可选初筛。

继续阅读