英语不是母语,作文会被 AI 检测器误判吗?GPTZero「914 篇零误判」测了什么
如果英语是你的第二语言,你大概读到过这种说法:AI 检测器更容易把你们写的东西判成 AI。2026 年 10 月 5 日同一天出了两组新数字,一组是 GPTZero 测自家模型,一组是大学研究者测 Pangram,结论都是几乎没有学习者作文被判成 AI。下面讲清两项测试各用了什么材料、「零」能证明什么不能证明什么,以及引发这场担心的 2023 年那项研究为什么依然成立。
HumanPen 团队
· 12 分钟
英语不是母语,作文会被 AI 检测器误判吗?
就两款检测器、一类作文而言,最新的数字非常低。GPTZero 说,它现在的模型 GPTZero 4o 把一个它没用来训练过的测试集里 914 篇英语学习者的作文全部判为人写。同一天,马里兰大学、Google DeepMind 和西蒙菲莎大学的研究者发布了一篇预印本,用 Pangram 4 检测 3,909 篇英语学习者作文,判为 AI 的比例是 0.0%。两批作文都出自美国中学生之手,两项研究也都没有测 Turnitin。
这个「零」要连着限定条件读。GPTZero 的测试是它自己做、自己发布的;而且 914 篇里 0 篇,真实误判率仍可能高到约三百分之一。它也推翻不了引发这场担心的 2023 年斯坦福研究:在那项研究里,2023 年 3 月在线的 GPTZero 把 91 篇托福作文判了 52% 为 AI,那些作文每一篇都不到 150 词。模型、作文、篇幅都不一样,所以两个结果并不矛盾;哪一个都不是对你那篇作文的保证。
GPTZero 测了什么
这篇博文题为 "Biased Against ESL and Students with Disabilities? We Put GPTZero 4o to the Test"(对母语非英语者和残障学生有偏差?我们拿 GPTZero 4o 测了一遍),作者 Anna Gao,2026 年 10 月 5 日发在 GPTZero 官方博客上。GPTZero 9 月 24 日发布 4o,并说从 9 月 20 日起它已是所有用户的默认模型。
作文来自 PERSUADE 2.0,这是一个研究语料库,收了 25,000 多篇美国 6 到 12 年级学生写的议论文,建库目的是改进自动写作反馈。每篇作文都附有作者信息,包括这名学生是否被认定为英语学习者,以及是否有 IEP 或 504 计划(美国学校为残障学生制定的支持计划)。2.0 版是在 PERSUADE 1.0 那批作文上加了评分;1.0 只收至少 150 词、且至少 75% 的词拼写正确的作文,平均篇幅 402 词。PERSUADE 1.0 在 2022 年 10 月就已在期刊上发表,早于 OpenAI 公开发布 ChatGPT(2022 年 11 月 30 日),所以这些作文不可能是用 ChatGPT 写的。
GPTZero 检测的是它所说的 "PERSUADE2.0's official held-out test split, which GPTZero 4o was not trained on"(PERSUADE 2.0 官方的预留测试集,GPTZero 4o 没有用它训练过)。其中有 914 篇英语学习者作文、1,172 篇有 IEP 或 504 计划的学生作文,两组重叠 147 篇。GPTZero 4o 把它们全部判为人写。博文里的图表把 914 篇学习者作文全部放在「人写概率」刻度最顶端的那一根柱子里;两组重叠的 147 篇,最低分是 0.997。
博文有两件事没说。一是多少分才算「人写」,它没给。二是 PERSUADE 其余的部分有没有拿去训练 4o,它也没说。那部分训练集自 Kaggle 上的数据科学竞赛 Feedback Prize 2021 起就是公开的,和测试集出自同一个语料库,都是美国 6 到 12 年级学生的议论文。所以这个预留测试集对同类作文是公平的检验,对一份大学实验报告就弱得多。
这还是 GPTZero 用自己挑的数据集测自己的产品,发在自己的博客上,没有附代码,也没有附被检测的作文。这不等于数字有错,只是说你读到的是公司对自家产品的陈述。GPTZero 自己也说这个结果是 "a great milestone; however, it is not a finish line."(一个了不起的里程碑,但不是终点线。)
914 篇里 0 篇,能说明什么、不能说明什么
914 篇里 0 篇是一个计数,定不出比率。914 篇、零误判,真实误判率仍可能高到约 0.33%,大约三百分之一。这是「914 次里发生 0 次」时常用的 95% 置信上限。很低,但不是零。
第二个限制不那么显眼。GPTZero 发布 4o 时的博文写的是 "only 1 false positive out of 10,402 essays"(10,402 篇作文里只有 1 篇误判),说的是 PERSUADE 测试集。这个测试集总共就是 10,402 篇,所以 914 篇正出自其中。按我们的算法,假如学习者被误判的频率和其他人完全一样,914 篇里预期只有约 0.09 篇误判,也就是说几乎每次都会看到零。假如学习者被误判的频率是其他人的十倍,看到零的机会仍至少有十分之四。
所以,914 篇里 0 篇说明不了学习者和其他学生受到同等对待:这么大的样本分不出这两种情况。它能说明的是,在这批作文上,所有人的误判率都很低,学习者也在内。
独立测试:Pangram 4 检测 3,909 篇作文
第二组数字在预印本 "IdeaLens: Detecting AI Ideas in Long-form Writing"(IdeaLens:检测长文中的 AI 想法)的附录里,作者是 Rishanth Rajendhran 等八人,2026 年 10 月 5 日发布在 arXiv 上。论文的主角是作者自己做的研究用检测器;商用检测器 Pangram 4 是它在 19 组普通人写文本上的对照之一。这项测试不是 Pangram 做的,不过作者在致谢里感谢了 Pangram 提供的研究额度,论文也还没有经过同行评审。
19 组里有一组叫 ELLIPSE,这个语料库收了约 6,500 篇美国 8 到 12 年级英语学习者的作文。每篇都是在美国全州年度统考中,用电脑在 25 到 30 分钟内写成的。经过培训的评分员给每篇作文的英语水平打 1 到 5 分,1 分代表能力有限,5 分代表 "native-like facility"(接近母语的熟练程度)。论文用了其中 3,909 篇。我们核对过,这个数字以及按年级、按分数的分布,和语料库公开的训练集文件相差不超过一两篇(文件里是 3,911 篇)。3,909 篇里约 70% 不到 500 词。
作者的判定规则是:Pangram 给出的 AI 占比加上「AI 辅助」占比的一半,合计达到一半,就算判为 AI。按这条规则,Pangram 把 3,909 篇中的 0.0% 判为 AI。这个数字四舍五入到一位小数,所以最多容得下一篇。作者公开的结果文件里,每个水平分档也都是 0.0%,只是各档人数很不均匀:最低档 8 篇、最高档 28 篇,第 2、3、4 档各有一千多篇。
在这里,拿基准率来比是行得通的,因为同一篇论文给出了 Pangram 在普通人写文本上的整体表现:19 组评测平均下来,Pangram 把 0.3% 的人写文本判为 AI。这个平均值主要由两组拉高:一组是混合多种文体的人写文本基准,一组是专家对研究提案的评审意见。19 组里有 15 组是 0.0%,ELLIPSE 是其中之一。其余各组从审稿意见到网页都有,所以这是拿学习者和 Pangram 对人写文本的一般表现比,而不是和母语同学比。两项新测试里,这是最接近直接回答「学习者是不是比其他写作者更容易被判 AI」的一处。就 Pangram、就这批作文而言,答案是否定的。
四项关于英语学习者写作的测试,放在一起看
| 测试 | 检测器与时间 | 英语学习者的作文 | 判为 AI |
|---|---|---|---|
| Liang 等,斯坦福(2023 年发表) | 2023 年 3 月 15 日访问的 GPTZero,七款检测器之一 | 91 篇托福作文,来自一个中文教育论坛,62 到 148 词 | 52%(七款检测器平均 61.22%) |
| Turnitin 自测(2023 年 10 月) | Turnitin 当时向客户提供的版本 | 2,221 篇 300 词以上的文本,来自大学阶段学习者 | 30 篇(1.4%);母语写作者 1,155 篇中 15 篇(1.3%) |
| GPTZero 自测(2026 年 10 月) | GPTZero 4o | 914 篇,美国 6 到 12 年级 | 0 篇 |
| IdeaLens 预印本(2026 年 10 月) | Pangram 4 | 3,909 篇,美国 8 到 12 年级 | 0.0%(最多一篇) |
这不是排行榜。每一行都是不同的检测器或不同的版本,各有各的「判为 AI」定义,测的也是不同的写作者。第一行的词数是我们自己数的,用的是斯坦福作者随代码公开的作文。那项研究我们写在为什么非英语母语的写作者更容易被 AI 检测器误判,Turnitin 的自测写在 Turnitin 的英语学习者偏差评测:长文与短文结果不同。Turnitin 那一行是 2023 年的模型,之后它已经换过检测器。
这是不是说明偏差问题已经解决了?
凭这些证据还说不上。2026 年的数字是真实的,但它覆盖的情形比「英语学习者」这个大类窄得多。
- 篇幅。 斯坦福那批作文每篇都不到 150 词。Turnitin 2023 年的自测发现,150 到 300 词的文本里,学习者和母语写作者之间的差距更大。两批新作文大多远高于这个长度:PERSUADE 平均 402 词,ELLIPSE 有 30% 在 500 词以上。2023 年那个吓人数字背后的超短文本,并不是 2026 年这两项测试测的东西。
- 水平。 两批新作文都是中学生写的。Turnitin 2023 年那批学习者文本倒确实来自大学阶段的学习者:它的数据集表把两个学习者语料都标为 "higher ed"(高等教育)。但按它自己的描述,多是短篇的议论或说明类写作任务;300 词组里的母语写作者也几乎全是美国中学生。它还写道:"A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation."(这次评测找不到可比的、公开的、大学水平的全长二语与母语写作文本。)
- 水平最弱的写作者样本很少。 PERSUADE 剔除了拼写错误太多的作文,ELLIPSE 最低水平档只有 8 篇。
- Turnitin。 它的 AI 检测 FAQ 说,2026 年 7 月已把多个模型合并成一个模型;对「是否有偏差」这一问,回答的是训练数据怎么挑,没有任何数字。FAQ 全文里「English learner」「ESL」「L2」「native」各出现 0 次,「second language」出现的 4 次都没有附数字。
- 版本。 GPTZero 4o 从 9 月 20 日起才成为默认模型;论文没写 Pangram 具体是哪天检测的这些作文。两款检测器都还会更新。
公允的总结比标题窄得多:2026 年秋天,两款检测器,面对美国中学阶段学习者写的几百词作文,几乎从不判 AI。
英语不是母语,担心被判 AI,可以做什么
- 先弄清用的是哪款检测器、什么时候测的。 这些数字说的是 GPTZero 4o 和 Pangram 4。如果你们学校用的是 Turnitin,或者 GPTZero 那次检测是在 9 月 20 日之前做的,这些数字就套不上。
- 要完整报告,不要只要一个结论或一个百分比。 你要看到哪些段落被标出、分数是多少。
- 被标的如果是短文,要说出来。 早先的研究都是在短文本上发现问题的;Turnitin 自己的报告在散文正文不足 300 词时不显示 AI 百分比。一篇被标的短讨论帖,依据的文字比一整篇论文少得多。
- 把写作过程的记录留好。 草稿、笔记、读过的文献和版本历史,才是关于你这篇作文的证据;一项研究在别人作文上的比率不是。怎么在 Word、Google Docs 和 Overleaf 里留住版本历史讲了哪些设置真的会保存它。
- 如果要引这些研究,就引准确。 如果标你的是 GPTZero,可以指出 GPTZero 自己公布的测试把 914 篇英语学习者作文全部判为人写。把它当作请对方看你草稿的理由,而不是证明:914 篇中学作文的测试,定不了你这一篇的事。
常见问题
这是不是说明 Turnitin 不会标我的论文? 这些研究回答不了。Turnitin 自己 2023 年的评测里,300 词以上的学习者文本有 1.4% 被判 AI,母语写作者是 1.3%;但那个模型已经换掉,现行 FAQ 也没有给出任何关于英语学习者的数字。
我在读大学,这些结果适用于我吗? 只能算勉强沾边。2026 年这两批都是美国中学生的作文:PERSUADE 是课堂作业,ELLIPSE 是 25 到 30 分钟的考试作文。一篇大学文献综述更长、更专业,而且是花几周写成的。离你最近的数据是 Turnitin 2023 年的评测,它的学习者文本来自大学阶段,只是多为短篇任务:300 词以上的有 1.4% 被判 AI,而那个模型 Turnitin 之后已经换掉了。
为了不被标,我该把英语写得更简单,还是更华丽? 这些结果里看不出有这个必要。在 Pangram 的测试里,水平 2、3、4 档的作文各有一千多篇,全都是 0.0%;按作者结果文件里的语法分、词汇分分档来看也一样。这只是一款检测器,但它至少说明,没有理由用一种不属于你的腔调去写。
有残障的学生呢? 同一篇 GPTZero 博文说,4o 把 1,172 篇有 IEP 或 504 计划的学生作文全部判为人写。限定条件也一样:厂商自测、中学作文,而计数为零仍然容得下一个很小的真实误判率。
参考来源
- Anna Gao,Biased Against ESL and Students with Disabilities? We Put GPTZero 4o to the Test,GPTZero,2026 年 10 月 5 日(正文及页面上的五张图);GPTZero Team,Introducing GPTZero 4o,2026 年 9 月 24 日;均为 2026 年 10 月 7 日读取。
- Rishanth Rajendhran、Minjoon Choi、Jenna Russell、Ramya Namuduri、Deniz Bölöni-Turgut、Marzena Karpinska、John Wieting、Mohit Iyyer,IdeaLens: Detecting AI Ideas in Long-form Writing,arXiv:2610.06778v1,2026 年 10 月 5 日(附录 E.3、G.1 节、表 17),以及作者公开的 ELLIPSE 结果文件;2026 年 10 月 7 日读取。
- Scott Crossley 等,A large-scale corpus for assessing written argumentation: PERSUADE 2.0,Assessing Writing 第 61 卷(2024),预印本;The persuasive essays for rating, selecting, and understanding argumentative and discourse elements (PERSUADE) corpus 1.0,Assessing Writing 第 54 卷(2022);2026 年 10 月 7 日读取。
- Scott Crossley 等,The English Language Learner Insight, Proficiency and Skills Evaluation (ELLIPSE) Corpus,International Journal of Learner Corpus Research 第 9 卷第 2 期(2023),预印本与语料文件;2026 年 10 月 7 日读取。
- OpenAI,ChatGPT: Optimizing Language Models for Dialogue,2022 年 11 月 30 日(互联网档案馆 2022 年 12 月 2 日存档);2026 年 10 月 7 日读取。
- Weixin Liang、Mert Yuksekgonul、Yining Mao、Eric Wu、James Zou,GPT detectors are biased against non-native English writers,arXiv:2304.02819v3(图 1a 与材料和方法部分;正式发表于 Patterns,2023),以及作者的数据仓库;2026 年 10 月 7 日读取。
- David Adamson,New research: Turnitin's AI detector shows no statistically significant bias against English Language Learners,Turnitin,2023 年 10 月 26 日(正文及结果表截图);Turnitin,AI writing detection capabilities FAQs 与 Using the AI Writing Report;2026 年 10 月 7 日读取。
继续阅读