Turnitin 会把非母语学生的英文写作判成 AI 吗?一项 2026 年发表的研究
如果英语不是你的母语,你大概听说过 AI 检测器对你有偏见。阿曼苏丹卡布斯大学的研究者在 2026 年发表的一项研究,拿 Turnitin 和 Originality 检验了这件事,用的是本校预科学生在 ChatGPT 出现之前写的课程作业。下面讲它对学生写作、对人写与 AI 混合的文本、对科学与人文写作分别发现了什么,以及这对你手上的分数意味着什么。
HumanPen 团队
· 5 分钟
Turnitin 会把非母语学生的英文写作判成 AI 吗?
在这项研究里,有时会,频率和 BBC 新闻稿差不多。48 篇英语作为外语(EFL)的学生作文,全部写于 2022 年 8 月以前,Turnitin 把其中 4 篇打到 20% 以上,Originality 也是 4 篇。48 篇 BBC 新闻稿,Turnitin 打到 20% 以上的有 3 篇,Originality 一篇没有。作者发现 Turnitin 在两组之间没有显著差别,Originality 则有接近显著的差别。对一半人写、一半 AI 的文本,两个检测器都判得很差。
这项研究题为《Evaluating the accuracy and reliability of AI content detectors in academic contexts》(评估学术场景下 AI 内容检测器的准确性与可靠性),作者是苏丹卡布斯大学的 Mohammad Hadra、Karleen Cambridge 和 Mostefa Mesbah,2026 年 2 月 2 日以开放获取形式发表在《International Journal for Educational Integrity》(国际教育诚信期刊)上。作者声明没有利益冲突。
研究者测了什么
他们做了 192 篇文本,分四组,每组 48 篇:
- EFL 学生写作。 取自该校预科「科学英语」课程的期末作业,全部在 2022 年 8 月以前提交,那时学生还用不上 ChatGPT 这类工具。
- 职业写作。 取自 XSum,一个由 BBC 新闻稿组成的研究数据集。
- AI 生成。 由两个大语言模型按与学生类似的作文题生成。
- 混合。 大约一半 EFL 学生文字、一半 AI 生成文字,拼成一篇。
文本长度在 300 到 1,100 词之间,192 篇里有 135 篇是科学类题目。检测是在 2025 年 1 月到 5 月之间做的。每个检测器的分数分成三档:0 到 20% 算「人写」,21% 到 79% 算「混合」,80% 及以上算「AI」。
对人写文本的发现
| 人写文本 | Turnitin:20% 及以下 | Originality:20% 及以下 |
|---|---|---|
| EFL 学生作文(48 篇) | 44 篇(91.6%) | 44 篇(91.6%) |
| BBC 新闻稿(48 篇) | 45 篇(93.8%) | 48 篇(100%) |
对 Turnitin 来说,学生作文和新闻稿之间的差距没有统计显著性(p = 0.50)。作者写道,这 "suggests that Turnitin did not exhibit measurable bias against EFL writers within this dataset."(表明在这组数据里,Turnitin 没有表现出对 EFL 写作者可测量的偏差。)Originality 对新闻稿全部判对,但判错了 4 篇学生作文,作者称之为接近显著的趋势(单侧 p = 0.058),方向与以往关于检测器对非母语写作者有偏差的研究一致。
读这组数字时要结合测试的规模。48 篇里 4 篇,大约是十二篇里一篇。这不是零,而一个超过 20% 的分数,正是学生可能被叫去问话的那种。而且它比的是新闻报道,不是母语者写的学术作文。
人写与 AI 混合的文本最难判
对一半人写、一半 AI 的文本,两个检测器大多没能把它们放进中间那一档。Turnitin 放对了 31%,Originality 只有 2%。作者的解读是,这些检测器 "appear calibrated primarily for binary distinctions (AI vs. Human) and struggle to identify partial or mixed AI involvement."(看起来主要是按二分法(AI 或人写)校准的,难以识别部分或混合的 AI 参与。)
四组合起来的总体准确率,Turnitin 是 0.61,Originality 是 0.69。
科学类写作更难判
两个检测器对科学类文本的准确率都比人文类低得多:
| 准确率 | 科学 | 人文 |
|---|---|---|
| Turnitin | 0.51 | 0.86 |
| Originality | 0.58 | 0.96 |
这些数字是四组合在一起算的,所以衡量的是各个方向的错误,不只是人写文本被判成 AI。作者推测,科学写作中常见的特征,"such as lexical density, technical terminology, and formulaic sentence structure, may be more difficult for detectors to distinguish from AI-generated text."(比如词汇密度、专业术语和程式化的句式,可能更难被检测器与 AI 生成的文本区分开。)
另一项 2026 年的研究,用 Pangram 和 GPTZero 测已发表的摘要,发现近年的政治学和神学摘要被标出的比例比化学和计算机科学更高。那项研究测的是别的东西、用的是别的检测器,我们在用 AI 润色过,会被判成 AI 吗?一项 2026 年研究测出的数字里讲过。两项结果合起来,得不出「哪个学科更安全」的规律。
长度也有影响,但不是直线关系。四组合起来看,两个检测器都在最短的文本(300 到 330 词)上最准,在中等长度(450 到 550 词)上最差:短、中、长三档的准确率,Turnitin 分别是 0.87、0.56 和 0.68,Originality 分别是 0.96、0.63 和 0.84。
这项研究没有告诉你的
- 两个检测器,测于 2025 年上半年。 只测了 Turnitin 和 Originality,时间是 2025 年 1 月到 5 月,而检测器会随更新改变。
- 一群学生。 EFL 作文来自一所大学的一个预科项目。
- 对照组是新闻,不是学术文章。 职业写作是 BBC 的报道。
- 固定比例的混合。 每篇混合文本都是大约五五开,作者也指出,真实的学生写作很少是这样。
他们的结论是:"neither detector achieves the level of reliability required for high-stakes decision-making."(两个检测器都达不到高风险决策所要求的可靠性。)
如果你自己的文字被标红
- 先看你落在哪一档。 在这项研究里,20% 及以下算人写。Turnitin 对低分显示星号而不是数字,见 Turnitin AI 率上的星号(*%)是什么意思?。
- 保留草稿和版本历史。 它们能说明文字是怎么写出来的,这是分数做不到的。
- 看哪些段落被高亮。 那些就是你要准备好解释的地方。
- 把证据拿出来。 这类研究,以及为什么非英语母语的写作者更容易被 AI 检测器误判里讲的更早的非母语写作者研究,都支持一个观点:光有检测分数不能算证据。
HumanPen 能帮上什么
如果你手上有 Turnitin 或 iThenticate 报告,标红的段落需要改写,这正是 HumanPen 降 AI 功能做的事。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。用之前先对照你课程关于 AI 协助的规定,提交之前把改回来的内容读一遍。
常见问题
Turnitin 对非英语母语的写作者有偏见吗? 在这组数据里,Turnitin 对 EFL 学生作文和 BBC 新闻稿的判定结果差不多,没有显著差别。这是对一群学生的一次测试,不是一般性的答案。
这项研究里的「被标出」是什么意思? 分数超过 20%。21% 到 79% 算「混合」,80% 及以上算「AI」。
那些学生作文真的没用过 AI 吗? 它们在 2022 年 8 月以前提交。作者说当时这些学生还用不上 ChatGPT 这类工具,而当时已有的文本生成系统需要受限的 API 权限和技术配置。
哪个检测器表现更好? Originality 的总体准确率更高(0.69 对 0.61)。在学生作文上两者持平,都是 48 篇里有 4 篇打到 20% 以上;Originality 对新闻稿全部判对。两者都判不好混合文本。
参考来源
- Mohammad Hadra、Karleen Cambridge、Mostefa Mesbah,Evaluating the accuracy and reliability of AI content detectors in academic contexts,《International Journal for Educational Integrity》第 22 卷第 4 篇,2026 年 2 月 2 日发表;2026 年 9 月 28 日读取(表 1–5)。
继续阅读