硕士论文被判 AI 的比例有多高?一项研究扫了 1,163 篇

布鲁塞尔自由大学的一个研究团队,用一个检测器扫了他们学院 2024–2025 学年收到的每一篇硕士论文。被标出的将近一半,其中约四分之三,检测器估计的 AI 内容不超过一半。同一个团队还拿作者身份已知的论文,测了四个检测器。下面讲他们对人写论文的发现、硕士论文那组数字能说明和不能说明什么,以及你的论文被标红时该怎么办。

HumanPen 团队

· 6 分钟

硕士论文被判 AI 的比例有多高?

在一个学院 2024–2025 学年的硕士论文里,Pangram 标出了 1,163 篇中的 529 篇,即 45.5%。在被标出的论文里,估计的 AI 生成内容占比中位数是 30%,估计超过 80% 的只有 1.9%。研究者无法拿这些数字去核对论文实际是怎么写的。在另一组作者身份已知的对照测试里,Turnitin、Pangram、GPTZero 和 Copyleaks 给每一篇人写论文的分数都在 0 到 20% 之间。

这项研究题为《Who wrote this? Evaluating the reliability of AI detection tools in higher education》(谁写的?评估高等教育中 AI 检测工具的可靠性),作者是布鲁塞尔自由大学(Vrije Universiteit Brussel)的 Marijke Van Vlasselaer、Filip Van Droogenbroeck 和 Bram Spruyt,2026 年 6 月 29 日以开放获取形式发表在《International Journal for Educational Integrity》(国际教育诚信期刊)上。作者声明与所测的任何工具都没有经济或机构上的关联。

对照测试:160 篇作者身份已知的论文

研究者做了四组英文学术论文,每组 40 篇,每篇至少 4,000 词:

  • 人写。 英语非母语学生在 2017 到 2019 年间提交的硕士论文,取自一个机构档案库。
  • 全部由 AI 生成。 由一个 ChatGPT 模型生成的完整论文。
  • 混合。 把人写论文的文献综述和结论换成 AI 生成的文字。
  • 改写过的混合。 混合论文里的 AI 部分,再用一条 ChatGPT 提示词改写,要求让文字 "sounds more like it was written by a real person"(听起来更像真人写的)。

然后,他们把每个工具的分数和每篇论文已知的 AI 内容占比做对比。

在人写论文上,四个工具给每一篇的分数都在 0 到 20% 之间。Pangram 和 Copyleaks 给出的都是 0%。Turnitin 对其中三篇显示的是星号而不是数字;Turnitin 自己的文档用星号表示 1% 到 19% 的分数,我们在 Turnitin AI 率上的星号(*%)是什么意思?里讲过。GPTZero 给了其中一些很小的分数。作者把这一点和以往关于非母语写作者的研究做了对比:"Unlike Liang et al. (2023), who reported substantial false-positive bias against non-native writers using seven early-generation GPT detectors, we found no false positives for Pangram, Copyleaks, and Turnitin"(与 Liang 等人 2023 年用七个早期 GPT 检测器发现对非母语写作者存在明显误报偏差不同,我们在 Pangram、Copyleaks 和 Turnitin 上没有发现误报)。那项更早的研究,见为什么非英语母语的写作者更容易被 AI 检测器误判。作者写道,误报 "almost absent"(几乎没有出现),这和以往的研究相比让他们感到意外;他们也补了一句提醒:"some tools may use conservative thresholds to avoid falsely labelling human-written text as AI-generated, which may increase the number of false negatives."(有些工具可能采用保守的阈值,以免把人写文本误标为 AI 生成,这可能会增加漏报。)

在确实含有 AI 文字的论文上,各工具的差别很大。在三类含 AI 的论文上,Pangram 的估计都最接近已知占比。另外三个工具,包括 Turnitin,都严重低估了全部由 AI 生成的论文,而这组论文全都出自同一个模型;作者认为这个差距可能是因为它是当时能用的最新模型。在混合论文上,落在正确区间的,Pangram 有 40 篇中的 37 篇,Turnitin 24 篇,Copyleaks 12 篇,GPTZero 0 篇。

读 Turnitin 的数字时要注意一个细节:研究者把 Turnitin 显示星号的论文算进了最低一档。我们的 Pangram vs Turnitin:两个 AI 分数为什么对不上也讲到了这项研究。

真实数据:一整年的硕士论文

因为在测试里 Pangram 对已知 AI 内容跟得最紧,研究者用它扫描了他们社会科学与经济学院各专业在 2024–2025 学年提交的全部 1,163 篇硕士论文。

结果数字
扫描的论文1,163 篇
被标出含有 AI 生成内容的论文529 篇(45.5%)
被标出论文的 AI 占比中位数(估计)30%
被标出论文中间的一半17% 到 49%
被标出论文的范围7% 到 100%
被标出论文中估计超过 80% 的1.9%

作者对这个分布的解读是:"the majority showed low-to-moderate AI usage, with very high AI usage (> 80%) being rare."(大多数显示的是低到中等程度的 AI 使用,非常高的 AI 使用(超过 80%)很少见。)

硕士论文那组数字说明不了什么

作者把局限写得很明白:

  • 没有标准答案。 没人知道这 1,163 篇论文实际是怎么写的,所以 "the flagging percentages cannot be interpreted as confirmed prevalence rates of AI use"(这些被标出的比例不能解读为已确认的 AI 使用率)。作者仍把这项分析称为 "a valuable first indication"(一个有价值的初步参照),但这些数字是 Pangram 的估计,不是已确认的比例。
  • 一个学院,一个工具。 这些论文来自一所大学的社会科学与经济学院,而且只用 Pangram 扫过。
  • 一个时间点。 测试里的 AI 文字生成于 2025 年 5 月,作者说他们的结果 "are valid only for a specific snapshot in time"(只对某个特定时间点有效)。
  • 一种改写方法。 「改写过的混合」那一组只用了一条 ChatGPT 提示词。作者提到学生可能会组合使用多种方法,所以那一组的结果不一定能推广。

那组人写论文也是特定的一群:一个学院在 2017 到 2019 年间提交的硕士论文。它们检测结果干净是个好迹象,但不能保证每一篇论文都会这样。

如果你的论文被标红

  1. 查清分数来自哪个检测器。 这项研究发现,同样的论文,不同工具给出的结果差别很大。Pangram 的估计、Turnitin 的百分比和 GPTZero 的分数不能互换。
  2. 查一下这个工具能不能读完你整篇论文。 比如 Turnitin,对超过 30,000 词的提交不生成 AI 写作报告,见一整本学位论文,Turnitin 查得了吗?。
  3. 看哪些章节被标出。 报告高亮了哪些段落,那些就是你要准备好解释的地方,手上要有草稿和版本历史。
  4. 问清楚这个分数会怎么用。 作者的立场是,被标出的结果 "should trigger a more thorough review of the student's paper content, rather than relying on an AI detection tool to draw a final conclusion"(引发对学生论文内容更彻底的审阅,而不是依赖 AI 检测工具下最终结论)。

另一项测量 AI 润色过的人写文字被标出频率的 2026 年研究,见用 AI 润色过,会被判成 AI 吗?一项 2026 年研究测出的数字。

HumanPen 能帮上什么

当论文里被标出的是一组需要重写的段落时,HumanPen 的降 AI 功能就是为这件事做的。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。学校关于 AI 协助的规定要先看,改回来的每一章在提交前都值得完整读一遍。

常见问题

有没有检测器把人写论文误判成 AI? 没有超过 20% 的。四个工具给每一篇人写论文的分数都在 0 到 20% 之间。Turnitin 对其中三篇显示了星号,GPTZero 给了一些很小的分数;Pangram 和 Copyleaks 全部是 0%。作者也提醒,保守的阈值能减少误报,代价是漏掉更多 AI 文字。

45.5% 是不是说明将近一半的硕士生用了 AI? 不能当作已确认的数字。它的意思是 Pangram 在 45.5% 的论文里估计有一些 AI 生成的内容。作者把它看作 "a valuable first indication"(一个有价值的初步参照),说明 AI 辅助写作已经很常见;但由于没有标准答案,他们也说这些比例 "cannot be interpreted as confirmed prevalence rates of AI use"(不能解读为已确认的 AI 使用率)。

哪个检测器最准? 在这项测试里,Pangram 的估计最接近已知的 AI 占比。这是一项研究、一组生成于 2025 年 5 月的论文;之后检测器和 AI 模型都有变化。

Turnitin 有没有拿来扫那些真实论文? 没有。那 1,163 篇论文只用 Pangram 扫过。

参考来源

继续阅读