AI 学术不端案件里,学校到底拿什么当证据?一项研究翻了 1,162 份案卷
如果你的作业被标出疑似 AI,正在等下一步通知,最有用的问题是:最后摆在做决定的人面前的,到底是什么。2026 年 9 月发表的一项研究,把澳大利亚一所大学三年的案卷翻了一遍,逐条数了出来。下面讲案卷里有什么、研究者给每类证据打了多重的分,以及这对你该准备什么有什么提示。
HumanPen 团队
· 12 分钟
AI 学术不端案件里,实际出现的是哪些证据?
在澳大利亚这一所大学,检测分数只占一小部分,而且越来越少。2023 到 2025 年的 1,162 起与 AI 有关的学术不端案件里,GPTZero 这类 AI 检测工具的输出,在 2023 年占当年证据条目的 5.8%,2024 年 8.8%,2025 年 0.5%,也就是在一个有 618 起这类案件的年份里只有 5 条。三年合起来,检测器输出出现在 1,162 起案件中的 67 起里。常见得多的是:学生在面谈中的承认(出现在 34.3% 的案件里)、查不到的参考文献(30.6%),以及阅卷人认为文字读起来像 AI(20.6%)。证据的类型和强弱,对案件最后怎么结束只有有限的解释力。
这项研究题为《How strong is the evidence in generative AI-related academic misconduct allegations? A mixed-methods analysis》(生成式 AI 相关学术不端指控的证据有多强?一项混合方法分析),作者是伍伦贡大学的 Albert Munoz、Mercedez Hinchcliff、Cameron Langfield 和 Ann Rogerson,开放获取,2026 年 9 月 2 日刊登于《International Journal for Educational Integrity》(国际教育诚信期刊)。案卷来自作者自己的学校,作者也都在这所学校任职。Rogerson 是该期刊编委,论文把这一点列为利益冲突。
研究者看了什么
2023 年 1 月到 2025 年 12 月,这所大学一共登记了 5,127 起学术不端案件。研究团队从中筛出 1,162 起涉嫌使用生成式 AI 的,占总数的 22.7%。这个比例逐年上升:
| 2023 | 2024 | 2025 | |
|---|---|---|---|
| 与 AI 有关的案件 | 214 | 330 | 618 |
| 占当年全部学术不端案件的比例 | 11.9% | 20.0% | 36.9% |
被纳入这 1,162 起,不代表学生被认定做了什么。论文说得很直白:"This study does not adjudicate whether individual students engaged in the misuse of generative artificial intelligence."(本研究不判定个别学生是否滥用了生成式人工智能。)
研究者在这些案卷里找出 1,855 条独立的证据,分成 15 类。每条证据都按法学研究里的三个维度打分:相关性、可信度,以及推断力,也就是单拿这一条出来,它对指控的支持有多强。这些评分是研究者的判断,由一个在本地运行、并按他们自己的人工编码校准过的语言模型套用到全部案卷上。它们不是在检验某一条证据到底对不对。
案卷里有什么
下面是全部 15 类,按出现在多少起案件里排序。一起案件可以同时有好几类证据,所以百分比加起来超过 100。
| 证据类型 | 案件数(共 1,162) | 研究者给的推断力评分 |
|---|---|---|
| 面谈中的承认 | 399(34.3%) | 97.2% 的条目为「强」 |
| 引用的参考文献查不到 | 356(30.6%) | 98.0% 为「中」 |
| 阅卷人认为读起来像 AI | 239(20.6%) | 「弱」70.6%,「中」29.4% |
| 真实文献被拿来支持它没说过的观点 | 196(16.9%) | 「弱」53.6%,「中」27.1%,「强」19.3% |
| Turnitin 或其他相似度报告 | 71(6.1%) | 100% 为「弱」 |
| AI 检测工具输出(论文举的例子:GPTZero、ZeroGPT) | 67(5.8%) | 「弱」92.5%,「中」7.5% |
| 文字不像学生的水平或以往作业 | 65(5.6%) | 「中」51.4%,「弱」48.6% |
| 学生在面谈中解释不了自己的作业 | 63(5.4%) | 100% 为「中」 |
| 只有指控、没有描述任何证据 | 58(5.0%) | 不评分 |
| 在线考试中记录到的违规行为 | 51(4.4%) | 「强」68.4%,「中」29.8% |
| 多名学生提交的内容几乎相同 | 51(4.4%) | 「弱」50.9%,「中」41.8%,「强」7.3% |
| 考试监考记录(日志、屏幕截图) | 37(3.2%) | 「强」86.1% |
| 文件元数据或系统时间戳 | 26(2.2%) | 「中」67.9%,「弱」32.1% |
| 书面承认 | 10(0.9%) | 100% 为「强」 |
| 有具名第三方确认文献是编造的 | 1(0.1%) | 「中」 |
查不到的参考文献是增长最快的一类,从 2023 年占证据条目的 10.4% 涨到 2025 年的 30.0%。
检测分数:本来就少,后来几乎没了
| 占当年证据条目的比例 | 2023 | 2024 | 2025 |
|---|---|---|---|
| AI 检测工具输出 | 5.8% | 8.8% | 0.5%(5 条) |
| Turnitin 或其他相似度报告 | 4.0% | 5.5% | 3.1% |
这些百分比的分母是证据条目,不是案件;论文只给出了 2025 年的条数。三年里与 AI 有关的案件分别是 214、330 和 618 起,这里只作背景,不是上表的分母。三年合起来,AI 检测工具一共出现 69 条,分布在 1,162 起案件中的 67 起里。
先别急着得出「检测器不算数」,有两点要说清楚。
评分是定下来的,不是测出来的。每一条 AI 检测证据的可信度都被评为「低」,而这是研究者事先定好的规则:论文写的是,这些输出 "were treated in the present analysis as low-credibility evidence"(在本分析中被当作低可信度证据处理),而它的可信度量表本来就设计成要考虑 "documented limitations such as AI detector false positive rates"(有据可查的局限,比如 AI 检测器的误判率)。这项研究没有去核对哪个分数是错的。想看一个很小的误判率放到一整所大学会变成多少,当一所大学一年交上去 75,000 篇论文,1% 的误判率意味着什么算过这笔账。
下降也和本校的一条规定对得上。从 2025 年起,这所大学的评估政策就禁止教职员工把作业上传到外部检测器。按现行措辞,教职员工 "are not permitted to upload student work to third party tools, including generative artificial intelligence (GenAI) or misconduct detection software"(不得把学生作业上传到第三方工具,包括生成式人工智能(GenAI)或不端检测软件)。同一条仍然允许使用学校支持的 "approved detection software"(经批准的检测软件),而 2025 年相似度报告仍占证据的 3.1%。学校现行的学术不端程序也列出了可能使用的软件,包括文本比对(Turnitin)和 "language analysis software (e.g. Turnitin Authorship)"(语言分析软件,例如 Turnitin Authorship)。作者对这次下降的解读是:教职员工逐渐接受了检测器输出达不到「可能性权衡」这一证明标准。你的学校有自己的规定,其中一部分收在19 所大学如何限制 AI 检测工具或证据:官方原文汇总里。
论文没有写明的一点是:Turnitin 的 AI 写作分数被归到了哪一类。相似度报告这一类的定义是文本比对证据,举的例子是一份报告显示 "a similarity score of 1%, which is unusually low"(相似度只有 1%,异常地低),针对的是那类作业。AI 检测工具这一类点名的是 GPTZero 和 ZeroGPT。
最常见的一类:「读起来像 AI」
在直接来自文字本身的证据里,最常见的是阅卷人觉得它读起来像 AI,出现在 239 起案件里。论文举的教职员工描述原话是:"generic transitional phrases, unnaturally uniform paragraph structure, and unsolicited definitions of basic terms not required by the task."(套话式的过渡句、整齐得不自然的段落结构,以及题目并不要求、却主动给基础术语下定义。)
研究者把这类证据大多评为「弱」,因为这些特征 "not exclusive to GenAI misuse."(并非生成式 AI 滥用所独有。)它在证据里的占比从 2023 年的 19.5% 变为 2025 年的 14.5%。
还有一类规模小一些,是拿作业和学生平时交的东西比(65 起),评分在「中」和「弱」之间几乎各占一半。论文在背景部分自己点出了它的问题:学生的写作会随时间变化,"which can make legitimate improvement difficult to distinguish from anomalies attributable to misuse."(这会让正当的进步很难和滥用造成的异常区分开。)如果你面对的是这种说法,拿以前的作业当文风基线:怎么挑、比什么、以及它证明不了什么逐项讲了旧作业拿来对比时,哪些地方站得住、哪些地方会被反驳。
案子的很大一部分,是在面谈里形成的
出现在最多案件里的一类证据,是学生在面谈中的承认(399 起),几乎每次都被评为「强」。面谈里的另一类证据,是学生解释不了自己的作业,出现在 63 起案件里,一律评为「中」,因为它 "consistent with GenAI use but equally consistent with alternative explanations such as poor comprehension or test anxiety"(与使用生成式 AI 相符,但同样符合其他解释,比如理解不够或考试焦虑)。
作者自己得出了结论:"in a substantial proportion of cases, the strongest evidence available emerged only after the institution had already determined the allegation was sufficient to proceed."(在相当一部分案件里,最有力的证据是在学校已经认定指控足以推进之后才出现的。)
而且节奏很快。从提出指控到最终结果,中位数是 12 天(中间一半的案件在 6 到 20 天之间)。按这所大学现行的课程作业学术不端程序,学校会给你一个面谈机会;面谈之前,科目负责人必须确保通过电子邮件把 "the summary of the allegation and evidence that has been collected"(指控摘要和已收集的证据)发给你;你可以带一名支持者陪同,但对方不能代表你发言。学校给学生的指南也提醒:"you may be asked to explain how you developed an assessment item"(你可能会被要求解释你是怎么完成这项作业的)。
这些都不是在建议你少说话。如果你确实以作业不允许的方式用了 AI,被误判为 AI 写作:怎么申诉,学校会认哪些证据里有一节专门讲这种情况,它的立场是如实说明。如果你没有,面谈正是你说明作业怎么写出来的地方。
证据越强,结果就越确定吗?
从这批数据看,不明显。研究者检验了证据的类型、数量和评分,与案件升级到哪一级、最后怎么结束有没有关系。他们找到了一些关联,但 "the explanatory power of evidence characteristics across all model specifications is modest"(在所有模型设定下,证据特征的解释力都有限)。
他们的解释在于程序本身。案件升级,取决于教职员工的认定,而不是证据评分。案子最后是被认定为学术不端,还是「学术规范欠佳」(poor academic practice,后果是教育性的,而不是纪律处分),往往取决于是不是初犯这类因素。到了委员会阶段被驳回,可能是因为学生的陈述、程序上的问题,或者出于学生福祉的考虑,而案卷记不下听证会上争论了什么。用作者的话说,整个流程 "no minimum evidentiary threshold at any stage of the pipeline"(任何阶段都没有最低证据门槛)。
这一点在数字里也看得到。有 58 起案件(5.0%)除了指控本身,没有描述任何证据。这种空指控确实在变少,从 2023 年占证据条目的 7.6% 降到 2025 年的约 2.5%。
这项研究管不到的地方
- 一所大学,三年。 伍伦贡大学,2023 到 2025 年。作者也说,这些规律未必适用于别的学校。
- 是案卷,不是听证会。 "The evidence records capture what was documented in the case file, not what was argued, tested, or weighed during the hearing."(证据记录反映的是案卷里写下了什么,而不是听证会上争论、检验或权衡了什么。)
- 没有按学生分组。 本科还是研究生、本地还是国际学生、哪个学科,数据里都没有,所以它回答不了谁更容易被指控。
- 评分是一套框架。 评分来自作者自己的方案,由一个语言模型套用;模型先用 12 起案件校准,再在 54 起没见过的案件上检验,它和两名人工编码者的一致程度,与两名人工编码者彼此之间的一致程度在统计上没有区别。
- 作者是内部人。 作者是被分析案卷那所大学的员工,他们自己写道,这 "introduces potential bias, especially during the calibration exercise."(带来了潜在偏差,尤其是在校准环节。)
- 中途改过规定。 2025 年禁止把作业上传到第三方检测器的规定,就落在研究时段之内。
如果你被标出,或者被叫去面谈
- 问清楚每一条证据是什么。 一个分数、一段被认为像 AI 的文字、和你以往作业的对比、某个文献的问题:让对方逐条列出来。这项研究里有 5.0% 的案件,除了指控什么都没有。你们学校的程序应该写明面谈前你有权看到什么;其余的准备,见被 AI 检测指控后,学术诚信听证会怎么准备。
- 如果案卷里有检测分数,问清楚是哪个工具,以及你们学校是否允许教职员工使用它。
- 如果说的是文字读起来怎样,就把写作过程的记录带上。 草稿、笔记、文件的版本历史。怎么在 Word、Google Docs 和 Overleaf 里留住版本历史讲了这些记录分别存在哪里。
- 准备好解释你的作业。 论证为什么这样安排、主要文献到底说了什么、几稿之间改了什么。这项研究里有 63 起案件,「解释不了」本身就被记成了证据。
- 第一阶段就把证据交上去。 在这所大学,对认定结果提出申诉,只能基于程序不当,或者 "new and substantial evidence that has not previously been considered."(此前未被考虑过的、新的实质性证据。)去你们学校的程序里找对应的那一句。
HumanPen 能帮上什么
对已经立案的案件,这里没有任何东西能帮上忙。那起案件针对的是你交上去的版本,事后再改写,案卷里的内容也不会变。这一节说的是更早的时候:你还在修改草稿,手上有这份草稿的 Turnitin 或 iThenticate 报告,而且已经确认科目说明允许用外部 AI 工具帮你改写措辞(而不是只允许某一个指定工具),也清楚要怎么声明这种帮助。以伍伦贡为例,学校给学生的指南写的是 "use only the permitted gen AI technology"(只使用获准的生成式 AI 技术),超出作业说明范围使用 AI 就算误用。这些条件都满足的话,HumanPen 的降 AI 功能就是做这个的。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。提交前把改写结果和你自己的草稿对一遍,因为交上去的每一句,你都应该解释得出来。
常见问题
大学现在还把 AI 检测分数当证据吗? 在这所大学,到 2025 年已经很少:5 条,占当年证据条目的 0.5%,此前学校的政策已经禁止教职员工把作业上传到第三方检测器。别的大学有各自的规定,所以这说明不了你们学校的做法。
单凭「读起来像 AI」就够了吗? 研究者把这类证据大多评为「弱」,因为相关特征并非 AI 使用所独有。这是他们的框架,不是学校的规定。在这所大学,最终决定是按「可能性权衡」,综合案件里的全部证据做出的。论文解释了这是什么意思:必须是「更可能发生过」,而且 "with the burden of proof resting with the institution and the academic raising the allegation rather than the student"(证明责任在学校和提出指控的教师,而不在学生)。
在这项研究里,什么算最有力的证据? 承认(书面的或在面谈中说的)、考试监考软件留下的记录,以及这些记录显示的违规行为。这几类各自的大多数条目都被评为「强」。
这项研究能说明被指控的学生到底用没用 AI 吗? 不能。它只是清点并评估案卷里有什么。被纳入这 1,162 起案件,意味着有人怀疑存在 AI 滥用,不是已经认定。
参考来源
- Albert Munoz、Mercedez Hinchcliff、Cameron Langfield、Ann Rogerson,How strong is the evidence in generative AI-related academic misconduct allegations? A mixed-methods analysis,《International Journal for Educational Integrity》第 22 卷第 26 篇,2026 年 9 月 2 日发表(正式版本 2026 年 9 月 10 日);2026 年 10 月 2 日读取(表 2、图 1 和图 2)。
- 伍伦贡大学,Academic Misconduct (Coursework) Procedure,2025 年 11 月 3 日生效版本,第 35、80、119 条;2026 年 10 月 2 日读取。
- 伍伦贡大学,Assessment and Feedback Policy,2025 年 3 月 14 日生效版本,第 14 条;2026 年 10 月 2 日读取。
- 伍伦贡大学,Using Generative Artificial Intelligence (Gen AI) in Assessments;2026 年 10 月 2 日读取。
继续阅读