AI 率 20% 算高吗?为什么没有绝对标准
20% 是 Turnitin 是否显示具体数字的界面分界,不是通用的学术不端分界。任何报告的含义,都取决于合格文本、模型误差、高亮位置和学校自己的规则。
HumanPen 团队
· 5 分钟
没有人公布阈值,包括 Turnitin
没有行业分界线,没有公认的安全区间,Turnitin 也没有给出过"多少算多"的数字。各机构自行制定做法,差异极大:有的把任何标记都当作找学生谈一次的理由,有的完全无视这个指标,而范德堡大学直接停用了它。
所以"20% 算不算高"的诚实答案是:这取决于你们学校那份白纸黑字的政策——政策查得到,光凭数字答不了。任何给你一个安全百分比的文章,那个数字都是编的。
这个问题还把三种决策混在了一起。Turnitin 制定报告规则,决定界面显示什么;学校制定调查规则,决定何时复核;纪律机构再按证据标准判断是否违反政策。同一个数字可能出现在三步里,却不能替任何一步自动设线。
20% 的显示边界,不等于 20% 的学术不端边界。把两者混为一谈,是大多数"安全分数"建议的根本错误。
两份同为 20% 的报告也未必可比。一份可能几乎全是符合检测条件的正文,另一份大半是表格和附录;一份高亮集中成块,另一份零散分布。百分比把这些不同情形压成一个标题数字,所以解释必须从完整报告与政策开始,而不是从通用颜色表开始。
厂商改变了低分区间的显示方式
确实有一条有文档依据的边界,但它是显示规则。从 2024 年 7 月起,当 Turnitin 的结果落在 1% 到 19% 时,它显示星号,不给具体百分比与高亮。Turnitin 解释说,测试发现低分区间误判更多,隐藏数字可以减少误读。
星号是在提示模型低分区间需要谨慎。它不等于零,也没有替学校规定该作出什么纪律结论。
显示出来的 20% 和隐藏的 19% 位于界面规则两边,但一个百分点不会制造科学悬崖。靠近任何阈值时,细小的文本或模型变化都可能切换显示。因此 20% 仍要结合上下文阅读,不能把它当作与星号本质不同的一类。
旧报告让比较更复杂。这项改变不追溯生效,因此 2024 年 7 月 8 日前的提交,可能仍显示今天会被隐藏的低数字。把创建日期、可取得的检测器版本和原报告截图或 PDF 一并保留。
那个 1% 的说法后来怎么了
2023 年 4 月检测器发布时,Turnitin 宣传在其评估条件下的文档级误判率低于 1%。到 2023 年 6 月,该公司首席产品官对 Inside Higher Ed 提到约 4% 的句子级误判数字。两者计量单位不同,不能写成误判率简单地从 1% 修订成 4%。
误判率还必须带分母和基础人群。句子级误差问的是人类句子多常被错判;文档级误差问的是整份人类文档多常跨过某条规则。两者都不能直接乘以 Turnitin 首年复核的 2 亿多篇论文来估算指控数量,因为其中人类、AI 辅助、不合格和重复提交的比例未知。
范德堡用每年约 75,000 份提交说明机构规模:即使厂商宣称的比例很小,也会产生许多需要公平复核的个案。它没有证明恰好会有 750 名学生被冤枉。一次标记可能根本不会成为指控,而一篇论文包含许多句子,也不等于一个句子误判就构成文档误判。
基础发生率还会改变另一个关键量。如果某次作业里违规使用 AI 很少,即便特异度很高,所有标记中仍可能有相当一部分是假阳性;如果使用普遍,同一个检测器的阳性预测值又不同。不知道流行率、灵敏度、特异度和学校复核流程,就无法从显示百分比推出"这个学生作弊的概率"。
检测百分比、误判率、学术不端概率,是三个不同的量,不能互相替换。
误判实际集中在哪里
Turnitin 公布过一项更具体的混合文本误差分析:受测误判句子中,54% 紧挨着 AI 文本,另有 26% 距离 AI 句子两句以内。
在那项评估里,五分之四的误判位于 AI 文本两句之内。这说明的是混写文档中的边界行为,不能回答全人类撰写文档里的误判分布,也不能自动推广到所有后续模型版本。
这有实际后果。一篇含有部分 AI 辅助段落的论文里,最容易被误判的恰恰是那些段落周围的句子,而百分比无法告诉你哪句是哪句。分布可以——这正是该读报告本身而不是只看那个总百分比的理由。Turnitin 还说明,误判在文档开头和结尾的句子——引言与结论——出现得更多,并为此调整了这些句子的聚合方式。
因此,把所有高亮句子删掉或重写,并不是可靠的诊断方法。交界处某些高亮可能是人写的,某些未高亮段落也可能用过 AI 却漏检。报告只能指出待结合上下文复核的区域;作者证据仍来自草稿、来源、允许使用的披露和作者解释作品的能力。
比"这算高吗"更值得问的问题
- 我们学校拿这个数字做什么? 很多机构把它当作"值得看一眼"的理由而不是结论。Turnitin 自己也声明它不判定学术不端。
- 标记落在哪里? 集中在方法、定义、背景这些本来就该写得程式化的部分,和散布在你的论证里,是两回事。
- 文档里有多少内容真的被评估了? 百分比只覆盖散文。一篇表格、列表、参考文献占比很高的论文,被评估的部分可能远小于你以为的。
- 这是什么报告状态、何时生成? 星号、0%、具体数字与资格错误含义不同,2024 年 7 月前的报告还遵循旧展示规则。
- 还要求哪些其他证据? 复核者是否查看草稿、来源、版本历史、既往写作和学生解释,而不是把指标当作充分证据?
对教师,启用功能前就应把流程写清:谁能看报告、什么情况触发谈话、如何向学生提供证据、哪些合理调整适用、谁作最终决定。对学生,应索要这份书面流程并保留原提交文件。两者都比争论 20 到底算不算"高"更有用。
继续阅读