AI 率 20% 算高吗?为什么没有绝对标准

没有一个数字是普遍安全的,而厂商自己在 20% 以下干脆不给数字——因为那正是它自己的测试中误判最多的区间。

HumanPen 团队

· 7 分钟

没有人公布阈值,包括 Turnitin

没有行业分界线,没有公认的安全区间,Turnitin 也没有给出过"多少算多"的数字。各机构自行制定做法,差异极大:有的把任何标记都当作找学生谈一次的理由,有的完全无视这个指标,而范德堡大学直接停用了它

所以"20% 算不算高"的诚实答案是:这取决于你们学校那份白纸黑字的政策——政策查得到,光凭数字答不了。任何给你一个安全百分比的文章,那个数字都是编的。

厂商自己都不给低分区间出数字

有一个地方确实存在阈值,而它很说明问题。从 2024 年 7 月起,当 Turnitin 检测到的 AI 比例低于 20% 时,它显示星号、不给百分比,理由是测试发现 0 到 19 之间误判率更高。

卖检测器的公司拒绝在 20% 以下给出数字。关于"一个小百分比有多大分量",这是目前能拿到的最清楚的表态。

这把通常的问题反了过来。人们问 20% 高不高,而更有用的观察是:20% 以下的所有分数,都被认定不够可靠、不值得发布。

那个 1% 的说法后来怎么了

2023 年 4 月检测器发布时,Turnitin 宣传的误判率是低于 1%。到 2023 年 6 月,该公司首席产品官对 Inside Higher Ed 表示,句子级误判率约为 4%

两个数字看着都小——乘上体量就不小了。仅 AI 检测器上线后的第一年,Turnitin 就复核了超过 2 亿篇论文。范德堡为自己校园算过这笔账:2022 年约收到 75,000 篇作业,1% 就是一年约 750 名学生被错误标记

错误率低和错误数量大,是同一个事实在两个尺度上的样子。而落到具体某个学生头上时,他承受的是数量。

误判实际集中在哪里

Turnitin 公布过一组比总误判率有用得多的数字:54% 的误判句子紧挨着一句真正的 AI 文本,另有 26% 距离 AI 句子两句以内。

五分之四的误判发生在真实 AI 文本两句之内。模型不是在干净的文档里随机撒错误——它是在人类与 AI 混写的文档里,沿着交界处涂抹

这有实际后果。一篇含有部分 AI 辅助段落的论文里,最容易被误判的恰恰是那些段落周围的句子,而百分比无法告诉你哪句是哪句。分布可以——这正是该读报告本身而不是只看那个总百分比的理由。Turnitin 还说明,误判在文档开头和结尾的句子——引言与结论——出现得更多,并为此调整了这些句子的聚合方式。

比"这算高吗"更值得问的问题

  • 我们学校拿这个数字做什么? 很多机构把它当作"值得看一眼"的理由而不是结论。Turnitin 自己也声明它不判定学术不端。
  • 标记落在哪里? 集中在方法、定义、背景这些本来就该写得程式化的部分,和散布在你的论证里,是两回事。
  • 文档里有多少内容真的被评估了? 百分比只覆盖散文。一篇表格、列表、参考文献占比很高的论文,被评估的部分可能远小于你以为的。
  • 它低于 20% 吗? 那厂商已经告诉过你,它不为那个区间的数字背书。

如果你更想从标记本身出发而不是从那个总百分比出发,导入报告会精确定位被标记的段落,其余部分不动。

继续阅读