为什么同一段文字在不同检测器上分数差很多
在斯坦福那项研究里,91 篇作文中有 89 篇被至少一个检测器标记,却只有 18 篇被全部七个标记。同一批作文、同一天——七个工具在其中 71 篇上各执一词。
HumanPen 团队
· 5 分钟
分歧是可测量的,而且很大
最清楚的公开数字来自那项关于非母语写作者的斯坦福研究,人们引用它通常是为了那个 61% 的误判率。但真正值得看的是下面两个数。
- 91 篇中的 89 篇(97.80%)被七个检测器中的至少一个判为 AI。
- 91 篇中的 18 篇(19.78%)被全部七个判为 AI。
中间差的 71 篇——语料里五分之四——没有得到七个检测器的一致二元结论。公开计数证明了分类存在分歧,但没有告诉我们每一份底层分数到底相差多远。
对这 71 篇而言,机构选用哪一个工具,可能改变是否出现标记。这说明结果依赖产品,不等于某一个特定检测器永远错。
日期也很重要。研究记录的是 2023 年初七个产品的状态,此后多家已经调整模型、阈值或报告界面,不能把它当作 2026 年排行榜。更耐用的结论是方法论上的:不同检测器的输出不可互换;除非重新做受控比较,一家的分数不能验证或抵消另一家的分数。
即使同一厂商重复运行,也可能因为服务静默更新、账号启用功能不同,或文档解析方式变化而得出不同结果。要让报告可复现,不能只保存正文,还要保留原文件、报告、日期、产品档位、语言设置和可取得的模型版本。脱离这些背景的一张百分比截图,日后很难审计。
它们为什么会分歧
因为它们不是同一种测量的不同实现。它们是不同的产品。
- 底层模型不同。 一个用 GPT-2 算困惑度,另一个跑专门训练的深度学习分类器——两个检测器面对同一个句子,问的根本不是同一个问题。
- 架构随时间分岔。 GPTZero 在 2023 年秋放弃了困惑度与突发性,其他家没有。跨厂商比较,某种程度上是在比较不同世代的方法。
- 训练分布不同。 "什么算平平无奇的人类写作"取决于分类器见过谁的写作。这正是 ESL 偏差的成因,而它逐家不同。
- 阈值与呈现规则不同。 Turnitin 现在对 1% 到 19% 隐去具体数字,别家可能每档都报。同一个底层信号,在你看到之前就能被呈现成不同样子。
- 计量单位不同。 一个百分比可能是文档置信度,另一个是被判 AI 的句子占比,第三个是符合检测条件的正文占比。长得一样的数字未必回答同一个问题。
- 预处理不同。 工具可能剔除参考文献、忽略列表、采用不同断句,或截断长文档。看似收到同一个文件,实际评分文本可能已经不同。
长度会继续放大差异。要求几百词的检测器可以利用文档级模式;接受单个段落的网页工具只能依赖局部特征。语言支持也一样:为英文校准的模型,不能自动假定它在译文或双语参考文献上行为相同。
这些百分比用的不是同一个量纲
各家厂商自己的定义已经说明,长得一样的百分比必须先看量纲,才能谈比较。以下页面查证于 2026 年 8 月 28 日。
| 厂商与输出 | 厂商说这个百分比是什么意思 | 厂商自己写的边界 |
|---|---|---|
| Turnitin AI Writing Report | 模型判断为可能由 AI 生成、或可能由 AI 生成后又被修改的合格文本占比。它是符合检测条件的正文中的比例,不是分类置信度。 | Turnitin 写明模型可能误判,不能把结果单独作为对学生采取不利行动的依据。 |
| Originality.ai AI Detection Score | 分类概率。它自己的例子说,60% Original 表示模型对“原创”这个判断有 60% 的信心。 | 页面明确说,这不表示正文有 60% 原创、40% 由 AI 生成,并承认会出现误报。 |
| GPTZero API class probability | 附在 human、AI 或 mixed 预测类别上的概率。GPTZero 把 90% 解释为:面对相似文档时,检测器有 90% 的时候会把这个类别判断对。 | 这句话限定在相似文档和 API 的预测类别上,不是在说提交里 90% 的词来自 AI。 |
| Winston AI Human Score | 内容由人创作的置信度估计。它写明 80% human、20% AI 指对人类创作有 80% 置信度,不是正文有 20% 来自 AI。 | Winston 说这份判断不具执行效力,而且 prediction map 可能会高亮人写的文字。 |
所以 Turnitin 给的是文档中一个合格子集的占比,另外三个例子给的是对分类标签的置信度。同一个百分号在做不同的数学工作。把一家厂商的数字换算成另一家的尺度,不叫第二意见,而是把问题换了。
同一家厂商也会展示两种不同百分比
不用跨公司比较,GPTZero 自己的公开页面就能看出量纲问题。它的 API 说明与网页检测器页面描述了两种不同输出,两边都用了百分号。以下页面查证于 2026 年 8 月 28 日。
| GPTZero 产品表面与字段 | 厂商逐字表述 | 这句话支持的量纲 |
|---|---|---|
| API class probability | "The class probability corresponding to the predicted class can be interpreted as the chance that the detector is correct in its classification."(对应于预测类别的类别概率可解读为检测器分类正确的几率。) | 面对相似文档时,预测出来的文档类别为真的概率 |
| 网页检测器结果 | "GPTZero will suggest what percentage of your text is likely to be AI-generated and highlight the specific phrases it has detected."(GPTZero 会提示你的文本中有多大比例可能被判定为 AI 生成,并高亮显示它检测到的具体短语。) | 提交文本中被描述为可能由 AI 生成的占比 |
它们可以是两个彼此独立的输出字段,不等于厂商自相矛盾。实际记录时必须写清产品表面和字段;只说“GPTZero 返回 30%”,还不足以确定这个数字量的是什么。
两家中文服务用同一个百分号表达不同东西
两份现行中文厂商页面也能看到同样的量纲差异。下面的逐字表述查证于 2026 年 8 月 28 日。
| 服务与输出 | 厂商逐字表述 | 这句话支持的量纲 | 核验日期 |
|---|---|---|---|
| 知网毕业论文(设计)管理系统 AIGC 检测服务 | “检测结果中的AIGC值表示的是文章内容存在AI生成的概率大小” | 文章内容存在 AI 生成的概率性判断;该页没有把它定义成词或句子的占比 | 2026-08-28 |
| 万方文察 AIGC 检测 | “精准识别论文中疑似AI生成文本占比” | 疑似 AI 生成文本在论文中的占比 | 2026-08-28 |
两个页面把同一个百分号放在不同的量上:一个讲文章存在 AI 生成的概率,一个讲疑似文本占比。前者的 30% 不能直接摆到后者的 30% 旁边比较,两家也都没有公布换算规则。
有些检测器几乎不输出连续刻度
比较分数时还有一层麻烦:某些检测器在基准测试里的输出集中在 0 或 1 附近,另一些则铺满更多刻度。这不一定说明底层模型没有连续得分;阈值、取整和界面都可能把连续信号显示得像二元判断。
HumanizerBench 对每个样本跑五个商业检测器,而它取中位数而不是平均数,理由正是这个:集合里有二值化的检测器时,一个离群值能把均值挪动 0.25。它的方法论页面直接这么写。
这类输出当然可以算平均数,但当输入单位与校准都不一致时,平均值该怎么解释并不清楚。中位数能降低一个极端值的影响,却不能揭示真相,也不能让多个检测器变得彼此独立。HumanizerBench 是公开的产品基准,不是机构级验证研究,它的聚合选择应当放在这个范围内理解。
多数表决也有同样限制。五个在重叠语料上训练的相关工具,不是五位独立证人;一致可能来自共同盲点,分歧也可能只来自不同阈值。没有与目标人群相匹配、且作者身份已知的测试集,就无法把几票赞成转换成作者使用 AI 的概率。
那该怎么办
由此有四条推论,都与写作技巧无关。
- 在正式程序里,先确定学校实际使用的那份报告。 换一家检测,只能得到另一家的看法,复现不了学校的工具、设置与版本。
- 第二意见判你没事不等于洗清,判你有事也不等于证据。 两者都只是某一个分类器的输出,而同一份文本,另外几个分类器读出来是别的结果。
- 问清楚这个分数被用来做什么。 Turnitin 明确说模型可能误判,不应成为对学生采取不利行动的唯一依据。检测结果只是复核输入,不是学术不端认定。
- 如果是研究性比较,就固定所有条件。 使用相同版本、完整输入、语言、日期与已标注语料,同时记录失败与排除内容,不能只抄界面上的数字。
在申诉中,几张相互矛盾的检测截图通常只会增加噪声。草稿、笔记、来源标注、版本历史,以及作者解释写作选择的能力,比另一个不透明分类器更直接地回答作者身份。对教师而言,厂商分歧意味着应当在困难个案出现之前设计好佐证流程,而不是事后临时补。
做采购评估时,应比较不同人群与文体的误差,而不是只问谁宣称总体准确率最高。还应要求公开更新政策、保留报告版本审计轨迹、说明合格文本规则,并提供学生能够实质回应的报告导出。机构越清楚工具只贡献哪部分信息、哪些证据可以推翻它,厂商分歧就越不危险。
想知道这个数字一开始在测什么,见AI 检测器实际在测什么。
继续阅读