同一篇文章,AI 分数却变了?2026 年 9 月 GPTZero 和 Copyleaks 换了模型,Pangram 定了截止日
同一篇文章,你用 AI 检测器查了两次,数字变了,可你一个字没改,或者改动远没有分数变化那么大。2026 年 9 月 18 日到 30 日之间,有三个检测器换掉了负责打分的模型,或者按计划要在这期间换。下面说清 GPTZero、Copyleaks 和 Pangram 各自说了什么、哪天说的、说到哪里为止,以及怎样判断你手上的两个分数到底能不能放在一起比。
HumanPen 团队
· 9 分钟
一个字没改,AI 分数为什么变了?
可能是检测器变了,不是你的文章变了。GPTZero 的发布说明写着,它称为 4o 的新模型在 2026 年 9 月 18 日上线;它的发布文章则说,这个模型从 9 月 20 日起成为所有用户的默认模型。Copyleaks 在 9 月 22 日发布了第 11.0 版 AI 文本检测模型。Pangram 说它的旧模型 3.3.2 会一直当默认模型,「until September 30, 2026」(直到 2026 年 9 月 30 日)。如果你的两次检测落在其中某个日期的两边,两个分数之间的差距可能跟你对文字做了什么毫无关系,不管分数是升了还是降了。
本文讲的是这三家第三方检测器。如果你在比的两个数字来自 Turnitin,它的模型有自己的更新节奏,见同一篇论文重新提交后 AI 分数变了,为什么?
三家各说了什么、哪天说的
| 检测器 | 换了什么 | 厂商给的日期 | 写在哪里 |
|---|---|---|---|
| GPTZero | Model 4.10b,它称为「4o」 | 9 月 18 日上线(发布说明);9 月 20 日起成为所有用户的默认模型(9 月 24 日的发布文章) | GPTZero 的模型发布说明,以及新闻文章《Introducing GPTZero 4o》 |
| Copyleaks | AI Text Detection Model V11.0(AI 文本检测模型 11.0 版) | 9 月 22 日 | Copyleaks API 文档的「What's New」(更新动态)页 |
| Pangram | 计划由 Pangram 4 接替 Pangram 3.3.2 成为默认模型 | Pangram 4 从 7 月 29 日起可以通过 API 使用;3.3.2 保留为默认模型到 9 月 30 日 | Pangram 的 Pangram 4 迁移指南和发布文章 |
这些日期单看任何一个,都不能告诉你你那一次检测是哪个模型打的分。每家的公告都留了一个空档,而且三家的空档不一样。
GPTZero:一个模型,两个日期
发布说明里这一条的标题是「September 13, 2026 (2026-09-13-base, Model 4.10b aka 4o) | released on September 18, 2026」(2026 年 9 月 13 日(2026-09-13-base,Model 4.10b,又称 4o),2026 年 9 月 18 日上线)。也就是说,条目标的是 9 月 13 日,写明的上线日却是 18 日。下面列了两项改进:「Decreased false positive rate on a variety of domains」(在多种领域上降低了误报率)和「Improved performance on third party benchmarks」(在第三方基准测试上表现更好)。
GPTZero 介绍这个模型的文章落款是 9 月 24 日,给的却是另一天:「As of 20 September 2026, the updated model is available to all users and is the default model offered on GPTZero.」(自 2026 年 9 月 20 日起,更新后的模型向所有用户开放,并成为 GPTZero 提供的默认模型。)
哪个日期才对,我们不替它定。9 月 18 日之前的检测,早于两个日期;9 月 20 日及以后的检测,晚于两个日期;夹在中间的,两种都有可能。
GPTZero 换模型很勤。它的发布说明里,日期在 2026 年的模型条目一共 11 条,其中 10 条是「base」模型、1 条是多语言模型。所以就算没有这一次,相隔一两个月的两次检测,也很可能是不同模型打的分。
新结果上你可能会看到一样东西:灰色文字。4o 那篇文章把它当作新功能介绍(「We've also introduced a new highlighting color: gray」(我们还新增了一种高亮颜色:灰色)),并说「Gray spans show which pieces of text are excluded by our AI detector」(灰色部分表示被我们的 AI 检测器排除在外的文字),目前被排除的是标题。发布说明则把背后的改动,也就是标题不再进入模型输入,记在更早的 8 月 1 日(Model 4.8b):「headers are now excluded from our model's input」(标题现在不再进入我们模型的输入)。比较分数时要看的是这个更早的日期:8 月 1 日之前的 GPTZero 检测,标题算进去了;之后的没有。
Copyleaks:公告是写给开发者看的
Copyleaks 的更新动态在 9 月 22 日写道,它已「released version 11.0 of the AI Text Detection model」(发布了第 11.0 版 AI 文本检测模型),这一版「improves detection accuracy and extends coverage to recently released large language models」(提高了检测准确度,并把覆盖范围扩展到最近发布的大语言模型)。
下一段看得出它是写给谁的:「No request changes are needed - the modelVersion field in the response now returns v11.0.」(请求无需改动,响应里的 modelVersion 字段现在返回 v11.0。)这是 Copyleaks 的 API 文档,也就是别的软件接进来调用的那一层服务。它说新模型已经在 API 的 AI 文本检测上生效,但没说 Copyleaks 自己的网站,或者接进你们学校系统里的那个版本,是哪天跟着换的。
倒是有一所大学提前告诉了自己的老师。Canisius University 的 Center for Faculty Development and Innovation(教师发展与创新中心)在博客上发了一篇日期为 9 月 14 日的文章:「On Tuesday, September 22nd, Copyleaks will be updating their AI text detector model to help ensure accuracy with AI content detection.」(9 月 22 日星期二,Copyleaks 将更新其 AI 文本检测模型,以确保 AI 内容检测的准确性。)还提醒「instructors should monitor their scans and be aware of variances with scan results and adjust settings accordingly.」(老师们应留意自己的检测,注意检测结果可能出现的差异,并相应调整设置。)这只是一所学校提前大约一周转达的通知,也没写版本号。不过它说明,这次更新被预期会出现在老师的检测结果里,不只是开发者的代码里。
如果你需要确认某个 Copyleaks 结果是哪个模型给的,API 从 2024 年 4 月 16 日起就带着答案:那天 Copyleaks 在 AI 检测结果里加了一个 `modelVersion` 字段。这个版本号会不会显示在你看到的那份报告上,取决于生成报告的那个系统。
Pangram:定了截止日,没确认已经换了
Pangram 4 于 2026 年 7 月 29 日「released through the API」(通过 API 发布)。迁移指南接着写:「Pangram 3.3.2 is still the default and will remain live until September 30, 2026.」(Pangram 3.3.2 仍是默认模型,并将一直保留到 2026 年 9 月 30 日。)发布文章把这句话对「不指定模型的软件」意味着什么说得更直白:「Default requests that don't specify a model will continue routing to Pangram 3 using the previous billing system, until Pangram 3 is deprecated.」(不指定模型的默认请求,在 Pangram 3 停用之前,会继续按旧的计费方式转给 Pangram 3。)
所以按 Pangram 自己的说法,一个调用 Pangram 时不写明模型的平台,整个 9 月拿到的都是 3.3.2;按它的计划,30 日之后就不再是了。
我们没能确认的是:这次切换到底发生了没有。10 月 2 日,我们读过的 Pangram 页面没有一页说已经切了,包括迁移指南(最后修改于 8 月 7 日)、发布文章、Pangram 4 的模型说明卡和 API 参考文档。API 参考文档里有一个「default」(默认)选项,说它「follows Pangram's current default model」(跟随 Pangram 当前的默认模型),却没写当前的默认模型是哪一个。而且这些都是针对 API 的说法,没讲过渡期间 Pangram 自己的网站用的是哪个模型。
不过有一个看得见的标志,只是适用范围很窄。Pangram 的迁移指南说,它的分段(「window」)标签变了:「AI-Assisted replaces the previous Lightly AI-Assisted and Moderately AI-Assisted labels.」(AI-Assisted 取代了此前的 Lightly AI-Assisted 和 Moderately AI-Assisted 两个标签。)通过 API 拿到的 Pangram 4 结果还会返回版本号「4.0」。所以,如果早先一次结果里有分段标着「Moderately AI-Assisted」,后一次的分段只出现「AI-Assisted」,那两次就不是同一个模型给的。有两点限制。一是这说的是分段标签,不是整篇结论;Pangram 4 的 API 示例里,整篇结论也写作「AI Assisted」。二是 Pangram 2025 年 12 月的公告说,免费用户看到的是「lightly AI-assisted text as Human, and moderately AI-assisted text as AI-generated」(轻度 AI 辅助的文字显示为人写,中度 AI 辅助的文字显示为 AI 生成),所以用免费账号的话,你可能根本没见过旧的那两档。
更新之后分数升了或降了,都说明不了你改得怎么样
这几次更新都只用笼统的话描述。GPTZero 说它「on a variety of domains」(在多种领域上)降低了误报;Copyleaks 说 11.0 版「improves detection accuracy」(提高了检测准确度),并覆盖了更新的语言模型。两家都没说某一篇文章的分数会往哪个方向走。
所以,如果你的分数在其中某次更新之后降了,这不能证明你的改写起了作用;如果升了,也不能证明你越改越糟。这两个数字里混着你的修改和一次模型更换,哪份结果里都没有东西能把两者分开。
怎样公平地比较两个分数
- 先对日期。 写下每次检测是哪一天,和上面的日期对一对。只要中间夹着其中某个日期,就把这两个数字当成两台不同仪器的读数。
- 再看设置是否一样。 有些工具让检测的人自己选模式。GPTZero 的公告里提到一个「Advanced Scan」(高级扫描)模式;Originality.ai 可以按模型检测(「Classic」,经典模式),也可以设一个「AI Allowance」(AI 容许度),可选 0%、5%、15%、25% 或 40%。模式不同,就是另一次测量。
- 想知道你的修改起了什么作用,就在同一天把两个版本都查一遍。 旧稿和新稿,同一个工具、同一种设置,一个接一个查。这样两次几乎一定用的是同一个模型(结果上如果显示模型名或版本号,对一下两次是否一致;像 9 月 18 日到 20 日这样的切换期,同一天也可能两种都有),差别就只来自文字。但它也只说明那一个工具那一天怎么看,不代表你们学校用的工具会给出什么结果。
- 留下完整结果,不要只记一个数字。 截图或保存报告本身,带上日期、模式,以及上面显示的任何模型名称或版本号。手抄下来的「34%」,以后没法拿去和发布说明对照。
- 如果检测是别人做的,问清三件事: 用的什么工具、哪一天、什么设置或版本。没有这三样,这个数字跟什么都没法比,包括你自己查的结果。
跨工具比较是另一个问题,数字对不上有它自己的原因,见为什么同一段文字在不同检测器上分数差很多。GPTZero 结果上的标签是什么意思,见GPTZero 的 Mixed 和 AI Polished:这两个标签是什么意思。
常见问题
我以前的检测结果会按新模型重新打分吗? 上面引用的三份公告都没说会给以前的结果重新打分。把存下来的结果当作当天那个模型的一次读数。作为对照,Turnitin 的模型发布说明里写着:「This release will not retroactively update previously-generated AI writing reports.」(本次更新不会追溯更新此前已生成的 AI 写作报告。)
老师的检测是更新前做的,我的是更新后做的,算哪个? 谁也抵消不了谁。它们是两个不同模型的读数,设置很可能也不一样。课程那边看的是老师做的那一次,所以有用的问题是:那次用的什么工具、哪一天、什么设置。你现在用新模型查的结果,并不是那一次的重跑。
这会影响我的 Turnitin 分数吗? 不会。Turnitin 是另一家公司,有自己的模型更新。用同样的办法去对它的日期。
来源
- GPTZero,GPTZero Release Notes (Model and API)(GPTZero 发布说明(模型与 API)),2026 年 9 月 13 日(Model 4.10b)与 2026 年 8 月 1 日(Model 4.8b)两条;2026 年 10 月 2 日读取。
- GPTZero,Introducing GPTZero 4o(GPTZero 4o 发布文章),落款 2026 年 9 月 24 日;2026 年 10 月 2 日读取。
- Copyleaks,What's New(API 文档更新动态),2026 年 9 月 22 日与 2024 年 4 月 16 日两条;2026 年 10 月 2 日读取。
- Canisius University,Center for Faculty Development and Innovation,Copyleaks AI Text Detector Model Update(Copyleaks AI 文本检测模型更新),落款 2026 年 9 月 14 日;2026 年 10 月 2 日读取。
- Pangram,Pangram 4 Migration Guide(Pangram 4 迁移指南,2026 年 8 月 6 日)与 Introducing Pangram 4(Pangram 4 发布文章,2026 年 7 月 29 日);Introducing Pangram 3.0 with AI assistance detection(Pangram 3.0 与 AI 辅助检测发布文章,2025 年 12 月 11 日);API 参考文档中的 AI Detection 与 Models 两页;均于 2026 年 10 月 2 日读取。
- Originality.ai,Introducing AI Allowance(AI Allowance 功能介绍);2026 年 10 月 2 日读取。
继续阅读