GPTZero 的 Mixed 和 AI Polished:这两个标签是什么意思

GPTZero 先给你三个百分比,再把五个具名分类藏在它们下面,点一下才看得到。AI Polished 是挂在 Mixed 底下的两个之一。GPTZero 在结果页的一个面板里给了它定义,又在 2025 年 6 月的一篇文章里解释过它,那篇文章放在新闻站上,不在帮助中心里。下面按 GPTZero 自己的措辞把这五个分类列齐,再说清每个分类旁边那个数字实际在数什么。

HumanPen 团队

· 14 分钟

先给结论

GPTZero 会给出三个百分比,上方的标题是「Chance this entire text is...」(这整段文本是……的概率),三项分别是 AI、Mixed 和 Human。这个数是模型对「归到这一类是对的」有多大把握,不是你的文章里有多少比例属于这一类。GPTZero 在结果页上就写了这一点,就在那排标签底下的一行字里。点开任一标签,会展开成带名字的子读数,三个标签底下加起来一共五个,「AI polished」是 Mixed 底下的两个之一。GPTZero 对它的定义是「Human-written text that was refined or edited by an AI tool」(由人写成、再经 AI 工具润色或编辑的文本),并补充说,得到这个标签意味着「the core ideas and structure are the student's own work, but AI was used as an editing assistant」(核心想法和结构是学生自己的,只是把 AI 当成了编辑助手)。所以「100% mixed」是模型在说:它非常有把握这份文档属于 mixed 这一类。至于它更倚重 Mixed 底下的哪一种读法,那是另一个数字,再点一下才看得到。

标签旁边那个数,数的到底是什么

先看你眼前这个界面,因为 GPTZero 的答案就印在上面。展开 Mixed 标签,读数正下方就是这一行:

This result isn't the percentage of mixed text, it's the model's confidence in the classification of the entire text as mixed.(这个结果不是混合文本所占的百分比,而是模型把整段文本归为 mixed 的把握。)

另外两个标签底下也有同一句,只把类名换了:AI 底下是「isn't the percentage of AI text」(不是 AI 文本所占的百分比),Human 底下是「isn't the percentage of human text」(不是人写文本所占的百分比)。

这个区分为什么要紧,GPTZero 机器学习团队的负责人 Alex Adam 在一篇日期为 2024 年 1 月 12 日的文章里讲过:

categorizing predictions this way enables the confidence of the detector to be disentangled from the percentage of sentences that are AI-generated. Without this distinction, an AI probability of 50% could mean that the detector is 50% confident in its prediction (essentially a coin flip), or that 50% of the text is AI-generated.(这样划分预测结果,可以把检测器的把握和 AI 生成句子所占的比例拆开。如果不做这个区分,50% 的 AI 概率既可能是检测器对自己的预测只有 50% 的把握(基本等于抛硬币),也可能是有 50% 的文本由 AI 生成。)

同一个「50%」有两种读法,对你来说意思正好相反。三分类输出就是为了把这两种读法分开。

GPTZero 的文档还从另外三个方向印证了这一点。GPTZero 的发布说明里有一条 2024 年 1 月 9 日的记录,说预测结果经过调整,「tuned to better represent the probability that the model is correct」(以更好地反映模型判断正确的概率),并举例说 90% 的 AI 分数意味着「there is a 90% chance that the text is entirely written by an AI」(这段文本完全由 AI 写成的可能性是 90%)。API 帮助页把类别概率描述为「the chance that the detector is correct in its classification」(检测器分类正确的可能性),并补充说 90% 表示「90% of the time on similar documents」(在类似的文档上有 90% 的时候是对的)。注意它说的是类似的文档,是一类文档,不是你手上这一份。技术介绍页则把这一点列为 GPTZero 的研究贡献之一,措辞干到不能再干:检测器被表述为「a trinary classification problem, separating prediction confidence from the proportion of LLM text.」(一个三分类问题,把预测的把握与 LLM 文本所占的比例分开。)

有一个 GPTZero 页面的说法正好反过来。首页的 FAQ 部分说 GPTZero「will suggest what percentage of your text is likely to be AI-generated」(会提示你的文本中大概有多大比例是 AI 生成的)。这句话出现在一个三步操作说明的回答里,不是在描述某个有名字的结果字段,所以很可能只是写得比较随意的营销文案,未必算矛盾。不管是哪种,实际做法都一样:光说「GPTZero 显示 30%」,别人分不清你说的是哪个量,所以要讲明它来自哪个界面、哪个字段。为什么同一段文字在不同检测器上分数差很多把这个问题和 Turnitin、Originality.ai、Winston AI 各自的单位放在一起对照过,跨厂商的版本在那篇里。

上面三个标签,底下五个具名分类

大家最容易卡在这里,这也是为什么「人写的、再用 AI 润色过」这种说法看起来像是凭空冒出来的。最上面一排是三个标签,每个都能点开。

标签点开后是GPTZero 写在底下的那一行
AI「chance AI Generated」(AI 生成的概率)、「chance AI Paraphrased」(AI 改写的概率)「isn't the percentage of AI text」(不是 AI 文本所占的百分比)
Mixed「chance AI-Human Mix」(AI 与人写混合的概率)、「chance AI polished」(AI 润色的概率)「isn't the percentage of mixed text」(不是混合文本所占的百分比)
Human「Human written」(人写)「isn't the percentage of human text」(不是人写文本所占的百分比)

一共五个具名读数。「AI polished」不是和 Mixed 并列的第四个桶,而是 Mixed 可能表示的两种情况之一。光这一条就能解开大部分困惑,因为一旦知道 Mixed 底下另一种读法叫 AI-Human Mix,一个 mixed 结果读起来就完全是另一回事了。

点任一读数旁边的小信息图标,会弹出一个面板,标题是「Understanding AI Classifications」(理解 AI 分类),五个分类各有一个标签页。下面是 GPTZero 给的定义原文:

AI Generated — Text written directly by an AI language model with no meaningful human editing.(由 AI 语言模型直接写成、没有经过实质性人工编辑的文本。) AI Paraphrased — AI-generated text that was rewritten — either by a tool or by hand — to disguise its origin.(AI 生成后又被改写过的文本,用工具或手工改写都算,目的是掩盖来源。) AI-Human Mix — Human-written text combined with AI-generated text in the same document.(同一份文档里,人写的文本和 AI 生成的文本拼在一起。) AI Polished — Human-written text that was refined or edited by an AI tool.(由人写成、再经 AI 工具润色或编辑的文本。) Human — Text written entirely by a human with no AI involvement.(完全由人写成、没有 AI 参与的文本。)

AI Polished 那个标签页还有第二段,这段最值得放在手边:

The text was originally written by a human, then run through an AI tool to improve grammar, rephrase sentences, or enhance clarity. The core ideas and structure are the student's own work, but AI was used as an editing assistant.(这段文本最初由人写成,之后用 AI 工具修改语法、换种说法改写句子,或让表达更清楚。核心想法和结构是学生自己的,只是把 AI 当成了编辑助手。)

注意每条定义是从哪里起步的。Polished 的起点是人写的文字,Paraphrased 的起点是 AI 的输出。它们不是同一件事的两个程度,而是两个相反的来历,挂在不同的标签底下。

还有两个小细节。GPTZero 在三个地方把这个标签写成了三种样子:标签上是「AI polished」,面板里是「AI Polished」,首页的示例按钮上是「Polished by AI」。另外,免费扫描有最低长度:输入 0 个字符时,输入框提示「Enter at least 250 characters to scan」(至少输入 250 个字符才能扫描),超过之后变成「Great! You've entered enough text to scan」(很好!你输入的文本已经够扫描了)。

「AI Polished」是哪来的,GPTZero 又在哪里解释它

这个分类比另外四个都新。它出现在一条 2025 年 6 月 3 日的发布说明里,归在「Added」(新增)下面,只有一行:

Ability to detect “polished” texts that are lightly edited by AI(能够检测经 AI 轻度编辑的「polished」文本)

九个月后又多了一行,2026 年 3 月 11 日:「Improved performance on the AI polished class.」(提升了 AI polished 类的表现。)发布说明里提到它的,就是这两条。

更长的解释在第一条记录两天之后出现,就是 GPTZero 介绍 AI Polished 类的那篇文章,作者 Emily Napier,日期 2025 年 6 月 5 日。它把这个标签挂在哪里写得明明白白:

To improve transparency, we’ve decided to distinguish between documents that combine “chunks” of AI and human text and documents rewritten or polished by AI. We now identify these documents under the “Mixed” class with an accompanying tag of “AI Polished”.(为了提高透明度,我们决定区分两种文档:一种是 AI 文本和人写文本「成块」拼在一起,另一种是被 AI 改写或润色过。我们现在把这类文档归在「Mixed」类下,并附上「AI Polished」标签。)

这就是上面那张表,只不过换成了 GPTZero 自己的话,还带着日期:mixed 文档有两种,其中一种会被打上 AI Polished 标签。

如果你要去找这篇文章,记得用两个说法搜。它的标题和正文用「AI Polished」,也就是面板上的写法。但有两处图注用的是「Lightly edited by AI」,这不在上面说的三种写法里,而是发布说明里的说法,文章网址也是用它拼出来的。

这篇文章不属于 GPTZero 的帮助中心,帮助中心的文章里也没有一篇提到这个标签。2026 年 9 月 15 日,我们把帮助中心逐篇查了一遍。它的首页列出五个一级分类,各自标着文章数:General 36、API 17、Origin Extension 8、Account Management 11、Microsoft Word Add-In 5,合计 77。逐个点进去,一共是八个子分类,外加三篇直接挂在分类页上的文章,全部列出来正好是 77 篇互不重复的文章。我们把这 77 篇都抓了下来,在每一页的 `innerText` 里搜索,也就是浏览器实际显示出来的文字(不换行空格换成普通空格,网站导航和侧栏也算在内),当天合计 88,894 个字符。侧栏每次加载都会变,所以重跑一遍不会正好得到这个数:

  • `polish`、`polished`、`AI polished`、`AI-polished`、`AI Polished`、`Polished`:各 0 次
  • `Polish`:1 次,指的是波兰语,出现在支持语言列表里
  • `confidence in the classification`,也就是结果页上用的那个说法:0 次

计数器本身是正常工作的:同一天、同一批文本里,`burstiness` 命中 28 次,`paraphras` 18 次,`sentence` 19 次,`mixed` 11 次。一页页翻主新闻索引也找不到这篇。2026 年 9 月 15 日那天,主索引共 30 页,翻到底是 147 个互不重复的文章地址,2025 年 6 月那篇不在其中。它列在新闻 sitemap 里,sitemap 当时有 320 篇文章。GPTZero 发文很勤,等你去查的时候,这两个总数都会变。

这些都不说明这个标签不可靠,这个计数也不是在论证它不可靠。它只是解释了为什么把 GPTZero 的帮助文章翻一遍,关于 AI Polished 还是一无所获。如果有人问你这个标签是什么意思,把那篇文章发给他就行。不过,除了分数,定义面板也要截一张图。那段定义很短,离你文档拿到的读数只隔一次点击;对方是把「polished」当成委婉说法,还是读到了 GPTZero 亲口说核心想法是写作者自己的,差别就在这张图上。

这个标签说的到底是哪一层

标签描述的是整份文档,它们上方的标题原文就是「Chance this entire text is...」(这整段文本是……的概率)。句子高亮是另一个输出,作用不一样,FAQ 把两者谁推出谁说得很明确:

The sentence-level classification should not be solely used to indicate that an essay contains AI (such as ChatGPT plagiarism). Rather, when a document gets a MIXED or AI_ONLY classification, the highlighted sentence will indicate where in the document we believe this occurred.(句子级分类不应单独用来说明一篇文章含有 AI(例如用 ChatGPT 抄袭)。而是当一份文档被归为 MIXED 或 AI_ONLY 时,高亮的句子会指出我们认为这发生在文档的哪个位置。)

先有文档结论,再有高亮。高亮是在解释结论,不是一句句加起来得出结论。界面上它显示为一个列表,标题是「Your most AI sentences」(你最像 AI 的句子),每一条标的是影响程度,没有自己的百分比。

GPTZero 还公布了每一层该信几分的排序,而这个排序和大多数人读报告的习惯正好相反:

The accuracy of our model increases as more text is submitted to the model. As such, the accuracy of the model on the document-level classification will be greater than the accuracy on the paragraph-level, which is greater than the accuracy on the sentence level.(提交给模型的文本越多,模型越准确。因此,模型在文档级分类上的准确度会高于段落级,段落级又高于句子级。)

你最后盯着看的,往往就是那一句被高亮的句子。而它恰恰是 GPTZero 自己评为最不准的那一层。

还有两个行为容易让人摸不着头脑。Advanced Scan 帮助文章说,被高亮的是那些「disproportionately affecting your overall AI or human score」(对你整体的 AI 或人写分数影响格外大)的句子,讲的是影响,不是比例;GPTZero 还补充说,没被高亮的句子「may still have an effect on your score, but they aren't more likely than other parts of your document」(可能仍会影响你的分数,但并不比文档其他部分的可能性更高)。另外,结果处在中间、却一句高亮都没有,这种情况有专门的一篇帮助文章:「there isn't one specific section of the document that is especially likely to have AI content. Rather, the entire document has signs of being AI generated, but with lower certainty.」(文档里没有哪一个特定部分特别可能含有 AI 内容,而是整份文档都有 AI 生成的迹象,只是把握较低。)

几乎没改什么,数字为什么变了

有两条发布说明和这件事有关,而两条的范围都比人们以为的窄。

2024 年 2 月 6 日:

Processing of long documents has been made more consistent. There should be less variation in predictions when cutting out a few sentences from long AI-generated documents(长文档的处理更一致了。从 AI 生成的长文档里删掉几句话时,预测结果的波动应该会更小)

2025 年 5 月 2 日:

Increased output stability when rescanning multiple times(多次重新扫描时,输出更稳定)

看清每条的范围。第一条说的是从 AI 生成的长文档里删句子。第二条说的是同一段文本扫两遍。两条都没有讲「改了自己稿子里的一句话再扫一遍」会怎样,我们也没找到讲这件事的说明:在上面那 77 篇帮助文章里,`stabilit`、`rescan`、`re-scan` 都是 0 次。这是本文没能补上的空白,它有一个实际后果:两个 GPTZero 数字只有在你知道各自是什么时候测的情况下,放在一起比才有意义,所以记分数时把日期一起记下来。

日期为什么要紧,发布说明页上就有答案。按页面 `innerText` 里行首的记录日期来数,自 2023 年 5 月以来共有 55 条带日期的记录,其中 2026 年截至 9 月 15 日有 10 条,最新一条是 2026 年 8 月 12 日(Model 4.9b)。今年的两条:5 月的「More granular mixed text predictions and identification of interleaving mixed texts」(更细粒度的混合文本预测,并能识别交错出现的混合文本),8 月的「Robustness to headers; headers are now excluded from our model's input」(对标题更稳健;标题现在不再计入模型输入)。结果页会在结论旁边印出模型版本,这是界面上最容易记下来的一项。7 月扫的和上周扫的,用的不是同一个模型。

把握档位是读数的另一半,也是别人拿分数说事时最常被丢掉的那一半。Advanced Scan 帮助文章把各档位对应到了错误率:「Highly confident: our error rate is less than 2%」(高度有把握:我们的错误率低于 2%)、「Moderately confident: our error rate would be around 10%」(中等把握:错误率约为 10%)、「Low confidence: our error rate would be 14% or higher」(把握较低:错误率为 14% 或更高)。技术介绍页给最高一档的平均错误率却是「less than 1%」(低于 1%),依据是内部评估集。两个数字都出自 GPTZero,用的都是 GPTZero 自己的数据,但对不上;写着 2% 的那篇帮助文章,标注的最后更新时间是一年前。GPTZero 的 ML 负责人对底层这个数字的局限也说得很坦白:校准这一步让检测器在大多数情况下「not overconfident in its predictions」(不会对自己的预测过度自信),但「achieving perfect calibration is nearly impossible」(做到完美校准几乎不可能)。只报类别、不报把握档位,等于只给了半个结果。

拿到一个标签之后怎么办

你做的事被不被允许,要问你的学校,不是问分类器。GPTZero 自己在这一点上说得比很多引用它的人都直白:「these results should not be used to punish students」(这些结果不应被用来惩罚学生),以及「we don't recommend using an AI detection result as the only proof for academic punishment or discipline」(我们不建议把 AI 检测结果当作学术处罚或纪律处分的唯一证据)。它的 ML 负责人说得更进一步,如果有人正拿着一次扫描结果冲你来,这句值得知道:

we do not encourage punitive actions based solely on the results of a single scan. Instead, a history of scan results should ideally be established, serving as stronger evidence of AI usage.(我们不鼓励仅凭一次扫描的结果就采取惩罚措施。理想情况下,应当先积累一段扫描结果的历史记录,作为使用 AI 的更有力证据。)

下面五件事在你自己手里:

  1. 先点开标签,别急着慌。 光秃秃一个「Mixed」是整个界面上信息量最少的东西。它底下的两种读法是 AI-Human Mix 和 AI polished,说的是两种不同的情况。
  2. 把类别、子读数、把握档位、模型版本和日期截进同一张图。 这五样都在同一个面板上。只把数字抄下来,能让它被读懂的那些信息就全丢了。
  3. 定义面板也截图,并保存 GPTZero 2025 年 6 月那篇文章的链接。 面板藏在信息图标后面,截图能把定义按你屏幕当时显示的样子留下来。那篇文章是 GPTZero 用文字说明「AI Polished 是 Mixed 底下的一个标签」的地方。
  4. 先弄清你的学校实际用的是什么,再去和别处来的数字较劲。 在免费工具上自查得到的,不是你们院系会看的那份报告;各家的类名、措辞和阈值也不通用。两个工具对同一份文件给出不同结论是意料之中,不是出了故障。
  5. 保留草稿和修改记录。 GPTZero 给教师的建议是向学生要「drafts, revision histories, or brainstorming notes」(草稿、修改记录或头脑风暴笔记),并特别点出编辑器的版本历史往往最能把问题说清。这类证据得在你用得上之前就已经存在,所以这是今天就该做的事,不是收到邮件之后才做的事。

检测器给出的是对眼前这段文本的一个读数,不是这段文本如何写出来的记录。不管你落在哪个标签上,真正争得赢的是关于你写作过程的那部分,而证据在你的草稿里。

延伸阅读

上文的引文都读自 GPTZero 自己的页面,以及一次未登录状态下跑的免费扫描,读取日期是 2026 年 9 月 15 日和 17 日,每条引文都注明了出处位置。凡是其中两个页面对同一件事给出不同数字的,两个数都列在了文中。

继续阅读