ChatGPT 是 AI 检测器吗:OpenAI 自己公布过它那个分类器的数据
越来越多的指控是从一张截图开始的:聊天机器人说「这段很可能是 AI 写的」。那就值得看看,做这个聊天机器人的公司自己公开过什么。
HumanPen 团队
· 7 分钟
先说结论
不是。OpenAI 为这件事单独训练过一个分类器,公布了实测准确度——它正确识别出 26% 的 AI 文本,同时把 9% 的人类文本误判为 AI——并在 2023 年 7 月 20 日把它下线,理由写的是 "due to its low rate of accuracy"(准确率太低)。你去问聊天模型「这是不是 AI 写的」,它不是那个分类器,从来也不是;它给出一个听上去合理的答案,因为生成听上去合理的答案正是它在做的事。
OpenAI 究竟做了什么,又测出了什么
2023 年 1 月,OpenAI 发布了一个分类器,自述是 "trained to distinguish between text written by a human and text written by AIs from a variety of providers"(训练用途是区分人写的文本与来自各家厂商的 AI 写的文本)。那篇公告今天仍在线,顶部加了一条下线说明。
数字就写在公告里,不是别人做的独立测试:
"In our evaluations on a 'challenge set' of English texts, our classifier correctly identifies 26% of AI-written text (true positives) as 'likely AI-written,' while incorrectly labeling human-written text as AI-written 9% of the time (false positives)."(大意:在一组英文「挑战集」上,分类器把 26% 的 AI 文本正确判为「很可能由 AI 写成」,同时有 9% 的人类文本被错判成 AI 写的。)
抓到二十六个百分点。九个百分点的人类写作被误判。而这是厂商对一个自己专门为此打造、还能拿自家模型输出当训练数据的系统,给出的自评。
公告开头还有一句被引用得远远不够多的话:"it is impossible to reliably detect all AI-written text."(要可靠地检出全部 AI 文本,是不可能的。)
它自己公布的局限
公告里有一节专讲局限,读起来像是一群预料到自己会被误用的人写的。用它自己的话说:
- "It should not be used as a primary decision-making tool, but instead as a complement to other methods of determining the source of a piece of text."(不应作为主要的决策工具,只能作为其它判断手段的补充。)
- "The classifier is very unreliable on short texts (below 1,000 characters). Even longer texts are sometimes incorrectly labeled."(对 1,000 字符以下的短文本非常不可靠;更长的文本有时也会被判错。)
- "Sometimes human-written text will be incorrectly but confidently labeled as AI-written by our classifier."(有时人写的文本会被它既错误又自信地判成 AI 写的。)
- "We recommend using the classifier only for English text. It performs significantly worse in other languages and it is unreliable on code."(建议只用于英文;在其它语言上表现明显更差,对代码不可靠。)
- "Text that is very predictable cannot be reliably identified."(可预测性很强的文本无法被可靠识别。)它举的例子是前 1,000 个质数的列表,"because the correct answer is always the same"(因为正确答案永远是同一个)。
- "Classifiers based on neural networks are known to be poorly calibrated outside of their training data. For inputs that are very different from text in our training set, the classifier is sometimes extremely confident in a wrong prediction."(神经网络分类器在训练数据之外的校准很差;面对与训练集差异很大的输入,它有时会对一个错误的预测极其自信。)
第三条和最后一条说的是同一件事:自信和正确之间没有连线。这类工具说「肯定是 AI」,并不比它说「可能是 AI」更有分量。同一套机器,换了个数字挂上去而已。
然后它被下线了
同一页的顶部:
"As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy."(自 2023 年 7 月 20 日起,该 AI 分类器因准确率过低而不再提供。)
一家公司下架自己的产品,并把准确率写成理由——这在这个领域里差不多是最干净的一种证据。说这句话对它自己是有代价的,也正因如此,它比任何一边的第三方意见都更值钱。
聊天模型不是那个分类器
这一点最需要讲明白,因为「下线」这件事有时被传成能力搬进了聊天机器人里。并没有。那个分类器是一个单独微调出来的模型,公告里的描述是 "a language model fine-tuned on a dataset of pairs of human-written text and AI-written text on the same topic"(在同题材的人写文本与 AI 文本成对数据上微调的语言模型),并且刻意调过置信阈值 "to keep the false positive rate low"(以压低误报率)。
这些描述没有一句是在说一个聊天界面。当你问聊天模型某段话是不是 AI 写的,它没有任何检测组件可查;它生成的是「这类问题后面通常会跟着的那类文字」。它会给你一个听着笃定的结论、你要的话还能给个百分比、再附一串理由——而同一段话你再问一次,它经常给出另一个结论。
所以在传的那张截图,不是一次不够好的测量。它根本不是测量。
这件事能说明和不能说明 Turnitin 的什么
一家厂商下线的分类器,说明不了另一家厂商现行产品的任何事情,硬扯过去是不诚实的。
Turnitin 的检测器是另一套系统,它的制造方用另一套说法描述它,有自己公开的主张,也有自己被记录在案的失效方式。检测器之间对同一段文字的判断差距很大,那是另一个问题、有它自己的证据,写在同一段文字在不同检测器上能差多远。而受误报影响最大的人群是有记录的——如果英语不是你的第一语言,这一点尤其相关,见非母语英语写作在研究里被测出什么。
这篇能成立的只有那个很窄的结论:拿聊天模型去问「这是不是 AI 写的」不构成检测;而做出最有名那个聊天模型的公司,专门造过一个分类器、测过它、又把它撤了。
如果你就是这样被标上的
给一点可操作的形状,但不假装我们了解你所在院校的流程。
- 先弄清这个说法是怎么来的。「被标了」可能是学校的检测系统出了一份报告,也可能是某个人把你的作业粘进了聊天机器人。这是两种情况,其中只有一种附带一份文件。
- 如果有报告,就去要。报告里有具体片段和位置;聊天窗口的截图里只有一句话。
- 把同一段文字、同一个问题,在两个全新会话里各问一次。不稳定是一件你可以当场演示的性质,不用靠嘴说。
- 别拿这些当开场。说服人的是过程和来历;关于工具的争论很少奏效,而一上来就提技术异议,容易被读成在回避问题。
我们在这件事里的位置
我们做的是改写文档,所以该把话说明白:上面没有一句是在论证检测不管用,我们也不卖这个论证。HumanPen 针对的是另一种情形——真的有一份报告,上面有具体片段被标红。那些标红划定了它改动的边界,边界之外一个字不碰。
如果你手上只有一张聊天机器人的截图、背后没有任何报告,那你面对的不是一个改写问题。你面对的是一场要去谈的话,而上面那些材料就是我们会带进去的东西。
常见问题
ChatGPT 能判断一段文字是不是 AI 写的吗?OpenAI 为这个任务单独造了一个分类器而不是用聊天模型,公布了它的准确度,并在 2023 年 7 月以准确率过低为由把它撤了。聊天界面没有任何检测组件可查。
OpenAI 那个分类器的数字是多少?在一组英文挑战集上,它正确识别出 26% 的 AI 文本,同时有 9% 的人类文本被错判为 AI 写的。
为什么聊天机器人听上去那么肯定?OpenAI 自己写的局限里就有一条:这类分类器可能 "extremely confident in a wrong prediction"(对错误的预测极其自信)。而聊天模型笃定的语气是它写字方式的一种属性,不是关于你这段文字的证据。同一段问两次,经常得到两个答案。
那是不是说明 Turnitin 的 AI 检测也不管用?这件事对它什么都没说。不同厂商、不同系统、不同的公开主张。这份出处唯一能支撑的结论是:把聊天模型当检测器用,不是检测。
继续阅读