聊天机器人多常把人写的文字判成 AI?一项 2026 年研究测了 15 个模型
老师把你的论文贴进聊天机器人,问是不是 AI 写的,得到的回答是「是」。2026 年 9 月发布的一篇预印本,量了聊天机器人背后的 AI 模型对人写的文字给出这个回答的频率:三代共 15 个模型,对同样 1,000 篇人写文本回答同一个问题。结果发现,问的是哪个模型,差别非常大。下面是这些数字,以及它们对你拿到的那个回答能说明什么、不能说明什么。
HumanPen 团队
· 9 分钟
聊天机器人多常把人写的文字判成 AI?
要看是哪个模型。在 2026 年的一篇预印本里,15 个聊天机器人背后那类通用 AI 模型通过 API、用同一句固定的问题,逐篇判断 1,000 篇人写文本出自人还是机器。上一代(GPT-4o 和另外四个 2024–25 年的模型)平均把 36.5% 的人写文本判成「机器」。最新一代(八个 2026 年的模型,包括 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro Preview)是 3.6%,单个模型从 0.1% 到 8.6% 不等。所以聊天机器人把人写的文字错判成「机器」的频率,很大程度上取决于模型,在这次测试里从三分之一以上到几乎为零都有。这样的比例描述的是一大批文本,不是你这一篇;单凭聊天机器人的回答也不能当证据:测试用的文本不是学生作文,而一张截图未必看得出是哪个模型回答的、问题又是怎么问的。
这项研究题为《Using LLMs to Detect LLM-Generated Texts: A Cross-Generation Analysis》(用大语言模型检测大语言模型生成的文本:跨代分析),作者是 Haiyue Yuan、Jie Guo、Weidong Qiu、Zheng Huang、Ruizhe Li 和 Shujun Li,来自英国肯特大学、上海交通大学和英国伯明翰大学,2026 年 9 月 28 日发布在 arXiv 上。它是预印本,没有经过同行评审。
研究者做了什么
他们从公开研究数据集 M4GT-Bench 里取了 1,000 篇人写文本,论文的描述是 "covering a broad range of topics, styles, and formats"(涵盖各种主题、风格和体裁)。我们翻看了他们公开的文件,里面有百科词条、操作指南、论坛回帖、论文摘要和论文审稿意见。论文没有把其中任何一篇说成学生作业。15 个模型又各按对应的提示写了 1,000 篇,提示大多要求 150 到 300 词。
然后每个模型轮流当检测器。每篇文本都发给每个模型,附上同一段指令,开头是 "Please determine whether the following text is generated by large language models or by a human"(请判断下面这段文字是大语言模型生成的还是人写的),模型只能回答「human」或「machine」,并说明理由。有效判断一共超过 233,000 次。
研究者按发布时间把模型分成三代:
- 最老一代(2023 年到 2024 年初): GPT-3.5 Turbo Instruct 和 Mixtral 8×22B Instruct。
- 上一代(2024–25 年): GPT-4o、DeepSeek-V3、Llama 3.3 70B Instruct、GLM-4 32B,以及一个 720 亿参数的 Qwen 模型(论文的模型表里写作 Qwen2.5-72B Instruct,正文其他地方写作 Qwen2-72B)。
- 最新一代(2026 年): GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro Preview、DeepSeek-V4-Pro、Qwen3.6-Max-Preview、GLM-5.1、MiMo-V2.5-Pro 和 Kimi K2.6。
这些模型主要是通过 OpenRouter 和各厂商自己的 API 调用的,论文没有提到测试过 ChatGPT、Gemini 或 Claude 的应用。论文也没写测试是哪天跑的:它说最新一代是 "at the time of our experiments"(做实验时)最新的模型,并记录了 2026 年 9 月 3 日核对过各模型的默认参数。
我们之前那篇ChatGPT 能判断文章是否由 AI 写成吗?查看 OpenAI 公布的证据,是围绕 OpenAI 专门做过、测过、2023 年又撤下的那个分类器写的,并由此论证:去问聊天模型「这是不是 AI 写的」,不算检测。那篇没有引用聊天模型做这件事的实测数据。这项研究补上了这一块:直接拿这个问题测了 15 个聊天模型,测试条件是 API,比单独的分类器更接近老师把论文贴进对话框的情形,但也不完全一样。
人写文本被判成了什么
| 当检测器的模型 | 人写文本被判成「机器」 | AI 文本被判成「人」 |
|---|---|---|
| 最老一代(2 个模型) | 13.0% | 81.9% 到 84.1% |
| 上一代(5 个模型) | 36.5% | 39.6% 到 48.1% |
| 最新一代(8 个模型) | 3.6% | 6.1% 到 13.4% |
每个数字都是这一代模型的平均值。最后一列的范围,取决于 AI 文本是哪一代模型写的。
三代模型错的方向各不相同。最老一代大多答「人」,所以误判的人比下一代少,却放过了五分之四以上的 AI 文本。上一代反过来:抓到的 AI 文本多了,却把三分之一以上的人写文本判成机器写的。最新一代两种错都少,不过对 2026 年模型写的 AI 文本,漏掉的更多(13.4%)。
第一行单独看容易被误导。13% 的误判率看起来比 36.5% 好,可它来自很少说「机器」的模型。一个从不指认任何人的检测器,也什么都抓不到。
同是最新一代,模型之间差别仍然很大
3.6% 这个平均数底下差得很开。作者公开的结果文件给出了最新一代每个模型在同样 1,000 篇人写文本上的数字:
| 最新一代模型 | 人写文本被判成「机器」 |
|---|---|
| Gemini 3.1 Pro Preview | 0.1% |
| Kimi K2.6 | 1.2% |
| Qwen3.6-Max-Preview | 1.3% |
| GLM-5.1 | 1.4% |
| GPT-5.5 | 2.0% |
| Claude Opus 4.7 | 6.1% |
| MiMo-V2.5-Pro | 7.9% |
| DeepSeek-V4-Pro | 8.6% |
把 15 个模型都算上,这个比例从 0.1% 一直到 55.3%,最高的是上一代的 Llama 3.3 70B。论文的主结论更宽:检测效果 "is primarily driven by detector capability rather than generator provenance"(主要取决于检测模型的能力,而不是文本出自哪个模型)。问哪个模型,比文本是哪个模型写的更要紧。
这张表说明模型之间差别有多大,但不能拿来对号入座:聊天应用里跑的版本可能和测试的不同,老师问的话多半也不是这段指令,而且每个模型对每篇文本只答了一次。
聊天机器人给的理由值多少
截图里通常还附着理由:结构太工整、内容太泛、读起来太顺。这项研究要求每个模型都给理由。研究者随后让另一个 AI 模型 GPT-5.6 Sol 把一批解释并排比对,它发现同样的特征被拿来往两个方向论证。用作者的话说,详细连贯的文字 "may be treated as evidence of human expertise by one detector, but as evidence of formulaic LLM generation by another."(可能被一个检测模型当作人类专业知识的证据,却被另一个当作大语言模型套路化生成的证据。)
他们还提醒,这些解释 "may be post-hoc justifications rather than accurate and reliable descriptions of how a decision was made"(可能是事后找的理由,而不是对判断过程准确可靠的描述)。作者对同一批解释做的关键词计数也指向同一方向,他们也说这些发现还需要人工标注来确认。截图里说你的论文结构清楚、过渡自然,那是在描述你的论文,不能说明它是从哪儿来的。
这项研究回答不了的
- 聊天机器人怎么判学生作文。 人写文本没有一篇被说成学生作业,而且两边都很短:按我们的统计,人写文本的中位数是 233 词,AI 文本的提示大多要求 150 到 300 词。一篇长论文的结果可能不同,研究也给不出往哪个方向偏的理由。
- 再问一次会不会变。 每个模型对每篇文本只判了一次,所以研究说明不了同一个聊天机器人第二次问时多常改口。
- 经不经得起检验。 它是预印本,作者自己也说这套三代划分 "rather simplistic"(相当粗糙)。
- 明年的模型。 研究者最初考虑的模型里,有很多已经停用或下线,这也是最老一代只有两个模型的原因之一。这些数字说的是这 15 个模型,不是之后出来的。
如果聊天机器人说你的论文是 AI 写的
- 先弄清楚到底跑了什么。 礼貌地问:用的是哪个聊天机器人,能不能看一下完整的对话(包括输入的问题),这是唯一的检查,还是另外也有 Turnitin 或别的报告?答案不同,你要回应的东西就不同。
- 读你课程和学校的规定。 看看疑似使用 AI 怎么处理、什么算证据。有些大学限制教职员能用哪些检测工具,或者限制检测结果的证据分量,19 所大学如何限制 AI 检测工具或证据:官方原文汇总收了这些官方原文。聊天机器人算不算在这些规定里,要看你们学校怎么写的。
- 把写作过程拿出来。 草稿、笔记、读过的资料,还有文件自带的历史记录。导出方法见怎么证明没用 AI:Word 和 Google Docs 的版本历史。能讲清楚自己的论点是怎么一步步搭起来的,这是聊天机器人的判断看不到的东西。
- 引用这项研究时,两头都要说。 「聊天机器人三次里错一次」只是上一代的数字。这次测试里最新一代把 0.1% 到 8.6% 的人写文本判成机器写的,上一代高得多。而且一个比例描述的是一大堆文本,不是你这一篇,这正是当一所大学一年交上去 75,000 篇论文,1% 的误判率意味着什么讲的道理。
- 别拿另一张截图去回应。 换一个聊天机器人说「人写的」,上面那些局限一样不少。草稿能说明论文是怎么写出来的,再找一个聊天机器人表态不能。
HumanPen 能帮上什么
聊天机器人的回答不是报告,里面也没有标出的段落;而一篇已经被质疑的论文,拿去改写也解决不了任何问题。HumanPen 的降 AI 功能面向的是另一种情况:还没交的稿子、手上有它的 Turnitin 或 iThenticate 报告,而且课程允许借助工具改写措辞。最后这一条,先去课程规定里确认。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。
常见问题
这是不是说,现在的 ChatGPT 能看出 AI 写的文字了? 单凭这项研究还说不上。论文写的是通过 API 测试,不是 ChatGPT 应用:GPT-5.5 等 15 个模型,问的都是同一句固定的问题。在这种设置下,最新一代平均把 3.6% 的人写文本误判成 AI,对 AI 文本漏掉 6.1% 到 13.4%,取决于文本是哪一代模型写的。
越新的聊天机器人一定越可靠吗? 不一定。上一代把人写文本判成「机器」的比例比最老一代还高(36.5% 对 13.0%)。上一代里的那个 Qwen 72B 模型只误判了 4.4% 的人写文本,比最新一代的三个模型都低(Claude Opus 4.7 是 6.1%,MiMo-V2.5-Pro 是 7.9%,DeepSeek-V4-Pro 是 8.6%),不过它靠的是几乎每次都答「人」。
这项研究经过同行评审了吗? 没有。它在 2026 年 9 月 28 日作为预印本发布在 arXiv 上。作者公开了全部文本、提示、每个模型的原始回答和分析代码。
参考来源
- Haiyue Yuan、Jie Guo、Weidong Qiu、Zheng Huang、Ruizhe Li、Shujun Li,Using LLMs to Detect LLM-Generated Texts: A Cross-Generation Analysis,arXiv:2609.34691v1,2026 年 9 月 28 日提交(预印本,未经同行评审);2026 年 10 月 2 日读取(表 1、5;第 3、4、5 节;附录 A.2、A.3)。
- 作者公开的数据与结果,GitHub 上的 hyyuan/detect-llm-generated-texts:逐模型比例取自 `dataset/results/eval/paper_reproducible/detector_error_profiles.csv`,人写文本取自 `dataset/human-generated-text/human.json`;2026 年 10 月 2 日读取。
继续阅读