用 AI 润色过,会被判成 AI 吗?一项 2026 年研究测出的数字
文章是你自己写的,只用 AI 顺了顺语言,结果检测器说是 AI。2025 年已有一项研究发现,哪怕只做极轻微的 AI 润色,被判为 AI 的比例也会上升。2026 年 8 月,美国圣母大学的一个团队用真实发表的摘要、按学科分开,又测了一次。下面讲他们测了什么、数字是多少、作者自己划出的局限,以及你手上的标红该怎么处理。
HumanPen 团队
· 7 分钟
用 AI 润色过,会被判成 AI 吗?
在这项研究测的两个商用检测器上,经常会。研究者让 AI 模型把 642 篇已发表论文的摘要改写得 "to sound better and more human-like"(更好、更像人写的)。润色后的版本,Pangram 判了 64% 到 80%,GPTZero 判了 38% 到 49%。同样这两个检测器,对 2013 到 2015 年写成的原始摘要一篇都没判。Turnitin 不在测试之列。作者的结论是:"detector scores should not serve as standalone misconduct evidence."(检测分数不应单独作为学术不端的证据。)
这项研究题为《Why AI Detection Fails for Academic Integrity》(AI 检测为什么在学术诚信上失灵),作者是美国圣母大学的四位研究者,2026 年 8 月 6 日发布在 arXiv 上,是为 ACM AI 领导力峰会(AILS '26)撰写的论文。
它不是第一项测这件事的研究。马里兰大学 Saha 和 Feizi 在 2025 年发表于 ACL Findings 的研究发现,经某个 AI 模型做 "only extremely minor edits"(仅仅极轻微的修改)之后,人写样本被 Pangram 判为 AI 的有 42.56%,被 GPTZero 判为 AI 的有 64.71%,用的是按每个检测器分别设定的阈值。两项研究的模型、阈值和文本都不同,数字只能并列看,不能相加,但方向是一致的。
研究者做了什么
他们从化学、计算机科学、政治学和神学四个领域取了 642 篇已发表论文的英文摘要。其中 306 篇来自 2013 到 2015 年,那时还没有 ChatGPT 这类工具;336 篇来自 2023 到 2025 年。
每篇摘要都交给 Gemini 3 Flash 改写。这里要看的是作者称为「refine」(润色)的那个版本,他们把它当作 "a proxy for guideline-compliant AI assistance"(符合规定的 AI 协助的代理指标)。模型收到的指令开头是:
"You are an expert scientist who excels in writing papers. Your task is to rewrite a given paper abstract to sound better and more human-like."(你是一位擅长写论文的科学家。你的任务是把给定的论文摘要改写得更好、更像人写的。)
作者对这种改法说得很清楚:"Our refine prompt is closer to light generative rewriting than to grammar-only editing; assisted-writing flag rates should be read accordingly."(我们的润色指令更接近轻度的生成式改写,而不是只改语法;读润色版的被判比例时应当考虑这一点。)拿它和你自己的用法比较之前,先记住这一句。
然后,每一篇原稿和每一个改写版都用 Pangram 3.2 和 GPTZero 打分。按作者公开的代码,GPTZero 取的是它「AI」那一类的概率,达到 0.50 或以上就算被判为 AI。
数字
| 被打分的文本 | Pangram 判为 AI | GPTZero 判为 AI |
|---|---|---|
| 原始摘要,2013–2015 年 | 0.0% | 0.0% |
| 原始摘要,2023–2025 年 | 14.9% | 8.9% |
| 2013–2015 年摘要的 AI 润色版 | 64.4% | 37.6% |
| 2023–2025 年摘要的 AI 润色版 | 80.1% | 48.5% |
有两点提醒来自作者本人。2023–2025 年的原稿可能已经有过没人记录的 AI 协助,所以这些被判的情况 "not confirmed false positives"(不是已确认的误报)。润色版也和人写文本不是一回事:论文说它的被判比例 "must not be abbreviated as FPR"(不得简称为误报率),所以我们这里也不这么叫。它衡量的是:一篇人写的摘要经 AI 润色之后,有多大比例会被判为 AI。
调整阈值也改变不了多少。在 0.4 到 0.6 之间,Pangram 对 2023–2025 年润色版的判定比例在 80% 到 85% 之间,GPTZero 在 48% 到 49% 之间。
学科不同,被判比例差很多
在 2023–2025 年的摘要上,被判比例很大程度上取决于学科:
| 学科 | 原稿被判(Pangram / GPTZero) | 润色版被判(Pangram / GPTZero) |
|---|---|---|
| 化学 | 2.1% / 1.1% | 73.7% / 46.3% |
| 计算机科学 | 9.6% / 6.0% | 69.9% / 36.1% |
| 政治学 | 24.1% / 15.2% | 86.1% / 54.4% |
| 神学 | 26.6% / 15.2% | 92.4% / 58.2% |
在未经改动的原稿上,理工科(化学、计算机科学)和另外两个领域(政治学、神学)之间的差距有统计显著性。作者还测了哪些文本特征与更高的分数相伴。最强的两个是长词的占比,以及来自学术词汇表(Academic Word List,一份收录学术写作常用词的标准词表)的词的占比,相关系数约在 0.30 到 0.35 之间。数字和其他非字母符号占比越高,分数越低。作者写明,这些 "associations are correlational and do not establish causal mechanisms."(关联只是相关,不能确立因果机制。)
这些是对 Pangram 和 GPTZero 的测量,不是对 Turnitin。我们为为什么写得好的文章反而被判成 AI查过 Turnitin 讲 AI 检测的三页帮助文档,里面没有给写作质量打分的说法。两者说的是不同的工具,并不矛盾。
这项研究没有告诉你的
作者自己列出了局限,拿它来对照你自己的情况时,这些都很要紧:
- 是已发表的摘要,不是学生作文。 原话是:"We analyze English published abstracts, not student essays; detector behavior on classroom genres may differ."(我们分析的是已发表的英文摘要,不是学生作文;检测器在课堂作业类文体上的表现可能不同。)
- 两个商用检测器,没有 Turnitin。 商用检测器是 Pangram 3.2 和 GPTZero,另有一个作为补充的 AI 模型基线。论文里没有提到 Turnitin。Pangram 之后又发布了新版本,所以你今天拿到的 Pangram 结果,不一定出自同一个模型。
- 一个模型,一种润色方式。 所有改写都出自 Gemini 3 Flash、用的都是上面那条指令。单纯的拼写语法检查没有单独测。
- 四个学科,只测英文。 这里化学被判得少,不代表化学专业的学生在别的检测器、别的文体上就安全。
- Pangram 为这项研究提供了 API,见论文致谢。
论文还把 AI 改写版交给一款商用人性化工具处理,之后两个检测器仍判为 AI 的不到 4%。拿它和诚实润色 38% 到 80% 的被判比例放在一起,就是作者主张检测分数不能单独作数的另一半理由。他们的结论是:"Integrity programs therefore need transparent AI-use norms and process evidence, not standalone detector scores."(因此,学术诚信制度需要的是透明的 AI 使用规范和过程证据,而不是单独的检测分数。)
如果你自己的文字在润色后被标红
- 先弄清分数出自哪个工具。 如果是 Turnitin,这些数字说的不是它。看老师那份报告实际高亮了什么。
- 查清规定允许什么。 很多出版社的政策把语言编辑和产出内容分开对待,有的还要求声明,见各大出版社的 AI 披露政策对照。课程作业以作业说明和学校政策为准。
- 保留润色之前的那一版。 论文给的实务建议是 "Any flag must be paired with drafting history"(任何标红都必须配上写作过程的记录)。一份用你自己的话写成、带版本历史的草稿,就是这种记录。
- 看哪些段落被标红,而不只看百分比。 那几段就是你要准备好解释的地方:你是怎么写的,AI 改了什么。
HumanPen 能帮上什么
如果你手上有 Turnitin 或 iThenticate 报告,标红的段落需要改写,这正是 HumanPen 降 AI 功能做的事。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。用之前先对照你课程关于 AI 协助的规定,提交之前把改回来的内容读一遍。
常见问题
用 Grammarly 算不算这项研究里的 AI 润色? 不能直接这么算。研究里的润色是让 Gemini 3 Flash 改写,作者说它 "closer to light generative rewriting than to grammar-only editing"(更接近轻度的生成式改写,而不是只改语法)。单纯的拼写语法检查没有测。Turnitin 另外说过,它的检测器并不针对 Grammarly 做的拼写、语法和标点修改,见用了 Grammarly,Turnitin 会把它判成 AI 写作吗?。
被指控用 AI 时,能拿这项研究去申诉吗? 它能支撑一个一般性的观点:这些检测器会把相当大比例的 AI 润色人写文本判为 AI,作者也说分数 "should not serve as standalone misconduct evidence"(不应单独作为学术不端的证据)。但它讲的不是 Turnitin,也不是学生作文,更说明不了你那篇文字发生了什么。能说明这一点的,是你的草稿和版本历史。
为什么 2013–2015 年未经改动的摘要是 0%,2023–2025 年的就更高? 论文说不清是哪个原因。原话是,2023–2025 年这个时段 "cannot separate model vintage from unobserved real-world AI use on original abstracts"(无法把模型版本的影响,和原始摘要中未被观察到的真实 AI 使用区分开)。所以它把这些数字报告为被判比例,而不是误报率。
GPTZero 对润色过的文字会给不一样的标签吗? GPTZero 在 Mixed 结果下有一个「AI Polished」标签,它的含义我们在 GPTZero 的 Mixed 和 AI Polished:这两个标签是什么意思里讲过。按作者的代码,这项研究用的是 GPTZero「AI」那一类的概率,所以被 GPTZero 归进 Mixed(包括 AI Polished)的文本,只有 AI 类概率仍达到 0.50 时才算被判。
参考来源
- Jonathan A. Karr Jr.、Grigorii Khvatskii、Ting Hua、Nitesh V. Chawla,Why AI Detection Fails for Academic Integrity,arXiv:2608.11256(v1 2026 年 8 月 6 日,v2 2026 年 8 月 20 日),AILS '26;2026 年 9 月 27 日读取(表 1–6,附录 A、B、D),以及作者公开的代码。
- Shoumik Saha、Soheil Feizi,Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writing,ACL 2025 Findings(arXiv:2502.15666);2026 年 9 月 27 日读取。
继续阅读