用 AI 润色过,会被判成 AI 吗?一项 2026 年研究测出的数字

文章是你自己写的,只用 AI 顺了顺语言,结果检测器说是 AI。2025 年已有一项研究发现,哪怕只做极轻微的 AI 润色,被判为 AI 的比例也会上升。2026 年 8 月,美国圣母大学的一个团队用真实发表的摘要、按学科分开,又测了一次。下面讲他们测了什么、数字是多少、作者自己划出的局限,以及你手上的标红该怎么处理。

HumanPen 团队

· 7 分钟

用 AI 润色过,会被判成 AI 吗?

在这项研究测的两个商用检测器上,经常会。研究者让 AI 模型把 642 篇已发表论文的摘要改写得 "to sound better and more human-like"(更好、更像人写的)。润色后的版本,Pangram 判了 64% 到 80%,GPTZero 判了 38% 到 49%。同样这两个检测器,对 2013 到 2015 年写成的原始摘要一篇都没判。Turnitin 不在测试之列。作者的结论是:"detector scores should not serve as standalone misconduct evidence."(检测分数不应单独作为学术不端的证据。)

这项研究题为《Why AI Detection Fails for Academic Integrity》(AI 检测为什么在学术诚信上失灵),作者是美国圣母大学的四位研究者,2026 年 8 月 6 日发布在 arXiv 上,是为 ACM AI 领导力峰会(AILS '26)撰写的论文。

它不是第一项测这件事的研究。马里兰大学 Saha 和 Feizi 在 2025 年发表于 ACL Findings 的研究发现,经某个 AI 模型做 "only extremely minor edits"(仅仅极轻微的修改)之后,人写样本被 Pangram 判为 AI 的有 42.56%,被 GPTZero 判为 AI 的有 64.71%,用的是按每个检测器分别设定的阈值。两项研究的模型、阈值和文本都不同,数字只能并列看,不能相加,但方向是一致的。

研究者做了什么

他们从化学、计算机科学、政治学和神学四个领域取了 642 篇已发表论文的英文摘要。其中 306 篇来自 2013 到 2015 年,那时还没有 ChatGPT 这类工具;336 篇来自 2023 到 2025 年。

每篇摘要都交给 Gemini 3 Flash 改写。这里要看的是作者称为「refine」(润色)的那个版本,他们把它当作 "a proxy for guideline-compliant AI assistance"(符合规定的 AI 协助的代理指标)。模型收到的指令开头是:

"You are an expert scientist who excels in writing papers. Your task is to rewrite a given paper abstract to sound better and more human-like."(你是一位擅长写论文的科学家。你的任务是把给定的论文摘要改写得更好、更像人写的。)

作者对这种改法说得很清楚:"Our refine prompt is closer to light generative rewriting than to grammar-only editing; assisted-writing flag rates should be read accordingly."(我们的润色指令更接近轻度的生成式改写,而不是只改语法;读润色版的被判比例时应当考虑这一点。)拿它和你自己的用法比较之前,先记住这一句。

然后,每一篇原稿和每一个改写版都用 Pangram 3.2 和 GPTZero 打分。按作者公开的代码,GPTZero 取的是它「AI」那一类的概率,达到 0.50 或以上就算被判为 AI。

数字

被打分的文本Pangram 判为 AIGPTZero 判为 AI
原始摘要,2013–2015 年0.0%0.0%
原始摘要,2023–2025 年14.9%8.9%
2013–2015 年摘要的 AI 润色版64.4%37.6%
2023–2025 年摘要的 AI 润色版80.1%48.5%

有两点提醒来自作者本人。2023–2025 年的原稿可能已经有过没人记录的 AI 协助,所以这些被判的情况 "not confirmed false positives"(不是已确认的误报)。润色版也和人写文本不是一回事:论文说它的被判比例 "must not be abbreviated as FPR"(不得简称为误报率),所以我们这里也不这么叫。它衡量的是:一篇人写的摘要经 AI 润色之后,有多大比例会被判为 AI。

调整阈值也改变不了多少。在 0.4 到 0.6 之间,Pangram 对 2023–2025 年润色版的判定比例在 80% 到 85% 之间,GPTZero 在 48% 到 49% 之间。

学科不同,被判比例差很多

在 2023–2025 年的摘要上,被判比例很大程度上取决于学科:

学科原稿被判(Pangram / GPTZero)润色版被判(Pangram / GPTZero)
化学2.1% / 1.1%73.7% / 46.3%
计算机科学9.6% / 6.0%69.9% / 36.1%
政治学24.1% / 15.2%86.1% / 54.4%
神学26.6% / 15.2%92.4% / 58.2%

在未经改动的原稿上,理工科(化学、计算机科学)和另外两个领域(政治学、神学)之间的差距有统计显著性。作者还测了哪些文本特征与更高的分数相伴。最强的两个是长词的占比,以及来自学术词汇表(Academic Word List,一份收录学术写作常用词的标准词表)的词的占比,相关系数约在 0.30 到 0.35 之间。数字和其他非字母符号占比越高,分数越低。作者写明,这些 "associations are correlational and do not establish causal mechanisms."(关联只是相关,不能确立因果机制。)

这些是对 Pangram 和 GPTZero 的测量,不是对 Turnitin。我们为为什么写得好的文章反而被判成 AI查过 Turnitin 讲 AI 检测的三页帮助文档,里面没有给写作质量打分的说法。两者说的是不同的工具,并不矛盾。

这项研究没有告诉你的

作者自己列出了局限,拿它来对照你自己的情况时,这些都很要紧:

  • 是已发表的摘要,不是学生作文。 原话是:"We analyze English published abstracts, not student essays; detector behavior on classroom genres may differ."(我们分析的是已发表的英文摘要,不是学生作文;检测器在课堂作业类文体上的表现可能不同。)
  • 两个商用检测器,没有 Turnitin。 商用检测器是 Pangram 3.2 和 GPTZero,另有一个作为补充的 AI 模型基线。论文里没有提到 Turnitin。Pangram 之后又发布了新版本,所以你今天拿到的 Pangram 结果,不一定出自同一个模型。
  • 一个模型,一种润色方式。 所有改写都出自 Gemini 3 Flash、用的都是上面那条指令。单纯的拼写语法检查没有单独测。
  • 四个学科,只测英文。 这里化学被判得少,不代表化学专业的学生在别的检测器、别的文体上就安全。
  • Pangram 为这项研究提供了 API,见论文致谢。

论文还把 AI 改写版交给一款商用人性化工具处理,之后两个检测器仍判为 AI 的不到 4%。拿它和诚实润色 38% 到 80% 的被判比例放在一起,就是作者主张检测分数不能单独作数的另一半理由。他们的结论是:"Integrity programs therefore need transparent AI-use norms and process evidence, not standalone detector scores."(因此,学术诚信制度需要的是透明的 AI 使用规范和过程证据,而不是单独的检测分数。)

如果你自己的文字在润色后被标红

  1. 先弄清分数出自哪个工具。 如果是 Turnitin,这些数字说的不是它。看老师那份报告实际高亮了什么。
  2. 查清规定允许什么。 很多出版社的政策把语言编辑和产出内容分开对待,有的还要求声明,见各大出版社的 AI 披露政策对照。课程作业以作业说明和学校政策为准。
  3. 保留润色之前的那一版。 论文给的实务建议是 "Any flag must be paired with drafting history"(任何标红都必须配上写作过程的记录)。一份用你自己的话写成、带版本历史的草稿,就是这种记录。
  4. 看哪些段落被标红,而不只看百分比。 那几段就是你要准备好解释的地方:你是怎么写的,AI 改了什么。

HumanPen 能帮上什么

如果你手上有 Turnitin 或 iThenticate 报告,标红的段落需要改写,这正是 HumanPen 降 AI 功能做的事。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。用之前先对照你课程关于 AI 协助的规定,提交之前把改回来的内容读一遍。

常见问题

用 Grammarly 算不算这项研究里的 AI 润色? 不能直接这么算。研究里的润色是让 Gemini 3 Flash 改写,作者说它 "closer to light generative rewriting than to grammar-only editing"(更接近轻度的生成式改写,而不是只改语法)。单纯的拼写语法检查没有测。Turnitin 另外说过,它的检测器并不针对 Grammarly 做的拼写、语法和标点修改,见用了 Grammarly,Turnitin 会把它判成 AI 写作吗?。

被指控用 AI 时,能拿这项研究去申诉吗? 它能支撑一个一般性的观点:这些检测器会把相当大比例的 AI 润色人写文本判为 AI,作者也说分数 "should not serve as standalone misconduct evidence"(不应单独作为学术不端的证据)。但它讲的不是 Turnitin,也不是学生作文,更说明不了你那篇文字发生了什么。能说明这一点的,是你的草稿和版本历史。

为什么 2013–2015 年未经改动的摘要是 0%,2023–2025 年的就更高? 论文说不清是哪个原因。原话是,2023–2025 年这个时段 "cannot separate model vintage from unobserved real-world AI use on original abstracts"(无法把模型版本的影响,和原始摘要中未被观察到的真实 AI 使用区分开)。所以它把这些数字报告为被判比例,而不是误报率。

GPTZero 对润色过的文字会给不一样的标签吗? GPTZero 在 Mixed 结果下有一个「AI Polished」标签,它的含义我们在 GPTZero 的 Mixed 和 AI Polished:这两个标签是什么意思里讲过。按作者的代码,这项研究用的是 GPTZero「AI」那一类的概率,所以被 GPTZero 归进 Mixed(包括 AI Polished)的文本,只有 AI 类概率仍达到 0.50 时才算被判。

参考来源

继续阅读