请母语编辑润色,会让论文看起来像 AI 写的吗?一项 2026 年研究

如果英语是你的第二语言,你可能在想:把论文交给母语编辑润色,会不会让 AI 检测器起疑?2026 年的一项研究正是在 13.5 万多篇真实稿件上测了这件事,比较人工编辑前后的分数。答案主要取决于检测器。下面讲它发现了什么、是谁做的,以及为什么它回答不了 Turnitin 会怎样。

HumanPen 团队

· 6 分钟

专业编辑润色,会让论文看起来像 AI 写的吗?

在这项研究里,并不一致。在 13 个开源 AI 检测器上,人工编辑让一些检测器的 AI 分数上升、另一些下降,达到实际意义门槛的只有其中 7 个。检测器本身造成的差别远大于编辑:对同样一批未经编辑的稿件,误报率从 0.0% 到 100% 不等。研究没有测任何商用检测器,包括 Turnitin。

这项研究题为《Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing》(风格是混杂因素:AI 检测对非母语学术写作的误报),作者是韩国中央大学的 Hyeonchu Park、Bugeun Kim 和 Wordvice 的 Gahye Jeong,2026 年 8 月 27 日发布在 arXiv 上,页面注明在 EMNLP 2026 上发表。文档来自专业英文编辑服务商 Wordvice。按该公司自己的博客,作者之一 Gahye Jeong 是 Wordvice 的首席技术官,博客还称 Wordvice 是 "the developer of the Wordvice AI Detector"(Wordvice AI 检测器的开发方)。

研究者比较了什么

数据是 2018 到 2025 年间的 135,389 对文档,覆盖 40 多个学科。每一对是一篇由英语非母语者写的文档,以及同一篇文档经母语编辑修改后的版本。其中略多于一半(52.9%)来自学术编辑,37.6% 来自招生申请编辑;单个领域里最大的是申请文书,有 22,639 篇。其余是商务编辑、托福写作、翻译等。因为作者、题目和内容都没变,检测分数的任何变化都来自编辑。

编辑本身是人做的。按论文的描述,这家服务商的规范只允许用 AI 语法检查工具查机械性错误,而 "AI-generated rewriting, paraphrasing, or stylistic generation is explicitly prohibited."(明确禁止由 AI 生成的改写、转述或风格生成。)改动是实在的,但幅度不大:在 6,000 对的抽样里,文档长度的中位变化只有 6.5 个词,平均句长从 24.35 个词略降到 23.51 个词。

13 个检测器都是公开的研究工具,按默认设置运行:统计类方法如 GLTR,零样本方法如 Fast-DetectGPT 和 Binoculars,训练好的分类器如 RoBERTa 和 RADAR。

比什么都重要的,是用哪个检测器

对 2023 年以前写成的稿件(作者把它们当作人写文本),被错判为 AI 的比例几乎完全取决于检测器:

检测器类型例子未编辑稿件被判为 AI 的比例
词元统计Log-rank、Entropy、GLTR99.8% 到 100%
训练分类器RoBERTa、RADAR93.1%、88.3%
训练分类器MAGE16.7%
零样本Fast-DetectGPT、LastDE+25.2%、19.9%
零样本DetectLLM-LRR、DiVeye、BiScope、Binoculars0.0% 到 0.6%

同样一批人写的文档,有的工具几乎全判成 AI,有的几乎全判成人写。作者的结论是:"These findings suggest that AI detectors do not represent a unified measure of AI-generated content; rather, they rely on a mix of generation-origin and linguistic-quality signals."(这些发现表明,AI 检测器并不代表对 AI 生成内容的统一衡量,而是混合依赖了生成来源信号和语言质量信号。)他们也提醒,这些绝对比例取决于他们设定的阈值。

编辑改变了什么

编辑之后,变化的方向取决于检测器。以下数字是 2018 到 2025 年的全部数据,不只是上表那批 2023 年以前的文档:

  • 编辑后误报变少: MAGE(下降 10.7 个百分点)、RADAR(下降 4.7)、BiScope(下降 0.5)。
  • 编辑后误报变多: LastDE+(上升 5.8)、Fast-DetectGPT(上升 4.6)、RoBERTa(上升 1.7)。
  • 说不清: DiVeye,它在论文不同表格里的数字方向不一致。
  • 几乎没变: 其余检测器,变化在 0.1 个百分点左右以内。

作者认为,这种编辑前后的变化比绝对比例更可靠:"the relative patterns across editing conditions provide more robust evidence of detector sensitivity to linguistic refinement."(不同编辑条件之间的相对变化,为检测器对语言润色的敏感性提供了更可靠的证据。)

稿件改得越多,分数朝那个检测器原本倾向的方向移动得越远。而且这种影响在 2023 到 2025 年比在 2018 到 2022 年更弱。

这项研究没有告诉你的

  • 没有商用检测器。 用作者的话说,"the analysis does not cover future systems or proprietary commercial detectors."(这项分析不涵盖未来的系统,也不涵盖专有的商用检测器。)Turnitin、GPTZero、Originality 和 Pangram 都没测,论文里没有提到 Turnitin。
  • 以学术编辑为主,但不全是。 作者把数据描述为以学术稿件为主,但其中超过三分之一是招生申请编辑,而论文没有按类型分开报告结果。他们还说:"Detector behavior may differ for student essays, journalistic articles, creative writing, social media content, and other genres with distinct linguistic and stylistic characteristics."(对于学生作文、新闻报道、创意写作、社交媒体内容,以及其他语言和风格特征不同的文体,检测器的表现可能不同。)
  • 只有人工编辑。 这批数据里的编辑都是人做的,而且规范禁止用 AI 改写。它对 AI 编辑工具说明不了什么。
  • 没有 AI 写的对照组。 用作者的话说,"the study does not include AI-generated control texts subjected to comparable editing procedures."(研究没有包含经过同样编辑流程的 AI 生成对照文本。)
  • 是谁做的。 数据和其中一位作者来自 Wordvice,一家卖编辑服务的公司,按它自己的说法,它也开发 AI 检测器。

可以从中得出什么

  1. 找不找人工编辑,按它本身的价值来定,而不是按这些检测器。 就这里测的 13 个研究型检测器而言,这项研究不构成因为怕被标 AI 就放弃人工编辑的理由:编辑对大多数分数的影响很小,而且有升有降,不过确实有 3 个检测器在编辑后误报变多。Turnitin 会不会一样,没有测过。查一下你的期刊或课程是否要求声明编辑协助。
  2. 两个版本都留着。 你的原稿和编辑的修订痕迹文件,能准确说明人改了什么,这是检测分数做不到的。
  3. 问清分数出自哪个检测器。 在这项研究里,不同检测器对同一份人写文字的判定差别很大,不过作者也提醒,具体比例取决于他们设定的阈值。更早的非母语写作者研究,见为什么非英语母语的写作者更容易被 AI 检测器误判;2026 年对 Turnitin 本身测 EFL 学生作文的研究,见 Turnitin 会把非母语学生的英文写作判成 AI 吗?一项 2026 年的测试。

HumanPen 能帮上什么

如果你手上有 Turnitin 或 iThenticate 报告,标红的段落需要改写,这正是 HumanPen 降 AI 功能做的事。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。用之前先对照你的期刊或课程关于 AI 协助的规定,提交之前把改回来的内容读一遍。

常见问题

母语编辑改过的论文,Turnitin 会标出来吗? 这项研究回答不了;它没有测 Turnitin,也没有测任何商用检测器。

编辑让论文看起来更像人写,还是更像 AI? 两种都有,取决于检测器。编辑后误报变少的有 3 个,变多的有 3 个;DiVeye 在论文各表里的数字不一致,其余几乎没动。

这适用于 AI 编辑工具吗? 不适用。这批数据里的编辑是人做的,规范禁止用 AI 改写。关于 AI 润色的 2026 年研究,见用 AI 润色过,会被判成 AI 吗?一项 2026 年研究测出的数字。

为什么有些检测器几乎把每篇稿件都判成 AI? 作者发现,基于词元统计的检测器对这些人写文本的误报率最高,而基于似然比的零样本检测器接近零。他们也提醒,绝对的误报率取决于所用的阈值。

参考来源

继续阅读