故意加错别字,能降低 AI 检测分数吗?

有学生为了过 AI 检测,故意加错别字、把文章写得比自己的水平低,也有人说分数确实降了。研究显示,效果在很大程度上取决于检测器。但有一件事改变不了:每个故意埋进去的错误都留在文章里,摆在给你打分的人面前。下面讲两项研究测了什么、学生和老师怎么说,以及如果你自己写的东西总被标红,该怎么办。

HumanPen 团队

· 7 分钟

故意加错别字,能降低 AI 检测分数吗?

要看检测器,研究结果两个方向都有。在一项大型基准里,加了常见拼写错误后,四个商用检测器认出来的比例几乎没变。另一项研究里,在一段短文本里加几个随机错别字,就让它测的多数研究型检测器跌到比瞎猜还差。两项研究都没测 Turnitin,我们也没找到 Turnitin 就这个问题发表过任何说明。不取决于检测器的是代价:错误留在你的文章里,给你打分的人会一个一个读到。

有学生说这招对他们管用。下面引用的一位说自己的分数降了,紧接着的下一句就说出了代价。这篇讲的就是这笔交换。

两项研究发现了什么

两项研究都发表在 ACL 2024(国际计算语言学协会年会)上。

RAID 是一个基准,作者称它是同类中规模最大的:用 11 个语言模型、在 8 类文本上生成了 509,014 篇 AI 文本,再用 12 个检测器去测,分别测原文和经过 11 种刻意干扰之后的版本。其中的拼写错误是照着真实笔误的样子做的:研究者参照维基百科的列表整理了一份常见拼写错误词典,只改词典里有的词,目的是 "to minimize suspicion from human readers"(尽量不让人类读者起疑),并对 20% 符合条件的词做了改动。

研究者把每个检测器的阈值都设在「误判 5% 的人写文本」这个位置,这不一定是产品默认的设置。在这个阈值下,四个商用检测器还能认出多少 AI 文本:

检测器原文加错拼后变化
Originality85.0%78.6%-6.4
Winston71.0%67.5%-3.5
GPTZero66.5%65.1%-1.4
ZeroGPT65.5%64.7%-0.8

12 个检测器都有所下降。降得最多的两个分别降了 15.3 和 17.2 个百分点,都是用 GPT-2 输出训练的开源模型,而 GPT-2 是 2019 年发布的语言模型。完整数据见论文附录表 16。

Stumbling Blocks 是同一届会议上的另一项研究。它用的是打字式错误(多打、漏打、打错或前后颠倒字母),而不是常见错拼词典;测试文本平均约 110 个 token;测的是开源和研究型检测器。作者报告,每段文本只改几个字符,就足以 "degrade the performance of most detectors to be worse than random"(让多数检测器的表现比随机猜测还差)。有少数几个检测器表现稳定。这项研究没有测任何商用检测器。

两项研究结果不同,是因为检测器、错误类型和文本长度都不一样。它们都不能告诉你学校用的那个检测器会怎样,而且两项研究有两个共同的空白:

  • 都没测 Turnitin。 两篇论文都没有提到它。
  • 都没报告错别字对人写文本的影响。 RAID 公开的数据里有加过同样错拼的人写文本,但论文只报告了检测器对 AI 生成文本的结果。如果被标红的是你自己写的文章,这些数字说的不是你的情况。

替换字符是另一种手法,Turnitin 会标出来

在 RAID 里,按 12 个检测器平均,让分数变动最大的干扰根本不是错别字,而是把字母换成其他字母表里长得一模一样的字符。

Turnitin 的相似度报告专门为此设了一个 Flags(标记)标签页:比对前先把替换还原,并把 "replaced characters"(被替换的字符)标出来给审阅者看。这份文档我们在相似度报告上的诚信标记:隐藏文字与被替换的字符里讲过。宣称用这种办法骗过检测器的工具,很可能会在老师打开的那份报告上留下这个标记。

学生和老师怎么说

2026 年 3 月 r/Professors 上有一帖,近 700 赞、200 多条评论,两边的说法都在里面。

帖子里一位学生讲了自己在一篇接一篇被标红之后改了什么:写得 "like i'm sending an email to a friend"(像在给朋友写邮件),句子长短错开,还 "to leave a typo here and there and suddenly my ai score drops."(偶尔留个错别字,结果 AI 分数突然就降了。)接着写道:"i absolutely hate the papers i'm producing now."(我现在非常讨厌自己交出去的文章。)2026 年 8 月,菲律宾雅典耀大学(Ateneo de Manila University)版块的一帖里,另一位学生写道:"i sometimes have to make my work sound stupid (sometimes i add 1 grammatical error) just so that i wont get flagged"(有时我得把作业写得很蠢,有时会加一个语法错误,就为了不被标红)。这些分数我们没法核实,它们是个人讲述,不是测量结果。

同一帖里的老师讲了这笔交换的另一面。一位写道:"Inserting mistakes would just result in a lower mark obviously."(故意插入错误,显然只会让分数更低。)另一位说起一个学生,这个学生的拼写错误 "were not normal mistakes a native or fluent speaker would ever make"(不是母语者或熟练使用者会犯的正常错误),举的例子是把 "cynicism"(犬儒)写成了 "sinacism"。

所以,检测分数也许会动,文章照样变差。只要评分标准里有拼写和语法,编出来的错误就会扣分;不像真实笔误的错误,偏偏会让阅卷的人起疑。看看你自己作业的评分标准:如果有一栏是拼写、语法或书写规范,你加进去的每个错误都会算在这一栏里。

也不是每位老师都赞成按拼写扣分。同一帖里有位老师反对按拼写和语法扣分,因为这对读写障碍的学生、非母语写作者等人伤害最大。那是在谈评分是否公平,并不是建议学生去加错。

故意写得平淡,问题是一样的

同一个思路更温和的版本,是写得比自己的水平低:不用自己喜欢的词、不用破折号、每句都写短。雅典耀大学那一帖里,一位学生写道:"Not 'dumbed' down per se but I stopped using words na I typically use (ex: delve) para lang di ma-flag"(也不算写笨,但我不再用自己平时常用的词了,比如 delve,只是为了不被标红)。另一位写道:"no more em dashes for me"(我再也不用破折号了)。r/Professors 那一帖里也有老师说:"Many students in the past year have told me they've dumbed-down their writing to avoid AI-accusations."(过去一年,很多学生告诉我,他们为了避免被指控用 AI,故意把文章写得更浅。)

代价和加错别字一样:扣掉的分是实打实的,对 AI 分数的影响却没人能打包票。学生听到的写法建议本身也自相矛盾,我们在为了不被标红,要不要改自己的写法里讲过。

如果你自己写的东西总被标红

  1. 保留草稿和版本历史。 万一分数受到质疑,文档一步步写出来的记录能回答问题,这是改最终稿做不到的。
  2. 看哪些段落被标红,而不只看百分比。 检测报告会高亮具体的句子,要看的就是这些。
  3. 改标红的段落,要为了意思去改,而不是为了制造噪音。 如果某个高亮的句子写得太笼统,就让它说出只有你这篇文章才会说的东西:具体的结果、具体的出处、你自己的推理。不管检测器怎么看,这都是更好的句子。
  4. 尽早和老师沟通。 截止日期之前带着草稿去谈,比截止之后再申诉顺利得多。

HumanPen 能帮上什么

如果你手上有 Turnitin 或 iThenticate 报告,标红的段落需要改写,这正是 HumanPen 降 AI 功能做的事。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。它不靠加拼写或语法错误来改变检测结果,我们在 Turnitin 降 AI 有哪些工具?10 款 AI Humanizer 对比里写过这一点。提交之前把改回来的内容读一遍:改写过的段落,署的仍然是你的名字。

常见问题

Turnitin 能认出故意加的错别字吗? 我们没找到针对 Turnitin 的公开测试,在我们查过的 Turnitin AI 检测指南和博客文章里也没找到相关说明。有文档可查的是:相似度报告会标出被替换的字符,那是另一种手法。

用语法检查工具改拼写,会让 AI 分数变高吗? 这和故意加错是两回事。Turnitin 说它的检测器 "not tuned to target"(并不针对)Grammarly 做的拼写、语法和标点修改,并说在它的测试里,这类修改 "in most cases"(在大多数情况下)没有被标红。用了 Grammarly,Turnitin 会把它判成 AI 写作吗?讲了它的原话,包括它区别对待的那些生成功能。

研究测过往人写的文本里加错别字吗? 报告出来的结果里没有。RAID 公开的数据里有加过错拼的人写文本,但论文只报告了 AI 生成文本的分数;Stumbling Blocks 测的也是 AI 生成的文本。如果是你自己写的文章,能确定的只有扣分这笔代价。

参考来源

继续阅读