先用母语写、再机翻成英文,会被判 AI 吗?一项 2026 年测试里 Pangram 的结果

你先用中文、阿拉伯文或西班牙文写好,再交给翻译工具转成英文。接着就开始担心:这段英文是机器出的,检测器会不会把它当成机器写的?2026 年 10 月 5 日发布的一篇预印本,针对一家检测器量了这件事。数字不大。但比数字更要紧的是它成立的条件;而且这些条件都回答不了另一个问题:你的课程到底允不允许你翻译。

HumanPen 团队

· 11 分钟

自己写的东西机翻成英文,AI 检测器多常判它是 AI?

在一项 2026 年的测试里,很少。研究者拿了 24 种语言的人写网页,全部写于 2022 年以前,让 Gemini 3.7 Flash 尽量忠实地翻成英文。1,197 篇译文里,Pangram 4 判 26 篇为 AI,即 2.17%;翻译前的 1,198 篇原文,它一篇都没判。可一旦正文是模型写的,结果就反过来了:由 Gemini 照着原作者自己的提纲改写出来的版本,翻成英文后 1,197 篇里有 1,161 篇被判 AI(97.0%)。

这只是 Pangram 一家的结果。Turnitin、GPTZero 等检测器都没测,2.17% 不能套到它们身上。这篇论文是预印本,未经同行评审;测的是网页,不是论文作业;翻译也是刻意逐字忠实的。另外,检测器判不判 AI,和你有没有被允许翻译,是两个问题。好几所大学,以及管 GCSE、A-level 课程作业规则的 JCQ,对后者都有明文规定。

这项研究题为《IdeaLens: Detecting AI Ideas in Long-form Writing》(IdeaLens:检测长文中的 AI 想法),作者是马里兰大学、Google DeepMind 和西蒙菲莎大学的 Rishanth Rajendhran 等八人,2026 年 10 月 5 日发布在 arXiv 上。翻译测试只是附录里的一个旁支实验,论文的主题是一个研究用的检测器,想判断一篇文章的「想法」出自人还是模型。作者在致谢里感谢了 Pangram(也就是这里被测的检测器)提供的研究额度。

研究者翻译了什么

人写文本来自 FineWeb2,一个公开的大型网页语料库。作者只留 2022 年以前写成的网页(这样基本可以排除聊天机器人代写),而且只要八类长文:学术写作、创意写作、知识类文章、新闻、非虚构写作、个人「关于我」页面、个人博客和用户评论。翻译测试从 24 种语言里每种各取 50 篇。语言从中文、西班牙文、德文、日文、法文、俄文,到阿拉伯文、印地文、波斯文、越南文、乌克兰文,再到阿姆哈拉文、约鲁巴文、僧伽罗文和泰米尔文。

每篇人写网页另配两个同语种的 AI 版本,都由 Gemini 3.7 Flash 写:

  • 只给题目。 模型只拿到一句话,说明网页类型和大致主题,所以内容全是它自己的。
  • 照着原作者的提纲写。 模型拿到这篇网页的完整提纲,要求按顺序把每一条写出来、什么都不加。要点全是人的,句子全是模型的。

三个版本随后都由 Gemini 3.7 Flash 译成英文。给它的指令要求 "nothing added, nothing removed, nothing improved"(不增、不删、不改进),还要求 "Keep the register, repetition, fragments and clumsy phrasing."(保留原来的语体、重复、残句和笨拙的措辞。)这更接近一位认真的人工译者,而不是把草稿贴进聊天机器人、让它把英文改好。每篇文本在翻译前后都交给 Pangram 4 判了一次。

翻译前后,Pangram 怎么判

文本原语言下被判 AI翻成英文后被判 AI
人写的1,198 篇中 0 篇(0%)1,197 篇中 26 篇(2.17%)
模型照原作者完整提纲写的1,200 篇中 616 篇(51.3%)1,197 篇中 1,161 篇(97.0%)
模型只凭一句题目写的1,200 篇中 942 篇(78.5%)1,200 篇中 1,200 篇(100%)

这里的「被判 AI」有特定含义。Pangram 4 会把一篇文本分成它认为是 AI、AI 辅助和人写的三部分比例。作者的规则是:AI 比例加上一半的 AI 辅助比例达到一半,才算判为 AI。只被 Pangram 标出一小部分的译文,不在这 26 篇里;这类译文有多少,论文没有报告。

也就是说,大约每 46 篇人写译文里有 1 篇被判 AI。另外两行很容易读错。

97% 不是对人写文字的误判。 论文把这些判定归为误报,因为论文研究的是「想法」,而这一行的想法是人的。但这一行每一句都是模型写的,而 Pangram 本来就是看措辞的。数据集自己的说明写得很直白:"An idea detector should not flag level 5; a prose detector should."(检测想法的工具不该标出第 5 级,检测文字的工具应该标出。)第 5 级就是照提纲写的那个版本。如果你把自己的笔记或提纲用母语交给聊天机器人,让它来写,拿回来的英文就是聊天机器人的文字;在这次测试里,Pangram 几乎全抓到了。

在这次测试里,翻译没有把 AI 文字藏起来,反而让它更容易被抓。 在原语言下,Pangram 漏掉的不少,这次测试里 1,200 篇只凭题目写的文本漏了 258 篇;网上文本越少的语言漏得越多:在论文完整的多语种数据里,作者归为低资源的十种语言中,只凭题目写的文本它只抓到 58.0%。翻成英文后,1,200 篇只凭题目写的文本它全部判为 AI。先用母语让聊天机器人写、再翻成英文,在这次测试里被抓得更多,而不是更少。

同一篇论文里还有另一个对照,方向一致。CoCoNUTS 是另一个研究组做的数据集,收的是 2022 年及以前用英文写的同行评审意见。其中一部分由语言模型译成中文再译回英文,Pangram 4 在这 1,493 篇里判 AI 的比例是 0.1%;同一批来源中另一部分由语言模型润色过,Pangram 判 AI 的比例是 61.2%(共 1,497 篇)。经中文绕一圈再回到英文,和你自己的草稿不是一回事。但在两个数据集里,被判 AI 的情况都集中在模型动手写或改进句子的地方,而不是忠实翻译的地方。

这项研究说明不了什么

  • Turnitin 会怎样。 这项研究没有 Turnitin 的数字,而且 Pangram 的判定和 Turnitin 的百分比本来就不是同一种测量(见 Pangram vs Turnitin:两个 AI 分数为什么对不上)。常见的一种说法是:翻译工具和聊天机器人用的是同一类语言模型,所以译出来的英文在任何检测器眼里都像机器写的。就 Pangram 和忠实翻译而言,这次测量的结果大体不支持这个说法。这项研究没测 Turnitin,Turnitin 会怎么判译文,它说明不了。2023 年有一项更早的测试把 Turnitin 列在 14 个检测器之中:14 个工具合计,在英文人写文本上的总体准确率是 96%,而在 9 篇用 DeepL 或 Google 翻译机翻成英文的人写文本上,用作者的话说 "dropped by 20%"(下降了 20%)。这是 14 个工具的合计,不是 Turnitin 单独的数字,而且检测器此后都变过。Turnitin 自己的文档把哪些文本特征和误报联系在一起,见 中翻英会被 Turnitin 判为 AI 生成吗?
  • 你那种语言的情况。 翻译测试只公布了 24 种语言合在一起的总数,每种 50 篇。没有单独的中文或阿拉伯文比例。
  • 你用的翻译工具。 只测了一个模型,配一条严格要求忠实的提示词。DeepL、Google 翻译,以及被要求「改得更学术一点」的聊天机器人都没测。从润色那组评审意见的结果看,最后这种属于另一种情况。
  • 论文作业。 测的是博客、新闻、评论之类的网页,不是按评分标准写的作业。
  • 同行评审。 这是预印本,尚未经过同行评审,而且 Pangram 提供了研究额度。论文没写这些文本具体是什么时候送检的,而检测器会更新。

判 AI 的比例低,不等于学校允许

这一部分研究回答不了。不少大学对翻译工具有专门的规定,不管有没有被判 AI,这些规定都照样适用。下面是三所大学现行的页面,加上 JCQ 的课程作业规定:

  • 约克大学。 它的协助政策把这一条列为终结性作业中不可接受的协助:"Using translation tools or services to translate text in whole or significant sections (oral or written), which is then submitted as summative work"(用翻译工具或服务把全文或大段文字〔口头或书面〕翻译后,作为终结性作业提交)。学生指南接受把翻译 "As a dictionary"(当词典用),限于单词、搭配或短语层面,并提醒:"translated text which is at sentence level or beyond risks submitting work of false authorship."(句子及以上层面的翻译文字,有构成虚假作者身份的风险。)
  • 哈德斯菲尔德大学。 "If you translate large portions of text written initially in your native language and submit this for assessment, this may be considered to be misconduct, as it raises the question of authorship of the translated version."(如果你把最初用母语写的大段文字翻译后交去评分,这可能被视为不端行为,因为它引出译文作者身份的问题。)同一条规定要求你注明使用了翻译工具,还说如果老师对你的语言有疑问,可能会要求你概括内容,或解释你用到的语法和词汇。紧接着的 10.2.3 又写道:"We do not expect you to use AI tools to contribute to the completion of your assessment or online exam unless you have been explicitly told that you can."(除非明确告知你可以使用,否则我们不期望你用 AI 工具来完成作业或在线考试。)如果你用聊天机器人翻译,这一条可能也适用。
  • 昆士兰大学。 图书馆的指南说,用机器翻译之前要先看课程说明,现场考核不许用机器翻译,并写明:"You must acknowledge that you have used machine translation in your assessment. Failure to acknowledge the use of machine translation can result in Academic Misconduct."(你必须在作业中说明自己用了机器翻译。不说明可能构成学术不端。)
  • JCQ(GCSE、A-level 与 EPQ 课程作业)。 JCQ 2026-27 学年针对 GCSE、A-level 非考试评估和 EPQ 的实施细则新增了一句:"AI translation tools must not be used to generate work for assessment."(不得使用 AI 翻译工具生成用于评分的作品。)

把这些和研究放在一起看。在约克,一篇从你自己的草稿整篇翻过来的论文,就算 Pangram 每一页都放行,也在不可接受的清单上;在昆士兰,同一篇论文可以没问题,只要课程允许、你也注明了。检测器怎么判,改变不了这两种结果中的任何一种。

如果你习惯先用母语写

  1. 找这份作业的规定,而不只是学校的总体页面。 约克允许院系在个别考核里禁用翻译,昆士兰让你去看课程说明。作业说明里没写,就书面问一句:"I write my first draft in [language] and translate it with [tool]. Is that allowed for this assignment, and how should I acknowledge it?"(我先用[某语言]写初稿,再用[某工具]翻译。这份作业允许这样做吗?需要怎样注明?)把回复留好。
  2. 按学校要求的方式注明。 昆士兰的指南给了可以改用的示例:"This work was post-edited by the author, after being translated from <insert language> to English using <insert tool>."(本作品由作者在使用〈工具名〉从〈语言〉译成英文后自行译后编辑。)
  3. 留好母语初稿,并且带日期。 它最能说明想法和结构在任何工具介入之前就是你的。放在 OneDrive 或 Google Docs 里的文件有版本历史,放在桌面上的 Word 文件没有。怎么在 Word、Google Docs 和 Overleaf 里留住版本历史分别讲了这三种。
  4. 别让模型替你写。 在这项研究里,模型只做翻译时,被判 AI 的情况很少;模型照着人的提纲写,或者润色人的句子,被判 AI 的比例就上去了。约克的政策还另外把 "Generating or re-writing (including shortening or summarising) any of the student's sentences or sections of work"(生成或改写学生的任何句子或段落,包括缩写或概括)列为不可接受。「翻译一下,顺便改得更学术」其实是两个要求,检测数据和这条规定针对的都是第二个。有的课程允许更多,以你的规定为准。
  5. 确保每一句你都讲得清楚。 拿英文对着母语草稿读,直到你能说出每句话的意思、为什么用这些词。哈德斯菲尔德的规定描述的正是这种核对。

常见问题

这是不是说明 Turnitin 不会把我翻译的论文判成 AI? 不是。Turnitin 不在这项研究里。除了作者自己的研究模型,在译文上跑过的检测器只有 Pangram 4。

测的语言里有中文吗? 有,中文是 24 种之一。但翻译结果只报告了合计,没有中文单独的比例。

直接用英文写,是不是比翻译更安全? 这篇论文回答不了。在另一组 3,909 篇英语学习者的作文里,Pangram 4 判 AI 的比例是 0.0%(保留一位小数);翻译后的网页是 2.17%。两组文本性质不同,不能拿来直接比。两个数字都很低。

IdeaLens 是什么,需要担心吗? 这是作者做的研究用检测器,判断的是文本的想法从哪来,而不是文字是谁写的。在翻译后的人写网页上,它判了 1,197 篇中的 3 篇。作者已公开发布这个模型;论文没有说有学校在用它。

我翻译的论文已经被判 AI 了,怎么办? 问清用的是哪个检测器,要报告本身,而不只是一个数字。带上母语初稿、翻译记录和版本历史。然后对照作业规定,因为不管检测器怎么判,翻译是否被允许、你有没有注明,这两件事都会被问到。

参考来源

继续阅读