机翻会被 Turnitin 判成 AI 吗?

机翻和 AI 生成是同一族技术。两者都把你的文本送进语言模型,产出的英文在词概率分布上落在分类器要画的那条线的同一边。

HumanPen 团队

· 26 分钟

先说结论

会。机翻产出的文本会被 Turnitin 的 AI 写作检测器标记,而且这不是 bug。机翻工具和 AI 生成工具跑在同类技术上,所以翻译器吐出来的英文带着分类器被训练去识别的那同一种统计特征。你用另一种语言写下自己的想法,机器把它渲染成英文。被渲染出来的那部分就是检测器读到的内容。

这和让 AI 替你写整篇论文不是一回事。这个区别对你很重要。对检测器不重要,因为检测器看的是成品文本,不是它怎么被生产出来的。

接下来讲这件事为什么会发生:你翻译过来的文本里哪些部分最暴露,机翻英文的哪些特征恰好撞上官方描述的误报易发特征,以及拿机翻做初稿和交出一份检测器会读成 AI 的东西,两者之间的线画在哪里。

检测器读的是词概率,翻译器产出的恰好是 AI 形状的

Turnitin 公开的检测流程从切片开始。句子被抽出来,切成互相重叠的片段,每个片段得到一个 0 到 1 之间的值。这个值表示该文本由机器生成的概率。这些片段分数被池化成句子分数,句子分数再汇总成文档层面的那个数字。

同一份 FAQ 页面写明了分类器真正敏感的东西。Turnitin 说它的分类器被训练来识别词概率差异,并且擅长人类写作者特有的词概率序列。被测量的就是这个属性。不是词汇量,不是句子长度,不是某个短语听着够不够正式。而是词的选择序列,按每个词有多好预测来排列。

机翻工具和 AI 文本生成器是同一族。两者都用语言模型生成英文文本。翻译器在给定源句的条件下,每个位置都选概率最高的那个英文词,这和生成式模型预测下一个 token 做的是同一件统计运算。两者的输出都偏向高频、流畅、低惊讶那条路径。这恰好就是分类器被训练去标记的那个分布。

一个常见的反对意见是 Turnitin 并没有显式计算「perplexity」或「burstiness」,这两个在公开讨论里被反复提及的指标。FAQ 确认了这一点:模型没有被显式编程去评估「burstiness」「perplexity」或其它单项指标。但同一页紧接着的下一句说,模型是从训练数据里学习统计模式。而 perplexity 本身就是词概率的一种度量。否认模型计算了一个具名指标,不等于否认模型读词概率。它读。那是它被训练在上面跑的东西。

检测器看的是成品,不是你怎么生产它的

Turnitin 把它分析的内容定义为 qualifying text(合格文本)。FAQ 写着合格文本只包含散文句子,也就是说只分析由标准语法句子构成的文本块。列表、项目符号和其它非句子结构不在内。

一段机翻出来的文字正是由标准语法句子构成的。这是翻译工具的全部意义。它产出散文。所以翻译过来的散文正好落在检测器处理的合格文本范围里。

检测器不知道你用另一种语言自己写了原文。它不知道是翻译器渲染的。它不知道你之后还编辑过。它看的是最终的英文散文,给一个概率。你用翻译器帮忙把自己原创的想法渲染成英文,另一个人让聊天机器人生成了一篇他没写过的论文。这是两种不同的行为。对检测器来说,它们产出的是同一类成品。

这是让很多用户觉得不公平的地方,我们理解为什么。但检测器从来就不是为了区分「辅助」和「代笔」而设计的。它的任务是标记词概率分布看着像机器产出的文本。翻译工具产出的文本看着像机器产出的,因为它的确是机器产出的。

为什么机翻散文撞上官方描述的误报特征

Turnitin 的 FAQ 里有一段话讲容易产生误报的文本类型:

「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.」(有时候误报,也就是把人类写的文本错判成 AI 生成,可能出现在这几种内容里:结构变化不多的文本、字面上自我重复的文本,以及只改写但没有出新想法的文本。)

紧跟着的下一句每次被引用时都会被丢掉:「If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.」(如果我们的指标在这类文本里显示较高的 AI 写作比例,我们建议你在看这个百分比时把这一点考虑进去。)

机翻散文比直接用英文写的文字更容易同时踩中这三个特征。

结构变化少,是因为翻译工具偏好给每种源语句式套一个固定的目标句式。源语里的主谓宾,翻译过来还是主谓宾,工具不会引入英文母语写作者自然就会写的那种节奏停顿和结构迂回。

字面重复,是因为翻译器会给一个反复出现的源语词锁定一个英文对应词,然后反复用。一个从头用英文写的人会去翻同义词架。翻译器不会,因为它的任务是匹配源文本,不是变风格。

只改写没出新想法,是翻译这件事本身的固有条件。翻译就是把同样的内容用不同的词重新表达。没有新论点被引入。这就是改写的定义。

Turnitin 自己的建议是,当指标在这类文本里显示较高比例时,你看那个百分比要把它考虑进去。这句话不是脚注。它是官方对「该怎么读机翻这类文本上的高分」的正式立场。

短文档更糟糕,而翻译稿经常不长

Turnitin 的 FAQ 描述了短稿件会发生什么:

「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.」(在只有几百词的短文档里,预测基本上是「全有或全无」,因为我们在单个片段上做预测,没有重叠的机会。)

下一句:「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(这意味着一些混合了 AI 生成和原创内容的文本,可能被整体判成 AI 生成。)

很多机翻稿件不长。一段摘要、一节方法论、一封求职信、一份审稿回复。几百词。如果文档短到只生成一个片段,检测器没有重叠可以平均,翻译过来的和原本写的英文混在一起,可能被整体判成 AI 生成。文档越短,一次差的片段就越没有余地被其它片段拉回来。

改写工具不会把你从这里带出去

一个常见的下一步动作,是把翻译过的文本扔进改写工具或「humanizer」里把词序打乱。Turnitin 的 FAQ 直接讲了这件事:

「Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection.」(此外,它还能识别 AI 生成文本可能被 AI 改写或绕过工具,也就是所谓 humanizer,修改过以逃避检测的情况。)

检测器的范围覆盖被改写工具或绕过工具处理过的文本。把翻译器的输出扔进改写工具,不会让你离开检测范围,而是让你进入检测器被设计来抓的第二个类别。

还有一个结构性问题。改写工具做的恰好是 Turnitin 误报描述里说的那件事:只改写,没出新想法。内容不变,词换了,词概率分布仍然是机器形状的,因为是机器换的。翻译器接改写器,两个工具一前一后,产出的文本同时撞上原始信号和改写信号。

机翻和 AI 生成不是一回事,但这救不了你

我们想对这条区别诚实。用你自己的语言写原创内容,再用翻译器渲染成英文,和让 AI 生成你没有写过的内容,是两种不同的行为。第一种是跨语言辅助。第二种是把思考外包出去。

Turnitin 的检测器不分这两种。它不是为此设计的。它的工作是估计一段英文散文由机器生成的概率。翻译器是机器。它产出的散文由机器生成。机器是在翻译而不是在从提示词生成,这个事实不改变分类器看到的东西。

这对用第二语言写作的人来说确实粗糙,我们不会假装不是。降低语言门槛的同一批工具,也产出检测器被造来标记的文本。在词概率层面把翻译散文和生成散文分开,这件事没有人解决,因为在这个层面它们长一个样。

真正有用的做法

三件事,按投入排序。

第一,翻译器只用来做初稿,别的什么都不做。机翻的原始输出是文本里暴露程度最高的版本。它是起点,不是成品。

第二,用你自己的英文逐句重写。不是换同义词。是重组结构。改变句式。把一个从句挪到另一个位置。把长句拆成两句。把两个短句合成一句。目标是把词概率序列推回分类器关联到人类写作者的那种不规则的、个人化的模式。你的英文不需要完美。它需要是你的,而不是翻译器的。

第三,如果你能看到 AI 写作报告,把它当范围用。被高亮的片段是分类器读成机器产出的那些。那些就是要重写的片段。其余的可以不动。

没用的做法:把文本扔进第二个工具。AI 检测器到底测的是什么深入讲了底层信号。改写过的还是被标了走了一遍交上去的是改写器输出会怎样。为什么检测器给出不一样的分解释了为什么两个检测器对同一份翻译文本会给两个不同的分。

读你手上那份报告

如果你的导师把 AI 写作报告分享给你,你要先看的不是百分比,而是被标出来的内容结构。

整段整段高亮翻译散文的报告,读的是翻译器的词模式。只在段落首尾句高亮的报告,可能是前面讲过的短片段效应。翻译部分和原创部分混合标出的报告,是短文档的 all-or-nothing 情形。

怎么读一份 Turnitin AI 检测报告把指标的各种状态和各自告诉你什么、不告诉你什么都过了一遍。20% 的 AI 率算高吗讲了这个阈值意味着什么,以及为什么它下面那一档不显示数字。

翻译文档上的百分比不是关于你诚实与否的陈述。它是关于你交上去的文本词概率分布的陈述。这是两件不同的事,你跟导师谈的时候也应该把它们当两件事来谈。

常见问题

我的翻译稿件一定会被标吗? 检测里没有一定。但翻译散文带的词概率模式是分类器被训练去关联到机器产出的那一类,所以风险是真的,是结构性的,不是碰巧。

用翻译器和用 ChatGPT 写论文是一回事吗? 不是。源内容是你自己写的,翻译器只是渲染。但检测器读的是最终的英文文本,而在那个层面文本是语言模型产出的。这个区别对你和你的导师重要。对分类器不重要。

如果我把翻译文本改写一遍,分数会降吗? 改写工具落在检测器公布的范围内。FAQ 说模型能识别被 AI 改写或绕过工具修改过的文本。改写还撞上「只改写没出新想法」这个误报特征。

我的翻译文本得了高分,但每个字都是我自己写的原文。怎么办? Turnitin 的 FAQ 建议,当指标在结构变化不多或字面重复的文本里显示较高比例时,你看百分比要把它考虑进去。带上源稿、翻译稿和编辑历史。百分比是英文文本的属性,不是对你写作过程的判决。

这是不是意味着我完全不该用翻译工具? 不是。用它们做初稿。然后自己逐句重写英文,直到这段散文听着像你写的,而不是像工具写的。检测器标的是机器产出的东西。你的任务是确保最终版本是你产出的。

继续阅读