非英语的提交,Turnitin 能查出 AI 吗?

语言这个问题其实是三个问题,常被当成一个来回答,而且先被回答的往往是错的那个。一个是文件本身是什么语言,一个是检测器支持什么语言,还有一个是「我用一种语言写、用另一种语言交」会发生什么——问这个问题的人,多数正处在第三种情形里。

HumanPen 团队

· 6 分钟

先说结论

三种语言,写在文件要求页上:英语、西班牙语、日语。其它语言的文件,超出了 AI 检测报告有文档说明的处理范围。要注意的是,这条规则针对的是你提交的那个文件的语言——所以一篇用葡萄牙语起草、用英语提交的论文,就是一份英语提交。

受支持语言清单原文

出自 Turnitin 的 AI 检测报告文件要求页

「File must be written in a supported language: English, Spanish, Japanese」(文件必须以受支持的语言写成:英语、西班牙语、日语。)

同一份短清单上还有一条:「Accepted file types: .docx, .pdf, .txt, .rtf」。

公开的语言规则就这么多。中文不在这份清单上,简体繁体都一样;德语、阿拉伯语、葡萄牙语、韩语也都不在。

三个检测器彼此并不相同

这一段很少进得了各种转述。讲 AI 检测的那份 FAQ 页面,现在开篇第一句就给自己划了范围:「The following content and FAQs pertain to our AI writing detection capabilities for English submissions only.」(以下内容与 FAQ 仅适用于英语提交的 AI 检测能力。)西班牙语和日语另有文档。

而专门去找「文字是否被改写工具或绕过工具处理过」的那项能力,只有英语有。Turnitin 的 AI 检测报告使用页 写着「only our English AI detector includes AI paraphrasing and AI bypasser detection capabilities」,紧接着的下一句是:「At this time our Spanish and Japanese AI detectors do not include AI paraphrasing or AI bypasser detection capabilities.」

别把这理解成一个口子。该理解成一个提醒:「Turnitin 的 AI 检测」并不是一个统一的东西,而你读到过的关于它如何表现的任何说法,几乎肯定都是针对英语检测器写的。

译成英语交上去,它就是一份英语提交

这条要求针对的是文件。如果你用母语起草、上传的文档是英语,那么被切片、被打分的就是那份英文文本,跟这些想法最初是用什么语言写下来的没有关系。

这就带出了大家真正想问的那个问题:机器翻译出来的文字,看起来会不会像模型的输出?Turnitin 没有公开发布过任何直接回答这个问题的东西,而 Turnitin 之外也没有人具备把它答扎实所需要的访问权限。Turnitin 公开过的,是它自家误报常见于哪几种文本特征:

「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.」(结构变化不大的内容、字面上自我重复的文本、改写过但没有产生新观点的文本。)

翻译出来的学术散文有可能三条全占上——不是因为作者做错了什么,而是因为翻译这件事本身就倾向于把句子形状规整化。这个关联是我们的推断,不是 Turnitin 的表述。

Turnitin 自己的下一句,才是值得带去见导师的那句:「If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.」厂商白纸黑字告诉读这份报告的人,看百分比时要把这一点考虑进去。

Turnitin 说自己在偏差上做了什么

它的 FAQ 说,训练样本有意纳入了「statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model」(统计上代表性不足的群体,如第二语言学习者、来自非英语国家的英语使用者、生源多元的院校学生,以及人类学、地质学、社会学等较冷门学科,以在训练模型时尽量减少偏差)。

这是公司对自家流程的陈述,没有附任何公开的偏差数据。把它当作一个声明出来的意图看待。至于「实际上谁更容易被标红」,那是另一个问题,有它自己的证据,我们在为什么非英语母语作者更容易被标红里过了一遍。

文档越短表现越差,任何语言都一样

在你以为两页的小作业属于低风险那一类之前,先看这句:

「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.」(只有几百词的短文档,预测会接近「全有或全无」,因为只有单个片段、没有重叠可供平均。)

再下一句:「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」短篇正是「翻译痕迹重的写作」和「全有或全无的打分」撞在一起的地方,这个组合产出的报告最难申辩。

常见问题

我的论文是中文写的,会有 AI 分数吗? 中文不在 AI 检测报告的受支持语言清单上。至于你所在院校的系统还会对这份文件做什么,那要问院校,Turnitin 的文档不覆盖这件事。

内容是我自己写的,只是用翻译工具译成了英文,这算 AI 生成吗? 这是两个问题,而且第一个只有你所在的院校能回答。现在的披露规定越来越多地把翻译和起草一起覆盖进去,所以去读规定原文,别默认翻译被豁免。

西班牙语检测器和英语的工作方式一样吗? 不完全一样。改写与绕过工具的检测,文档上写明只有英语有;而主 FAQ 现在也把自己限定在英语提交。

学校用 Turnitin,可我从来没见过 AI 百分比。 本来就见不到。Turnitin 说只有教师和管理员能看到这个指标,不过教师可以把报告下载成 PDF 再分享。另外 AI 检测需要单独的授权,所以有些院校根本就没有。

模型会试图判断用的是哪个 AI 工具吗? 不会。它是按「更可能是人写的还是更可能由 AI 生成」的概率给片段分类(这个测量到底是什么)。

继续阅读