Turnitin 新增阿拉伯语 AI 检测:「支持一门语言」到底给了什么
新增一门语言这件事,从外面看只是名单上多了一行。真去读那门语言自己的帮助页,会发现它是另一个模型、另一份 FAQ、另一张模型清单,连要求那一行写的都不是「阿拉伯语」而是「现代标准阿拉伯语」。这篇把那一页拆开看,顺便给出一份下次可以照着核的清单。
HumanPen 团队
· 10 分钟
8 月 18 日到底改了什么
在学校买了对应授权、管理员打开了开关的前提下,一份用现代标准阿拉伯语写的论文现在可以被处理并给出 AI 百分比。没改的是:阿拉伯语用的是一个独立模型,它有自己那份规则;而如果你的论文是用英语写的,那天对你的提交没有任何影响。
语言名单本身这个站上另有一篇:Turnitin 的 AI 检测支持哪几种语言 讲的是当前是哪四种、不在名单里会怎样。这一篇假设你已经在名单里,问下一个问题:「被支持」具体给了什么,又没给什么。
规则写在阿拉伯语那一页,不在英文页
Turnitin 的英文 AI 写作 FAQ 开篇先把自己圈起来:`The following content and FAQs pertain to our AI writing detection capabilities for English submissions only.`(以下内容仅适用于英语提交。)这行字下面挂着三个链接,分别指向西班牙语、日语和阿拉伯语版本。
阿拉伯语那份跟英文页共用同一个文章编号,地址是 `guides.turnitin.com/hc/ar/articles/28477544839821`。它不是逐行翻译。我们在 2026 年 8 月 30 日重新读取两页:阿拉伯语渲染正文 20,282 字符,英文 31,012 字符。长度本身不说明问题,真正有用的是下面这些具体答案的差异。
最清楚的一处是文件要求。英文页那份清单最后一条是 `File must be written in English`。阿拉伯语页最后一条写的不是「阿拉伯语」,而是现代标准阿拉伯语:`يجب أن يكون الملف مكتوبً باللغة العربية الفصحى الحديثة`。清单其余几条和英文一致:小于 100 MB、至少 300 词长文体散文、不超过 30,000 词、以及同样那几种文件类型。
由此有两件事值得记住。
一是短文的处境跟英语一模一样。散文不足 300 词就没有报告可争,而什么算合格文本 这套「只看长文体散文」的规则在两种语言下是同一条。阿拉伯语那页几乎逐句重复了关于短文的警告:只有几百词的文档,预测基本是「全有或全无」,这一点在短文本为什么容易被整篇判定 里讲得更细。
二是那一行要求限定的是语体,不是语族。本轮核对的阿拉伯语 FAQ 和 8 月 18 日 release notes 都没有说明方言混写、或者引文本身是方言时会怎样处理。这两页没有给答案,不能拿它们往任何一个方向下结论。
模型清单:18 条对 32 条
有两个地方登了同一类清单,列出阿拉伯语检测器能识别哪些模型生成的内容:阿拉伯语 FAQ,以及 Turnitin release notes 页面 上标着 2026 August 18 的那一条。Turnitin 同时维护不止一个更新日志,所以说清是哪一页很重要。按带发布日期的条目数,阿拉伯语这份是 18 条。英文 FAQ 也有自己的清单,同一页上出现两次,每次都是 32 条。
两份清单互不包含。`Qwen 3 Next` 和 `OpenAI o3` 在阿拉伯语清单里,而 `Qwen` 这个字符串在整份英文 FAQ 上一次都没出现;`GPT-4o` 和 `Nova-2-lite` 在英文清单里,这两个字符串在整份阿拉伯语 FAQ 上也一次都没出现。那条 release notes 用一句话解释了原因:
Please note our Arabic AI writing model is a separate model from our English AI writing, Spanish AI writing, and Japanese AI writing models.(阿拉伯语模型是独立于英语、西班牙语、日语模型的另一个模型。)
还有一个理由不要把这类清单当成台账:英文页那两份同样的清单,彼此在两个日期上就对不上。一份把 `Claude Sonnet-4.6` 记成 2026-02,另一份记成 2026-05,而阿拉伯语页跟后一份一致。同一屏之内自相矛盾的厂商页面,不适合用来支撑判断。Turnitin 能不能查出某个具体模型 讲的就是这类清单为什么一直在变。
英语检测器还多一项另外三种语言没有的能力,就是识别经改写或绕过工具处理过的文本;阿拉伯语 FAQ 明确写着该能力目前只在英语检测器里提供。四个检测器之间的差别,非英语提交那一篇 有原文引用。
英文页有、阿拉伯语页没有的那句话
英文 FAQ 里有一句关于偏差的话被引用得很多,我们自己也引过:训练样本刻意纳入了 `statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments`(二语学习者、来自非英语国家的英语使用者、生源多元的院校学生等统计上代表性不足的群体)。这句在英文页出现两次,一次在训练方法那一问下,一次在专门问偏差的那一问下。
阿拉伯语 FAQ 也有训练方法那一问,答案更短:模型训练用的是一段时间内的代表性样本,涵盖不同地区和学科,包含 AI 生成与真实学术写作两类。关于代表性不足群体的那半句不在,而且整页没有单独的偏差问答。
这一条我们是数出来的,不是看出来的。2026 年 8 月 30 日在渲染后的阿拉伯语 FAQ 里检索:`تحيز`(偏差)、`لغة ثانية`(第二语言)、`الممثلة`(代表)都是 0 次。同一页上的对照词 `الذكاء الاصطناعي`(人工智能)和 `الإيجابيات الخاطئة`(误报)分别是 124 次和 3 次。英文 FAQ 上的 `second-language learners`、`under-represented`、`bias` 都是 2 次。两边都有非零对照,说明检索确实读到了页面。
它意味着什么、不意味着什么。它不意味着阿拉伯语模型有偏差。它只说明英语训练数据那句声明没有出现在本轮核对的阿拉伯语 FAQ 里;如果有人把它搬到阿拉伯语论文的场合,他引用的是另一模型的页面。准确率那条倒是重复出现了:阿拉伯语页同样写着「AI 写作占比超过 20% 的文档,误报率控制在 1% 以下」这个目标,1% 误报率在学校规模下意味着什么 原样适用。
中文读者会落在哪一种位置
8 月 18 日这条更新会不会落到你头上,看的不是你在哪儿读书、母语是什么,而是你点上传的那份文件是用什么语言写的。中文读者大致落在下面三种位置,处境差得很远。
一、你交的本来就是阿拉伯语。 阿拉伯语专业的毕业论文、在海湾国家读的学位、以阿拉伯语提交的成果,现在都在名单里,上面那几条直接适用。特别是 release notes 里的这句:`Any previously submitted assignments can be checked with our AI writing detector when they are re-submitted to Turnitin, and you have AI writing enabled for your account.`(此前提交过的作业,在重新提交且账号启用了 AI 写作检测的情况下,也可以被检测。)也就是说,3 月交的章节不是永久在范围之外,别人今天重传一次就进范围了。
二、你用中文起草,交上去的是英文。 这种情况下,8 月 18 日那天对你的提交没有任何影响。要求那一行管的是文件本身:英文页写的是 `File must be written in English`,阿拉伯语页写的是文件必须以现代标准阿拉伯语写成——两句都在说这份上传的文件,不是说你写的时候在用哪种语言想。所以真正被处理、被打分的是那份英文文本,走的是英语检测器。你真正该读的也就不是这次阿拉伯语的公告,而是检测器对非母语英语写作者的表现,以及先中文后翻译这条路上机器翻译与 AI 分数 目前哪些有定论、哪些没有。
三、你想知道中文什么时候进名单、进了会怎样。 阿拉伯语这次是目前最新的一个样本,照它可以列几条,等下次有新语言时逐条去核:它是独立模型,不是现有模型顺便多学一门语言;它有自己那一页 FAQ,英文页上的结论不自动成立;它有自己的模型清单,和英文那份互不包含;要求那一行会写明具体语体,这次写的是现代标准阿拉伯语,而不是笼统一个语种名;能力也不等价,英语独有的那部分不会跟着过来。最后一条最实际:旧作业不会因为交得早就永久在范围外,重传一次就进检测。
顺带纠正一个常见推论:现在中文论文不被 AI 写作检测处理,说的是这个功能的覆盖范围,不是对论文的判断,更不是学校那边的结论。这一层线上那篇语言名单 讲得更完整。
在你假设这些对自己成立之前
三个前提,全都是学校层面的,跟你写得怎么样无关。
功能得先买。阿拉伯语这次的 release notes 条目标着 `Turnitin license(s): Originality add-on`,阿拉伯语 FAQ 也重复了通行规则:AI 写作检测只对购买了 Turnitin Originality 的客户开放,iThenticate 2.0 客户则需要作为附加项购买。为什么我学校从来不显示 AI 分 讲的基本就是这件事。
开关得打开。阿拉伯语 FAQ 说,不希望提交被处理的学校,可以在管理员账号设置里关掉 AI 写作检测;只有在学校启用了这项功能的情况下,Turnitin 才会处理提交。
而后来打开开关,并不会自动回头处理旧的。阿拉伯语页写着历史提交无法回溯处理,需要重新提交,这跟 release notes 那句「重传即可检测」是同一件事的两面。
还有一条常让学生意外:阿拉伯语 FAQ 在「学生能不能看到结果」那一问下的回答是,AI 写作检测的指标和报告对学生不可见,教师可以把报告下载成 PDF 再分享给学生。所以在一门开了这个功能的课上,你可能自始至终看不到那个数字,第一次听说它的场合就是一场谈话。
如果本来就要改某一节
也有导师已经点名让某一节重写的时候。阿拉伯语正文仍然要人工处理,或者使用明确支持阿拉伯语的工具:HumanPen 当前的 humanize 只处理英文,不能改写阿拉伯语正文。阿拉伯语学位论文里要保护的东西很具体,包括经文与圣训引文、全篇统一的音译术语、右到左排版中嵌入的拉丁字母文献编号,以及导师已经确认的参考文献条目。
如果最终提交的是英文文档,HumanPen 可以把改动限制在作者手动选中的段落,或者 Turnitin、iThenticate 报告匹配到的段落。它会先展示段落级范围,范围外的文本不进入改写,因此你只需要重点复核真正发生变化的部分。符合条件时可以免费继续降 AI。
这里没有任何一句是在预测你下一份报告会是多少。Turnitin 的阿拉伯语模型自 2026 年 8 月 18 日上线后仍可能继续变化。这里能稳定说清的边界更简单:HumanPen 当前的 humanize 适用于英文文档,不适用于阿拉伯语正文。
常见问题
我学校开了阿拉伯语 AI 检测吗? 前提是买了 Turnitin Originality(或 iThenticate 的附加项)并且管理员打开了 AI 写作检测。阿拉伯语 FAQ 说只有学校启用了功能,提交才会被处理。问系里或者管 Turnitin 的图书馆/教务团队最快。
5 月交的阿拉伯语论文还会被查吗? 重新提交就会。release notes 那条说历史作业在重传且账号启用了 AI 写作检测时可以被检测,阿拉伯语 FAQ 从另一面说了同一件事:不能回溯处理,得重传。
阿拉伯语方言能查吗? 公开的要求写的是文件必须以现代标准阿拉伯语写成。本轮核对的阿拉伯语 FAQ 和 8 月 18 日 release notes 都没有讲方言或混合语体,因此这两页回答不了这个问题。
为什么百分比很小但高亮很多,或者反过来? 原因跟英语那边一样。阿拉伯语页说这个百分比算的是合格文本,也就是长文体里的散文句子,并且这个百分比不一定是整篇的百分比。列表之类的非句子结构不在其中。
低于 20% 的分数会显示出来吗? 阿拉伯语页写着同样的显示规则:1% 到 19% 只给星号不给数字,理由是 Turnitin 认为这一区间更容易误报。Turnitin AI 分数上的星号是什么意思 讲了它在报告里的实际样子。
导师引用的 Turnitin 页面写着三种语言。 先看是哪一页、什么时候更新的。2026 年 8 月 27 日,「使用 AI 写作报告」那一页的要求里已经是四种语言,而单独那份文件要求页仍然写着三种,两页同时在线。宁可信 release notes 里带日期的那一条,也不要信指南里那句没有日期的话。
我能自己看到那个分数吗? 不能。那一页给的答案是指标和报告都不向学生开放,你能看到的前提是老师主动把 PDF 下载下来给你。想在交之前对自己的稿子先有个数,只能在学校那套报告之外自己走一遍,交之前先自查 讲的是怎么走。
继续阅读