提交 PDF,Turnitin 还能查出 AI 吗?

多数人是从侧面撞上这个问题的:提交系统要 PDF,或者期刊要 PDF,然后你开始怀疑格式本身会不会改变检测器看到的东西。它改变的比你想的少,而它真正改变的那几件事,又不是被拿来宣传的那几件。

HumanPen 团队

· 7 分钟

先说结论

能。PDF 是 Turnitin 为 AI 检测报告列出的四种受理文件类型之一,另外三种是 .docx、.txt 和 .rtf。交 PDF 并不会把你的文档移出 AI 检测分析。格式真正改变的是你这个文件里装着什么,而这一点会在提交的其它环节上产生实实在在的后果。

受理文件类型清单

直接取自 AI 检测报告文件要求页

「Accepted file types: .docx, .pdf, .txt, .rtf」(受理的文件类型:.docx、.pdf、.txt、.rtf。)

同一份短清单也规定了语言:「File must be written in a supported language: English, Spanish, Japanese」。如果你真正想问的是语言那一条而不是格式,我们在非英语的提交能不能被查出 AI里单独拆过。

关于格式,公开信息就这些。没有单独的 PDF 通道,没有从轻处理,公开的要求里也没有任何一句把某一种受理类型区别对待。

报告在你的 PDF 里读的是什么

和它在 Word 文件里读的一样:散文。Turnitin 管它叫「合格文本」,定义写在 AI 检测报告使用页上。

「This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.」(合格文本只包含散文句子,也就是说只分析由标准语法句子构成的文本块,不包括列表、项目符号这类短的非句式结构。)

紧接着:「This percentage is not necessarily the percentage of the entire submission.」(这个百分比未必是整篇提交内容的占比。)

所以一份学位论文 PDF 上的百分比,是它内部连续散文的统计量,不是页数的统计量。Turnitin 在别处说,一份包含多种写作类型的文档「would result in a disparity between the percentage and the highlights」——这就是你看到的高亮怎么加都凑不出那个数字的官方原因。这种对不上怎么读,见怎么读一份 Turnitin AI 检测报告

表格与参考文献列表

有两条对「学位论文这种体量」特别相关的具体规定,都来自 Turnitin 的 AI 检测模型更新记录

表格里的散文会被处理:「We are now able to process long-form prose text in tables.」下一行加了一个总被忽略的条件:「Resubmit to reprocess existing submissions that contain tables.」(含表格的旧提交需要重新提交才会重新处理。)已经出过的报告不会自己更新。

参考文献被排除:「We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report.」同样的坑、同样的措辞:「Resubmit to reprocess existing submissions that contain highlighted reference sections.」

如果你手上那份报告的参考文献列表被标了色,先看它是什么时候生成的,再下关于参考文献的任何结论。另外也要确认你拿的是哪份报告:Turnitin 的文档写着 AI 高亮「are not visible in the Similarity Report」,根本不出现在相似度报告里;而参考文献条目在相似度报告里被匹配上是常态——引用格式存在的意义,本来就是让所有人把同一个来源写成同一个样子。

导出成 PDF 真正改变了什么

不是检测。是文档本身。

导出 PDF 会把 Word 文件里的那套机件压平:域、自动生成的目录、交叉引用、自动编号,都不再是活的对象,而变成印上去的文字。如果你后面还要改稿,这件事就有影响;而反方向的往返影响更大——把文字从 PDF 里弄回文档,正是编号和结构被悄悄改坏的地方(长文档里会坏掉的东西)。

实操规则很无聊:一直在源文件里改,最后再从你真正要交的那一版导出 PDF。

文档篇幅会改变它的行为

有一句值得随身带着:

「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.」(只有几百词的短文档,预测会接近「全有或全无」,因为只有单个片段、没有重叠可供平均。)

以及它的下一句:「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」一页纸的 PDF 不是同一种测量的缩小版,它是更钝的那一种。

你到底看不看得到分数

两道彼此独立的门,哪一道都跟你的文件无关。Turnitin 说 AI 检测「is only be available to customers that license Turnitin Originality」(原文语法如此),另有一条面向 iThenticate 2.0 账户的加购路径。它还说只有教师和管理员能看到这个指标,并补充「with the PDF download feature, instructors can download and share the AI report with students」(教师可以下载 PDF 并分享给学生)。

最后这句里的 PDF,才是多数学生真正拿到手的那份:报告的 PDF,不是他们提交的 PDF。讨论时值得先说清楚说的是哪一个。

常见问题

交 PDF 比交 Word 文件更安全吗? 不。两者在同一份受理清单上,Turnitin 文档里描述的分析过程也不区分它们。

那如果 PDF 里全是扫描的页面图片呢? 图片里没有可提取的散文;但把这个当成一条出路,本身就是个糟糕的主意。全是页面图片的 PDF 没法被检索、引用或批注,而这些通常是提交要求里某处写着的。而且 Turnitin 自己的说法是,AI 分数「should not be used as the sole basis for adverse actions against a student」——做决定的是人,不是那个统计量。把统计量拿掉,读它的人还在。

我的 PDF 有相似度分数,却没有 AI 百分比。 这两项互相独立。Turnitin 的文档写着相似度分数与 AI 百分比「are completely independent and do not influence each other」。没有 AI 数字,指向的是授权、语言规则或谁有权查看这个指标,而不是你的文件(两者的完整区别)。

幻灯片导出成 PDF 会有 AI 报告吗? PDF 在受理清单上,所以机制上会。但幻灯片以短句和项目符号为主,而项目符号不属于合格文本,所以报告能拿来分析的散文,可能只占页面上内容的一小部分。

继续阅读