Turnitin 为什么把参考文献和引用标出来?那些排除项到底管到哪一步
大家拿来当依据的那几条排除规则,描述的是一份报告怎么被生成出来,不是你文件本身的属性。这个区别决定了参考条目上的高亮是件怪事还是一个日期问题,也决定了两个数字里哪一个才值得去争。
HumanPen 团队
· 22 分钟
先说结论
Turnitin 的 AI 写作报告在处理时会把参考书目整个排除掉,而且只分析由标准语法句子构成的散文,所以你的参考文献列表既没有把 AI 率抬高,也没法拿来把它摊薄。参考书目上出现的颜色,绝大多数情况下来自另一份报告——相似度报告(Similarity Report)。中文里这两份东西经常被一起叫成「查重」,但它们是两套各自独立的分析;而在相似度那一边,一条参考文献跟别人的撞上,恰恰是同一套引用格式要求出来的结果。
剩下三个更窄的问题通常被跳过。为什么有些 AI 报告的参考条目上确实带颜色。注释书目跟一份纯参考文献列表算不算同一回事。以及如果颜色出在相似度那一边,真正能改变它的开关在谁手上。
串起这三个问题的是同一件事:这些排除项不是你文档的属性,而是生成一份报告的步骤,在报告被生成的那一刻执行。换一个时刻,报告就变了,文件一个字都不用动。
那条排除是当成 bug 修掉的,旧报告没有跟着重跑
Turnitin 的 AI writing detection model 那一页挂着带日期的更新说明。2023 年 8 月 9 日那条是这么写的:
「We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report.」(我们修复了一个偶尔会把参考书目中的参考条目标为 AI 写作的 bug。生成 AI 写作报告时,参考书目现已被排除。)
每次有人转述这条,掉的都是紧跟着的那一句:「Resubmit to reprocess existing submissions that contain highlighted reference sections.」(含有被高亮的参考文献部分的旧提交,要重新提交才会被重新处理。)也就是说,排除是在一份报告被生成的过程里执行的。2023 年 8 月 9 日那天已经存在的报告,原来什么样还是什么样,一直到有人把那篇论文再交一次为止。
同一条更新说明里,表格是同样的形状。「We are now able to process long-form prose text in tables.」(我们现在能够处理表格里的长文散文。)下一句是「Resubmit to reprocess existing submissions that contain tables.」(含有表格的旧提交,要重新提交才会被重新处理。)两处改动都吊在同一个动作上,而这个动作没有人会自动替你做。
对多数手里拿着今年生成的报告的人来说,上面这些不解释任何事情。它真正有用的地方是养成一个习惯:在解释报告为什么长这样之前,先查它是哪天生成的,因为它服从的是那一天的规则。同一份文件相隔一年生成的两份报告,不是对同一次测量的两次读数。这层意思的通用版本,在复检之后仍有标记,两份报告怎么比里拆过。
这也解释了为什么网上关于「参考文献被标红」的说法听着都挺有把握,却都透着一股旧味。相当一部分是对着 2023 年的截图写的。
参考文献列表在 AI 率的分子和分母里都不在
有两个问题一直在被问,而它们的答案是同一个。参考书目把我的 AI 率推高了吗?参考文献列得再长一点,能不能把它压下来?
Turnitin 把模型看的那部分内容定义为 qualifying text(合格文本),它的检测能力 FAQ 写着,模型「only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures」(只分析由标准语法句子构成的文本块,不包括列表、项目符号这类短的非句子结构,以及其它非句子结构),紧接着的下一句给出了后果:「This percentage is not necessarily the percentage of the entire submission.」(这个百分比未必是整份提交内容的比例。)一条参考文献不是标准语法句子,何况参考书目在处理之前就已经被拿掉了。所以参考文献列表不在分子里,也不在分母里。
这一下同时废掉两个打算。交之前把参考文献删掉,不会改变报告分析的内容,只会为了一个你本来没有的问题,把论文交成残缺的。往参考文献里灌条目也摊薄不了什么,摊薄要求新增的词落在分母里,而它们不在。
想看看一份塞满表格和列表的文档里分母到底是什么,怎么读一份 Turnitin AI 检测报告里算过一个数字例子。
「排除在处理之外」和「检测不可靠」是两句话
「参考书目」这个词在这件事里干了很多活。Turnitin 自己的页面上,关于「长得像参考文献的东西」有两句话经常被读成一句,可它们说的不是一回事。
Turnitin 的一篇帮助文档里写着:「The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies.」(模型对非散文形式的 AI 生成文本,例如诗歌、剧本、代码,检测不可靠;对项目符号、表格、注释书目这类短篇幅或非常规写作,也检测不到。)
把它跟那条更新说明并排读。更新说明说的是一条处理规则:参考书目在模型跑起来之前就被拿走了。帮助文档说的是一条可靠性限制:对某几类写作,模型的输出 Turnitin 自己不背书。这两句不是同一种保证,后面那句弱得多。
这个区别到了注释书目那里最难办,因为注释是你写的散文句子,压在一堆不是你写的条目下面。如果你的注释书目回来带着颜色,那跟一份纯参考文献列表被标上颜色不是同一件事,而那条更新说明管的也不是这一种情况。
带引用的句子是当散文打分的,而且不是单独打
Turnitin 公开的计分过程是一串操作:先把句子抽出来,切成互相重叠的片段,每个片段得到一个 0 到 1 之间的值,每个合格句子继承覆盖它的那些片段的分数,这些被池化过的句子分数再汇总成文档层面的那个数字。引用不是这串操作里任何一步的输入。
重叠这件事有个后续,很少有人跟到底。靠近某个片段边缘的句子同时落在两个片段里,于是它身上带着不止一个继承来的分数。你那句带引用的句子上的高亮,有一部分是从左右两句借来的,所以要改的地方,如果真有地方可改,永远不在那个方括号上。这一点能推出什么、推不出什么,改掉一句被标红的话,AI 率会掉「一句的量」吗追过一遍。
这也意味着好几个很想做的修改根本没有作用对象。重新编号,把括号内引用换成上标,在论点前面加一句引述提示,把出处从句中挪到句末:这些都不改变被打分的那个属性,因为它们都不改变散文本身。
如果你的问题其实是「我手上这份到底是哪种报告」,为什么 Turnitin 把我的参考文献标红了把几条岔路都走了一遍。
在相似度报告那一边,开关不在你的文档里
换另一种情况。有人把一个百分比转给你,颜色落在参考书目上,然后让你把这个数字降下来。能动这个数字的东西不在你的文件里。
相似度报告是带着排除筛选项生成的,参考书目是其中一项,引文是另一项。谁配的这份报告,谁就决定了哪几项开着,而这个选择不会跟着一个粘进邮件正文的百分比一起传过来。同一份没动过的文件,两份报告能差出一大截,光这一条就够了。AI 写作报告与相似度报告的区别讲了这些筛选项,以及去哪儿看它们当时是开是关;引号打了、出处也标了,为什么还是算相似讲的是没人打开那些开关时,带出处的段落会落到什么下场。
这也是反对那个最顺手的动作的理由。一条参考文献之所以跟别人的参考文献撞上,是因为格式手册要求你们所有人产出同一串字符。一条被改到不再撞车的条目,就是一条不再遵守格式的条目;要是某个工具把整张列表一次性改完,你多半不会发现,改卷的人会。改写工具会把引用、表格和公式改成什么样里记着一个真实发生过的例子。
所以回那封邮件时,有用的是一个问题而不是一版修改:那份报告开了哪些排除项,以及参考书目以外的地方,颜色落在哪儿。后半句才是需要你来回答的部分。
拿着报告花五分钟
这件事不需要账号,不需要申诉,也不需要专家。它需要那份 PDF 本身而不是一个数字的截图,还有大概五分钟。
- 先找生成日期。 任何地方描述的排除项和模型版本,都是那份文件生成时生效的那一套,不是帮助中心今天写着的那一套。
- 在看任何带颜色的东西之前,先看 AI 指标。 1% 到 19% 这一档,Turnitin 不给分数也不给高亮,只显示一个星号。所以你要是看到的是星号,那么眼前所有被标出来的东西,都不是 AI 报告产出的。
- 顺着一处颜色点进去,看它能给你什么。 能带你到一个具名来源、来源还各自带着百分比的,是相似度报告。AI 的高亮不出现在那里,也不通向任何地方。
- 问清楚当时开了哪些排除筛选项。 参考书目和引文是两个各自独立的开关,两个状态在一个被转发的数字上都看不见,而跑这份报告的人知道。
- 确认是 AI 报告之后,去读被高亮的散文,别数行数。 百分比是在合格文本上算的,高亮却落在一份还装着其它所有内容的文档里,这两样用眼睛对不上。
写下来会发现,这是一串关于这份报告的问题,不是关于你写作的问题。对这件事来说,这个比例大致是对的。
我们在参考文献这块划的线
HumanPen 是一个文档改写工具,这里相关的那个设计决定是关于范围的,不是关于输出的。要么你自己挑出要改的段落,要么把文档连同它的 AI 写作报告一起传上去,让被标出的片段来定义范围。只有跟报告匹配上的片段会被改写,其余部分原样保留。
对这篇文章的主题来说,这有一个很具体的后果。参考文献列表本来就没有理由落进一次改写的范围里,因为它在这个计算的两边都不在。一个照样伸手去改它的工具,是拿你的风险去换一件本来就帮不到那个数字的事。
只有真正被改写掉的词才计费。报告标了五分之一,费用大致就是整篇的五分之一。符合条件时可以免费继续降 AI。
我们唯一不会告诉你的,是下一份报告上会写什么。我们自己的产品页写的是,HumanPen 会尽量保留原意、结构、术语、引用、排版和样式,只调整需要润色的表达;下一句紧接着说,复杂文档仍建议下载后复核。这两半都是当真的。
常见问题
我的 AI 报告在参考条目上就是有颜色,这可能吗? 以前可能。Turnitin 2023 年 8 月 9 日的更新说明宣布,一个会把参考书目里的内容标成 AI 写作的 bug 已经修复,此后生成 AI 写作报告时参考书目会被排除。同一条说明还写着,旧的提交要重新提交才会被重新处理,所以更早的报告会带着原来的高亮不动。如果你手上这份是最近生成的,先确认它是不是相似度报告。
参考文献列得更长,能摊薄我的 AI 率吗? 不能。百分比是在合格散文上算的,而 Turnitin 说这个结果「is not necessarily the percentage of the entire submission」(未必是整份提交内容的比例)。不在分母里的词,摊薄不了任何东西。
我的注释书目被高亮了,这算同一条排除吗? 不算同一句话。那条更新说明讲的是参考书目被排除在处理之外。Turnitin 的一篇帮助文档另外把注释书目列进了「模型检测 AI 写作不可靠」的写作类型里,这是一句关于可靠性的话,不是一条关于「什么会被拿掉」的规则。另外注释是你写的散文,而一份纯参考文献列表不是。
换一种引用格式,两个数字里哪个会变? AI 那边不会,因为那套计算的公开描述里根本没有读引用这一步。相似度那边,一段带出处的匹配会被怎么归类,取决于一个有明确局限的识别步骤,引号打了、出处也标了,为什么还是算相似把这些局限走了一遍。
回这封邮件之前该先要什么? 完整报告的 PDF 而不是截图、生成日期、这是哪一份报告、当时开了哪些排除筛选项。这四个答案能在讨论到你的写作之前,把这件事的大部分解决掉。
继续阅读