为什么 Turnitin 把我的参考文献标红了?

两份报告测的是完全不同的东西,而只有其中一份会在你的参考文献上标颜色。本文讲怎么分辨手上是哪一份、为什么含引用的句子仍会被标红,以及官方自己说误报集中在哪一段。

HumanPen 团队

· 7 分钟

第一步:先搞清楚你看的是哪份报告

Turnitin 处理 AI 检测报告时会整体排除参考文献,而 AI 高亮从来不会出现在相似度报告里。所以被标红的参考文献列表是相似度匹配,不是 AI 标记,你的参考文献也不是把 AI 百分比推上去的原因。

这一条分清楚,后面大部分疑问就自己解决了。一次提交会产出两样东西,它们测的是完全不同的属性:相似度报告找的是你提交的文字与别处文字的重合;AI 检测报告估计的是你的散文里有多大比例可能由 AI 生成。Turnitin 自己的文档把两者描述为互相独立,并写明 AI 高亮不会出现在相似度报告中。两个数字互不喂给对方。

很多人分不清手上是哪份,有个很现实的原因:AI 检测指标只有教师和管理员能看到,学生看不到。教师可以下载 AI 报告的 PDF 版本转给学生,所以传到学生手里的通常是那份 PDF,或者一张转了几手、上面根本没写是哪份报告的截图。

先问清楚是哪份报告,再谈别的。下面每一条都取决于这个答案。

两份报告的完整对比见AI 检测报告与相似度报告的区别

如果是相似度报告:参考文献被匹配上是常态

一条参考文献条目是学术写作里最容易重复的字符串。作者、标题、期刊、卷号、年份,连它们之间的标点都由引用格式规定死了,所以两篇引用同一来源的论文会产出逐字相同的一行。引用格式本来就是干这个用的。

参考文献在相似度报告里整片亮起来,通常正是这套机制在正常工作:你的格式是按引用规范写的,别人也引了同样的文献。真正值得看的是别处还有没有颜色——正文段落里的重合是另一回事,那才是需要给出解释的部分。哪些匹配会计入你看到的那个数字,取决于这份报告上生效的过滤设置,这一点在报告对比里有讲。

如果是 AI 检测报告:你的参考文献根本没被算进去

Turnitin 的 AI 检测模型页 上有一条 2023 年 8 月 9 日的更新记录,写明处理 AI 检测报告时参考文献已被排除。这不是谁忘了打开的一个开关,而是这份报告生成方式的一部分。

除此之外,模型本身只看它所谓的"合格文本",也就是由标准语法句子构成的长文散文。列表、项目符号这类短的非句式结构不进入分析范围,而参考文献条目本来也不是句子。由此带来两个常被忽略的后果:那个百分比是合格散文中的占比,不是整份文档的占比;你眼睛看到的高亮量与拿到的数字对不上。这两点在怎么读一份 Turnitin AI 检测报告里有展开。

如果 AI 百分比比你预期的高,它来自正文。不来自参考文献列表。

那为什么带我引用的那句话被标红了?

因为被打分的对象不是引用。

Turnitin 描述的机制是:把提交内容切成互相重叠的片段,每个片段给一个 0 到 1 的分数,句子通过池化继承它所属片段的分数,再汇总成文档级的数字(AI 检测能力 FAQ)。这套描述里没有任何一步在识别引用、引文或来源。

一句碰巧含有 (Smith, 2019) 的话,被当作散文打分,和它前面那句的处理方式一模一样。被标红的是那个句子,里面的引用只是顺带。

这就排除了一整类想当然的补救办法。换引用格式、把文中括号引用挪进脚注、重写来源表述,都碰不到模型实际反应的那个东西。

关于这件事流传最广的解释,Turnitin 自己否认了

几乎每一个讨论这个话题的帖子里,都会有人解释说 AI 检测器测的是 burstiness(波动度)和 perplexity(困惑度),而学术散文因为密度高、节奏平均,这两项都不好看。这个解释很顺,但它不是 Turnitin 说自己造的东西。

同一份 FAQ 正面回应了这一点:模型基于 transformer,并非按 burstiness、perplexity 这类具体指标显式编程;Turnitin 还补充说,单次预测未必总能拆成逐个特征来解释。

在照着那套模型给出的建议行动之前,这一点值得知道。刻意把句子长短拉开、让文字看起来没那么均匀,是在针对一个厂商声称并非如此构建的系统做推测。这套说法的来历,以及后来取代它的是什么,见AI 检测器在 perplexity 和 burstiness 之外测的是什么

Turnitin 自己说误报集中在哪里

还有一条,具体得有点意外。同一个模型页 上 2023 年 5 月 24 日的更新记录写道:Turnitin 观察到误报在文档开头几句和结尾几句出现得更多,并指出这些句子往往是写得比较泛的引言或结论内容。

那么想想你的结论在哪儿——它就在参考文献列表正上方。

如果你是在报告靠下的位置看到一片颜色,就理解成"参考文献被标红了",不妨确认一下高亮到底停在哪一行。参考文献上面那段,正是 Turnitin 自己点名的薄弱区。

如果你的文档很短,还有一条相关的:Turnitin 说只有几百词的文档,预测会接近"全有或全无",因为只有单个片段、没有重叠可供平均。所以短文档里的混合内容,可能整篇被判成 AI。

按顺序该查什么

  1. 先确认是哪份报告。 如果 AI 指标旁边没有数字、只有一个星号,那就是 AI 报告。Turnitin 对 1 到 19 之间的 AI 分数不显示百分比,并说这个区间的误报率更高。
  2. 如果是相似度报告,看参考文献之外的匹配。那些才是有意义的。
  3. 如果是 AI 检测报告,去读被高亮的散文,别再把那个百分比当成整份文档的占比。
  4. 看看高亮是不是落在开头或结尾几句,那是 Turnitin 自己点名的误报高发段。
  5. 记住厂商自己说这个数字是干什么用的。 Turnitin 在它自己的多个页面上都写过,该指标可能出错,不应作为对学生采取不利行动的唯一依据。这句话拿去和导师沟通是合理的。

如果对话已经开始、而论文确实是你自己写的,被判 AI 但确实是你写的讲了该准备哪些证据。

如果你决定改写

往任何改写工具里粘贴之前先看一句:如果这个工具是整篇文件一起改写,你的参考文献列表默认就在它的处理范围里,而这类损伤是有公开记录的。

Northumbria 大学讲师 Tadhg Blommerde 用教师端 Turnitin 权限做这类工具的评测,并明确声明不接赞助、不放联盟链接。他构造了一篇带文中引用和 APA 参考文献列表的测试文章,拿去跑 Walter Writes。在这份 2025 年 2 月的评测里他指出,该工具"连参考文献列表都改写了",并另外指出输出里出现了一条输入中根本不存在的引用(评测视频)。凭空多出一条引用,比你原本想解决的那个分数麻烦得多。

HumanPen 就是围绕这个约束做的。参考文献条目、文中引用标记、脚注、图表题注、图表编号、表格单元格和交叉引用域都属于受保护内容,不会被改写。改写范围由你决定,而不是工具替你假设:你可以手动选段落,也可以导入 AI 检测报告、让它的高亮来划定范围,匹配到的段落会在任何处理开始之前先给你看。DOCX 或 PPTX 进去,还是同样可编辑的文件出来。不会靠往文字里塞语法或拼写错误来压低分数。符合条件时可以免费继续降 AI。

以上没有一句是在承诺你下一份报告会是多少。它描述的是什么会被改、什么不会。

常见问题

参考文献会把我的 Turnitin AI 分数拉高吗? 不会。Turnitin 的更新记录写明,处理 AI 检测报告时参考文献被排除;而分析只覆盖由标准语法句子构成的合格散文,参考文献条目不属于这一类。AI 百分比高,来源是你的正文。

提交前先把参考文献删掉,是不是就不会被标红了? 不是。这改变不了 AI 报告分析的内容,因为参考文献本来就被排除在那套处理之外;而且这等于为了一个并不存在的问题交上一份不完整的论文。想知道报告在反应什么,去看哪些散文段落被高亮了。

为什么我的相似度分数很高,AI 分数却只有一个星号? 这是两项互相独立、测量对象不同的指标。Turnitin 对 1 到 19 之间的 AI 分数用星号代替数字,理由是这个区间误报率更高。相似度高、AI 指标处是星号,通常意味着匹配文本很多(往往包含参考文献),而被模型判为 AI 的散文很少。

我自己能看到 AI 检测报告吗? 不能直接看到。Turnitin 说 AI 检测指标只对教师和管理员可见。教师可以下载报告的 PDF 版本分享给你——在你根据别人的转述去推测什么被标红之前,值得先把这份 PDF 要过来。

继续阅读