为什么 Turnitin 标记了我的参考文献
Turnitin 的 AI 写作检测明确排除参考书目。我们梳理了修复时间线、相似度报告和 AI 报告的区别,以及参照文献被标红时应该检查什么。
HumanPen 团队
· 19 分钟
简短回答
现行的 Turnitin 报告里,参考文献列表和参考书目不应该收到任何 AI 写作标记。AI 写作检测模型在分析时已经把参考书目整体排除在外。如果你手头的报告上参考文献被标红了,原因基本逃不出三种,而且没有一种是"Turnitin 在你的参考书目里检测到了 AI 生成内容"。这三种分别是:报告太旧(生成于 2023 年 8 月之前)、你看到的其实是相似度匹配而不是 AI 标记、被标记的其实是参考文献附近的正文散文而不是参考文献本身。
下面逐一拆解。但起点是 Turnitin 自己做的那次修复,以及他们请你采取的那个动作。
参考文献曾经被标红,以及 2023 年 8 月的修复
Turnitin 在 2023 年 4 月上线 AI 写作检测后的头几个月里,参考书目并没有被排除在分析范围外。一个 bug 会偶尔在参考书目里标出"AI 写作"。我们知道这一点,是因为 Turnitin 在自己的AI 写作检测模型发布说明里记了这件事:
"We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report."
同一行发布说明的下一句是:
"Resubmit to reprocess existing submissions that contain highlighted reference sections."
第二句话是大多数学生漏掉的部分。修复不会自动应用到已经生成的报告上。如果你的老师在 2023 年 8 月之前生成过一份报告,并且从来没有重新提交过那篇论文,那么收件箱里躺着的仍然是参考书目被标红的那份旧报告。报告不会自己更新。
同一批发布说明里还有一条和表格相关的改动。2023 年 8 月之前,表格里的长文散文不被处理。Turnitin 的发布说明写的是:"We are now able to process long-form prose text in tables." 紧接着一句:"Resubmit to reprocess existing submissions that contain tables."
如果你论文里有表格,报告又是 2023 年 8 月之前生成的,同一个建议适用。修复已经发布,但只对修复之后生成的报告生效。
AI 分和相似度分是两个互不相干的分数
"Turnitin 标记了我的参考文献"这个抱怨背后,最常见的其实是第二种混淆。
Turnitin 会出两种报告。一种是 AI 写作报告。另一种是相似度报告。它们是分开的。相似度报告显示你的文本在哪里和其他来源的文本匹配。AI 写作报告显示模型认为哪些文本是 AI 生成的。从 Turnitin 的AI 写作检测能力 FAQ里:
"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other."
同一页另一处:
"AI writing highlights are not visible in the Similarity Report."
反过来也成立。相似度标记不会出现在 AI 写作报告里。
参考文献是最容易产生相似度匹配的内容之一。你引用了已发表的论文。别的学生也引用了同一批论文。标题、作者名、期刊名、DOI 都是逐字相同的字符串。当你的参考文献出现标红,第一件事是搞清楚你到底在看哪份报告。如果是相似度报告,那些标记不是 AI 标记。它们是匹配文本。匹配源可能是另一篇学生论文、一篇已发表的文章,或者一个网站。这些和 AI 写作检测没有任何关系。
Turnitin 在参考文献密集的文档里分析什么、不分析什么
还有第三个机制值得了解。Turnitin 的 AI 模型不分析你提交文档里的每一个字。它分析的是 FAQ 里所说的"qualifying text":
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures."
紧接着一句:
"This percentage is not necessarily the percentage of the entire submission."
对参考文献部分的实际含义是:即使你的参考书目条目被排成段落形式,模型也不一定会把它当成 qualifying text 来分析。条目短。很多不是完整句子。模型是用来读散文的。格式化的参考文献列表更接近结构化列表,而不是段落。
这也解释了为什么 AI 写作报告上的百分比和高亮量看起来对不上。一份有长篇参考书目、图表目录和目录的文档,有相当一部分是非 qualifying text。百分比是模型实际读取的散文上的百分比。高亮放在得分超过模型阈值的散文片段上。如果你的参考书目有 40 条,但你自己写的正文只有两段被标记了,报告上的"2%"是 qualifying prose 的 2%,不是全篇文档的 2%。
如果你当前报告上参考文献被标红了,检查这三件事
如果你手头正有一份报告,参考文献似乎被标了,按顺序检查以下三项。
第一,看报告的生成日期。如果报告早于 2023 年 8 月,它是在参考书目修复发布之前生成的。当前模型没问题。是报告过时了。解决办法是请老师重新提交。直接引用发布说明里的那句话往往就够了。原文在 Turnitin 自己的文档页上:"Resubmit to reprocess existing submissions that contain highlighted reference sections."
第二,看你在看哪份报告。如果标记在相似度报告里,而不是 AI 写作报告里,那些是相似度匹配,不是 AI 标记。你的参考文献列表和另一篇论文的参考文献列表匹配是相似度检测的正常行为。它不意味着任何关于 AI 生成的事情。AI 写作标记"are not visible in the Similarity Report",相似度标记也不会出现在 AI 写作报告里。两份报告是分开的。
第三,看参考文献正前后的文本。如果被标记的是参考书目前后一两句散文(一段致谢、一条方法说明、一个参考文献小节的引导句),模型可能在把它当散文读。它本来就该这么做。标记不在你的参考文献上。在紧挨着参考文献的散文上。去读被标记的具体文字,而不是它所在的区域。
一个已经不是问题的问题
补一条:Turnitin 在 2023 年还观察到,文档开头几句和结尾几句的误报率更高。这类句子大多是写得太泛的引言或结论。从 2023 年 5 月 24 日的发布说明:
"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives."
提这一条是因为学生有时会在网上看到"Turnitin 专门标记引言和结论"的旧建议。那是一个已知问题,2023 年已经改过检测逻辑,不是现行缺陷。如果你在 2023 年的论坛帖子里看到这种说法,修复已经发布。发布说明的下一句就写了。对现行报告来说,这不属于需要担心的悬而未决的问题。
你实际要做的
给正在看报告、发现参考文献被标红的人一个行动清单:
- 看报告生成日期。2023 年 8 月之前的报告需要重新提交才能生效。
- 确认你在看的是 AI 写作报告还是相似度报告。参考文献上的相似度标记是正常的。参考文献上的 AI 标记不应该出现。
- 如果报告是当前的,标记确实在 AI 写作报告里,去读被标记的那段文字本身。大概率是参考文献附近的散文,不是参考文献条目。
2023 年 8 月的修复记录在我们链接的那个页面上。如果需要请老师重新提交,发布说明里有现成的那句话:"Resubmit to reprocess existing submissions that contain highlighted reference sections."
继续阅读