Turnitin 匹配到一个你根本没看过的来源——为什么,以及怎么办

你的相似度报告里列了一个你从没访问过的网站,而你确定自己没读过它。这比恐慌所暗示的要常见得多:Turnitin 显示的是它碰到的第一个匹配文本实例,不一定是最初出处。同一句话可以在很多地方存在——被抓取的页面、聚合站、其他学生的论文。本文解释机制、常见成因,以及怎么读匹配本身而不是读来源名字。

HumanPen 团队

· 5 分钟

短回答

报告里出现一个你没见过的来源,不代表你抄了它,也不代表报告错了。Turnitin 的匹配列表显示的是它碰到的第一个匹配文本实例——不一定是最初出处。你引用的那段文字可能存在于很多地方:你确实读过的那篇论文、那个论文被抓取到聚合站上的拷贝、还有用了同一来源的另一位学生的提交。Turnitin 显示的是其中一个拷贝。真正要紧的是匹配的文本本身——它和你的写作有多像,重叠部分是引用、常见短语,还是实质内容。

为什么会出现你没见过的来源

大学解读相似度报告的指南直接说明了这个机制(UNE 和 LSE 的文档用几乎相同的措辞):

「Sources indicated in the right-hand panel are the first instance of the matched text which Turnitin comes across, not necessarily the original source.」(右侧面板列出的来源是 Turnitin 碰到的匹配文本的第一个实例,不一定是最初出处。)
「Turnitin displays the first match that it finds, so it is possible that if you have used material from one source that the software will display a match from another source that contains the same text.」(Turnitin 显示它找到的第一个匹配,所以如果你用了某个来源的材料,软件显示的匹配可能来自另一个包含相同文本的来源。)

两个直接推论:

  • 列出的来源是一个拷贝,不是判决。 显示的那个网页可能只是同一段文字存在的另一个地方——包括抓取或转载了你真正使用来源的页面。
  • 一句话可以有很多个家。 你的匹配文本可以合法地同时存在于你读过的一篇论文、它的转载版、以及引用了同一来源的另一位学生的提交里。Turnitin 挑了其中一个来显示。

常见成因

当列出的来源是你从没见过的名字时,通常是下面几种之一:

  • 聚合站和转载站。 学术文本会被内容农场和聚合页面抓取转发。你匹配到的其实是你真正读过的那篇论文;显示的页面只是它的拷贝。Chi 大学的 FAQ 对这类匹配说得很直白:「别担心看到维基百科,它们经常使用其他来源的文本。」
  • 另一位学生用了同一来源。 Turnitin 的数据库包含此前提交的学生论文。如果另一位学生引用或使用了和你相同的段落,你的匹配可能列出他们的论文——尤其是你们俩都从同一篇已发表文献取材时。
  • 两个人,同一个改写方向。 两个独立作者面对同一段原文,可能取到相近的改写角度。于是他们的文字互相匹配——即使谁也没抄谁。匹配是真的;抄袭不是。
  • 期刊和机构库的多种版本。 期刊和机构知识库会以多种形式托管同一篇文章,匹配到其中任何一个都很正常。

匹配不等于抄

读报告最难的部分是把机制和指控分开。大学指南把它定成一条规则:相似度报告是文本匹配工具,不是抄袭检测工具。和陌生来源的匹配只证明你的文本与数据库里存储的文本相似——仅此而已。它不证明你抄了那个来源,也不是判决。

这反过来也成立。匹配到一个你没读过的页面,如果重叠是实质性的,仍然可能要紧——那个页面可能是你应该引用的某篇论文的抓取拷贝,或者你的草稿确实和别人的已发表作品有实质重叠。来源名字本身告诉你的很少。匹配文本几乎告诉你一切。

怎么读匹配本身

与其对名字产生反应,不如把高亮文本和来源并排读:

  1. 打开匹配——在报告里点开来源,看具体哪些句子匹配了。
  2. 读重叠,不读网址——匹配的是一段你引用过的直接引文、一个标题或参考文献、一句方法学套话,还是你的一段正文?
  3. 看相似程度——几个词或一句话,与好几句话措辞一致,是不同的量级。
  4. 比较来源的内容——如果那个页面看起来像聚合站,或者是你确实用过的某样东西的转载拷贝,那只是机制的显示现象,不是新的指控。

这和老师做的阅读是同一件事:判断这个匹配是引用、常见表达、还是需要解释的东西。

什么时候值得再查

大多数陌生来源的匹配是无害的,但少数情况值得多看一眼:

  • 核心部分的实质重叠。 如果连续好几句话匹配——不只是短语——而列出的来源是你从没碰过的页面,去看看那是什么页面。它可能是你用过来源的转载拷贝(没问题),也可能你的草稿确实与你不知道的已发表作品重叠(值得查)。
  • 那个页面是学生论文,不是网站。 匹配到另一位学生的提交不代表串通(collusion)。你们俩可能都用了同一来源。但如果重叠很大,值得回头看看你写了什么、为什么会趋同——因为这正是老师会仔细看的情况。
  • 匹配在你的参考文献或引文里。 正确引用的引文和参考文献列表里的匹配是预期的,常规会被过滤器排除;它们不是老师当作问题的匹配。

当你读完重叠部分还是解释不了,实际的做法和任何相似度问题一样:问你的老师。报告的作用就是开始一段对话,不是结束一段对话。

结论

相似度报告里的陌生来源,是匹配机制的显示属性,不是对你的判决。报告列出的是它碰到的第一个匹配文本实例——一个抓取页、一个聚合站、另一位学生的论文,或者同一句话可能有的许多个家当中的一个。决定匹配要不要紧的是文本本身:重叠了多少、是否带引号和引用、重叠是在你的核心论证里还是在一个短语里。读匹配,不读名字——当重叠是真实的又解释不了时,报告的工作就是和你的老师打开一段对话。来源列表里的名字不决定任何事。文本决定。

继续阅读