Turnitin 相似度报告的过滤与排除:什么会改变你的分数——以及谁有操作权

你的相似度报告在参考文献、在引文、在四五个词的短句里都有匹配——你疑惑这些匹配是不是真的「算数」。Turnitin 关于过滤与排除的官方指南讲了报告可以怎样被精炼:按字数或百分比排除小匹配、排除引用文本与参考文献、排除单个来源。排除后分数重算。但控制权在老师那一侧。本文解释机制、边界,以及这对你意味着什么。

HumanPen 团队

· 5 分钟

短回答

相似度分数不是盖在你论文上的一个固定数字——它是可以被精炼的匹配视图。Turnitin 官方指南描述了过滤与排除功能:排除小匹配、引用文本、参考文献和整个来源,应用这些排除后分数会重新生成、重新计算。一个重要边界:这些控制项在报告的老师端。你没有按钮能把自己报告里的匹配拿掉——而且 Turnitin 指南明确说排除「不会替代人的判断」(don't replace human judgment)。理解机制不等于你能改自己的数字。

为什么分数不是固定的

报告存在的目的是帮老师审阅匹配——不是宣告判决。这就是为什么 Turnitin 把过滤与排除做进了报告本身。官方指南写道:

「Using Filters and Exclusions will help you refine a Similarity Report to only include matches that are irrelevant to you.」(使用过滤与排除,可以帮你把相似度报告精炼到只包含对你有意义的匹配。)

同一份指南也说明了实际后果:「应用过滤与排除,可能改变也可能不改变整体相似度百分比,取决于多种因素。」也就是说,你在提交日看到的数字只是报告的一个版本——老师可以生成一个更精炼的版本,百分比可以变。

小匹配:按字数或百分比排除

「为什么一个 5 个词的短语也被算进去?」最常见的答案就是小匹配这一类。Turnitin 指南直接描述了这种排除:

「Excluding small matches allows you to exclude matching against sources with a small amount in common with the submission. For example, it's possible to exclude matches fewer than 20 words in total, or less than 10% in total.」(排除小匹配,可以让你排除与提交内容重叠很少的来源。例如,可以排除总计少于 20 个词、或少于 10% 的匹配。)

下一句解释了百分比怎么算:

「The percentage is based on the total word count of the student's submission. For example, if a student submitted a 5,000 word submission, and you have this set to 10%, it will exclude sources of less than a 500 word match.」(百分比基于学生提交的总词数。例如,如果学生提交了 5000 词的文档,而你把阈值设为 10%,就会排除少于 500 词匹配的来源。)

所以一个 5 个词的短语处在尺寸标尺的最底端。它可以成为匹配——而它恰恰是可以被排除阈值拿掉的那种匹配,因为它低于门槛。老师要不要应用这样的阈值是老师的选择;默认报告是包含这个匹配的。

引用与参考文献:可以排除的「预期文本」

第二类是学生问得最多的:格式正确的引用和参考文献列表本身成了匹配。指南说:

「Exclude quoted text, bibliographic content, and reference materials from within a Similarity Report to remove those matches from the report. This can possibly affect the score percentage, and help provide a more focused assessment.」(把引文、文献内容与参考文献材料从相似度报告中排除,可以拿掉这些匹配。这可能会影响分数百分比,并帮助提供更聚焦的评估。)

在 Similarity 产品版本里,同一想法把理由也说了:

「Exclusions hide specific types of text that shouldn't count toward similarity, such as properly formatted quotations, bibliographies, or in-text citations. Exclusions help make similarity scores fairer and more accurate by ignoring expected or properly referenced text.」(排除会隐藏不应该计入相似度的特定文本类型,例如格式正确的引文、参考文献或行内引用。排除通过忽略预期中的、或引用规范的文本,让相似度分数更公平、更准确。)

这就是为什么一页报告看起来吓人(「我的整页参考文献都匹配了!」),而老师的精炼视图小得多。匹配是真实的——报告只是在审阅时可以排除预期的文本。

排除来源:分数重新计算

除了内容类别,一个完整的来源也可以从计算中拿掉。指南写道:

「Excluding a source removes an entire source and all associated matches from the similarity calculation, preventing any of its text from contributing to the overall similarity percentage.」(排除一个来源,会把该来源及其所有关联匹配从相似度计算中移除,让它的任何文本都不再贡献到整体相似度百分比。)

单个匹配也可以用同样的方式移除:

「Excluding a match removes a specific text match from the similarity calculation, so it no longer contributes to the overall similarity percentage.」(排除一个匹配,会把该具体文本匹配从相似度计算中移除,它不再贡献到整体相似度百分比。)

任何排除之后,报告都会重新生成:「选择 Apply Changes……确认并重新生成报告,让你的更改即时反映在作业里。」之后你看到的百分比是精炼视图——不是最初提交视图。

重交:你的原稿进入已排除来源

指南里有一个细节直接跟重交行为相关:

「If a student resubmits an assignment, their original assignment will show up under 'excluded sources' in order to prevent matching against the original draft.」(如果学生重交作业,他们的原稿会出现在「已排除来源」下,以防止与原始草稿匹配。)

这与 Turnitin 匹配帮助中心里描述的自匹配保护是同一件事:你的后一稿不会匹配前一稿,因为前一稿被当作已排除处理。老师可以从报告的「已排除来源」列表恢复被排除的来源——包括他们通常不想看到的自匹配,只要他们愿意。

边界:排除不替代判断

同一份官方指南用一句话划出了边界:

「While exclusions refine the process, they don't replace human judgment; it's still important to review the remaining matches to determine whether they reflect proper attribution or potential plagiarism.」(排除虽然精炼了流程,但不会替代人的判断;仍然重要的是审阅剩余的匹配,判断它们反映的是规范引用还是潜在抄袭。)

对你作为学生来说,这就是全部要点。报告是给你老师用的调查工具,不是你能控制的产出。实践中的要点:

  • 你不能从自己的报告里排除匹配——控制项在老师端。
  • 精炼后的报告(排除之后)不是「通过」——它是老师想审阅内容的更清晰视图。
  • 如果某个匹配让你困扰——在参考文献里、在引文里、或只是一个小短语——正确做法是问老师他们的审阅视图是怎样的,而不是试图自己把它拿掉。

结论

你看到的相似度分数只是报告的一个版本。Turnitin 的过滤与排除可以拿掉小匹配(低于字数或百分比阈值)、引用与参考文献文本、以及整个来源——每次更改后分数都会重算。这些控制项属于老师,而指南自己的话就是边界:排除「不会替代人的判断」。如果你在引文、参考文献或短句里看到匹配,它们是报告设计上可以被排除的真实匹配——只是你不是拿着控制权的那个人。读报告、理解机制、然后问那个真正要紧的问题:你的老师是怎么审阅它的?

继续阅读