Turnitin 44% 但来源很少?——高分相似度报告到底怎么读
报告显示 44% 相似——而下面的来源列表几乎是空的。百分比不是来源数量,是匹配词数占比。这篇讲计算方式、为什么几个来源就能撑起高分,以及为什么分数会随教师侧设置变化。
HumanPen 团队
· 5 分钟
短答案
相似度 44% 但来源列表只有寥寥几个,不是矛盾,也不是系统错误。百分比数的是词,不是来源:它是你提交中与 Turnitin 数据库匹配的文字所占的份额。一个单一的长来源——你重点参考的一篇文章、你自己更早的提交、甚至一段正确引用的文字——就能占掉很大一部分词。
分数还对设置敏感。教师可以排除引用、参考书目和此前提交,而这些设置会改变同一份文档的数字。所以「高分 + 少来源」的意思是:去读匹配分布,而不是读标题上的百分比。
你看到的是什么
报告页并排显示两样东西:上面的百分比和下面的匹配来源列表。大数字配短列表,读起来很可疑——「44% 但只有 7% 匹配」——因为感觉上两个数字应该同步变动。
它们不同步。百分比和来源列表是两种不同的度量。百分比是覆盖你整篇文档的一个数字。来源列表是匹配词来自哪里的分解——而一个来源可以贡献很多词。
这就是整个困惑的形状:一个按词计数的标题数字,一个按来源计数的列表,两者之间没有任何规则把它们绑在一起。
百分比到底是什么
Turnitin 自己的学生指南把这个数字定义得很精确。相似度分数是你的提交所含匹配文本的百分比,即总体相似度。它的算法是:用提交的总词数,除以与数据库来源匹配的词数。
这个定义带来两个推论。
推论一:百分比与来源列表里有多少个来源无关。它是你的文档词数的一个分数。一篇 44% 的词都匹配的文档——哪怕只对一个来源匹配——报告的就是 44%。
推论二:数据库庞大而多样。Turnitin 的指南把它描述为互联网上当前和归档的内容、数以千计的期刊与出版物,以及此前提交给 Turnitin 的论文。无论来源是一篇长文章还是二十个短页面,匹配词数都按同样方式计入。
为什么几个来源也能撑起高分数
短来源列表产生高百分比的具体方式:
一个长来源。 如果你的论文有相当一部分在转述或引用同一篇文章,那一个来源就占掉匹配词里的一大块。来源列表很短,百分比却不短。
你自己更早的草稿。 Turnitin 的官方场景里就包括反复提交同一篇论文草稿的学生——结果是终稿对更早版本可能拿到 100% 的分数。一个来源(你自己),最大百分比。
正确引用和标注的文本。 学生指南说,你的提交很可能与数据库的某些内容匹配,而且正确使用的引用和参考文献仍会被高亮为匹配。被引段落是真实的匹配;百分比像对待其他文本一样把它们计入。
文档内部的重复。 如果你自己的论文把某个短语或定义重复了几次,而那个短语在数据库里存在一次,每一次重复都可以算作匹配文本。
共同点:百分比是词的份额,而词可以堆在一两个来源上。
分数对设置敏感
同一份文档,教师如何配置报告,会产生不同的百分比。这在 Turnitin 自己的官方场景里有文档可查。
教师可以选择从相似度报告中排除引用,以在适用的情况下降低相似度分数——而其中一个官方示例正是:学生提交包含大量引用和详尽参考书目,分数偏高,直到引用与参考书目被从报告中排除。
所以你看的百分比是文档和报告设置的函数:引用是否排除、参考书目是否排除、此前提交是否排除。教师侧设置改变数字;文档没有变。
这一点在同班同学之间或草稿之间比较分数时很重要——你可能在比较两份关于相似文档的、但不同设置的报告。
怎么读你自己的报告
别再看标题上的百分比,开始读匹配分布。
第一步,打开来源列表,看被高亮的匹配——不是看数量,而是看文字。匹配的是什么?是你引用的一个来源里的长段落?你重复过的定义?你旧草稿的一段?每一种含义都不同,而百分比本身无法区分它们。
第二步,问清楚设置是什么。报告生成时排除了引用吗?参考书目?此前提交?答案会改变这个数字对你的文档具体意味着什么。设置由教师控制;直接问是搞清楚百分比到底在数什么的最快方式。
第三步,用官方口径把数字放进语境:不存在固定的合格分数。Turnitin 的学生指南写明,每所学校、每位老师、每份作业认可的匹配文本量都可能不同,并建议你查阅课程大纲、作业说明或直接问老师。
高分加少来源是一个问题,不是判决——答案在匹配文字和设置里,不在百分比里。
结论
44% 加短来源列表不是矛盾。相似度百分比数的是匹配词——你总词数的一个份额——而来源列表数的是来源;一个长来源、你更早的草稿、或正确引用的文字都能供出很大一块词。分数还对设置敏感:教师可以排除引用、参考书目和此前提交,这会改变同一份文档的数字。去读被高亮的匹配,问清楚设置——高分的含义就住在那里。
继续阅读