你的稿子由谁在查重,又在跟什么比
作者通常把这道检查想象成一个搜索引擎,在公开网络上找自己写的句子。它背后的安排比这具体得多,而其中几个细节会改变「一处匹配」到底意味着什么。
HumanPen 团队
· 8 分钟
先说结论
如果你投的期刊是 Crossref 会员并且使用 Similarity Check,那么这道检查是 Crossref 以优惠价提供给会员的一项服务,跑在 Turnitin 的 iThenticate 上。你的稿子会不会走这一道,取决于出版方参不参加——所以这是要先确认的事实。在它适用的情况下:上传稿件、拿到报告的是编辑,不是你;除非有人发给你,你通常看不到那份报告。Crossref 说参与的会员可以对 Similarity Check 数据库中文章的全文获得只读访问以供比对,并把这个数据库描述为收录了超过 7800 万条全文学术内容。
到底是谁在跑这道检查
Crossref 用一句话描述这项服务:"A service provided by Crossref and powered by iThenticate—Similarity Check provides editors with a user-friendly tool to help detect plagiarism."(Similarity Check 是 Crossref 提供、由 iThenticate 驱动的一项服务,为编辑提供一个易用的工具来帮助发现抄袭。)
这句话里有两个词,对作者来说承载了大部分含义。
编辑。这个工具被描述成给编辑用的:他们 "upload a paper"(上传一篇稿件),拿回 "a report highlighting potential matches and indicating if and how the paper overlaps with other work"(一份高亮潜在匹配、并指出该稿是否以及如何与其它作品重叠的报告)。写明的用途是 "assess the originality of the work before they publish it"(在发表之前评估这项工作的原创性)。你不是这个软件的使用者,你是它的对象。
会员。Similarity Check 是一项面向 Crossref 会员的服务。Crossref 说这个安排让会员获得 "reduced-rate access to the iThenticate text comparison software from Turnitin"(以优惠价使用 Turnitin 的 iThenticate 文本比对软件),并写着 "Only Similarity Check members benefit from this tailored iThenticate experience"(只有 Similarity Check 会员才享有这套定制的 iThenticate 体验)。所以你的稿子会不会走这一道,取决于出版方参不参加——这是关于出版方的事实,不是关于你所在学科的。
这也意味着,「期刊做了查重」这句话至少描述两种完全不同的情形:一种是出版方在这个体系之内,另一种是它用的是别的东西。别人给你一个数字,问一句是哪一种产出的,很合理。
读上面这些的时候有一件事要一起记着:Crossref 就是把这项服务提供给会员的那个机构,服务里附带着打折的查重费。它对这套安排「是什么」的描述是准确的,但那不是一份关于「这道检查值不值得跑」的无利害评估。本文里的每一处引用,都是对机制的描述,不是对它的评价。
它在跟什么比
比对集合是作者最常猜错的一部分。
Crossref 把这个数据库描述为收录了 "over 78 million full-text scholarly content items"(超过 7800 万条全文学术内容),并把会员资格买到的东西描述为包括 "read-only access to the full text of articles in the Similarity Check database for comparison purposes"(对 Similarity Check 数据库中文章全文的只读访问,用于比对)。
是全文,不是摘要,也不是元数据。iThenticate 的文档把检索目标描述得更宽:取决于所选设置,可能包含 "billions of pages of active (and archived) internet information, previously submitted works"(数十亿页现存与已归档的互联网信息、以往提交过的作品)以及 "tens of thousands of periodicals, journals, and publications"(数以万计的期刊、杂志与出版物)。
有两条后果值得记住:
- 付费墙后面的论文也在比对集合里。你自己读不到某篇东西,跟你的句子会不会被拿去和它比,是两回事。
- 集合是每次检查各自选定的。检索目标被描述成为这次检查所选,所以两位编辑跑同一份稿子,可能跑在不同的目标集合上。一边给出的数字,不构成对另一边数字的预测。
这份报告是用来干什么的,又不是用来干什么的
iThenticate 的指南一上来就先提醒:一处高亮只是在陈述文本重叠,仅此而已——一段引用得当的文字、或者你参考文献表里的一条,本来就应该亮起来。
那个百分比本身是算术,文档也是这么写的:数出匹配上的词数,再除以这份稿子有多少词。这个公式不会因为你标了出处就打折。
但这不等于说你的参考文献表一定会把数字顶上去。决定这件事的是过滤器:iThenticate 讲过滤器的那一页描述了一个排除参考文献的设置,它 "automatically identifies and ignores reference lists or bibliographic sections so they don't inflate the similarity percentage"(自动识别并忽略参考文献列表或书目部分,使它们不至于把相似度百分比抬高),另外还有针对引号内文字和已标注出处文字的两个独立开关。所以同一份稿子既能产出一个含参考文献的百分比,也能产出一个不含的,而数字本身不会告诉你手上这个是哪一个。别人拿一个数字跟你说事时,这就是第一个该问的问题。
这也正是报告要按「有没有识别出周围的引号和正文内引用」把匹配分组的原因——那是一个自身局限被写明的识别环节,也是为什么两份百分比相同的稿子可以是完全不同的两回事。
你自己已发表的论文在什么位置
这个数据库是由会员登记的内容构成的。Crossref 在它那两页 Similarity Check 页面上都没有把这件事对作者意味着什么写出来,所以下面这一步请当成推论、不是引用:如果你在参与该服务的会员那里发表过,那就应当预期你自己的文章会坐在后续稿件被比对的语料里——包括你自己的下一篇。
作者第二次投稿时撞上的那个谜团,通常就是这么来的:新论文里有一大块跟自己写过的一篇对上了。这不是检查出了毛病,而是这道检查跑在了一个包含你的语料上。
这一切都不决定「在你的领域里复用自己的文字是否可接受」。它只意味着报告会把它显示出来,而你应该准备好去解释,而不是被它吓一跳。
顺带说一句版本问题
Crossref 的文档列了 iThenticate v1 与 iThenticate 2.0 的接入路径,包括直接在浏览器里用 2.0、以及通过稿件跟踪系统集成来用,另外还有一条从 v1 升级到 2.0 的路径。
也就是说,摆在你面前的报告可能来自其中某一个界面,而不同界面可用的报告功能不一样。如果有人拿一份「Similarity Check 报告」上的数字跟你说事,那么它出自哪个版本、背后开了哪些排除设置,都是可以问的,而这两个问题都会改变这个数字的含义。
作者拿这些能做什么
- 先查清你的目标期刊参不参加,以及参加的是什么。这是出版方层面的事实,常常写在投稿须知里。
- 按「全文」而不是「摘要」来假设。你只看得到摘要的那篇论文,只要你贴着它转述,它照样在比对集合里。
- 预期自己以前的成果会出现,并准备好说清哪些部分是复用的、为什么。
- 先问设置是什么,再把任何百分比当成你稿子的属性。它是一次比较的属性,而这次比较是有参数的。
- 别把数字当成结论。指南说得很明确:一处匹配本身不构成结论;真正有用的对象是匹配清单,以及每一处是怎么标注出处的。
如果报告上还有第二个数字
在出版方的授权包含它的情况下,有些稿子回来时相似度数字旁边还带着一个 AI 写作指标。那是另一项测量、另一层含义,做多少引用和出处的功夫都动不了它。
HumanPen 只处理第二个数字。把稿子和报告一起给它,被标出来的那些就是全部的活。
至于相似度这一侧,老实的建议都很无聊:标注出处、引文格式做对、问清排除设置开了哪些、准备好解释复用。没有任何一款改写产品应该被当成「参考文献表被匹配上了」的解法卖给你。
常见问题
我能自己跑一遍 Similarity Check 吗? 走这条路不行。Crossref 把它描述成一项面向会员的服务,为编辑提供查稿工具;访问权绑定在会员机构上,不是个人作者。
它是不是只拿开放获取的论文来比? 不是。Crossref 把会员描述为对 Similarity Check 数据库中文章的全文拥有只读访问以供比对,并写明该数据库收录超过 7800 万条全文学术内容。
我自己以前那篇会被算成匹配吗? 有可能。比对语料由会员登记的内容构成,所以已发表的作品——包括你的——是新稿件被比对的对象的一部分。
两位编辑对同一份稿子给了我不同的百分比,哪个是对的? 都可能是对的。检索目标是每次检查各自选定的,报告还带排除设置,所以那个百分比描述的是一次特定的比较,而不是你这个文件的固定属性。
继续阅读