引号打了、出处也标了,为什么还是被算成相似
一段引号和出处都齐全的文字被标成匹配,看起来像个 bug。多数时候不是。中间还隔着一个有文档记载的识别环节,而会出错的正是这一环。
HumanPen 团队
· 9 分钟
先说结论
每一处匹配都会按「系统有没有识别出它周围的引号和正文内引用」被分进四个组之一:未引用也未加引号、缺引号、缺出处、已引用且加了引号。做这个判断的是一个训练出来的模型,而且它的局限是公开写明的——只在英文上训练,引用识别只覆盖四种点名的格式,只认七种引号形态,出处离被匹配的文字太远它可能就漏了。一段出处完全正确、但形态不对的文字,会落进错误的那一组。
先说那个百分比,因为它不是大家以为的那样
总相似度的定义简单到可以记在脑子里:匹配到的词数除以全文词数。这个公式不加权,也不会因为你标了出处就打折。
真正让这个数字上下动的是另一套机制,而且它不归你设。同一个帮助站上有一页专讲排除过滤器,一共五个:排除参考文献、排除引号内文字、排除已标注出处的文字、排除小段匹配、排除小来源。这里最要紧的是第二个。它 "ignores text enclosed in quotation marks or formatted as block quotes, preventing properly quoted material from appearing as matches"(忽略引号内或设为块引用格式的文字,使正确引用的材料不至于显示为匹配),文件是 .doc 或 .docx 时它还覆盖缩进的块。
这已经答了标题里那个问题的一半。有时候一段引用得完全正确的文字之所以出现,就是因为没人打开那个开关。开没开是跑这次检查的人决定的,而这件事不会写在他发给你的那个数字上。
分母值得盯一下,因为同一个平台上的 AI 写作指标用的不是这个分母。它的百分比算在符合条件的正文散文上,而不是你的整个文件,这就是为什么那个数字和它的高亮常常看起来不成比例。两个数字,两个分母。这两者我们在相似度分数与 AI 写作分数并排来看那篇里摆到过一起。
还有一个门槛值得在一切之前知道:提交的文本至少要有 20 个词,才会生成相似度报告。
以及文档开篇那句最容易被跳过去的定调:"Highlighted matches are instances of text similarity; they do not always indicate plagiarism. The match could be a quote or cited material listed in a bibliography."(被高亮的匹配只是文本相似的实例,并不总是意味着抄袭。它可能是一处引文,也可能是参考文献里列出的、已标注出处的材料。)
那四个组
Match Groups(匹配分组)按「这段被匹配的文字是怎么标注出处的」把总相似度拆开。用文档自己的措辞:
- Not Cited or Quoted(既未引用也未加引号)—— 指那些 "that are not written as a quotation or has no citation to its original source"(没有写成引文、或者没有指向原始来源的出处)的匹配。
- Missing Quotations(缺引号)—— "This text is cited, but the match is so exact that it may also require quotation marks."(这段文字标了出处,但匹配得太精确,可能还需要加引号。)
- Missing Citation(缺出处)—— "This text is written as a quote, but lacks a citation to its original source."(这段文字写成了引文,但缺少指向原始来源的出处。)
- Cited and Quoted(已引用且加了引号)—— "This text contains a quotation and is cited to a source."(这段文字含有引文,并且标注了来源。)
文档写明这么分的目的,是让审阅者能 "distinguish between integrity issues, teachable moments, and properly-included source text"(区分学术诚信问题、可作教学提醒的情形,以及本就该在那里的引用材料)。也就是说,一处匹配落进哪一组,在别人怎么读你的稿子这件事上是真正起作用的——可以说比首页那个百分比起的作用还大。
所以真正该问的不再是「这段为什么会匹配」,而是「这段落进了哪一组,那一组对不对」。
它是怎么判断的,又会在哪里漏
这一节的内容是有文档的,却几乎没人转述过。
识别出处和引号靠的是一个训练出来的模型,不是一条规则:文档说这里用了机器学习技术 "to recognize in-text citations and quotation marks associated with matched text"(用于识别与被匹配文字相关联的正文内引用和引号)。厂商也把自己的错误率写得很直白:"Since there are innumerable ways to include in-text citations and quotation marks, the Similarity Report won't get it right every time."(由于加正文内引用和引号的方式数不胜数,相似度报告不可能每次都判对。)
由此引出三条写明的局限。
只做英文。 "The technology that powers Match Groups is trained on English content, and this functionality is currently only available for submissions in English."(支撑匹配分组的技术是在英文内容上训练的,该功能目前仅对英文提交可用。)
引用识别只训练过四种格式。 "Citation recognition models have been trained on citations in certain formats: APA, MLA, Turabian, and IEEE numbered citations and references. If a citation is included for a match but is not in one of these formats, the report may--but is less likely to--recognize those as citations."(引用识别模型只在特定格式的引用上训练过:APA、MLA、Turabian,以及 IEEE 的编号式引用与参考文献。如果某处匹配带了出处但不属于这几种格式,报告仍可能识别出它是引用——只是可能性较低。)
拿这份名单对一下你自己的学科。Vancouver、Chicago 作者—年份制、Harvard 以及它那一大堆机构变体都不在上面。这不等于它们永远识别不出来——原话是 "less likely"(可能性较低)——但如果你用的不是那四种之一,「你标了出处的引文被读成标了出处」这件事的概率,按文档写的就是更低。至于你到底该按哪一种格式写,本身就是一团乱,我们在你要用的到底是哪一种 Harvard和按学科选引用格式里各理过一遍。
距离也算数。 "Citations may not be recognized if they are placed very far from the matched text."(如果出处离被匹配的文字很远,可能不会被识别。)一段块引用、出处却压在下一段末尾,就正好是这种情况。
它认得的引号形态
匹配分组那一页明确列了七种形态:
- 直双引号:"…"
- 弯单引号:‘…’
- 法式尖引号(guillemets):«…»
- 反向法式尖引号:»…«
- 德式下上双引号:„…“
- 双直角引号:『…』
- 直角引号:「…」
这份名单要照抄,别凭印象:双引号那一条给的是直的,单引号那一条给的却是弯的一对。而同一个帮助站上讲排除过滤器的那一页印的又是另一份:八条,单引号是直的而不是弯的,多了 《…》 和 〈…〉,少了 「…」。一个帮助站上两份公开名单,两份加起来十种不同形态,两页谁也没提到谁。
别把这件事变成「所以该用哪一种引号」的规矩。把它变成另一条规矩:从你校对完的那一稿到你上传的那个文件之间,不许有任何东西动过你的引号。
另外有一种失效方式是明写出来的:"Quotation marks are not recognized if they are separated from the text by a space (for example, " this improperly quoted text")."(如果引号与文字之间隔着空格,引号不会被识别。)
这是本文里最容易自己查的一件事。前引号后面多出来的一个空格——从 PDF 里复制粘贴时会带过来,段落重排时也会被塞进去——就足以把一处匹配从「已引用且加了引号」挪进「缺引号」。
引号没被识别出来的地方,这处匹配会掉进 "Missing Quotations"(缺引号)或 "Not Cited or Quoted"(既未引用也未加引号),取决于出处有没有被识别出来。两种失效是叠加的。
同一段匹配上多个来源时,卡片上写的是哪一个
同一串文字匹配到不止一个来源时,报告会先显示其中一个,而优先顺序是公开的:先互联网,再出版物,最后是已提交作业库。
看自己的稿子时,这个顺序会显得反直觉。你从一篇已发表论文里正正当当引来的一句话,卡片上可能标着某个转载了那篇论文的网站。有一个 "Show overlapping sources"(显示重叠来源)的控件能把其余的展开,单张卡片上也有查看其它来源的操作。
在你打算就某处匹配去争之前,先知道这一条:卡片上写的那个来源是匹配得最强的那个,不一定是你实际用的那个。
花二十分钟把自己的稿子过一遍
上面这些都不需要你拿到报告。在你正要提交的那个文件里就能做完。
- 找出每一处直接引文,确认前引号紧贴着第一个字符,中间没有空格。直接搜「引号 + 空格」这个组合。
- 核对引号形态,并且在任何一次格式转换之后再核一遍。过一遍模板、过一遍 PDF、或者从合作者的编辑器里转一圈回来,直引号会被换成弯引号而不通知你。译稿里还可能出现两份公开名单上都没有的形态。
- 把出处挪近。如果一处引文的出处躺在下一句或下一段末尾,把它挪到紧挨着被引用的文字。
- 记住你用的引用格式。如果不是 APA、MLA、Turabian 或 IEEE 编号式,就要预期识别没那么可靠,准备好自己解释一处匹配,而不是指望报告替你归好类。
- 对仍然被标成匹配的地方,去看来源卡片,别只看高亮颜色——卡片上写的是最强匹配,可能不是你真正用的来源。
一份报告的两半之间那条线
报告的相似度这一侧不归我们管,改写也不是它的解法。如果一段之所以匹配是因为它本来就是引文,那答案是把出处标清楚。把引文的措辞改掉,只会让它变成一段更糟的引文。
HumanPen 处理的是另一个指标。当一份稿子带着 AI 写作百分比和具体被标出来的段落回来时,把那份报告导进去,就是在告诉它该打开哪几段。
如果你的报告上两个数字都有,它们是两个各自独立的问题、各有各的修法。把它们当成一件事,正是人们最后去改写那些其实只需要挪一对引号的引文的原因。
常见问题
我的引文出处标得好好的,还是被算成匹配,这是错的吗? 不一定。文档写明被高亮的匹配只是文本相似的实例、并不总是意味着抄袭;而针对引号内文字的排除过滤器是单独的一个开关,得有人去打开。开关没开时,正确引用的材料本来就应该出现在匹配里。这时候真正要看的是它落进了四个组里的哪一组。
报告认得我用的引用格式吗? 按文档,引用识别是在 APA、MLA、Turabian 和 IEEE 编号式上训练的。其它格式仍有可能被识别,但原文写的是可能性较低。
我的引号为什么没算数? 被认可的形态是列出来的,另外有一种失效写得很明确:引号与文字之间隔着空格就不会被识别。去查一下前引号后面紧跟的那个空格。
这些对非英文稿件适用吗? 文档写明匹配分组是在英文内容上训练的,且仅对英文提交可用。
继续阅读