SafeAssign 和 Turnitin AI 检测的区别:各自到底查什么

很多同学以为 SafeAssign 通过了,Turnitin 的 AI 检测也能过。这两个工具运行的是完全不同的分析,看的是完全不同的信号。理解这个差异,就能解释为什么一篇论文可以通过一个工具却被另一个标记。

HumanPen 团队

· 6 分钟

简短回答

SafeAssign 和 Turnitin AI 检测回答的是不同的问题。SafeAssign 问的是:这篇文章是否和数据库里已有的内容匹配?它把你的提交和学术论文、网页、机构仓库做比对,然后报告匹配文本的百分比。Turnitin 的 AI 写作检测问的是:这篇文章是否像机器写的?它分析散文句子的词概率模式,报告疑似 AI 生成内容的百分比。一篇论文可以在 SafeAssign 里零匹配,同时在 Turnitin AI 检测里拿到高分,因为 AI 检测器根本不找抄袭文本。它找的是选词的统计模式。两个分数之间没有任何关联。

SafeAssign 做什么

SafeAssign 是一个抄袭检测工具。它的工作原理是把提交的文本和它的源材料数据库做比对,数据库包括学术出版物、互联网内容、以及参与机构提交的论文参考库。输出是一份原始性报告,显示匹配文本及其来源,并给出一个表示匹配百分比的分数。关键点在于:SafeAssign 完全是关于匹配的。它问的是你的文字是否出现在别处。它不分析你是怎么写的、写作风格是否像机器生成的、或者选词模式是否与 AI 相关。如果你每个字都是自己写的但恰好和某个已发表来源措辞接近,SafeAssign 会标记它。如果你用 AI 生成了全新的、不匹配数据库里任何内容的文本,SafeAssign 看不出任何问题。

Turnitin AI 检测做什么

Turnitin 的 AI 写作检测在完全不同的原理上运行。Turnitin 自己的 FAQ 是这样描述检测过程的:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."

检测器不是在查匹配。它是在根据模型训练时学到的统计模式,对文本片段进行分类,判断是否疑似机器生成。这就是为什么 Turnitin 的 FAQ 明确说 "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other."(相似度分数和 AI 写作检测百分比完全独立、互不影响)。同样的独立性也适用于任何抄袭检测工具:SafeAssign 的匹配百分比和 Turnitin 的 AI 分测量的是不同维度上的不同东西。在 Turnitin 内部,AI 写作报告和相似度报告之间也是同一种分割。

为什么过了不代表都过了

困惑通常始于一个场景:同学在 SafeAssign 里跑了论文,拿到低相似度百分比,就以为论文安全了。在抄袭指控面前它确实安全。但在 AI 检测指控面前未必。考虑两种场景。第一种:同学每个字都自己写但紧密改写了一个来源。SafeAssign 可能标记高匹配率因为措辞重叠,尽管没有涉及 AI。Turnitin 的 AI 检测器大概率会给低 AI 分,因为写作模式是人的。第二种场景:同学用 AI 工具生成了不匹配任何已有来源的全新文本。SafeAssign 返回零匹配因为文本是新的。Turnitin 的 AI 检测器可能标记为高度疑似 AI 生成,因为词概率模式与模型学到的机器写作特征吻合。两个工具对彼此关注的东西是盲的。SafeAssign 告诉你关于 AI 的任何事情都无法判断。Turnitin 的 AI 检测器告诉你关于抄袭的任何事情也无法判断。查重那一侧到底伸进了哪些库,你的稿子由谁在查重,又在跟什么比里有讲。

谁能看到什么

还有一个访问权限的区别值得了解。Turnitin 的 FAQ 指出 "only instructors and administrators are able to see the indicator",即 AI 写作检测指标只有教师和管理员能看到。学生看不到自己的 AI 分,除非教师选择分享报告的 PDF 版本——这一点官方原文紧接着就说了:"However, with the PDF download feature, instructors can download and share the AI report with students." SafeAssign 则可以根据机构设置让学生看到自己的原始性报告。这意味着一个学生可能看到干净的 SafeAssign 报告并感到放心,却永远看不到教师那边 Turnitin 给出的 AI 分。一个工具给你看了某个数字不代表另一个工具在展示同样的东西,也不代表同一个人能看到两者。你看不到的那一侧是什么样,见AI 比例偏高时,厂商是怎么教老师处理的

这对你意味着什么

总结一下我们讲的内容:

  • SafeAssign 查的是文本和数据库的匹配。它是抄袭检测工具。
  • Turnitin AI 检测查的是词概率模式。它是 AI 检测器。
  • 两个分数完全独立。过了其中一个对另一个没有任何参考价值。
  • 被 SafeAssign 标记不代表被标记 AI,反之亦然。
  • 学生通常看不到自己在 Turnitin 上的 AI 分,而 SafeAssign 报告是否可见取决于学校设置。

如果你有 Turnitin 或 iThenticate 的 AI 报告,想针对被标记的段落做处理,可以导入报告只改那些段落。符合条件时可以免费继续降 AI。

继续阅读