Copyleaks 和 Turnitin AI 检测对比:为什么检测器会给不同分

同学经常用多个 AI 检测器跑同一篇论文,得到完全不同的分数。Turnitin 可能说 20% 而 Copyleaks 说 80%。原因很简单:不同模型、不同训练数据、不同分类阈值。理解检测器为什么不一致有助于在上下文中读懂每个分数。

HumanPen 团队

· 8 分钟

简短回答

不同的 AI 检测器给出不同分数,因为它们是用不同数据训练的不同模型,有不同的分类阈值。Copyleaks 和 Turnitin 是不同团队开发的独立产品。各自有自己的模型、训练语料和聚合片段级预测的方法。当 Copyleaks 说 80% 而 Turnitin 对同一文本说 20% 时,两者都不一定错。它们测量的是不同的统计模式,用的是不同的决策边界。你应该关心的是你的学校实际使用的那个工具的分数。如果你的学校用 Turnitin,你的 Copyleaks 分数有参考价值但没有决定性。

Turnitin 的检测器怎么运作

Turnitin 的 FAQ 描述了它的流水线:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."

Turnitin 还公布了一个具体的误报目标:"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." 这个目标塑造了模型分类边界文本的激进程度。一个调为最小化误报的模型会把更多不确定的片段分类为人写的,这在混合文本上可能产出更低的 AI 分。

为什么 Copyleaks 和 Turnitin 不一致

Copyleaks 用自己的 AI 检测模型,有自己的训练数据和分类阈值。Copyleaks 模型的细节不像 Turnitin 的 FAQ 那样公开,所以我们无法做并排机制比较。但不一致的结构性原因很清楚:两个用不同数据训练的不同模型会对同一文本做不同分类。Turnitin 模型分类为 0.3 AI 概率的一个句子,Copyleaks 模型可能给 0.7。当这些片段级差异在整个文档中汇总时,最终百分比可能显著分歧。为什么同一段文字在不同检测器上分数差很多把这件事整体拆过一遍。

还有一个阈值差异。Turnitin 不显示 1% 到 19% 之间的分数,只显示星号。FAQ 解释:"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range." 如果 Copyleaks 对 Turnitin 显示星号的同一文本显示 15% 的分数,差异部分是展示决策而不只是分类差异——参见Turnitin AI 率上的星号(*%)是什么意思

短文档放大不一致

Turnitin 的 FAQ 指出短文档预测可靠性更低:

"In shorter documents where there are only a few hundred words, the prediction will be mostly "all or nothing" because we're predicting on a single segment without the opportunity to overlap."

下一句:"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."

在短文档上,一个检测器可能把整篇文本分类为 AI(拿到 100%),另一个分类为人写的(拿到 0%)。全有或全无的行为意味着每个模型处理单个片段的微小差异可以在最终分数上产生巨大分歧。如果你在比较检测器分数,文档长度很重要。一篇 300 词的摘要可能在不同工具上得到天差地别的分数,而一篇 3000 词的论文可能显示更接近的一致性。

哪个分数重要

重要的分数是你学校使用的那个工具的分数。如果你的大学用 Turnitin,你的 Turnitin AI 分是影响你学术处境的那个。Copyleaks 5% 的分数帮不了你如果 Turnitin 给你 80%。Copyleaks 80% 的分数不会损害你如果你的学校不用 Copyleaks。用多个检测器跑论文可以给你文本是否有 AI 模式的总体感觉,但它不能告诉你学校的检测器会怎么说。知道你实际分数的唯一方法是看你学校使用的工具的报告,而只有教师和管理员能看到 Turnitin AI 指标。学校到底跑不跑检测,取决于学校买的是哪个许可

这对你意味着什么

总结一下我们讲的内容:

  • 不同的 AI 检测器用不同模型、不同训练数据和不同阈值。不一致是预期中的,不是意外的。
  • Turnitin 公布了误报目标(对 AI 占比超过 20% 的文档低于 1%)和机制(重叠片段分类)。
  • Turnitin 把 1% 到 19% 的分数压为星号,这可能放大与其他工具的表面分歧。
  • 短文档产出全有或全无的预测,可能导致检测器间的巨大分歧。
  • 重要的分数是你学校实际使用的那个工具的分数。

如果你有 Turnitin 报告显示哪些段落被标记了,可以导入报告专门处理那些段落。符合条件时可以免费继续降 AI。

继续阅读