Turnitin 自己测了检测器对英语学习者有没有偏差,结果有两半

300 词以上的提交,Turnitin 报告二语写作者与母语写作者的误报率差距很小、统计上不显著。而 150 到 300 词之间的提交,同一次评测发现差距更大,且显著高于它自己 1% 的目标。它还自陈了一条关于样本的局限——如果你写的是大学长度的论文,那条局限直接决定这个结论能不能套到你身上。

HumanPen 团队

· 6 分钟

结论分两半

Turnitin 自己做了关于这个问题的评测并且公开了结果。结论分两半,方向正好相反。

提交件达到 300 词及以上时,英语学习者和母语英语作者之间的误报率差距很小,在统计上不显著。提交件在 150 到 300 词之间时,同一份评测发现差距更大,明显超出了他们自己定的 1% 目标。

所以那个让人安心的结论是不是覆盖你,取决于你提交的东西有多长。Turnitin 还提到了一个跟大学写作直接相关的样本局限,放在后面说。

测了什么

Turnitin 为每种组合抽了最多 2,000 篇文本,交叉两个维度:L2 英语(英语学习者)写作对 L1 英语(母语英语)写作,"太短"(150 到 300 词)对"够长"(300 词及以上)。这些数据没有进入检测器的训练集。

标题里会放的那一半

对达到 300 词下限的文档,报告说 L2 和 L1 作者之间的误报率差异很小,在统计上不显著:

"For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target." (对于达到 300 词最低要求的文档,L2 英语作者和 L1 英语作者之间的误报率差异很小,且在统计上不显著,说明检测器在这两组作者之间不存在偏向。另外,虽然两组的误报率都略高于 0.01 即 1% 的总目标,但没有哪一组的误报率与该目标有显著差异。)

"统计上不显著"的意思是,他们观察到的差异有可能是噪音。不是说差异为零,也不是说偏差不存在。两组的误报率其实都略高于 1% 的目标,只是没高出到统计检验认为有意义的地步。"略高于"不等于"低于"。

标题里不会放的那一半

对 150 到 300 词的文档,同一份评测给出了相反的方向。L2 和 L1 作者之间的差距更大,误报率显著高于 1% 目标:

"Conversely, for documents that are \"too short,\" we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum." (反过来,对于"太短"的文档,他们发现两组作者之间的误报率差异更大,而且显著高于 0.01 的误报率目标。这再次印证了之前的发现:AI 写作检测器需要更长的样本才能正确识别 AI 生成的内容并把误报控制到最低。)

同一次研究,同一个检测器,长文本给出一个结果,短文本给出另一个结果。博客标题写的是前一个。后一个在正文里。

样本里到底是什么

这次评测用的 L2 写作样本,跟你在大学里写的东西不是同一类。厂商自己提到了这个问题:

"Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation." (L2 英语文档大多是短篇议论或说明写作任务,跟 ASAP 中学水平作文语料库最接近。这次评测没能找到可比的、公开可获取的 L2 和 L1 大学级完整文档集合。)

评测里的 L2 写作,大部分是中学水平的短篇议论和说明文。如果你写的是大学论文、文献综述、实验报告或论文章节,这些不在评测范围内。Turnitin 说找不到公开可获取的 L2 和 L1 大学级完整文档集合来做比较。"统计上不显著"这个结论是在中学水平的短篇作文上得到的。它对你要交的那种长文成不成立,这份评测回答不了。

300 词这条线

300 词下限直接追溯到这次研究。评估了 800,000 份文档之后,发现短篇提交的误报率偏高,于是把最低提交字数设为 300 词:

"Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission." (他们评估了 800,000 份文档,发现短篇提交(少于 300 词)的误报率略高于可接受水平。如此短的样本里可能没有足够的信号或标记来识别 AI 写作的特征性分布差异。为了把误报率控制在 1% 以下,他们将最低提交长度更新为 300 词。)

这个下限存在,是因为短文本出了问题。让人安心的结果只在这个下限以上成立。在这个下限以下,同一份评测恰恰发现了你最想知道的那个差距。

Liang 那项研究怎么说

你可能看到过跟 Liang 的研究相关的新闻标题。Turnitin 在博客里直接回应了这件事:

"Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short." (Liang 的主张基于一个很小的样本集合,只有 91 篇托福练习作文,全部短于 150 词。Turnitin 的 AI 写作检测没有被纳入那次评测,部分原因可能是他们不会对这么短的文档做预测。)

你拿这些能干什么

如果你的提交超过 300 词,数据显示 L2 和 L1 误报率之间的差距很小,在统计上不显著。这不等于保证你不会被标红。它的意思是,这次评测没有找到强有力的证据说 L2 作者系统性吃亏,至少在他们手里的那个样本中没有。

接下来是你能实际拿去用的几条。

提交前查一下字数。如果一段不到 300 词被标红了,检测器自己的评测说短文本会让 L2 和 L1 之间的差距变大,整体误报率也更高。你可以请老师对完整文档而不是某个短片段做检测。

问清楚标红了什么内容、阈值是多少。如果用的是 Turnitin,300 词下限和"略高于 1%"都是你可以跟审核标红的人提的具体细节。

留好草稿、笔记和来源。如果你被标红了并且觉得跟你的 L2 写作有关,拿出修改记录和源材料才是能推进对话的东西。跟教授争论统计显著性大概没什么用。

继续阅读