Turnitin 为什么把我的作业判成 100% AI?

如果 Turnitin 在你自己写的作业上给出 100% AI 分,分数是真的,但它意味着什么不是它表面看起来的那个意思。短文档、重复结构、只改写不加分析的写法,都会把人类文本推向 100%。Turnitin 自己的文档说,分数不应作为对学生采取不利行动的唯一依据。

HumanPen 团队

· 24 分钟

先说结论

100% 的分数不代表 Turnitin 确定你的文本是 AI 生成的。对于只有几百词的短文档,预测接近 all-or-nothing(全有或全无),因为系统只在一个片段上打分,没有重叠片段可以平均。结构变化少、字面自我重复、或只改写不产生新想法的文本更容易触发误报。而 Turnitin 自己在三份帮助文档里都写明,分数不应作为对学生采取不利行动的唯一依据。

我们在Turnitin 到底用不用 perplexity 和 burstiness里讲过分类器和片段机制。这篇要回答的是:当系统对你知道是自己写的东西返回 100% 时,发生了什么。原因都是机制上的,不是随机的,而且 Turnitin 自己的页面上有记录。

短文档的问题

这是真正由人类写的文本拿到 100% 分数最常见的原因。Turnitin 的 AI 写作检测能力 FAQ 是这么描述短文档的:

「In shorter documents where there are only a few hundred words, the prediction will be mostly "all or nothing" because we're predicting on a single segment without the opportunity to overlap.」(在只有几百词的短文档里,预测会主要是「全有或全无」式的,因为我们在单个片段上做预测,没有重叠的机会。)

下一句补全了画面:

「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(这意味着,一些混合了 AI 生成内容和原创内容的文本,可能被整体标记为 AI 生成。)

两句连起来读,短文上的 100% 分数就不像一个判决了。它更像仪器分辨率的上限。只有一个片段时,没有东西可以平均。一个高概率片段就成了整篇文档的分数。如果你的文章是 300 词或 500 词,这是第一个要排查的可能。

Turnitin 在 2023 年 12 月的发布说明里也提到,"submissions that contain less than 300 words may result in an AI writing score that is likely less accurate"(少于 300 词的提交可能产生准确度较低的 AI 写作分数)。短文档更难打分,系统自己知道这件事。

什么样的文本更容易被误判

同一页 FAQ 列出了误报更容易出现的文本类型:

「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.」(有时候误报,把人类写的文本错误地标记为 AI 生成,可能出现在结构变化不多的内容、字面上重复自己的文本、或只改写而没有发展出新想法的文本中。)

下一句和这份清单一样重要:

「If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.」(如果我们的指标显示这类文本中 AI 写作的比例较高,我们建议您在查看所显示的百分比时将这一点纳入考量。)

这是 Turnitin 在告诉教师:当这类文本上出现高分时,要打折看待。如果你的写作结构上很均匀(段落长度相近、句式相似、词汇重复),或者你紧密改写了来源材料但没有加入自己的分析,分数就会往上走,哪怕每个词都是你写的。

这不是 bug。这是分类器把均匀读成了信号。看起来规则化的统计模式可能匹配模型从 AI 文本里学到的东西,即使文本是由一个恰好写得很一致的人类写的。

100% 分数是汇总值,不是判决

要理解为什么单个片段就能给出 100%,得看整条打分流程。Turnitin 的 FAQ 描述了这条流水线:

「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.」(论文提交后,句子被抽出来、切成互相重叠的片段做预测分析。每个片段由 AI 检测模型分类,得到一个 0 到 1 之间的值,表示该文本更可能由人类还是 AI 生成。每个合格句子继承覆盖它的那个片段的分数。因为片段互相重叠,有些句子会带有多个分数,再被池化成一个分数。这些句子分数进一步汇总,用来计算文档整体的 AI 写作分数。)

在长文档里,有很多重叠片段。靠近某个片段边缘的句子同时落在下一个片段里。两个片段的分数被池化在一起。一个读起来像 AI 的片段不会主导,因为相邻片段把池化分往别的方向拉。

在短文档里,只有一个片段。没有重叠。没有跨窗口的池化。这单个片段的分类结果就成了文档分数。如果这个片段被分类为 0.95 的 AI 概率,文档分数就是 100%(或聚合映射出来的任何值)。系统没有第二意见可以参考。

这就是 100% 分数集中在短文上的机制原因。不是因为短文更可能是 AI 写的,而是因为仪器自我纠偏的机会更少。

Turnitin 自己怎么说分数的用途

Turnitin 的文档比使用它的机构要谨慎得多。AI 写作报告指南里写:

「Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student.」(我们的 AI 写作检测模型可能不总是准确的,它可能误判人类写的、AI 生成的和 AI 改写的文本,因此不应作为对学生采取不利行动的唯一依据。)

同一页的下一句:

「It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred.」(需要进一步的审查和人工判断,结合机构对其特定学术政策的执行,才能确定是否发生了学术不端。)

另一篇报告审阅指南用不同的措辞讲了同一点:

「It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy.」(它不是要在孤立状态下给出确定答案。比任何工具都重要的是看到分数的教育者,由他们平衡这些信息与对学生及其作业的个人了解以及机构政策来做出决定。)

再下一句:

「When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended.」(当教育者将 AI 写作分数视为单一数据点而非确定结论来使用时,工具就是在按预期方式被使用。)

这些都是 Turnitin 自己的话,不是我们的意见。造检测器的公司在告诉用它的人:分数是一个数据点,不是结论。如果你的学校把 100% 当作铁证,那它正在以一种 Turnitin 自己说不该这么用的方式使用这个工具。

被判了 100%,怎么办

查文档长度。 如果提交只有几百词,F9 描述的 all-or-nothing 行为是最可能的解释。分数反映的是单片段预测的局限,不是对你写作过程的判定。

查你的文本是否匹配误报特征。 结构变化少、字面自我重复、只改写不创新,是 Turnitin 自己点名的那三类。如果你占了其一,官方的建议是在读百分比时把这层考虑进去。这是一句可以带进谈话里的引用。

问报告是什么时候生成的。 2023 年 5 月,Turnitin 改了检测逻辑来减少文档首尾几句的误报,那里曾经有更高的误报率。修复记录在他们的发布说明里。如果报告早于那次修复,它可能反映一个已经处理掉的问题。2024 年 7 月之前生成的报告还可能在 1 到 19 区间显示数字,而现在的报告只显示星号。旧报告和新报告行为不同,日期很重要。

带上写作过程的证据。 版本历史、带时间戳的草稿文件、显示研究活动的浏览器历史。这些不是关于分数的论证,它们是 Turnitin 说的应该伴随分数的「进一步的审查和人工判断」。

引用 Turnitin 自己的话。 「should not be used as the sole basis for adverse actions against a student」(不应作为对学生采取不利行动的唯一依据)这句话出现在三份 Turnitin 文档里。「a single data point rather than a definitive response」(一个数据点而非确定结论)是 Turnitin 说工具应该怎么被使用的方式。这些不是观点,是制造商写的操作说明。

我们怎么看这件事

HumanPen 是一个文档改写工具。这里相关的设计决定是:我们在片段层面改写,不在分数层面操作。我们不去动一个看不见的分数。我们取出 AI 写作报告标出来的那些片段,改的是那些片段里实际的语言,文档其余部分一个字不动。计费只算被改写掉的词,如果拿改完的稿子重新测、报告仍在 20% 或以上,对标出的片段重跑是免费的。

我们不会告诉你下一份报告上会写什么。我们不做检测分数的预测。我们做的事情比这窄:改写报告标出的那些片段里的具体语言,保留周围的结构、引用和排版。

常见问题

Turnitin 会不会在 100% 上判错? 会。Turnitin 自己的 FAQ 说短文档会触发 all-or-nothing 式的预测,而结构变化少或紧密改写的文本更容易被误判。100% 分数是片段级分类的汇总,在短文档上可能只有一个片段。

100% 是不是说明 Turnitin 很确定? 不是。百分比是一个分类器对重叠片段打分、池化后汇总出来的输出。在只有单片段的文档上,一个高概率片段就是全部的分数。Turnitin 说分数「should not be used as the sole basis for adverse actions against a student」(不应作为对学生采取不利行动的唯一依据),并且是「a single data point rather than a definitive response」(一个数据点而非确定结论)。

为什么我的短文拿了 100%,长论文却没有? 长文档有更多重叠片段,分数跨窗口池化,单个像 AI 的片段被稀释了。短文档只有一个片段,没有重叠,没有稀释。这是打分流水线的机制属性,不是对你写作的判断。

我用了 Grammarly 会怎样? Turnitin 的 FAQ 说,Grammarly 的拼写、语法和标点修改「在多数情况下」不会被标记为 AI。但 Grammarly 的生成功能(起草、改写、摘要)属于另一类,由这些功能产生的内容「will likely be flagged as AI-generated」(很可能被标记为 AI 生成)。

我能不能把 Turnitin 自己的话拿来用? 可以。「分数不应作为唯一依据」这句话出现在三份 Turnitin 文档里。「分数是一个数据点」这句话在他们的审阅指南里。这些是制造商写的操作说明,在讨论分数意味着什么时是相关的。

继续阅读