词概率与 Turnitin:分类器实际在读什么

分类器从训练数据中学习词概率序列。我们拆解这对你的写作意味着什么。

HumanPen 团队

· 12 分钟

词概率意味着什么

句子中的每个词都有一个在特定语境下出现的概率。当你写"The experiment showed a significant"时,下一个词是"result"的可能性远高于"pineapple"。语言模型根据前文语境估计这些概率,Turnitin 的分类器也是如此,只是方式不同。

词概率指的是在给定前文的情况下,每个词的选择有多可预测。AI 文本生成模型倾向于选择最符合预期、统计上最常见的选项。人类写作者则往往选择不太可预测的词,比如不常见的动词、领域特定的名词,或者打破 AI 模型统计模式的表达方式。

Turnitin 直接声明其分类器被"trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers"。分类器不是在数关键词,而是将你选词的概率分布与它从训练数据中学到的模式进行比较,这些训练数据同时包含人类和 AI 文本。

这一点很重要,因为两段语法完美的文本在词概率上可能截然不同。人类作者可能引入一个意外的比喻,在学术句子中使用口语化表达,或者在 AI 会使用同义词的地方重复某个词。每个选择都会改变分类器读取的概率特征。

Turnitin 分类器读取什么

当论文提交到 Turnitin 时,流程从分段开始。句子被提取,分割成重叠的区段,每个区段由 AI 检测模型独立打分。每个区段获得一个 0 到 1 之间的值,代表文本是 AI 生成还是人类写作的概率。

Turnitin 清晰地描述了这个流程:"Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." 重叠区段中的句子继承区段分数,当一句话出现在多个重叠区段时,其分数被汇集成一个值。然后这些句子级分数聚合成整篇文档的 AI 写作总分。

这个流程的核心是一个基于 transformer 的模型。Turnitin 的架构文档指出:"Our current system uses a modern deep learning approach based on the transformer architecture." Transformer 读取各区段的词概率序列,学习哪些序列是人类写作的特征,哪些是 AI 生成的特征。

关键洞察是,分类器不是孤立地看单个词。它读取的是整个文本区段中的选词序列。一个不寻常的词不会大幅改变你的分数,但持续的低概率选词模式(人类写作者自然产生的模式)会被识别为人类写作。相反,持续的高概率、统计可预测的选择会被识别为 AI 风格。

这与困惑度的区别

许多关于 AI 检测的文章将"perplexity"作为核心指标。困惑度按定义是词概率的一种度量,它量化语言模型对给定词序列的惊讶程度。低困惑度意味着词是可预测的,高困惑度意味着并非如此。

这里有一个关键的细微差别。Turnitin 明确否认将困惑度作为命名指标来计算:"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." 他们继续说:"Instead, it learns statistical patterns from our training data."

那么 Turnitin 到底查不查困惑度?答案比是或否更微妙。困惑度是词概率的度量,Turnitin 的分类器确实基于词概率模式训练。但分类器并不计算单一困惑度分数并代入公式。Transformer 从训练数据中学习复杂的统计模式,这些模式包含词概率但不可简化为命名指标。

Turnitin 解释道:"As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules." 实际结论是说"Turnitin 检查困惑度"是一种过度简化。分类器整体性地学习词概率模式,这些模式影响每个区段分数,但不可简化为你能自行计算的公式。

2026 年 7 月的模型变更

2026 年 7 月,Turnitin 做了一项重要的架构变更。其文档确认:"In July 2026, we updated our model architecture to consolidate a multi-model ensemble into a single model. This update improves and simplifies the AI writing report, maintaining a less than 1% false positive rate."

在此变更之前,系统使用多个模型并将输出组合。多模型集成可能在分数聚合方式上引入复杂性,不同模型可能以不同方式权衡词概率模式。转向单一模型意味着分类器在训练中学到的词概率模式在整篇文档中被一致地应用。

假阳性率保持在 1% 以下,即每 100 篇完全人类写作的文档中,被错误标记为 AI 生成的不超过 1 篇。为了维持这个低比率,模型可能会让一些真正的 AI 文本未被检测到,这是我们将在下一节探讨的权衡。

这对你的写作选择意味着什么

理解分类器读取词概率序列后,我们可以得出几个实际的观察。

首先,高度打磨、公式化的写作往往看起来更像 AI。Turnitin 自己指出,假阳性通常涉及"content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." 当写作结构单一且使用常见、可预测的选词时,它可以类似于分类器与 AI 生成关联的高概率模式。

其次,带有真正个性的写作往往看起来更像人类。不寻常的用词、多变的句式和独创的表达创造了与人类作者身份关联的低概率序列。这不是要注入错误,而是要以反映真正个人声音而非统计平均值的方式表达想法。

第三,Turnitin 透明地表示一些 AI 文本会被漏检。他们声明:"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document." 他们给出了一个具体例子:"If we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." 如果你的文档被标记为中等百分比,实际 AI 文本比例可能更高。

这个校准差距有两个含义。对学生来说,假阳性虽罕见但有可能,尤其是在高度打磨或重复的学术写作中。对教师来说,报告的百分比应被视为保守估计而非精确测量。建议很明确:写出真正多变的用词和结构,理解分数反映的是概率评估而非确定性计数。试试这里

继续阅读