改掉一句被标红的话,AI 率会掉「一句的量」吗

关于 Turnitin 那个 AI 百分比是怎么算出来的,流传着几种说法,都让它看上去像一道加法。每一种都能追回一份具体的文件,而每一份文件说的,都比建在它上面的那条建议要少。

HumanPen 团队

· 22 分钟

先说结论

不会。一个句子身上背的那个分,不是它自己单独挣来的,所以「修好几句」和「掉几个百分点」之间没有兑换率。Turnitin 公开的说法是:句子被抽出来,切进互相重叠的片段,每个片段拿一个 0 到 1 的分,而片段里的句子继承它所在的每一个片段的分——也就是说,一个靠近片段边界的句子,身上不止一个分,之后被合并成一个。这段描述点了三个动作:继承、合并、汇总,三个都没有公布过,所以没有办法从里面读出某一句究竟占了多少。眼下有三种关于这道计算的具体说法在流通,三种都是加法。每一种都能追到一份文件,而每一次,那份文件说的都比建在它上面的说法要少。

三种都在下面,每一种旁边放着它的那份文件。机制本身,以及顺着机制推出来的手工改法,我们另写了一篇:不用工具手工降 AI 率

说法一:「报告在句子这一层是二元的」

一家论文校对公司的「怎么降低 AI 分」指南上这样写,2026 年 8 月 18 日取件,逐字:

"There is no colour scale like the similarity report. The AI report is binary at the sentence level: each sentence is either flagged or not flagged. The overall percentage is simply the proportion of flagged text across the whole document."(不像相似度报告那样有色阶。AI 报告在句子这一层是二元的:每个句子要么被标红,要么没有。总百分比就是全文中被标红文字所占的比例。)

作为对你手上那份报告长什么样的描述,前半句是对的。一个句子要么被高亮要么没有,画面上确实没有深浅之分。它写错的是高亮背后那件事。Turnitin 自己的说法是:

"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score."(这些片段中的每一个合格句子,继承该片段的分数。由于片段互相重叠,有些句子会有多个分数,之后被合并成一个分数。)

所以那个句子并没有自己挣到一个判决。它继承了一个概率,可能是两个,来自包含着它的邻居的文本块。高亮是一个阈值的画法,不是这个数字赖以算出来的量。

那段引文的最后一个分句另有问题。「全文中被标红文字所占的比例」,并不是 Turnitin 所说的那个百分比的分母。分析只覆盖它所谓的合格文本,也就是按标准语法句子写成的文本块,列表和项目符号被排除在外;而 Turnitin 由此给出的结论是 "this percentage is not necessarily the percentage of the entire submission"(这个百分比未必是整份提交内容的占比)。如果你的文件有三分之一是表格、项目符号和参考文献列表,那么分母就不是你的文档。这一点我们在怎么读一份 Turnitin AI 检测报告里拆过。

建在这条描述上的建议长什么样:数一数被高亮的句子,除一下,算出你得修好几句。在公开的那段描述之下,这道算术没有对应的对象,因为高亮的条数和那个百分比,不是同一个量的两种看法。

说法二:「所有片段分数的平均」

来自一家降 AI 工具厂商的指南,它在讲机制时把 Turnitin 自己的帮助中心列为出处。2026 年 8 月 18 日取件,逐字:

"The model calculates an overall prediction based on the average of all segment scores, producing the percentage displayed in the AI writing indicator."(模型基于所有片段分数的平均值计算出一个总体预测,产生 AI 写作指标上显示的那个百分比。)

这一条离得近多了,近到值得把差在哪儿说准。公开的那句是:

"These sentence scores are further aggregated and used to compute the overall document AI writing score."(这些句子分数被进一步汇总,用于计算文档级的 AI 写作总分。)

是句子分数,不是片段分数。片段分是一个中间值,句子从它那里继承,有时继承两次;被拿去汇总的,是合并之后出来的东西。

这两种算法会不会落在不同的数上,我们没法告诉你,因为 Turnitin 既没有公布合并的算法,也没有公布汇总的算法。不同的是这个运算作用在什么上面,而这一半正是一份修改计划所依赖的。按「对片段取平均」来理解,每个片段不论装了几个句子都占同样的权重,而每个句子恰好待在一个片段里。这两条,公开的那段描述都没有这么说。

说法三:「每段的第一句和最后一句都重写一遍」

第三种说法跳过了机制,直接以一条指令的形式出现:把每一段的开头句和结尾句重写,因为开头和结尾最容易被标红。

它背后确实有一份文件。在一条日期为 2023 年 5 月 24 日的更新说明里,小标题是 "Improvements in detection at the start and end of documents"(文档开头与结尾处检测的改进),Turnitin 写道:

"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives."(自上线以来,我们观察到文档开头几句或结尾几句出现误报的比例更高。这些句子很多时候是写得比较泛的引言或结论内容。因此,我们已经修改了检测逻辑,以帮助减少这类误报。)

从这段里该拿走三件事,按被丢掉的频率排。

它说的是一份文档的开头和结尾,不是每一个段落的。这条建议一路往下搬了两级结构。

它是一份修复公告。第三句才是公告本身。把前两句当成检测器现在怎么运作的描述来引用,等于拿一份缺陷报告当规格书用。

而且这条说明后面还有一句:"We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version."(我们还改进了片段边界检测的精度,这在少数情况下可能导致边界与上一版本相比发生变化。)边界移动过。哪一句落在哪个片段里,是一个跟着版本走的实现细节,不是可以拿来做计划的东西。

如果你正在为一场学术不端的谈话做准备,不要把这条更新说明带进去。坐在你对面的人也会读第三句。你能合理地说出口的那句更窄,也更站得住:厂商曾因误报而修改过模型,这不是一个可以被当作定论证据来对待的东西该有的样子。

三种说法的共同点

它们每一条只要成立,你就能算出单独一个句子值多少。吸引力就在这儿。一份修改计划需要一个进度单位,而公开材料里没有任何一处提供这个单位。

你也没法靠做实验把这个缺掉的数补回来,有两条写在文档里的原因。高于 0% 又低于 20% 的分数根本不显示——一个星号,没有高亮——所以从 19% 真的降到 4%,看上去和什么都没动一模一样。而且在大多数配置里,那个指标本来就不归你看:Turnitin 说学生看不到这个指标,也看不到那份报告;能把它交到你手上的,是有权把报告下载成 PDF 的教师。

有一种情形确实接近加法,而它恰恰是你最不想要的那种。当一份提交只有几百词时,只存在单个片段,没有重叠的机会,于是按 Turnitin 自己的说法,预测基本是全有或全无——因此混合了 AI 生成内容与原创内容的文本,可能被整篇报成 AI 生成。那不是精细控制。那是一个开关。

这会改变你今晚怎么安排

  1. 在照着某条「该改哪些句子」的规则动手之前,先找到它出自哪份文件。 上面三条都有。三次里那份文件说的都比规则少,而这个差距,大约五分钟的阅读就能看见。
  2. 从你手上真有的高亮出发。 如果一份报告标出了具体的段落,那些是带着证据的。而一条关于位置的规则,背后的证据是 2023 年的一份更新说明。
  3. 数你要重新校对一遍的段落,不是你要改的段落。 你动过的每一段,都是你要重读一遍、去看引用有没有断、论断有没有漂、数字有没有跑掉的段落。一份要动学位论文里每一段的计划,等于悄悄给自己造了一份和论文一样大的校对工作。
  4. 把你开头那个文件留着。 原稿和中间几版草稿才是这件事里有证据价值的部分,而且不管那个数字怎么变,它们的价值都在。具体怎么留,见怎么留住版本历史

我们做的这个工具,以及它给不了你的那个数

HumanPen 接收 PDF 形式的 AI 检测报告,按它标出来的片段干活。它有一条规则和这篇有关:改写的最小处理单位是段落,所以只覆盖某段一部分的选择,会在任务开跑之前被补齐成整段。

这条规则不是关于计分的主张。它之所以存在,是因为高亮可以从半句话中间开始,而照着高亮的字符原样改写,交回给你的会是一个由两个人写的段落——前半段一个语域,后半段还靠着前半段里没人动过的那些说法在支撑。一次改写需要覆盖多大的范围才动得了那个分,Turnitin 没有公布过,我们在外面也没有条件把它算出来。

我们给不了你的是那个兑换率,别的东西也给不了。一个能给你预测百分比的工具,给的是一个它手上并没有的数。

常见问题

如果一个句子被高亮了,把它删掉,是不是就减掉了它那一份分? 不能这么指望。高亮反映的是这个句子从周围片段那里继承来的分,而删掉文字会改变片段本身。文档那个数是合并后的句子分数的汇总,不是被高亮句子的加总。

那如果我改写一整段,分数会按同样的量往下掉吗? 没有公开过的量,段落和句子一样没有。公开的是片段互相重叠,所以任何一处文字会发生什么,取决于它两边的文字。

为什么高亮的量和那个百分比对不上? 因为百分比只在合格散文上计算,而 Turnitin 说,混合了多种写作类型的文档 "would result in a disparity between the percentage and the highlights"(会导致百分比与高亮之间出现落差)。

每段的第一句和最后一句真的更容易被标红吗? 这个说法的源头讲的是一份文档的开头几句和结尾几句,讲于 2023 年,而且在同一条说明里就宣布了修改检测逻辑来减少这种情况。它不是对当前行为的描述,也不能拿来当申辩材料。

我能自己测一测改动的效果吗? 通常不能。20% 以下只显示一个星号,没有数字也没有高亮;而在大多数配置里,这个指标是给教师和管理员看的,不是给你看的。

---

继续阅读