Turnitin 的 AI 率有多大误差范围?我们数了 46,712 字符
报告回来是 43%,第一个念头是「43 上下浮动多少」。定义这份报告的三个厂商页面都没有公布答案。这个空白不只在某一页 FAQ 里,三页都一样。它们公布的是另外三样东西:一个单向的例子、一段被隐去数字的区间、以及一段机制描述,而真正的浮动就藏在那段机制里。
HumanPen 团队
· 13 分钟
Turnitin 的 AI 率有多大误差范围?
没有公布过。定义 AI 写作报告的三个页面,2026 年 8 月 28 日读取,渲染后正文合计 46,712 字符,`interval`、`margin`、`standard deviation`、`uncertain`、`precision`、`variance`、`error bar`、`plus or minus`、`±`、`estimat` 这些词加起来命中 0 次。量具是活的:同一份语料里 `percentage` 命中 47 次、`false positive` 命中 21 次。厂商确实公布了三个数字,经常被当成误差范围,但它们一个都不是。
这个"没有"本身就是有用的结论,不是抱怨。它告诉你哪个问题该停止追问,以及关于你报告上那个数字,真正有答案的是哪两个问题。
站上有两篇邻近的,方向不同,这一篇不重复:Turnitin 的误报率,讲清楚讲的是"判定"这个是非题的出错率;当一所大学一年交上去 75,000 篇论文,1% 的误判率意味着什么讲的是这个比率放到一所学校的年提交量上是什么规模。这一篇问的是数字本身:它在估计什么,以及它能偏多少。
清点结果,附分母
三个页面,2026 年 8 月 28 日在浏览器里登出态读取,量的是 `document.querySelector('article').innerText`,不是整页 body。body 会多出约 725 字符的导航和页脚,把分母撑大却不增加任何相关文本。字符数分别是:Using the AI Writing Report 6,492;AI writing detection capabilities FAQs 30,987(页面自己标着 "Updated 9 days ago");AI writing detection model 更新说明 9,233。合计 46,712。
| 检索词 | 报告页 | FAQ | 更新说明 | 合计 |
|---|---|---|---|---|
| `interval` | 0 | 0 | 0 | 0 |
| `margin` | 0 | 0 | 0 | 0 |
| `standard deviation` | 0 | 0 | 0 | 0 |
| `uncertain` | 0 | 0 | 0 | 0 |
| `precision` | 0 | 0 | 0 | 0 |
| `variance` | 0 | 0 | 0 | 0 |
| `error bar` | 0 | 0 | 0 | 0 |
| `plus or minus` 与 `±` | 0 | 0 | 0 | 0 |
| `estimat` | 0 | 0 | 0 | 0 |
| `percentage`(对照) | 10 | 31 | 6 | 47 |
| `false positive`(对照) | 2 | 12 | 7 | 21 |
| `qualifying text`(对照) | 6 | 4 | 3 | 13 |
| `segment`(对照) | 0 | 9 | 1 | 10 |
| `reliab`(对照) | 2 | 3 | 0 | 5 |
| `probabilit`(对照) | 0 | 4 | 0 | 4 |
对照那几行不是凑数的。一整列零如果没有对照就一文不值。检索要是断了、页面要是没渲染完,`percentage` 也会是零。它回来的是 47。
有两个"差一点"的命中值得原样印出来,因为草率一读就会被当成发现。`confidence` 在整份语料里恰好命中一次,而且不是统计意义上的:"While Turnitin has confidence in its model, Turnitin does not make a determination of misconduct."。`precise` 也恰好一次,出现在 2023 年一条关于切分边界的更新说明里。两者都不是离散程度的度量。你要是复算时撞到这两处,先把句子读完再决定它算不算。
而且这句话是双向的。"厂商没有公布误差范围"是关于这几个页面在这个日期的事实。它不能推出模型内部没有自己的置信度,下面那节机制描述明说它算了一个;它同样不能被任何人反过来用作"这个数字很精确"的依据。它的意思是这个问题在查过的页面上没有答案,而"没有答案"和"答案是某一边"是两回事。
被误当成误差范围的三个数字
文档对"错误"不是只字不提,它只是对这一种错误只字不提。有三个公布过的数字经常被拉来当误差范围,一个都不合适。
- 1% 以下的误报率目标。 它写明的适用范围是 "documents with over 20% of AI writing",讲的是一份纯人写的文档有多大概率被标出来。那是一个判定在群体上的出错率,不是你那个 43 上下的一条带子。
- "50% 可能其实是 65%" 那个例子。 这个最接近,下一节专讲它。它是单向的,而且讲的是漏检的 AI 文本,不是显示出来的数字偏高。
- 1%–19% 被隐去的那段区间。 低于 20% 阈值不显示任何数字。这是厂商对"哪一段读数不适合展示"的表态,信息量不小,但一条隐藏规则同样不是误差范围。
这份清单里缺的正是你需要的那一样:任何形如"得分 X 的文档通常落在 Y 到 Z 之间"的陈述。46,712 字符里没有一句是这个形状。所以"43% 上下浮动多少"没有这三个一手来源支持的答案。谁给出一条范围,就该同时给出另一个一手出处。
最接近误差范围的例子指向哪边
我们找到的、最接近误差范围的一段文字,量化了报告上的数字可能离真实情况多远,而且它只指向一边。
"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing."
请注意读它的形状,形状比数字重要。它说的是:真实的 AI 文本量可能高于显示出来的数字。它没有说反过来。这次清点没有在那三个页面上找到反方向的配套范围。更新说明里唯一一次 `up to` 讲的是最多支持 30,000 词,不是百分比。
这就是这段话能够支持的全部不对称。它解释了例子为什么指向上方:系统为了减少误报,接受漏掉一部分 AI 文本。但它没有告诉我们,单份报告里的高分或低分各有多大证据分量。查过的页面没有公布校准曲线、似然比或结合基础率的度量,且同一份 FAQ 明确说这个百分比不应成为采取行动的唯一依据。
如果这篇论文从头到尾是你亲手完成的、你认为这个数字错了,上面这一段帮不上忙。它不是误差范围,它是一份关于系统往哪边错的披露。真正能帮上忙的材料在另一处:Turnitin 的误报率,讲清楚整理了厂商自己在误报上的表态。
浮动到底藏在哪一步
FAQ 写出了计分顺序。读完它,你能看见一个不确定度本来会出现在哪一步、又是在哪一步从公开说明里消失的。
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."
四步,而连续量在第一步就存在:每个切片拿到一个 0 到 1 之间的值;句子继承它;重叠部分的多个分数被合并;句子分数再聚合成整篇的数字。0.51 和 0.99 是两种差别极大的把握程度,而等它们走到你的报告上时,两者都已经变成同一个整数百分比的一部分。
那三个页面没有写出合并规则、聚合规则,也没有交代汇总之后,句子要跨过哪条线才会被标出来。从模型的不确定度到你导师看到的那个数字之间,隔着三个没有说明的函数。这比单摆一列零,更准确地说明了公开信息里缺了什么。
这些都不会让那个数字变得没有意义。它是模型对「合格文本中可能由 AI 生成的比例」作出的估计。没有公开的合并规则、聚合规则和误差范围,会限制我们能从这个估计推出什么,但不会抹掉厂商给它定义的单位。于是 43% 更谨慎的读法是「模型估计合格文本中有 43% 可能由 AI 生成」,而不是「整份文档每一个字里有 43% 是 AI 写的,而且误差已知」。
官方写明的短文档例外
官方材料只支持一条很窄的长度提醒,不支持用文档词数推算分数分辨率的一般规律。
FAQ 写的是:"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."。这是厂商明确写出的单切片短文档情形。查过的页面没有公布文档变长时,分数分辨率如何变化的一般函数。
所以拿到报告时,不要编一个误差范围,而要补上报告语境:多少合格文本进入了估计,这是不是厂商明确警告过的「几百词、单切片」情形。不要再把这条短文档提醒外推成 8,000 词章节的未知规律。短文档的「全有或全无」:为什么几百词的稿子分数会走极端讲的是官方写明的短文档情形,Turnitin AI 检测中的"合格文本"是什么?详解讲的是哪些内容根本进不了分母。
厂商自己不再显示数字的那一段
有一个位置,Turnitin 实际上已经承认读数不够稳,而它承认的方式是把数字拿掉。
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed."
两点值得带走。第一,星号不是把一个低分藏起来不给你看,而是厂商不给出分数,并且连标红也没有;报告没有留下任何可供指认的具体段落。第二,这是三个页面里最清楚的一处:厂商因为误报风险而不显示自己的一段输出。它是我们找到的、最接近"不确定度披露"的东西,而它的形态是一条规则,不是一个数字。Turnitin AI 报告上的星号 (*%) 是什么意思?讲的就是这个显示到底代表什么。
一个不带不确定度的数字该怎么读
把上面所有内容过一遍之后,还能拿去用的是这些。
- 别再要误差范围,改要分母。这个数字是在多少句合格文本上算出来的?按厂商自己的描述,几百词意味着接近二值的输出。
- 记住已公布例子的方向。报告 50 可能实际 65。这次清点没有在三个页面里找到反方向的范围。
- 把星号当作"未给出分数",不是"分数很低"。没有分数,也没有标红。
- 不要把合格文本的估计比例换算成你有多少段有问题。它是在切片上做未公开的合并与聚合之后的产物,不是一个你能一一对应找出来的句子计数。
- 不要替跨稿变化赋予厂商没有定义的显著性。查过的页面没有公布「变化几个百分点算显著」。把每份报告的合格文本语境和标红与数字放在一起看。
- 别人拿数字压你时,用厂商自己的说法。它的 FAQ 写着这个百分比 "should not be used as the sole basis for action or a definitive grading measure by instructors",也写着它的模型 "may not always be accurate"。
如果有人给你一个 Turnitin AI 率的置信区间,问他从哪儿来的。按上面的证据,不是从 Turnitin 来的。
如果确实有几段要改
上面全是在讲怎么读报告,不是讲拿它做什么,这两件事得分开。但有一个实际后果直接来自前面的清点问题,值得说出来:一个没有公开不确定度的百分比,追着它跑等于追一个没有定义清楚的靶。标红是有定义的靶。它们是你能盯着看的、具体的几段文字。
这也正是 HumanPen(由我们开发,下面只是一方说明)把「导入报告」而不是「输入数字」当作入口的原因。把手上那份 AI 写作报告交上去,被标出来的那几段就成了这次任务的边界;边界在屏幕上由你确认,只有确认过的段落会被改写,其余文字保持不变。这说的是改写范围,不是对上传、传输或存储方式的承诺。之所以宁可这样也不整篇跑一遍,理由不是数字会更好看,那个谁都不能保证。每改一段,你就多出一段要在交稿前拿回来源核对。范围越小,最后要核的地方越少。如果你交出去的就是这份文件本身,改写工具会把引用、表格和公式改成什么样?讲的是改完之后该验哪几样。
还有一句该说的,其实这一页写到这里已经在铺垫了:下一个数字会是多少,没有人能提前告诉你,包括我们。而这篇稿子要是你自己一个字一个字写出来的,上面这些都用不上。那时该做的是拿证据和过程说话,不是动文字。
常见问题
Turnitin 公布过 AI 百分比的误差范围吗? 定义这份报告的三个页面上没有。2026 年 8 月 28 日读取的 46,712 字符里,`interval`、`margin`、`standard deviation`、`uncertain`、`precision`、`variance`、`error bar`、`plus or minus`、`±`、`estimat` 全部为零,而同一份文本里 `percentage` 命中 47 次、`false positive` 命中 21 次。
43% 就是我整篇论文的 43% 吗? 它是模型对「合格文本中有 43% 可能由 AI 生成」作出的估计,不一定等于整份提交的 43%。合并规则、聚合规则和误差范围都没有公布,所以你不能把它逐段对应到肉眼可见的文章部分。
实际的 AI 文本会不会比显示的多? 厂商直接这么说过,还给了自己的例子:识别出 50%,文档 "could contain as much as 65% AI writing"。这个例子指向上方。这次清点没有在三个页面里找到反方向的范围。
为什么一篇短文章分数会走极端? 因为可能只有一个切片。FAQ 写着在几百词的文档里预测 "mostly 'all or nothing'",混合文本因此可能被整段标成 AI 生成。
为什么我的报告显示星号而不是数字? 低于 20% 阈值时厂商不给出分数也不给标红,改为显示 `*%`,理由写的是避免误报的可能。
分数高或低能不能证明是谁写的? 不能。厂商的例子说明显示比例可能低估 AI 文本,但查过的页面没有公布把单份百分比换算成证据分量所需的校准和基础率信息。厂商也明确说,这个百分比不应成为采取行动的唯一依据。
继续阅读