Turnitin 报告显示 100% AI,是怎么来的
100% 不是"比 60% 更确定"的版本。按 Turnitin 自己公布的计分方式,两个极端恰恰是这套计算最没得可平均的地方。
HumanPen 团队
· 17 分钟
先做三个检查,再谈原理
能产生 100 的情形里,"你写的每一句都像机器写的"排在很后面。前面三种十分钟内就能排除。第一,先确认手上这个数字是哪一个:Turnitin 说 AI 写作指标对学生不可见,所以你自己在自己的界面里点出来的百分比,是相似度而不是 AI 率。第二,看文档里有多少散文:Turnitin 说几百词的短文档,预测会"mostly 'all or nothing'"(基本上非全即无),因为它是在单个片段上做预测,没有重叠的机会。第三,问清楚这个 100 是"什么的 100%":百分比是在合格文本上算的,而 Turnitin 明写这个数字 "is not necessarily the percentage of the entire submission."(未必是整份提交内容的比例。)三条都排除掉,再去问模型在文字本身里看到了什么。
这三种情况要做的事完全不同,所以顺序比原理更要紧。这一页讲的是一个极端数字是怎么被算出来的。它不是拿去开会的稿子,也不预测下一份报告会是多少。
先分清手上这个 100 是哪一个
谁能看到 AI 率,Turnitin 写得很清楚。它的说明里写着 "only instructors and administrators are able to see the indicator"(只有教师和管理员能看到该指标),另一处写着 "The AI writing detection indicator and report are not visible to students."(AI 写作检测指标与报告对学生不可见。)紧接着的下一句同样重要:"However, with the PDF download feature, instructors can download and share the AI report with students."(不过教师可以用 PDF 下载功能把 AI 报告下载下来分享给学生。)所以两条路都存在:别人发给你的一份 PDF,确实可能就是 AI 报告;而你自己在提交界面里点进去看到的那个百分比,不是 AI 指标。
那就剩下另一个数字了,而 100 在那一边是个平常得多的值。相似度 100% 有一条有据可查、且完全无辜的成因:你自己更早的草稿被另一份作业收进了库,和终稿几乎逐字相同。这条路什么时候成立、什么时候不成立,我们在早先的草稿会和我的重交稿撞车吗里追过一遍。两份报告是两套独立的分析,高低四种组合都可能出现,那是Turnitin AI 写作报告与相似度报告有什么区别那篇的主题。
相似度那边的 100 和 AI 那边的 100 是两个结论,成因不同,该做的事也不同。把一晚上花在错的那个上面,是这件事最常见的坏走向。
短文档本来就是非全即无地打分
Turnitin 公布的计分过程有三步:先把句子抽出来、切成互相重叠的片段,每个片段拿到一个 0 到 1 之间的概率值,然后每一个合格句子继承它所在片段的分数。因为片段互相重叠,靠近边界的句子会带着不止一个分数,这些分数再被池化成一个。被池化后的句子分数才汇总成文档层面的那个数字。正是这一层层的平均,让一份文档可能落在 43 而不是落在两端。
现在把这层平均拿掉。Turnitin 的 FAQ 写了没得平均时会怎样:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."(在只有几百词的较短文档里,预测基本上是非全即无的,因为我们是在单个片段上做预测,没有重叠的机会。这意味着一段混合了 AI 生成内容与原创内容的文字,可能被整体标记为完全由 AI 生成。)
把这段读成"分辨率"的问题,而不是"准不准"的问题。在一份长文档里,100 意味着大量彼此独立的预测全都落在了同一侧。在一份几百词的文档里,它可能只意味着一次预测,然后界面把它渲染成了一个百分比。两者在屏幕上长得一模一样,作为证据却不是一回事——而那段引文的第二句直接说了,被整体扫进去的正是混合内容。
这底下还有一条地板:提交内容必须包含至少 300 词的长文格式散文,才会生成 AI 报告。也就是说,能拿到数字的最短的那种文件,恰恰也是数字建立在最少几次独立观测上的那种,而刚过地板的那一段区间正是两件事重叠的地方。一篇 900 词的反思作业、一份简短的实验记录、一份为凑长度而扩写的会议摘要,都落在 Turnitin 描述的这个区间里。另一头会怎样——学位论文长到一份报告覆盖不完——写在Turnitin 能查一整篇学位论文吗。
到底是"什么的 100%"
这个百分比不是在你的文档上算的,而是在 Turnitin 所说的合格文本上算的,而这个定义很窄:"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures."(合格文本只包含散文句子,也就是说我们只分析由标准语法句子构成的文本块,不包含列表、项目符号这类短的非句子结构,以及其它非句子结构。)紧跟着的那一句才是要记住的:"This percentage is not necessarily the percentage of the entire submission."(这个百分比未必是整份提交内容的比例。)
有些排除项是另外说明的。Turnitin 的更新说明里记着,参考书目中的引用条目曾被误标为 AI 写作,这个 bug 已修,并且 "Bibliographies are now excluded when processing the AI writing report."(生成 AI 写作报告时,参考书目现已被排除。)另一条则写着 "We are now able to process long-form prose text in tables."(我们现在能够处理表格中的长文散文。)这两条的下一句是同一件事:要重新提交才会重新处理,别默认这些改动对你已经交上去的那一份自动生效。所以参考文献列表在计算之外,而表格里的成段文字在计算之内——这两条多数人的直觉都是反的。
拿一份真实的文件套进去。一份 5,000 词的实验报告,带一张方法表、三段规程的项目符号、一个附录和 60 条参考文献,真正合格的可能只有 2,000 词。这份报告上的 100,说的是那 2,000 词。它没有对另外 3,000 词说任何话——那部分从未被评估,也就既不能拿这个数字去指控,也不能拿它去辩护。
这也是为什么 100 可以和"整页整页没有任何高亮"同时存在。Turnitin 说包含多种写作类型的文档"would result in a disparity between the percentage and the highlights"(会导致百分比与高亮不一致)。在分数的顶端,这种不一致看起来像自相矛盾,其实是预期行为。
数高亮行数再去对百分比不会有结果,因为两者算的根本不是同一样东西。报告的其它状态各是什么意思,在怎么读一份 Turnitin AI 检测报告里逐条走过。
文档很长,分数还是顶到头
如果文件是 8,000 词连续散文,单片段那条解释就用不上了:确实是大量彼此独立的预测都落到了同一侧。问题于是变成——什么样的东西会让一整份文档从头到尾在模型眼里长得一样。Turnitin 公布过一个不完整的答案,形式是它自己列出的、容易出现误判的文本特征:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(误判有时会出现在这几类内容上:结构变化不多的内容、字面上自我重复的文字、以及只做了改写而没有产生新想法的文字。如果我们的指标在这类文本上显示出较高的 AI 写作占比,我们建议在看待所显示的百分比时把这一点考虑进去。)
这三条特征都是整份文档层面的性质,不是单个句子的性质。这是我们的读法,不是 Turnitin 的主张,但它正好对得上问题的形状:一篇按规定章节顺序写的论文,处在一个方法段落有固定说法的学科里,摘要里陈述一遍研究目的、引言里再陈述一遍、讨论里又陈述一遍——它在每个片段里的气质都差不多,没有哪一段与邻居差异大到能把汇总值拉下来。整齐不是写作缺陷,在好几类文体里它就是要求,这也正是为什么这种结果很难靠指着某一段来反驳。
那段引文的第二句是厂商对读分数的人说的话,不是你可以拿来构造的辩词。真正影响过决定的是另一回事,我们从公开裁决案例里整理在明明是你自己写的却被标了。如果改是合适且被允许的,那三条特征也是最接近"手改说明书"的东西,做法在不用工具,怎么把 AI 味改掉。
一个 100 定不了的事
在你打算论证"这个数字被夸大了"之前,有件事值得先知道:厂商公布的取舍方向正好相反。Turnitin 说 "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document."(为了维持这个 1% 的低误判率,我们有可能漏掉文档里的一部分 AI 文本。)并给出了误差的方向:"if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing."(如果我们判定一份文档中有 50% 可能由 AI 工具写成,它实际可能含有多达 65% 的 AI 写作。)不管这份报告出了什么问题,"这工具被设计成倾向于多报"都不是厂商描述的那个设计。
但这也不等于一个 100 就是结论。Turnitin 在三处帮助文档里写着,其模型可能误判人写的、AI 生成的和 AI 改写过的文本,不应作为对学生采取不利行动的唯一依据。而人们互相引用的那个准确率数字带着一个在流传中掉了的限定,我们在1% 误判率到底意味着什么里拆过。另外,没有任何公开的阈值规定多少算学术不端,两个方向都没有:界面里那个 20 是显示规则而不是关于你的规则,见20% 的 AI 率算高吗。
如果确实是你写的,第一步就去改写是走错方向。它把讨论的对象换掉了,而且回答的是没有人问的问题。
改写工具在哪儿有用,以及 100 为什么让它没用
有句话得直说,因为它对我们自己不利:到了 100,HumanPen 平时最值钱的那个能力没东西可咬。把文档连同 Turnitin 或 iThenticate 的报告一起传上去,只有报告里被标出的片段会被改写,其余内容一字不动,并且只按改写部分计费。在 30% 的时候这是实打实的节省——三分之二的文件既不被碰也不被计费。到了 100%,报告把能标的都标了,范围就是整份文档,成本就是跑一遍全文。如果你指望报告能帮你把工作量圈小,100 恰恰是那个圈不小的数字。
如果新报告仍有符合条件的标记片段,可以免费继续降 AI。
这些都不是对检测结果的承诺,我们也不会做这种承诺。没有任何工具能告诉你,未来某个版本的模型在一份它没见过的文档上会输出什么;凡是承诺一个保证分数的,都是在承诺它控制不了的东西。还有些情况根本不该用这类工具:如果你的立场是这份东西就是你写的,那要处理的对象就不是那个数字。
常见问题
100% 是不是说我写的每一句都被标了? 不是。百分比是在合格文本上算的,列表、项目符号和其它非句子结构不参与计算,而 Turnitin 明说这个数字未必是整份提交内容的比例。一份含大量表格、列表和参考文献的文件,完全可能显示 100%,同时有很大一部分从未被评估。
我的文章只有 600 词,是不是这个原因? 这是第一个该查的。Turnitin 自己的说法是,几百词的文档里预测基本上是"非全即无"的,因为它在单个片段上做预测、没有重叠的机会,因此混合了 AI 生成内容与原创内容的文字可能被整体标记为完全由 AI 生成。
我是在自己的 Turnitin 界面里看到这个数字的,那是 AI 率吗? 几乎可以确定不是。Turnitin 说只有教师和管理员能看到 AI 指标、该指标对学生不可见,不过教师可以把 AI 报告下载成 PDF 分享给学生。你自己点出来的百分比是相似度,而相似度有它自己走到 100 的平常路径。
有没有工具能保证下一份报告更低? 没有,看到这种保证反而要警惕。检测器的版本会变,厂商之外没有人能对一个还没跑过的模型版本的输出打包票。一项改写服务能定义的是范围和成本,不是分数。
继续阅读