Turnitin 把我整章方法都标红了
该问的不是模型凭什么认定你第三章作弊,而是高亮为什么是连成一整块的、以及那个百分比究竟是什么的百分比。
HumanPen 团队
· 23 分钟
先说结论
因为分数不是一句一句落到你的句子上的。Turnitin 公布的做法是:把提交内容切成互相重叠的片段,每个片段拿到一个概率分,然后每一个合格句子继承它所在片段的分数。把一段两千词都保持同一种语域、同一批句式、同一套词汇的文字送进去,相邻片段之间就没什么可分歧的,高亮出来自然是一条带,而不是零星几处。方法与材料这一章恰恰是被要求这么写的,而 Turnitin 自己那份「误报容易出现在什么样的文本上」的说明里,有两条正好是这个文体按惯例必须具备的性质。这不等于那个数字是错的。它的意思是:铺满一整章的红不是对四十个句子作出的四十条独立判断,把它当成四十条来读,你会跑去修错的东西。
为什么它是连成一片的
人们描述的这个场面很具体,而且形状每次都一样。文献综述干干净净,讨论也干干净净,翻到方法这一章,高亮从标题下面第一句就开始,一直到这一章结束都没断过。那看起来不像模型挑出了几处可疑的句子,倒像它认定了一整章可疑。所以盯着它看的时候才格外难受。
分数是怎么走到一个句子上的,Turnitin 写在帮助文档里。值得读的是那段描述中间的两句,而不是别人转述出来的那个概括:
"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score."(这些片段内的每一个合格句子都继承其所属片段的分数。由于片段互相重叠,有些句子会带有多个分数,这些分数再被池化成一个。)
所以被分类的单位是一个文本窗口,不是一个句子。一个句子拿到什么分,取决于它跟谁挨着。接下来这句是我们的读法、不是 Turnitin 公布的内容:当连续的句子共享同一批窗口、而这些窗口彼此又长得差不多时,它们给出的分数就没什么理由分开,由这些分数渲染出来的高亮自然是连着的。一条带是一段匀质文字的预期呈现形式,不是一串独立结论的计数。
这一点有个很实际的后果。你方法章里第一个被标红的句子,未必是任何东西的起点——因为横跨小标题的那个片段里,装着上一节最后一段的文字。有人会花很长时间盯着第一个标红句,想弄明白这一句到底哪里不对。按公布的这套做法,它可能哪里都没有不对。
这也意味着人们本能想做的那个算术根本不存在。你没法拿一条带除以它的句子数,得到「每句值多少分」;也没法减掉一句,去预测会发生什么。这类算法最流行的三个版本,我们在改写一个被标红的句子,分数会掉吗里逐个拆过。
诚实的边界在这里:Turnitin 公布的是这条流水线的形状,没有公布池化函数、汇总方式,也没有公布片段长度。上面所有推论都只是「公布的描述意味着高亮会怎么分布」,谁都没法拿它去预测一个数字。
你的方法章里,究竟有多少内容进了计算
第二件要弄清的是分母,因为两份信息量相同的方法章,能送到模型面前的文字量可能天差地别。Turnitin 只分析它所说的合格文本:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures."(合格文本只包含散文句子,也就是说我们只分析由标准语法句子构成的文本块,不包含列表、项目符号这类短的非句子结构,以及其它非句子结构。)紧跟着的那一句才是这里最要紧的:"This percentage is not necessarily the percentage of the entire submission."(这个百分比未必是整份提交内容的比例。)
现在看看你这个学科实际上是怎么写这一节的。湿实验的操作规程写出来是编号步骤、一张试剂表、一份仪器清单加一个参数块。心理学或教育学的方法章写出来是连续的段落:被试、材料、流程、分析,每一部分都是成串的完整句子。在分析看来这是两份不同的提交,而回来一整片红的是后一种。
| 这一节是怎么排版的 | 有多少进入合格文本 | 那个百分比于是在说什么 |
|---|---|---|
| 编号步骤、参数表、设备清单、公式 | 很少,因为多数不是标准语法句子 | 主要是文件里别处的散文,不是这一节 |
| 用连续段落写的被试、材料与流程 | 基本上是全部 | 一个几乎全由常规程序性散文构成的样本 |
| 整段散文放在表格单元格里 | 会被处理。2023 年 8 月 9 日的一条更新说明写着模型已能处理表格中的长文散文,并同时写明已有的提交要重新提交才会重新处理 | 和普通段落一样。这一点会让那些出于别的原因把文字挪进表格的人意外 |
中间那一行底下藏着一个反直觉的结论。被排除在合格文本之外不是打折。被排除掉的是编号步骤和数值表格,而它们本来就不会长得像生成文本;留下来的恰恰是你写得最循规蹈矩的那部分。合格样本越窄,那个数字就越彻底地只在说你那几段程序性散文。
有一条排除是朝另一个方向走的,值得知道,因为它能消掉一个常见的虚惊:同一份 2023 年的更新说明记着,参考书目里的条目被标红曾经是一个 bug,该 bug 已修,生成 AI 写作报告时参考书目现已被排除,而含有被标红参考文献部分的提交需要重新提交才会重新处理。如果你手上是一份参考文献列表通红的旧报告,你看到的就是这件事。
数字和页面上高亮的量对不上,根源全在上面这些,而且 Turnitin 是直说的,不用你去推。怎么读一份 Turnitin AI 检测报告把这个落差走了一遍;Turnitin 能查一整篇学位论文吗讲的是撞到长度上限时会怎样——按章节提交的人正好住在那一带。
这个文体正好撞在厂商自己列的名单上
Turnitin 公布过它的误报通常有哪些共同点。逐字如下:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(误报有时会出现在这几类内容上:结构变化不多的内容、字面上自我重复的文字、以及只做了改写而没有产生新想法的文字。)
紧接着的那一句根本不是对你说的:
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(如果我们的指标在这类文本上显示出较高的 AI 写作占比,我们建议在看待所显示的百分比时把这一点考虑进去。)
那三条里有两条,说的正是方法章被要求做到的事。结构变化恰恰是报告规范花力气抹平的东西:每一项测量用同一个句式、各小节按同一个顺序排、每台仪器用同一种写法,好让两个描述方式完全一致的流程能被拿来对比。字面重复则是你用来表明两个条件确实被同样处理过的手段。整篇论文里,只有这一节把同一个句子形状写十一遍是正确的,也只有这一节,把它拆开的代价最贵。在这一节里哪些字能动、哪些不能动是另一个问题,有它自己的一套规矩,写在方法与结果里哪些地方能改;至于要不要为此调整自己的写法这个更大的问题,在要不要为了躲开 AI 标记而改变写作方式。
如果你是单独拿这一章去查的,你量的是另一样东西
这种情况下的慌张,很多不是来自学校那份报告,而是来自自己的一次试查:把这一章粘进某个地方,或者单独交进一个草稿检查的作业里,回来一个谁都不想看到的数。
Turnitin 对短提交的描述,讲的是它换了一种行为方式,不只是准头上差一点:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."(在只有几百词的较短文档里,预测基本上是非全即无的,因为我们是在单个片段上做预测,没有重叠的机会。)紧跟着的一句是:"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."(这意味着一段混合了 AI 生成内容与原创内容的文字,可能被整体标记为完全由 AI 生成。)
单独提交的一章正是这个区间的候选,而且比单看词数更像——因为编号步骤和表格是最先被从分母里拿掉的。底下还有一条地板:生成 AI 写作报告要求提交内容含至少 300 词的长文格式散文,所以一节太短的方法章单独交上去,可能根本不出报告,而不是出一个低分。再往上,显示门槛以下也没有东西可读:高于 0% 而低于 20% 的结果只显示一个星号,不给数字也不给高亮——也就是说,真的改好了和完全没改,在你这一侧看起来一模一样。
一片红定不了的事
很容易把上面这套机制拿去当成对自己有利的证据。它不是。这一页解释的是那个数字在测量什么,没有一句是关于你这一章是谁写的。而且它是双向的:方法章上的一条带证明不了什么,一套「带是怎么形成的」的解释同样证明不了什么。
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."(我们的 AI 写作检测模型未必总是准确——它可能误判人写的、AI 生成的以及被 AI 改写过的文本——因此它不应作为对学生采取不利行动的唯一依据。)分量在下一句上:"It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred."(要判定是否发生学术不端,需要进一步审查、人的判断,以及机构对其具体学术政策的适用。)
- 一条带说明的是分布,不是条数。 它告诉你模型在那一段上的打分是齐的,没告诉你其中任何一个分数有多确信。
- 百分比说的是合格散文,所以两章排版不同的内容之间没法比,把各章的百分比加起来得到的数字更是什么都不指。
- 这份报告出自一个厂商自己声明可能误判的系统,这是一个「该由人来看」的理由,不是一个「可以不看结论」的理由。
- 多数情况下这些你自己核不了。 指标和报告对学生不可见,不过教师可以把报告下载成 PDF 分享给你。
不要把这篇文章当成论据带进面谈。给一个已经读过同样几页帮助文档的人讲分类器,看上去更像是有备而来而不是在回答问题,而且它把话题整个挪到了模型身上:你在为一个分类器辩论,不是在谈自己的工作。真正有分量的是来源证据:草稿、实验规程、分析文件、时间。明明是你自己写的却被标了讲哪些证据值得整理,被标 AI 之后的那场谈话讲那场会在程序上是什么,版本历史当证据讲这些记录平时都存在哪儿——如果你从来没想过这件事,从这篇开始。
如果这一章反正要改
有时候决定已经下了,导师定的或者你自己定的,问题就变成怎么改才不会改坏。方法章是整篇论文里最不能随手改字的一节。顺序、时间、剂量、设备、参数、判定规则、分析人群、排除标准,这些就是内容本身,一个读着更顺、却悄悄漏掉其中一项的句子是实打实的缺陷——而原来那个生硬的句子不是。
被低估的成本不是改写,是改完之后的重新核对。每一个被动过的段落,都是你现在必须对着实验规程、分析代码和表格重读一遍的段落。一个动到整章的方案,等于给自己造了一份整章规模的校对活儿。所以改动的范围比用什么方法改要紧得多。
HumanPen 就是围着这一点做的。把那次提交的 Turnitin 或 iThenticate AI 写作报告导进来,报告标出的片段就是改动范围:只有那些文字被改写,其余内容冻结;站点对段落规则的自述是 "a paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm."(段落是引擎改写的最小单位:如果你选中的只是某个段落的一部分,它会被扩展成整段,并按这个范围展示出来给你确认。)公式、图和表格结构不属于文字改写的对象,这一条在方法章里比在文档的任何别处都更要紧。计费只数真正被改写的那些词,跟你上传的文件有多大无关。符合条件时可以免费继续降 AI。
这些都不是预测。Turnitin 的模型会变,显示规则以前也改过,我们没有任何办法告诉你下一份报告会写什么。上面这些说的是哪些字会被动、哪些字会被计费——这是我们真正能控制的两件事。
常见问题
每个字都是我自己写的,为什么整个方法章都被标了? 因为分类的单位是互相重叠的片段而不是句子,句子继承并池化所属片段的分数。一长段维持同一种语域的文字,让相邻片段之间没什么可区分的,输出于是倾向于连成一片。这是在描述一条带如何形成,不是在断言你这条带是误报。
一整块高亮是不是意味着里面每一句都被判成了 AI? 不是,理由就在公布的那段描述里。一个句子带的是它从所属片段继承来的分数,可能不止一个,然后被池化。把一条带读成一串逐句判决,直接就会导出那种「一句一句往下改」的计划。
我的方法章大部分是编号步骤和一张参数表,为什么百分比还这么高? 那些可能根本没进分析。Turnitin 分析的是合格文本,即由标准语法句子构成的散文,并且它明写这个百分比未必是整份提交内容的比例。把步骤和表格排除掉之后,留下来当样本的正是那些最循规蹈矩的段落。
要不要在方法章里加点变化,让它看起来别那么重复? 这首先是一个关于你所在学科报告规范的问题,其次才是一个关于检测器的问题,而方法章里的重复通常是在干活的。厂商就这类文本给出的建议,是说给读报告的人听的,不是说给写它的人听的。
我单独把这一章拿去查,得到一个很高的数。导师看到的就是这个数吗? 未必,因为那是另一份提交。Turnitin 说几百词的文档预测基本上是非全即无的,因为只有单个片段、没有重叠的机会,而这种情况下混合内容可能被整体标记为完全由 AI 生成。一章和整份文件的分母也不是一个。
能不能拿厂商自己列的误报特征当辩护材料? 那是一份关于这个工具错误模式的公开说明,而且是写给看百分比的人的,所以知道它存在是合理的。但它不是关于你这份文档的证据,而把一套机制当论据带进学术不端的谈话里,往往适得其反。带草稿和实验规程去。
继续阅读