不用工具手工降 AI 率:哪些改动真的动到了统计特征
Turnitin 评的是互相重叠的多句片段,不是单个句子。这篇讲的是:手工改稿的哪些动作对得上它自己文档里写明的性质,以及全靠手工要付出什么代价。
HumanPen 团队
· 14 分钟
先说结论
有两件不同的事都被叫作「humanize AI text」。一件是想让生成的文本通过检测;另一件是大多数人真正的处境:文章是你自己写的,或者起初是草稿但你后来重写过,结果还是被标红了。这篇讲的是第二件。而下面几乎所有内容,都在说明为什么第一件是个移动靶。
改整段,而不是抠单词。Turnitin 把提交内容切成互相重叠的多句片段,逐片段打分,片段内每个合格句子继承它所在片段的分数——所以在一句话内部换个同义词,是在跟它周围的整段较劲。Turnitin 在自家误报里点名的三个性质是:结构变化不多的文本、字面上自我重复的文本、以及只做了转述而没有发展出新观点的文本。这份清单是目前最接近「手工改稿规范书」的公开材料。
包括我们在内,没有人能告诉你改完之后分数会落在哪个数上。这个话题下大部分建议,都是按「你能测量自己的结果」来写的。多数时候你测不了——下面有一节专门讲这个。
那个分数究竟是什么的统计量
AI 写作百分比不是「可疑句子」的计数。Turnitin 的 FAQ 是这样描述这条流水线的:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(论文提交后,句子被抽取并切分为互相重叠的片段送去预测;每个片段由模型给出 0 到 1 之间的值;片段内每个合格句子继承该片段的分数;由于片段重叠,有些句子会有多个分数,再合并为一个;这些句子分数进一步汇总,算出整篇的 AI 写作分数。)
由此可以推出三件有实操意义的事。
一个句子没有自己的意见。它的分数来自它所属的那些文本块,而它同时属于不止一个。所以你正盯着的那句话,扛的可能是邻居定下的分数。
只有散文算数。Turnitin 把这叫作合格文本,说它只分析「only blocks of text that are written in standard grammatical sentences」(由标准语法句子构成的文本块),列表、项目符号和其它非句子结构不算。它还说得出的数字「is not necessarily the percentage of the entire submission」(未必是整篇的占比),并且混合了多种写作类型的文档「would result in a disparity between the percentage and the highlights」(百分比与高亮之间会出现落差)。如果你觉得标红的量凑不出给你的那个数,这就是文档里写明的原因,不是程序出错。这一点在怎么读 Turnitin 的 AI 检测报告里讲得更细。
还有:你能作用的单位是段落,不是词。
Turnitin 公开过的唯一一份特征清单
这一页其余所有内容,都是那份 FAQ 里一句话的下游:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(误报有时会出现在这几类内容上:结构变化不多的内容、字面上自我重复的文本、以及只做了转述而没有发展出新观点的文本。)
下一句同样重要:「If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.」(如果我们的指标在这类文本上显示出较高的 AI 写作比例,建议你看这个百分比时把这一点考虑进去。)这是厂商在告诉教师:对这类写作,高分要打折看。
要看清这份清单到底是什么:它是 Turnitin 在点名自家检测器会判错的那几种人类写作的形状。它不是对模型工作原理的描述,也不是一份「把生成文本伪装起来」的操作清单。它描述的是这样一种处境——东西是你写的,但还是被标红了。三个具名性质,对应三个改法。整套方法就这么多。
流传最广的那套解释,比看上去窄得多
在讲改法之前先把这件事清掉,因为网上一半的建议都建立在它上面。
标准说法是:检测器测的是突发性(burstiness)和困惑度(perplexity),而学术散文因为节奏均匀所以分数难看。同一份 FAQ 回应了这一点:模型「is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions」(并未被显式编程去评估突发性、困惑度这类具体信号或公共讨论中常被提到的其它单项指标)。它说模型是从训练数据中学习统计模式,并且单条预测未必能逐特征地解释。
但别把这句话推太远。同一页还说,它的分类器就是被训练来识别词概率差异的,而困惑度正是一种对词概率的度量。所以准确的说法很窄:Turnitin 否认的是把那两个具名指标当作显式规则来计算,它并没有否认用词的统计特征起作用。
实际影响比听上去小。调整句子节奏依然值得做,但理由是上一节那个,不是因为你在拧某个「突发性旋钮」。这套说法从哪来的,我们在AI 检测器到底在测什么里梳理过。
改法一:重建整段,而不是修补句子
打开被标红的那一段,然后把草稿关掉,对着你的笔记、提纲或它所依据的文献,把这一段重新写一遍。不要在原有句子上修改。写完之后再和旧版逐处比对,确认没有事实、数字或引用在过程中丢失。
为什么这一条排第一:片段计分意味着周围的句子也参与产生了这个分数。从原始材料重写出来的段落,句子构成不同、论述顺序不同,长度通常也不同;而逐词修补出来的段落,形状还是那个形状。
要按连续两三段成片地做,而不是把单句修补撒得满篇都是。片段会跨越段落边界,所以连片处理比同样数量的零散修改做的功更多。
这是慢的那一条。它也是唯一一条能稳定产出「有人问起时,你能逐句说明这是你写的」的文字。
改法二:把结构变化放回去
Turnitin 误报清单上的第一项。生成的草稿——说实话,还有很多写累了的人写的草稿——会收敛到同一个形状:段落长度几乎一致,每段以主题句开头,以一句「由此可见」收尾,中间三个支撑点。
该改什么:
- 让段落长度跟着它要干的事走。一句话的限定说明可以自成一段;一个完整例子跑十二句也行,只要把例子讲透确实需要那么多。
- 把不需要收尾句的段落的收尾句删掉。很多草稿里,每三段就有一段以复述自己的开头结束。
- 打破主题句的条件反射:让一段从例外开始,一段从数字开始,一段从论证的中途开始。
- 有些句子就该直接停在那里。
有个坑。把散文改成项目符号,不是这条改法。项目符号不属于合格文本,所以把散文从句子里抽出来,等于把它抽出了分析范围——数字可能因此变动,而你的写作其实什么也没变。你的评阅人会看出来,而你为了一个统计量把论文改差了。挪进表格连这点作用都没有:一条更新说明称 Turnitin 现在可以处理表格中的长篇散文,并且已提交的内容需要重新提交才会适用这一变化。
改法三:把稿子里说了两遍的都删掉
清单第二项,也是这一页上最便宜的收益。
在自己文档里搜六个词以上的重复串。然后检查学术草稿惯常自我重复的四个位置:摘要对引言、引言对第一节、每一处「如前所述」、以及结论对全文。再查一类段落:结尾复述了自己的第一句——那其实是改法二的问题换了件衣服。
删后一次出现的,不是删第一次。如果某个要点确实需要在结论里重提,用一个从句重提,不要用一整段。
认真做下来,一节里能删掉的量常常出乎意料。它顺带还把论文变短了——而这通常是你本来就有的另一个问题。
改法四:把想法往前推进,而不是换个说法
清单第三项:「只做了转述而没有发展出新观点的文本」。这是清单里唯一一条改变段落主张、而不只是改变读感的改法,也是唯一一条能扛住真实评阅人的。
对每一处被标红的段落,加上只有你能加的东西:
- 来自你自己数据的那个数字,以及它不成立的那一个个案。
- 你为什么在否决了显而易见的方法之后选了现在这个方法。
- 你在做的过程中注意到的一条局限——而不是从别人讨论部分抄来的那种。
- 你的两份文献在哪里互相矛盾,以及你采信的是哪一份。
- 你原本预期、但没有得到的结果。
如果一个段落装不下上面任何一样,那就该问它到底在承担什么论证。那些「说得都对但空」的段落,正是读起来像生成的段落;而按 Turnitin 自己的说法,它们也正是它的检测器会判错的那些。
代价:这一条是开放式的,可能意味着花一个下午回到文献里。它也是这里唯一一条与任何检测分数无关、直接能提高分数(指论文本身的分)的改法。
改法五:先看看你的文档长度是否撑得起这套做法
Turnitin 说短文档的行为不一样:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."(在只有几百词的短文档上,预测基本是「全有或全无」,因为我们只在单个片段上预测,没有重叠的机会。)
紧接着的下一句:「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(这意味着混合了 AI 生成与原创内容的文本,可能被整体判为 AI 生成。)
对一份 500 词的个人陈述或课程讨论帖来说,实际上只有一个片段。在里面改两句话,不构成朝任何方向的部分进展。要么对着笔记把整篇重写,要么接受这个分数正在按文档描述的方式运作,把力气放在「能拿出你怎么写的」这件事上。这一面我们在东西是你写的,却被标红了里讲过。
每条改法针对什么,大概要花多少时间
时间那一列是估计,不是测量。它假设的是英文学术散文、笔记就在手边、且没有被打断——这组假设从来没有一次成立过。
| 改法 | 针对什么 | 每千词大致耗时 |
|---|---|---|
| 对着笔记重建段落 | 片段级计分:单位是段落,不是句子 | 45 到 90 分钟 |
| 恢复结构变化 | 「结构变化不多的内容」 | 15 到 30 分钟 |
| 删掉字面重复 | 「字面上自我重复的文本」 | 10 到 20 分钟 |
| 把想法推进,补上只有你知道的东西 | 「只做了转述而没有发展出新观点」 | 开放式,常常是几小时 |
| 把散文改成项目符号 | 把散文移出分析范围,而不是改变它 | 别做 |
前四行要当成一件事读,不是一份菜单。它们高度重叠:对着笔记重建一个段落,通常在同一遍里就顺手修好了它的长度、它的重复和它的空洞。
这些你多半没法测量
这是大多数指南跳过的部分,而它会改变你该怎么做。
AI 检测指标和报告对学生不可见,只有教师和管理员能看到——尽管教师可以把报告下载成 PDF 分享。所以除非有人给你看,你是在没有仪表的情况下改稿。
就算报告摆在你面前,低分段的分辨率也很差。对 1 到 19 之间的分数,Turnitin 不显示百分比,只显示星号,并说这样做是为了避免可能的误报。也就是说,一次把文档从 18% 改到 6% 的修改,在报告上的样子和什么都没改完全一样。
模型本身也是按「宁可少报」建的。Turnitin 说为了压住误报率,「there is a chance that we might miss some AI written text in a document」(有可能漏掉文档中的一部分 AI 文本),并给了自己的例子:报告为 50% 的文档「could contain as much as 65% AI writing」(实际可能含有多达 65% 的 AI 写作)。一个往下走的数字,在任何一个方向上都算不上什么证明。
做这些改动时有一句话值得记住。Turnitin 给教师的指引是:把这个分数当作「a single data point rather than a definitive response」(一个数据点而非定论)来用,才是按预期在使用它;它有三个帮助页面写着这个分数不应作为对学生采取不利处理的唯一依据。把论文改好。分数在论文的下游,何况你根本看不到它。
全靠手工,实际代价是什么
时间是最明显的一项,而且它不是线性增长的。一篇 1,500 词的小论文是一个晚上;一章 8,000 词、带表格、参考文献和交叉引用的稿子是另一种动物——因为此时难的已经不是改写本身。
不那么明显的代价:
- 你改写的每一段,都是你要重新复核一遍的段落。 数字、方法部分的时态、引用是否还挂在它原来支撑的那句话上。复核往往比改写更耗时。
- 你可能把自己的论证改平。 凌晨一点对着自己的文字做三遍「让它别那么均匀」,一处谨慎的限定说明就是这样变成了武断结论。
- 在长文件上,损伤是结构性的。 交叉引用、编号题注、脚注和目录域会在文字移动时损坏,而且是无声地坏。这类失效我们在Word 的域、目录与交叉引用里写过。
- 你可能在重做本来就没问题的部分——因为除非教师把报告给你,你看不到哪些段落被标红了。
贵的是范围,而范围恰恰是 HumanPen 围绕着建的东西,所以这一段请当作利益相关方在说话。按报告导入的路径接收你拿到的 AI 检测报告,按那个页面上的说法:「只改写从报告中匹配到的段落,文档其余部分逐字保留」。符合条件时可以免费继续降 AI。手工做也好,不手工做也好,原则是同一条,而且是很无聊的一条:范围越窄,事后要复核的东西越少。
什么时候就该手工来做
手工改稿是正确选择的次数,比工具厂商愿意承认的要多:
- 文档很短。几百词的东西,你横竖都要整篇重写。
- 你的笔记和文献还开着。那时改法四几乎是免费的,而半年后它是不可能的。
- 被标红的那一节,是你确实能从底层工作重新写出来的,比如方法部分或结果段落。
- 报告找到的问题是真问题。重复、空段、结构划一,首先是写作缺陷;修掉它们会让论文变好,跟任何数字动没动无关。
常见问题
把句子长度改得参差一点,能降低 AI 检测分数吗? 不是按通常给出的那个理由。Turnitin 说它的模型并未被显式编程去评估突发性或困惑度这类信号;但它另外点名「结构变化不多的内容」是自家误报里常见的性质,所以恢复变化仍然值得做。把它当作几条改法之一,不要当作诀窍。
要改多少,那个数字才会动? 没有人能告诉你,凡是给你一个百分比的都是编的。Turnitin 对重叠片段计分再合并,所以一处修改的效果取决于它周围的段落。而且在 1% 到 19% 这一档你还失去了反馈——报告在那里只显示星号,不显示数字。
我的参考文献被标红了,要改参考文献吗? 先确认你手上是哪份报告。一条更新说明称,处理 AI 检测报告时参考文献被排除(已提交的内容需重新提交才适用该变化),而 Turnitin 说 AI 检测的高亮根本不会出现在查重报告里。被标红的参考文献几乎总是查重命中;而参考文献条目互相匹配本来就是常态——引用格式的存在,就是为了让所有人把同一份来源写成同一个样子。
我只用了语法检查工具,会被标红吗? Turnitin 的 FAQ 说,在对人类撰写文档的测试中,「in most cases」(多数情况下)Grammarly 及其它语法检查工具所做的修改没有被它的检测器标红。它接着说这不包括 Grammarly 的生成式功能(点名起草、改写、摘要),用这些功能产出的内容「will likely be flagged as AI-generated by our detector」。它划的那条线,是在「修正你的句子」和「生成你的句子」之间。
有没有一个我该瞄准的分数? 没有公开的阈值,各机构自定做法。Turnitin 给教师的指引是:把这个分数当作一个数据点而非定论来用,才是按预期在使用它。为什么流传甚广的 20% 并不是一条规则,我们在20% 的 AI 率算高吗里讲过。
来源:Turnitin 的 [AI writing detection capabilities FAQs](https://guides.turnitin.com/hc/en-us/articles/28477544839821-Turnitin-s-AI-writing-detection-capabilities-FAQs)、[Using the AI Writing Report](https://guides.turnitin.com/hc/en-us/articles/22774058814093-Using-the-AI-Writing-Report),以及 [AI writing detection model 更新说明](https://guides.turnitin.com/hc/en-us/articles/28294949544717-AI-writing-detection-model)。引文于 2026 年 8 月 14 日对照上述页面核对。本文发表在一家出售文档 humanizer 的公司的博客上——读到「手工改稿的代价」那一节时,这一点值得知道。
继续阅读