已经用另一个 AI 改写过了,为什么 Turnitin 还是标红

「再过一遍改写工具」这个动作,Turnitin 在自家文档里点了名,还有带日期的更新说明。这篇讲:那个分数到底算在什么单位上、报告里的颜色在 2026 年 8 月 4 日并成一种之后还能说明什么,以及你手上两份文件之间能自己做的那一次比对。

HumanPen 团队

· 22 分钟

先说结论

有两件不同的事同时在发生,通常被并成一件。第一,那个百分比不是算在你换掉的词上:Turnitin 把提交内容里的句子抽出来,切成互相重叠的片段,每段给一个 0 到 1 的分,片段里每个合格句子继承它所属片段的分数并做池化。如果改写后句子还是那些、顺序没变、段落断点也没变,那么被计分的那个分组也就没变。第二,「先用 AI 生成、再用改写工具过一遍」这个流程,Turnitin 在自己的文档里写明了,并且从 2023 年 12 月起就在为它发更新说明。

具体到你这份文件,是哪一件在起作用,看百分比是看不出来的。报告的颜色类目以前能给出一半答案,而 2026 年 8 月 4 日 Turnitin 把这两类合并成了一类,新出的报告连这一半也没有了。剩下的是一次比对:不需要任何检测器,拿自己那两个文件就能做。两个都在下面。

这篇假定文本本来就是 AI 生成的、你后来过了一遍改写工具。如果文章是你自己写的却还是被标红,那是另一种处境、另一套应对,我们写在文章是你自己写的却被标红了怎么办

那个分数挂在什么单位上,你那一遍又动了什么

Turnitin 的能力 FAQ 用一段话描述了这条流水线:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(论文提交后,句子被抽出并切分成互相重叠的片段送去预测;每个片段由模型给出 0 到 1 之间的值;片段内每个合格句子继承该片段的分数;由于片段重叠,有些句子会有多个分数,再合并成一个;这些句子分数进一步汇总,得出整篇的 AI 写作分数。)

扛着分数的单位是片段,而片段是一组句子。这是在说被测的量挂在哪一层,不是在给某一种改写动作下判断。句内替换是改写可以做的若干种操作之一;它对片段分数有多大影响,取决于片段里跟着一起变的还有多少,而 Turnitin 既没公开池化函数也没公开汇总方式,所以没有任何公开的量可供推算。这个缺口不是哪家厂商能从外部补上的,包括我们。

不用猜也能说的那部分反而更有用。如果改写后的文件句子数一样、句序一样、段落断点也一样,那么原先同处一个片段的那些句子,现在还在同一个片段里。把两句并成一句、把一句拆成两句、删掉一个重复的从句、把某个论断挪到另一段——这些会改变哪些句子被分在一起。而这件事,你翻自己那两个文件就能看出来。

Turnitin 公开点过名的性质也在这一层。同一份 FAQ 里说,误报「can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas」(可能包括结构变化不多的内容、字面上自我重复的文本,以及只做了转述而没有发展出新观点的文本)。第三项写的就是改写工具的产物,是厂商自己写的,而且写在「会被标红的文本」这份清单里。紧接着的下一句方向相反,也该一并读:「If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.」(如果指标对这类文本给出较高的 AI 写作占比,我们建议在看这个百分比时把这一点考虑进去。)由此推出的手工改法,在不用工具手工降 AI 率里。

这个流程在官方文档里有名字,还有日期

第二件事跟你的文件无关,跟检测器被造来找什么有关。Turnitin 的 FAQ 写得很直接:

"Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection."(此外,它还能识别出 AI 生成文本被 AI paraphraser 或 bypasser 工具(也叫 humanizers)改动过、以规避检测的情形。)

括号里那句「也叫 humanizers」是 Turnitin 原文写的,不是我们加的。三条更新说明给了这项能力一条时间线,最近的那一条改的是报告显示什么,没改模型在找什么。

更新说明原文写了什么对「再过一遍」意味着什么
2023 年 12 月 6 日"AI word spinners are sometimes used to avoid identification of AI-generated text. We now detect likely AI-generated text even if it may have been paraphrased using an AI word spinner."(有人用 AI 洗稿工具来躲开对 AI 生成文本的识别。现在即便文本可能被 AI 洗稿工具改写过,我们仍能检出它很可能是 AI 生成的。)改写这一步被写进模型的宣称覆盖范围已经两年多。同一条说明还写着:已提交过的内容需要重新提交,这项变化才对它生效。
2025 年 8 月 27 日"With this release, the 'AI-generated only' category in the AI writing report will now include the percentage of AI-generated text that may have been modified by an AI bypasser tool."(本次发布后,AI 写作报告中 `AI-generated only` 这一类目将把「可能被 AI bypasser 工具改动过的 AI 生成文本」的占比也算进去。)这个日期之后,一段 `AI-generated only` 高亮并不能排除 bypasser 那条判定。标准报告从来没有为它单开第三种颜色。
2026 年 8 月 4 日"We've updated the AI Writing Report to combine the previous two categories blue and purple into a single blue category"(我们更新了 AI 写作报告,把原来的蓝、紫两个类目合并成单一的蓝色类目),以及 "purple highlights previously used for AI-paraphrased text will no longer be shown"(原先用于 AI 转述文本的紫色高亮将不再显示)。同一条还写着模型 "will continue to detect likely AI generated content that may have been further modified by AI paraphrasers or bypassers"(仍将继续检测那些可能被 AI paraphraser 或 bypasser 进一步改动过、很可能由 AI 生成的内容)。报告不再把这两类分开显示,检测本身并没有停。Turnitin 还写明,新版报告覆盖的是那个日期之后交上去的文件,早先那些要再走一遍流程才会重出报告——所以你手上那份旧的仍然可能带紫色。

Turnitin 还明说不会公开它训练针对过哪些工具:「Our AI writing detector has been trained and tested to detect leading paraphraser and bypasser tools. However, to safeguard the integrity of our solution and its effectiveness in maintaining academic honesty, we're unable to disclose the names of these tools.」(我们的 AI 写作检测器已针对主流 paraphraser 与 bypasser 工具做过训练和测试。但为了保护方案本身的完整性及其在维护学术诚信上的有效性,我们无法公开这些工具的名单。)所以「哪个改写工具能过」这个问题,没有人能给出可核实的答案,卖改写工具的人也不能。那份名单在公开层面不存在,而模型还在变。

这一整段有个边界,用厂商自己的话说更稳妥。一项被写进文档的能力,说明的是模型被训练去做什么,不等于某一段具体文字真的走过那条路。Turnitin 自己的指引写着,模型「may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student」(未必总是准确——它可能误判人写的、AI 生成的和被 AI 转述过的文本——因此不应作为对学生采取不利处置的唯一依据),并且认定是否构成学术不端「takes further scrutiny and human judgment」(需要进一步审查和人的判断),还要结合机构自己的学术政策。

语种也有边界:Turnitin 的一篇帮助文档写着「only our English AI detector includes AI paraphrasing and AI bypasser detection capabilities」(只有英文检测器包含 AI 转述与 AI bypasser 检测能力),紧接着写明西班牙语和日语检测器不包含这两项。

只剩一种颜色之后,颜色还能说明什么

2026 年 8 月 4 日之前,标准的 AI 写作报告有两种可见类目。一种是 `AI-generated only`,自 2025 年 8 月那次更新起,这一类里也可能装着模型认为「可能被 bypasser 改动过」的文本。另一种是紫色的 `AI-generated text that was AI-paraphrased`,那是在「已被判为很可能 AI 生成」的文本之上再做的一次推断。8 月 4 日那天,Turnitin 把后者并进了前者,并说明那种紫色标记此后不会再出现。

所以颜色能说明什么,取决于你手上是哪一版报告。8 月 4 日之前出的那版里,紫色说明模型在 AI 生成之外还走到了转述那条判定,而另一个类目在 2025 年 8 月之后对有没有转述这一步两边都不说;那之后出的那版只有一个类目,在颜色这一层根本不再给答案。没变的是检测本身:同一条说明写着,模型仍会继续检出那些可能被改写工具进一步改动过的 AI 生成内容。两种情况都不指认工具、账号、设备或提示词。要拿一份旧报告讲故事,先把那两个旧类目读清楚,我们拆在Turnitin 的 AI-paraphrased 与 AI-bypasser 标签到底是什么意思

还有第二个理由,别把两份报告之间的类目变化读得太重。这类改动不追溯既往:Turnitin 说 2026 年 8 月这次只管那之后交上去的东西,已经躺在系统里的,不重新交一遍就还是旧报告。跨在一次更新两侧的两份报告本来就不是在量同一件事,类目可以在你的文字没动的情况下发生切换。如果你手上正好有两份报告、想推断这次修改起了什么作用,变量比看上去多,长版本在改完还是被标红:要比的是两份报告,不是两个分数

不需要检测器也能做的那次比对

这一遍改写到底起没起作用,你几乎没法测,两个都有出处的原因叠在一起。Turnitin 对高于 0%、低于 20% 的分数既不给数字也不给高亮,只显示一个星号——所以「真的从 19% 掉到 3%」和「完全没动」看起来一模一样。而且在多数配置下,那个指标也不归你看:Turnitin 说报告对学生不可见,不过教师可以下载 PDF 版分享给学生。

你能做的是把改写前和改写后的两个文件并排打开,回答四个问题。四个都不需要检测器,一整章大概五分钟。

比什么怎么比说明了什么
每段的句子数挑三四个被标红的段落,两个文件里各数一遍句末标点数目对得上,说明原先同处一个片段的句子现在还在一起
段落断点与论断的先后顺序缩到 50% 看排版形状,不看具体用词合并、拆分、调序会改变哪些句子被分在一起;句内替换不动这个排布
第一份报告从没标红的段落先在报告上把它们圈出来,再看这一遍有没有照样改了手上没有报告的那一遍,对标红和没标红的文字一视同仁。凡被它动过的,现在都是你得重读一遍的文字
直接引语、数字和文内引注搜引号,再逐条搜引注改写工具没有办法知道哪一句是必须逐字保留的原文引用
这个流程有个专属的坑:如果你是拿一小段试的改写工具,那次试验几乎什么都没告诉你。Turnitin 说,在只有几百词的文档里「the prediction will be mostly "all or nothing" because we're predicting on a single segment without the opportunity to overlap」(预测会接近「全有或全无」,因为只有单个片段、没有重叠的机会),并且因此「some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated」(混合了 AI 生成与原创内容的文本,可能被整体判成 AI 生成)。

第四行那条,代价落在分数以外的地方——它扣的是评分表上的分。也正是最没人查的一条,因为文件回来的时候看起来是完工的样子。

那一遍对文档其余部分做了什么

一个改写工具通篇跑一遍,手上没有报告,也就没有范围。它会改掉你本来挺满意的引言、你磨了一周的方法段,以及那句带着导师问过的数字的话。这些都没被标红。而它们现在都是你没读过当前版本的文字。

这是一份跟文档等长的校对活,而且掉在提交周期里最没时间干这个的位置上。真正会坏的东西都很琐碎、但很要命:一句直接引语被悄悄改了措辞、一个限定词被删掉于是论断说得比数据能撑的更满、一个术语在中途被换成近义词于是同一个概念有了两个名字、一个数字被四舍五入。参考文献、表格和公式各有各的坏法,我们列在改写会对引用、表格和公式做什么

替代方案不是「什么都别做」,而是让报告来定范围,这样你要重新核对的段落,正好就是真被说了什么的那些段落。这就是只改报告标红的那几段在实操上的意思,而其中大部分难度在于:把一处从半句话中间开始的高亮,映射回你源文件里的某一段。

手上这份报告该怎么用

你手上有比一个百分比更有用的东西:一组被标出来的段落。从它们开始。

  1. 所有文件都留着,按顺序留。 原始草稿、改写后的版本、两份报告。这串文件是这里唯一能回答「这东西是怎么写出来的」的材料,而且不管那个数字怎么变,它一直能回答。
  2. 别再通篇盲跑第二遍。 那会把要重新核对的量翻倍,而且你会失去分辨「哪一处改动带来了什么」的能力——两轮修改混在一段你已经认不出来的文字里。
  3. 在做别的之前,先把上面那张表的四行走一遍。 引语和引注排最前。那是评分标准,不是检测器的输出。
  4. 范围由报告决定,不由分数决定。 没被标红的段落,是没有任何证据指着的段落。
  5. 动笔改之前先查你所在机构的规定。 没有公开的阈值,什么算可接受的辅助由各机构自己定,不由厂商定。为什么流传很广的 20% 并不是那条规定,在20% 的 AI 率算高吗里。

第四条那件事我们做了个工具。HumanPen 收 PDF 版的 AI 写作报告,把报告里标红的段落映射回你上传的文档,并在动手之前先把范围摆给你看。段落是它改写的最小单位,所以一处只盖住半段的高亮会被扩到整段,并按扩过之后的样子交给你确认。计费按实际被改写的词数算,所以圈了四段跑,就按那四段算。

它给不了的是一个预测分数,因为那个数字在 Turnitin 之外没人拿得到。能说的是:符合条件时可以免费继续降 AI。

常见问题

再过第三遍改写工具会有用吗? 没有任何公开的量能让人回答这个问题,而且每多跑一遍,就多一轮需要你重新核对的改动。厂商自己那份误报清单里点名了「text that has been paraphrased without developing new ideas」(只做了转述而没有发展出新观点的文本)是会被标红的文本所具有的性质之一——在加第三轮同样的动作之前,这句值得先读一遍。

报告里有紫色,是不是就证明我用了改写工具? 不是,而且先看一眼那份报告是什么时候出的。紫色曾经是模型从最终文字推出来的一个分类,不是文档生产过程的记录;Turnitin 说模型可能误判人写的、AI 生成的和被 AI 转述过的文本,也说这个分数不应作为对学生采取不利处置的唯一依据。2026 年 8 月 4 日之后这个类目不再单独显示,所以页面上还能看到紫色,说明这份报告是那之前出的,或者是一份之后没有重新提交过的旧提交。

我只拿 300 词的一小段去试,结果整段都被标红了,为什么? Turnitin 说在只有几百词的文档里,预测会接近「全有或全无」,因为只有单个片段、没有重叠的机会,并且因此混合内容可能被整体判成 AI 生成。用一小段做试验田,几乎是最差的选择。

这些对西班牙语或日语的提交适用吗? 转述那部分不适用。Turnitin 的一篇帮助文档写着,只有英文检测器包含 AI 转述与 AI bypasser 检测能力,西班牙语和日语检测器不包含。

两遍之间我自己去看一眼分数不行吗? 通常不行。高于 0%、低于 20% 的都显示成星号,没有数字也没有高亮;而多数配置下,指标和报告是给教师和管理员看的,不是给你看的。这也是这个话题几乎全靠说法而不是靠测量在跑的主要原因,同一段文字在不同检测器上给出不同答案的道理,我们写在为什么同一段文字在每个检测器上分数都不一样

来源:Turnitin 的 [AI writing detection capabilities FAQs](https://guides.turnitin.com/hc/en-us/articles/28477544839821-Turnitin-s-AI-writing-detection-capabilities-FAQs)、[Using the AI Writing Report](https://guides.turnitin.com/hc/en-us/articles/22774058814093-Using-the-AI-Writing-Report),以及 [AI writing detection model 更新说明](https://guides.turnitin.com/hc/en-us/articles/28294949544717-AI-writing-detection-model)。引文于 2026 年 8 月 14 日对照上述页面核对;Turnitin 发布说明里 2026 年 8 月 4 日那一条,于 2026 年 8 月 18 日核对。本文发表在一家出售文档改写工具的公司的博客上——读到「那一遍对文档其余部分做了什么」那一节时,这一点值得知道。

继续阅读