为什么写得好的文章反而被判成 AI

这个问题预设了检测器读过你的文章、并且因为它读起来太好而扣了分。而厂商公开的那套说明里,根本没有一个格子是留给「写得好」的——这会改变一个高亮到底能说明什么。

HumanPen 团队

· 26 分钟

先说结论

它不是在给文章打分。我们检索的三个 Turnitin 帮助页里,「quality」「style」「polished」「well written」「vocabulary」「clarity」都不存在。灵敏度对照「300 words」则三页都有,说明检索路径读到了页面文字,不是抓了空页。FAQ 也没把这套检测器说成对写作质量的测量。Turnitin 公开的是一张没有频率数据的清单,说误报「可能包括」哪些文本。谨慎的学术写作可能因为重复固定术语或使用平行结构而长得像其中两条,但 Turnitin 没有说这些属性在误报中出现得多频繁。

这并不等于「文笔好就一定没事」,别把它当成那句话来用。厂商公布的是它愿意公布的那一部分,训练出来的东西比文档长得多。它成立的是一个更窄、也更有用的结论:「写得好」不是这套系统会报告的量,所以一个高亮不是对它的判决;而建立在「它就是在评这个」之上的那些建议——最后总会拐到「把自己写差一点」——背后没有任何公开材料。

把厂商自己的用词数一遍

2026 年 8 月 18 日取了三页。`guides.turnitin.com` 对命令行请求返 403,所以这次走浏览器读渲染后的正文:「Using the AI Writing Report」、「Turnitin's AI writing detection capabilities FAQs」和「File requirements for an AI Writing Report」。这三页管的是机制和文件规则;发版记录页、已知问题页没有算进来。表里记的是不区分大小写的「存在/不存在」,不再发布会随活页面变动的精确次数。

检索词AI 写作报告使用指南AI 检测能力 FAQ文件要求页
`quality`不存在不存在不存在
`style`不存在不存在不存在
`well written` / `well-written`不存在不存在不存在
`polished`不存在不存在不存在
`genre`不存在不存在不存在
`discipline`不存在不存在不存在
`false positive`(次级对照)存在存在不存在
`300 words`(灵敏度对照)存在存在存在

最后一行才是让上面那片「不存在」站得住的东西:抓空了和真的没有,留下的痕迹是同一个,所以得先让一个已知在三页上的词报出「存在」,量具才算是活的。只看 FAQ 那一页:「writing」和「segment」存在,「vocabulary」「word choice」「clarity」不存在。「breakdown」在使用指南上存在,但都是界面面板的名字,不是统计项。

真正会漏的是图。FAQ 的 `article` 范围里没有图;站点 logo 属于页面外壳,不是 FAQ 正文的资产。使用指南上的截图没有 alt 文字,纯文本量具对它们结构性失明,所以我们另外逐张打开看了。它们包括一份样例报告(AI 56%,相似度 23%)、一页带高亮的正文和状态提示。上面那些词一个都没出现。但其中一张确实带着一句正文里找不到的话:

「AI detection includes the possibility of false positives. Although some text in this submission is likely AI generated, scores below the 20% threshold are not surfaced because they have a higher likelihood of false positives.」(AI 检测存在误报的可能。虽然这份提交里有些文本很可能由 AI 生成,但低于 20% 阈值的分数不会呈现出来,因为它们误报的可能性更高。)

这是产品在自己最没把握的那一段区间里拒绝印出数字。值得记住,因为在这批材料的其它任何地方,误报率都只是被描述,没有被拿来做过什么。

那么在场的是哪套词

总得有东西在干这件事。FAQ 在「What parameters or flags does Turnitin's model take into account when detecting AI writing?」(检测 AI 写作时,Turnitin 的模型会把哪些参数或标志纳入考虑)这个小标题下点了名:

「Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.」(我们的分类器被训练来识别这些词概率上的差异,并且擅长识别人类写作特有的词概率序列。)

同一段答案还很小心地加了一句:模型「is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions」(并没有被显式编程去评估「突发性」「困惑度」这类公开讨论里常被提到的单项指标),它「learns statistical patterns from our training data」(从我们的训练数据里学统计规律)。两句都在页面上,只读一句就会走偏:厂商否认的是两个被点名的公开指标,不是否认词概率是这里的通货。这一堆术语各自到底指什么,困惑度与突发性之外,AI 检测器还在测什么里写过。

现在把公开材料里出现的单位往上追,而不是往下追。词,然后是句子,然后是这一段:

「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1 ... Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.」(提交之后,句子被抽出并切成互相重叠的片段送去预测。每个片段由模型分类、给出 0 到 1 之间的值……片段里每个合格句子继承所属片段的分数。因为片段是重叠的,有些句子会拿到多个分数,再池化成一个。这些句子分数再被汇总,算出整份文档的 AI 写作分。)

这条链到此为止。被分类的最大对象就是一个片段,宽度是几句话;文档那个数是这些片段分的汇总,不是读完全文之后再下的第二道判断。而让一篇文章称得上好的东西,几乎全都比一个片段大:一条撑得住八页的论证、选得准的证据、第二节埋下、第五节回应的那个反驳。在真正发生分类的那个尺度上,这些都不是一个对象。不是系统称了称你的思路然后不喜欢它。是没有那个格子。

「人写的」是拿什么校准出来的

讲学术写作里的误报时,厂商指向了一批 ChatGPT 发布前的测试语料:

「To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate.」(为了强化测试框架、诊断误报的统计趋势,每次更新或发布新模型之前,我们都会在 70 万篇以上、写于 ChatGPT 发布之前的额外学术论文上跑测试,进一步验证我们低于 1% 的误报率。)

同一页在自己的小标题「How does Turnitin ensure that the false positive rate for a document remains less than 1%?」(Turnitin 如何确保单份文档的误报率保持在 1% 以下)下面又说了一遍,这次把「over」丢掉了:「we perform additional tests on 700,000 additional academic papers that were written before the release of ChatGPT」。同一批语料,一页之内两种写法。

要看清 Turnitin 是怎么描述这批参照语料的:它们是学术论文,因为写于 ChatGPT 发布前而被选中。这是按日期做的描述,不等于厂商声明每篇都经过独立的人工作者核验。能安全保留的结论更窄:Turnitin 说自己每次模型上线前都会在这批 ChatGPT 发布前的学术论文上重跑测试,用来盯误报率;该页没介绍逐篇验证作者的流程。

这仍然定不了案,说定了就是我们越界。厂商公布的是目标值,不是目标值背后的分布;而「低于 1%」这句本身还带着一个限定,被它自己的下一句悄悄丢掉了。这条线索的完整版本,包括把一个很小的比例乘上一所真实大学一年的提交量会变成什么,在当一所大学一年交上去 75,000 篇论文,1% 的误判率意味着什么里。

误报的分布没有公开

页面写的是「低于 1%」的误报率,但它没公开这些误报在测试语料里怎么分布。页面没给任何分组误报率,也没说某一类文本承担了更多误报。

页面真正公开的,是一张没有量化频率的清单,说误报「可能包括」哪些文本,后面再给读百分比的人一句建议:

「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.」(有时候误报——把人写的文本错判成 AI 生成——会出现在结构变化不多的内容上、字面重复自己的文本上,或者只做了改写、没有产生新想法的文本上。如果我们的指标在这类文本上给出较高的 AI 写作比例,我们建议你在看这个百分比时把这一点考虑进去。)

先看这张清单上有什么、没有什么。没有「用词高级」,没有「句子长」,没有「论证有力」。它点了三种可能的文本属性,却没给其中任何一种的频率。第三条描述的是一个流程,而不是你自己写出来会长成的样子。

前两条值得拿来和普通的学术写作对照,但下面是我们的读法,不是厂商的说法。如果你的领域要求同一个概念每次出现都用同一个名字,你可能会刻意重复同一个术语,因为同义词反而引入歧义。如果你把可比较的几项写成平行句,好让读者并排看,你也可能因为同一个理由减少结构变化。这两件都不是失误。Turnitin 只说误报「可能包括」这些属性;它没说出现频率,没说误报集中在这里,也没说这些属性与误报相关。

我们主张的是「写得好就会被标」——那比上面任何一条材料能支撑的都大得多。这句话流传很广,而跟在它后面的那条建议,通常是让你显得没那么有能力。这张清单真正支撑得起的手改动作有哪些、自己动手要付什么代价,不用工具手工降 AI 率:哪些改动真的动到了统计特征里逐条写过。

还要注意厂商那句后半段是说给谁听的。它让看这个百分比的人把文本本身的性质考虑进去。那句话的收件人是读报告的人,不是写论文的人。

你这一类写作是不是更吃亏,这件事没有公开

下一个自然的问题是:误报在你的学科、章节或文体里是不是更常见。FAQ 里有一个很接近的小标题——「Does the Turnitin model take into account that AI writing detection technology might be biased against particular subject-areas or second language writers?」(Turnitin 的模型有没有考虑到 AI 检测技术可能对特定学科或第二语言写作者存在偏见),而它的答案讲的是训练样本:

「One of the guiding principles of our company and of our AI team has been to minimize the risk of harm to students, especially those disadvantaged or disenfranchised by the history and structure of our society. Hence, while creating our sample dataset, we took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments and less common subject areas such as anthropology, geology, sociology, and others.」(我们公司和 AI 团队的指导原则之一,是把对学生的伤害风险降到最低,尤其是那些因社会的历史和结构而处于弱势或被剥夺权利的学生。因此在构建样本数据集时,我们把统计上代表性不足的群体考虑了进去,比如第二语言学习者、来自非英语国家的英语使用者、生源多元的院校的学生,以及人类学、地质学、社会学这类较冷门的学科。)

「anthropology」「geology」「sociology」这些学科名只出现在描述样本如何构建的段落里。「discipline」「genre」「subgroup」在三页中都不存在。也就是说,学科作为训练的输入出现,却没有作为公开的测试分组结果出现。没有任何一个学科有公开的误报率,那条关于偏见的回答背后也没有放任何数字,所以它只能被当作一份意向声明来读。

正是这个空缺,让大家在这个问题上能引的数字全部来自公司外面:一项 2023 年、样本为 91 篇托福作文的研究。它的范围、它做的对照实验、它自己的局限,我们在为什么非英语母语的写作者更容易被 AI 检测器误判里拆过。同样也是这个空缺,让两个检测器可以对同一段文字给出两种结论,那是另一摊事,在为什么同一段文字在不同检测器上分数差很多里。

你最花心思的那部分,可能根本不在被测的范围里

「它标了我写得最好的文章」这个说法还有最后一层不成立的地方,跟那个百分比到底是「谁的百分比」有关。你文档里只有一部分有资格被打分:

「This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission.」(合格文本只包含散文句子,意思是我们只分析由标准语法句子写成的文本块,不包含列表、项目符号这类短的非句子结构,也不包含其它非句子结构。这个百分比不一定是整份提交的百分比。)

2023 年 8 月的两条更新又挪了一次边界:一条说表格里的长篇散文现在会被处理;另一条说「有时会把参考书目里的文献标成 AI 写作」这个 bug 已修复,参考书目现在被整体排除在处理之外。这两条 release note 的结尾是同一句话——已有的提交需要重新提交一次,改动才对它生效。

所以,你排了两个晚上的参考书目,以及写成简短、非句子项目符号的纳入标准,都在被打分的集合之外。表格则要看内容:表格里的长篇连续散文可以被处理,数字单元格、片段和其它非句子内容则可能仍不属于合格文本。因此,这个百分比不必然描述整份提交。这也正是它和你眼前那片着色文字对不上的机械原因,我们在怎么读一份 Turnitin AI 检测报告里逐行拆过。

那这些能拿来干什么

跟你怎么写关系很小,跟那个数字能承担多重的判断关系很大。

  • 要排除掉的动作只有一个:把自己写得没那么有能力。 上面所有内容都指向这一条。这笔交易不划算的地方很朴素:老师那边的分是一定会落下来的,而分数那边的效果既没人量过,你通常也没权限盯着看。
  • 要问的是哪几段,不是多少分。 高亮告诉你分类器落在了哪儿。百分比告诉你它落在合格文本的多大比例上,而那和「占你文章的多大比例」是两个量。
  • 短文档会被粗粒度地量。 厂商原话:「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.」(在只有几百词的短文档里,预测基本上是「全有或全无」,因为我们是在单个片段上预测,没有重叠的机会。)真正扎人的是下一句:「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(这意味着 AI 生成与原创混合的文本,可能被整体标成 AI 生成。)而合格文本不足 300 词时,按文件要求根本不会有报告可读。
  • 如果你的文风是因为文体要求才这么写的,先弄清厂商那句建议是说给谁的。 「把文本的性质考虑进去」这句,收件人是看百分比的那个人。在决定「要改的是论文」之前,这件事值得先知道。
  • 对任何关于结果数字的承诺保持怀疑,包括我们的。 Turnitin 自己的说法是,单次预测「may not always be explainable in simple feature-by-feature terms」(未必总能拆成逐特征的解释)。公司外面没有人能把一次改动映射到分数的一次移动上。

改写在什么位置上成立,在什么位置上不成立

上面这些都不构成「所以去改写」的理由。如果你的立场是这文章是你写的,那要动的就不是文章。

改写只在一个很具体的位置上站得住:报告已经存在,上面标了具体的几段,而这几段本来就要改。HumanPen 就是照这个形状做的。文档和那份 AI 报告(Turnitin 或 iThenticate)一并交上去,作用范围就等于报告标出来的那些片段;范围以外,你写的字原样留着。粒度规则在我们自己的页面上写着:「A paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm.」(段落是引擎能改写的最小单位:如果你选中的只是某一段的一部分,它会被补齐成完整段落,并按这个样子显示出来让你确认。)计费只算实际被改写的词,所以一个限定了范围的任务,成本取决于范围,不取决于文件有多大。

如果新报告仍有符合条件的标记片段,可以免费继续降 AI。谁也交不出来的,是下一份报告会印出什么数。看完前面这些就清楚了:报出一个数的工具,报的是它手里根本没有的东西。

常见问题

文笔好的文章是不是更容易被标? 这个说法比公开材料能支撑的大,我们不主张它。有据可查的是 Turnitin 说误报「可能包括」三种文本,其中没有一种是对质量的判断;外加一项 2023 年样本上测到的、对英语词汇量较小的写作者的效应。把那个宽泛版本当成一个在流传的说法,而不是一个结论。

用词高级会不会把 AI 分推上去? 厂商公开的东西对此没有说法:我们检索的三页里,「vocabulary」和「word choice」都不存在。一项 2023 年的对照实验直接动了用词,方向和民间说法相反:研究者把已经被判成 AI 的作文的用词做丰富化处理,标记数随之下降。这说明在那个实验里,用词不是惰性的变量。它对你这份文档说明不了任何事。

我的文章重复,是因为术语必须前后一致。 这就是那个「按惯例本该如此」的情形,它对上了厂商误报清单里的一条。而厂商在这种情形下给的建议是说给读报告的人的:看百分比的时候,把文本本身的性质考虑进去。

要不要刻意去制造句长变化? 不要当成一道排版作业来做。如果变化本来就在承担意思,把它恢复回来只是普通的修改。但在一个惯例要求整齐划一的章节里硬造出变化,等于用学科没要求的写法换掉学科要求的写法,换回来的是一个从外面根本量不到的效果。

我能在交上去之前自己看一眼这个分数吗? 通常不能。Turnitin 的说法是 AI 写作指标和报告是给教师和管理员看的,只有教师把报告下载下来转给你,它才会到你手上。任何默认你能盯着这个数字变化的建议,都在假设一种多数学生并不具备的权限。

继续阅读