英文论文 AI 率太高怎么办?先搞懂报告在说什么
当 Turnitin 说你的英文论文 AI 率太高,第一步不是降,而是搞清楚手上那个数字到底是哪种、依据什么规则显示出来的。要降的不是 perplexity,是把你的词概率拉回你自己的人写模式。
HumanPen 团队
· 35 分钟
先说结论
Turnitin 的 AI 写作报告在 1% 到 19% 这一档不显示数字,只给一个星号;20% 及以上才开始出现精确百分比和高亮。所以当你说「AI 率太高」的时候,第一步不是想办法降,而是搞清楚你手上那个数字到底是哪种、在哪一档、依据什么规则显示出来的——因为只有带数字的报告才附带可以定位的高亮,星号那档什么抓手都不给。
第二步才是问为什么高。Turnitin 的模型把你的文本切成重叠片段,给每段一个 0 到 1 之间的概率分,再汇总成文档分。你的用词落在 AI 生成文本那一侧的概率分布里,分就偏高。中文母语者写英文时有三个统计倾向会把这个概率往 AI 那一侧推,下面逐条拆。
第三步是改。改的方向不是去降一个叫 perplexity 的指标——Turnitin 没有显式计算它。方向是让你的词概率回到你自己的人写模式:用你自己的词,用你自己平时写不出来的句式结构,逐段改被标出的地方,而不是换同义词。
「太高」到底是什么意思
Turnitin 的 AI 写作报告对低分有一套专门的显示规则。官方在检测能力 FAQ 里是这么写的:
「To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed.」(为避免误判,1% 到 19% 这一档不给分数、也不给高亮;检出低于 20% 阈值时,报告用一个星号标注,不给出百分比。)
也就是说,如果你手上看到的「AI 率」是一个带百分号的数字,它至少是 20%。如果你看到的是一个星号,那么它落在 1% 到 19% 之间,报告不告诉你具体是多少。0% 是二十以下唯一会精确显示的数字。
这层区分看起来琐碎,但它决定你接下来能做什么。星号意味着你拿不到高亮段落,无从知道哪些文字触发了标记,也就无从逐段修改。带数字的 20% 及以上才有高亮,有高亮才谈得上定位和改写。所以「AI 率太高怎么办」这个问题,只有在你手上的报告显示的是 20% 及以上、并且你能看到高亮的时候,才有可以操作的答案。这一层我们在怎么读一份 Turnitin AI 检测报告里展开过。
还有一件事必须先确认。Turnitin 明写「only instructors and administrators are able to see the indicator」(只有教师和管理员能看到这个指标),以及「The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students.」(AI 检测指标和报告对学生不可见。但借助 PDF 下载功能,教师可以把 AI 报告下载下来分享给学生。)你手上如果有报告,是因为有人决定把 PDF 下载下来给你。先确认你拿到的是完整 PDF,而不是一张截图。
高的机制原因:你的词概率落在了 AI 那一侧
Turnitin 在 FAQ 里描述了检测的计算链路:
「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.」(提交进 Turnitin 后,句子被抽取并切分成重叠片段做预测分析。每个片段由模型分类,得到一个 0 到 1 之间的值,表示这段文字更可能由人还是由 AI 生成。每个 qualifying 句子继承所属片段的分数;片段重叠时,一个句子可能携带多个分数,这些分数被池化为一个。再由句子分数汇总成文档的 AI 写作分数。)
这是一条概率链。你的每一句话被模型判了一个 0 到 1 的分,越接近 1 越像 AI。这些分汇总起来,就是你看到的百分比。
所以「AI 率高」的机制意思很具体:你写的文字,在模型的概率空间里,落在了 AI 生成文本那一侧。不是你用了 AI,而是你的用词和句式的统计特征,碰巧更接近 AI 生成文本的平均模式。
这里必须澄清一个全网流传的错误说法。很多回答把 Turnitin 的检测机制说成「算 perplexity 和 burstiness」,然后教你怎么降这两个值。Turnitin 自己在 FAQ 里明确否认了这一点:
「Our model is not explicitly programmed to evaluate specific signals such as "burstiness," "perplexity," or other individual metrics sometimes referenced in public discussions.」(我们的模型并不被明确编程去评估「burstiness」「perplexity」这类在公开讨论里偶尔被提及的单项指标。)
紧接着的下一句:
「Instead, it learns statistical patterns from our training data.」(相反,它从我们的训练数据里学习统计模式。)
但这不等于 Turnitin 不看词概率。同一页 FAQ 在另一问里写着:
「Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.」(我们的分类器就是被训练来识别这种词概率差异的,并且擅长识别人类作者特有的词概率序列。)
这两句必须放在一起读。Turnitin 没有显式计算一个叫 perplexity 的分数,但它的分类器确实在做词概率层面的判断——因为 perplexity 本身就是词概率的一种度量。所以正确的说法是:你不能去调一个叫 perplexity 的旋钮,那个旋钮不存在;你能改的是你自己用词的概率分布,让它在模型的判断里回到人写的那一侧。
为什么中文母语者写英文更容易被标记
这一节讲三个统计倾向,每一个都会把你的词概率往 AI 那一侧推。它们不是中文母语者的缺陷,是你在用第二语言同时处理语法、用词和论证时容易出现的统计特征。
第一,倾向用「安全」的高频词。 中文母语者写英文时,本能地会选择含义稳定、不容易出错的高频词。而高频词恰恰是 AI 生成文本最常选的词——语言模型也是按概率选词,高频词概率高。你的用词分布越往高频集中,就越接近 AI 生成文本的平均分布。前面引过的那句「Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers」说的就是这个:分类器看的是词概率序列,人类作者的序列有自己的特点,高频集中不是其中之一。
第二,句式变化少。 Turnitin 自己列出了误报易发的文本特征:
「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.」(有时误判——把人写的文本错标为 AI 生成——会出现在这些文本上:结构变化不多的内容、字面上自我重复的文字、或者只改写而未产生新想法的文字。)
下一句:
「If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.」(如果我们的指标显示这类文本的 AI 写作含量较高,我们建议你在看这个百分比时把这一点考虑进去。)
中文母语者写英文时,留给句式选择的认知余力本来就少。结果就是句式趋于一致——主谓宾、主谓宾、主谓宾。结构变化少,正好落在官方列出的误报易发特征的第一条上。官方甚至建议教师对这类文本的高分打折看待,这句话必须跟着引到。
第三,可能用了机翻或 Grammarly 辅助。 机翻的输出本身就是语言模型生成的,它的词概率分布天然落在 AI 那一侧。Grammarly 的情况更要分清楚。Turnitin 的 FAQ 对 Grammarly 有专门说明:拼写、语法、标点修改在多数情况下不会被标记;但 Grammarly 的生成式功能——起草、改写、摘要等——不在豁免范围内,官方明写这类内容「will likely be flagged as AI-generated」(很可能会被标记为 AI 生成)。如果你用了 Grammarly 的句子重写功能,那些段落被标是意料之中的事。
AI 检测器为什么对非英语母语者有偏见把这一族问题放在更大的背景下讲过。
怎么降:改的是词概率,不是 perplexity
先说不要怎么改。
不要去降 perplexity。 前面已经引过 Turnitin 的原话:模型不被明确编程去评估 perplexity 这个单项指标。任何教你「降 perplexity」的建议,前提就是错的——你降不了一个 Turnitin 不显式计算的值。市面上很多 humanizer 工具的营销文案就建立在这个错误前提上。
不要换同义词。 换同义词换的是单个词,不换词概率分布。你把「important」换成「crucial」,换的是一个词,但「crucial」在 AI 生成文本里也是高频词。你的整体分布没有变,模型看到的还是同一个分布,只是其中一个位置换了标签。换同义词改的是表面,模型看的是统计。
不要全文重写。 短文档有一个官方明写的极端行为:
「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.」(在只有几百词的短文档里,预测基本上是「全有或全无」的,因为我们在单个片段上预测,没有重叠的机会。)
下一句:
「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(这意味着,一些混合了 AI 生成内容与原创内容的文字,可能被整体标记为 AI 生成。)
所以半改状态在短文档上风险尤其大:你改了一半,另一半被误判成 AI,整体可能还是高分。
再说怎么改。
先看报告。 前面引过,学生看不到指标,但教师可以下载 PDF 分享。你有权要那份 PDF。拿到之后,先找到被高亮的段落——只有 20% 及以上的报告才有高亮。知道哪些段被标了,才谈得上改。
被标记的段逐个改。 改的方向是改变句子的结构,而不是换词。把你习惯的主谓宾换成你平时写不出来的结构——从句、倒装、插入语、跨句的指代。这些结构改变了你的词概率序列,让它在模型的判断里偏离 AI 平均模式。一句话的分数还被它的邻居影响(因为片段重叠),所以改一段会影响它前后几句的分。
用你自己真正想用的词。 绕开「安全高频词」的倾向,用你真正想用的词,哪怕它不那么常见。人类作者的词概率序列有自己的特点,而特点往往就在偏离高频的那些选择上。
留意 qualifying text 的边界。 Turnitin 只分析标准语法句子构成的散文:
「This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.」(qualifying text 只包括散文句子,也就是说我们只分析以标准语法句子写成的文本块,不包括列表、项目符号等非句结构。)
下一句:
「This percentage is not necessarily the percentage of the entire submission.」(这个百分比未必是整份提交的百分比。)
所以你看到的数字是 qualifying text 上的百分比,不是全文占比。改写时也要盯准 qualifying text——改列表和项目符号不会动那个分母。
官方的设计取舍:宁可漏检
有一件事说在前面,因为它影响你怎么读自己手上的分。Turnitin 在 FAQ 里公开了检测的设计取舍:
「In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing.」(为了把误判率维持在 1% 这么低,我们有可能漏掉文档里的一部分 AI 文本。我们接受这一点,因为我们不想把人写的文字错标成 AI 写的。举例来说,如果我们判定一份文档有 50% 可能由 AI 写成,它实际可能含有多达 65% 的 AI 写作。)
方向很明确:宁可漏检,也不误判。这意味着报告存在低估的倾向,不是高估。如果你拿到一个高分,这个分在模型的设计方向上是偏保守的,不是偏激进的。这不能用来证明分一定准,但它可以帮你不把分当成天花板。
「改结构」具体是什么意思
「改结构」听起来抽象,举个例子就清楚了。
- 原句:「The results show that the method is effective.」
- 换同义词:「The findings demonstrate that the approach is successful.」——这是换词,结构没变,模型的判断大概率不动。
- 改结构:「What the results show is not that the method works in general, but that it works under the specific condition we tested.」——句式从简单主谓宾变成了强调结构加转折,词概率序列变了,模型看到的分布不一样了。
改结构不是要你写花哨的句子。是要你写你自己平时不太写的句式,因为你自己平时不太写的句式,恰恰是你作为人类作者的概率特征所在。
拿到报告后的五分钟动作清单
- 先确认你拿到的是 PDF,不是截图。 截图没有日期、没有高亮位置、看不出是哪种报告。
- 看数字是百分比还是星号。 百分比意味着 20% 及以上,有高亮可以改。星号意味着 1% 到 19%,没有高亮,无从定位。
- 找到被高亮的具体段落。 这些才是要改的,其余部分不动。改不该改的地方是白费功夫。
- 逐段读高亮内容,判断是哪种情况。 是句式太一致?是用词太高频?是用了 Grammarly 的重写功能?不同原因改法不同。
- 改结构,不换词。 用你自己平时写不出来的句式重写被标记的句子。
- 改完再查。 检测器会变,Turnitin 自己也说模型在迭代,所以不承诺固定结果。你能做的是改完再查一次,看高亮是不是掉了。为什么不同检测器之间会对不上解释了为什么不同检测器的结果不能互相验证。
常见问题
AI 率太高是不是说明我用了 AI? 不是。Turnitin 的模型看的是词概率分布,不是使用记录。你没用 AI,也可能因为用词高频、句式一致、或用了机翻辅助而被标记。Turnitin 自己列出了误报易发特征,并建议教师对这类文本的高分打折看待。
我能不能查到自己的 AI 率? 通过 Turnitin 的指标不行。官方明写指标和报告对学生不可见,教师可以下载 PDF 分享给学生。你能看到的每一份报告,都是因为有人选择给你看。
换同义词能降 AI 率吗? 大概率不能。换同义词换的是单个词,不换词概率分布。模型看的是整体分布,不是个别词。改结构比换词有效。
用了 Grammarly 会不会被标? 拼写、语法、标点修改在多数情况下不会被标记。但 Grammarly 的起草、改写、摘要等生成式功能,官方明写很可能会被标记为 AI 生成。区分这两类功能。
短论文是不是更容易被标? 几百词的短文档预测接近 all-or-nothing,混合内容可能被整体判成 AI。短文档上改写要格外小心,不要留半改状态。
用 humanizer 工具能降吗? 本稿不做效果声称。Turnitin 的设计方向是宁可漏检也不误判,模型在迭代,任何工具对未来检测结果做的承诺都不可信。我们能说的是:改结构比换词有效,拿到报告再改比盲改有效。
继续阅读