Turnitin 能查出 Claude、Copilot、Gemini 吗?
「换一个模型写就查不出来了」这个想法,前提是检测器认得出文本出自谁家的模型。Turnitin 的 FAQ、更新页和报告文档分别在讲覆盖、发布变化与输出,先把这几层分开,才能知道哪些结论站得住。
HumanPen 团队
· 22 分钟
先说结论
Claude 和 Gemini 的多个版本出现在 Turnitin 英文 FAQ 的覆盖清单里,原文说检测器「能检测出其内容」。我们审阅的五个页面没有点名 Copilot,但这既不代表豁免,也不能证明某次 Copilot 提交一定会被检测。Product Updates 和通用 release notes 也会在特定语种的更新里点名模型,所以 FAQ 不是 Turnitin 公开模型名的唯一地方。已审材料没有提供一张稳定的逐模型概率表;报告文档描述的是对重叠文本片段算概率,输出分为很可能由人写成或很可能由 AI 生成。
来源是 2026 年 8 月 18 日实读的五个具名页面:AI 写作报告指南、检测 FAQ、AI 写作检测模型更新日志、通用 Turnitin release notes 和 Product Updates。下文结论只限于这些页面与引用的段落,不冒充 Turnitin 官网全集。活页面会原地更新,所以正文不再发布字符总数和词频命中数。
有一件事本文不主张:换模型没用。已审来源没有给出能预测这种比较的数字,我们也没有。
FAQ 里的覆盖清单
清单在 Turnitin 的 AI 写作检测 FAQ 页上,同一页出现了两次:一次在「How does it work?」的回答里,一次在「Which AI writing models can Turnitin's technology detect?」这个问题下面。两份的开头一模一样。
「Currently, Turnitin's AI writing detection model for English submissions can detect content from GPT-4o (released 2024-05) ...」(目前,Turnitin 面向英文提交的 AI 写作检测模型能检测出以下模型产生的内容:GPT-4o(2024-05 发布)……)
值得多看一眼的是那个动词。`can detect content from` 说的是覆盖范围,不是「曾经拿它测过」。这个方向上的偏差在中文和英文的转述里都很常见,而且偏的方向总是把厂商的主张调软。2026 年 8 月 18 日审阅时,这句话点了多个 GPT、Gemini、Claude 版本,也包含 LLaMA、Mistral、Deepseek、Nova、Grok 和 o1-mini。这里记录的是当日出现的模型家族,不是一个永久总数。
每一条后面的括号里都有一个发布日期。这些日期不要采信。同一页上的两份清单,至少有两条的日期互相对不上,2026 年 8 月 18 日复查时仍然如此——也就是说不管你读到的是哪一份,页面自己已经在告诉你这些日期没人在维护。
那句话的结尾是 `and tools based on these LLMs as well`,紧接的下一句写着 Turnitin 会 `continue to expand our detection capabilities to other models in the future`(未来会把检测能力扩展到其它模型)。
Copilot 没被点名,能说明什么
多数人搜索时打的是产品名,不是模型名。上面点名的五个页面里,我们没有找到 Copilot 专属的覆盖结论、准确率主张或结果预测。这个发现只属于这五页,不能外推 Turnitin 的所有公开材料。
FAQ 的模型清单以 `and tools based on these LLMs as well` 收尾。如果某个工具使用清单里的模型,这条概括可能相关;但本文没有核实某个具体 Copilot 产品、模式和时间点背后用的模型。少了这条映射,就不能从概括条款推断某次 Copilot 提交会不会被标。产品名缺席,既不能证明豁免,也不能证明检出。
覆盖清单不是逐模型排行榜
英文 FAQ 的覆盖说明点了模型名,但没有给每个条目分别挂上命中率、准确率或难度排序。它给出的检测数字是整体误报目标:`under 1% for documents with over 20% of AI writing`(AI 写作占比在 20% 以上的文档,误报保持在百分之一以内)。这说的是整个检测器,不是 Claude 和 Gemini 谁更容易被标。
Turnitin 的其它页面也会点名模型。Product Updates 在 2026 年 5 月 5 日的西班牙语模型更新里列了 GPT 和 Gemini 版本;通用 Turnitin release notes 在 2026 年 8 月 18 日新增的阿拉伯语模型更新里,点了多个模型家族的版本。另有一份独立的 AI 写作检测模型更新日志,用更少的细节概括部分发布。由此可见,「只有 FAQ 点名模型」这个说法本身就不成立。
这些具名更新仍然不是一张稳定的逐模型概率表。发布覆盖变化,和预测下一份文件,是两种不同的主张。
那个百分比到底是怎么算出来的
FAQ 用一段话讲完了整条流水线,短到可以整段读:
「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score.」(提交进来之后,句子被抽出来切成互相重叠的片段送去预测。每个片段由检测模型分类,给一个 0 到 1 之间的值,表示这段文本更可能出自人还是 AI。片段内每个合格句子继承所属片段的分数。)
注意最后那半句里只有两类:很可能是人,很可能是 AI。不管谁跟你说检测器认得出某家模型的「指纹」,这是厂商自己对分类器输出的描述,里面没有第三格。Turnitin 也说过它的模型不是拿几个指标搭起来的:模型 `is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions`(没有被写死成去算「突发性」「困惑度」之类在公开讨论里常被提到的单项指标),而是 `instead, it learns statistical patterns from our training data`(而是从训练数据里学统计规律)。这个区分在实践中意味着什么,困惑度与突发性之外,AI 检测器还在测什么那一篇拆得更细。
如果你脑子里的画面是「一个生成模型配一个检测器」的那种一对一结构,FAQ 紧接在模型清单后面的这句话描述的方向正好相反:
「In July 2026, we updated our model architecture to consolidate a multi-model ensemble into a single model. This update improves and simplifies the AI writing report, maintaining a less than 1% false positive rate.」(2026 年 7 月,我们更新了模型架构,把多模型集成合并为单一模型。这次更新改进并简化了 AI 写作报告,同时维持低于 1% 的误报率。)
FAQ 描述的是一个分类器输出文本层面的概率。另一个句子才给出模型覆盖清单。7 月那句架构说明出现在 FAQ,却没有出现在独立的 AI 写作检测模型更新日志里。这个错位说明,必须把页面类型说清楚,不能把任何一张更新页当成穷尽的发布历史。
厂商自己把那个「像在指认工具」的区分撤掉了
2026 年 8 月 4 日,Turnitin 把报告里的两个类目合并成了一个。以前用紫色标出来的那一类——AI 生成、之后又被 AI 改写过——现在不再单独出现。它在产品更新页上给出的理由,是这家公司关于「工具指认」这件事说过的最直白的一段话,而且说的是它自己的用户:
「Reduce the risk of unwarranted academic misconduct reviews by removing distinctions that could be read to imply more certainty about the specific tool or workflow used to produce a submission」(去掉那些可能被读成「对提交内容用了哪个具体工具或哪套流程更有把握」的区分,以降低不必要的学术不端调查风险。)
一个 2024 年加进去的区分,2026 年被撤掉,原因是读的人从一份承载不了这种信息的报告里读出了工具身份。同时没有变的那半边也要一起看:宣布这次合并的那条发布说明写着模型 `will continue to detect likely AI generated content that may have been further modified by AI paraphrasers or bypassers`(会继续检测可能又被 AI 改写工具处理过的、疑似 AI 生成的内容)。界面上颜色少了一种,底下的检测主张没动。
这里有个很实际的推论。如果你看到的截图里还有紫色,那份报告不是按现行规则出的:Turnitin 说这次更新只对新提交的文件生效;旧提交若要生成更新后的报告,需要重新提交。先给报告定个日期,再拿它推理。当前这个百分比涵盖什么、不涵盖什么,见怎么读一份 Turnitin AI 检测报告。
同样这几页里,写明了会影响分数的是什么
首先是长度,而且方向和很多人想的相反:篇幅短不会更安全,只会让结果更粗糙。
「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(在只有几百词的短文档里,预测结果基本是「全有或全无」,因为只有单个片段、没有重叠的机会。这意味着一段混合了 AI 生成与原创内容的文本,可能被整体判成完全由 AI 写成。)
这是文档的属性,不是执笔者的属性。Turnitin 描述自家误报时点出的那几条也一样:
「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.」(误报有时会出现在这类内容上:结构变化不多、字面上自我重复、或者虽然改写过但没有产生新想法的文本。)
结构变化、重复、想法有没有推进——每一条都是把来源遮住也能量的东西,没有一条是某个厂商。这推不出「换模型没用」,把它写成那个结论也不诚实,因为这几页根本没有讨论这种比较。它只说明一件事:大家花时间最多的那个变量,恰好是官方文档里说得最少的。如果你被标了、而东西确实是你自己写的,先看被标记了,但确实是你自己写的:怎么准备申辩。
站在我们这个位置,能诚实说的部分
我们卖的是文档改写工具,这一节请带着这个前提读。我们不承诺检测结果,理由不是谦虚:检测系统会更新。公开的 Product Updates 页面记录了 8 月 4 日那次报告变化,这已经足以说明报告本身会变,不需要再猜谁另外收到了通知。
能诚实描述的是范围和成本,所以 HumanPen 只描述这两样。一份 Turnitin 或 iThenticate 报告说到底是一串坐标;把它和文件一起交过去,改写就被圈在这些坐标里,之外的句子还是你原来的措辞。积分算的是正文里有多少被动过,跟文件多大无关。符合条件时可以免费继续降 AI。
也确实存在「这类工具就是不该用」的情况,这个我们单独写过:什么时候「整份文档改写」是错的工具,六种情形,每一条都引自我们自己的页面,答案是你自己动手。
常见问题
Copilot 没被点名,是不是就没事? 已审的五个页面没有给 Copilot 专属结论。FAQ 那句 `and tools based on these LLMs as well`,在工具使用清单内模型时可能相关;但我们没有核实某个 Copilot 产品、模式和时间点背后的模型。一个名字缺席,预测不了某次提交的结果。
清单里的这些模型,哪个更安全? 已审页面没有提供一张稳定的逐模型排行榜。Product Updates 和 release notes 有时会在覆盖更新里点名模型,但那不是下一份文件的概率表。某个人拿自己的提交跑出的百分比,是另一种性质的证据,读的时候也该按另一种性质来读。同一段文字在不同工具上为什么会差很多,见为什么同一段文字在不同检测器上分数差很多。
西班牙语或日语的提交适用吗? 那些使用独立的检测模型,而且不同页面公开的细节也不同。Product Updates 在 2026 年 5 月 5 日的西班牙语更新里列了 GPT 和 Gemini 版本;独立的 AI 写作检测模型更新日志概括同一次发布时没有带上同样的清单。通用 Turnitin release notes 又是第三个来源,不能把三者混叫成一张发布记录。语种边界的完整情况见非英语的提交,Turnitin 能查出 AI 吗?。
老师能看出我用的是哪个模型吗? 我们审阅的当前报告文档描述的是「很可能由人写成」与「很可能由 AI 生成」,没有模型名字段。从 2026 年 8 月 4 日起,报告只剩一个「AI 生成」类目;它给这次合并写的理由,就是要去掉那些「可能被读成对具体工具或流程更有把握」的区分。
我用的是清单里某个模型的旧版本,结果会不一样吗? 已审页面不足以预测。FAQ 确实把版本分开列出,每个后面还带括号日期,但同一页的两份清单在部分日期上互相矛盾,也没有给每个版本分别挂上结果数字。就算某次更新点了版本名,也预测不了这一份文件。
继续阅读