AI 检测器至少要多少字:五家厂商自己公布的下限

改完被标红的那一段,把它贴进免费检测器看一眼——这是最自然的动作,也是这几家厂商在自己文档里专门提醒过的那种情况。五家公布了最短长度,其中一家还公布了两次自测:他们的人亲手写了一小段,工具判它是 AI。

HumanPen 团队

· 10 分钟

AI 检测器至少要多少字,那个数字才算数?

这里每一家都公布了一条下限,而一个自然段通常落在其中大多数之下。 以下数字都来自厂商自己的文档,2026 年 9 月 18 日核对:

工具它自己公布的
Copyleaks —— 硬下限"For the AI Detector to get an accurate reading, it requires a minimum of 350 characters"(AI 检测器要得到准确读数,至少需要 350 个字符)——注意单位是字符,不是词
Copyleaks —— 建议送检量"we suggest testing text containing an average of 350 words"(我们建议送检的文本平均在 350 词左右)
Winston AI"Minimum 300 characters. Texts under 600 characters may produce unreliable results and should be avoided."(最少 300 字符。低于 600 字符的文本可能产生不可靠的结果,应当避免)
Originality.ai网页版最少 100 词;API 没有下限,但"accuracy is decreased for texts below 100 words"(低于 100 词的文本准确度会下降)
ZeroGPT"At least 150–200 words; longer text (500–1,000+) improves stability."(至少 150–200 词;更长的文本(500–1,000 以上)会让结果更稳定)
Turnitin散文正文不足 300 词,根本不出 AI 分

上面有两条线是按字符写的,其余是按词写的——这正是最容易混的地方。换算很快:英文散文里一个词连同后面的空格大约占 6 个字符(本站已发布的 5,357 个段落实测中位数是 6.0)。换算之后,表里每一条线都能换成词数:Winston 的 300 字符下限约合 50 词、它那条「低于 600 字符应当避免」约合 100 词;Copyleaks 的 350 字符下限约合 58 词,它建议的送检量是 350 词;Originality 的下限是 100 词;ZeroGPT 要求至少 150 到 200 词,并说 500 到 1,000 以上更稳;Turnitin 是 300 词。拿你自己那段去对这几个数就行。给个尺度参照:我们把同样这 5,357 个英文段落拿去对同样这几条线——54% 够得着 Winston 的 300 字符,39% 够得着 Copyleaks 的 350 字符,6% 够得着 Originality 的 100 词,0.5% 够得着 ZeroGPT 的 150 词,而 Copyleaks 建议的 350 词,一个都够不着。中位段落是 51 词、312 字符:七条线里只过了一条——Winston 的 300 字符,其余六条都差着。

有两件事值得分开说。下限是「厂商不再为自己那个数字背书」的那条线——但它并不总是「低于它就什么都不返回」的那条线。有的工具照样返回:Originality.ai 说它 API 里的检查 "have no word count minimum"(没有词数下限),紧接着告诉你低于 100 词准确度会下降;也有的干脆不给,Turnitin 就是其中之一。所以屏幕上出现了一个数字,本身并不说明工具认为这份样本够大。

为什么「刚改完的那一段」是最难判的一种样本

把被标出来的那段改掉,把改完的那段贴进检测器,看一眼数字,据此判断自己过没过。Originality.ai 的帮助中心把这个动作排在它的误报成因清单前列:

You are more likely to receive false positives by only scanning part of the entire piece of content: a single paragraph, the intro, the conclusion, half of the paper... etc.(只扫整篇内容中的一部分——某一段、引言、结论、半篇论文等等——更容易拿到误报。)

紧接着的下一句给了替代做法:"We can fix a lot of false positives by scanning the entire piece of content instead of a snippet. This just gives our tool more context and more content to go off of."(很多误报只要把整篇内容送检、而不是送一个片段,就能解决。这样工具能拿到更多上下文、更多内容可依据。)

同一页上还有两次厂商拿自己做的实测,这比建议本身更少见、也更有用:

  • 一段 50 词的博客引言,由写这篇帮助文档的人亲手写成,检测结果是 79% AI
  • 一段 107 词的结论,同样是亲手写的,结果是 69% AI。页面给的解释是:结论既短又套路化——"You summarize everything before, give the reader more options and places to click, and finish up with any final calls to action."(你把前面的内容总结一遍,给读者更多选择和可点的去处,最后收在若干行动号召上。)

两个数字都来自人写的文本。它们不是关于你写作水平的证据,而是关于「短而结构可预测的片段会把分数抬成什么样」的证据——而一篇论文的引言和结论,天生就既短又套路化。

短片段还会改变排版在读数里的分量。Copyleaks 的限度页说它的检测器读的是上千种模式,"not just words or formatting"(不只是词语或排版),随后补了对短样本要命的那一句:"Numbering, bullets, and outline-style headers are only one small part of the overall signal, but in very short texts they can have a larger relative impact to overall AI detection scores."(编号、项目符号和提纲式小标题只占整体信号的一小部分,但在很短的文本里,它们对整体 AI 检测分数的相对影响会更大。)一段带三个编号步骤的方法描述,正好是这个形状。

还有第二个理由,和长度无关:刚改完的那一段,恰恰是全文中被编辑得最重的一段。Originality 那一页对「用过工具」说得很直:"In general: if a tool interacted with your content in any way, it will raise the AI score"(总的来说:只要有工具以任何方式介入过你的内容,AI 分就会上去),而且它把语法检查工具和聊天机器人并列在一起。无论你怎么看这条口径,它意味着你手上那一段带着最多的编辑痕迹,而你正要求工具单独去判它。

逐句读数比整篇读数更弱

现在多数检测器都会给单句上色,这很容易让人逐句去读报告。有两家厂商直接说了:这种更小范围的读数,分量不如整体那一个。

Winston AI 的 API 文档在介绍逐句得分数组时补了一句:"Please note that assessments on smaller samples are less accurate than the general score."(请注意,对更小样本的判定,准确度不如总分。)

GPTZero 关于逐句高亮的说明走得更远,而且它回答了一个我们反复被问到的问题——为什么把高亮的句子改掉,分数却没动:

Some sentences in an otherwise AI or human document might not show up as highlighted. They may still have an effect on your score, but they aren't more likely than other parts of your document.(在一篇整体偏 AI 或偏人写的文档里,有些句子可能不会被高亮出来。它们仍然会影响你的分数,只是并不比文档其它部分更可疑。)

接着是带上理由的那一句:"You may find that adjusting an entire document changes your score more than just adjusting the sentences. This is because our detector holistically analyzes the document, and its prediction can depend on a pattern that affects the bulk of the text."(你可能会发现,调整整篇文档对分数的改变,比只调整那些句子更大。这是因为我们的检测器是整体分析文档的,它的判断可能取决于一个覆盖大部分文本的模式。)

这等于厂商自己在说:高亮并不是一张完整的地图,它标不出是什么造成了这个数字。检测器实际在测什么讲的是这些分数怎么算出来、以及那套流传最广的解释为什么已经过时;这里的结论更窄——如果你把高亮的句子当成需要处理的全部清单,按厂商自己的描述,你手上就是一张不完整的地图。

同一段文字、同一个工具、不同的答案

能改变读数的不只是长度。Copyleaks 让机构在三档灵敏度里选一档,并且公布了每一档对应的误报率和漏报率:

档位Copyleaks 自己的描述误报率漏报率
Extra Safe(最保守)"Designed to minimize false positives by using additional AI detection based filters."(通过额外的 AI 检测过滤器把误报降到最低)0.010%0.5765%
Balanced(默认)"Ideal for detecting AI content while minimizing false positives."(在尽量少误报的前提下检出 AI 内容)0.0295%0.174%
Extra Sensitive(最敏感)"Our most sensitive model, designed to flag AI text that was put through a 'humanizer' or text spinner."(我们最敏感的模型,用于标出经过「人性化」工具或词句改写器处理过的 AI 文本)0.1973%0.063%

把第一行和最后一行放在一起看:从最保守那一档换到最敏感那一档,厂商公布的误报率从 0.010% 上升到 0.1973%,大约是原来的二十倍——而这是别人屏幕上的一个开关。你看不到它被拨在哪一档,你拿到的报告里也不会写。

所以当你自己查的结果和学校查的结果对不上时,在「肯定有一边坏了」之前,至少还有三种更平常的解释:工具不同、同一个工具的档位不同、送检的文本量不同。两个 AI 检测器为什么给出不同的分数把其余几种也讲了。

真正算数的那次读数,是在整份文件上做的

不管你在家里跑什么,真正有后果的那个数字,由你学校的工具、在你提交的那份文件上、按它自己的设置产生。散文正文不足 300 词,Turnitin 根本不会给 AI 分;而刚过这条线的文档,它形容自己的判断接近「全有或全无」——这对短作业意味着什么是另一篇的题目。

Turnitin 较新的 Clarity 作业也按同样的思路公布了一个工作区间:"For Turnitin Clarity to work optimally, we recommend a minimum word count of 300 words and a maximum of approximately 2,500 words."(为了让 Turnitin Clarity 发挥最佳效果,我们建议字数不少于 300 词、不超过约 2,500 词。)而在开启 AI 写作检测的情况下,"submissions must be between 300 and 30,000 words"(提交内容必须在 300 到 30,000 词之间)。

至于你能不能自己跑一次检查,取决于学校开了什么、以及哪些界面对你开放,那是另一个问题,也有自己的答案:提交前怎么自查

那该怎么做

  1. 整篇送检,不要只送那一段。 这一条同时符合上面每一家厂商自己的建议:不用换工具、不用注册新账号、不用改设置,就是把同一次检查放在更多文本上。在按长度计费的工具上它确实更贵——Winston 的 API 文档写着 "Each word that is processed by the API consumes one credit."(API 每处理一个词消耗一个额度)——但它仍然是这些页面自己让你采信的那一次读数。
  2. 比较要可比。 改前改后的对照只有在工具、档位、送检文本量三者都一致时才说明问题。两次读数之间换了样本量,读数本身就变了。
  3. 预期数字会自己动。 模型是分版本的。Winston 的 API 文档里列着二十二个可选版本,从 2.0 到 4.18,默认用最新的那个。三周前的分数和今天的分数,可能出自两个不同的模型。
  4. 别把自己查的数字当判决,哪个方向都别。 在家查出来低,不等于放行,因为学校用的是另一个工具;在一段 60 词的片段上查出来高,也不等于结论:60 词只过得了上面七条线里的一条,其余六条都过不了。
  5. 留好你真正拿到的那份报告。 如果已经被标红了,有分量的是学校出具的那一份,不是你事后自己跑出来的读数。改完再查还是被标红讲了这种对照能说明什么、不能说明什么。

常见问题

有没有一个字数,过了它检测器就可靠了? 上面这几家没有一家宣称存在「过了这个点结果就确定」的界线。它们公布的是一条下限(低于它,它们自己说不可靠)和一个方向(越长越稳)。Copyleaks 的说法是"the accuracy of our detection increases as the text length increases"(文本越长,我们的检测准确度越高);ZeroGPT 的措辞是更长的文本"improves stability"(让结果更稳定)。

我那段 150 词的文字查出来 80%,是说里面 80% 是 AI 写的吗? 不是。这个混淆值得说清楚,因为这个混淆本来就藏在这些分数的命名方式里。Originality.ai 的帮助中心写得很直白:"an AI score of 90% doesn't mean that AI produced 90% of the content. It means that our tool is 90% confident that AI was used in some part to produce the content"(90% 的 AI 分不表示 AI 写了其中 90% 的内容,而是表示我们的工具有 90% 的把握认为 AI 参与了这份内容的某个部分)。「把握程度」和「占全文比例」在屏幕上长得一模一样,含义完全不同。而 Turnitin 的百分比又是第三种——它是合格文本中的占比。

那我把几段拼起来凑过下限行不行? ZeroGPT 自己就是这么建议的:"consider merging sections before checking."(送检前可以考虑把几节合起来。)这能让你过长度门槛,但此后那个读数描述的是合并后的整块,不是你原本担心的那一段。如果你的问题是关于某一段的,那么无论怎么拼,都得不到一个干净的答案——这是诚实的答案,不是让人舒服的答案。

这些下限对我学校的 Turnitin 报告也适用吗? 上面那些下限属于各家自己的检测器。Turnitin 有它自己的一套:散文不足 300 词不出分,而且只有散文句子才计入百分比。清单、表格、项目符号根本不在它测量的范围里,这也是高亮和数字看起来对不上的原因之一。

参考来源

继续阅读