破折号是 AI 写作的马脚吗?
这条说法背后的观察没问题,往下推的那一步有问题。而人们随手采取的补救——全文替换——是对一份已经定稿的文档做的最大一次改动,也是最不被看一眼的一次。
HumanPen 团队
· 23 分钟
先说结论
厂商自己的文档里我们找不到任何东西支持这条说法,下一节会把检索过程原样摊开。2026 年 8 月 18 日,我们检索了 Turnitin 的三个帮助页——AI 写作报告使用指南、AI 检测能力 FAQ、文件要求页。三页加起来,字符串「dash」总共命中一次,还是「dashboard」里的那个 dash;「punctuation」总共命中一次,出现在一句解释里——检测器「is not tuned to target Grammarly-generated spelling, grammar, and punctuation modifications to content」(并非针对 Grammarly 做的拼写、语法、标点修改而调校)。而那个直接问「模型到底看哪些参数」的问题,官方是完全用词序列来回答的。所以关于这个标点,说得最斩钉截铁的那条建议,背后并没有一句我们能找到的、造检测器那家公司说过的话。
这不等于证明了破折号一定不起作用。一个靠训练数据学统计规律的模型,没有义务把它学到了什么全部公布出来,公开材料也排除不了破折号贡献了一点点。缺的是另外半边:我们也找不到任何东西支持给它单独计权。而人们随手采取的那个补救——把全文的破折号一次替换掉——等于把一份文档几乎每一段都动了一遍,一个键完成,没有人再读一眼。
一句话里塞了两个不同的说法
「破折号是 AI 的马脚」被当成一件事在说。它其实是两件,而这两件之间没有任何东西把它们连起来:
- 模型生成的文本里破折号很多。 这是关于模型输出长什么样的陈述,谁都可以自己去看。
- 破折号会推高 AI 检测分数。 这是关于某个分类器怎么给特征计权的陈述,厂商之外没人看得到。
第一句完全成立、第二句同时是假的,这在逻辑上毫无障碍:某个特征在一个群体里常见,并不能告诉你一个在两个群体上训练出来的检测器会怎么用它。本来就爱用破折号的人写的文本,正是第二句会打偏的那一类,而第一句对他们会怎么样一个字都没说。
这个道理的通用版本我们说过。AI 检测器到底在测什么里就写着:一段文字不会因为带了某一个显眼的写作习惯就拿到高分。这篇要做的事更窄一点:我们去查了这个具体的习惯在厂商自己的文档里到底有没有出现过——一条传得这么广的说法,总该在某处有一份文件撑着。
我们去查了什么,查到了什么
三个页面,2026 年 8 月 18 日取页,取渲染后的正文文本,不区分大小写检索:「Using the AI Writing Report」「Turnitin's AI writing detection capabilities FAQs」「File requirements for an AI Writing Report」。这三页是讲机制和文件规则的地方;版本更新日志、已知问题页不在本次检索范围内。下表数的是出现次数,不是行数。
| 检索词 | AI 写作报告使用指南 | AI 检测能力 FAQ | 文件要求页 |
|---|---|---|---|
| dash | 0 | 1,在「dashboard」里 | 0 |
| em dash | 0 | 0 | 0 |
| hyphen | 0 | 0 | 0 |
| punctuation | 0 | 1 | 0 |
| character | 0 | 0 | 0 |
| comma | 0 | 0 | 0 |
| 「300 words」(灵敏度对照) | 1 | 1 | 1 |
最后一行必须有。因为「检索到零」和「压根没抓到那一页」,从外面看起来一模一样。一个已知三页都有的短语各命中一次,上面那一片零才算数。
于是只剩下一个真命中。它所在的那一整段是这样的,回答的是「学生用 Grammarly 查语法会不会被判成 AI」:
「No. Our detector is not tuned to target Grammarly-generated spelling, grammar, and punctuation modifications to content but rather, other AI content written by LLMs such as GPT-3.5. Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector. Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector.」(不会。我们的检测器并非针对 Grammarly 做的拼写、语法、标点修改而调校,针对的是 GPT-3.5 这类大模型写出来的 AI 内容。在我们对无 AI 内容的人写文档所做的测试中,多数情况下 Grammarly 免费版与高级版、以及其它语法检查工具做的修改没有被判为 AI。请注意,这不包括 Grammarly 生成式功能产出的内容,包括起草、改写、摘要等;用这些功能产出的内容很可能会被我们的检测器判为 AI 生成。)
要按它本来的样子读。它说的是一个语法工具改了什么,不是你的破折号;它写的是「in most cases」而不是「从不」;而最后两句在生成式功能那一侧用力拉向相反方向。这条界线落在哪里,我们在Turnitin 会检测 Grammarly 吗里拆过。在本篇里它只有一个用处:这三页里,标点和检测出现在同一句话里的地方就这一处,而这句话的指向是背离标点级调校,而不是走向它。
再看那个本来最有可能正面回答我们的问题。在小标题「What parameters or flags does Turnitin's model take into account when detecting AI writing?」(Turnitin 的模型检测 AI 写作时考虑哪些参数或标志?)之下,实质那一句是:
「Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.」(我们的分类器被训练来识别这些词概率上的差异,并且擅长识别人类写作特有的词概率序列。)
词概率。词的序列。当它自己的 FAQ 直截了当问「模型到底看什么」时,厂商给出的答案落在这个层级上。
公开材料里没有比「词」更小的单位
顺着官方对「一个分数是怎么算出来的」这段描述往下追,词汇在到达字符之前就停了:
「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1 … Each qualifying sentence within these segments inherits the segment's score.」(论文提交后,句子被抽出来、切成互相重叠的片段做预测分析。每个片段由模型分类并给出 0 到 1 之间的值……片段内每个合格句子继承所属片段的分数。)
片段、句子、qualifying text——同一份 FAQ 把它定义为由标准语法句子构成的文本块——以及词概率序列。这条链上出现的每一个单位都是词或者比词更大,而真正拿到一个属于自己的数值的最小对象,是横跨好几句话的一个片段;句子的分是从那儿继承来的。
破折号在这个片段的里面。把它拿掉,片段里还是同样那些词、同样的顺序——这恰好是替换标点不会改变的那件事,而词的顺序正是厂商点名的那件事。分词器层面在不在乎,是另一个问题,Turnitin 之外没人答得了,我们也不打算假装答得了。但这条建议通常是以「机制已经搞清楚了」的姿态给出去的,而公开的那套机制里没有留给它的位置。
破折号确实会改变的东西
删掉一个破折号,有一个可测量的后果你三十秒内就能自己验,而它跟检测毫无关系:Microsoft Word 在 em dash 和 en dash 处断词,在连字符处不断词——所以「cost—benefit」算两个词,「well-known」算一个词。把四十个不带空格的 em dash 换成连字符,你的词数就少四十。
对大多数文档这只是个冷知识。对一份卡在字数上限边上的稿子就不是了,而 Turnitin 自己的文件要求还给「能不能被处理」设了一个词数天花板——所以我们在Turnitin 能查一整篇学位论文吗里专门写过破折号和词数统计。注意这件事的形状:我们真能演示出来的那个效果,走的是词数统计器,不是分类器。
全删掉的代价
破折号在句子里是干活的。你拿什么替它,那个东西干的就是另一份活,这个选择不是化妆问题:
- 逗号把停顿变弱了。原本破折号扛着的那个真正的插入或转折,逗号要么弄丢,要么攒出一串连着的逗号,把句子的结构盖住。
- 分号把语域抬高了一档,而且要求后半截能独立成句。很多时候它并不能。
- 括号把内容降格成旁白。你对这段内容重要性的主张跟着变了——在讨论部分,这是论证问题,不是排版问题。
- 句号把一个想法切成两个。有时候是改善;有时候切断的正是这句话本来要建立的那个联系。
- 什么都不放成立的次数比多数人以为的多,而且是这张单子上唯一不引入新决定的选项。
然后乘上文档里的个数。全文替换会把这些决定全部按同一种方式做掉,一个动作完成,而动的那些文字,你本来根本不打算去碰。这大概是多数人对一份定稿会做的最大一次改动,也是最不被看一眼的一次。
另外,如果你的文档受某个格式规范约束,那么该管你破折号的是那份规范,不是某条帖子。至少「我这些破折号哪些该是 em、哪些该是 en」是个有答案的问题。
这条说法里站得住的那半边
把关于分类器的那套理论剥掉,还剩下一样东西站着,但它指向的是一个人,不是一个分数。
相当一部分读者是相信这条规则的。如果你导师正好是其中之一,你那些破折号确实让你付出了真实的代价——一个印象,在第一页就形成了,跟检测器一点关系都没有。这个风险不依赖于任何关于软件怎么工作的说法,这恰恰是它更结实的原因。我们认为这半边值得当回事;同时声明这是我们的判断,不是任何公开材料里的结论。
但要看清,全文替换对付不了它。一个人在对你的文字形成印象的时候,反应的对象是一整页,不是在数字符;那个让他觉得像机器写的段落,把破折号换成逗号之后还是会让他有同样的感觉。真正能推动读者的是文字确实像你写的,以及你说得清它是怎么来的——这就是保留草稿的理由,这些材料实际怎么用得上,我们写在版本历史当证据里。
还有一层不对称,让「防御性写作」整体上是笔亏本买卖。多数配置下,你根本看不到自己正在对着写的那个数字:Turnitin 明写 AI 检测指标和报告对学生不可见,得有教师把报告下载下来分享给你,它才到得了你手上。而分数是真的,读你稿子的那个人也是真的。
改动要落在你还读得完的尺度上
不管你最后怎么处理破折号,有一条原则是有用的,而全文替换恰好违反它:把改动控制在你还能把改了什么读一遍的尺度上。每一处没被复核的改动,都是文档可以悄悄出错的地方。
HumanPen 是围着这个约束做的,不是围着标点做的。文件和一份 AI 检测报告(Turnitin 或 iThenticate)一起交进去,被标记的片段就是改动范围,范围之外保留你自己的措辞。粒度规则我们自己的页面写得很直白:最小改写单位是段落,选中的片段会补齐为完整段落后再计费。段落这个尺度,比本文讨论的那个东西高出好几级。
有两件事更适合当作边界说,而不是当作卖点说。计费只按实际被改写的词数算,所以圈定范围跑就按那个范围算,而不是按文件有多重算。符合条件时可以免费继续降 AI。
我们做不到的是给你一个数字。Turnitin 自己对模型的表述是:单次预测「may not always be explainable in simple feature-by-feature terms」(未必总能拆成逐特征的解释),而且它没有公布过任何把「一次修改」映射到「分数变化」的东西——所以谁给你报一个改完的百分比,谁就是在报一个他手里没有的数。线以下更糟:1% 到 19% 一律显示成一个星号,不给百分比、不给高亮,也就是说这一档里真实发生的改善对所有人都是不可见的,包括你自己。想知道两个工具对同一段话为什么给出不同的数,看检测器之间为什么互相打架;如果你手上已经握着一份报告,从怎么读懂 Turnitin 的 AI 写作报告开始。
常见问题
把破折号全删掉,AI 率会降吗? 没人能告诉你,而且不管说「肯定会」还是说「肯定不会」,都超出了已公开材料能支撑的范围。我们能报告的是:我们检索的那三个 Turnitin 帮助页里没有任何一处提到破折号;标点在这三页里唯一出现的那一处,说的是检测器并非针对标点修改而调校。
模型是不是真的比人更爱用破折号? 很可能是,而且这是一条你自己拿生成的文本就能验的说法。但它和「检测器给这个特征计权」是两条不同的说法,前者推不出后者。
删掉它们有没有可测量的效果? 有一个你自己就能验的,而且跟检测无关。Word 在 em dash 处断词、在连字符处不断词,所以把不带空格的 em dash 换成连字符,每换一个词数就少一个。
导师说我的破折号看着像 ChatGPT 写的,怎么办? 把它当成一个读者的印象,因为它本来就是。印象要靠草稿、笔记、以及你能不能把自己的论证从头讲一遍来回应,靠全文替换是回应不了的——他根本不会注意到你换过。
是不是干脆换一种写法来避开这整件事? 故意压低自己的写作水平,代价是确定的分数损失,收益是对着一个你通常无权查看的分数下的一次没有量过的赌。厂商自己公布的误报特征——结构变化少、字面上重复自己——那张单子上没有标点这一项;顺着那张单子能做的手工修改,我们写在不借助工具怎么给 AI 文本去味里。
继续阅读