IEEE 格式与 AI 检测:规范从你的句子里拿走了什么
有两条 IEEE 规定直接落在会被打分的句子上。一条把相关工作段落里的作者名和年份删掉,只留方括号里的数字;另一条让摘要成为一段没有任何引用、没有公式、没有脚注的连续散文。两条都不是可选项,也都不是你的写作。
HumanPen 团队
· 17 分钟
IEEE 格式的论文,一半句式是规范写的,为什么还被标红?
这里其实是两件事,分开看才清楚。IEEE 的编辑规范规定了你的引用语法、摘要长度、标题编号、图表题注开头,甚至点名了一批用词,而这些恰好压在检测真正会读的那部分文字上。另一件事是:双栏 PDF 不是文本文件,机器从里面取出来的文字,顺序未必是你写的顺序。前一件决定你的句子被允许长成什么样,后一件决定被分析的东西还是不是你那篇论文的正常语序。后一件你自己 30 秒就能验。
厂商那边一个字都没提过 IEEE,也没提过任何格式。2026 年 8 月 27 日我们把定义 AI 写作报告的三个官方页面(Using the AI Writing Report、AI 写作检测能力 FAQ、File requirements for an AI Writing Report)读完,渲染后正文合计 38,174 字符,逐词检索:`IEEE` 命中 0,`bracket` 0,`numbered` 0,`column` 0,`layout` 0,`caption` 0,`figure` 0,`heading` 0,`abstract` 0,`citation` 0。作为对照,这批文本上 `prose` 出现 12 次、`qualifying` 12 次、`PDF` 7 次,量具本身是活的。
反方向不是空的,而且里面有什么,值得数清楚。IEEE 的编辑规范抽出来是 141,011 字符,`artificial intelligence` 在里面出现 2 次。一次是那条披露规定,下文会逐字引全文;另一次在缩写附录里,是词条 `GenAI generative artificial intelligence`。也就是一条规定加一个词条,不是两条规定。规定正下方 IEEE 还附了自己写的致谢示例,`AI-generation` 和 `<AI system used>` 就出在那儿——你自己去搜这份 PDF,接着命中的就是这两处。要搜的话有个坑先说:这份 PDF 的文字层大量丢词间空格,搜 `artificialintelligence` 两处都能出来,搜带空格的那个版本可能一处都出不来。`Turnitin` 命中 0,`plagiarism` 0,`AI detection` 0;`detector` 的 2 次命中也都在同一个缩写附录里,其中一条是 `maximum-likelihood sequence detector`。也就是说,IEEE 对「你用 AI」有明确立场,对「谁来检测 AI」一个字都没有。这两件事经常被混成一件,但它们是两个问题。
规范把作者名和年份从你的相关工作里删掉了
先看那条几乎没人引用的规定,它埋在《IEEE Editorial Style Manual for Authors》参考文献那一节里:
`Do not say "in reference [1] …"; rather, the text should be written to read simply, "in [1]…" The author's name should not be included in a text reference with a number (i.e., "In Smith [1]") and should be changed to "in [1]" except in such cases where the author's name is integral to the understanding of the sentence (e.g., "Smith [1] reduced calculated time …").`
再往下两句,同一节把另一个标识也拿掉了:
`Reference dates should not be used as reference identifiers and should be deleted in text except in rare cases where the date is somehow relevant to the article's subject.`
把同一段话放在两种体系下对比一下。在作者-年份体系里,相关工作段落满是专名和年份:某某(2021)做了什么,某某(2023)发现了什么,每句话的开头都不一样,因为开头是不同的名字。到了 IEEE,规范把名字拿掉、把年份拿掉,剩下方括号里的数字。真正还能变的,是动词。
还有一条规定,专门制造了那种长长的方括号串:
`The numbering of references is employed by citing one reference per number. Every reference in a Transactions reference list should be a separate number entry. Use of one reference number to designate a group of references is not permitted.`
所以综述句会以 `[12], [13], [14], [15]` 结尾,而不是用一个方括号把一组文献括起来。会议模板用自己的话说了同一件事,还顺带规定了标点的位置:
`The template will number citations consecutively within brackets [1]. The sentence punctuation follows the bracket [2]. Refer simply to the reference number, as in [3]—do not use "Ref. [3]" or "reference [3]" except at the beginning of a sentence: "Reference [3] was the first ..."`
这些都不是在挑 IEEE 的毛病。编号引用省地方,而在有页数上限的场合,省地方就是全部意义所在。它只是说明:相关工作那一段里,有多少东西其实不是你决定的。
摘要是全文密度最高的合格文本
规范在列文章各部分时直接给了数字:`Abstract, must be one paragraph and between 150 to 250 words.`(摘要必须是一段,150 到 250 词之间)。Abstract 那一节接着补上约束:
`In order for an Abstract to be effective when displayed on IEEE Xplore as well as through indexing services such as Compendex, INSPEC, Medline, ProQuest, and Web of Science, it must be an accurate, standalone reflection of the contents of the article. They shall not contain numbered mathematical equations, numbered reference citations, nor footnotes.`
IEEE 会议侧的写作指引换了套说法讲同一件事:一段、不超过 250 词、`self-contained with no abbreviations, footnotes, references, or mathematical equations`(自足,不含缩写、脚注、参考文献或数学公式)。
把这段当作对一个文本对象的描述,而不是写作建议来读。你的摘要是定长的单段,被要求准确反映全文、除此之外什么都不许有,而所有能把散文打断的装置——公式、方括号、脚注标记、小标题——全被明令排除。它是纯粹的连续散文,而且是你已经写完的那份文档的压缩版。
Turnitin 列自家误报特征时,其中一项是 `text that has been paraphrased without developing new ideas`(只做了改写、没有产生新想法的文本),紧跟着的一句是提醒读者,读那个数字时要把文本的这个性质算进去。这两份文档不是在讲对方,而且厂商没有给这个特征任何频率数字,所以没有人能告诉你它占多少。但 IEEE 摘要之所以是这个形状,是因为一份规范把它做成了这个形状。
什么在分析范围里,以及厂商唯一公开排除的那一样
Turnitin 把自己读的东西定义为「段落里的散文句子」,并说这个百分比 `is not necessarily the percentage of the entire submission`。把这条定义套到 IEEE 的各个部件上,是我们的对照,不是厂商的裁定。
| IEEE 论文的组成部件 | IEEE 的规定 | 是不是「段落里的句子」 |
|---|---|---|
| 一级标题 `I. INTRODUCTION` | 用罗马数字编号、居中、全大写 | 是标签,不是句子 |
| 二级标题 `A. Formal Frameworks` | 大写字母加句点、左对齐、斜体 | 否 |
| 嵌入式标题 `1) Sophisticated Local Control:` | 阿拉伯数字加右括号、缩进一个 em、后接冒号 | 它引出的那句话是散文 |
| 图题 `Fig. 1. Theoretical measured values of n.` | `Fig.` 加编号加句点加一个 em 空格;`In general, do not use A, An, or The at the beginning of a figure or table caption` | 通常是短语,不是完整句 |
| 表题 | `TABLE` 加罗马数字居中置于表上方,说明文字在其下,末尾不加句点 | 否 |
| 摘要 | 一段、150 到 250 词、不含引用、公式与脚注 | 全部是散文 |
| Index Terms | 按字母序排列的关键词,作为摘要区最后一段 | 是列表 |
| 正文中带 `[12], [13]` 的句子 | 编号引用,一个编号只对一条文献 | 是散文句子,只是里面有方括号 |
| 独立公式 | 连续编号,编号加括号右对齐 | 否 |
| 首页脚注 | 收稿与修回日期、经费、单位、通讯作者 | 否 |
| 参考文献表 | IEEE 著录格式,按引用顺序编号 | 按厂商自己的 release note,被排除 |
最后一行值得说准,因为这一行最多人记反。厂商为 AI 写作报告公开写明的排除项只有参考文献一项,出处是 2023 年 8 月的一条 release note:它说修掉了在参考文献条目里高亮 AI 写作的 bug,并写明 `Bibliographies are now excluded when processing the AI writing report.`,同一条还说要重新提交才对已有文档生效。
由此推不出的是:你句子中间那个 `[12]` 也被排除。在那三个页面里检索,`citation` 命中 0,`bracket` 命中 0。一句话里有方括号,它仍然是一句话。这类混淆的完整版本,包括哪些排除项其实属于相似度报告而不属于这一份,见Turnitin 为什么把参考文献和引用标出来?那些排除项到底管到哪一步和Turnitin AI 检测跳过哪些内容?非散文、代码等。
还有一个算术上的后果。把标题、图表题注、公式、关键词、首页脚注和参考文献从一篇六页的会议论文里减掉,剩下的散文比页数暗示的少得多。厂商的文件要求写明,一次提交至少要有 300 词的长文散文才会生成报告。
你那份双栏 PDF 复制出来长什么样
这一段讲的事验证成本几乎为零,而几乎没有人去验。
PDF 存的是「某个字形在某个坐标」。它不存你的阅读顺序。把文字取出来是一次重建,而在 IEEE 的双栏版式上,这次重建必须自己猜一栏在哪儿结束。
为了看清这件事在真实文件上是什么样,我们从 arXiv 取了一篇五页的 ICASSP 2026 论文(`arXiv:2608.25794v1`),2026 年 8 月 27 日用 `pdfplumber` 抽了一遍。整篇出来是 26,572 个字符、2,162 个以空白切分的词元。输出的第 5 到 12 行在左栏摘要和右栏引言之间逐行交替,于是摘要里的一句话后面紧跟着引言里毫不相干的一句。词间空格也没保住,标题出来是 `COOPERATIVEMULTI-AGENTREINFORCEMENTLEARNINGFORADAPTIVE`。第二页那张图贡献了 `(cid:16) (cid:17)` 这类词元,全文共 29 处。参考文献表里,第 `[3]` 条和第 `[15]` 条占着同样几行。
两条限制先说清楚,别拿这个过度发挥。这是一个抽取器在一个文件上的结果,而 Turnitin 没有公开它用哪个抽取器、怎么处理多栏版式,所以这里没有任何一句话在说这篇论文的 Turnitin 报告会长成某个样子。另外,引用方括号本身倒是完好通过了:全文 51 个方括号词元,包括写成 `[3,4]` 和 `[17,18]` 的区间。
它真正说明的是:所有关于分数的讨论底下都压着一个假设,而这个假设值得验一次。打开你提交的那份 PDF,全选、复制、粘进纯文本编辑器,读第一屏。如果摘要和引言在那里是交错的,那就是下游任何一方拿到的东西的形状。
Turnitin 的文件要求页从另一侧碰到了这件事,写在最佳实践里,而不是写成规则:
`When using Turnitin's AI writing detection for assignments, it's best practice to have all students submit their work in the same file format (e.g., all .docx or all .pdf). This helps maintain uniformity in how submissions are processed.`
也就是说,厂商认为文件格式是个变量,变量大到值得建议一个班统一格式。它接受的类型是 `.docx, .pdf, .txt, .rtf`。如果学校的作业口收 DOCX,那就交 DOCX:字处理文件本来就按阅读顺序存文字,下游没有人需要去判断一栏在哪里结束。用 LaTeX 编译的时候未必有这个选择,但这件事最好是提前知道,而不是事后发现。旁边那个问题——你的文献管理软件往文件里吐的是什么——见为什么 Zotero 和 EndNote 导出的引用有时不符合要求。
这些规定之后,还剩下哪部分是你的
对规范公平一点:它是一套 house style,而且自己说明了这一点。它的编辑理念一节写着 IEEE 做的是 `a mechanical edit`,并且 `we do not try to change an author's style of writing`。上面引的那些规定管的是引用语法、标签和长度,不管你怎么论证。同一节还有一句对非英语母语作者有用的自陈:`some are from authors unfamiliar with the English language`,接着说这类作者可以去 IEEE Author Center 寻求语言帮助。语言背景和检测分数是另一条线,展开在非母语写作被标记为 AI?文档怎么说。
所以论文是分得开的,而且这个划分用得上。
IEEE 还规定了一件事,正好是很多人问「AI 和论文」时真正想问的那件,放在这里说。规范里有一条披露规定,而且写明了披露写在哪儿:
`The use of content generated by artificial intelligence (AI) in an article (including but not limited to text, figures, images, and code) shall be disclosed in the acknowledgments section of any article submitted to an IEEE publication. The AI system used shall be identified, and specific sections of the article that use AI-generated content shall be identified and accompanied by a brief explanation regarding the level at which the AI system was used to generate the content. The use of AI systems for editing and grammar enhancement is common practice and, as such, is generally outside the intent of the above policy. In this case, disclosure as noted above is recommended.`
后两句要慢读,因为动词换了。文本、图、图像和代码是 `shall be disclosed`(应当披露),而且披露要点名用了哪个系统、哪几节用了。编辑与语法润色被单独划出去,说这是常规做法,披露是 `recommended`(建议),不是必须。你这次改动算哪一类,得你自己判断;拿不准就去问,别自己猜。这和任何一份报告怎么说你的论文没有关系。
规定的部分,就让它保持规定的样子。 方括号格式与引用顺序。句首也写 `Fig.`。罗马数字的章节标签。写 `in Section II-A`,而规范明确要求不要用 `Subsection` 这个词。摘要长度。参考文献按 IEEE 格式著录。会议侧还要加一项:模板自带的说明文字。模板页对这一项写了一句带后果的话:`Failure to remove template text from your paper may result in your paper not being published.`(未删干净模板文字可能导致论文不予发表)。这是整张清单上唯一写明了后果的一条,值得在投稿前搜一遍,而不是投完再说。
你自己的部分,通常也是初稿里最薄的部分。 为什么是这个问题而不是隔壁那个。前人的方法具体做不到什么,说得足够具体到别人可以反驳你。你的结果覆盖不到哪儿。下一步你会去测什么、为什么。IEEE 会议侧的指引要求引言先给研究现状、再收到你的具体课题,最后 `End with a description of the exact question or hypothesis that your paper will address`。那是三个动作构成的形状,不是一段模板,而这三个动作没有任何规定好的措辞。
还有一件和分数完全无关的事。相关工作如果写成「一条文献一句话,每句都说某人提出了某方法」,它做的事比同样篇幅用来讲清楚这些方法为什么分成这几派要少。后者更好读也更好审,而且那正是句子形状还有地方可去的部分。
真要动手改之前,先算清成本
改一篇 IEEE 论文,慢的地方不在写。随便挑一段动过的文字,里面可能同时躺着四条方括号引用、一处 `[1, eq. (8)]` 形式的交叉引用、两个 `Fig.` 指代和一个 `Section II-A` 指针,这些全部对着当前编号核过一遍,这段才敢用。只要有一条参考文献改了号,核对范围就会扩散。成本要按「打开了几段」算,不是按「改了几个词」算。
范围因此是第一个该看的东西。HumanPen 是我们自己做的,下面这段按第一方说明读,不是中立推荐。要改哪几段有两条路。一条是自己把段落加进去。另一条是把手头已有的那份 AI 报告传上去(Turnitin 与 iThenticate 出的都收),由报告里标出的位置画线。线上说明写明段落是引擎改写的最小单位,圈选如果停在段落中间,它会补齐到整段再摆出来让你点头,画好的线之外不动。收费也照这条线算:没被改写的词不进账单。术语、引用、结构、版式与样式都在它声明要保住的清单里,文件进去是什么格式回来还是什么格式,站上自己的指引是复杂文档下载后要复核。符合条件而仍被标红的片段,可以免费继续降 AI。
对一篇满是编号交叉引用的论文来说,「下载后复核」指的是一份具体的核对表,不是通读一遍:每一个方括号、每一处 `Fig.` 和 `Table` 指代、每一个 `Section` 指针,对着你真正要提交的那份文件里的编号过一遍。文档层面上一次往返会破坏什么(含域和交叉引用),写在Word 的域、目录与交叉引用:为什么纯文本往返会破坏学位论文。
这里没有一句话在预测分数。Turnitin 自己说,它的模型 `may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student`,下一句还要求在此之上加人的判断。
常见问题
句子里的 `[1]` 会被算进去吗? 公开材料里没有任何一句说它被排除。厂商为这份报告写明的排除项只有参考文献一项,出自 2023 年 8 月的一条 release note;而按上面那次实读,定义这份报告的三个页面里 `citation` 和 `bracket` 都是零命中。一句话里有方括号,它仍然是散文句子。
参考文献表会被打分吗? 同一条 release note 说,处理 AI 写作报告时参考文献已被排除,并补充说已有的提交要重新提交才生效。所以这条改动之前生成的报告,和之后生成的报告不是同一次测量。
该交 DOCX 还是 PDF? 这通常由收文件的一方决定。你能控制的是,在交出去之前先知道自己的 PDF 复制出来是什么样。厂商自己的最佳实践是一个班统一用一种格式,理由是这有助于保持处理方式的一致;它接受的类型是 `.docx, .pdf, .txt, .rtf`。
相关工作整段被标红,但每句都是我自己写的。 这种组合正好落在厂商自己描述的误报特征上,而那一段的收尾是建议看百分比时把文本性质考虑进去。它不能在任何方向上判定作者是谁。相关指引汇总在AI 比例偏高时,厂商是怎么教老师处理的。
会议论文和期刊论文有区别吗? 机制一样,构成不一样。有页数上限的会议论文里,图、表、公式和题注占比更高,能进分析的散文因此更少,这一层见会议论文与 Turnitin AI 检测:你需要知道的事和短文档的「全有或全无」:为什么几百词的稿子分数会走极端。
用了改写工具要不要声明? 这是披露问题,和检测报告说什么是两件事。IEEE 直接给了答案:AI 生成的内容 `shall be disclosed in the acknowledgments section`(应当在致谢部分披露),并且要写明用了哪个系统、影响了哪几节;而用 AI 做编辑和语法润色被单独划出去,说这是常规做法,披露是「建议」不是「必须」。这里没有一句话在告诉你,你这次改动算哪一侧——我们也没有资格替你定。投稿前去读你那个刊/会自己的原文,不要读别人的转述。各大出版社的 AI 披露政策对照把主要几家摆在一起。
公式会影响分数吗? 厂商说它对非散文形式的 AI 文本检测不可靠,而独立公式不是散文句子;引出公式的那一段是。完整说明见Turnitin 如何处理数学公式和非散文内容。
继续阅读