随机对照试验报告与 AI 检测:CONSORT 2025 在你动笔前定死了哪些句子

随机对照试验报告在被人读到之前已经写过两遍:一遍是方案,一遍是论文,两遍对着同一个团队发布的两张编号清单。这张清单管到你标题里的一个单词。在因为一份检测报告去动手改句子之前,值得先弄清楚这件事。

HumanPen 团队

· 15 分钟

数据是我自己做的,为什么随机对照试验报告还是拿到高 AI 率?

因为试验报告的大部分内容在你动笔之前就被规定好了,而其中很大一块是你自己文档的第二遍复述。CONSORT 2025 列了 30 个必须覆盖的条目,规定标题里要出现哪个词,把各组人数赶进流程图、把基线特征赶进表格。剩下以连续散文形式存在的,主要是方法叙述和讨论,而方法叙述本身是一份已注册方案的压缩版。Turnitin 在完全没提过临床试验的几份文档里说,它只分析散文句子,并且它自己的误报可能出现在「结构变化少」或者「只做了改写、没有产生新想法」的文本上。方法部分被标红既不能证明它是怎么写出来的,而为了让段落看起来不那么整齐就去删清单要求的内容,只会让报告变差。

厂商那边一个字都没提过这件事。2026 年 8 月 27 日我们把定义 AI 写作报告的三个官方页面读完,渲染后正文合计 38,174 字符,逐词检索:`CONSORT` 命中 0,`clinical` 0,`trial` 0,`randomis` 0、`randomiz` 0,`protocol` 0,`checklist` 0,`registr` 0。同一批文本上 `prose` 出现 12 次、`qualifying` 出现 12 次,量具本身是活的。

反方向更容易想当然,所以也数了一遍。SPIRIT–CONSORT 官网站点地图上列出的 13 个内容页,加上 CONSORT 2025 清单和 12 页的扩展清单,合计 61,768 字符:`detection` 命中 0,`detector` 0,`Turnitin` 0,`generative` 0,`large language` 0,`ChatGPT` 0,`plagiarism` 0。同一次跑的灵敏度对照:`consort` 107 次、`trial` 167 次、`randomis` 36 次。`artificial intelligence` 只有 1 次命中,在扩展页上,指的是一个针对「干预措施本身是 AI 系统」的试验的 SPIRIT 扩展。那是「怎么报告一项关于 AI 工具的试验」,和「作者用 AI 写东西」是两码事。所以下面这条关联是我们自己搭的,两边的文档从头到尾没有提过对方。

清单管到你标题里的一个单词

CONSORT 2025 清单第 1a 条写的是 `Identification as a randomised trial`(在标题中标明这是一项随机试验)。而在把每一条摊开讲的扩展清单里,它说得更直白:

`Use the word "randomised" in the title`

一份报告规范管到一行标题里的一个单词。这条规则本身是好的,理由也硬:数据库和做系统评价的人要靠它检索到你的试验。它同时意味着,全世界这一类报告的第一行都带着同一个词。

第 1b 条接着规定摘要。它列出的必备内容是 7 个一级要点,其中 3 个又展开成 10 个子项,加起来点名了 14 样东西:目的、试验设计与框架、纳入标准与试验场所、干预与对照、主要结局、分配方式、盲法对象、各组随机人数、各组分析人数、各组结果连同效应量与精度、重要不良事件、总体解释、注册库名称与编号、经费来源。清单下面还有一句,原文用星号包着:

`Do not report information that does not appear in the body of the paper`

把它当写作约束读,这句话的位置很特别:摘要被要求是你自己论文的压缩,同时被要求不许出现正文里没有的东西。厂商那边描述自家误报特征的那一段里,有一个短语叫 `text that has been paraphrased without developing new ideas`(只做了改写、没有产生新想法的文本)。没有人在说这两份文档讲的是同一件事,它们不是。但按第 1b 条写出来的摘要天然落在那个描述里,而且除了各段的小标签之外,它从第一个字到最后一个字都是散文句子。

方法部分是你第二次写它

这一段是试验报告和其它体裁最不一样的地方,也是「加了张清单的论文」这个说法不成立的原因。

试验开始之前有一份方案。CONSORT 第 3 条要求你写明它在哪:`Where the trial protocol and statistical analysis plan can be accessed`,扩展清单进一步要求给出方案所在位置的 URL。第 2 条要求注册库名称、注册号、URL 和注册日期。第 10 条要求报告 `Important changes to the trial after it commenced including any outcomes or analyses that were not prespecified, with reason`(试验开始后的重要变更,含未预先设定的结局或分析及其原因)。

三条摆在一起,描述的是一个很具体的处境:谁怎么生成随机序列、分配怎么隐藏、谁被设盲、纳入排除怎么定、分析怎么计划,全都写在一份论文公开指向的文档里,而论文又把同样的内容再短一点地报告一遍。这不是偷懒,前瞻性注册要的就是这个。

方案那一侧有同一团队发布的规范,SPIRIT 2025,34 个条目的清单,和 CONSORT 一起更新、同一笔经费支持(网站页脚逐字写着 MRC-NIHR: Better Methods, Better Research,编号 MR/W020483/1)。所以两份文档不只是内容相关,它们各自对着一张成对更新的编号清单。

如果你觉得自己的方法部分读起来像在填表,原因就在这儿:学术出版里规定得最细的两份文档,先后在描述同一套流程,各自对着一张清单。顺带一句对中文读者有用的:官方翻译页目前列出的中文材料是 CONSORT 2010 那一版的清单、流程图和声明;挂在 CONSORT 2025 名下的翻译只有韩文一种(2026 年 8 月 27 日实读)。手里拿的是中文版清单时,先确认它对应的是哪一年。

数字是被规范主动挪出散文的

CONSORT 不只说要报告什么,对其中几条最重的内容,它还规定了报告的形式。

CONSORT 2025 条目规定的形式落到「只算散文句子」的量尺上
22a,各组随机、接受干预、进入主要结局分析的人数`In a flow diagram, the number of participants:` 后面跟一串要点,逐项列出各阶段人数一张计数流程图里没有散文句子
22b,随机后的失访与排除及其原因同样是 `In a flow diagram`同上
25,基线人口学与临床特征`A table showing baseline demographic and clinical characteristics for each group`均值、标准差和百分比组成的表格
27,各组全部不良或非预期事件`For each group preferably in a table with the number of participants at risk`以表格为主,周边有少量散文
2,试验注册注册库名称、编号、URL、日期是短行,不是句子
5a 与 5b,经费与利益冲突资助方名称、其在试验中的角色、已申报的利益常以短条目组成的声明块出现

把 Turnitin 划的范围放在旁边:

`This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.`

同一页紧接着的那句是:

`This percentage is not necessarily the percentage of the entire submission.`

参考文献也在外面。厂商 2023 年 8 月的一条 release note 说修掉了在参考文献条目里高亮 AI 写作的问题,并写明 `Bibliographies are now excluded when processing the AI writing report.`;同一条还说,要重新提交才对已有文档生效。

于是把流程图、基线表、不良事件表、注册信息行和参考文献都减掉。留在分析范围里的是引言、方法叙述、围绕表格的结果叙述,以及讨论——也就是 CONSORT 规定得最细、同时几乎不含你真实数字的那几部分。通用规则见Turnitin AI 检测中的"合格文本"是什么?详解,表格那一层见Turnitin 会读表格里的文字吗?哪些算、哪些不算,那篇也讲了同一条 release note 里关于表格内长文散文的部分。

还有一个后果值得单独提。如果一份报告真正进入分析的散文只有几百词,就会落进厂商描述的这种行为:`mostly "all or nothing" because we're predicting on a single segment without the opportunity to overlap`,而下一句是 `some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated`。一份带大流程图、三张表和四十条参考文献的试验报告,按被测量的口径算,比它的页数看起来要短得多。展开见短文档的「全有或全无」:为什么几百词的稿子分数会走极端

清单在两个地方直接管到措辞

有两条不只是列内容,而且很容易被忽略,因为它们各自只是长表格里的一行。

第 22b 条讲随机后的失访与排除,末尾加了一句:

`The wording "protocol deviation" is not sufficiently explicit and exact reasons should be reported`

一份报告规范点名一个说法并且否决它,这不常见。它在这里要紧的理由和检测无关:如果一次修改把一个具体原因换成了一个顺口的概括说法,这次修改就把第 22b 条弄坏了。这种问题校对看不出来,熟悉清单的审稿人一眼就看得出来。

第 29 条讲结果解释,是另一条:

`Avoid overinterpretation ('spin')`

讨论部分通常被说成是论文里自由发挥的地方。在这个体裁里,它自带一条关于结论能走多远的指令,另外还要求把结果与已有证据联系起来、把获益和危害放在一起说。第 30 条再点名局限性段落必须覆盖的四样东西:方法学局限、结果的不精确性、外推性,以及在相关时的多重分析问题。

清单从头到尾没碰的那部分

真正决定你下一步动作的是这条分界,而它通常不在改稿建议里。

CONSORT 规定必须出现什么,在若干处规定以什么形式出现,在两处点名一个不能用的说法。它没有写你的句子。清单里没有任何一条告诉你,这个问题为什么值得研究该怎么说。

不能动的那一半,而且每一项都能报出编号。 这里真正有用的不是一句「别乱改」,而是每一项背后都有一个可以指着说的条目号:流程图里的计数是 22a 和 22b;注册库名称、编号、URL 和日期是第 2 条;实际执行的纳入排除标准是 12a;谁生成随机序列、用什么方法生成是 17a;谁被设盲、盲法怎么实现是 20a 与 20b;各组结果连同效应量与精度、二分类结局的绝对与相对效应,是第 26 条。这会改变一次沟通的形态——「这一段我不能删」后面跟着一个编号,分量是不一样的。至于把表达和科学状态分开这件事本身怎么做(CONSORT、STROBE、PRISMA 放在一起讲),见方法与结果部分哪些可以改写,哪些必须逐字保持准确

你自己的那一半,而且大多数人没用满。 第 6 条要求写 `Importance of the research question` 和 `Why a new trial is needed in the context of available evidence`,子项里还包括干预可能通过什么机制起作用、为什么选这个对照。第 29 条要求说明你的结果与已有证据是什么关系。这些是论证,而论证的形状会随想法变化。如果你的引言可以和同领域任何一篇试验的引言互换,那是习惯,不是规范——而这恰好是变化不需要付任何代价的地方。

清单自己也没打算覆盖所有设计。它的扩展页列出建立在 2010 版清单上的 22 个 CONSORT 扩展、建立在 2025 版上的 1 个,并且原文写着这份列表 `is by no means exhaustive`。整群、交叉、阶梯设计、预试验、实用性试验、非劣效、危害、患者报告结局,各自还有额外条目。如果你的试验属于其中之一,被规定的比例只会更大。

方法或摘要被标红之后,按这个顺序做

  1. 先看高亮落在哪,再看那个数字。 整章方法连成一片高亮有它的机制解释,先弄明白这个:Turnitin 把我整章方法都标红了
  2. 数被分析的散文,不要数页数。 把流程图、表格和参考文献拿掉,看还剩多少连续散文。「全有或全无」那条行为针对的是这个数,不是页数。
  3. 动措辞之前,先把清单要求的内容标出来。 把扩展清单开在稿子旁边,逐句标出「这句存在是因为某一条要求它存在」。这一步要冷着做,不要边改边判断。
  4. 把厂商自己的立场带进谈话。 它的 FAQ 写着这个百分比 `should not be used as the sole basis for action or a definitive grading measure by instructors`,讲误报特征那一段的收尾也是建议对方在看百分比时把文本性质考虑进去。这类表述汇总在AI 比例偏高时,厂商是怎么教老师处理的
  5. 如果有人拿一个阈值压你AI 率 20% 算高吗?为什么没有绝对标准解释了为什么没有任何公开数字能当合格线。
  6. 披露是另一件事,单独处理。 用了 AI 辅助修改要不要声明,取决于期刊而不是检测工具,各大出版社的 AI 披露政策对照把主要几家摆在一起。

如果措辞反正要改

改一份试验报告的成本大头不在写作。你动过的每一段,接下来都要和另外三份文档对一遍:填好的清单、已注册的方案,以及你在第 3 条里承诺任何人都能去读的统计分析计划。一个覆盖全稿的修改计划,等于创造一份和全稿等大的核对工作,而在这类文档里,核对漏掉一处就是一个关于试验的事实错误。

范围因此值得较真。下面几句讲的是我们自己的产品 HumanPen,请当成第一方口径来读,别当成中立测评。哪几段允许被动,是在任务开跑之前就定死的:你可以自己指定段落,也可以交一份检测报告上去,由报告里被标出的位置来定。线上说明写明段落是引擎改写的最小单位,一次圈选如果落在段落中途,系统会把它补成整段,再把补好的范围原样列给你确认,此外的文字不进这次任务。收费口径就是这个范围本身:没被改写的词不计。回来的仍是可编辑文档,含义、结构、术语、引用、版式与样式都在它声明要保住的清单里,站上自己的建议是复杂文档下载后要复核一遍。符合条件而仍被标红的片段,可以免费继续降 AI。走报告驱动那条路的细节见只改写 Turnitin 报告标红的那几段

改完分数会是多少,没有人能提前告诉你,我们也不能。所以无论用什么方式改,重投之前都要把返回的方法段和方案对一遍、把返回的效应量和你的分析输出对一遍。一个置信区间掉了一位数字,比一句话被标红严重得多。

常见问题

按 CONSORT 写会推高 AI 率吗? 厂商公开的材料里没有这样的说法,按上面那次实读,它讲报告的三个页面根本没有出现试验、方案或报告规范。它公开说的是,误报可能出现在结构变化少的内容上,而 CONSORT 是有意把试验报告一部分的结构变化拿掉的。

我的方法部分和注册方案高度重合,这有问题吗? 从报告规范看没有问题。方案是这项试验之所以算前瞻性的依据,第 3 条要求你写明它在哪,第 10 条要求报告任何偏离。它只在一个很窄的意义上是问题:把自己的文档再讲一遍,产出的是密度高、变化少的散文,而那正是最暴露在这套量尺下的形状。

流程图和基线表算进那个百分比吗? 只有合格的散文句子进分析,一张计数流程图和一张均值表都不是散文句子。2023 年 8 月的一条 release note 确实说表格单元格里的长文散文会被处理,并且要重新提交才对旧文档生效,所以「一张写满整句的表」和「一张全是数字的表」是两回事。

能不能把参与者流失那段改写一下降分? 句子可以挪,但第 22b 条要求给出排除的确切原因,并且明确否决 `protocol deviation` 这个说法。如果一次修改把原因换成概括说法,这份报告就比你交上去那份更不合规了,分数抵不掉这个。

整段摘要被标红。 按第 1b 条写出来的摘要有 14 项必须覆盖的内容、一条「不许出现正文没有的东西」的指令,中间没有表格、列表或参考文献把它断开。它是全文密度最高的合格文本。厂商的指引是这个百分比不能当作处理的唯一依据,而它讲误报特征的那一段,是你该摆到对方面前的东西。

CONSORT 2010 的论文或观察性研究适用吗? 上面引的条目都是 2025 版,30 个条目的清单,2025 年发布。观察性研究另有一套规范。但那条通用的判断不变:先弄清楚你哪些句子是报告规范规定的,再决定改哪些。

继续阅读