被误判为 AI 写作:怎么申诉,学校会认哪些证据
文章是你写的,一个百分比却说不是,而日历上已经排进了一场约谈。这篇讲的是:头一个小时该做什么、在公开的裁决案例里真正说服了裁决者的是哪类证据、哪几种辩解会把局面推向对面,以及一封可以照抄的回复信。
HumanPen 团队
· 20 分钟
先说结论
这篇文章有一个前提:文章确实是你写的。如果不是,下面大部分做法只会让你的处境更糟——文末另有一节专门讲那种情况。
在回复任何东西之前,先把你的写作记录保全下来;然后书面索要三样东西:你被指违反的具体条款、决策者将看到的全部证据、以及处理程序和期限。检测分数本身不构成证据。真正决定这类案子的,是一份带日期的、说明这份文档如何形成的记录,并且能对上被标红的那些具体段落。
有两家机构把其中最有用的部分明说了出来。Turnitin 自己的指南写着,它的 AI 检测模型「may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student」(可能并不总是准确,可能误判人写的、AI 生成的和 AI 改写的文本,因此不应作为对学生采取不利处理的唯一依据),并补充说认定学术不端「takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies」。另一句来自 OIA(英格兰与威尔士高等教育的学生投诉独立裁决机构),它把举证责任放在了该放的一边:「The responsibility is on the provider to prove that the student has done what they are accused of doing, not on the student to disprove it.」(举证责任在院校,不在学生。)OIA 只管英格兰与威尔士的院校,约束不了你的学校;但这句话说明的是程序公正长什么样。
这不等于你可以坐等对方举证。它的意思是:你拿出的证据,是为了给决策者一些具体的东西去掂量,而不是为了卸下一份本来就不在你身上的责任。
头一个小时
五件事,按这个顺序。前三件对时间敏感,后两件不那么急。
- 什么都别动。 提交的文件不要动,它所在的文件夹不要动,草稿不要动,文件名也不要动。重新保存会改掉文档的修改时间;而一个在被指控当天刚被你「整理」过的文件夹,是对方最容易拿来说事的东西。想做批注就先复制一份,在副本上做。
- 先弄清楚你到底有没有版本历史。 这个问题决定了你能做出哪一类申辩,而大多数人默认「有」,实际是「没有」。微软的支持文档说得很直白:「Version history in Microsoft 365 only works for files stored in OneDrive or SharePoint in Microsoft 365.」(版本历史只对存放在 OneDrive 或 SharePoint 的文件生效。)如果你是在笔记本本地硬盘上用 Word 写的,就没有版本历史可以拿出来。Google Docs 每份文档都留,但要有相应权限:「To browse earlier versions of a file, you need permission to edit that file.」(要浏览早期版本,你必须有该文件的编辑权限。)如果文件在课程账号或某个你可能失去访问权的共享盘上,今天就去确认。
- 趁还有访问权限,先把东西取下来。 课程账号会关,共享盘权限会被收回,而版本历史本身并不是一个可以下载的文件。按你学校能接受的形式做带日期的截图或导出,并记下原件现在还在哪里,以便对方要求直接查看时能找到。
- 今天就凭记忆写下你自己的时间线。 什么时候定的题、在哪里写的、最先读了哪些文献、拿到反馈后改了什么、为什么改。这不是证据,这是一周后你要用的索引——那时你会对着四十个文件想不起来哪个才重要。这类记忆衰减很快,而且可能在有人来问你之前就已经衰减:在 OIA 公开的一个案例里,学生就主张提交与答辩之间隔得太久,影响了他对自己作品的回忆。
- 拿到程序文件和期限,找到能帮你的人。 学术不端处理程序是你学校公开发布的一份文件。在动笔回复之前先读它,因为它会告诉你现在处在哪一环、认定标准是什么、你还有多长时间。如果学校有学生权益或申诉方面的辅导渠道,用它——这类人每周都在处理这种事。
先搞清楚你被指控的到底是什么
「AI 检测把你的论文标红了」不是一项指控,它只是某个人打开这份文件的理由。在你辩解任何事情之前,先把指控变成一个你能回答的形式。
书面索要下面四样东西,措辞保持中性:
- 具体条款:你被指违反的是学术不端规定里的哪一条。在 OIA 支持学生的一个案例里,它的建议之一就是要求院校修订规定,把与 AI 有关的违规写进核心政策,并且在通知里告诉学生面对的是哪一项违规、理由是什么。
- 全部证据:决策者将会看到的所有材料,包括检测报告本身。OIA 的办案说明写道,学生「should also be given sufficient notice of meetings and be provided with all relevant evidence, including detection software reports, to allow them to respond effectively to allegations.」(应当被提前充分通知会议时间,并获得包括检测软件报告在内的全部相关证据,以便有效回应指控。)同一份说明也要求决策者「understand the strengths and limitations of detection software, and weigh this evidence carefully against other available information.」
- 报告是哪个工具、哪个版本、什么时候跑的。 厂商会换模型。去年的报告和今天早上的报告,不是对同一件事的同一种测量。
- 被质疑的是作品的哪一部分。 OIA 把这条列为良好做法:院校应当「consider whether the whole or part of a submission is thought to be AI-generated, and clearly set out what aspect of the assessed work led to the suspicion that AI had been used inappropriately.」(明确说明被怀疑的是整篇还是部分,以及作品的哪个方面引起了怀疑。)
关于报告本身有一条实务提示。Turnitin 的 FAQ 写着 AI 检测指标和报告对学生不可见,同一段里又写着「with the PDF download feature, instructors can download and share the AI report with students」(教师可以下载 PDF 并分享给学生)。也就是说,它存在一种可以交到你手上的形式。去要这份 PDF,而不是根据别人对「哪里被标红了」的转述去推理。
关于那个数字,有两件事能让你不去争错的东西。Turnitin 说它只分析所谓的合格文本,即由标准语法句子构成的散文,因此得出的百分比「is not necessarily the percentage of the entire submission」(未必是整篇提交内容的占比)。另外,对 1% 到 19% 这一档,它根本不显示数字,只显示一个星号,理由是避免这一档可能出现的误报。如果你的报告在百分比的位置上是一个星号,那就是这个情况。
证据分级:各自能扛住多少
这个排序是我们自己的,依据是 OIA 那几个公开的 AI 案例最终取决于什么,而不是任何官方量表;你学校的程序可能有不同的权重。
| 证据 | 它能说明什么 | 分量 | 怎么取得,以及什么会卡住你 |
|---|---|---|---|
| 提交文档的版本历史 | 文字是随时间累积出来的,而不是整篇一次到位 | 最强(前提是它存在) | Google Docs 每份文档都有,但你得有该文件的编辑权限;Word 只对存在 OneDrive 或 SharePoint 的文件保留;本地文件没有 |
| 带日期的草稿和提纲(独立文件) | 同一件事,只是形式由你掌握 | 强 | 你自己的存储、邮件附件、教学平台的提交记录。不要改名,也不要重新整理 |
| 笔记与做过标注的阅读材料 | 论文里的论断来自你亲手处理过的文献 | 强 | 你自己的文件。OIA 的说明告诉院校「It can be helpful to explicitly ask students to supply copies of any notes or drafts」,所以主动提供并不算越界 |
| 提交前来往的反馈 | 有第三方在一个不由你控制的日期看到过进行中的稿子 | 强 | 导师邮件、教学平台评论、研讨课记录、同学的批注 |
| 你自己对这份作品的讲解 | 问题为什么这样提、文献怎么选的、什么时候改了什么 | 强,而且常常是决定性的 | 一次约谈或答辩。要按「讲述你的决策过程」来准备,而不是按背诵来准备 |
| 你以前的作品,用于文风比对 | 你平时就是这么写的 | 两可 | 容易拿到,但是双刃剑:不同作业的任务、期限和可获得的语言支持都不同,写出来的东西自然也不同 |
| 关于检测器误报率的公开研究 | 关于工具本身的背景信息 | 单独用很弱 | 随手可得,但脱离你的个案几乎没有价值。只有挂在你的报告和你的写作记录上时它才起作用 |
| 另一个检测器给出的干净分数 | 几乎什么都说明不了 | 负分 | 别做。理由见下 |
如果前四行你一样都没有,就照实说,不要凑数。一个诚实的短答复(「我是在自己电脑上用 Word 写的,没有留草稿」)加上一个扎实的第五行,是一个真实可辩的立场;而编出来的第一行不是。
公开案例真正取决于什么
这个话题上大部分建议都是从理论出发写的。OIA 公开了案例摘要,所以在英格兰与威尔士,至少有一小批已裁决的案子可以看到「公正处理」和「不公正处理」分别长什么样。其中三个与 AI 和学术不端有关。它们约束不了你的学校,但值得读——因为它们展示的是哪一类证据真的起了作用,以及裁决者最后是在什么问题上翻案的。
[CS072501](https://www.oiahe.org.uk/resources-and-publications/case-summaries/ai-and-academic-misconduct-cs072501/),学生一方成立。 学生向委员会提交了论文准备、构思和笔记的细节,并指出检测软件此前曾把他另一篇论文错误标红。OIA 认可委员会确实审视了论文实质内容,没有只依赖检测报告。真正让裁决翻转的是接下来这一句:「it didn't properly consider all the points the student raised or the evidence they presented, including their essay planning and preparation.」(未妥善考虑学生提出的全部论点和提交的证据,包括构思与准备材料。)委员会所依据的部分证据未曾提供给学生,学生因此没有公平的机会就「这篇与他其它论文的比较」作出说明;而决定既没有给出充分理由,也没有解释为何该处罚是恰当的。院校被要求重新审议。学生后来告诉 OIA,重新审议后院校认定不存在学术不端。
[CS072502](https://www.oiahe.org.uk/resources-and-publications/case-summaries/ai-and-academic-misconduct-cs072502/),学生一方成立。 这个案子关于答辩。「None of the evidence relied upon by the provider was shared with the student ahead of the viva」(院校所依据的证据在答辩前一份都没有给学生);尽管程序要求,学生没有被邀请提交书面申辩或当面陈述;答辩本身只考了学科知识,却「did not give the student an opportunity to also explain how they had worked on the assignment」(没有给学生机会说明他是怎么完成这份作业的)。学生也提到提交与答辩之间间隔太久影响了回忆。之后的上诉被驳回,且没有对上述任何一点作实质考虑。
[CS072503](https://www.oiahe.org.uk/resources-and-publications/case-summaries/ai-and-academic-misconduct-cs072503/),学生一方不成立。 这一个也要读,它是有用的反面参照。这里院校考虑了范围恰当的证据,包括学生在答辩中的坦白、草稿笔记和书面回应,遵循了自己的程序,处罚在 OIA 看来也是相称的。学生的主张基本上是:他在答辩中坦白、他投入了很多努力,这些本应被更多地计入。投诉未获支持。
三个案子共同的模式不是「检测器错了」,而是程序:证据有没有给学生、学生有没有机会回应、有没有考虑一定范围内的多种证据、有没有给出理由。这些恰恰是你可以主动要求的,而且提出这些要求并不算对抗。
Turnitin 那一段,值得完整引用
如果你的文字密度高、局部重复、或者大量转述自文献,那么下面这段是你能摆在决策者面前的最有力的东西——因为这是厂商自己在描述你的处境。它出自 Turnitin 的检测 FAQ:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(误报有时会出现在这几类内容上:结构变化不多的内容、字面上自我重复的文本、以及只做了转述而没有发展出新观点的文本。如果我们的指标在这类文本上显示出较高的 AI 写作比例,我们建议你在看这个百分比时把这一点考虑进去。)
起作用的是第二句,而它恰恰是被到处引用时最常被删掉的一句。Turnitin 在这里并不是在承认缺陷,它是在告诉读报告的人:对这类文本,要把这个数字打折看。这是卖工具的公司对你的评阅人说的话。
只有确实对得上时才用它。文献综述、方法部分、对某个标准流程的系统描述、用第二或第三语言写成的论文——它描述的是这些形状。如果你的文章一个都不沾,引用它只会显得你在硬凑。
还有一句更短的,适用于所有人。Turnitin 在另一份指引里说这个分数「is not meant to provide definitive answers in isolation」(不应被当作可以单独给出定论的东西),并且当教师把它当作「a single data point rather than a definitive response」(一个数据点而非定论)来用时,「才是按预期在使用它」。
四种会适得其反的辩解
「AI 检测器不可靠,所以这一次也是错的。」 这是最常见的开场,也是最弱的。它会招来一句显而易见的反驳:Turnitin 公开的目标是把误报率控制在「under 1% for documents with over 20% of AI writing」(AI 写作占比超过 20% 的文档,误报率低于 1%)。这个数字站不站得住是个真问题,但争它会把你拖进一场二十分钟约谈里赢不了的辩论,还会把注意力从你唯一占优的战场——你自己的写作记录——上引开。就你这份文档争论,不要就这一类工具争论。
突发性(burstiness)与困惑度(perplexity)。 半个互联网都会告诉你,AI 检测器测的是句长变化和用词可预测性,而学术散文在这两项上表现很差。Turnitin 的 FAQ 说,它的模型「is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions」(并未被显式编程去评估突发性、困惑度这类具体信号或公共讨论中常被提到的其它单项指标),而是「learns statistical patterns from our training data」(从训练数据中学习统计模式)。
但要小心别把这句话推太远,它比看上去窄得多。同一页还说,它的分类器就是被训练来识别词概率差异的,而困惑度正是一种对词概率的度量。所以站得住的说法只能是:Turnitin 否认的是把那两个具名指标当作显式规则来计算,它并没有否认词的统计特征起作用。如果你走进约谈说「厂商已经推翻了整套理论」,任何一个开着那页 FAQ 的人一句话就能纠正你。更稳的做法是完全不谈机制,把时间花在你的草稿上——那里没有可被纠正的东西。
2023 年那条关于开头和结尾的更新说明。 这条在各种申诉模板里流传很广,而它是个坑。Turnitin 确实发过一条说明,称观察到文档开头几句或结尾几句误报率更高,通常是较为套路化的引言或结论内容。但那条说明的下一句是:「As a result, we have changed our detection logic to help reduce these false positives.」(因此我们已修改检测逻辑以减少这类误报。)它挂在模型更新说明页面上,标题是「Updates to address our customers' false positive concerns」,日期为 2023 年 5 月。它是一条修复公告,不是对现行缺陷的描述。 任何人打开你引用的那一页都会读到下一行,然后你就输掉了整个房间。
换一个检测器,或者干脆重写。 把论文放进另一个检测器跑出一个干净分数,什么也证明不了(检测器之间本来就经常互相矛盾),而如果它也标红了,等于给委员会又送了一个数字。在被指控之后重写已提交的论文更糟:它看起来像篡改,而且改掉了所有人正试图据以推理的那一件实物。
还有第五条,不成文:不要在书面材料里揣测评阅人的动机。它从来没帮过任何人,而且会一直留在档案里。
那封信
控制在两页以内。附一份证据清单,而不是一整个文件夹。用一种能留下发送日期凭证的方式寄出。下面方括号里的都是给你的操作说明,不是要发出去的文字。如果你所在项目的工作语言是英文,就用英文写,内容照搬即可。
主题:关于学术不端指控的回复,[课程代码] [作业名称],学号 [学号]
尊敬的 [姓名 / 学术不端审查委员会]:
我就 [日期] 的通知作出回复,该通知涉及我于 [日期] 为 [课程代码] 提交的 [作业名称]。
这份作业是我本人撰写的。我没有使用生成式 AI 工具产出其中任何部分的文字。
我确实使用过的工具,以及在每种工具上具体使用的功能:[文献管理软件、拼写检查、语法检查、翻译工具、统计软件、转写工具。如果除文字处理软件外没有用过别的,就直接写明。]
随信附上这份作业形成过程的记录:
- [材料] / [日期或日期区间] / [它能说明什么]
- [材料] / [日期或日期区间] / [它能说明什么]
- [材料] / [日期或日期区间] / [它能说明什么]
简要说明:我在 [日期] 因 [原因] 选定了这个题目;阅读与笔记集中在 [区间];第 2 项中的提纲写于 [日期];第一版完整草稿(第 3 项)写于 [日期区间]。在 [日期] 的 [反馈 / 指导 / 研讨] 之后,我因为 [原因] 修改了 [内容]。提交版本的日期是 [日期]。
关于被标红的具体段落:[逐段说明。对每一段,说清它为什么会写成这样:这是本领域的标准表述、这是对第 N 项所附文献的贴近转述、这是可变化空间有限的方法描述、这一段我反复修改过。不要只给一句笼统的否认。]
另外,希望能向我确认以下几点:
- 我被指违反的是 [规定名称] 中的哪一条具体条款;
- 决策者将考虑的全部证据,包括完整的检测报告和任何比对材料;
- 报告由哪个检测工具、哪个版本生成,以及生成日期;
- 适用的认定标准,以及申诉的途径和期限。
我也希望,任何决定都能写明它在检测分数之外所依据的具体证据。[仅当报告来自 Turnitin 时加这一句:]Turnitin 自己的指引写明,其 AI 检测模型可能误判人类撰写的文本,不应作为对学生采取不利处理的唯一依据。
我愿意参加约谈,说明这份作业的写作过程,也可以带上相关的原始文件。
此致,[姓名] / [学号] / [专业] / [日期]
发出前检查四件事:你提到的每一个附件都真的附上了;里面每一个日期都是对的,因为一个错日期会拖垮其余全部;没有任何对他人动机的揣测;以及,你已经读过你自己学校的处理程序——期限和回复途径来自那份文件,不是来自这个页面。
约谈
把它当作对你决策过程的讲解来准备,不是当作一场记忆测验。重读提交的版本和作业要求。想清楚:题目为什么这样提、你主要依靠了哪些文献以及为什么、某张表或某张图是用什么做出来的、各版草稿之间改了什么。
如果时间间隔过长、身体状况、沟通方式差异或语言需求会影响你的回忆或表达,尽早书面说明,并把这个请求挂在程序文件中关于合理调整的条款上。OIA 的办案说明要求院校考虑「whether assumptions about AI use could be biased against a student's writing style, for example if the student is disabled or has a communication difference, or if English is not the student's first language」(关于 AI 使用的假设,是否可能对某些学生的写作风格构成偏见,例如学生有残障、有沟通方式差异,或英语并非其第一语言)。对评审方而言,这是需要现场纳入考虑的事项,不是你在讨要人情。
被问到想不起来的事,就说想不起来。在一个小细节上猜错,代价远高于那个细节本身的价值。
这件事最远能走到哪一步
每所学校的层级都是它自己的,唯一可靠的描述在你自己学校的学术不端处理程序里。大致形状是这样:
- 非正式或调查阶段。 一次谈话、一份说明要求,有时是一场答辩。很多事情到这里就结束了,而这也是拿出证据成本最低的地方。
- 正式的评审小组或委员会。 作出认定,如果有处罚,也在这里。这一环理应给出理由。
- 校内申诉。 通常受理范围很窄,最常见的是程序瑕疵或新证据,并且一定有期限。
- 校外复核。 只有在校内途径走完之后才谈得上。
第四级具体是什么,因法域、因学校而异,不能照搬别处的做法。在英格兰与威尔士,这一级是 OIA。它的两个机制值得知道:你通常需要一封 Completion of Procedures Letter,「which the provider will send you once you have completed its complaints or appeals procedures」(院校在你走完投诉或申诉程序后会发给你),并且投诉必须在「within 12 months of the date of the provider's final decision」(院校最终决定之日起 12 个月内)送达。OIA 自述是英格兰与威尔士的学生投诉独立裁决机构,所以在别处读书,这条路不是你的路。
怎么找到适用于你的那一套:去你学校的官方规定里找两类文件——处理学术不端的那一份,和处理学生申诉的那一份,名称各校不同。你要找的是三句话:认定由谁作出、申诉在什么期限内向谁提出、以及校内最终决定之后还有没有下一步。校外是否存在对应的复核渠道,不要假设有,也不要假设没有;程序文件必须写明最终校内决定之后会发生什么,找到那一句。这个页面替代不了那份文件。
如果你确实用了 AI 写其中一部分
那么上面那套框架对你就是错的,硬套只会让处境更糟。但公开案例里仍有两件事对你有意义。
坦白会被计入权衡,但不会抹掉认定。在 CS072503 里,学生在答辩中坦白了 AI 使用,并主张这应当对他有利。OIA 认定院校已经把这一点连同草稿笔记和书面回应一并考虑过、遵循了自己的程序、处罚也是相称的,投诉未获支持。坦白仍然是更好的选择,而且是唯一一个能扛过答辩的选择,但它不是一项抗辩理由。
「允许使用的工具」和「禁止使用的工具」之间那条线,比大多数人以为的窄。Turnitin 说它的检测器「is not tuned to target Grammarly-generated spelling, grammar, and punctuation modifications」(未针对 Grammarly 的拼写、语法、标点修改进行调校),并且在测试中「in most cases」这类修改没有被标红。但同一条回答接着说,这「excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features」(不包括由 Grammarly 生成式 AI 功能产出的内容,包括起草、改写、摘要等),而用这些功能产出的内容「will likely be flagged as AI-generated by our detector」。所以「我只用了 Grammarly」不是一句话能说清的事,要说清用的是哪个功能。
常见问题
我自己能看到 AI 检测报告吗? 不能直接看到。Turnitin 说 AI 检测指标和报告对学生不可见,同时也说教师可以把报告下载成 PDF 分享出来——所以去要这份 PDF,而不是根据别人对「哪里被标红」的转述工作。
报告在百分比的位置显示了一个星号,是什么意思? 对 1% 到 19% 之间的 AI 检测分数,Turnitin 不显示数字,只显示星号。它给出的理由是这一档潜在误报的发生率更高。
报告写 40%,是不是说我论文的 40% 是 AI 写的? 不是。Turnitin 说模型只分析合格文本,即由标准语法句子构成的散文,得出的百分比「未必是整篇提交内容的占比」。它还说,包含多种写作类型的文档,其百分比与高亮之间会出现落差——所以两者对不上是预期之内的,不是程序出错。
我用了 Grammarly,会有麻烦吗? 完全取决于你用了 Grammarly 的哪一部分,以及你的作业允许什么。Turnitin 说它的检测器未针对拼写、语法、标点修改调校,在其测试中这类修改多数情况下没有被标红;但由 Grammarly 生成式功能(起草、改写、摘要等)产出的内容很可能被标红。说清你用的是哪个具体功能,并且除了通用规定之外也要看作业要求本身——作业要求可能比通用规定更严。
我的文章只有 700 词,长度有影响吗? Turnitin 说有。在只有几百词的短文档上,预测「mostly 'all or nothing'」(基本是全有或全无),因为只有一个片段、没有重叠的机会;它还补充说,这意味着「some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(混合了 AI 生成与原创内容的文本,可能被整体判为 AI 生成。)如果你的文档很短,这句话值得摆到读分数的人面前。
要不要换一个检测器跑一遍来自证清白? 不要。别处的干净分数说明不了任何事,而如果它也标红了,等于给委员会送去第二个数字。把力气花在写作记录上。
我既没有版本历史也没有草稿,是不是没救了? 不是,但你的申辩此时落在「能不能讲清楚这份作品」上——而按公开案例看,这本来就是最强的一块地。用那些你不是为此目的创建的东西去重建:借阅记录、邮件、教学平台的访问日志、研讨课笔记、和同学讨论作业的聊天记录。
最后到底是谁作决定? 是人,依据你学校的规定作决定。Turnitin 说它的分数「不应被当作可以单独给出定论的东西」,也不应作为不利处理的唯一依据,并说认定是否构成学术不端「需要进一步审视和人的判断,并结合机构对其具体学术政策的适用」。那个数字只负责打开这份卷宗,它关不上。
本页是一般性信息,不是法律意见。学术不端处理程序、证据规则和申诉权利因国家、因学校而异。文中 OIA 的材料直接适用的是英格兰与威尔士的高校;在其它地方,它只是「公正程序长什么样」的一个有用范例,对任何人都没有约束力。
继续阅读