拿以前的作业当文风基线:怎么挑、比什么、以及它证明不了什么

讲「怎么证明是我写的」,常见的建议都在讲过程证据:草稿、时间戳、版本历史。这篇讲另一种:拿旧作业说明这篇的文风就是你一贯的文风。它的分量没有看上去那么重,一些学校的处理程序里已经有这一步,而且你交上去的东西,对面也可以反过来用。

HumanPen 团队

· 15 分钟

交出以前的essay,能证明这篇也是我写的吗

不能,而且专门做这件事的工具自己就是这么说的。所谓「文风基线」,就是把你以前批改过的作业拿出来,说明这次被标红的文字跟你一贯交上去的东西长得一样。这确实是一类真实的证据,约克大学(University of York)的学术不端政策就写着,调查小组应当把「学生此前提交的作业拿来作比对」。但 Turnitin 有一个专门做作者身份比对的产品,而 Turnitin 自己的 FAQ 写着,那个产品「无法指出内容是否由 AI 写成」。文风比对回答的是「这看起来像不像你」;你面对的指控问的是「这一份文档是怎么来的」。这是两个问题。

所以老实说,文风基线是佐证,不是答案。它该垫在过程证据下面,而不是摆在最前面。

下面讲:谁已经在拿你的旧作业做比对、比的是什么,你自己该挑哪几份,以及它会反过来咬你的三种情形——比对可能早就做过而你没看到;你交出去的任何一份都能被重新丢进检测;你的写作要是进步了,基线反而在跟你作对。这一页只带走一样东西的话,带走「这类证据扛得住什么,扛不住什么」那张表。

这个比对,可能在你想到之前就有人做过了

三份公开文件,2026 年 8 月 28 日读的。其中两份明确要求工作人员把你的新作业和旧作业放在一起看。第三份做的是另一回事,这个区别值得知道。(西华盛顿和南卡这两页,下面引的内容都收在折叠面板里,去核对的话要先点开。)

机构与文件原文写了什么落到你身上是什么意思
约克大学《学术不端政策 2023–24》AM2.1.1(f)涉嫌「虚假作者身份」时,调查小组「应当考虑虚假作者身份嫌疑说明中提供的证据,以及学生此前提交的作业,用于比对」。同一条还赋予它「要求学生接受强制面谈、并索取准备性材料」的权力这个比对是程序里的一步,不是你在求人家开恩。你交不交,它都可能发生
西华盛顿大学 ATUS《怀疑学生作业用了 AI 时怎么评估》「事先准备」一节:「可考虑收集一份基线写作样本用于文风比对。」「评估学生作业」一节:「该作业与此前的作业样本是否一致?」下面拆成「写作风格、质量与篇幅」和「写作机制(例如拼写、标点或结构)」它把比对维度公开写出来了。你要自己搭这个比对,就照对面已经在用的维度搭
南卡罗来纳大学学生行为与学术诚信办公室的 AI 页面公开的小节标题里有「文档版本历史」「与人工智能样本的比对」「人工生成材料库」。它描述的比对,是把作业题目丢给 ChatGPT 或 Copilot,「看它面对同样的题目会怎么回答」不是所有学校都拿你比你,有的是拿你比模型。对这种方法,你的一摞旧essay完全接不上话

比对做了、而且做出问题的案例,是有记录的。OIA(Office of the Independent Adjudicator)是英格兰和威尔士的独立学生投诉机构,会把处理结果做成匿名摘要公开。2025 年 7 月,它以「AI 与学术不端」为题一次出了六份。第一份里,一名自闭症学生否认用了 AI,交出了自己的提纲和笔记。摘要写着,「纪律小组考虑了学生提交的书面证据,也把这篇论文与该学生的其他一些作业作了比对」,然后认定构成学术不端。

OIA 支持了学生的投诉,理由之一是:

"The student had not been given a fair opportunity to comment on how this essay compared to their other essays because some of the evidence the panel relied on had not been shared with them."(学生没有得到公平的机会,就这篇论文和他其他论文的比对发表意见,因为小组依据的部分证据从没给他看过。)

学生后来告诉 OIA,学校重新审理之后,认定根本不存在学术不端。

所以,主动交材料之前,先问一句:是不是已经拿我其他作业做过比对了?能不能给我看?约克的政策从另一头讲了同一条原则:小组「不会使用任何学生事先未曾看到、也未获机会回应的材料来作判断」。

厂商卖这个比对,也写清楚了它答不了什么

开头提到的那个产品叫 Authorship,它跟 AI 检测到底差在哪,见Turnitin 代写检测和 AI 检测是两回事。这里要紧的是它拿什么来比。给调查人员看的那份指南写得很直白,比的就是你的历史作业:

"Authorship for Investigators also provides new evidence about a student's writing over time that can be used to confirm suspicions of a possible misconduct violation. This evidence is provided in an Authorship Report that is generated by either manually uploading files to compare against each other, or by entering a Turnitin paper ID and selecting from a list of the students' past work which files you would like to compare against."(Authorship for Investigators 还会提供学生写作随时间变化的新证据,可用来印证对可能违规的怀疑。这些证据放在一份 Authorship 报告里。报告有两种生成方式:手动上传几份文件互相比对;或者输入一个 Turnitin paper ID,再从该学生的历史作业列表里选出要比对的文件。)

同一页也自己划了界:「需要注意的是,Authorship for Investigators 并不判定代写。是否构成代写,需要由人根据可能性权衡作出判断。」

那份报告的公开指南页,读者打开只看得到一条说明:相关指引「只有从报告内部进入时才可见」。所以如果有人拿你的历史作业跑过比对,最能讲清结果是什么意思的,是打开那份报告的人。这也是要先问能不能看的又一个理由。

按 2026 年 8 月 28 日的版本,Turnitin 的 AI 检测 FAQ 里一次都没出现 baseline、style、portfolio、voice 这几个词。所以 AI 检测的文档对你的写作风格两头都没说话:谁也不能拿它说你风格可疑,你也不能拿它证明你风格一贯。

该挑哪几份旧作业

约克的政策和西华盛顿那一页都没有给数量。约克写的是复数的「此前提交的作业」,没有数字;西华盛顿写的是单数的「一份基线写作样本」。所以按质量挑,不用凑数。

  • 批改后发回来的、老师批注还留在文件上的。 一份发回来的作业带着日期、批改人和一个不是你自己给的分数。你重新敲一遍的干净版本,这三样都没有。
  • 先对文体,再对课号。 实验报告和反思性小论文是两种东西,写法本来就不一样。只能二选一时,先保证文体对得上。
  • 任何在监考条件下写的东西。 限时考试的答卷(如果系里肯给你原件)、课堂上当场写的、有监督的测验。这些东西的作者身份本来就没有争议,而这恰恰是平时作业交多少份都给不了的。
  • 挑最典型的,不是挑最好的。 你要论证的是一致性。大二拿过奖的那篇,说明不了你平常一个普通星期二怎么写字。
  • 走过正式流程并且被放过的那一份。 如果你以前有作业被标过、后来调查认定没问题,那是一个有记录的结果,比单纯的「像不像」硬得多,理由见后面「你的写作确实进步了」那一节。

反过来不该拿的:找不到批改原件的、课程里做过小组作业的、以及任何你不希望别人逐字细读的。顺带一提,每周的网课讨论帖是少数几种什么都不用做就会自动攒出一串带日期文字的地方,为什么这种形式会顺手帮你攒出一份记录,写在网课讨论帖被说是 AI 写的里。

到底能比哪几项

西华盛顿那一页列了四项:写作风格、质量、篇幅,以及写作机制,机制又拆成拼写、标点和结构。这份清单好用,恰恰因为它是对面列的。你按这几项来组织材料,说的就是审的人已经在用的话。

四项里有三项靠人判断。机制最接近能量化,Word 也能给你两个数,但看了下面的公式就知道,这两个数都不管拼写和标点。

在 Microsoft 365 版 Word 的「开始」选项卡里打开编辑器(Editor),进文档统计信息(Document stats),能看到 Flesch Reading Ease(易读性)和 Flesch-Kincaid Grade Level(年级水平)两个分数。微软的支持页把两个公式都印了出来,易读性是:

"206.835 – (1.015 x ASL) – (84.6 x ASW)"

其中 ASL 是平均句长(按词数),ASW 是每词平均音节数。Flesch-Kincaid 的公式用的是同样这两个输入。

所以把这些数字写进邮件之前要想清楚:两个分数都只由两个变量决定,句子多长、词有几个音节。你的选词偏好、论证结构、引用习惯、段落长短,它们一概不知。四份文档的年级水平对得上,是很弱的佐证;对不上也说明不了什么,因为一章文献密集的正文本来就句子更长、多音节词更多,这是文体的差别,跟作者是谁无关。

如果你的文档不是单一语言,微软同一页上还有两条要注意。文件里混着几种语言时,Word「显示的是最后一次检查的那种语言的易读性统计」。英文文档里夹着某些欧洲语言时,Word「只显示计数和平均值,不显示易读性」。

没人提醒你的那一条:你的写作确实进步了

文风基线论证的是:这次被标红的文字,跟你以前的东西长得像。现在把日期加上去,再把这句话说一遍。你读了两年,每学期都收到反馈,看了几百篇文献,然后你主张自己的写作没有变过。

对很多人来说这句话根本不成立,而且看的人手里有你的成绩曲线。更麻烦的是,这是一场你未必想赢的官司:白纸黑字告诉系里「这几年的教学在我的文字上没留下任何痕迹」,这话本身就很怪。(至于以后要不要刻意把文风保持稳定,是另一个问题,见为了不被标红,要不要改自己的写法。)

旧作业还有第二种用法,能绕开上面这一整摊,而且 OIA 的案例里就有学生这么用。在那第一份摘要里,学生的论证不是「这篇像我别的essay」,而是:检测软件「此前曾把他写的另一篇论文标为疑似使用 AI,而那一次最终认定他没有用 AI」,学生据此认为这「说明该检测软件对他的写作风格存在偏差」。

同样的材料,另一种论证。一种说「我的作业像我的作业」;另一种说「这台仪器以前对我的文字下过一个结论,那个结论后来被推翻了」。后者不需要你声称自己停止了进步,而且矛头对着仪器,不是对着你。它也有边界:一个工具、一份文档、一次场合,推不出关于准确率的一般结论。机制那部分写在为什么同一段文字在不同检测器上分数差很多,为什么没有哪个数字能当及格线,写在AI 率 20% 算高吗

两种论证要选一个的话,通常第二种更硬,前提是它真的发生在你身上。

这类证据扛得住什么,扛不住什么

你想让它证明的事它能撑住的部分它做不到的部分
「这篇是我写的」被标红的文字,跟别人给过你分数的作业长得像,而且那个日期不是你挑的这份文档是怎么来的,它说不了。Turnitin 给自己那套比对产品划的也是这条线,上文引过
「我一直就是这么写的」你摆出来的这几份之间是一致的你没摆出来的那些。样本是你挑的,屋里每个人都知道是你挑的
「检测器判错我了」如果你以前某篇被标过、指控后来撤了,那是一个有记录的结果,不是一面之词关于这个工具错误率的一般性结论。一份文档,一次场合
「旧作业交出去是安全的」没有这回事Turnitin 的 FAQ 写着:「此前提交过的作业,只要重新提交到 Turnitin 且账户开启了 AI 写作检测,就可以被检测。」你交出去的,就是可以被跑的

你主动交出的基线,是一叠请人家细看的文档;而「重新提交就能再跑一次」是 Turnitin 文档里写着的能力,不是假设。这不是说别交,是说要在交之前想好,别等交完了才想。

约克政策里还有一条方向相反的坑,专门砸没留材料的人。授权比对的同一条也写着:「缺乏准备性材料,可被视为虚假作者身份的证据。」准备性材料指的是笔记和草稿,不是写完的旧essay,所以文风基线填不上这个洞。能填的那类材料写在怎么在 Word、Google Docs 和 Overleaf 里留住版本历史

怎么交出去

  1. 先问有没有已经做过的比对,并且要求看到结果。这不算找茬。上面引过的约克政策写明,小组不会拿你没看过的材料来判;OIA 支持那名学生的投诉,这也是理由之一。
  2. 交发回来的原件,不要重打一份。 老师的批注、提交日期、分数,这三样才是来自你之外的部分。文字一模一样但干干净净的 Word 文档,留下了文字,丢掉了证据。
  3. 自己把比对维度点出来。 不要只说「请您比对一下」。说得更接近这样:句子长度、我怎么用小标题、我引原文的方式、我习惯把引注放在句末。给出三四条别人两分钟内能自己核的。
  4. 主动说清哪里变了。 你的写作要是确实进步了,赶在别人指出来之前自己说。「结构比大一那会儿紧了,是因为这份反馈」,读起来是准确;对这一点闭口不谈,一旦被看出来,读起来就是别的意思。
  5. 放第二位,不要放第一位。 屋里的问题是这份文档怎么做出来的。回答这个问题的是过程证据,基线只是佐证。过程证据分几层写在AI 检测器误判了,怎么证明这篇东西是你自己写的,学校实际认哪些材料写在被误判为 AI 写作:怎么申诉
  6. 留一份你交了什么、什么时候交的记录。 案子要是进到第二阶段,第一位审阅者手上到底有过什么,是要紧的。

我们做的那一小块

上面这些,没有一件是改写工具能替你做的,攒基线是你自己的活。改写工具在一件事上会拖你这套论证的后腿:被标红的论文改动越多,就越难跟你准备交出去的那几份样本放在一起比。所以真要改,只改有争议的那几段。

HumanPen 改英文文档时,可以把改动限定在这几段:你自己圈出段落,或者导入检测报告、按报告标红的范围来定(做法见只改写 Turnitin 报告标红的那几段),动手之前先由你确认改哪几段。它会尽量保留术语、引用、表格和排版,回来的仍是可编辑文档。

符合条件时可以免费继续降 AI。改完分数会是多少,我们不做承诺。

常见问题

要带几份旧作业? 上面引的两份政策文件都没给数字。约克写的是没有数量的复数「此前提交的作业」,西华盛顿写的是单数的「一份基线写作样本」。按质量挑:批改过、发回来的、文体对得上、而且是你典型的水平而不是最好的一次。

学校能把我的旧essay也丢进 AI 检测吗? Turnitin 的 FAQ 写着,此前提交过的作业只要重新提交、且账户开了 AI 写作检测,就可以被检测。所以旧作业并不自动在射程之外,这一点值得在你主动交一整个文件夹之前先知道。

有没有专门拿我的文字比我的文字的工具? Turnitin 有,叫 Authorship,跟 AI 检测分开卖。它拿几份文件互相比,或者拿来跟学生以前交过的作业比;Turnitin 的 FAQ 写着它「无法指出内容是否由 AI 写成」。Turnitin 说,怎么读那份报告的指引要从报告内部打开。

我的旧作业 AI 率也很高,怎么办? 那就别把「像不像」当主线打。旧作业上的标红更可能是这台仪器在你这类文字上的表现,而不是关于其中任何一份文档的结论。这更接近「你的写作确实进步了」那一节里的第二种论证,那是一场关于工具的讨论。文档里承认会出现误报的那几类人群,收在非母语写作被标记为 AI?文档怎么说

文风基线到底值不值得做? 当配角,值得,而且成本很低。当主角,不值得。它回答的是这段文字看起来像不像你,而人家问的是这一份文档是怎么来的。

继续阅读