毕业设计 / capstone 的 AI 率:分阶段提交和多人合写带来的麻烦
capstone / final year project 不是一篇长论文。它分阶段交、多半不止一个作者,而且常常还有一个进不了你们 LMS 的第二读者。这三点各自会带来一个普通课程论文不会有的问题,而且它们的处理时机隔着好几个月。
HumanPen 团队
· 16 分钟
先说结论
capstone 和课程论文的差别有三处,每一处的后果不一样。它要交不止一次,所以你自己的中期报告有可能进了论文库,成为最终稿被比对的对象之一。它是几个人合写的,而 AI 写作报告的百分比是整份文档一个数,里面没有"作者"这一列。而最后那个把大家的稿子捏成一种口吻的人,做的恰好是 Turnitin 官方文档点名容易产生误报的那种编辑。
这三件事没有一件是"最后拿工具把全文改一遍"能解决的。其中两件的结果,在几个月前就已经被别人在后台的一个开关上定下来了,你能做的动作是"去问一句",不是"去改一段"。
下面不预测任何分数。Turnitin 公布的是流程结构和文件要求,没有公布合格线,我们也不给。
中期报告是一次独立提交,不是"同一篇的早期版本"
Turnitin 有一个功能,形状和 capstone 的时间表几乎一模一样,叫 Multipart assignment(多部分作业)。官方指南开篇写的是:
"Multipart assignments let instructors connect two or more assignment parts into one larger assignment workflow. Use Multipart assignments when students need to complete a larger project in stages, such as an outline, annotated bibliography, first draft, and final draft." (多部分作业让教师把两个或更多的作业部分连成一个更大的作业流程。当学生需要分阶段完成一个较大的项目时使用,比如提纲、带注释的参考书目、初稿、终稿。)
真正要看的是紧接着的那句:
"A Multipart assignment is a connected set of assignment parts. Each part has its own title, instructions, dates, settings, and submissions, but the parts are grouped together as one assignment experience." (多部分作业是一组相互关联的作业部分。每一部分有自己的标题、说明、日期、设置和提交,只是这些部分被归拢成一次作业体验。)
各自的设置,各自的提交。而且从你这边看过去,官方说这几个部分不一定会显出是一组:`Students see each part of a Multipart assignment as a separate assignment in their LMS or Turnitin, as they normally would.`(学生在 LMS 或 Turnitin 里看到的,是一个个分开的作业,和平常一样。)学生端的指南又说了一遍:你的各个部分"在作业列表里以独立作业的形式出现",并且"每一部分有自己的提交"。
所以第 7 周传上去的中期报告和第 22 周传上去的最终报告,是两次提交、两套设置,不是同一个文件被改了一版。大家常听说的那条保护——重交会覆盖上一次、两者不会互相匹配——说的是重交到同一个作业。这条规则什么时候成立、什么时候不成立,我们在重交的稿子,会和我自己之前那版撞上吗?里逐条写过,结论是:出事的是"交到第二个作业",不是"第二次上传"。
而你第 7 周那份文件到底有没有被存进论文库,是一个开关,而且是设在你上面两层的开关。Turnitin 的账户设置指南列出了管理员可以给教师的权限:
"Enable instructor standard repository options: Chosen instructors will be able to set the assignment option to either store student papers within the standard paper repository or not store the papers in any repository." (开启教师标准论文库选项:被选中的教师可以把作业选项设为把学生论文存入标准论文库,或者不存入任何库。)
开启扩展选项后,教师的可选项变成标准论文库或本机构论文库。管理员也可以直接把选择权收走,选 `Submit all papers to the standard repository`,同一页对它的说明是:`All student papers submitted to the account will be stored in the standard paper repository.`(该账户下提交的所有学生论文都会存入标准论文库。)
换句话说,你这门课的几个提交点,未必按同一套规则处理,而这些设置在上传界面上一个都看不见。
由此得到的动作只有一个,而它的价值全在时机上:在中期提交之前问,不是在最终稿出报告之后问。第 6 周给导师发一封邮件问"这次提交会不会存进论文库",一分钟的事;第 23 周再问,已经没有答案能改变什么了。
还有一点,别默认你们学校有这个结构。官方列出了不支持多部分作业的集成方式:Google Classroom、Sakai、Manaba、In Campus。如果你们的 capstone 跑在其中之一上,那几次提交就只是彼此无关的独立作业——这不改变论文库的问题,但会改变你导师批改时能不能在你的几次提交之间来回翻。
万一真撞上了,也别去改那个数
有一种处理方式我们希望你跳过:小组看到最终稿的相似度很高,查出来源就是自己中期报告里那份文献综述,于是花一周把文献综述重写一遍,直到它不再和自己匹配。
这里有两个问题。
第一,相似度分数和 AI 百分比是两回事,互不影响。官方原文:`The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.` 自己撞自己是相似度层面的事,它和 AI 那个百分比之间没有传导,改掉它也不会让那个百分比动一下。为什么"高/低"的四种组合都可能出现,我们在 Turnitin AI 写作报告和相似度报告有什么区别?里拆过。
第二,也是真正扎人的一点:为了"不再像自己"而重写文献综述,会把这段文字推向官方自己描述误报时点名的那种形态。
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (有时候误报——把人写的文本错判为 AI 生成——会出现在这几类内容上:结构变化不多的内容、字面上重复自己的文本,或者只做了改写、没有产生新想法的文本。)
紧接着的那一句才是要留住的:
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (如果我们的指标在这类文本上给出了较高的 AI 写作占比,我们建议你在看这个百分比时把这一点考虑进去。)
一份纯粹为了不再撞上自己而重写、背后没有新读任何材料的文献综述,对上的正是这句话里的这一项:只做了改写、没有产生新想法的文本。你等于是把一个"教师那边有解法"的相似度数字,换成了一种你自己不好解释的文本形态。
而教师那边的解法才是这件事的正解:把你之前的提交从报告中排除,这个控制项在教师手里,不在你手里。
一份文档,一个数字,没有作者这一列
机制本身就解释了小组文档为什么会这样。Turnitin 的说法是:把提交内容切成重叠的片段,每个片段拿到一个 0 到 1 的概率分;一个合格句子的分数来自覆盖它的那些片段,多个分先池化成一个,再一层层汇总成整份文档的那个数。
把它当成一条流水线读一遍,有件事就很明显了:这条流水线上没有"谁写的"这个字段。文档是单位。五个人的字进去,一个百分比出来,而这个百分比没法再按人拆回去。如果你已经卡在这个局面里了,通用版本在小组作业被标记 AI,但你并没有用 AI,该怎么办。
但报告里确实有一样东西带着分数没有的维度:高亮是有位置的。被标出来的段落落在某一页、某一节、某个小标题下面,而那个小标题是谁写的,你们组自己知道。
这条路要走通,需要两个条件同时成立,而第一个是你得拿到报告,那份报告你自己拿不到:官方写着 `The AI writing detection indicator and report are not visible to students.`(AI 写作检测指标和报告对学生不可见。)紧接着的一句给了唯一的口子:`However, with the PDF download feature, instructors can download and share the AI report with students.`(不过借助 PDF 下载功能,教师可以下载 AI 报告并分享给学生。)所以要的是那份 PDF,不是一张写着百分比的截图。拿到之后怎么读,见怎么读一份 Turnitin AI 检测报告。
二是你得有一份当时就在记的分工记录。一张"章节—负责人—开始日期—最后一次大改日期"的表,放在共享盘里随手更新,一学期加起来十分钟。等到第 23 周被问起来才补出来的同一张表,是一份在事发之后创建的文件,屋里每个人都看得出来。
capstone 报告里,到底哪些部分进了这次测量
Turnitin 只分析它所说的合格文本(qualifying text),定义是"长文写作格式中、由标准语法句子构成的散文句子"。官方同时写明,那个百分比 `is not necessarily the percentage of the entire submission`(不一定是整份提交的占比)。完整定义和排除项在Turnitin AI 检测中的"合格文本"是什么?。
现在想想一份 capstone 报告实际上是由什么构成的。需求表。编号的测试步骤。代码清单。图注。甘特图。附录里的访谈提纲。这些里面成段的句子并不多。
剩下的是:背景、文献综述、讨论、结论——这几块几乎扛下了全部的测量。
而这在小组里是个人的问题,不是排版的问题。多数团队里这四块不是平摊的,它们落在英文写得顺的那个人身上,或者落在那个自愿"负责写字部分"、其他人去做东西的人身上。于是这个文档级的百分比,几乎完全是在一两个人写的文字上算出来的,然后作为一个"这份有五个署名的文档的属性"被报出来。
进那间办公室之前值得先想清楚这一点。因为屋里的第一个问题通常是"这是谁写的",而对于产生了这个数字的那几块,诚实的答案比署名列表短。
那个统稿的人
每个小组文档都有这么一个人:截止日前一周,把五个文件拿过来,让它们读起来像一份东西。
他做的事里有一大半是必要的,而且完全没有风险。把术语统一,别让第三节的"参与者"到第五节变成"受访者"。把方法部分的时态改一致。有人插了一张图之后重编图号。把所有引用统一到一种格式。对齐标题层级。这些都没有碰到任何人的句子结构。
要小心的是另一趟:因为"接缝太明显",把全文抹成一种口吻的那一趟。
回到官方那份误报清单,第一项是"结构变化不多的内容"。一份五个人写出来的文档,天然就带着结构上的差异,而它带着这个差异的原因,正是它由五个人写。抹平口吻的那一趟,抹掉的就是它。
所以落到操作上:统一术语、格式和引用,别动句子的节奏。 capstone 报告读起来像一个团队写的,本来就是对的,因为它就是团队写的。接缝不是评分标准里的缺陷,而为了藏住接缝花掉的力气,恰好花在你更想保住的那个维度上。
如果文档放在协作编辑器里,还有第二个不要动的理由:那个编辑器留下的"哪一段是谁写的"记录,在有人把每一段都编辑一遍之后就基本作废了。各家工具到底留下了什么,我们逐个查过,在怎么在 Word、Google Docs 和 Overleaf 里留住版本历史。
那个不在你们系统里的第二读者
如果 capstone 有校外合作方——企业、医院、街道、实习单位的课题——就多出一个坐在上面所有系统之外的读者。有三件事值得早点弄清楚。
这场对话里没有人手上有报告。 学生看不到 AI 写作指标,校外的人更看不到。如果合作方问"这份东西查过 AI 吗、结果是多少",唯一的路径是你导师把 PDF 下载下来。走学校,不要绕过学校。
交给合作方的文件,未必是交给学校的那一份。 交付版通常会去掉反思部分和给评分用的附录,也可能加上学校根本不看的材料。两个文件,两个词数。这一点只在一个边界上要命:提交超过 30,000 词就不会生成 AI 写作报告,而一份带附录的 capstone 报告压到这条线附近的频率,比大家想的高。超出文件要求的提交不是"干净",是"没跑成",两者的区别我们在一整本学位论文,Turnitin 查得了吗?里写过。
如果项目材料涉及保密,论文库那个开关就不只是行政问题了。 你的提交存不存,是前面引的那个设置,可以设成"教师逐个作业选",也可以设成"该账户下所有论文一律入库"。事后想撤下来不是你能做的动作:官方把它描述成一个逐级上报的请求——`instructors have the ability to request the deletion of any submissions in their assignments. Administrators can approve or reject requests.`(教师可以请求删除其作业下的任何提交,管理员可以批准或拒绝。)所以如果合作方的数据在你的附录里,这件事要在第一次上传之前和导师谈,而不是在最后一次上传之后填表。
我们没法告诉你合作方会要求什么、会接受什么。没有人能,谁给出一个肯定答案,谁就是在替你猜。可知的是学校这一侧,而学校这一侧是一组有名字的开关。
如果你们学校用的不是 Turnitin
上面每一处引文都来自 Turnitin 自己的帮助文档,只对使用 Turnitin 的院校成立。如果你们用的是别的系统,能迁移过去的不是那些具体名词,而是三个结构性的问题,你可以拿去问教务或导师:
- 我们这门课的每一次提交,是不是各自独立的一次入库?
- 存不存、存到哪里,是谁在哪一层设置的?
- 事后要撤,走的是什么流程、谁批?
这三个问题的答案在哪套系统里都存在,只是名字不一样。真正会出事的从来不是"你不知道某个功能叫什么",而是"你以为这几次提交是同一件事"。
第一周就该做完的事
下面这些在 capstone 刚开始时都很便宜,到结尾时一件都做不成。
- 问清楚哪几次提交会入库。 一封邮件,把这门课所有提交点一次问完,在第一次提交之前问。
- 建一张分工表。 章节、负责人、开始日期、最后一次大改日期。放共享盘随手更新,不要事后重建。
- 说好共享文档归谁所有。 在多数协作编辑器里,建文件的那个人对历史记录拥有其他人没有的权限。
- 每到一个节点,给版本起个名字。 不管你的编辑器把这个动作叫什么,一个带日期、带两个字说明的命名版本,比一百个自动版本有用。
- 统稿规则在最后一周之前就定好。 术语表、引用格式、图表编号、标题层级。第二周写下来,第二十二周就没人需要去"抹口吻"。
- 早点知道最终提交会不会超过 30,000 词,早到还来得及拆分,而不是交稿前一夜发现报告根本没跑出来。
如果你已经过了"预防"这个阶段,被标记了,但确实是你自己写的:怎么准备申辩讲的是怎么把回应组织起来;如果你们这门课用的是 Turnitin 浏览器里的写作空间而不是上传文件,那个空间记录了什么是另一个话题,在Turnitin Clarity 记录了你写作过程的哪些东西。
改写在这件事里的位置
改写解决不了上面三个问题里的任何一个。它改不了"当初哪次提交入了库",给不了那个百分比一个作者列,也替代不了"这份文档是怎么长出来的"这份记录。
它有位置的场合很窄也很具体:你手上有那份 PDF 报告,有几段被高亮了,而你想只动这几段——因为文档的其余部分是另外四个人写的、也是他们校对过的。这一条正是小组文档和个人论文真正的差别:凡是被工具改过的地方,都得有人再读一遍才敢交,而在 capstone 里,那个人不一定是你。
HumanPen 的设计就是奔着把这个数量压小去的:文档连同报告一起传上去,报告里的高亮定义改写范围,没被标出来的段落原样返回。段落是它能改动的最小单位,所以只命中半段时会扩成整段,并且在开跑之前先把范围给你看。计费只算真正被改写的那些词,不看文件多大。符合条件时可以免费继续降 AI。
这说的是范围和成本,不是你下一次送检会拿到什么数字。那种话我们不讲。在一份五个作者的文档上,它有用的地方只有一个:你们组开会前要重读的段落清单,短一些。
常见问题
AI 百分比能告诉导师是我们几个里的谁用了 AI 吗? 不能。官方对机制的描述里没有作者这个字段:提交被切成重叠片段、逐段打分、池化后汇总成文档级的一个数。报告里唯一带位置信息的是高亮,那是唯一能和人对上的东西,而且前提是你们组本来就知道谁写了哪一节。
中期报告和最终报告都在系统里,这算问题吗? 这是相似度层面的问题,不是 AI 层面的问题,而答案取决于中期那次提交有没有被存起来。那是教师在作业设置里选的,可选项由管理员开放。要问就在中期提交之前问;如果已经撞上了,拿去找教师——把之前的提交从报告中排除,是他那边的控制项。
我们最终报告加附录 45,000 词,会怎样? Turnitin 的文件要求写明,提交不得超过 30,000 词才会生成 AI 写作报告。超过这个上限就没有百分比,指标显示的是"无法处理这次提交",不是"干净"。
最后有一个人把全文编辑了一遍让它读起来一致,这做错了吗? 不一定,而且统一术语、引用和格式的那部分完全没问题。要小心的是把所有人的句子抹成一种口吻的那一趟——因为"结构变化不多的内容"是官方自己那份误报清单上的第一项,而一份五个人写的文档,这种差异本来是白送的。
我能不能拿版本历史来代替对着分数争论? 可以拿出来,也值得拿出来,但它自己了结不了任何事。官方说自己的分数 `should not be used as the sole basis for adverse actions against a student`(不应作为对学生采取不利行动的唯一依据),在另一页又把它称作 `a single data point rather than a definitive response`(一个数据点,而不是一个定论)。你的版本历史在同样的意义上也是一个数据点。哪个数据点有多少分量,由你学校的学术诚信处理程序决定——那份文件才是要去读的东西。
继续阅读