AI 率高,会不会悄悄拉低成绩?一项 214 名教师参与的实验

被指控是一种担心。还有一种更说不出口的:AI 率很高的报告就放在你的论文旁边,老师打分时看到了,却从来没人提起。2026 年 7 月发表的一项研究正好测了这个情形:一篇论文、四个版本的虚构检测报告、214 名老师。测出来的差距很大,但不能拿它预测你自己成绩的理由也不少。

HumanPen 团队

· 9 分钟

没人指控我,AI 率高会不会悄悄拉低成绩?

在一项实验里,会,而且差得不少。214 名大学教师先看一份检测报告,再给同一篇课程论文打分。报告写 7% AI、判为低风险、什么都没标时,这篇论文平均拿到 73.30 分(满分 100);报告写 87%、判为高风险、还把论文里的四句话标成红色时,平均只有 51.61 分。论文本身一个字没改。

但这不等于你的成绩会掉 22 分,甚至不等于一定会掉。报告是研究者自己编的,论文是中文写的,老师是在线上问卷里打分而不是在真实课程里,214 人里只有 16 人(7.5%)用过 AI 检测工具。 这项研究真正说明的是:报告上的分数和它旁边那行结论,改变的不只是老师怀不怀疑 AI,还有老师对文章本身好坏的判断。

这项研究题为《Automation bias in teachers' evaluation of student writing: effects of algorithmic warnings and visual risk cues in AI detection reports》(教师评价学生写作中的自动化偏差:AI 检测报告中算法预警与视觉风险提示的影响),作者是阿尔法拉比哈萨克国立大学的 Peitao Du、Tingting Liu 和韩国天主教大学的 Xujin Xian,2026 年 7 月 7 日发表在《Frontiers in Psychology》上,可以免费阅读全文。作者声明没有接受资助,也没有商业或财务上的利益冲突。

老师们看到了什么

研究者自己写了一篇论文,题目大意是「在线教育的效果与挑战」,定位是一篇中等水平的本科课程论文:语言流畅,结构基本完整,观点比较常规,论证不深。他们在里面放了四句套话。这四句没有明显的事实错误,也没有明显的逻辑断裂,只是那种谁的文章里都可能出现、读起来有点空的句子。

然后他们给一个并不存在的检测工具「AcademicCheck」做了四个版本的报告:

组报告写的 AI 率那四句是否标红
A7%否
B7%是
C87%否
D87%是

每位老师被随机分到其中一个版本,每组 52 到 55 人。他们先看报告摘要,再读论文。每份报告除了数字,还附了一句结论:7% 的版本写的是 "Low risk"(低风险),说文本呈现 "predominantly human-authored writing characteristics"(以人类写作为主的特征);87% 的版本写的是 "High risk"(高风险)和 "a high likelihood of AI-assisted writing"(很可能是 AI 辅助写作)。标红的版本里,报告还提示这几处需要人工复核,所以这里的「标红」是颜色加提示语,不只是颜色。答完之后,研究者告诉老师们这份报告是模拟的。

数字变高之后,变了什么

组报告论文平均分(0–100)打算出手干预的程度(1–7)
A7%,不标红73.303.40
B7%,标红71.873.72
C87%,不标红60.644.89
D87%,标红51.615.66

主要是 87% 那份报告在起作用。 不标红的情况下,把 7%「低风险」的报告换成 87%「高风险」的,论文平均少了约 13 分。老师们也不只是觉得它更像 AI 写的,给原创性、语言表达、逻辑结构打的分也都更低了,可他们读到的文字一字不差。

报告已经判了高风险,标红的影响才最大。 在 7% 的条件下,把四句话标红,对百分制分数的影响没有达到统计显著;但老师对语言表达的评分确实降了。这说得通:老师刚被指着看的,正是这几句。到了 87%,同样的标红又让分数多掉了大约 9 分。

老师们说自己会做更多。 最后一列问的是:老师有多大可能要求学生修改、提醒学生独立写作或遵守 AI 使用规范,或者要求学生解释写作过程和资料来源。在 7 分制上,它从 3.40 升到了 5.66。这是老师们自己说会怎么做,不是观察到的实际行为。

为什么这不是你成绩的预告

作者自己把结果称为 "preliminary and context-specific"(初步的、限于特定情境的)。下面这几条说明了这个说法为什么贴切。

  • 报告是虚构的,而且故意拉得很极端。 用「AcademicCheck」这个编出来的工具,是为了不让老师对真实工具的既有看法掺进来。两个数字也是特意挑得相距很远。作者说这个反差 "was intentionally strong"(是有意设得很强的),为的是看老师对明显偏低和明显偏高的预警会不会有不同反应;至于现实中落在两者之间的分数,他们说推广时要谨慎。
  • 只有一篇论文,而且是中文的。 所有老师读的都是同一篇中文论文。「中等水平」是研究者自己定的,他们说没有经过预实验或外部评分者校准。换成一篇很好或很差的论文,结果未必一样。
  • 大多数老师没用过检测工具。 他们是通过问卷星和教师社群在线招募的,有少量报酬,约三分之二教社会科学。只有 16 人(7.5%)用过 AI 文本检测或 AI 查重工具。正文和补充材料都没有把这 16 人的结果单独拿出来报告。
  • 这是问卷,不是成绩册。 老师手上只有报告和论文,别的信息几乎没有,打的分也不算在任何学生头上。作者自己的结论是,这些发现 "should not be generalized directly to all real grading contexts."(不应直接推广到所有真实的评分情境。)
  • 差距大得少见。 每一组里,大多数老师给的分数离本组平均不到 5 分,A 组和 D 组的平均分却差了将近 22 分。作者自己也说,这么大的效应 "should be interpreted cautiously."(应当谨慎看待。)他们认为部分原因是 7% 和 87% 的反差太强、老师掌握的背景信息太少:"In real teaching, teachers may see intermediate rates and have richer information about students and writing processes, so actual bias may be smaller."(在真实教学中,老师可能看到中间水平的分数,对学生和写作过程也了解得更多,所以实际的偏差可能更小。)

它对真实的阅卷意味着什么

把这些具体条件放到一边,有一个发现仍然站得住:老师是先看报告、后读论文的,而报告改变了他们读论文的方式。作者的解释是,像 "AI content: 87%"(AI 内容:87%)这样的数字,会把老师手上的活从「评这篇论文」变成「核对系统说得对不对」。他们给高校的建议里有一条是两步走:老师先 "complete their quality evaluation before reviewing the detection report"(在查看检测报告之前完成质量评价)。

我们的读者面对的大多是 Turnitin,不是虚构的工具。Turnitin 自己的文档里有三点值得和这项研究放在一起看。

  • 你通常看不到老师看到的东西。 Turnitin 的 FAQ 写着 "only instructors and administrators are able to see the indicator"(只有教师和管理员能看到这个指标),不过教师可以把 AI 报告下载成 PDF 分享给学生。谁能看到什么,见学生能看到 Turnitin AI 率吗?学生端与教师端权限对照。
  • 低分不带高亮。 Turnitin 说 "no score or highlights are attributed for AI detection scores in the 1% to 19% range."(AI 检测分数在 1% 到 19% 之间时,不给出分数,也不做高亮。)报告上显示的是一个星号。所以 B 组那种「数字很低、句子却被标出来」的组合,在现在的 Turnitin 报告里不会出现。分数在 20% 以下时,报告上没有被 AI 检测标出的句子去牵引老师的视线。详见Turnitin AI 率上的星号(*%)是什么意思?
  • Turnitin 说这个数字不是成绩。 同一份 FAQ 写着,这个百分比 "should not be used as the sole basis for action or a definitive grading measure by instructors."(不应被教师用作采取行动的唯一依据,也不应作为决定性的评分标准。)可是这个实验里没有人让老师拿 AI 率当评分标准。老师只是被请来给一篇论文打分,报告就跟着进来了。成绩本来应该从哪里来,见Turnitin 分数是成绩吗?相似度分数实际是什么、不是什么。

所以这项研究没法告诉你,你的老师有没有被影响、影响了多少。它做到的是:「那份报告可能会左右老师怎么读我的论文」不再是多心,而是一件可以正常去问的事。

你能做什么

下面这几件事,都不需要等到有人指控你才做。

  1. 成绩看着不对劲,问评分标准,别问 AI 率。 「哪几项评分标准扣了分,体现在哪几段?」是拿到任何成绩后都可以问的正常问题。标红还改变了老师写给学生的意见:问到会建议学生怎么改时,看到 7% 加标红报告的老师有 65.4% 提了语言上的修改,看到同样 7% 但没标红的只有 7.5%;关于充实内容的建议则从约一半降到几乎没有。(作者把这部分开放题编码定为探索性分析。)如果你拿到的意见全是措辞,一句没提论证,就把论证也问一问。
  2. 问一下打分时有没有用到 AI 报告,有的话要 PDF。 光一个百分比说明不了多少,报告里才看得到哪些段落被标了出来。
  3. 准备好随时能拿出写作过程。 研究问的后续动作不是处罚,而是要求修改、提醒遵守 AI 使用规范、要求解释写作过程和资料来源。看到 87% 加标红报告的老师,明显更倾向于提出这些要求。手上有草稿、笔记和版本历史,被问到时就能很快答上来。
  4. 还在修改、手上又有报告的话,先读被标出的段落。 实验里被标红的是下面这四句(作者提供的英译):"With the rapid development of information technology, online education has gradually become an important component of higher education."(随着信息技术的快速发展,在线教育已逐渐成为高等教育的重要组成部分。)"This paper analyzes this issue from three aspects: learning effects, interaction modes, and technical conditions."(本文从学习效果、互动方式和技术条件三个方面分析这一问题。)"In conclusion, online education brings convenience but also faces many practical challenges."(总之,在线教育带来便利,也面临许多现实挑战。)"Therefore, this issue deserves continued attention and further research from the education community."(因此,这一问题值得教育界持续关注和进一步研究。)这类句子一被标出来,老师对语言的评分就跟着往下走。放进谁的文章都成立的开头、路线图句和结尾,本来也值得换成你自己的话。

HumanPen 能帮上什么

如果你手上有 Turnitin 或 iThenticate 报告,还在修改阶段,课程也允许这类帮助,HumanPen 的降 AI 功能处理的就是被标出的段落。导入 Turnitin 或 iThenticate 报告,只改报告标出的段落,返回同格式的可编辑文件。交上去之前,自己把返回的文件从头看一遍。

常见问题

老师们知道报告是假的吗? 打分时研究者没告诉他们。答完之后,研究者才说明报告是模拟的,不构成真正的学术诚信判定。

这是一项关于 Turnitin 的研究吗? 不是。报告来自一个编出来的工具「AcademicCheck」,目的是不让老师对真实检测工具的看法影响结果。

AI 率 7% 时,标红有影响吗? 对百分制分数没有统计显著的影响,但老师对论文语言表达的评分降低了。

Turnitin 低于 20% 只显示星号,星号会不会也有这种影响? 这项研究没测。它的低分条件是 7% 这个数字加一句「低风险」结论,不是星号。星号本身也在告诉老师「检测到了一点」,老师会怎么读它,这项研究回答不了。

参考来源

继续阅读