引用的访谈/问卷回答被判 AI?Turnitin 到底在查什么
你在访谈或问卷部分引用了受访者的回答,Turnitin 却把它标成 AI 写的——那是真人的话啊,检测器怎么会这么判?Turnitin 官方说明说:AI 检测器用语言模型分析句子,文档里没有任何「引文豁免」。直引和普通句子一样被分析,这就是为什么一段通顺的受访者回答会被标记。这篇讲官方机制、什么形态的文本会被排除、以及你实际可选的方案。
HumanPen 团队
· 4 分钟
短答案
Turnitin 的 AI 检测不会跳过引文。官方文档描述的是这样一个检测器:把提交里的句子提取出来,用语言模型分析——任何官方页面里都没有「引号」作为排除项。
一段读起来通顺的受访者原话,会和论文里其他句子一样被分析。这就是为什么真人的话也会显示为 AI:检测器看的是句子结构和词概率,不是这句话最初是谁写的。
官方机制:分析的是句子,不是引文
Turnitin 的 FAQ 讲检测怎么做时,对分析单位说得很明确:
论文提交后,句子会被提取出来、切分成重叠片段做预测分析。每个片段由 AI 检测模型分类,得到一个 0 到 1 之间的值。
单位是句子。官方 AI 写作报告页面从另一个方向说了同一件事:百分比基于长篇写作格式中的散文句子,「模型对非散文形式——比如诗歌、脚本、代码——无法可靠检测,也不检测短形式/非常规写作,比如项目符号、表格、注释书目」。
这些描述里没有任何「引文」类别。引号里的句子对检测器来说,仍然是一个句子。
为什么引用回答会被标
受访者数据的两个特点让它容易中招:
回答是口语,不是书面散文。 口述的回答转写下来,往往是短句、重复、口语化。如果你保持这种形态,它可能被当作短形式或非散文文本——检测器会排除这类。但大多数研究论文会把引文融进流畅的段落里:先介绍受访者,引用原话,再加以评论。到这一步,引文就是段落里的一个句子,它会按句子被分析。
访谈回答可能异常规整。 回答结构化问卷的受访者,倾向给出完整、结构匀称的句子。官方措辞说检测器训练去分辨人类和 AI 写作者的「词概率序列」,而高度规整的句子正是 AI 生成文本常有的形态。这句引文看起来就像模型被训练去抓的那种东西。
结果是一场错位:词是真人的,但统计形态接近生成文本。
文档排除什么——以及不排除什么
官方文本里的排除清单,按的是文本形态,不是文本来源:
模型对非散文形式——比如诗歌、脚本、代码——无法可靠检测,也不检测短形式/非常规写作,比如项目符号、表格、注释书目。
一条保持短答形态的受访者回答,作为项目符号或单行列表项,可能落在分析之外。同一句话改写成你段落里流畅的句子,就落在分析之内。单靠引号什么也改变不了——关键看它读起来是不是长篇散文。
除了改变形态,没有文档写明的「保护引文不被分析」的办法:保持短形式,或者干脆不引用。
报告标了引文怎么办
如果你的相似度或 AI 报告标了某段受访者原话,官方指引和其他被标的句子一样:把指示器当信号,不是当判决。Turnitin 的 FAQ 说,百分比「不应作为采取行动的唯一依据,也不应作为老师的最终评分标准」。
按顺序,你的选项:
- 先看被高亮的句子本身。 打开 AI 报告,读被标的文本。如果是受访者的原话,对照你的录音或转写记录核对——那就是你的证据。
- 判断这句引文是否需要保持现在的形态。 只有真正的短小形态——一行回答保留成列表项——才落在分析之外;一个完整句子无论你是否缩进成块引文,都仍在分析之内,因为模型读的是散文句子,与排版无关。所以这一招只对本来就很短、本来就是列表形态的回答有用。
- 保留你的记录。 转写稿、录音、签过字的同意书,是「这些话不是生成的」的证据。被标的引文加上你的记录,是你和老师谈这件事时应该依靠的东西。
- 只调整引文周围的文字,不动引文本体。 改写受访者的话去改变它的形态,等于改数据。站得住脚的做法是原样保留引文,重新考虑它的呈现方式,而不是它的内容。
一句话总结
Turnitin 的 AI 检测器用语言模型分析句子,官方文档里没有引文豁免。受访者的回答一旦融进散文,就和其他句子一样被分析——而高度规整的回答在统计上确实会接近生成文本。文档里存在的排除,是按文本形态(短形式、列表、非散文)来的,不是按引号来的。如果引文被标,指示器是信号不是判决:对照记录核实原话,重新考虑呈现方式,保持引文内容原样。
继续阅读