Turnitin 会读表格里的文字吗?哪些算、哪些不算

表格里的文字曾经对 Turnitin 的 AI 检测完全隐形,后来改了。这篇讲现在哪些会被处理、哪些仍然被排除,以及百分比和高亮为什么经常对不上。

HumanPen 团队

· 11 分钟

表格到底算不算,为什么大家都搞不清

如果你曾提交过含有数据表格的论文,然后盯着 AI 写作检测报告看,你大概会好奇 Turnitin 到底分析了哪些内容。这种困惑很正常。很长一段时间里,one Turnitin help article says: "The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies."

这措辞把表格和诗歌、脚本放在同一类别,而检测器不会处理这些格式。学生和教师因此理解为表格内的任何文字都被完全忽略了。这个理解说得通,但并不是全部情况。

实际情况是,Turnitin 的 AI 检测只处理它所称的 prose sentences。文档解释道:"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." 表格被排除并不是因为有关于表格的特殊规则,而是因为大多数表格内容本身并不符合 prose 的定义。

表格里哪些文字会被分析

Turnitin 更新了处理逻辑。它的 AI writing detection model 页面(guides.turnitin.com/hc/en-us/articles/28294949544717-AI-writing-detection-model)里 2023 年 8 月 9 日那一条写道:"We are now able to process long-form prose text in tables." 这是一项有意义的改进。如果你的表格包含以标准语法形式写成的完整句子,这些句子现在会被 AI 检测模型分析。

关键词是 "long-form prose text"。一个表格单元格中写着"The results indicate a statistically significant correlation between variable X and variable Y, with a p-value below 0.01"是标准的 prose sentence,会被处理。一个单元格写着"p < 0.01"或"Variable X, 0.85"则不是句子,而是数据片段,会被跳过。

这一区分很重要,因为许多学术表格混合了完整句子和短数据条目。句子部分会被分析,数据部分不会。你不能假定整个表格要么全部包含要么全部排除。Turnitin 以文本块为单位评估内容,寻找标准语法句子,不管它们出现在表格单元格还是文档正文中。

同一条还指示:"Resubmit to reprocess existing submissions that contain tables." 如果你在此次更新前提交了论文,其中的表格 prose 未被处理。重新提交会触发更新后的逻辑。

哪些内容被排除在外

即使有了表格 prose 更新,仍有几类内容不在 AI 检测分析范围内。Prose-only 规则意味着 bullet points、短非句子结构和列表不会被处理。如果你的表格包含短片段而非完整句子,这些片段会被排除。

Bibliographies 是同一天修的。2023 年 8 月 9 日那一条指出:"We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." 这个修复解决了一个具体问题,即参考文献条目被误标并产生误导性结果。指引很明确:"Resubmit to reprocess existing submissions that contain highlighted reference sections."

因此被排除的列表包括短表格片段、bullet points、数据条目,以及现在完全排除的 bibliographies。检测器专注于文档正文和表格单元格中的 prose sentences,跳过其他所有内容。这不是系统缺陷,而是一个设计选择,因为检测模型基于 prose 训练,而非数据格式或引用结构。

百分比和高亮为什么对不上

AI 写作百分比与报告中高亮文本之间的差距是最常见的困惑来源之一。文档直接回应了这个问题:"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights."

如果你的文档包含有完整句子的表格、短数据片段、bullet points 和 bibliography,只有 prose sentences 会被分析。百分比反映的是被分析的 prose 中模型归类为 AI 生成的比例,并不反映整个提交的比例。文档指出:"This percentage is not necessarily the percentage of the entire submission."

这就是为什么你可能看到 40% 的 AI 写作分数,但只有几段高亮文字。高亮显示的是被标记的 prose 片段,百分比是根据实际处理的 prose 计算的。被排除的内容,如表格数据或 bibliography 条目,不会出现在高亮中,也不会以你预期的方式纳入百分比计算。

理解这一区别有助于正确阅读报告。百分比不是高亮文本与总文本的简单比率,而是基于模型实际处理的 prose 得出的分数,这个 prose 可能只是你整个文档的一个子集。

提交前该检查什么

在提交包含表格的文档之前,我们建议检查表格内容。如果你的表格单元格包含完整句子,这些句子会被 AI 检测器分析。确保这些句子体现的是你自己的写作。如果你用 AI 起草了任何表格 prose,这些 prose 会像论文中其他任何句子一样被评估。

检查你的 bibliography。Bibliographies 现在被排除在 AI 写作分析之外,所以参考文献不应显示为高亮文本。如果你有一份较旧的报告其中参考文献被标记了,重新提交文档会应用更新后排除 bibliographies 的逻辑。

如果你有一份包含混合内容类型的文档,百分比和高亮部分看起来不一致时不要惊讶。正如文档所解释的,当文档包含多种不同写作类型时,百分比和高亮之间的差异是正常的。阅读高亮以了解哪些具体 prose 片段被标记,并将百分比视为来自被分析 prose 的分数,而非来自整个提交的分数。

如果你想在提交评分之前验证文档在 Turnitin AI 检测下的表现,我们为此构建了一个工具。试试我们的 Turnitin report preview,看看你的 prose 处于什么水平。

继续阅读