短文档的「全有或全无」:为什么几百词的稿子分数会走极端
Turnitin 要靠互相重叠的片段才能给出有层次的 AI 分数。几百词的稿子凑不出足够的片段,结果就变得粗暴。这篇讲清楚重叠机制怎么运作,以及短作业为什么最吃亏。
HumanPen 团队
· 10 分钟
重叠片段是怎么运作的
要理解为什么短文档会产生不可靠的 AI 写作分数,我们首先需要了解 Turnitin 如何处理文本。文档解释道:"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1..."
"overlapping"这个词在这里承担着重要作用。Turnitin 不会把你的文档作为一个连续块来分析,而是将文本分割成相互重叠的段落,意味着一个句子可能出现在多个段落中。每个段落获得自己的 0 到 1 之间的预测分数,最终的 AI 写作百分比来自这些单独段落分数的综合。
这种重叠使模型能够产生细致的百分比,而非二元的是或否结果。当段落重叠时,模型可以比较文本不同部分的分类结果。一个位于两个低分段落和两个高分段落之间的段落,有助于形成更审慎的整体预测。没有重叠,模型就失去了三角定位的能力,分数变得不够精确。
只剩一个片段时会发生什么
当文档非常短时,没有足够的文本来创建多个重叠段落。文档直接说明了后果:"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."
单一段落意味着模型对整个文档做出一次预测。没有跨段落的平均计算,因为没有可平均的内容。模型审查文本一次,给出一个分数,那个分数决定了文档是否被标记为 AI 生成。
文档继续写道:"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." 这就是核心问题。如果你在 300 词的文档中自己写了 200 词并使用 AI 写了 100 词,模型无法区分两者。它将文档作为一个整体来处理,如果这个整体得分超过阈值,整篇文档就会被标记。报告无法显示哪些具体句子是 AI 生成的,因为预测是在文档层面做出的,而非句子层面。
300 词这条线
Turnitin 对提交设置了最低字数要求,技术规格规定下限为 300 词。接受的文件格式为 .docx、.pdf、.txt 和 .rtf,最多 30,000 词,文件大小不超过 100MB。支持的语言为英语、西班牙语和日语。
300 词的下限并非随意设定。文档解释道:"Results show that our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate." 低于这个阈值,模型根本没有足够的文本可供分析。重叠机制需要素材来创建多个段落,300 词大致是模型开始产生更可靠预测的起点。
即使在 300 词或略高于 300 词时,重叠也可能很少。一篇 350 词的文档可能只产生两三个略有重叠的段落,这比一个要好,但离 2,000 词论文的段落密度还差得远。准确性的提升是渐进的。更多文本意味着更多段落、更多重叠,以及模型在同一文档内区分 AI 生成内容和原始内容的更多机会。
混着写的稿子,可能整篇被判成 AI
All-or-nothing 问题在短文档包含原始和 AI 生成混合文本时最为明显。文档指出 "some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." 对于一个大部分自己写但部分使用 AI 的短作业学生来说,这意味着即使大部分文本是原创的,整篇文档仍可能获得高 AI 写作分数。
某些类型的写作会使这个问题更严重。文档指出:"Sometimes false positives... can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." 讨论帖和简短反思这类短作业通常符合这些描述。它们往往比完整的研究论文结构变化更少,可能以相似的句式重复相似的观点。文档建议:"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."
还有一个 Turnitin 已识别并处理的具体模式。2023 年的一項更新指出:"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." 短文档受开头和结尾内容影响更大,因为这些部分在总文本中占比例更高。2023 年的修复有所帮助,但短文档的结构性脆弱性仍然存在。
讨论帖、短反思这类作业该怎么看
短作业在 AI 检测中面临多重叠加的挑战。段落更少,重叠更少,结构变化更少。更容易包含通用的开头和结尾内容。所有这些因素使得短文档的 AI 写作分数不如长文档可靠。
讨论帖、短篇反思和简短回答论文是高等教育中最常见的短篇作业。如果你正在写这类作业,你应该知道为你的提交生成的 AI 写作报告可能无法区分你的原创写作和任何 AI 辅助部分。一个低分段落就可能将整篇文档翻转为被标记类别。
文档承认这一局限:"Our AI writing detection model may not always be accurate... so it should not be used as the sole basis for adverse actions against a student." 这一声明对于 all-or-nothing 动态起作用的短文档尤为相关。如果你在短作业上收到 AI 写作标记,报告可能反映的是单段落预测的局限性,而非对你写作过程的清晰信号。
Turnitin 还声明:"We strive to maximize the effectiveness of our detector while keeping our false positive rate... under 1% for documents with over 20% of AI writing." 该误报目标适用于具有足够长度以进行可靠分析的文档。短文档处于最优范围之外,误报率可能更高。
我们建议对短文档上的 AI 写作分数保持谨慎。自己写你的作品,避免在开头和结尾使用通用措辞,如果你需要在提交前验证草稿,试试我们的 humanizer tool 来检查你的文本水平。
继续阅读