Pangram vs Turnitin:两个 AI 分数为什么对不上
期刊、学校或者发表平台拿 Pangram 扫了你的文本,你手上还有一个 Turnitin 的数,两个对不上。原因比「模型不一样」要具体得多:这两家连该报哪一种指标都没谈拢,再往下一层,它们数的单位不同、算的语料也不同。下面是两家各自公布的东西,以及两个数永远合不上时你还能做什么。
HumanPen 团队
· 19 分钟
先说结论
Pangram 给出的分和 Turnitin 给出的分,不是对同一样东西的两次读数,所以两者有差距是意料之中的事,而不是哪一边坏了的证据。 Turnitin 2024 年 8 月的白皮书写着,公司不把 "accuracy"(准确率)当作指标。Pangram 的首页上挂着一个 "99.9%+ Accuracy"(准确率 99.9% 以上)徽章,这是 2026 年 9 月 15 日看到的版本。再往下一层,两边又分开了:Turnitin 的 FAQ 描述的是句子被切进彼此交叠的片段去打分、百分比只在合格文本上取;Pangram 的模型卡(厂商为这个模型公布的技术说明)描述的是按 token 预测、三个标签、文档占比按字符加权。真会带来后果的那个数,是你所在机构用来做决定的那个工具给出的。
两家连该报哪一个指标都没谈拢
Turnitin 那份白皮书叫《Turnitin's AI Writing Detection Model Architecture and Testing Protocol》,落款是 2024 年 8 月。里面有这么一句:
"Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed."(Turnitin 不把「准确率」当作指标,因为它太容易被操纵,也太依赖于计算它时所用的那份具体数据集。)
理由就在下一句里,而且这个算术你自己就能验:
"For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system."(举例来说,设想一份含 100 篇文本的数据集,其中 99 篇是人写的。一个简单、笨拙的算法,把每一篇都判成「人写」,在这份数据集上就能拿到 99% 的准确率,尽管它作为 AI 写作检测系统毫无价值。)
这个例子才是真正值得拿走的东西。一个什么都不标的检测器,在那 100 篇里能对 99 篇,所以这个数字是跟着测试集的构成走的,不是跟着检测器的好坏走的。白皮书接着说自己用的是另外两个指标:`Turnitin uses two main metrics to test AIW-2: recall and FPR.`(Turnitin 用两个主要指标来测试 AIW-2:召回率和误报率。)这两个指标在同一节里都有定义,并配有算例。
Pangram 这边把准确率放在很显眼的位置。首页徽章写的是 "99.9%+ Accuracy"(2026 年 9 月 15 日)。高等教育那个页面把两个数摆进了同一条横幅:开头一句是 "99.98% accuracy",往后 52 个字符是 "99.9%+ Accuracy" 徽章,中间夹着的是 "Detects AI Assistance Free Credits"。而 Pangram 自己那份 Pangram 4 模型卡(日期 2026 年 7 月 29 日)没有把准确率放在标题位置,它报的是按语料、按语言、按领域拆开的误报率和漏报率。
所以这两个头条数字,不是同一个属性上的一个高分和一个低分。其中一家已经用白纸黑字反对了另一家主打的那个指标。我们不评判哪一种选择更对,这两句话也都不是什么内幕——今天它们都印在公开页面上。
两个百分比各自在数什么
两套系统都返回一个百分比,而这两个百分比是用不同的原料搭起来的。
| Turnitin(FAQ 与 2024 年 8 月白皮书) | Pangram(Pangram 4 模型卡,2026 年 7 月 29 日) | |
|---|---|---|
| 分类的单位 | 句子,再拼进彼此交叠的片段 | token,解码成长度不定的片段 |
| 重叠怎么处理 | 落在多个片段里的句子会拿到多个分,"which are then pooled into a single score"(随后被汇总成一个分数) | 在 512-token 的推理窗口内,"predictions for tokens that appear in multiple windows are aligned and averaged"(出现在多个窗口里的 token,其预测会被对齐并取平均) |
| 文档百分比是谁的占比 | 只算合格文本。"this percentage is not necessarily the percentage of the entire submission"(这个百分比不一定是整份提交内容的百分比) | 被分析的那份文档。`fraction_human`、`fraction_ai_assisted`、`fraction_ai` 是 "character-weighted"(按字符加权)的,并且 "sum to 1.0"(相加等于 1.0) |
| 有几个类别 | 两个。百分比覆盖的是 "likely generated by AI or likely generated and modified by an AI paraphraser or bypasser"(很可能由 AI 生成,或很可能由 AI 生成后再经 AI 改写工具或规避工具修改)的那部分文字 | 三个:`Human`、`AI-Assisted`、`AI-Generated` |
| 最短长度 | 300 词的散文 | 50 词 |
| 低分怎么显示 | 1% 到 19% 只显示一个星号,不给百分比,也不给高亮 | `prediction_short` 在人写字符至少占九成时返回 `Human`,AI 字符至少占八成时返回 `AI`,其余情况返回 `Mixed` |
分母那一行才是真正咬人的地方。Turnitin 的 FAQ 说,显示出来的百分比覆盖的是 "the amount of qualifying text within the submission"(提交内容中合格文本的数量),并且 "If text within the submission is not considered long-form prose text, it will not be included."(如果提交内容里的某段文字不被视为长篇散文,它就不会被计入。)Pangram 那几个占比覆盖的是被分析的文本,相加等于 1.0。把同一篇带长参考文献列表、目录和几张表格的论文交给两套系统,在模型开跑之前,它们面对的词就已经不是同一批了。怎么读一份 Turnitin AI 检测报告把哪些东西进得了、哪些进不了 Turnitin 那个分母走了一遍。
1% 和万分之一不在同一把尺子上
这是最常被摆在一起的两个数,而把其中一个除进另一个,得到的比值没有任何意义。两个都叫误报率,测法却不是一回事。
Turnitin 的 FAQ 给的是一个目标:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing."(我们力求最大化检测器的效力,同时把误报率——即把完全由人写的文本错判为 AI 生成——控制在 1% 以下;这适用于 AI 写作占比超过 20% 的文档。)
句尾那个条件是承重的,白皮书解释了它从哪来。一份文档被标成 AI 生成,条件是超过 20% 的句子级分数越过了某个句子阈值;白皮书写着 "the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%)."(之所以选定 20% 这个文档占比切分点以及那个预设的模型阈值,是为了把文档级误报率压在 0.01(1%)以下。)切分点和这个比率是同一套机制的两个部件,不是对它的独立佐证。当一所大学一年交上去 75,000 篇论文,1% 的误判率意味着什么把乘法做了一遍。
Pangram 的首页 FAQ 给的是一个比率:
"Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents."(Pangram 的误报率——即人写文档被错误标记为 AI 的比率——目前是万分之一。这个数字是在一批公开数据集的汇总上算出来的,其中包含数以千万计的书面文档。)
模型卡给的是一个更窄的数,还点了语料的名字:"At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples."(在生产工作点上,Pangram 4 在 1,000,000 条人写英文 FineWeb 评测样本上达到 0.0041% 的误报率,大约是二万四千分之一。)同一张卡上另有一张表按领域拆分,其中「Academic Writing (English)」那一行是 0.019%,取自 62,971 条样本,比它上面那个总体数字要高。
标注规则不同、工作点不同,而 Turnitin 那一侧的比率还只在 20% 切分点之上才适用。所以我们不会给你一个两数相除的结论。你能做的是另一件事:问每个数是在什么上面测出来的。这一点两家都写下来了。Turnitin 的 FAQ 说它拿 "over 700,000 additional academic papers that were written before the release of ChatGPT"(七十多万篇写于 ChatGPT 发布之前的额外学术论文)来验证自己那个比率。Pangram 的首页把它那个数归因于 "an aggregate of public datasets"(一批公开数据集的汇总),模型卡把那个更窄的数归因于 FineWeb 样本,而学术写作在模型卡上是十一行领域里的一行。两边答的压根不是同一个问题,麻烦就出在这儿。
同一个名字底下,挂着分母不同的几个数
一个误报率,只有连同它是在哪批文档上算出来的一起看,才有意义。两家都在同一个名字底下公布了好几个数,其中有一对值得从头到尾走一遍,因为最顺手的那个解释恰好是错的。
先看 Pangram,下面这些都是 2026 年 9 月 15 日查到的。右边那一栏要和左边一样认真读:这些数字之所以分散,一部分是因为你落在了哪个页面上,一部分是因为每个数各自是拿什么测出来的。
| 数字 | 出现在哪 |
|---|---|
| "99.9%+ Accuracy" | 首页徽章,以及高等教育页横幅里的一个徽章 |
| "99.98% accuracy" | 同一条横幅的开头一句,在那个徽章前 52 个字符处 |
| "99.26% overall" | 《Pangram vs. Turnitin》,日期为 2026 年 7 月 28 日的一篇文章 |
| 没有准确率数字 | Pangram 4 模型卡,日期 2026 年 7 月 29 日,它报的是按语料拆开的误报率与漏报率 |
| "1 in 10,000"(万分之一) | 首页 FAQ,测自 "an aggregate of public datasets"(一批公开数据集的汇总) |
| "roughly 1 in 24,000"(约二万四千分之一) | 模型卡,测自 1,000,000 条 FineWeb 英文样本 |
| 学术文章 "approximately 1 in 25,000"(约二万五千分之一) | 2026 年 7 月 28 日那篇文章 |
| 「Academic Writing (English)」0.019% | 模型卡,取自 62,971 条样本,比它自己的总体数字要高 |
Turnitin 那边有一个最温和的版本,发生在同一个文件内部:2024 年 8 月的白皮书在正文里把 AIW-2 的文档级误报率写成 0.5%,在 Table 1 里写成 0.51%,两处依据的是同一批 719,877 篇 2019 年前的学生论文。
更要紧的是另一对。Turnitin 公布过两个数,都叫句子级误报率。2023 年 6 月,它的首席产品官写道:
"Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written."(我们的句子级误报率大约是 4%。这意味着,某个被标为 AI 所写的具体句子,有 4% 的可能其实是人写的。)
2024 年 8 月的白皮书给的是 0.33%,来自一次在 2019 年前提交的论文上做的压力测试;它对那批论文的说法是 "All papers in this dataset are human written."(这份数据集里的论文全部是人写的。)
最容易想到的解释是中间换了模型。确实换了,而且这解释不通。白皮书写着 AIW-1 在 2023 年 4 月上线,又写着 "In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model"(2023 年 12 月,Turnitin 上线了 AIW-2,一个用来替换 AIW-1 的升级改进模型),所以 2023 年 6 月在线上跑的就是 AIW-1。然后翻白皮书自己的 Table 2:在同一批 719,877 篇论文上,AIW-1 的句子级误报率是 0.42%,不是 4%。同一个模型、同一个名字,两个数差着一个数量级。换代这个说法站不住。
把这两个数分开的,是每个百分比各自取自哪一批文本。4% 的前提是句子已经被标红了:在检测器标出来的那些句子里,有这么大比例其实可能是人写的。0.42% 和 0.33% 跑的是从头到尾都由人写的文本:在这些句子当中,有这么大比例被标了出来。这两个数测的压根是两回事,落不到一起才是应该的。4% 的原始定义可以在 Turnitin 2023 年 6 月的说明里核对。
这里面没有哪一家被抓了现行,也没有哪个数字过期了。这是同一个说法被挂到几次不同的测量上之后的自然结果。所以当有人在会上把一个比率抛给你时,能问出东西来的是这一句:这个百分比是在哪一批文本上算的。全部交上去的文档?只有已经被标红的句子?只有合格的散文?一个不说清集合的百分比,既没法核,也没法反驳。
独立测试做到了哪一步,以及它没能定下什么
把这两个工具放在同一批文本上测过、又经过同行评审并开放获取的研究,我们只找到一项。《Who wrote this? Evaluating the reliability of AI detection tools in higher education》,2026 年 6 月 29 日发表于《International Journal for Educational Integrity》。作者自建了一批 160 篇英文学术论文,四个类别各 40 篇,每篇不少于 4,000 词。
在纯人写那一组上,结论覆盖了它测的四个工具:"all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers."(四个工具都把 100% 的人写文本正确归为「真阴性」(得分在 0 到 20% 之间)。这表明,就这批论文而言,没有哪个检测器倾向于把人的写作错标为 AI 生成。)在纯 AI 生成那一组上,两个工具分道扬镳。论文写道 "Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)"(Turnitin 把 100% 的纯 AI 生成论文判成了假阴性(得分在 0 到 20% 之间)),以及 "Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified."(Pangram 是唯一表现良好的工具,严格口径的准确率为 65%,宽松口径为 97.5%,只有一例被错分。)
在任何人拿这个往任一方向砸你之前,先看作者自己划的边界:"the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category"(我们研究的范围限于 160 篇论文、四个 AI 检测工具,纯 AI 生成类别只用了一个生成式 AI 模型(GPT-4o Deep Research)),并且结论 "valid only for a specific snapshot in time"(只在某个特定的时间切片上成立)。他们给院校的那句建议才是值得带进会议室的:检测工具 "should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy."(不应作为高风险决策中的唯一证据,而应纳入一个更宽的评估策略中实施。)
还有一处措辞值得记一笔,因为改过的版本往往比原文传得更远。论文的结论句是 "From the four AI detection tools studied here, at this moment only one produced satisfactory results."(在这里研究的四个 AI 检测工具中,目前只有一个给出了令人满意的结果。)Pangram 自己转述这项研究时,把它写成了 "only [Pangram] produced satisfactory results"(只有 [Pangram] 给出了令人满意的结果),被替换掉的部分用方括号标了出来。
这场比较里还常被引到另外两份材料,两份都得带着说明看。芝加哥大学 Becker Friedman Institute 一份日期为 2025 年 10 月 6 日的研究简报写道 "Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages"(在商用选项中,Pangram 在中等长度到长篇的文段上实现了基本为零的误报率和漏报率)。它没有测 Turnitin:那四个工具是 Pangram、Originality.ai、GPTZero 和一个 RoBERTa 基线。它的语料是 1,992 段日常文体的文字,横跨新闻、博客、消费者评论、简历等六类,不是学生的课程作业。这里还有一层关系值得摆上桌面,而且要两半一起摆:两位作者之一 Alex Imas 出现在 Pangram 首页一条署名的推荐语里;同时,那篇工作论文的首页上写着 "All authors declare that they have no financial or personal conflicts of interest related to this study."(全体作者声明,与本研究相关,他们不存在财务或个人利益冲突。)论文在该研究所的网站上可以免费下载,从简报页点两下就到。这两件事各自有多重,你自己掂量;我们宁愿你两件都看到,而不是两件都看不到。
另一份是 TechCrunch 记者 2026 年 7 月的一次上手测试,同一篇文章产出了两个数:"Pangram gave it a 13% AI assisted score"(Pangram 给了它 13% 的 AI 辅助分),以及 "when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score."(当我把同一篇文章按我写成的样子整篇交给 Pangram 时,它拿到了 100% 人写的分数。)一位记者的一次操作不是基准测试。它是一份第一手记录:同一段文字怎么提交,回来的数就可能不同——而两家机构各交了一份不一样的文件时,你就在这个位置上。
还有一种情况是两边根本没法比,因为只有一边给了数。同一篇同行评审论文在主图下注明 "Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score"(Turnitin 把 AI 分数在 0% 到 20% 之间的论文视为不确定,用一个星号代替数值分数来标注),因此 "19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure."(19 篇纯 AI 生成、7 篇混合、6 篇 Humanised、3 篇纯人写的论文,在图中被记为缺失。)160 篇里有 35 篇在 Turnitin 那边没有数可以拿来对。如果你的 Turnitin 结果是一个星号,你不是在为一个低分辩护,你是手上根本没有分数;Turnitin AI 率上的星号(*%)是什么意思?解释了它背后的显示规则。
两个结果对不上的时候,你能做什么
先把两份报告拿到手,因为在两边你都得依赖跑这次扫描的人。Turnitin 的 FAQ 写着 "The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students."(AI 写作检测指标和报告对学生不可见。不过借助 PDF 下载功能,教师可以下载 AI 报告并与学生分享。)Pangram 的帮助中心说结果可以用链接分享,收到链接的人 "will see the scan overview and segment details without having to create a Pangram account."(无需创建 Pangram 账号即可看到扫描概览和片段详情。)两份都要;Pangram 这边要明确要那个分享链接,不要截图。片段视图能看出是哪几段撑起了那个数字,一张百分比的截图给不了你任何可用的东西。
别指望直接找 Pangram 更正记录。它的反馈按钮挂在跑这次扫描的那个账号上:帮助页写的是 "Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account"(打开你想反馈的那条结果,可以是刚扫完之后,也可以从你账号里的 History / All Checks 页面进入),结果下面有一个赞和一个踩。你导师跑的那次扫描不在你的账号里。
至于被判的那个人自己能走的申诉入口,我们也没在公开页面上找到。2026 年 9 月 15 日,我们把 Pangram 的 sitemap 里列出的 256 个网址逐个取回正文,合计 2,117,382 个字符,再逐页检索。`appeal` 命中 1 个页面,是一篇讲广告的博客文章,取的是「有吸引力」那个义项。`dispute` 命中 2 个:服务条款里的仲裁条款,以及一篇讲合作的文章里提到的署名争议。`grievance`、`contest`、`redress`、`ombuds`、`request a review` 在这 256 个页面里一次都没有命中。同一轮检索里,`false positive` 出现在 162 个页面上、`student` 出现在 182 个页面上——这是我们判断计数器确实在匹配、而不是对每个词都安静地返回零的依据。
这个清点有一处边界。正因为它属于你应该能推翻的那种说法,我们把它写出来:sitemap 不等于整个站点。本文引用最多的那个页面,也就是 Pangram 的 Pangram 4 模型卡,返回 200,却不在那份 sitemap 里。所以请把这个结果读成「这 256 个列出的页面上没有这样一条路径」,而不是关于 Pangram 托管的每一个页面的结论。也请往两个方向读:它不意味着 Pangram 拒绝更正,更不意味着你所在的机构没有流程。它的意思是,厂商不是办这件事的地方。
下面这两家部署了 Pangram 的机构,各自公布了一条自己的路径,那才是值得知道的东西。Substack 告诉作者在 AI 检测报告上 "select Report detection error"(选择「报告检测错误」),并且在草稿上提供一个 "Disable AI detection"(关闭 AI 检测)的开关。Wiki Education 把参与者的维基百科编辑送进 Pangram,它告诉带课教师,自己已经核实过的那些误报,多数时候是什么原因造成的:"If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen."(如果一名学生保存的是一份空的提纲(例如只有很短的要点或空的小标题),或者含有大量非散文文字(比如句子片段或参考文献条目),这可能触发 AI 检测器。在我们见到的、已确认的误报当中,非散文文字是一个常见因素。)它还写道,自己 "not use Pangram as definitive proof that the text was AI generated"(不把 Pangram 当作文本由 AI 生成的确凿证据),而是把它当作 "a way to flag which text needs additional human scrutiny for verifiability."(一种标出哪些文字需要人再核一遍可供查证性的手段。)
非散文这一点,你拿自己的文件就能核,而且 Pangram 的模型卡从厂商那一侧支持它。这个模型面向的写作是 "of at least 50 words, written primarily in complete sentences"(至少 50 词,且主要以完整句子写成),模型卡还列出了哪些东西落在这个范围之外,其中包括 "tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation"(目录、参考文献部分、套模板或自动生成的文字、说明书和技术手册,以及以数学符号为主的文本)。它另外写着 "human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document"(检测一份文档之前,应移除人写的页眉、页脚、说明文字和其他无关的格式元素),以及 "Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts."(在条件允许时,纯文本和 .docx 文件优于 PDF,因为 PDF 解析可能引入意料之外的杂质。)所以有两个很具体的问题可以拿去问跑扫描的那个人:交上去的是不是 PDF,参考文献列表和封面目录这些前置内容有没有跟着一起进去。
有几句话值得在会上原样引出来,恰恰因为它们出自厂商而不是出自我们。Pangram 给老师的指引里写着 "we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures"(我们认为 AI 检测是标出作业的一个很好的办法,但在采取任何惩处措施之前,这个检出结果都需要进一步调查。其中 `futher` 是原文的拼写),还写着 "A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong."(非零的误报率意味着,任何一次阳性检出都可能是真的,也可能就是那个统计上异常的万分之一——Pangram 判错的那一次。)Turnitin 的 FAQ 写着 "Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies."(Turnitin 不作出是否存在学术不端的认定;它提供的是数据,供教育者依据其学术与院校政策作出知情的判断。)
Pangram 的老师页面还把教师指向写作过程本身的证据,并且点了 Google Docs 的名:"select File -> Version history -> See version history to see a full history of their writing process."(依次选择「文件」->「版本记录」->「查看版本记录」,即可看到其写作过程的完整历史。)如果你手上有这份记录,谈话的焦点就会从「谁的百分比是对的」移开,而那恰恰是已公布的这些数字定不下来的问题。怎么在 Word、Google Docs 和 Overleaf 里留住版本历史讲了各个工具把它存在哪里,被误判为 AI 写作:怎么申诉,学校会认哪些证据讲流程的其余部分。
这对你意味着什么
- 两家报的不是同一种指标。 Turnitin 2024 年 8 月的白皮书说自己不把准确率当指标;Pangram 在首页和高等教育页上都以一个准确率数字打头。
- 两个百分比数的不是同一批东西。 Turnitin 的只覆盖合格散文;Pangram 那几个 fraction 是在被分析的文本上按字符加权、相加等于 1.0。而且 Turnitin 那个低于 1% 的目标还附着一个条件——AI 写作占比超过 20% 的文档——所以没有哪种算法能把它换算成 Pangram 的万分之一。
- 要问的是这个百分比取自哪一批文本,而不是哪个模型版本产出的。 Turnitin 公布过两个句子级比率:约 4%(2023 年 6 月)和 0.33%(2024 年 8 月白皮书)。中间确实换过一次模型,在 2023 年 12 月,但换代解释不了这个差距:同一份白皮书把更早那个模型在它的测试语料上写成 0.42%,不是 4%。把它们分开的是各自取自哪一批文本——4% 只数已经被标红的句子,0.42% 和 0.33% 跑的是从头到尾都由人写的文本。
- 先弄清你手上那个数是占比还是把握,再拿它跟任何东西比。
- 星号不是一个低分。 在那项同行评审研究里,160 篇论文中有 35 篇在 Turnitin 那边根本没有数字。
- 把你的异议递给跑这次扫描的人。 Pangram 的反馈按钮长在扫描账号里,而在它 sitemap 列出的 256 个页面上,我们没找到面向被判者的申诉入口。要那份报告本身,也要 Pangram 那个带片段视图的分享链接。
手上是一份 Turnitin 或 iThenticate 报告的话,可以把报告一起传上去,针对它圈出来的那几段做处理。符合条件时可以免费继续降 AI。
继续阅读