商科 case study 被判 AI:SWOT、五力和两种「都一样」

三十个人用同样四个框架分析同一家公司,交上来三十份长得很像的报告。这种「像」体现在两个地方,对应两份不同的报告,而且解法不是同一个。

HumanPen 团队

· 12 分钟

先说结论

在国内读书的时候,遇到「大家写得都一样」这件事,第一反应基本都是查重。这个反应在这里会把人带偏,因为你手上很可能是两个数字,而它们量的不是同一件事。

框架对你的文字做了两件事。它给你一套固定词汇和固定顺序,所以你的段落和同学的段落长得像。它又把报告切成一组平行的格子,所以你自己那五段互相长得像。

只有第二种是 AI 写作百分比会反应的东西。官方对 AI 打分的描述是一个只针对本份提交的过程:文件被切成互相重叠的片段,每段给一个概率,句子分数再池化、汇总。整个描述里没有一步是拿你的文件去和别人的文件比。跟别人比的是另一个数字——相似度,它的定义是拿提交内容去比对 "Turnitin's comprehensive collection of content",而厂商写明这两个数字 "completely independent and do not influence each other"(完全独立、互不影响)。

动手之前还有第三件事值得知道,也是最容易让人意外的一件:在一份框架密集的案例分析里,你写的东西有相当一部分根本不在打分范围内。百分比只按散文句算。按这个定义,SWOT 的四个格子、用项目符号列的 PESTEL、五力的标题清单,都不是散文句。

两种「都一样」,两份不同的报告

先把这两件事拆开,因为很多人是拿着第一个担心去看第二份报告的。

跟同学一样自己内部一样
长什么样三十个人都写 "the bargaining power of suppliers is moderate"你自己那五段五力段落形状和长度都差不多
可能出现在相似度报告AI 写作报告
机制拿文本去比对一个内容库在你这一份文件内部按片段分类词概率形态
你看到的数字由谁决定由设置排除过滤器和阈值的人没人;模型怎么跑就是怎么跑

相似度那边有两个细节是框架语言特有的。第一,框架标签都很短。排除过滤器那一页公开写着一个小匹配设置:"By default, the threshold is 8 words, meaning that only matches 8 words or longer appear in the Similarity Report. You can increase this number, but 8 words is the minimum allowed value."(默认阈值是 8 个词,也就是只有 8 词及以上的匹配才会出现在相似度报告里。这个数字可以调大,但 8 词是允许的最小值。)拿你自己的框架短语去数一下:`Threat of new entrants` 四个词,`Bargaining power of buyers` 四个词,`Strengths, weaknesses, opportunities and threats` 五个词。这个设置在旧版报告里没有,开不开也轮不到你。8 词是「有人把这个过滤器打开之后」的默认值,不是不管谁都生效的地板——但它仍然告诉你,厂商把多短的匹配当噪声。

第二,AI 那一侧根本不在找共享短语。FAQ 说分类器 "are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers"(被训练来识别词概率上的这些差异,并且擅长人类写作特有的词概率序列),同页另一处又写模型 "is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions"(并没有被显式编程去评估「突发性」「困惑度」这类特定信号,或者公开讨论里有时会提到的其它单项指标)。两个数字都在手上的话,Turnitin AI 写作报告和相似度报告有什么区别?两种分数不要混着看把这条界线画完整了。

你那些格子大半不在这个数字里

FAQ 对分析范围写得很明确:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures."(合格文本只包含散文句,也就是说我们只分析由标准语法句子构成的文本块,不包括列表、项目符号等非句子结构。)

关于这个百分比究竟是什么的百分比:

"As noted previously, this percentage is not necessarily the percentage of the entire submission. If text within the submission is not considered long-form prose text, it will not be included."(如前所述,这个百分比不一定是整份提交内容的百分比。文中不属于长篇散文的部分不会被计入。)

拿一份常见的 MBA 案例报告,按这个定义逐块过一遍。

报告里的部分通常的形态算不算合格散文
SWOT 四宫格四个格子里的名词短语条目不算,项目符号和非句子结构被排除
六个标题下用项目符号列的 PESTEL短语碎片不算,同上
做成表格、每格写完整句子的 PESTEL表格单元格里的句子2023 年 8 月更新日志写 "We are now able to process long-form prose text in tables."(现已能够处理表格中的长篇散文文本),并注明已提交的文件需重新提交才会重新处理
五力:每个力一个带评级的标题加一段段落
4P:每个 P 一个小标题加一段段落
财务附件、比率表、附录数字和标签不算
参考文献bibliography2023 年 8 月更新日志写参考文献 "are now excluded when processing the AI writing report"
你的建议和论证连续段落

从这张表里掉出两个结论,光看屏幕上那个数字是看不出来的。

同样的分析、排版方式不同,你和同学的百分比就没有可比性。同一份 PESTEL,一个人用项目符号、一个人用表格加完整句子,两个人被打分的文本量根本不一样。

另一个是:格子密集的报告,剩下的合格散文可能非常少。这一点要连着 FAQ 对短文本的说法一起看:"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."(在只有几百词的短文档里,预测基本上会是「全有或全无」,因为只能在单个片段上预测、没有重叠的机会。)另外,生成一份 AI 写作报告本身就要求文件里至少有 300 词的散文。如果你那份 3,000 词的案例分析大半是附件和条目,你看到的百分比很可能只是按中间那些串联性的说明文字算出来的。Turnitin AI 检测跳过哪些内容?非散文、代码等讲的是通用的排除范围;这里要说的是,框架式排版对分母的影响比几乎任何其它作业形式都大。

串联的那些文字为什么会写成一个样

Turnitin 公开过误报易发文本的共同点:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(有时候误报会出现在结构变化不多的内容、字面上自我重复的文本,或者只做了改写、没有发展出新想法的文本上。)

框架式写作会自然地长成这个样子,而且原因跟写的人是谁无关。

词汇是源头定死的。哈佛商学院战略与竞争力研究所公布的五力名称就是这五串:Threat of New Entrants、Bargaining Power of Suppliers、Bargaining Power of Buyers、Threat of Substitute Products or Services、Rivalry Among Existing Competitors,最早由 Michael Porter 在 1979 年的《哈佛商业评论》文章里提出。这些字面不该由你去改,评分的人也不希望你改。

顺序其实是习惯而不是规定。HBS 那一页自己就把替代品排在第一位、新进入者排在第四位,和上一段列的顺序并不一样。真正定死的是每一块结尾那句话的模子。典型动作是一句固定框架的定论:某个力 + 高中低 + 一个分句的理由。做五遍,你就写出了五句结构完全一样、只换名词的句子——这正好是「结构变化不多」的一种。

我另外查了一下,这套东西在文档里有没有被当成特殊情况处理。

这次数了什么。 2026 年 8 月 27 日,读取定义 AI 写作报告的三页官方文档的渲染正文:Using the AI Writing Report(7,218 字符)、AI 写作检测能力 FAQ(31,712 字符)、AI writing detection model 更新日志(9,957 字符)。三页合计逐词检索:`SWOT` 0 次 · `PESTEL` 0 次 · `PESTLE` 0 次 · `Porter` 0 次 · `case study` 0 次 · `business` 0 次 · `marketing` 0 次 · `discipline` 0 次 · `genre` 0 次。`framework` 唯一一次命中是厂商在讲自己的测试框架。同一份文本上的灵敏度对照:`prose` 13 次 · `qualifying` 15 次 · `bibliograph` 4 次。`subject area` 命中 3 次,全在 FAQ 那一页,三次都在讲训练数据的构成:一次是 `academic writing across geographies and subject areas`,另外两次重复同一份名单 `less common subject areas such as anthropology, geology, sociology, and others`(人类学、地质学、社会学等较少见的学科)。

所以商科没有被单独开口子,两个方向都没有。模型分不出案例分析和实验报告,文档也没有声称它分得出。

把框架和分析拉开距离

框架那部分本来就是可替换的,这正是框架存在的意义。分析那部分本来该是只有你写得出来的。而在多数报告里,这两样东西挤在同一个段落、用同一种语气写,文件因此变得均匀。

能把它们拉开的具体动作:

  1. 定论句和论证句用不同的句型。 评级那句是固定模子就让它是,但下一句别也用一个固定模子。一句短促的评级加一段展开的论证,读起来和五段一模一样的混合句完全不同。
  2. 把数字、时间和出处点出来。 一句把供应商议价能力落到你自己附件四里那两家代工厂、以及其中一家被收购的年份上的话,和「供应商议价能力高,因为行业集中度高」不是一回事。后一句任何一个什么都没读的人都能对任何行业写出来。
  3. 说清楚框架在这家公司身上哪里失效。 一段说明「在有法定专营的受管制市场里,替代品这一力几乎没有意义」的文字是分析。给它评一个「低」然后翻页,是填表。
  4. 该砍的格子砍掉,用一句话说明为什么砍。 对轻重不同的力做等长处理,正好是厂商描述的那种平坦结构,而且它把同样多的字给了一句话就够的那一力。
  5. 先写建议,再回头检查框架支不支持它。 先搭框架再写结论的报告,结尾往往就是把几个格子复述一遍。2023 年的一条更新日志提到过误报集中在文档首尾几句、"written in a generic way"(写得很笼统),检测逻辑已经据此改过;但那种写作习惯本身没有消失。为什么引言和结论最容易被标记为 AI里有这条更新日志的完整原文。

以上都不是在说这些动作之后百分比会变成多少,谁这么说都是在猜。上面这份清单要划的是另一条线:案例分析里哪些段落是你的,哪些是框架的——这条线不管有没有检测工具都值得划。

真要改,先动哪一块

假设报告已经回来、总得改点什么。顺序很重要,因为案例分析是最容易被改坏的文件类型之一。

  1. 先看高亮,不看百分比。 高亮落在串联性的说明文字上,还是落在你的建议部分,决定了下一步动什么,而那个数字不告诉你。
  2. 框架标签别动。 它们是术语。要看你有没有正确套用五力的老师,就是要看见那五个名字。
  3. 附件、比率、图表别动。 它们不属于合格散文,而且这是全文出错代价最高的部分。
  4. 从分析段落开始。 改写唯一站得住脚的范围就是这一块;而如果整份报告读起来很均匀,本来就薄的也正是这一块。
  5. 改过的地方全部重校一遍。 每一个被动过的段落,都是你现在得回头拿附件数字对一遍的段落。真正贵的是这一步,不是改写本身。

第五点就是为什么「改动范围」比工具的其它任何特性都重要。HumanPen 收的是报告文件本身,不是粘贴进去的文本:DOCX 传上去,回来还是一份能编辑的 DOCX,结构、术语、引用、排版和样式原样留着。对一份表格和附件很多的报告,这就是「跑一次任务」和「重排一下午」之间的差别。要改哪些片段可以自己圈,也可以把 Turnitin 或 iThenticate 的 AI 报告交给它去找;不管哪种,它只改这些,其余一个字不动。能改动的最小单位是一个段落,动手之前先把扩展后的范围摆给你看,所以接下来要重读几段,你心里是有数的。符合条件时可以免费继续降 AI。

常见问题

我们三十个人写的 SWOT 都差不多,这会被当成 AI 吗? 不会通过这条路径。AI 写作百分比被描述为对你自己文本切成重叠片段后的分类,不是和其他提交内容做比对,FAQ 里还写明 "no separate repository for AI writing detection"(AI 写作检测没有独立的存储库)。和别人重合的文本属于相似度那一侧,是另一个数字、另一套过滤器。

SWOT 那个格子本身会被打分吗? 项目符号和其它非句子结构公开写明在分析范围之外。表格里的完整散文句是另一回事:2023 年 8 月的更新日志说表格中的长篇散文现已会被处理,已提交的文件需要重新提交才会重新处理。所以同一份 PESTEL,排版方式不同,进不进分母是不一样的。

我的案例分析回来是 100%,可全文真正的散文只有 900 词。 这个组合值得对着 FAQ 自己那句短文本的说明读:"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing'…" 格子密集的报告,合格散文可能比总词数看起来少得多。短文档的「全有或全无」:为什么几百词的稿子分数会走极端讲的是片段机制。

那我以后不套框架了? 不用,评分标准多半还要求你套。能调的是比例:少花篇幅给格子贴标签,多花篇幅写这些格子本来要支撑的那个判断。这样出来的报告更好,顺带也没那么均匀。

我能不能拿这个百分比去跟老师说这是误报? 可以提,厂商自己的措辞也帮得上忙。《Using the AI Writing Report》那一页写着这个指标 "may not always be accurate"(未必总是准确)、"should not be used as the sole basis for adverse actions against a student"(不应作为对学生采取不利行动的唯一依据)。检测能力 FAQ 里讲误报的那一段,则建议在看结构均匀的文本的百分比时 "take that into consideration"(把这一点考虑进去)。但这些都不能证明这份文件是谁写的。当一所大学一年交上去 75,000 篇论文,1% 的误判率意味着什么把这笔账老老实实算了一遍。

继续阅读