Pangram と Turnitin:二つの AI スコアが食い違う理由
学術誌、学校、あるいは投稿プラットフォームが自分のテキストを Pangram にかけ、さらに Turnitin の数値も手元にある。二つは食い違う。その理由は「別のモデルだから」より具体的だ。両ベンダーは同じ種類の指標を出しているわけではなく、その下では異なるコーパスに対して異なる単位を数えている。ここでは、それぞれが公表している内容と、決して一致しない二つの数値を前に何ができるのかを述べる。
HumanPen チーム
· 19 分
手短な答え
Pangram の結果と Turnitin の結果は、同じ量に対する二つの読み取りではない。だから両者に差があるのは想定内であり、どちらかが壊れている証拠ではない。 Turnitin の 2024年8月のホワイトペーパーは、同社が指標として "accuracy"(正解率)を使っていないと述べている。2026年9月15日に確認した Pangram のトップページには「99.9%+ Accuracy」(精度 99.9% 以上)というバッジが掲げられている。見出しの下でも両者は再び分かれる。Turnitin の FAQ は、重なり合うセグメントの中で採点される文と、対象となる散文に対する百分率を説明し、Pangram のモデルカードは、三つのラベルによるトークン単位の予測と、文字数で重み付けされた文書全体の比率を説明している。結果を左右する数字は、自分の所属先が判断に使うツールが出したものである。
どの指標を公表するかでは両ベンダーは一致していない
Turnitin のホワイトペーパー、Turnitin's AI Writing Detection Model Architecture and Testing Protocol(2024年8月付)は、こう述べている。
「Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed.」(Turnitin は "accuracy" を指標として用いていない。それはあまりにも簡単に操作でき、計算の基となる特定のデータセットに依存しすぎるからだ。)
次の文がその理由を述べており、その計算は自分で確かめられる。
「For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system.」(例えば、100 本の文章からなるデータセットを考えてみよう。そのうち 99 本は人間が書いたものだ。すべての文章を「人間が書いたもの」と判定する単純で素朴なアルゴリズムは、AI ライティング検出システムとして何の価値もないにもかかわらず、このデータセットで 99% の正解率を達成してしまう。)
この例こそが持ち帰る価値のある部分だ。何も指摘しない検出器でも、その 100 本のうち 99 本は正しく判定する。つまり数字は検出器の性能ではなく、テストセットの構成によって動く。ホワイトペーパーは、Turnitin が「uses two main metrics to test AIW-2: recall and FPR」(AIW-2 をテストするために二つの主要指標、recall と FPR を用いている)と述べ、同じ節で両方を計算例つきで定義している。
Pangram は精度の数字を目立つ形で公表している。トップページのバッジには「99.9%+ Accuracy」(精度 99.9% 以上、2026年9月15日確認)とある。高等教育向けページには両方が同時に載っている。冒頭の文にある「99.98% accuracy」(精度 99.98%)と、その 52 文字後、同じバナー内にあるバッジ「99.9%+ Accuracy」(精度 99.9% 以上)で、間にあるのは「Detects AI Assistance Free Credits」(AI による支援を検出、無料クレジット)だけだ。一方、2026年7月29日付の Pangram 4 のモデルカードは、精度をまったく前面に出していない。そこに載っているのは、コーパス、言語、ドメイン別に分類された偽陽性率と偽陰性率である。
つまり、この二つの目玉となる数字は、同じ性質に対する高い値と低い値という関係ではない。一方のベンダーが、もう一方が前面に出す指標に対する異議を文章で公表しているのだ。どちらの選択が誤りだと言っているわけではないし、どちらも秘密ではない。二つの記述は今日も公開ページにある。
それぞれのスコアは実際に何を数えているのか
どちらのシステムも百分率を返す。その百分率は、異なる素材から作られている。
| Turnitin(FAQ および 2024年8月のホワイトペーパー) | Pangram(Pangram 4 モデルカード、2026年7月29日) | |
|---|---|---|
| 分類の単位 | 文。重なり合うセグメントにまとめられる | トークン。可変長のセグメントにデコードされる |
| 重なりの扱い | 複数のセグメントに現れる文は複数のスコアを受け取り、「which are then pooled into a single score」(それらはその後、単一のスコアに統合される) | 「predictions for tokens that appear in multiple windows are aligned and averaged」(複数のウィンドウに現れるトークンの予測は位置を合わせて平均される)。512 トークンの推論ウィンドウ内での話である |
| 文書の百分率は何に対する割合か | 対象となるテキストのみ。「this percentage is not necessarily the percentage of the entire submission」(この百分率は必ずしも提出物全体に対する割合ではない) | 分析対象の文書。`fraction_human`、`fraction_ai_assisted`、`fraction_ai` は「character-weighted」(文字数で重み付けされている)で、「sum to 1.0」(合計は 1.0 になる) |
| クラス数 | 二つ。この百分率は「likely generated by AI or likely generated and modified by an AI paraphraser or bypasser」(AI によって生成された、あるいは AI によって生成され、AI の言い換えツールや回避ツールによって修正された可能性が高い)テキストを対象とする | 三つ:`Human`(人間)、`AI-Assisted`(AI 支援)、`AI-Generated`(AI 生成) |
| 最小の長さ | 散文 300 語 | 50 語 |
| 低い結果 | 1% から 19% では、百分率もハイライトも表示されず、アスタリスクだけが表示される | `prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise(人間の文字が 90% 以上を占める場合は短縮形の「人間」、AI が生成した文字が 80% 以上を占める場合は「AI」、それ以外の場合は「混在」を返す) |
厄介なのは分母の行だ。Turnitin の FAQ は、表示される百分率が「the amount of qualifying text within the submission」(提出物内の対象テキストの量)を対象とし、「If text within the submission is not considered long-form prose text, it will not be included.」(提出物内のテキストが長文の散文と見なされない場合、それは含まれない。)と述べている。Pangram の比率は分析対象テキストを対象とし、合計は 1.0 になる。長い参考文献リスト、目次、二、三つの表を含む論文を両方のシステムに投げ込めば、どちらのモデルが動く前から、同じ語の集まりを相手にしていないことになる。Turnitin の AI ライティング報告書の読み方 では、何が Turnitin の分母に入り、何が外れるのかをたどっている。
なぜ 1% と 1 in 10,000 は同じ尺度にないのか
この二つは並べて語られる数字だが、一方を他方で割って得られる比には何の意味もない。どちらも偽陽性率と呼ばれる。しかし測定の仕方は互いに異なる。
Turnitin の FAQ は目標値を述べている。
「We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing.」(私たちは、AI による記述が 20% を超える文書について、完全に人間が書いたテキストを AI 生成と誤判定する割合である偽陽性率を 1% 未満に保ちつつ、検出器の有効性を最大化するよう努めている。)
この末尾の条件が主張を支えており、ホワイトペーパーはその出どころを説明している。文書は、文レベルのスコアのうち 20% を超えるものが文の閾値を超えたときに AI 生成と判定される。そしてホワイトペーパーは、「the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%).」(文書割合 20% のカットオフと、あらかじめ定められたモデルの閾値は、文書レベルの偽陽性率を 0.01(1%)未満に保つために選ばれた。)と述べている。カットオフと率は一つの仕組みの一部であり、それとは独立した主張ではない。大学が 75,000 本の論文を提出するとき、1% の偽陽性率が意味すること がその掛け算をしている。
Pangram のトップページの FAQ は次の率を述べている。
「Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents.」(Pangram の偽陽性率、すなわち人間が書いた文書が誤って AI と判定される割合は、現在 1 in 10,000 である。この数字は、数千万件の書かれた文書を含む公開データセットの集合に対して算出されている。)
モデルカードは、コーパス名を示したうえで、より狭い数字を出している。「At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples.」(本番運用のポイントにおいて、Pangram 4 は、人間が書いた英語の FineWeb 評価用サンプル 1,000,000 件に対して 0.0041% の偽陽性率(およそ 1 in 24,000)を達成している。)カード内の二つ目の表は率をドメイン別に分類しており、学術的文章の行は 62,971 件に対して 0.019% と、すぐ上の英語全体の数字より高い。
判定規則が異なり、運用ポイントも異なり、Turnitin 側では 20% のカットオフを超えた場合にしか適用されない率がある。したがって、私たちは二つの数字の算術的な比較をここに置くつもりはない。代わりにできるのは、それぞれが何に対して測定されたのかを尋ねることだ。そして両ベンダーはそれに文書で答えている。Turnitin の FAQ は、自社の率を「over 700,000 additional academic papers that were written before the release of ChatGPT」(ChatGPT の公開前に書かれた 700,000 本以上の追加の学術論文)に対して検証していると述べる。Pangram のトップページは自社の率を「an aggregate of public datasets」(公開データセットの集合)に帰しており、モデルカードはより狭い数字を FineWeb のサンプルに帰している。学術的文章は、十一あるドメインの行のうちの一つとして別に現れる。これらは異なる質問への答えであり、それが問題のすべてだ。
同じラベルが、分母の異なる数字に付いている
偽陽性率は、それが算出された文書の集合と結びついて初めて意味を持つ。両ベンダーは一つのラベルの下に複数の数字を公表しており、そのうち一組は全体を追いかける価値がある。差の説明として思いつくものが、実は間違っているからだ。
まず Pangram から。すべて 2026年9月15日に確認した。右の列を左の列と同じ注意深さで読んでほしい。ばらつきの一部は、どのページにたどり着いたかという点から生じており、もう一部は、それぞれの数字が何に対して測定されたかという点から生じている。
| 数字 | 掲載箇所 |
|---|---|
| 「99.9%+ Accuracy」(精度 99.9% 以上) | トップページのバッジ、および高等教育ページのバナー内のバッジ |
| 「99.98% accuracy」(精度 99.98%) | 同じバナーの冒頭の文、52 文字前 |
| 「99.26% overall」(全体で 99.26%) | Pangram vs. Turnitin、2026年7月28日付の投稿 |
| 精度の数字なし | Pangram 4 のモデルカード(2026年7月29日付)。代わりにコーパス別の FPR と FNR を掲載している |
| 「1 in 10,000」(1 万分の 1) | トップページの FAQ。「an aggregate of public datasets」(公開データセットの集合)に対して |
| 「roughly 1 in 24,000」(およそ 2 万 4 千分の 1) | モデルカード。FineWeb の英語サンプル 1,000,000 件に対して |
| 学術エッセイについては「approximately 1 in 25,000」(およそ 2 万 5 千分の 1) | 2026年7月28日の投稿 |
| 「Academic Writing (English)」(学術的文章(英語))に対して 0.019% | モデルカード。62,971 件に対してで、自社の全体の数字より高い |
Turnitin はこの現象の最も軽い例を一つのファイルの中で生み出している。2024年8月のホワイトペーパーは、AIW-2 の文書レベルの偽陽性率を本文では 0.5%、表 1 では 0.51% としている。どちらも、2019 年より前に提出された 719,877 本の学生論文という同じ集合に対しての値だ。
より重要な組み合わせは、Turnitin がどちらも文レベルの偽陽性率という名前で公表している二つの数字だ。2023年6月、同社の Chief Product Officer は次のように書いた。
「Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written.」(私たちの文レベルの偽陽性率は約 4% です。これは、AI が書いたものとしてハイライトされた特定の文が、実は人間が書いたものである可能性が 4% あるという意味です。)
2024年8月のホワイトペーパーは、2019 年より前に提出された論文に対するストレステストから 0.33% という値を出している。その論文群については「All papers in this dataset are human written.」(このデータセットに含まれる論文はすべて人間が書いたものです。)と述べている。
思わずそう読みたくなるのは、この間にモデルが変わったからだという説明だ。モデルは実際に変わった。しかしそれではこの差は説明できない。ホワイトペーパーは、AIW-1 が 2023年4月に投入され、「In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model」(2023年12月、Turnitin は AIW-1 モデルを置き換える更新・改良版のモデル AIW-2 を投入した)と述べている。つまり 2023年6月に動いていたのは AIW-1 だった。では、同じホワイトペーパーの表 2 で AIW-1 を引いてみよう。同じ 719,877 本の集合に対して、その文レベルの偽陽性率は 0.42% であり、4% ではない。同じモデル、同じラベル、桁が一つ違う二つの数字。バージョンの話は崩れる。
違うのは、それぞれの百分率がどの集合に対して算出されているかだ。4% は、すでにハイライトされた文という条件つきの値である。検出器が指摘した文のうち、その割合が実は人間の文章だったかもしれない、という話だ。0.42% と 0.33% は、そもそも完全に人間が書いた文章に対する値である。それらの文すべてのうち、その割合が指摘されたという話だ。この二つは異なる質問に答えており、互いに近い値になる理由はない。4% の定義は Turnitin の 2023年6月の説明 で読める。
これはベンダーの不備が見つかった話でも、数字が古くなった話でもない。一つの表現が、いくつもの異なる測定に付けられてしまった結果だ。だから会議で率を突きつけられたら、前に進む質問は「どの集合に対してか」である。提出されたすべての文書か。すでにハイライトされた文だけか。対象となる散文だけか。集合の付いていない百分率は検証できないし、反論することもできない。
独立した検証は何があり、何が決着しないのか
査読つきのオープンアクセス研究のうち一つだけが、両方のツールを直接比較している。Who wrote this? Evaluating the reliability of AI detection tools in higher education(『これは誰が書いたのか。高等教育における AI 検出ツールの信頼性の評価』)は 2026年6月29日に International Journal for Educational Integrity に掲載された。英語の学術論文 160 本からなる合成セットを作り、四つのカテゴリにそれぞれ四十本ずつ、いずれも 4,000 語以上という条件で構成している。
人間が書いた集合については、結果はテストされた四つのツールすべてに当てはまる。「all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers.」(四つのツールはすべて、人間の文章の 100% を正しく「真の陰性」、すなわち 0 から 20% のスコアとして分類した。これは、この論文群において、どの検出器も人間の文章を AI 生成と誤って指摘する傾向がないことを示している。)完全に AI が生成した集合では、二つのツールは袂を分かった。論文は、「Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)」(Turnitin は完全に AI が生成した論文の 100% を偽の陰性、すなわち 0 から 20% のスコアとして分類した)と、「Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified.」(Pangram は、厳密な精度 65%、包括的な精度 97.5% で良好に機能した唯一のツールであり、誤分類は一例だけだった)と報告している。
どちらの方向であれ、誰かがこれを引いてくる前に。著者たち自身が自分の限界を設定している。「the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category」(私たちの研究の範囲は、160 本の論文、四つの AI 検出ツール、および完全に AI が生成したカテゴリ用の GenAI モデル一種(GPT-4o Deep Research)に限られていた)、そして結果は「valid only for a specific snapshot in time」(特定の一時点のスナップショットに対してのみ有効)だという。機関への勧告は、会議に持ち込む価値のある一文である。検出ツールは「should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy.」(重大な判断において唯一の証拠として使われるべきではなく、より広い評価戦略の中に組み込まれるべきである)。
表現について一つ注記しておく。編集された版のほうがオリジナルより広く流通するからだ。論文の結びの文は「From the four AI detection tools studied here, at this moment only one produced satisfactory results.」(ここで検討した四つの AI 検出ツールのうち、この時点で満足のいく結果を出したのは一つだけだった。)である。Pangram 自身によるこの研究の要約は、これを「only [Pangram] produced satisfactory results」(満足のいく結果を出したのは [Pangram] だけだった)と言い換えている。角括弧による置換である。
この比較で引用される研究はほかにも二つあり、どちらにも但し書きが必要だ。2025年10月6日付の University of Chicago の Becker Friedman Institute のリサーチブリーフは、「Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages」(商用の選択肢の中で、Pangram は中程度の長さから長い長さの passage において、偽陽性率と偽陰性率が実質的にゼロを達成している)と述べている。これは Turnitin をテストしていない。四つのツールは Pangram、Originality.ai、GPTZero、そして RoBERTa のベースラインだった。コーパスは、ニュース、ブログ、消費者のレビュー、履歴書など六つの日常的なジャンルにわたる 1,992 個の passage であり、学生の課題ではない。ここでテーブルに載せておく価値のあるつながりもある。両方の側だ。二人の著者のうち一人、Alex Imas は、Pangram のトップページの署名入りの推薦文に登場している。一方、ワーキングペーパーは冒頭のページに「All authors declare that they have no financial or personal conflicts of interest related to this study.」(すべての著者は、本研究に関連する金銭的または個人的な利益相反がないことを宣言する。)という一文を載せている。その論文は研究所から無料でダウンロードでき、ブリーフから二クリックの場所にある。どう評価するかはご自身の判断だ。私たちは、二つの事実のうちどちらかではなく両方を見てほしい。
二つ目は、2026年7月の TechCrunch の記者の実地テストで、一つの記事から二つの数字を出している。「Pangram gave it a 13% AI assisted score」(Pangram はそれに 13% の AI 支援スコアを与えた)、そして「when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score.」(私が書いたとおりの同じ記事を全体として Pangram に渡したところ、100% 人間のスコアになった)。ある記者が一度試した記録はベンチマークではない。それは、テキストの提出の仕方によって返ってくる数字が変わるという一次記録だ。二つの機関が二つの異なるファイルを走らせるとき、あなたはまさにその立場にいる。
そして、二つがまったく比較できない場合がある。数字を返すのがどちらか片方だけだからだ。同じ査読つき論文は、主となる図の下にこう記している。「Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score」(Turnitin は、AI スコアが 0% から 20% の間の論文を不確実と見なし、数値スコアの代わりにアスタリスクで示す)、そしてその結果「19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure.」(完全に AI が生成した論文 19 本、ハイブリッド 7 本、人間が手を入れたもの 6 本、完全に人間が書いたもの 3 本が、図では欠損としてコード化された)。これは 160 本中 35 本について、何と突き合わせる Turnitin の数字もないということだ。自分の Turnitin の結果がアスタリスクなら、低いスコアを弁明しているのではない。スコアがそもそも存在しないのであって、Turnitin の AI スコアにおけるアスタリスク(*%)の意味 が、その背後にある表示規則を説明している。
二つの結果が食い違ったときにできること
まず報告書を手に入れることから始めよう。どちらの側でも、あなたはそれを実行した人に依存しているからだ。Turnitin の FAQ は「The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students.」(AI 記述検出のインジケーターと報告書は学生には表示されない。しかし、PDF ダウンロード機能を使えば、教員は AI 報告書をダウンロードして学生と共有できる。)と述べている。Pangram のヘルプセンターは、結果をリンクとして共有でき、受け取った側は「will see the scan overview and segment details without having to create a Pangram account.」(Pangram のアカウントを作らなくても、スキャンの概要とセグメントの詳細を見られる)と述べている。両方を求め、Pangram 側ではスクリーンショットではなく共有リンクを具体的に求めよう。セグメント表示は、その数字を生んだ passage を示してくれるが、百分率のスクリーンショットは何の手がかりにもならない。
Pangram に直接掛け合って記録を正そうとは考えないほうがいい。フィードバックの機能は、スキャンを実行したアカウントに紐づいている。ヘルプページは「Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account」(フィードバックをしたい結果を、スキャンの直後、あるいはアカウント内の History / All Checks ページから開く)よう案内しており、結果の下に高評価と低評価のボタンがある。教授が実行したスキャンは、あなたのアカウントにはない。
また、結果を受け取る側の人のための異議申し立て手続きも、公開されたものは見つからなかった。私たちは 2026年9月15日に、Pangram のサイトマップに載っている 256 件の URL すべての本文を読み、合計 2,117,382 文字を対象にすべてのページを検索した。`appeal`(異議申し立て。ここでは「魅力がある」という意味)は一ページに現れる。広告についてのブログ投稿だ。`dispute`(争議)は二ページに現れる。利用規約の仲裁条項と、著者性をめぐる争いについてのパートナー投稿だ。`grievance`(苦情)、`contest`(異議を唱える)、`redress`(是正)、`ombuds`(オンブズ)、`request a review`(レビューを依頼する)は、256 件のうちどれにも現れない。同じ検索で、`false positive`(偽陽性)がそれらのページのうち 162 ページに、`student`(学生)が 182 ページに見つかった。これによって、カウンターが実際に一致を数えており、どの問いにも黙ってゼロを返していたわけではないと分かる。
この件数には一つの限界がある。間違っていれば崩せるはずの主張だから、はっきり書いておく。サイトマップはサイト全体ではない。この記事が最も多く引用しているページ、Pangram 4 のモデルカードは 200 を返すが、そのサイトマップには載っていない。だから結果は「256 の掲載ページにそのような手続きがなかった」と読んでほしい。Pangram がホストしているすべてのページについての主張ではない。そして両方向に読んでほしい。これは Pangram が訂正を拒むという意味ではないし、あなたの所属先に手続きがないという意味でももちろんない。ベンダーはその宛先ではない、という意味だ。
Pangram を導入している二つの組織が、独自の窓口を公開している。知っておく価値があるのはそちらだ。Substack は、AI 検出の報告書に対して「select Report detection error」(Report detection error を選択する)よう書き手に案内しており、下書きに対する「Disable AI detection」(AI 検出を無効にする)という操作も文書化している。参加者の Wikipedia 編集を Pangram に通している Wiki Education は、これまでに確認した誤りの大半の背景にあったものを教員に伝えている。「If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen.」(学生が空のアウトライン(例えば、短い箇条書きや空のセクション見出しだけのもの)を保存したり、散文ではないテキスト(文の断片や文献情報など)を大量に含めたりすると、AI 検出器が作動することがある。散文ではないテキストは、私たちが確認した偽陽性の大半に共通する要因である。)また、Wiki Education は「not use Pangram as definitive proof that the text was AI generated」(テキストが AI 生成された決定的な証拠として Pangram を使うのではなく)、「a way to flag which text needs additional human scrutiny for verifiability.」(検証可能性のために人が追加で調べる必要のあるテキストを示す手段)としていると書いている。
この「散文ではないテキスト」という指摘は、自分のファイルで確かめられる。そして Pangram のモデルカードがベンダー側からそれを裏付けている。モデルは「of at least 50 words, written primarily in complete sentences」(少なくとも 50 語で、主に完全な文で書かれた)文章を対象としており、カードはその範囲外にあるものを列挙している。その中には「tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation」(目次、参考文献のセクション、テンプレートや自動生成による文章、説明書や技術マニュアル、そして数式記号が大部分を占めるテキスト)が含まれる。さらに「human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document」(人間が書いたヘッダー、フッター、指示書き、その他の余分な書式は、文書をチェックする前に取り除くべきである)とし、「Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts.」(利用できる場合は、PDF ではなくプレーンテキストと .docx ファイルが推奨される。PDF の解析は意図しない産物を生むことがあるからだ)としている。では、スキャンを実行した人への具体的な質問は二つだ。それは PDF だったか。そして参考文献リストと前付け部分がそのまま一緒に通ったか。
会議で引用する価値のある数行がある。私たちではなくベンダーから出たものだからだ。Pangram の教員向けガイダンスは、「we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures」(AI 検出は課題に注意を促す優れた手段だと考えているが、検出結果は懲罰的な措置の前にさらなる調査を要する)と述べ(この綴りは原文のまま)、さらに「A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong.」(偽陽性率がゼロでないということは、どの陽性判定も本物でありうると同時に、Pangram が間違える統計的に異常な 1 万分の 1 の事象でもありうるということだ)と付け加えている。Turnitin の FAQ は「Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies.」(Turnitin は不正の認定を行わない。むしろ、教育者が自らの学術的・組織的な方針に基づいて十分な情報にもとづく判断を下せるよう、データを提供する。)と述べている。
Pangram の教員向けページは、執筆過程の証拠にも教員を向けており、Google Docs を挙げている。「select File -> Version history -> See version history to see a full history of their writing process.」(File -> Version history -> See version history を選択すると、執筆過程の全履歴が表示される)。その記録があれば、議論は「どの百分率が正しいか」という問いから外れる。そしてそれは、公表されている数字では決着しないただ一つの問いだ。Word、Google Docs、Overleaf でバージョン履歴を残す方法 がそれぞれの保存場所を扱い、AI として誤って指摘されたら:異議の申し立て方と、大学が受け入れる証拠 が手続きの残りを扱っている。
これはあなたにとって何を意味するか
- 両ベンダーは同じ指標を報告していない。 Turnitin の 2024年8月のホワイトペーパーは、精度を指標として使わないと述べている。一方 Pangram は、トップページと高等教育向けページで精度の数字を前面に出している。
- 百分率は異なるものを数えている。 Turnitin の百分率は対象となる散文だけを対象とする。Pangram の比率は分析対象テキストに対して文字数で重み付けされ、合計は 1.0 になる。さらに、Turnitin の 1% 未満という目標は、AI による記述が 20% を超える文書という条件つきである。したがって、それを Pangram の 1 in 10,000 に変換できる計算は存在しない。
- どのバージョンが数字を出したかではなく、どの集合に対して算出されたかを尋ねよう。 Turnitin は文レベルの率を二つ公表している。約 4%(2023年6月)と 0.33%(2024年8月のホワイトペーパー)だ。この間にモデルの変更は実際に起きた。2023年12月だ。しかしそれではこの差は説明できない。ホワイトペーパーは、古いモデルをテスト用コーパスで 0.42% としており、4% としてはいない。両者を分けているのは集合だ。4% はすでにハイライトされた文だけを数え、0.42% と 0.33% は完全に人間が書いた文章に対する値である。
- 自分の数字が割合なのか確信度なのかを見極めてから、何かと比べよう。
- アスタリスクは低いスコアではない。 査読つき研究では、160 本中 35 本に Turnitin の数字がまったくなかった。
- 異議はスキャンを実行した人を通じて申し立てよう。 Pangram のフィードバック機能はスキャンしたアカウントの中にあり、サイトマップに載っている 256 ページのいずれにも、指摘された人向けの異議手続きはない。報告書そのものと、セグメント表示つきの Pangram 共有リンクを求めよう。
手元に Turnitin または iThenticate の報告書があるなら、その報告書を取り込んで、そこが指摘した箇所に取り組める。条件を満たす箇所は、無料で再実行できます。
続きを読む