GPTZero の Mixed と AI-Polished:二つのラベルの読み方
GPTZero は三つのパーセンテージを表示し、その一クリック下に五つの名前付き分類を隠しています。AI Polished は、Mixed の下にある二つのうちの一つです。GPTZero は結果画面のパネルでそれを定義し、2025年6月の投稿で説明していますが、その投稿はヘルプセンターではなくニュースサイトに置かれています。ここでは GPTZero 自身の言葉でその全体を挙げ、それぞれの横にある数字が実際に何を数えているのかを説明します。
HumanPen チーム
· 14 分
まず結論から
GPTZero は三つのパーセンテージを表示します。その見出しは "Chance this entire text is..."(このテキスト全体が…である確率)で、並ぶのは AI、Mixed、Human です。この数値は、そのクラスが正しいというモデルの確信度であって、あなたのエッセイのうちどれだけがそのクラスに含まれるかという割合ではありません。GPTZero はこのことを結果画面そのものに、チップの下の一文として書いています。どのチップでもクリックすれば名前付きの下位の読みが開き、三つ合わせて全部で五つ、"AI polished" は Mixed の下にある二つのうちの一つです。GPTZero はそれを "Human-written text that was refined or edited by an AI tool"(人間が書いたテキストを、AI ツールで仕上げたり編集したりしたもの)と定義し、このラベルが付く場合は "the core ideas and structure are the student's own work, but AI was used as an editing assistant"(中心となる考えと構成は学生自身のものだが、AI は編集の助手として使われた)と付け加えています。つまり "100% mixed" は、その文書が mixed クラスに属するとモデルが強く確信していることを示しています。Mixed の下の二つの読みのどちらに比重を置いたのかは別の数値で、さらにワンクリック先にあります。
ラベルの横にある数字は何を数えているのか
まずは目の前の画面から始めてください。GPTZero の答えはそこに書いてあります。Mixed のチップを展開すると、読みのすぐ下にこの一文が現れます:
This result isn't the percentage of mixed text, it's the model's confidence in the classification of the entire text as mixed.(この結果は混合テキストの割合ではなく、テキスト全体を mixed に分類することに対するモデルの確信度です。)
同じ文が残る二つのチップの下にも置かれています。違うのはクラス名だけです。AI の下には "isn't the percentage of AI text"(AI テキストの割合ではない)、Human の下には "isn't the percentage of human text"(人間が書いたテキストの割合ではない)。
この違いがなぜ重要なのかは、GPTZero の機械学習チームを率いる Alex Adam が、2024年1月12日付の投稿ではっきり書いています:
categorizing predictions this way enables the confidence of the detector to be disentangled from the percentage of sentences that are AI-generated. Without this distinction, an AI probability of 50% could mean that the detector is 50% confident in its prediction (essentially a coin flip), or that 50% of the text is AI-generated.(このように予測を分類することで、検出器の確信度と、AI が生成した文の割合とを切り離せます。この区別がなければ、AI 確率 50% は、検出器が自分の予測に 50% しか確信を持っていない(実質的にコイン投げ)という意味にも、テキストの 50% が AI 生成であるという意味にもなり得ます。)
同じ 50% の二つの読み方であり、あなたにとっては正反対の意味になります。三クラスの出力は、この二つを混ぜないために存在します。
ドキュメントも別の三つの方向から同じことを裏づけています。GPTZero のリリースノートの 2024年1月9日付の項目は、予測値を "tuned to better represent the probability that the model is correct"(モデルが正しい確率をよりよく表すように調整)したと述べ、具体例として、AI スコア 90% は "there is a 90% chance that the text is entirely written by an AI"(そのテキストが完全に AI によって書かれている可能性が 90% ある)ことを意味すると説明しています。API のヘルプページは、クラス確率を "the chance that the detector is correct in its classification"(検出器の分類が正しい可能性)と説明し、90% は "90% of the time on similar documents"(類似文書では 90% の割合で正しい)を意味すると付け加えています。ここで言うのは類似文書、つまり複数の文書一般の話であって、あなたの文書の話ではありません。そして技術紹介ページは、これを GPTZero の研究成果の一つとして、これ以上なく淡泊な言い回しで挙げています。検出器は "a trinary classification problem, separating prediction confidence from the proportion of LLM text."(予測の確信度と LLM テキストの割合を切り離す三値分類の問題)として位置づけられています。
一つだけ、逆の言い方をしている GPTZero のページがあります。ホームページの FAQ ブロックには、GPTZero は "will suggest what percentage of your text is likely to be AI-generated"(あなたのテキストの何パーセントが AI 生成らしいかを示す)と書かれています。ただこれは、名前のある結果フィールドを説明したものではなく、三ステップの使い方説明の中にある一文なので、矛盾というより雑なマーケティング文句である可能性が高いでしょう。いずれにせよ実務上のルールは同じです。"GPTZero said 30%"(GPTZero が 30% と言っていた)だけでは、誰がどの量について話しているのか分かりません。どの画面のどのフィールドから来た値なのかも書き添えてください。同じテキストが検出器ごとに違うスコアになる理由は、これを Turnitin、Originality.ai、Winston AI の単位と並べて比較しています。ベンダーをまたぐ形のこの問題は、そちらにあります。
上段は三つのチップ、その下に五つの名前付きクラス
ここが多くの人が引っかかる場所であり、"written by a human and polished with AI"(人間が書き、AI で仕上げた)という言い回しがどこからともなく現れるように見える理由でもあります。一番上の列は三つのチップで、それぞれが開きます。
| チップ | 開くと出てくるもの | その下にある GPTZero の一文 |
|---|---|---|
| AI | "chance AI Generated"、"chance AI Paraphrased" | "isn't the percentage of AI text"(AI テキストの割合ではない) |
| Mixed | "chance AI-Human Mix"、"chance AI polished" | "isn't the percentage of mixed text"(混合テキストの割合ではない) |
| Human | "Human written" | "isn't the percentage of human text"(人間が書いたテキストの割合ではない) |
名前付きの読みは合計五つです。"AI polished" は Mixed の横にある四番目の枠ではありません。Mixed が意味し得る二つのうちの一つです。この一事実だけで混乱の大半は解けます。その下のもう一つの読みが AI-Human Mix という名前だと分かれば、mixed という結果の読み方は大きく変わるからです。
それらの読みの横にある小さな情報アイコンをクリックすると、パネルが開きます。見出しは "Understanding AI Classifications"(AI 分類を理解する)で、五つそれぞれにタブが用意されています。GPTZero の定義をそのまま引用します:
AI Generated — Text written directly by an AI language model with no meaningful human editing. AI Paraphrased — AI-generated text that was rewritten — either by a tool or by hand — to disguise its origin. AI-Human Mix — Human-written text combined with AI-generated text in the same document. AI Polished — Human-written text that was refined or edited by an AI tool. Human — Text written entirely by a human with no AI involvement.(AI Generated — AI 言語モデルによって直接書かれ、意味のある人間の編集が入っていないテキスト。AI Paraphrased — 出自を隠すために、ツールまたは手作業で書き換えられた AI 生成テキスト。AI-Human Mix — 同じ文書の中で、人間が書いたテキストと AI 生成テキストが組み合わさっているもの。AI Polished — 人間が書いたテキストを、AI ツールで仕上げたり編集したりしたもの。Human — AI が一切関与せず、完全に人間によって書かれたテキスト。)
AI Polished のタブには第二段があり、これこそ手元に置いておく価値のある部分です:
The text was originally written by a human, then run through an AI tool to improve grammar, rephrase sentences, or enhance clarity. The core ideas and structure are the student's own work, but AI was used as an editing assistant.(そのテキストはもともと人間が書いたもので、その後、文法を整えたり、文を言い換えたり、分かりやすくしたりするために AI ツールを通されています。中心となる考えと構成は学生自身のものですが、AI は編集の助手として使われています。)
それぞれの定義がどこから出発しているかに注意してください。Polished は人間の文章から始まり、Paraphrased は AI の出力から始まります。同じものの程度の違いではなく、由来が正反対であり、ぶら下がっているチップも別です。
もう二つ、小さな点があります。GPTZero はこのラベルを三つの場所で三通りに書いています。チップ上は "AI polished"、パネル内は "AI Polished"、ホームページのサンプルボタン上は "Polished by AI" です。また、無料スキャンには最小文字数があります。0 文字のとき入力欄には "Enter at least 250 characters to scan"(スキャンするには 250 文字以上を入力してください)と表示され、超えると "Great! You've entered enough text to scan"(十分な文字数が入力されました)に切り替わります。
"AI Polished" はどこから来たのか、GPTZero はどこでそれを説明しているのか
このクラスは他の四つより新しいものです。2025年6月3日付のリリースノートに、"Added" の項目として一行だけ載っています:
Ability to detect "polished" texts that are lightly edited by AI(AI によって軽く編集された "polished" テキストを検出できるようになった。)
九か月後、2026年3月11日にさらにもう一行:"Improved performance on the AI polished class."(AI polished クラスの性能を改善しました。)リリースノートにこのクラスが登場するのは、この二つの項目だけです。
より長い説明は、最初の項目の二日後に公開されました。Emily Napier による、AI Polished クラスを紹介する GPTZero の投稿(2025年6月5日付)です。このラベルがどこに位置づくのかが、そこにははっきり書かれています:
To improve transparency, we've decided to distinguish between documents that combine "chunks" of AI and human text and documents rewritten or polished by AI. We now identify these documents under the "Mixed" class with an accompanying tag of "AI Polished".(透明性を高めるため、AI と人間のテキストが「塊」として組み合わさっている文書と、AI によって書き換えられたり仕上げられたりした文書とを区別することにしました。これらの文書は現在、"Mixed" クラスに分類し、併せて "AI Polished" というタグを付けて識別しています。)
これは上の表を、GPTZero 自身の言葉で、しかも日付付きで述べたものです。mixed 文書には二種類あり、その一方に AI Polished タグが付くということです。
この投稿を探しに行くなら、二つの言い回しで検索してください。見出しと本文では、パネルと同じ "AI Polished" が使われています。一方、図のキャプションのうち二つは "Lightly edited by AI" を使っており、これは上に挙げた三つのどれでもなく、リリースノートの言い回しです。ページのアドレスもそこから作られています。
この投稿は GPTZero のヘルプセンターには含まれておらず、ヘルプ記事の中でこのラベルに触れているものは一つもありません。2026年9月15日に、サポートセンターを漏れなく確認しました。ホームページには五つのトップレベルコレクションが並び、それぞれに記事数が表示されています。General 36、API 17、Origin Extension 8、Account Management 11、Microsoft Word Add-In 5、合計 77 です。それぞれに入っていくと、サブコレクションが八つと、コレクションのページに直接ぶら下がっている記事が三本あり、すべて数え上げると重複のない記事がちょうど 77 本になります。その 77 本をすべて取得し、各ページの `innerText`(ブラウザが実際に描画するテキスト。ノーブレークスペースは通常のスペースに置き換え、サイトのナビゲーションやサイドバーも含む)を検索しました。その日の合計は 88,894 文字です。サイドバーはページを読み込むたびに変わるため、やり直しても同じ数にはなりません:
- `polish`、`polished`、`AI polished`、`AI-polished`、`AI Polished`、`Polished` — いずれも 0 件
- `Polish` — 1 件、ただしこれは対応言語一覧にある言語名(ポーランド語)
- `confidence in the classification`(結果画面が使っている表現)— 0 件
カウンタは確かに動いていました。同じ日の同じコーパスで、`burstiness` は 28 件、`paraphras` は 18 件、`sentence` は 19 件、`mixed` は 11 件を返しました。ニュースのメインインデックスをページ送りしても、やはりそこにはたどり着きません。2026年9月15日時点でそのインデックスは 30 ページあり、最後までたどると重複のない投稿アドレスが 147 件でしたが、2025年6月の投稿はその中にありませんでした。この投稿はニュースの sitemap に記載されており、sitemap には当時 320 件の投稿がありました。GPTZero は頻繁に投稿するので、あなたが確認するときにはどちらの総数も動いているはずです。
こうしたことは、このラベルが信頼できないという意味ではありません。この件数も、そう主張するための論拠ではありません。GPTZero のヘルプ記事を読み通しても AI Polished について何も出てこない理由を説明しているだけです。誰かにあなたのラベルの意味を聞かれたら、この投稿を送ればよいのです。ただし、スコアだけでなく定義パネルもスクリーンショットに収めてください。定義は短く、あなたの文書が受けた読みからワンクリックの場所にあります。そして、"polished" を婉曲表現だと思う読み手と、GPTZero が中心となる考えは書き手自身のものだと述べているのを読んだ読み手とを分けるのが、この一枚です。
このラベルが実際に扱っている階層
チップが記述するのは文書です。その上の見出しには文字どおり "Chance this entire text is..."(このテキスト全体が…である確率)と書かれています。文のハイライトは役割の異なる第二の出力であり、FAQ は推論がどちら向きに進むかをはっきり述べています:
The sentence-level classification should not be solely used to indicate that an essay contains AI (such as ChatGPT plagiarism). Rather, when a document gets a MIXED or AI_ONLY classification, the highlighted sentence will indicate where in the document we believe this occurred.(文レベルの分類は、そのエッセイに AI が含まれている(ChatGPT による盗用など)ことを示す根拠として単独で使うべきではありません。むしろ、文書が MIXED または AI_ONLY に分類された場合、ハイライトされた文は、それが文書内のどこで起きていると我々が考えているかを示します。)
まず文書、その後にハイライトです。ハイライトは判定を積み上げて導くものではなく、判定を説明するものです。画面上は "Your most AI sentences"(もっとも AI らしいあなたの文)という見出しのリストとして表示され、各項目には固有のパーセントではなく影響度が付けられています。
GPTZero は、どの階層をどこまで信頼すべきかの序列も公開しています。そしてそれは、多くの人がレポートを読む順番とは逆になっています:
The accuracy of our model increases as more text is submitted to the model. As such, the accuracy of the model on the document-level classification will be greater than the accuracy on the paragraph-level, which is greater than the accuracy on the sentence level.(モデルに入力されるテキストが増えるほど、モデルの精度は上がります。したがって、文書レベルの分類における精度は段落レベルより高く、段落レベルは文レベルより高くなります。)
あなたが最後まで見つめてしまうのは、ハイライトされた個々の文です。そしてそれは、GPTZero 自身が最も精度が低いと評価している階層でもあります。
もう二つ、人を戸惑わせる挙動があります。Advanced Scan のヘルプ記事によれば、ハイライトされるのは "disproportionately affecting your overall AI or human score"(全体の AI スコアまたは人間スコアに不釣り合いな影響を与えている)文であり、これは割合ではなく影響の話です。さらに GPTZero は、ハイライトされていない文も "may still have an effect on your score, but they aren't more likely than other parts of your document"(スコアに影響することはあっても、文書の他の部分より可能性が高いわけではない)と付け加えています。別の話として、中程度の結果なのにハイライトが一つもない場合には、専用のヘルプ記事があります:"there isn't one specific section of the document that is especially likely to have AI content. Rather, the entire document has signs of being AI generated, but with lower certainty."(文書の中で特に AI 内容を含みやすい特定の箇所があるわけではありません。むしろ、文書全体に AI 生成の兆候はあるが、確信度は低いということです。)
ほとんど手を加えていないのに数値が動いた理由
この点に関わるリリースノートは二つありますが、どちらも人々が思っているより範囲が狭いものです。
2024年2月6日:
Processing of long documents has been made more consistent. There should be less variation in predictions when cutting out a few sentences from long AI-generated documents(長文ドキュメントの処理の一貫性を高めました。AI 生成の長文ドキュメントから数文を削り取ったときの、予測のばらつきは小さくなるはずです。)
2025年5月2日:
Increased output stability when rescanning multiple times(複数回再スキャンしたときの出力の安定性を向上させました。)
それぞれの射程を見てください。一つ目は AI が生成した長文ドキュメントから文を削る場合の話、二つ目は同じテキストを二度通す場合の話です。どちらも、自分の下書きの一文を書き直してからもう一度スキャンした場合については述べていません。そして私たちにも見つけられませんでした。上記 77 本のサポート記事全体で、`stabilit`、`rescan`、`re-scan` はいずれも 0 件です。ここが本記事の空白であり、実務上の一つの帰結があります。GPTZero の数値は、それぞれがいつ取得されたかを把握していなければ、別の GPTZero の数値と並べても意味を持ちません。だからスコアと一緒に日付も記録してください。
日付が重要な理由は、リリースノートのページにあります。ページの `innerText` で行頭にある記録日を数えると、2023年5月以降の日付付き項目は 55 件あり、そのうち 2026年は 9月15日までで 10 件、最新は 2026年8月12日(Model 4.9b)です。今年のものを二つ挙げると、5月の "More granular mixed text predictions and identification of interleaving mixed texts"(混合テキストの予測をより細かくし、入り交じった混合テキストを識別できるようにした)、8月の "Robustness to headers; headers are now excluded from our model's input"(見出しに対する頑健性を向上。見出しはモデルの入力から除外されるようになった)です。結果画面には判定の横にモデルバージョンが印字されており、それが画面上で最も手軽に記録できる項目です。7月のスキャンと先週のスキャンは、同じモデルで実行されたものではありません。
確信度の帯は読みのもう半分であり、スコアだけが誰かに突きつけられるときに真っ先に落ちる部分です。Advanced Scan のヘルプ記事は、この帯をエラー率に対応づけています:"Highly confident: our error rate is less than 2%"(確信度が高い:エラー率は 2% 未満)、"Moderately confident: our error rate would be around 10%"(確信度が中程度:エラー率は 10% 前後)、"Low confidence: our error rate would be 14% or higher"(確信度が低い:エラー率は 14% 以上)。一方、技術紹介ページは最上位の帯の平均エラー率を、内部評価セット上で "less than 1%"(1% 未満)としています。どちらの数値も GPTZero 自身のもので、GPTZero 自身のデータに基づくものですが、一致していません。そして 2% を載せているヘルプ記事は、最終更新が一年前になっています。GPTZero の ML 責任者は、元になる数値の限界についても率直です。キャリブレーションの工程によって、検出器はたいてい "not overconfident in its predictions"(自分の予測に対して過剰に自信を持たない)状態になっているが、"achieving perfect calibration is nearly impossible"(完璧なキャリブレーションの達成はほぼ不可能)だということです。確信度の帯を抜きに語られたクラスは、結果の半分にすぎません。
ラベルを手にしたときにすべきこと
あなたがしたことが許されていたかどうかは、分類器ではなく所属機関に聞くべき問いです。GPTZero 自身も、引用する人々の多くより率直にそう述べています:"these results should not be used to punish students"(これらの結果を学生の処罰に使うべきではない)、そして "we don't recommend using an AI detection result as the only proof for academic punishment or discipline"(AI 検出の結果を、学業上の処罰や懲戒の唯一の証拠として使うことは推奨しない)。ML 責任者はさらに踏み込んでいます。一度のスキャン結果を突きつけられているなら、これは知っておく価値があります:
we do not encourage punitive actions based solely on the results of a single scan. Instead, a history of scan results should ideally be established, serving as stronger evidence of AI usage.(一回のスキャン結果のみに基づく懲罰的な対応は推奨しません。むしろ、スキャン結果の履歴を積み重ねておくことが望ましく、それが AI 使用のより強い証拠となります。)
自分の手でできる五つのこと:
- 慌てる前に、チップを開いてください。ただの "Mixed" は、画面上で最も情報量の少ない表示です。その下にある二つの読み、AI-Human Mix と AI polished は、それぞれ異なる状況を表しています。
- クラス、下位の読み、確信度の帯、モデルバージョン、日付を一枚のスクリーンショットに収めてください。五つとも同じパネルに載っています。数値だけを書き直すと、それを読み解く手がかりがすべて失われます。
- 定義パネルもスクリーンショットし、GPTZero の 2025年6月の投稿のリンクも保存してください。パネルは情報アイコンの奥にあり、スクリーンショットなら定義を画面に表示されたままの形で残せます。その投稿は、AI Polished が Mixed の下のタグであることを GPTZero が文章で説明している場所です。
- よそから来た数値を相手にする前に、自分の所属機関が実際に何を使っているかを確かめてください。無料ツールでの自己チェックは、学科が見るレポートではありません。クラス名、言い回し、閾値もベンダー間で共通ではありません。二つのツールがあなたのファイルについて意見を異にするのは想定内の結果であり、故障ではありません。
- 下書きと編集履歴を保管してください。GPTZero 自身が教育者に向けて書いた助言は、"drafts, revision histories, or brainstorming notes"(下書き、編集履歴、ブレインストーミングのメモ)を求めることだとしており、とりわけエディタのバージョン履歴が問題の決着に役立ちやすいと述べています。この種の証拠は、必要になった時点ですでに存在していなければなりません。つまり、メールが来てからではなく、今日やるべき仕事です。
出力は、目の前にあるテキストを読んだ結果であって、そのテキストがどう生まれたかの記録ではありません。どのチップに落ちたとしても、実際に通せるのは自分の執筆プロセスについての主張であり、その証拠は下書きの中にあります。
関連記事
- GPTZero 対 Turnitin:スコアが一致しない理由と、それぞれのツールが実際に測っているもの — 二つのツールが同じファイルに異なる数値を返してきたときに。
- Turnitin は紫色の AI 言い換えハイライトを廃止した — Turnitin 自身のラベル体系は 2026年8月に変わりました。古いスクリーンショットは、人々が思うようには古くなっていません。
- 同じテキストが検出器ごとに異なるスコアになる理由
- パープレキシティとバースト性の先で、AI 検出器は何を測っているのか — GPTZero は 2023年秋にディープラーニング型のアーキテクチャへ移行した際、この二つを使うのをやめたと述べています。
- 判定は出たが、自分で書いた:申し立ての準備
- パーソナルステートメントが AI 判定:先に形を決めたのはプロンプトだった
上の引用はすべて、GPTZero 自身のページと、ログアウト状態で実行した無料スキャンから、2026年9月15日と17日に読み取ったものであり、それぞれの引用はその所在を明記しています。同じ事柄について二つのページが異なる数値を出している場合は、両方を掲載しています。
続きを読む