パープレキシティとバースト性を整理する:どのAI検出器がこの指標を使っているのか
GPTZeroはパープレキシティとバースト性を用いている。Turnitinは用いていない。本稿では両方の指標を定義し、その違いを説明し、それが執筆の方針にどう関わるかを示す。
HumanPen チーム
· 5 分
パープレキシティとは何か
パープレキシティは、単語がどれだけ予測しやすいかを示す指標である。言語モデルが文を読むとき、それまでに出てきた単語をもとに、次に来る各単語へ確率を割り当てる。次の単語が十分に予測できるものであれば、その位置のパープレキシティは低い。予想外の単語であれば、パープレキシティは高い。テキスト全体のパープレキシティは、要するに、全体を通して単語の選び方がどれほど予測可能だったかという平均値である。
こう考えると分かりやすい。「この実験は有意な」まで書いたとする。次に来る単語は「結果」「差」「効果」のいずれかである可能性が非常に高い。いずれも出現確率の高い語だ。ところが次が「パイナップル」だったとすれば、それは確率の低い選択であり、その位置のパープレキシティは跳ね上がる。常にいちばん想定される語を選ぶテキストは、全体のパープレキシティが低くなる。予想外の選択をするテキストは、パープレキシティが高くなる。
AIが生成したテキストはパープレキシティが低くなりがちである。言語モデルは、最も確率の高い次の単語を選ぶように作られているからだ。文脈上の確率を最適化するため、語の選択が予測可能なパターンに収まっていく。対照的に人間の文章には、予測しにくい語の選択、めずらしい動詞、専門領域の名詞、モデルなら選ばなかったであろう言い回しがしばしば混ざる。この差は実際に存在し、測定もできる。問題は、すべてのAI検出器がパープレキシティを実際のアルゴリズムの一部として使っているかであり、その答えはノーである。
バースト性とは何か
バースト性は、文の構造のばらつきを示す指標である。段落内のどの文も、長さも文法構造もリズムもほぼ同じなら、バースト性は低い。文の長さが大きくばらつき、短く切れ味のよい文もあれば、従属節を抱えた長く複雑な文もあるなら、バースト性は高い。
人間の文章は、AIが生成したテキストよりもバースト性が高くなりがちである。人はまとめて書く。短い断言の文と、傍注を挟んだ長い文とを混ぜる。強調したいときにはパターンを崩す。AIモデルは統計的な一貫性を最適化するため、文構造が均一になりやすい。結果として、読めばなめらかだが構造的な変化に乏しいテキストになる。
バースト性が検出指標として広まったのは、人間の文章とAIの文章の違いについて、本質的な何かを捉えていたからである。人間は不規則で、AIモデルは一貫している。バースト性を測る検出器は、文レベルの構造が人間に見えるほど十分にばらついているかを見ている。パープレキシティと同じく、バースト性は有用な概念だ。そして同じくパープレキシティと同じく、どの検出器も計算しているわけではない指標である。
この指標を使っている検出器
パープレキシティとバースト性を、名前の付いた指標として公に使っている検出器の代表例がGPTZeroである。同社のドキュメントは、パープレキシティをテキストの予測しにくさを測る値、バースト性を文レベルのばらつきを測る値として説明している。GPTZeroのアルゴリズムはこれらの指標を計算し、分類の判定に用いている。GPTZeroの挙動を理解したい、あるいはそれに合わせたいのであれば、パープレキシティとバースト性は直接関係してくる。
Turnitinは別の考え方をしている。公式FAQにはこうある。"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions."(我々のモデルは、「burstiness」や「perplexity」、あるいは公開の議論でときおり言及される他の個別指標といった特定のシグナルを評価するよう明示的にプログラムされていない。)次の文はこう続く。"Instead, it learns statistical patterns from our training data."(代わりに、我々の学習データから統計的なパターンを学習する。)これは、Turnitinがこの両方の指標を計算していないという、直接的かつ明示的な否定である。
この違いが重要なのは、同じテキストでも両方のツールの判定が食い違うことがあるためである。バースト性とパープレキシティを高くするように作られた文章は、GPTZero(この両方の指標がアルゴリズムに直接組み込まれている)とTurnitin(分類器は学習データからパターンを学んだだけで、どちらの指標も計算していない)とで、結果が変わるかもしれない。「バースト性を上げろ」「パープレキシティを下げろ」といった助言は、特定の種類の検出器に合わせて作られたものだ。それがTurnitinに効くかどうかは分からない。
Turnitinは代わりに何を使っているのか
Turnitinがパープレキシティもバースト性も計算していないのだとすれば、では何を使っているのか。ドキュメントには、学習データから統計的なパターンを学び、それをテキストの区間に適用する分類器が説明されている。
Turnitinは次のように述べている。"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. Instead, it learns statistical patterns from our training data."(我々のモデルは、「burstiness」や「perplexity」、あるいは公開の議論でときおり言及される他の個別指標といった特定のシグナルを評価するよう明示的にプログラムされていない。代わりに、我々の学習データから統計的なパターンを学習する。)この分類器は、パープレキシティの数式もバースト性の数式も実行しない。学習時に内部化されたパターンを適用するだけであり、そこには単語の確率が関わっているものの、名前の付いた単一のスコアに還元できるものではない。
同じFAQのページは、分類器が実際にどこを見ているのかも明言している。"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."(我々の分類器は、単語確率におけるこうした違いを検出するよう訓練されており、人間の書き手に特有の単語確率の並びにも精通している。)単語の確率は、Turnitinの分類器が学んだことの中心にある。ただしモデルはそれを、学習済みのパターンを通して処理するのであって、明示的にパープレキシティを計算しているわけではない。
仕組みは区間単位である。Turnitinはこう説明する。"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated."(論文がTurnitinに提出されると、提出物から文が抽出され、予測分析のために重なり合う区間に分割される。各区間はAI検出モデルによって分類され、そのテキストが人間によるものかAI生成によるものかを示す確率として、0から1の値が与えられる。)区間は重なり合い、文はスコアを引き継ぎ、複数のスコアがまとめられ、最終的な集計から文書全体の割合が算出される。この一連の処理には、パープレキシティやバースト性を計算する工程は含まれていない。
Turnitinはさらにこう記している。"As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms."(その結果、出力は人間が読める少数の透明なルールによってではなく、多くの学習済みパターンが協働することによって生成される。そのため、個々の予測を特徴ごとに単純に説明できないこともある。)モデルの判断過程は、いくつかの指標を追いかけただけで逆算できるようなものではない。
執筆において実際に変わること
実践的な結論は単純である。「Turnitinを出し抜くためにパープレキシティを下げろ」という助言を目にしたら、それはこのツールを誤解したうえでの話だ。Turnitinはパープレキシティを計算していない。バースト性やパープレキシティに関する助言はGPTZeroには関係するかもしれないが、Turnitinの仕組みには当てはまらない。
問題は、Turnitinの分類器がこれらの概念を名前の付いた指標として使っていないことだ。学習データから統計的なパターンを学んでおり、そのパターンには単語の確率の情報が含まれ、それがテキストに適用される。分類器が計算していない指標に合わせて最適化することはできない。できるのは、真正な人間の執筆を反映した書き方をすることだ。語の選択や構造に自然なばらつきを持たせ、AIモデルが生み出すパターンとは違うものにしていく、ということである。
文章を試して今の位置を確かめられるよう、再実行を無料で提供している。こちらから試してください。
続きを読む