Perplexity と Burstiness の神話:Turnitin が実際に使っているもの

Turnitin は、perplexity と burstiness を名前の付いた指標として使っているわけではないと明確に否定しています。ここでは公式ドキュメントに実際に書かれている内容を整理し、その違いがなぜあなたの文章に関わってくるのかを説明します。

HumanPen チーム

· 5 分

その神話と、その出どころ

「Turnitin は AI の文章をどう検出しているのか」と検索すると、同じ主張を繰り返す記事が何十本も見つかります。Turnitin は AI が生成した文章を見つけ出すために perplexity と burstiness を使っている、というものです。この主張は aihumaniser.pro、blog.aibusted.com、humanizethisai.com といったサイトや、sohu.com の中国語記事にも見られます。どれも二つの指標を定義し、それを Turnitin のものだと決めつけ、検出を通り抜けるために「perplexity スコアを下げる」方法を指南しています。

問題は、この主張が事実に反していることです。Turnitin 自身のドキュメントは逆のことを述べています。私たちは公式 FAQ を読みましたが、そこには競合サイトが助言の土台にしてきた perplexity・burstiness という物語を真っ向から否定する記述があります。この神話はあまりに広まってしまい、今では多くの学生や書き手が、Turnitin の計算していない指標に合わせて文章を最適化しなければならないと信じ込んでいます。

これが問題になるのは、誤った前提の上に築いた戦略は判断を誤らせるからです。Turnitin が perplexity スコアを計算していると信じていれば、存在しない指標を動かそうとして、不規則な語をわざと混ぜることに力を注ぐかもしれません。実際の仕組みは別のものです。

Turnitin のドキュメントに実際に書かれていること

Turnitin の公式 FAQ は、perplexity と burstiness の問題に直接答えています。ドキュメントにはこうあります。「Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.」(このモデルは、'burstiness'、'perplexity'、あるいは公開の議論で時に言及される他の個別の指標といった特定のシグナルを評価するよう、明示的にプログラムされているわけではありません。)次の文はこう続きます。「Instead, it learns statistical patterns from our training data.」(その代わりに、学習データから統計的なパターンを学びます。)

これは明白な否定です。Turnitin はあなたの文章に対して perplexity の計算を行ってはいません。モデルが burstiness スコアを見て、文の長さのばらつきが十分かどうかを確かめているわけでもありません。このシステムは、名前の付いた少数の指標を計算して数式に流し込む、という仕組みでは動いていません。

ドキュメントはさらに踏み込んで、その理由を説明しています。Turnitin はこう述べています。「As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms.」(その結果、このモデルの出力は、少数の透明で人にも読めるルールによってではなく、多くの学習済みパターンが協調して働くことで生成されます。そのため、個々の予測が特徴ごとに単純な形で説明できるとは限りません。)モデルの判定の過程は、指標のチェックリストに落とし込めるものではありません。分類器は学習データからパターンを学んだのであり、そのパターンは個別の特徴としては説明できない形で組み合わさって働きます。

なぜこれは『Turnitin は語の確率を無視している』という話と同じではないのか

公式の記述を読み込みすぎる危険があります。Turnitin が perplexity を使っていないと言い、perplexity が語の確率の指標だとすれば、Turnitin は語の確率をまったく無視しているということになるのでしょうか。いいえ。同じ FAQ のページに、決定的な反論が書かれています。「Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.」(この分類器は、語の確率におけるこうした違いを検出するよう学習されており、人間の書き手に特有の語の確率の並びに精通しています。)

この一文があるおかげで、単純な解釈は成り立ちません。Turnitin が否定しているのは、burstiness と perplexity を名前の付いた指標として明示的に組み込んだという点です。語の確率が分類器の動作の中心にあることを否定しているわけではありません。同じドキュメントが、語の確率こそ分類器の学習対象だと確認しています。違いがあるのは、「perplexity」という名前の付いた指標を計算することと、学習データを通じて語の確率のパターンを学ぶことの間にあります。

perplexity は語の確率の指標です。perplexity が低いとは、その文脈において語が予測しやすいということです。高いとは、予測しにくいということです。Turnitin の分類器は語の確率のパターンを学ぶため、perplexity が測る概念はこのモデルの動作に関係してきます。Turnitin が否定しているのは、単一の perplexity スコアを名前の付いた特徴として明示的に計算しているという点です。transformer ベースのモデルは学習データから複雑な統計パターンを学びますが、そのパターンには語の確率の情報が含まれていながら、単一の名前付き指標に還元できるものではありません。

GPTZero は対照的に、perplexity と burstiness を名前の付いた指標として使っていると公に述べています。これは二つの検出器の間の本当の違いです。両者を混同すると、的外れな助言につながります。GPTZero で効く方法が Turnitin にも当てはまるとは限りません。二つのツールは異なる手法を採っているからです。

実際の仕組みはどうなっているのか

Turnitin が perplexity や burstiness を計算していないのだとすれば、いったい何をしているのでしょうか。ドキュメントが説明している処理の流れは、競合サイトの記事が描く指標ベースの手法とはかなり違うものです。Turnitin はこう述べています。「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.」(論文が Turnitin に提出されると、提出物から文が抽出され、予測分析のために重なり合うセクションへと分割されます。各セクションは AI 検出モデルによって分類され、0 から 1 の値が与えられます。この値は、その文章が人間によるものか AI によるものかという確率を示すものです。これらのセクションに含まれる条件を満たす各文は、セクションのスコアを引き継ぎます。セクションは重なり合うため、複数のスコアを持つ文もあり、それらは一つのスコアにまとめられます。こうした文ごとのスコアはさらに集計され、文書全体の AI 文章スコアの算出に使われます。)

あなたの論文は一つの塊として評価されるわけではありません。文が抽出され、重なり合うセクションに分割されます。各セクションには 0 から 1 のスコアが付きます。セクションは重なり合うため、一つの文が複数のセクションに現れ、複数のスコアを引き継ぐことがあります。それらのスコアはまとめられ、さらに文書全体の最終的な割合へと集計されます。

この仕組みは、perplexity スコアと burstiness スコアを計算して組み合わせるというやり方とは根本的に異なります。分類器はセクション単位で文章を評価し、人間の文章と AI が生成した文章を見分ける統計的なパターンを学びます。そのパターンには語の確率の情報が含まれていますが、それは名前の付いた指標として組み込まれたものではなく、学習データから学ばれたものです。

これを正しく理解することがなぜ大切なのか

実際の仕組みを理解すれば、従うべき助言も変わります。Turnitin が perplexity を計算していると信じていれば、予測しにくい語をわざと入れるかもしれません。burstiness を計算していると信じていれば、文の長さをわざとばらつかせるかもしれません。どちらの戦略も、狙うべき的を外しています。

Turnitin の分類器は学習データから統計的なパターンを学びます。あなたの文章について perplexity スコアを計算しているわけではありません。学習したパターンは複雑で、ドキュメントにあるとおり、常に特徴ごとに単純な形で説明できるとは限りません。たった一つの指標を最適化して検出器を「出し抜く」単純な公式は存在しません。

あなたにできるのは、本物の人間による執筆だと伝わる書き方をすることです。人間の文章には、AI モデルが生み出す統計的なパターンとは異なる語の選び方や言い回しが自然と含まれます。分類器は、人間の書き手に特有の語の確率の並びを認識するよう学習されています。自分の声で、その自然な揺らぎを保ったまま書くこと、それこそが分類器の「人間によるもの」として認識するよう作られている書き方です。

perplexity と burstiness の神話は、努力を誤った方向に向けさせます。書き手は Turnitin の計算していない指標を最適化するために時間を使ってしまいます。GPTZero(perplexity と burstiness を実際に使っている)と Turnitin(使っていない)の違いがあるため、片方のツールに合わせて作られた助言が、もう片方には無関係なこともあるのです。

条件を満たす箇所は、無料で再実行できます。HumanPenというツールをこちらから試してください

続きを読む