素晴らしい語彙が AI と判定される?その理由
多くの学生から、語彙が豊かで洗練された文章ほど AI と判定されてしまうという報告が寄せられています。その理由は、優れた文章が AI に似ているからではありません。検出システムが単語の確率パターンを解析しており、特定の形式的な学術文章が AI 生成テキストと統計的な特徴を共有してしまうからです。
HumanPen チーム
· 4 分
結論から言うと
優れた語彙を使っていること自体が AI フラグの原因になるわけではありません。検出システムは単語の選択の質を評価しているのではなく、単語の並びの統計的確率を評価しています。一貫した文章構造、決まり文句の接続表現、予測可能な語彙パターンを用いた形式的な学術文章は、AI 生成テキストに関連付けるようモデルが学習した単語確率プロファイルと重複する可能性があります。問題なのは語彙が「優れすぎている」ことではなく、文章の統計的プロファイルが均一な構造と形式的な単語パターンによって形成され、機械生成の文章に似てしまうことです。Turnitin の FAQ では「構造的な変化に乏しいコンテンツ」が誤検出を起こしやすい特徴として挙げられています。洗練された語彙と均一な構造の組み合わせは、まさにこの説明に当てはまります。
検出システムはあなたの言葉をどう読み取るか
Turnitin の FAQ にはこう説明されています:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(論文が Turnitin に提出されると、提出文から文が抽出され、予測分析のために重なり合うセクションに分割されます。各セクションは AI 検出モデルによって分類され、0 から 1 の値が与えられ、そのテキストが人間によるものか AI 生成のものかの確率を示します。これらのセクション内の該当する文は、セクションのスコアを継承します。セクションは重なり合うため、一部の文は複数のスコアを持つ可能性があり、それらは単一のスコアに統合されます。これらの文のスコアがさらに集約され、文書全体の AI 執筆スコアの算出に使用されます。)
モデルはあなたの語彙を読んで「人間には難しすぎる」と判断しているわけではありません。単語の確率パターンによってセクションを分類しているのです。FAQ には、モデルが何を測定しているかを明確にする 2 つの記述があります。「私たちのモデルは、『burstiness』や『perplexity』など、公開討論で時に言及される個別の指標を評価するように明示的にプログラムされているわけではありません。」また、「私たちの分類器は、これらの単語確率の違いを検出するように訓練されており、人間による文章の特有の単語確率シーケンスの検出に優れています。」
モデルは perplexity という指標を計算しているわけではありません。しかし、単語確率データに基づいて訓練されています。一貫した接続詞、同じ文の出し出し、同じ語彙パターンを用いる形式的な学術文章は、自然な人間による文章の変動に乏しく予測可能なパターンよりも、AI 生成テキストに似た単語確率シーケンスを生み出す可能性があります。AI 検出システムが perplexity や burstiness 以外に何を測定しているか で詳しく説明しています。
洗練された文章が誤検出プロファイルに一致する理由
FAQ には誤検出を起こしやすいテキストがリストされています:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(時に誤検出(人間が書いたテキストを AI 生成と誤ってフラグ付けすること)には、構造的な変化に乏しいコンテンツ、文字通り自分自身を繰り返すテキスト、新しいアイデアを発展させずに言い換えられたテキストが含まれる可能性があります。)
次の文にはこう続きます:「そのようなテキストにおいて AI 執筆の割合が高く表示された場合は、示されたパーセンテージを参照する際にその点を考慮に入れることをお勧めします。」
よく編集された学術文章は、最初の項目に該当する可能性があります。文章を洗練させる過程で、文章構造を標準化し、一貫した接続表現を使用し、形式的な語彙を全体に適用することがあります。これにより、「構造的な変化」が乏しいテキストが生成されます。文章を文学的な意味でより良くする洗練が、統計的な意味ではより均一にし、その均一性こそが誤検出の説明で指摘されている点なのです。これがまさに、AI 検出システムがよく書かれたエッセイをフラグ付けする理由 で論じている内容です。
スコアは質の判断ではない
FAQ にはこうも記されています:
"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors."(したがって、AI 執筆インジケーターのパーセンテージを、教員による措置の唯一の根拠または最終的な評価基準として使用すべきではないことを強調しておかなければなりません。)
AI スコアは質の評価ではありません。あなたの文章が「優れすぎている」「洗練されすぎている」「形式的すぎる」という意味ではありません。モデルがあなたの単語確率パターンを分類した結果、あるパーセンテージが算出されただけです。よく書かれていて語彙が豊富なテキストで高いスコアが出ても、あなたの仕事の質が無効になるわけではありません。あなたのテキストの統計的プロファイルが、モデルが AI に関連付けるパターンと重複しているという意味です。そのために書き方を変えるべきかは別の問題です:AI フラグを避けるために書き方を変えるべきか。
どう対処すればよいか
ここまでの内容をまとめます:
- 優れた語彙を使うこと自体が AI フラグの原因になるわけではありません。検出システムは語彙の質ではなく単語の確率パターンを読み取ります。
- 均一な構造を持つ形式的な学術文章は、AI 生成テキストと統計的な特徴を共有する可能性があります。
- Turnitin は「構造的な変化に乏しいコンテンツ」を誤検出を起こしやすい特徴として挙げています。
- 文章を洗練させると構造的な変化が減少し、統計的な意味でテキストがより均一になる可能性があります。
- スコアは文章の質に対する判断ではなく、措置の唯一の根拠として使用するべきではありません。
どの箇所がフラグされているかを示す Turnitin レポートをお持ちの場合は、レポートをインポート して、それらの特定の箇所に取り組んでください。対象となる箇所は無料で再実行できます。
続きを読む