なぜ非ネイティブの英語書き手は AI 検出ツールに引っかかりやすいのか

7 つの検出ツールは、人間が書いた TOEFL エッセイの標本の 61% を誤って AI と判定しました。この研究がすべての多言語書き手を代表するわけではありませんが、語彙の幅が狭いだけで、誰が書いたかという中身を変えずに検出スコアが動いてしまう仕組みが、対照的な添削実験から示されています。

HumanPen チーム

· 8 分

研究結果:人間のエッセイの 61.22% が AI と判定された

2023 年、スタンフォード大学の研究グループ(Liang, Yuksekgonul, Mao, Wu, Zou)は、広く使われている 7 つの GPT 検出ツールを 2 組のエッセイにかけました。1 つ目は中国人の学生フォーラムから集めた 91 編の TOEFL エッセイ00130-7) で、すべて学生が書いたものです。2 つ目は Hewlett 財団の ASAP データセットから取った、アメリカの中学 8 年生による 88 編のエッセイです。どちらの組にも AI は関与していません。この研究は Cell Press のジャーナルである Patterns に発表されました。

アメリカの中学 8 年生のエッセイでは、検出ツールはほぼ完璧に動作しました。一方、TOEFL エッセイでは偽陽性率の平均が 61.22%に達しました。7 つのツールすべてが一致して91 編中 18 編(19.78%)を AI 生成と判定し、91 編中 89 編(97.80%)は少なくとも 1 つのツールでフラグされました。

この対照こそが重要な結果です。同じ 7 つのツールは、TOEFL エッセイよりもアメリカの中学 8 年生のエッセイの方がはるかに良い精度を示しました。だからといって、すべての多言語書き手や今日のあらゆる検出ツールのエラー率がこれでわかるわけではありません。しかし、全体の精度を主張しても、特定の書き手集団ではもっと酷い結果が隠れている可能性があることが示されています。

61.22% という数字は、この標本と 2023 年の 7 つの検出ツールに関する結果として理解してください。あなた個人がフラグされる確率ではありません。この研究は、エラーが不平等に起きうるという警告であり、普遍的な予測ではないのです。

この知見には異議も出ています。ある検出ツールのベンダーは、一つの学生フォーラムから取った 91 編では少なすぎて、また出所が偏りすぎていて、一般的な割合を支持するには不十分だと主張しました。これらは正当な指摘です。標本は恣意的な抽出であり、比較対象の年齢と言語的背景が異なり、2023 年以降に検出製品も進化しています。そのため、妥当な結論はヘッドラインよりも狭いものになります。この研究は、機関が輕易に無視すべきではない大きな格差を特定したのです。

リスクの観点からも、機関は同様の慎重な姿勢を示しています。ヴァンダービルト大学は 2023 年 8 月に Turnitin の AI 検出機能を無効化しました。文書レベルで 1% の偽陽性率だとしても、年間約 75,000 件の提出物を前にすると深刻なレビュー負担が生じると指摘したのです。この計算は予測ではなく、正確に 750 人の学生が告発されると言っているのではありません。すべての論文が対象となるわけではなく、母集団の基準率は不明で、フラグが付いても必ず告発につながるわけではありません。要点は、わずか数パーセントでも、機関規模では公正なプロセスが必要だということです。

証拠を強化するには何が必要でしょうか。より大規模な事前登録済み研究では、第一言語、習熟度、専門分野、課題の種類を超えて書き手をサンプリングし、年齢をマッチさせたグループを比較し、検出ツールのバージョンごとの結果を公開し、偽陽性と偽陰性の両方を報告すべきです。全体の精度だけでは不十分です。導入を検討する機関は、ベンダーが実際の学生集団を評価したか、サブグループの結果が入手可能かを尋ねるべきであり、別のコーパスからのヘッドラインレートを輸入するべきではありません。

個々のレポートについては、スタンフォードの数字もベンダーのベンチマークも、その案件を決定しません。関連する証拠はローカルなものです。どのテキストが該当したか、ハイライトはどこにあるか、どのモデルバージョンが使われたか、課題で何が許容されていたか、学生のドラフトがどう発展したか。集団研究はレビュー担当者にどの失敗モードを深刻に捉えるべきかを教えますが、個別の作品のレビューを代替するものではありません。

検出ツールが実際に測っているもの

初期の公開された検出ツールの解説では、perplexity(困惑度)と burstiness(爆発性)という 2 つの統計的シグナルに焦点が当たっていました。現代の商用システムは多くの学習済みシグナルを組み合わせている可能性があり、内部は通常開示されていないため、これらの用語は現在のあらゆる製品を完全に記述するものというより、問題を理解するための枠組みと捉えるのが適切です。

Perplexity(困惑度)は、言語モデルにとってあなたの言葉選びがどれだけ驚くべきものかを測ります。モデルが予測した次の単語が実際に使われていれば、perplexity は低くなります。Burstiness(爆発性)は、文章間で長さや構造がどれだけ変化するかを測ります。均一で規則的な文章は低いスコアになります。

これらのシグナルを使う検出ツールでは、perplexity が低く、変化が小さいと、機械的な分類に寄与することがあります。これは普遍的なテストではなく、同じ文章でも参照モデルが違えば perplexity は変わりえます。分類器はシグナルを組み合わせて、どこを閾値としてラベル付けするかを選ぶ必要があります。

検出ツールは執筆者や意図を観察するわけではありません。提出されたテキストの特徴を観察し、訓練データから学習したパターンと比較するだけです。

この区別は第二言語の書き手にとって重要です。語彙が小さい、文の枠組みが繰り返される、授業で習ったモデルに厳密に従うといったことは、生成テキストに見られる特徴に似てしまいます。より良い分類器がこのエラーを減らすことはあっても、どのアーキテクチャでも、テキストの類似性から「誰が書いたか」を直接観察できるわけではありません。

閾値も重要です。下げれば生成テキストをより多く検出できますが、人間のテキストもより多く入ってきます。上げればその逆です。宣伝されている精度の数値は、ある運用ポイントにおける 1 つのデータセットの説明に過ぎません。習熟度、専門分野、文書の長さ、後続のモデルバージョン全体で同等のパフォーマンスが保証されるわけではありません。

語彙の幅が結果を動かすことを示した実験

この論文は 2 組のグループを比較するだけで終わりません。元のエッセイとその議論を固定したまま、言語を両方向に操作します。これにより、考えられるメカニズムがより説得力を持つようになります。ただし、語彙をモデルによる他のあらゆる文体変化から完全に切り離したわけではありません。

第一の方向。 研究者たちは、全員の一致でフラグされた TOEFL エッセイを取り、GPT-4 に語彙を豊かにするよう依頼しました。perplexity は有意に上昇し(P = 9.36E-05)、全員に検出されたエッセイ数は 18 編から91 編中 1 編(1.10%)に減少しました。著者も議論もエッセイ自体も同じです。変わったのは語彙だけでした。

第二の方向。こちらがより強力な証拠です。 検出ツールがほぼ完璧に判定したアメリカの中学 8 年生のエッセイを取り、ChatGPT に「非ネイティブスピーカーが書いたかのように言葉遣いを単純化して」と指示しました。誤判定率は平均5.19% から 56.65%に跳ね上がりました。

根底にあるエッセイの執筆者は変わっていませんが、分類結果は変わりました。この介入は、人口統計ラベルが検出器に somehow 見えていたのではなく、表面的な言語、特に語彙の多様性に因果的役割があることを支持しています。GPT-4 や ChatGPT は構文、リズム、言い回しも変える可能性があるため、語彙が唯一の原因だと証明したと言い切ることはできません。

論文自体の結論は、検出ツールは「言語表現が制限された書き手を意図せず罰する可能性があり」、評価や教育の場での導入そのものに反対して警告しています。

この結果は、多言語書き手がよりフォーマルに書こうとすると逆効果になりうる理由も説明しています。学術的なアドバイスでは、決まり文句の接続詞、保守的な語彙、均一な文構造を評価することがよくあります。これらは明確さのために適切かもしれませんが、古い統計的検出ツールが人間らしさの証拠と見なしていた多様性を正確に減らしてしまうのです。解決策は、論文に装飾的な語彙を無理に押し込むことではありません。検出器を執筆者テストとして扱わないことです。

関連する知見:一つの指示文ですべてを撃破できる

同じ論文は、これらのスコアを証拠として使うことを複雑にする事実を報告しています。研究チームは ChatGPT-3.5 でエッセイを生成しました。検出ツールはそれらを確実に検知しました。その後、一つの自己編集指示文「提供されたテキストに文学的な言語を用いて格上げせよ」を適用すると、検出率は100% から 13%に落ちました。

これはここでテクニックとして提示しているのではありません。これはこの測定器についての事実として提示しています。一行の指示文で 87 ポイントも動く測定値は、告発の弱い根拠にしかなりません。そして、誰にも特定の検出結果を正直に約束できない理由でもあります。私たちはそんな約束はしません。

この結果には 2 つの限界があります。第一に、これは 2023 年にテストされた 7 つの検出ツールとモデル出力を記述したもので、2026 年のあらゆる製品を記述したものではありません。第二に、回避に対する堅牢性と人間の書き手に対する公平性は異なる性質です。検出ツールは騙されにくくなっても、不平等な偽陽性を残したままかもしれません。現在のいかなる評価も、スコアが実際に使われることになる集団と文章ジャンルで、この両方をテストすべきです。

検出ツールは、選別には有用でも、裁定には信頼性が足りないことがあります。結果が重大であればあるほど、より独立した証拠と手続き的なレビューが必要になります。

フラグが付いたらどうするか

これは検出ツールを回避する書き方のアドバイスではありません。統計があなたについての証拠として読まれているときに何をすべきかです。

  • 下書きを今から保管してください。 Word や Google ドキュメントのバージョン履歴、アウトラインファイル、読書メモ、指導教員からのフィードバックを保存しておきます。これらの資料は作品が時間をかけてどう発展したかを示します。対立する検出スコアよりも強い証拠になります。
  • ヘッドラインのパーセンテージではなく、完全なレポートを求めてください。 箇所のハイライトから、フラグが方法論、定義、背景といった、慣用的な言葉遣いが予想されるセクションに集まっているかどうかがわかります。レポートが実際にセクション別の確率を提供していない限り、それらをセクションレベルの確率として説明しないでください。
  • その数字がどう使われているかを尋ねてください。 関連するコースまたは機関の方針、検出ツールとそのバージョン、スコア以外に考慮された証拠を求めてください。多くの機関は、フラグを「見る理由」であって「発見」としては扱いません。
  • 意味と所有権のために編集してください。 あなたが自然に使わないだろう表現を置き換え、すべての主張と引用を確認し、議論を説明できるようにしてください。文の長さの多様性を人為的に作り出すためだけに、明確な散文を歪めてはいけません。

正式な手続きが始まっている場合は、提出済みファイルをそのままにしておき、コピーから作業を始めてください。研究、執筆、フィードバックの受信、修正を行った時期を簡単なタイムラインに書き出してください。証拠を検討するための十分な時間を求め、ルールが許す場所では顧問または学生代表を連れて行ってください。偽のフラグへの対応準備 に関する別のガイドが、その手続きを詳しく扱っています。

教育者の場合、学生にバイアスの問題を提起させるのを待ってはいけません。事前に、誰がフラグをレビューするか、どんな裏付けが必要か、言語的背景や障害がどう考慮されるか、学生が基礎となるレポートをどう受け取るかを定義してください。人間のプロセスがそれに異議を唱える能力がある場合に限り、ツールは単なる選択的な選別にすぎなくなります。