AI が 20% は高すぎる?絶対的な閾値が存在しない理由

20% という数字は、Turnitin が数値結果を表示する境界であって、不正行為の普遍的境界ではありません。レポートの意味は、該当するテキストの内容、モデルの誤差、ハイライトの位置、そして各教育機関の独自のルールによって決まります。

HumanPen チーム

· 5 分

Turnitin を含め、誰も閾値を公表していません

業界としてのカットオフ基準も、認められた安全圏も、Turnitin が「これ以上は多すぎる」とする数値も存在しません。各教育機関が独自の方針を決めており、その対応は多様です。フラグを学生との対話のきっかけとする機関もあれば、この指標を無視する機関もあり、Vanderbilt 大学は 完全に無効化しました

つまり、「20% は高いのか」という問いに対する正直な答えは、公表されているポリシー次第であり、数字だけでは答えられないということです。安全な割合を提示する記事は、それをでっち上げています。

この問いは、3 つの異なる決定を隠しています。Turnitin はインターフェースに表示される内容に関する報告ルールを選択します。教育機関はスタッフが提出物を審査するタイミングを定める調査ルールを選択します。懲戒機関はポリシー違反があったかどうかを判断する際に証拠基準を適用します。同じ数値が 3 つの段階すべてに関わることがあっても、その数値自体がどれかを決定するわけではありません。

20% という表示境界は、20% で不正行為とみなすルールではありません。この 2 つを同等とみなすことが、ほとんどの「安全スコア」アドバイスに潜む根本的な誤りです。

2 つの 20% レポートが必ずしも比較可能であるわけではありません。ある文書はほぼ完全に該当する散文で構成されている可能性があり、別の文書は表や付録が中心である可能性があります。1 つは集中した 1 つのブロックを示し、もう 1 つは散在する部分を示す可能性があります。パーセンテージはこれらの異なるケースを 1 つの見出しに圧縮するため、解釈はレポートとポリシーから始めるべきであり、普遍的なカラーチャートから始めるのではありません。

ベンダーが低範囲の表示方法を変更しました

文書化されている境界は 1 つあり、それは表示ルールです。2024 年 7 月から、Turnitin の結果が1% から 19%の範囲にある場合、アスタリスクが表示され、数値パーセンテージもハイライトも表示されません。Turnitin によれば、テストで低範囲において偽陽性の発生率が高いことが分かり、数値を隠すことで誤解を減らせるということです。

アスタリスクはモデルの低範囲に関する注意です。ゼロを意味するわけではなく、教育機関にどのような懲戒結論を導くべきかを示すわけではありません。

表示される 20% と隠された 19% は表示ルールの反対側に位置しますが、その 1 ポイントの違いが科学的な断崖を作り出すわけではありません。どんな閾値の近くでも、モデルやテキストの小さな変化がユーザーの表示を切り替える可能性があります。そのため、20% のレポートは文脈とともに読むべきであり、アスタリスクとは本質的に異なるとみなすべきではありません。

古いレポートは比較をさらに複雑にします。この変更はさかのぼって適用されなかったため、2024 年 7 月 8 日以前の提出物は、新しい提出物では隠される低い数値スコアを引き続き表示する可能性があります。作成日、利用可能な場合は検出器のバージョン、元の PDF またはスクリーンショットをケース記録とともに保管してください。

「1%」という主張はどうなったのか

この検出器が 2023 年 4 月にローンチされた際、Turnitin は評価条件下で文書レベルの偽陽性率が1% 未満であると宣伝しました。2023 年 6 月には、同社の最高製品責任者が Inside Higher Ed の取材に対し、文レベルの偽陽性率は約 4% だった と述べています。これらの数値は異なる単位を使用しており、1 から 4 への単純な改訂として提示されるべきではありません。

偽陽性率には分母と母集団が必要です。文レベルの誤差は「人間の文が誤ってラベル付けされる頻度は何か」を尋ね、文書レベルの誤差は「完全に人間が書いた文書が決定ルールを越える頻度は何か」を尋ねます。どちらの数値も、Turnitin の 初年度にレビューされた 2 億件の論文 に掛けて告発件数を推計することはできません。人間作成、AI 支援、不適格、重複提出の内訳が不明だからです。

Vanderbilt 大学は年間約 75,000 件の提出を例に、機関の規模を説明しました。主張される率が小さくても、公平な審査を必要とするケースが多数生じうることを示すためです。ただし、正確に 750 人の学生が誤って告発されることを証明するものではありません。フラグが告発に至らない場合もあり、論文に多くの文が含まれていても誤陽性文書になるとは限りません。

基準率が重要であるのには別の理由もあります。特定の課題において禁止された AI 使用が稀な場合、特異度が高くても偽陽性が全フラグの大きな割合を占める可能性があります。使用が一般的な場合、同じ検出器でも陽性的中値は異なる値になります。有病率、感度、特異度、教育機関の審査プロセスを知らなければ、表示されたパーセンテージから「この学生が不正をした確率は何か」という問いに答えることはできません。

検出器のパーセンテージ、偽陽性率、不正行為の確率は 3 つの異なる量です。いずれも他と置き換えることはできません。

偽陽性が実際に集まる場所

Turnitin は、人間と AI 作成の文を混合したテストから、より具体的な誤差分析を公表しています。観察された偽陽性文の 54% が AI 作成の文の直後にあり、さらに 26% が 2 文離れていました

その評価では、偽陽性文の 5 分の 4 が AI 文から 2 文以内にありました。これは混合文書における境界の振る舞いを記述するものであり、完全に人間が書いた論文における偽陽性の位置を示すものではなく、その後のすべてのモデルバージョンに一般化されるべきではありません。

これには実用的な結果があります。AI 支援の箇所がいくつかある論文では、それらの周囲の文が誤ってフラグ付けされる可能性が最も高く、パーセンテージではどれがどれかを区別できません。分布は可能です。これが、見出し ではなくレポート自体を読むべきだという議論の根拠です。Turnitin はまた、文書の冒頭と末尾の文—序論と結論—で偽陽性の発生率が高いことを 報告 しており、そのため集計方法を変更しました。

したがって、ハイライトされた文をすべて削除または書き換えることは健全な診断対応ではありません。ハイライトされた境界の文の一部は人間によるものであり、ハイライトされていない箇所の一部は AI 支援だが検出されなかった可能性があります。レポートは文脈レビューのための箇所を特定するものです。執筆者性の証拠は依然として、ドラフト、情報源、許可された使用の宣言、および執筆者が作品を説明する能力から得られます。

「これは高いか」よりも良い問い

  • 私の教育機関はこの数値をどのように扱うか? 多くの機関はこれを見解ではなく検討の理由として扱います。Turnitin 自体も、これが不正行為を決定するものではないと述べています。
  • フラグはどこにあるか? 方法論、定義、背景に集中している—形式的に読まれるべき箇所—ことは、あなたの議論全体に散在することとは異なる意味を持ちます。
  • 文書のどの部分が評価されたか? パーセンテージは散文にのみ適用されます。表、リスト、参考文献が中心の論文は、あなたが考えるよりはるかに少ない部分しか評価されていない可能性があります。
  • どのレポートの状態と日付を見ていますか? アスタリスク、0%、数値スコア、適格エラーはそれぞれ異なる意味を持ち、2024 年 7 月以前のレポートは古い表示ルールに従います。
  • どのような追加証拠が必要か? レビュー担当者が指標を十分とみなすのではなく、ドラフト、情報源、バージョン履歴、以前の執筆、学生の説明を検討するかどうかを尋ねてください。

教育関係者の場合、この機能を使用する前にこのプロセスを書面に残してください。誰がレポートを閲覧できるか、何が対話を引き起こすか、学生にどのように証拠が提供されるか、どのような配慮が適用されるか、誰が最終決定を下すか。学生の場合、その書面プロセスを求め、元の提出物を変更せずに保持してください。どちらのステップも、20 が本質的に「高い」かどうかを議論するよりも有用です。