査読者が論文を AI 生成と指摘した。Turnitin の公式見解

査読者から「論文が AI 生成に見える」と指摘された場合、Turnitin の公式ドキュメントでは自社の AI 表示機能の限界をどう説明しているか。FAQ によると、このスコアだけで判断を下すべきではない。これはあくまで参考情報の一つに過ぎず、誤検知も起こり得る。AI スコアは指導者と管理者のみが閲覧可能で、AI 生成率が 20% を超える文書における誤検知率は 1% 未満を目標としている。

HumanPen チーム

· 4 分

スコアは唯一の根拠ではない

Turnitin の FAQ は自社の AI 表示機能の限界を明確に説明している:

"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors."(したがって、AI 作成指標のパーセンテージを、教員が懲戒措置や成績評価の唯一の根拠として使用すべきではないことを改めて強調します)

これは Turnitin 自身による声明だ。パーセンテージは「結論」ではなく「兆候」に過ぎない。査読者が Turnitin のスコアを根拠に論文を指摘した場合、そのスコアは最初から最終判断を意図したものではないとドキュメントは明言している。期刊が投稿論文に対して実際に何を実行するかは別の問題だ:期刊は論文の AI 生成をチェックするか

単一のデータポイントである

FAQ はスコアを多数の入力情報の一つとして位置づけている:

"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy."(単独で決定的な答えを出すことを意図したものではありません。どのツールよりも重要なのは、スコアを確認し、この情報と学生・その成果物・機関の方針に関する自身の知識を天秤にかけながら判断を下す教育者です)

このスコアは、ツールが把握できない文脈を持つ教育者によって解釈されるよう設計されている。あなたの執筆プロセスも、草案の履歴も、文章の癖も、ツールには分からない。ドキュメントが伝える本質はシンプルだ――スコアを読む人間の判断が、スコア自体よりも重要なのである。

パーセンテージだけで論文を指摘する査読者は、FAQ が「そう使うべきではない」と明言する方法でツールを活用している。スコアは本来、学生やその研究成果に関する個人的な知識と照らし合わせてバランスを取るためにあるものだ。

誤検知の具体例

FAQ は、誤検知を引き起こす可能性のある文章の特徴を具体的に挙げている:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(誤検知、つまり人間の文章を誤って AI 生成と判定するケースには、構造的な多様性に欠ける内容、文字通り反復する文章、新たな展開 なき 言い換えられた文章などが含まれる)

論文がフラグを立てられたなら、これらの特徴に心当たりがないか振り返ってみよう。構造の単調さ、同じ表現の繰り返し、新たな分析を加えずに情報源を言い換えただけの文章――これらはすべて、自分が一字一句書いた文章であってもフラグが立つことがあり得る。これらは推測ではなく、公式に記録された誤検知のパターンなのだ。

ここで注目すべきは、これらの特徴が学術論文ではごく一般的だということだ。文献レビュー、研究方法の説明、結果の記述はいずれも、性質上構造の単調さや表現の反復を生みやすい。誤検知は「その文章が AI 生成である」ことを意味しない。AI の出力に関連するパターンをその文章が共有しているに過ぎない。Turnitin が研究方法セクション全体をフラグ付けした事例 では、このケースが詳しく検討されている。

誤検知率の目標値

FAQ には特定の誤検知率の目標値が記載されている:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing."(当社は検出機能の有効性を最大化しつつ、AI 執筆率が 20% を超える文書において、人間が完全に作成した文章を誤って AI 生成と判定する誤検知率を 1% 未満に抑えることを目指しています)

その次の行にはこう続く:「In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents.」(言い換えれば、100 件の完全に人間が作成した文書のうち約 1 件を、AI 作成文書として誤ってフラグ付けする可能性があります)

目標は「AI 執筆率が 20% を超える文書で誤検知率 1% 未満」。これは Turnitin が誤検知の発生を公式に認めた上で、その頻度に閾値を設定していることを意味する。ただしこの閾値は目標値であり、保証ではない。誤検知はシステムの設計パラメータに組み込まれた要素なのだ。大学が 75,000 件の論文を提出する際、1% の誤検知率が意味するもの では、この目標値を実際の人数規模に換算して示している。

実際にスコアを確認できるのは誰か

FAQ は AI 指標へのアクセスが制限されている点を強調している:

"Please note, only instructors and administrators are able to see the indicator."(なお、この指標を閲覧できるのは指導者と管理者のみです)

学生はこのスコアを閲覧できない。編集フローにおける査読者も、多くの場合 Turnitin の AI 指標に直接アクセスできない。もし査読者があなたの論文を AI 生成と指摘したなら、それは類似性レポートや別の検出ツール、あるいは文章そのものに対する自身の評価に基づいている可能性がある。どのツールがその指摘を下し、誰がどのレポートにアクセスできたのか――これを明確にすることが重要だ。期刊の場合、通常は iThenticate が使われる:iThenticate は AI 執筆を検出するか

あなたがすべきこと

ドキュメントの記載を要約すると:

  • AI 作成指標のパーセンテージは、懲戒措置や成績評価の唯一の根拠として使用するべきではない。
  • スコア単独で決定的な判断を下すことを意図したものではない。学生に関する教育者の知識や機関の方針の方が重要である。
  • 誤検知には、構造的な多様性に欠ける文章、反復表現、新たな展開 なき 言い換えられた文章などが含まれる。
  • AI 執筆率が 20% を超える文書における誤検知率の目標は 1% 未満であり、誤検知はシステムに組み込まれた要素である。
  • AI 指標にアクセスできるのは指導者と管理者のみで、学生は閲覧できない。

査読者から指摘された箇所を修正したい場合は、レポートを取り込む して該当箇所に取り組もう。条件を満たす箇所は無料で再実行できる。

続きを読む