なぜ AI チェッカーは質の高い論文をフラグするのか
この問いは、AI チェッカーが論文を読んで「出来が良すぎる」と判定したという前提に立っています。しかし、提供元が公開しているツールの説明 どこにも「well written(出来が良い)」という項目は存在しません。つまり、フラグが実際に示しているのは別のことなのです。
HumanPen チーム
· 14 分
結論を一言で
このシステムは文章の質を評価しているわけではありません。私たちが検索した Turnitin のヘルプページ 3 箇所すべてにおいて、「quality」「style」「polished」「well written」「vocabulary」「clarity」といった用語は一切出現しませんでした。一方、「300 words」という感度設定は 3 ページすべてに存在していたため、検索自体は空白を返すのではなくページのテキストを読み取っていました。FAQ は、このチェッカーを「文章の良し悪しを測るもの」として位置付けていません。Turnitin が公開しているのは、偽陽性が起こり得るテキストの根拠のない一覧です。注意深く書かれた学術的散文は、固定された用語を繰り返したり並列構造を使ったりする際、その一覧の 2 つの項目に該当する場合があります。しかし Turnitin は、これらの特性が誤判定のうちどれほどの割合を占めるかについては言及していません。
だからといって、洗練された文章が無害だと証明されたわけではありません。そう言い切るつもりもありません。企業が文書化するのは、文書化すると選んだ部分だけです。訓練済みモデルには、ヘルプページに書かれていること以上に多くのものが含まれています。ここで私たちが示せるのは、より狭く、しかし実用的な一点です。「well written(文章が上手)」とは、このシステムが報告対象としていない尺度です。したがって、フラグは文章の良し悪しへの判定ではありません。そして「自分の実力よりレベルを落として書け」というアドバイスは、この前提に依存して組み上がっていますが、それを裏付ける公開情報は存在しないのです。
提供元の用語を数えてみる
2026 年 8 月 18 日に取得した 3 ページのレンダリングテキストを検索しました。`guides.turnitin.com` はコマンドラインからの単純なフェッチに対して 403 を返したためです。対象としたのは「Using the AI Writing Report」「Turnitin's AI writing detection capabilities FAQs」「File requirements for an AI Writing Report」の 3 ページです。これらのページはメカニズムとファイル要件を説明するもので、リリースノートや既知の問題ページは検索範囲外でした。下の表は大まかな数ではなく、大文字小文字を区別しない存在・非存在を記録したもので、ライブページの変動により変化する可能性があります。
| 検索語 | レポートガイド | 検出に関する FAQ | ファイル要件 |
|---|---|---|---|
| `quality` | なし | なし | なし |
| `style` | なし | なし | なし |
| `well written` / `well-written` | なし | なし | なし |
| `polished` | なし | なし | なし |
| `genre` | なし | なし | なし |
| `discipline` | なし | なし | なし |
| `false positive`(二次的な管理) | あり | あり | なし |
| `300 words`(感度設定) | あり | あり | あり |
表の最下行が、他の行すべてに意味を持たせる理由です。空の結果も取得エラーも同じ痕跡を残します。したがって、3 ページすべてに存在することが分かっている用語は、まず存在していなければならないからです。FAQ では「writing」と「segment」は存在しますが、「vocabulary」「word choice」「clarity」は存在しません。「breakdown」はレポートガイドに存在しますが、統計としてではなく、インターフェースのパネル名としてのみです。
次に、テキスト検索では全く捉えられない画像があります。FAQ 記事そのものには画像は含まれておらず、サイトのロゴは記事ではなくページの共用部分に属するものです。レポートガイドには_alt テキストなしの_スクリーンショットが掲載されています。そこで、これらを個別に開いて確認しました。そこには、56% の AI と 23% の類似性を示すサンプルレポート、ハイライトされた文章のページ、ステータスメッセージなどが含まれていました。上記の用語はいずれも使用されていません。そのうちの 1 つには、ページの本文にはどこにも現れない文が含まれていました。
"AI detection includes the possibility of false positives. Although some text in this submission is likely AI generated, scores below the 20% threshold are not surfaced because they have a higher likelihood of false positives."(AI 検出には偽陽性の可能性があります。本投稿には AI 生成の可能性が高いテキストが一部含まれていますが、20% の閾値未満のスコアは偽陽性の可能性が高いため表示されません。)
これは、製品自身が最も信頼できない帯域の数値を表示しないという判断です。そしてこの点は押さえておく価値があります。なぜなら、この資料の他のあらゆる箇所では、誤判定率は「記述」されるだけで、「行動」には移されていないからです。
何が言葉を持っているのか
実際に働いている何ものかがあり、FAQ はそれを「What parameters or flags does Turnitin's model take into account when detecting AI writing?」(Turnitin のモデルは AI 文章を検出する際、どのようなパラメータやフラグを考慮しますか?)という見出しの下で説明しています。
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."(私たちの分類器は、単語の確率のこうした差異を検出するように訓練されており、人間の書き手に特有の単語確率の連鎖を捉えることに長けています。)
同じ回答では、モデルは「'burstiness'、'perplexity'、あるいは公の議論で時折言及される他の個別指標といった特定のシグナルを評価するように明示的にプログラムされているわけではない」こと、そして代わりに「訓練データから統計的パターンを学習する」ことも付け加えています。両方の文がページ上にあり、どちらか一方だけを読んで他方を無視すると、誤った場所にたどり着きます。提供元は 2 つの固有名詞の指標を否定しているのであって、単語の確率が通貨であることを否定しているのではありません。これが人々の議論する用語にどう意味を持つかは、AI チェッカーが何を測っているかで詳しく説明しています。
次に、公開されている単位を下から上へと辿ってみましょう。単語、そして文、そしてこれです。
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1 ... Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(論文が Turnitin に投稿されると、投稿文から文が抽出され、予測分析のために重なり合うセクションに分割されます。各セグメントは AI 検出モデルによって分類され、0 から 1 の値が与えられます。これらのセグメント内の各対象文は、そのセグメントのスコアを引き継ぎます。セグメントは重なるため、一部の文は複数のスコアを持つことがあり、それらはその後 1 つのスコアに統合されます。これらの文のスコアはさらに集約され、文書全体の AI 文章スコアの算出に使用されます。)
連鎖はそこで止まります。分類の対象となる最大の単位はセグメントであり、これは数文の幅しかありません。文書スコアはそれらの集約であり、全体を読み込んだ上で下される 2 回目の判定ではありません。論文を良からしめるもののほとんどは、セグメントよりも大きな単位です。8 ページにわたって展開される議論、適切に選ばれた証拠、第 2 節で提起され第 5 節で答えられる反論。これらはいずれも、分類が行われるスケールにおける対象物ではありません。システムがあなたの推論を測って、それを嫌っているのではありません。そのような枠自体が存在しないのです。
「人間」が何を基準に調整されているか
学術的散文における偽陽性について議論する際、提供元は ChatGPT 登場前のテストコーパスを参照しています。
"To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate."(テスト体制を強化し、偽陽性の統計的傾向を診断するため、アップデートまたは新モデルのリリース前に、ChatGPT のリリース前に書かれた 70 万本以上の学術論文を追加でテストし、偽陽性率 1% 未満をさらに検証しています。)
FAQ は独自の小見出し「How does Turnitin ensure that the false positive rate for a document remains less than 1%?」(Turnitin はどのようにして文書の偽陽性率を 1% 未満に保っていますか?)の下で同じことを再び問い、「over」を落としてこの数値を繰り返しています。「we perform additional tests on 700,000 additional academic papers that were written before the release of ChatGPT」。同じコーパスが、1 ページ上でわずかに異なる 2 つの文で語られています。
Turnitin がこの参照母集団をどのように記述しているかを読んでみてください。ChatGPT のリリース前に書かれたという理由で選ばれた学術論文です。これは日付に基づく記述であり、すべての論文が個別に人間による執筆か検証されたという記述ではありません。より狭い主張でも依然として有用ではあります。Turnitin は、モデルのリリース前にこの ChatGPT 以前の学術コーパスを再実行して偽陽性率を監視していると述べています。しかし、ページには論文ごとの著者性検証についての記述はありません。
だからといって、これで決着がついたわけではありません。そう言い切れば、私たちは主張を過大評価することになります。提供元が公開しているのは目標値だけで、その背後にある分布ではありません。そして、その目標値自体が、直後の文で静かに手放している限界を帯びています。この議論の完全な版、つまり小さな率を実在する大学の年間ボリュームに乗じたときに何が起こるかは、1% の偽陽性率が意味することで説明しています。
誤判定の分布は公開されていない
ページには 1% 未満の偽陽性率が記載されていますが、テストコーパス全体で誤判定がどのように分布しているかは公開されていません。サブグループ別の率はなく、ある種のテキストが他のテキストよりも多くの誤判定を占めるかどうかも示されていません。
ページが公開しているのは、偽陽性が含む可能性のあるテキストの根拠のない一覧と、そのパーセンテージの読み方に関するアドバイスです。
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(偽陽性(人間が書いたテキストを AI 生成として誤ってフラグすること)には、構造的なバリエーションがあまりないコンテンツ、文字通り自分自身を繰り返すテキスト、新しいアイデアを発展させずに言い換えられたテキストが含まれることがあります。そのようなテキストで AI 文章の割合が高く示された場合は、表示されたパーセンテージを見る際にそれを考慮に入れることをお勧めします。)
この一覧に何が載っていて、何が載っていないかを読んでください。洗練された語彙では ありません。長い文でもありません。力強い議論でもありません。3 つのテキスト特性が挙げられていますが、そのいずれの頻度も示されていません。3 つ目は何かあなた自身が書いて生み出したものというより、むしろプロセスを描写しています。
最初の 2 つは、通常の学術的慣行と比較する価値があります。以下は私たちの解釈であり、提供元の解釈ではありません。あなたの分野で、あるものを毎回同じ名前で呼ぶことが求められているなら、類義語は曖昧さを導入する可能性があるため、意図的に同じ用語を繰り返すでしょう。比較可能な項目を並列の文で並べて、読者がそれらを並べて把握できるようにする場合、同じ理由で構造的なバリエーションを減らすでしょう。どちらの選択も過ちではありません。Turnitin は、偽陽性がこれらの特性を含む可能性があると述べています。しかし、それがどの程度の頻度なのか、誤判定がそこに集中しているのか、あるいはこれらの特性が誤判定と相関しているのかについては述べていません。
私たちが言っていないこともあります。というのは、それはここで裏付けられるどんな主張よりもはるかに大きな主張だからです。「洗練された文章がフラグされる」という文は広く出回っています。そして、それが通常結び付けられているのは、「あなたが持つ能力より劣った書きぶりをしろ」という指示です。公開された一覧が実際に裏付ける修正と、それを手作業で行うコストは、ツールなしで AI テキストを人間らしくする方法で詳しく扱っています。
2 つ目の文が誰に向けて書かれているかにも注意してください。その文は、パーセンテージを見ている誰かに対し、それが生じたテキストの種類を考慮するように求めています。指示は論文を書いた人ではなく、レポートを持っている人に向けられているのです。
あなたの種類の文章が不利かどうかは公開されていない
次に当然浮かぶ疑問は、偽陽性があなたの分野、あなたのセクション、あるいはあなたのジャンルでより一般的かどうかということです。FAQ にはこれに近い見出しがあります。「Does the Turnitin model take into account that AI writing detection technology might be biased against particular subject-areas or second language writers?」(Turnitin のモデルは、AI 文章検出技術が特定の分野や第 2 言語の書き手に偏りを持つ可能性を考慮していますか?)答えは訓練サンプルについて述べています。
"One of the guiding principles of our company and of our AI team has been to minimize the risk of harm to students, especially those disadvantaged or disenfranchised by the history and structure of our society. Hence, while creating our sample dataset, we took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments and less common subject areas such as anthropology, geology, sociology, and others."(当社および AI チームの指針の一つは、特に社会の歴史や構造によって不利な立場に置かれているか、権利を奪われている学生への危害のリスクを最小限に抑えることです。したがって、サンプルデータセットを作成する際、第 2 言語学習者、非英語圏の英語使用者、多様な学生を抱える大学に在籍する学生、人類学、地質学、社会学などの一般的でない分野の学生など、統計的に過小表現されているグループを考慮しました。)
「anthropology」「geology」「sociology」という分野名は、サンプルがどのように構築されたかを説明する段落にのみ現れます。「discipline」「genre」「subgroup」は 3 ページすべてに存在しません。したがって、分野は訓練への入力として現れていますが、公開されたテストの内訳としては現れていません。人類学の偽陽性率は公開されておらず、提供元もバイアスへの回答に数値を裏付けていません。それが、これを意図の表明として読まなければならない理由です。
この隔たりこそが、この問いに対して人々が見つめる数字が企業の外側から来ている理由です。91 件の TOEFL エッセイを対象とした 2023 年の研究です。その範囲、管理された編集、そして実際の限界については、なぜ非ネイティブ英語話者が AI チェッカーにより多くフラグされるのかで詳しく扱っています。これが、同じ段落に対して 2 つのチェッカーが 2 つの異なる判定を下す理由でもあります。これは別の混乱であり、なぜチェッカーは意見が一致しないのかで扱っています。
あなたの最善の仕事の一部は測定そのものの対象外
「良いエッセイをフラグされた」という枠組みが間違っている理由がもう一つあります。それは、そのパーセンテージが何のパーセンテージなのかに関わります。あなたの文書の一部だけがスコアの対象となります。
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission."(この対象テキストは散文の文のみを含みます。つまり、標準的な文法構造で書かれたテキストのブロックのみを分析し、リスト、箇条書き(短い非文構造)、その他の非文構造など、他の種類の文章は含みません。このパーセンテージは、必ずしも投稿全体のパーセンテージではありません。)
2023 年 8 月に発表された 2 つの変更が、その境界をさらに動かしました。一つは、表内の長文散文が処理対象となったこと。もう一つは、参考文献内で AI 文章がハイライトされることがあったバグが修正され、参考文献が処理対象から除外されたことです。これらのリリースノートの両方は同じ結び方で、いずれの変更も適用される前に、既存の論文を再提出するよう伝えています。
したがって、2 晩かけて整えた参考文献や、短文の箇条書きで書かれた含入基準は、スコアの対象外です。表は条件付きです。その中の長文散文は処理対象となり得ますが、数値セル、断片、その他の非文の表内容は、対象散文の外に残る可能性があります。したがって、そのパーセンテージは投稿全体を描写しているとは限りません。これもまた、目の前にある色付きのテキスト量と一致しないことがある機械的な理由です。これを一行ずつ分解するのは、Turnitin AI ライティングレポートの読み方で扱っています。
これをどう扱うか
そのほとんどは、あなたがどう書くかについてではなく、その数字がどれだけの重みを持てるかについてです。
- 能力を低く見せることは、まず除外すべき一手です。上記のすべてがこれに反対しており、取引は典型的な意味で不均衡です。評価者の点数は確実に影響しますが、スコアへの影響は誰もが測定したことがなく、通常は監視を許されないものです。
- どのパーセンテージかではなく、どの箇所かを問うてください。ハイライトは分類器がどこに下されたかを伝えます。パーセンテージは、対象テキストのうちどれだけがそれに下されたかを伝え、それはあなたのエッセイ全体の割合とは異なる量です。
- 短い文書は粗く測定されると考えてください。提供元の言葉によれば、「単語が数百語しかない短い文書では、予測は主に『すべてか無か』になります。重なる機会 없이 1 つのセグメントで予測するためです」。その次の文が重要です。「これは、AI 生成コンテンツとオリジナルコンテンツが混在するテキストが、AI 生成全体としてフラグされる可能性があることを意味します」。対象テキストが 300 語未満の場合、ファイル要件には読むことのできるレポートは全く存在しないと記載されています。
- あなたの文章がジャンルの要件によって規範的になっている場合、提供元のアドバイスが誰に向けられているかを確認してください。その文はあなたではなく、パーセンテージを読む人に向けられています。論文そのものを変える必要があると結論付ける前に、知っておくべきことです。
- 結果の数値についてのいかなる約束も、私たちのものを含めて、疑ってください。Turnitin 自身の立場は、個々の予測は「単純な機能ごとの用語で常に説明可能とは限らない」というものです。会社の外側の誰も、編集をスコアの動きにマッピングすることはできません。
リライトはどこに適合し、どこに適合しないか
これらはどれも、リライトを正当化する議論ではありません。その作業があなた自身のものあり、それを語る準備がある場合、変えるべき対象は論文ではありません。
リライトが自身の存在意義を得るのは、ある特定の時点です。レポートが存在し、特定の箇所がマークされ、それらの箇所がいずれにせよ改訂される場合です。これが HumanPen が作られている形です。Turnitin または iThenticate からの AI レポート付きのファイルを渡せば、マークされた箇所が範囲となり、その外側はあなたの書いた言葉を保ちます。私たちのページには粒度のルールが明記されています。「段落がエンジンがリライトする最小単位です。選択範囲が段落の一部のみをカバーしている場合、段落全体に拡張され、確認のためにそのように表示されます。」課金は実際にリライトされた単語数で行われるため、範囲が限定されたジョブは、ファイルの重さではなく、範囲の分のコストで済みます。
新しいレポートが依然として箇所をフラグした場合、対象結果は AI をさらに下げることを無料で続けられます。しかし、次のレポートの数字を誰にも渡すことはできません。上記のすべてを踏まえると、ある数値を提示するツールは、持っていない数字を提示していることになります。
よくある質問
出来の良い散文はよりフラグされやすいでしょうか?それは公開資料が裏付けるよりも大きな主張であり、私たちはこれを主張していません。文書化されているのは、Turnitin が偽陽性が含む可能性があると述べる 3 種類のテキストの一覧であり、そのどれもが質の判断ではなく、加えて 2023 年の 1 サンプルから英語の語彙範囲が小さい書き手への測定された影響です。広義の版は、発見というより、出回っている主張として扱ってください。
高度な語彙を使うと AI スコアは上がりますか?提供元が公開しているものはこれについて何も語っていません。「vocabulary」と「word choice」は、私たちが検索した 3 つのヘルプページからどちらも不在でした。2023 年の管理実験の一つは、語彙の選択を直接動かし、俗説とは逆に、それを押しのける方向に働きました。研究者はすでにフラグされたエッセイの言葉遣いを豊かにし、フラグは低下しました。これは、その実験において語彙の選択が不活性ではなかったことを裏付けています。しかし、あなたの文書については何も裏付けていません。
私の文章が自分自身を繰り返すのは、用語が一貫している必要があるからです。それは通常のケースであり、提供元自身の偽陽性一覧の 1 つの項目に該当します。その状況でのアドバイスは、レポートを読んでいる人に向けられています。「パーセンテージを見る際に、テキストの性質を考慮に入れてください」。
意図的に文長のバリエーションを追加すべきでしょうか?書式設定の練習としてはいけません。バリエーションがすでに意味を担っている場合、それを回復することは通常の改訂です。規範性が均一性を求めるセクションでそれを人工的に作り出すことは、あなたの分野が求めた文章を、求めていない文章に置き換えることであり、その見返りは、外側から誰も測定できない効果です。
提出前に自分でスコアを確認できますか?通常はできません。Turnitin の立場では、AI 文章指標とレポートは講師および管理者用のものであり、学生に届くのは、講師がレポートをダウンロードして渡した場合に限られます。数字の動きを監視できると仮定するアドバイスは、ほとんどの学生が持っていないアクセス権を仮定しています。