AI検出器に必要な最小語数——五社が公表していること

書き直したばかりの段落一つを無料のチェッカーに貼り付ける。これほど自然な行動はないが、それは同時に、ここに挙げる各社が自社のドキュメントで警告している状況そのものでもある。五社が最小の長さを公表している。うち一社は二つの実験を公表しており、自社のスタッフが短い文章を手で書いたところ、ツールはそれをAIと判定した。

HumanPen チーム

· 10 分

AI検出器の数字が意味を持つまでに、どれだけのテキストが必要か

ここに挙げた検出器はどれも下限を公表しており、段落一つはその多くを下回る。 以下は各社自身の数値で、各社のドキュメントから取得し、2026年9月18日に確認した:

ツール公表している内容
Copyleaks — 厳格な下限「For the AI Detector to get an accurate reading, it requires a minimum of 350 characters」(AI Detectorが正確な読み取りを行うには、最低350文字が必要)——語ではなく文字。
Copyleaks — 推奨サンプル量「we suggest testing text containing an average of 350 words」(平均350語を含むテキストでの検査を推奨する)。
Winston AI「Minimum 300 characters. Texts under 600 characters may produce unreliable results and should be avoided.」(最小300文字。600文字未満のテキストは信頼できない結果になるおそれがあり、避けるべきである。)
Originality.aiウェブサイトでは100語が下限。APIには下限がないが、「accuracy is decreased for texts below 100 words」(100語未満のテキストでは精度が低下する)としている。
ZeroGPT「At least 150–200 words; longer text (500–1,000+) improves stability.」(少なくとも150〜200語。より長いテキスト(500〜1,000語以上)は安定性が増す。)
Turnitin散文が300語未満では、AIスコアは一切出ない

このうち二本は文字数で、残りは語数で書かれている。だから混同しやすい。換算は簡単だ。英語の散文では、語は後ろの空白を含めておよそ6文字——本サイトが公開している5,357の段落における中央値は6.0だ。換算すると、表の下限はすべて語数になる。Winstonの300文字という下限は約50語、「600文字未満は避けよ」の線は約100語。Copyleaksの350文字という下限は約58語で、同社が推奨するサンプルは350語。Originalityは100語。ZeroGPTは少なくとも150〜200語を求め、500〜1,000語以上ならさらに安定すると言う。Turnitinは300語だ。自分の文章をこれらの数に当ててみてほしい。尺度として、同じ5,357の段落を同じ下限に当てて数えた。Winstonの300文字に届くのは54%、Copyleaksの350文字に届くのは39%、Originalityの100語に届くのは6%、ZeroGPTの150語に届くのは0.5%、そしてCopyleaksが推奨する350語のサンプルに届くものは一つもなかった。中央値の段落は51語・312文字で、七本の下限のうちWinstonの300文字だけを超え、残る六本には届かない。

混同されがちな二つのことを分けて考える価値がある。下限とは、提供元が自分の数字を支えるのをやめる地点であって、それが常に「それを下回れば何も返ってこない」地点というわけではない。こうしたツールには、それでもパーセンテージを返すものがある。Originality.aiは自社APIの検査について「have no word count minimum」(語数の下限はない)と述べ、そのうえで100語未満では精度が下がると説明している。単に拒否するものもあり、Turnitinはそちらだ。つまり、画面に数字が出たとしても、それだけではツールがそのサンプルを十分に大きいと見なした証拠にはならない。

書き直したばかりの段落が最も難しいケースである理由

指摘された箇所を直し、その箇所をチェッカーに貼り付け、数字を読んで終わりかどうかを判断する。Originality.aiのヘルプセンターは、まさにこの手順を誤検知の原因リストの上位に置いている。

You are more likely to receive false positives by only scanning part of the entire piece of content: a single paragraph, the intro, the conclusion, half of the paper... etc.(コンテンツ全体のうち一部だけをスキャンすると、誤検知を受け取る可能性が高くなる。段落一つ、導入、結論、論文の半分……など。)

その次の文が、代わりに何をすべきかを述べている。「We can fix a lot of false positives by scanning the entire piece of content instead of a snippet. This just gives our tool more context and more content to go off of.」(断片ではなくコンテンツ全体をスキャンすれば、多くの誤検知を解消できる。それによって私たちのツールは、より多くの文脈とより多くの中身を手がかりにできるようになる。)

同じページには、提供元が自社を相手に行った二つの実験が載っている。助言よりも珍しく、そして役に立つ。

  • ヘルプ記事の執筆者自身が手で書いた50語のブログ導入部が、79% AIとして返ってきた。
  • 同じく手で書かれた107語の結論が、69% AIとして返ってきた。ページの説明は、結論は短いだけでなく定型的でもあるというものだ。「You summarize everything before, give the reader more options and places to click, and finish up with any final calls to action.」(それまでをすべてまとめ、読者により多くの選択肢とクリック先を与え、最後の行動喚起で締めくくる。)

どちらの数字も、人間が書いたテキストから出たものだ。どちらもあなたの文章についての証拠ではない。短く、構造が予測できる抜粋がスコアに何をもたらすかについての証拠だ。そして論文の導入と結論は、どちらも生来短く、構造が予測できるようにできている。

短い抜粋は、テキストの書式が持つ重みも変える。Copyleaksの制限に関するページは、自社の検出器が数千のパターンを読むと述べ、「not just words or formatting」(語や書式だけではない)と続け、さらに短いサンプルで効いてくる部分を付け加えている。「Numbering, bullets, and outline-style headers are only one small part of the overall signal, but in very short texts they can have a larger relative impact to overall AI detection scores.」(番号、箇条書き、アウトライン形式の見出しは全体のシグナルのごく一部にすぎないが、非常に短いテキストでは、AI検出スコア全体に対する相対的な影響がより大きくなり得る。)三つの番号付きステップを持つ手法の段落は、まさにその形だ。

書き直した段落が最悪のサンプルである理由はもう一つある。長さとは無関係だ。それはあなたの文書の中で、ちょうど最も編集が集中した部分だからだ。ツールの使用がスコアに何をもたらすかについて、Originalityのページは率直だ。「if a tool interacted with your content in any way, it will raise the AI score」(何らかのツールがあなたのコンテンツに少しでも関わったなら、AIスコアは上がる)とし、チャットボットと並んで文法チェッカーを名指ししている。この方針をどう評価するにせよ、それは次のことを意味する。あなたが手を入れてきた段落は、編集の痕跡を最も多く帯びた段落であり、あなたはその段落だけで判断するようツールに求めているのだ。

文単位の数字は、文書全体の数字より弱い

今や大半の検出器が文ごとに色を付けるため、レポートを文単位で読みたくなる。この小さな読みが全体の読みより軽いと、二社がはっきり述べている。

Winston AIのAPIドキュメントは、返す文ごとのスコアの配列を説明する中でこう付け加えている。「Please note that assessments on smaller samples are less accurate than the general score.」(より小さなサンプルに対する判定は、全体スコアより精度が低いことにご注意ください。)

GPTZeroの文ハイライトに関する説明はさらに踏み込んでおり、私たちが繰り返し受ける質問——ハイライトされた文を直したのにスコアが動かなかったのはなぜか——に答えている。

Some sentences in an otherwise AI or human document might not show up as highlighted. They may still have an effect on your score, but they aren't more likely than other parts of your document.(全体としてAI寄り、あるいは人間寄りの文書の中には、ハイライトされない文もある。それらもスコアに影響する可能性はあるが、文書の他の部分より可能性が高いというわけではない。)

そして、理由を添えたうえでこう続く。「You may find that adjusting an entire document changes your score more than just adjusting the sentences. This is because our detector holistically analyzes the document, and its prediction can depend on a pattern that affects the bulk of the text.」(文だけを調整するより、文書全体を調整するほうがスコアが大きく変わる場合がある。私たちの検出器は文書を全体として分析しており、その判定はテキストの大部分に影響するパターンに依存することがあるためだ。)

つまり提供元自身が、ハイライトはその数字を生んだ要因の完全な地図ではないと述べているわけだ。AI検出器が実際に何を測っているのかでは、これらのスコアがどう算出されるか、そしてよく知られた説明がなぜ古くなっているかを扱っている。ここでの実用的な論点はもっと狭い。ハイライトされた文を、対応すべき項目のすべてだと考えるなら、提供元自身の説明によれば、あなたは部分的な地図をもとに作業していることになる。

同じテキスト、同じツール、違う答え

読みを動かすのは長さだけではない。Copyleaksは機関が三つの感度設定から一つを選べるようにしており、それぞれが自社のエラー率に何をもたらすかを公表している。

設定Copyleaks自身の説明偽陽性偽陰性
Extra Safe「Designed to minimize false positives by using additional AI detection based filters.」(AI検出に基づく追加フィルタを用いて、偽陽性を最小限に抑えるよう設計されている。)0.010%0.5765%
Balanced(デフォルト)「Ideal for detecting AI content while minimizing false positives.」(偽陽性を抑えながらAIコンテンツを検出するのに最適。)0.0295%0.174%
Extra Sensitive「Our most sensitive model, designed to flag AI text that was put through a 'humanizer' or text spinner.」('humanizer'やテキストスピナーを通したAIテキストを検出するために設計された、当社で最も感度の高いモデル。)0.1973%0.063%

最初の行と最後の行を並べて読んでほしい。最も保守的な設定から最も感度の高い設定へ移ると、公表されている偽陽性率は約二十倍になる。しかもそれは、他人の画面にあるスイッチだ。どの位置にあるかはあなたには見えないし、渡されたレポートのどこにも書かれていない。

だから、自分の検査結果と学校の検査結果が食い違うとき、「どちらかが壊れている」という結論に飛びつく前に、少なくとも三つのありふれた説明がある。ツールが違う、同じツールでも設定が違う、テキストの量が違う、の三つだ。二つのAI検出器が異なるスコアを出す理由で残りを扱っている。

効力を持つのは、ファイル全体に対する読み

自宅で何を回そうと、結果を左右する数字は、あなたの機関のツールが、あなたが提出するファイルに対して、そのツールの設定で出すものだ。散文が300語未満の提出物に対して、TurnitinはAIスコアを一切出さない。そしてその線のすぐ上の文書については、自らの予測を「ほぼ全か無か」に近いと表現している——それが短い課題に何をもたらすかは、それ自体が別のテーマだ。

Turnitinの新しいClarity課題も、同じ趣旨で動作範囲を公表している。「For Turnitin Clarity to work optimally, we recommend a minimum word count of 300 words and a maximum of approximately 2,500 words」(Turnitin Clarityを最適に機能させるため、最小300語、最大およそ2,500語を推奨する)としたうえで、AI執筆検出が有効な場合は「submissions must be between 300 and 30,000 words.」(提出物は300語から30,000語の間でなければならない)としている。

そもそも自分の検査を実行できるかどうかは、機関が何を有効にしているか、そしてあなたがどの画面に到達できるかによって決まる。これは別の問いで、それ自体に答えがある。提出前に自分の作業を確認する方法。

では、何をすべきか

  1. 段落ではなく文書全体を検査する。 これは各社自身の助言のすべてに合致する唯一の変更だ。新しいツールも、新しいアカウントも、新しい設定も要らない。同じ検査をより多くのテキストに対して行うだけだ。長さで課金するツールでは確かに費用が増える。WinstonのAPIドキュメントには「Each word that is processed by the API consumes one credit」(APIが処理する各語が一つのクレジットを消費する)とある——それでも、彼ら自身のページが取るよう促している読みはこれだ。
  2. 同じ条件のもの同士を比べる。 前後の比較が意味を持つのは、ツール・設定・テキスト量の三つが両側で同じ場合だけだ。二つの読みの間でサンプルの大きさを変えれば、それだけで読みは変わる。
  3. テキストに触れていなくても数字は動くと想定しておく。 モデルはバージョン更新される。WinstonのAPIドキュメントには、2.0から4.18まで二十二の選択可能なバージョンが並んでおり、既定値は最新のものだ。三週間前のスコアと今日のスコアは、同じモデルから出たものではないかもしれない。
  4. 自分の検査の数字を、どちらの方向でも判決とみなさない。 自宅で低く出ても、それはお墨付きではない。学校のツールは別のツールだからだ。60語の抜粋で高く出たとしても、それも所見ではない。60語は上の七本の下限のうち一本だけを超え、残りは超えない。
  5. 実際に受け取ったレポートを手元に残す。 すでに指摘を受けているなら、効力を持つのは機関が作成した文書であって、あなたが後から生成した読みではない。書き直したあとに再検査するでは、その比較に何が言えて何が言えないかを扱っている。

よくある質問

検出器が信頼できるようになる語数はあるのか。 ここに挙げた各社で、自社の出力が確実になる地点があると主張しているところはない。彼らが公表しているのは、それを下回れば信頼できないと自分たちが言う下限と、長いほど安定するという方向性だ。Copyleaksの言い方は「the accuracy of our detection increases as the text length increases」(テキストが長くなるほど、当社の検出精度は上がる)。ZeroGPTの言い方は、より長いテキストが「improves stability」(安定性を高める)というものだ。

150語の段落が80%と返ってきた。これは80%がAIという意味か。 違う。この混同は、スコアの命名の仕方自体に組み込まれているので、はっきりさせておく価値がある。Originality.aiのヘルプセンターは率直に述べている。「an AI score of 90% doesn't mean that AI produced 90% of the content. It means that our tool is 90% confident that AI was used in some part to produce the content」(AIスコア90%は、AIがコンテンツの90%を作ったという意味ではない。コンテンツのある部分を作るのにAIが使われたと、当社のツールが90%の確信を持っているという意味だ)。確信度の数字と、文書に占める割合の数字は、画面上は見分けがつかないが意味は違う。Turnitinのパーセンテージはさらに第三の型で、分析対象テキストに占める割合だ。

いくつかの段落をまとめて下限を超えればよいのか。 ZeroGPTはまさにそれを勧めている。「consider merging sections before checking.」(検査前にセクションを統合することを検討してください。)それで長さの閾値は超えられるが、その読みが記述するのは統合されたブロックであって、あなたが心配していた段落ではない。問いが特定の箇所についてのものなら、テキストをどう並べてもきれいな答えは出ない——これは心地よい答えではなく、正直な答えだ。

これらの下限は、学校のTurnitinレポートにも当てはまるのか。 上の下限はそれぞれの提供元の検出器のものだ。TurnitinにはTurnitinの下限がある。散文300語未満ではスコアが出ず、パーセンテージの対象になるのは散文の文だけだ。箇条書き、表、ブレットは測定対象から外れる。だからこそ、ハイライトと数字がちぐはぐに見えることがある。

出典

続きを読む