パラフレーズすると Turnitin の AI スコアが上がるのはなぜ?

類似度を下げることと AI 検出を下げることは、逆の方向に働きます。書き換えツールがマッチを避けるために選ぶ単語は、AI 生成器も使う高頻度の単語で、検出器まさにその分布を読み取っています。

HumanPen チーム

· 10 分

結論から言うと

パラフレーズツールは類似度スコアを下げるために作られており、そのためにあなたの言葉を同じ意味の別の言葉に置き換えます。置き換えられる単語は高頻度の表現、つまり AI 生成器もデフォルトで使うような言葉です。Turnitin の検出器は単語の確率パターンを読み取り、書き換えられたテキストがその分布に近づくと、AI パーセンテージが上がります。これはバグではありません。別のターゲットに対して、設計通りの仕組みが働いているだけです。

Turnitin の言葉によれば、類似度スコアと AI パーセンテージは「完全に独立しており、互いに影響しません(completely independent and do not influence each other)」。これらは別のもので、別のプロセスで計算されます。片方を変えても、もう片方に良い結果が出るとは限りません。逆方向に働く場合、一つ目の問題を解決するために使ったパラフレーズツールが、二つ目の問題を引き起こすことになります。

2 つのスコア、2 つのターゲット、1 つのドキュメント

Turnitin の Detection FAQs にはこうあります:「類似度スコアと AI 作成検出率は完全に独立しており、互いに影響しません(The Similarity score and the AI writing detection percentage are completely independent and do not influence each other)」。類似度スコアは、テキストのどこまでがデータベース上の他のテキストと一致しているかを示します。AI パーセンテージは、テキストのどこまでが機械によって書かれたように見えるかを示します。これらは同じ属性の 2 つの視点ではありません。

パラフレーズツールは最初のターゲットのために設計されています。データベース内の何かと一致する文章を受け取り、一致しなくなるように書き換えます。これで類似度スコアが下がります。ただし、ツールは元の単語の選択を別の表現に置き換えることでこれを実現し、それらの代替表現は各意味に対して最も一般的で最も確率の高い表現から選ばれます。元の表現は個性的だったかもしれません。置き換えられた表現は、設計上、その正反対です。

一方、AI パーセンテージは完全に別の仕組みから計算されます。その計算方法については AI 検出器が測定するもの で詳しく説明しましたが、簡潔に言えば、検出器はテキストを重複するセグメントに分割し、それぞれに確率スコアを割り当て、それらを文書レベルの数値に集約します。パラフレーズツールが選んだ言葉が、今やスコアリングの対象となります。それらの言葉が高確率ゾーンに集まっている場合、数値は上がります。

検出器が実際に読み取っているもの

多くの人が Turnitin の検出器は「perplexity」と「burstiness」を測定すると言います。それは正確ではありません。Turnitin の FAQ にはこうあります:「当社のモデルは、『burstiness』、『perplexity』、または公表された議論で時々言及される他の個々の指標などの特定の信号を評価するように明示的にプログラムされているわけではありません(Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions)」。同じ段落の次の文にはこうあります:「代わりに、それはトレーニングデータから統計的パターンを学習します(Instead, it learns statistical patterns from our training data)」。

しかし、同じ FAQ ページの別のセクションではこうも述べています:「当社の分類器は単語の確率の違いを検出するようにトレーニングされており、人間の著者特有の単語確率配列の検出に優れています(Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers)」。つまり、モデルは perplexity スコアを計算してそう呼んでいるのではありません。自社の言葉で言えば、単語の確率を読み取っているのです。この違いは重要です。というのも、最初の引用を単独で見ると、検出器が単語の確率を完全に無視しているように聞こえるからです。そうではありません。検出ツールが一致しない理由 では、異なるツールが同じテキストに対してどのように異なる数値を出すかについて説明しており、単語確率モデリングがその中心にあります。

これがパラフレーズにどのように関係するかは明確です。元の文章には、あなたの語彙、あなたの習慣、それを書く前にたまたま読んだものによって形作られた単語確率プロファイルがあります。パラフレーズされたバージョンには、ツールが選択したものによって形作られたプロファイルがあり、ツールは分布の端ではなく中心から選択します。単語確率でトレーニングされた検出器は、書き換えられた文章を機械生成出力のモデルにより近いものと見なします。AI を使ったからではなく、パラフレーズされた文章の統計的足跡がそれに似ているからです。

Turnitin が偽陽性と呼ぶ正確なプロファイル

ここが居心地の悪いところです。Turnitin の FAQ には偽陽性を生み出しやすいテキストの種類がリストされており、その説明はパラフレーズツールが生成するものの仕様書のように読めます:

「偽陽性(人間が書いたテキストが誤って AI 生成としてフラグが立つこと)には、構造的多様性があまりないコンテンツ、文字通り自分自身を繰り返すテキスト、または新しいアイデアを開発せずにパラフレーズされたテキストが含まれることがあります(Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas)」。

その直後の文が最も重要です:「もし当社のインジケータがそのようなテキストに多量の AI 作成を表示している場合、表示されたパーセンテージを見直す際にこれを考慮に入れることをお勧めします(If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated)」。Turnitin は教員に、この説明に一致するテキストの高い AI スコアを割り引くよう伝えているのです。

パラフレーズツールは、設計上、新しいアイデアを開発しません。既存のアイデアを取り、言い換えるだけです。また、新しい文章の形を導入するのではなく文書全体にスタイルを均一化するため、構造的多様性を減少させる傾向もあります。ツールはテキストをより多様にしようとしているのではなく、一致を減らそうとしています。これら 2 つの目標は一致せず、2 つ目の目標はテキストが偽陽性の影響を受けやすいプロファイルに近づくように押します。

洗練された文章がなぜ検出器を誘発するかについて詳しく調べましたが、そこでの仕組みも同じです。平滑化は統計的信号です。

検出器が傾いている方向

Turnitin は AI テキストを見逃す方が、人間の文章を誤ってフラグする方が良いと述べています。FAQ にはこうあります:「偽陽性の 1% という低い率を維持するために、文書内の一部の AI 作成テキストを見逃す可能性があります。私たちは人間の文章を AI 作成として誤ってハイライトしたくないので、それで構いません(In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written)」。

この傾きは現実のもので、それが完全に人間が書いた文書がフラグされる確率が低い理由です。しかし、人々が想定しているような仕方でパラフレーズされたテキストを保護するわけではありません。1% の偽陽性率は、偽陽性プロファイルに一致しないテキストに適用されます。プロファイルに一致するテキスト、つまり Turnitin 自身が上記の引用で説明している種類のテキストは、1% の数値が測定された対象のテキストではありません。検出器は全般的に注意深く傾いていますが、トリガーを引く特徴はパラフレーズツールが導入する特徴と同じです。

テキストが AI 駆動のツールによってパラフレーズされた場合、別の経路があります。Turnitin は「AI パラフレーザーやバイパッサー(ヒューマナイザーとも呼ばれる)ツールによって修正された AI 生成テキストのインスタンスを特定することもできる(can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection) 」と述べています。これは偽陽性ではありません。これは別の信号に対する真陽性であり、検出器にはそのための名前付きの機能があります。AI で言い換えてもフラグされた では、AI モデル自身が書き換えを行うツールを使った場合に何が起こるかを説明しています。

すべてのパラフレーズツールが同じことをするわけではない

スペルを修正する文法チェッカーと文章を書き換える生成ツールの間には意味のある違いがあります。Turnitin はこの線を明確に引いています。Grammarly について、FAQ はこう述べています:「AI 生成コンテンツを含まない人間が書いた文書について私たちが実施したテストに基づくと、ほとんどの場合、Grammarly(無料版および有料版)および/または他の文法チェックツールによって行われた変更は、当社の検出器によって AI 生成としてフラグされませんでした(Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector)」。キーとなる修飾語は「ほとんどの場合」です。免除は絶対的ではありません。

そして FAQ は続けます:「ただし、これには下書き生成、パラフレーズ、要約、その他の機能を含む Grammarly の生成 AI 機能によって生成されたコンテンツは除外されます。これらの機能を使用して作成されたコンテンツは、当社の検出器によって AI 生成としてフラグされる可能性があります(Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector)」。スペルと句読点の修正は 1 つのカテゴリです。パラフレーズと書き換えは別のカテゴリです。2 つ目のカテゴリが AI スコアが上昇する場所です。

Turnitin はどのパラフレーザーやバイパッサーツールをトレーニングおよびテストしたかのリストを公開していません。FAQ にはこうあります:「ただし、当社のソリューションの整合性と学問的誠実性を維持する効果を守るために、これらのツールの名前を開示することはできません(However, to safeguard the integrity of our solution and its effectiveness in maintaining academic honesty, we're unable to disclose the names of these tools)」。したがって、Turnitin 以外の人々は、どの特定のツールが検出され、どのツールが検出されないかを教えることができず、名前付きツールが検出器を「打ち負かす」という主張は、Turnitin 自身のテストに対して検証できない主張です。私たちはその主張をせず、そう主張する人を信頼することもお勧めしません。

実際に AI パーセンテージを下げるもの

AI パーセンテージは、テキストの単語確率プロファイルが検出器が機械出力に関連付ける分布から遠ざかるときに下がります。これは、語彙、文章構造、およびジェネレーターが自分で選ばなかったアイデアを導入するときに起こります。新しいアイデアを追加しないパラフレーズは逆の効果があります。プロファイルを中央に動かします。

パラフレーズツールをすでに使用して AI スコアが上がった場合、進むべき道は別のパラフレーズパスではありません。別のパスは 1 つの高頻度単語セットを別のセットに置き換えるだけです。プロファイルは動きません。フラグが立った箇所を自分の単語の選択、自分の文章の形、そして理想的には自分の追加分析や例で書き換える必要があります。それが検出器が読み取る確率分布をシフトするものです。

これの実践版は、レポートを目の前にした状態で、Turnitin AI 作成レポートの読み方 にあります。レポートはどのセグメントがフラグされているかを示し、それらがあなたの単語の選択が平均であることをやめ、あなた自身の選択を始める必要があるセグメントです。

境界線はどこにあるか

HumanPen はドキュメントライターであり、ここで関連する設計の選択は、何が書き換えられ、何が書き換えられないかについてです。ドキュメントを AI 作成レポートと一緒にアップロードでき、レポートがフラグした箇所だけが書き換えられます。ドキュメントの残りの部分はあなたが書いたまま残ります。

この問題についてこれが重要である理由は、文書全体のパラフレーズパスが上記の仕組みに関する最悪のシナリオだからです。フラグされていない箇所を含め、すべてを書き換え、それらをすべて高頻度の中心に向かって動かすことによってそれを行います。スコープ限定された書き換えは、検出器がすでにフラグしたセグメントのみに触れ、それらをさらに平滑化するのではなく、それらの単語確率プロファイルをシフトすることを目標としてそれを行います。

請求は実際に書き換えられた単語のみをカウントします。後続のレポートがまだ箇所をフラグしている場合、それらは追加料金なしで再実行できます。次のレポートが何を言うかは誰にも言えないので、私たちはお教えしません。しかし、仕組みは仕組みであり、スコープ限定された書き換えはそれに逆らうのではなく、それとともに働きます。

よくある質問

パラフレーズは常に AI スコアを上げますか? いつもではありませんが、パターンに名前があるほど頻繁です。Turnitin は「新しいアイデアを開発せずにパラフレーズされたテキスト」を偽陽性の影響を受けやすいプロファイルの中にリストしています。そのプロファイルがオンにするのは、どの編集操作が文章を生成したかではなく、新しい分析が追加されたかどうかです。同じ考えの内側に留まるテキストは、検出器が AI 出力に関連付けるようにトレーニングされた単語確率プロファイルを維持します。特定のスコアが上がるかどうかは、元のテキストがどのように見えたかと、ツールがそれを何に置き換えたかによります。

スペルを修正するために Grammarly を使用しました。それは私の AI スコアを上げますか? Turnitin は、ほとんどの場合、Grammarly および他の文法チェックツールによって行われた変更は「当社の検出器によって AI 作成としてフラグされなかった(were not flagged as AI-written by our detector)」と述べています。修飾語「ほとんどの場合」はその文で仕事をしています。パラフレーズ、要約、または下書き生成などの Grammarly の生成機能を使用した場合、FAQ はそのコンテンツが「AI 生成としてフラグされる可能性が高い(will likely be flagged as AI-generated)」と述べています。

類似度スコアが下がるのに AI スコアが上がるのはなぜですか? それらが異なるものを測定するからです。Turnitin は 2 つのスコアが「完全に独立しており、互いに影響しません(completely independent and do not influence each other)」と述べています。パラフレーズは一致するテキストを削除することにより類似度を下げます。置き換えられた単語は高頻度の表現である傾向があり、検出器は AI 生成テキストのものと重複する単語確率パターンを読み取るため、AI スコアを上げる可能性があります。

AI スコアを修正するためにパラフレーズツールをもう一度実行するだけでいいですか? もう一度実行すると、共通の単語の 1 つのセットを別のセットに置き換えます。単語確率プロファイルは有用な方向に動きません。プロファイルをシフトするのは、フラグされた箇所を自分の語彙、自分の文章構造、そして自分の追加のアイデアで書き換えることです。

Turnitin は私が使用したパラフレーズツールを検出しますか? Turnitin は「主要なパラフレーザーおよびバイパッサーツールを検出するようにトレーニングおよびテストされた(trained and tested to detect leading paraphraser and bypasser tools)」と述べていますが、どれかは開示していません。FAQ はリストを共有することは「学生が当社のシステムを回避しやすくする(would make it easier for students to evade our system)」と述べています。Turnitin 以外の人々は、特定のツールがそのリストにあるかどうかを検証できません。