Turnitin は自社の検出器に、英語学習者に対するバイアスがないかどうかを検証しました。その結果には二つの側面があります。
300語を超える提出物について、Turnitin は L2 話者と L1 話者の差は小さく、統計的に有意ではないと報告しています。150語から300語の提出物では、同じ評価で差はより大きく、自らの目標値 1% を有意に上回りました。さらに Turnitin は自らのサンプルについて一つの限界を述べています。大学レベルの文章を書いている人にとって、それは無視できない点です。
HumanPen チーム
· 6 分
手短な答え、その両方の側面
Turnitin はこの問いについて自ら評価を行い、その結果を公表しました。答えには二つの側面があり、向いている方向は逆です。
300語以上の提出物では、英語学習者(L2)と英語母語話者(L1)の擬陽性率(FPR)の差は小さく、統計的に有意ではないことがわかりました。150語から300語の提出物では、同じ評価で差はより大きく、自らの目標値 1% を有意に上回りました。
つまり、その安心できる結果が自分に当てはまるかどうかは、提出したものの長さ次第です。また、Turnitin が自らのサンプルについて述べている限界もあります。大学レベルで書いている人には関係があり、後半に書いています。
何が検証されたのか
Turnitin は二つの変数の組み合わせごとに、最大 2,000 本のテキストを集めました。L2 英語(英語学習者)対 L1 英語(英語母語話者)、そして「短すぎる」(150語から300語)対「十分な長さ」(300語以上)です。これらのデータセットは検出器の学習データには含まれていません。
見出しに載る結果
300語の最小要件を満たす文書について、Turnitin は L2 話者と L1 話者の擬陽性率の差は小さく、統計的に有意ではないと報告しています。
「For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target.」(私たちが定める最小語数 300語の要件を満たす文書では、L2 英語話者(ELL 話者)と L1 英語話者(英語母語話者)の擬陽性率(FPR)の差は小さく、統計的に有意でもありません。これは、私たちの検出器がこの二つの話者集団の間にバイアスを持たないことを示しています。さらに、各集団の FPR は全体の目標 0.01(1%)をわずかに上回っていますが、どちらの集団の FPR もこの目標から有意に異なるほどではありません。)
「Not statistically significant」(統計的に有意ではない)とは、見つかった差が単なる偶然かもしれないという意味です。差がゼロという意味ではありませんし、バイアスが存在しないという意味でもありません。さらに両集団の擬陽性率は 1% の目標を上回っていました。ただ、検定が意味のあるものとみなすほどの差ではありませんでした。「Slightly higher」(わずかに高い)は「at or below.」(目標値かそれ以下)ではありません。
見出しに載らない結果
150語から300語の文書では、同じ評価が逆向きの結果を出しました。L2 話者と L1 話者の差はより大きく、擬陽性率は 1% の目標を有意に上回りました。
「Conversely, for documents that are (逆に、too short、つまり短すぎるとされる文書については、)"too short," we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum.」(この二つの話者集団の間には FPR により大きな差があり、それは私たちの目標である 0.01 FPR を有意に上回っています。このことは、AI 文章検出器が AI 生成コンテンツを正しく見分け、擬陽性を最小限に抑えるためにはより長いサンプルが必要だという、私たちの以前の発見を改めて裏付けるものです。)
同じ検出器を使った同じ研究が、長いテキストには一つの結果を、短いテキストには別の結果を出しました。ブログのタイトルに載っているのは前者です。後者は本文にあります。
サンプルの中身は実際には何だったのか
Turnitin は次のように書いています。
「Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation.」(L2 英語の文書のほとんどは、説得や説明を目的とした短いライティング課題で、Automated Scoring and Assessment Prize(ASAP)の中等教育レベルのエッセイコーパスに最も近いものです。大学レベルの全文書を L2 話者と L1 話者の両方から集めた、比較可能な公開コレクションは、この評価には存在しませんでした。)
この評価に使われた L2 の文章は、そのほとんどが中等教育レベルのエッセイです。大学のレポート、文献レビュー、実験レポート、学位論文の章を書いているのであれば、それは検証された対象ではありません。Turnitin は、この比較に使える大学レベルの L2・L1 文章の公開コレクションが見つからなかったと述べています。「not statistically significant」(統計的に有意ではない)という結果が当てはまるのは、中等教育レベルの短い説得的・説明的なエッセイです。実際に提出する文書にもそれが当てはまるかどうかは、この評価では答えられない問いです。
300語という線
Turnitin は 300語という最小要件を、この研究に直接結びつけています。800,000 件の文書を評価し、短い提出物が擬陽性率を押し上げることを確認したうえで、300語を要件にしました。
「Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission.」(このブログの前半でも触れた 800,000 件の文書の評価から、短い提出物(300語未満)では擬陽性率がやや高く、放置できない水準になることがわかりました。そのような短いサンプルには、AI による文章特有の分布の違いを見分けるだけのシグナルや手がかりが十分に含まれていないのかもしれません。擬陽性率を 1% 未満に保つため、私たちは AI 文章検出の機能が提出物を処理する際の最小提出長を 300語へと速やかに引き上げました。)
この最小要件があるのは、短いテキストが問題を起こしたからです。安心できる結果が当てはまるのは、その要件を超える場合だけです。その下限を下回る範囲では、同じ評価が、知っておくべき差を見つけています。
Liang の研究についてはどうか
Liang の研究に関する見出しを目にしたことがあるかもしれません。Turnitin はそれに直接答えています。
「Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short.」(Liang の主張は、わずか 91 編の TOEFL(Test of English as a Foreign Language)練習エッセイという小さな作品集に基づいています。そのすべてが 150語未満です。Turnitin の AI 文章検出はこの評価に含まれていませんでした。おそらく、これほど短い文書については私たちが判定を出さないことも、その理由の一つでしょう。)
これをどう使うか
提出物が 300語を超えているなら、Turnitin 自身のデータによれば、L2 と L1 の擬陽性率の差は小さく、統計的に有意ではありません。だからといって指摘されない保証にはなりません。意味するところは、この評価が、L2 話者が体系的に不利だという強い証拠を見つけられなかったということです。少なくとも、彼らが手にしていたサンプルでは。
実際に使えるのは、次の三つです。
提出前に語数を確認する。 300語未満のセクションが指摘された場合、検出器自身の評価が、短いテキストほど L2 話者と L1 話者の差が広がり、擬陽性率も全体的に高くなると述べています。短い抜き書きではなく文書全体で判定を実行してもらうよう、担当教員に頼めます。
何がどの基準で指摘されたのかを尋ねる。 Turnitin が使われていたなら、300語の最小要件と「slightly higher than 1%」(1% をわずかに上回る)という記述は、その指摘を審査する人に具体的に持ち出せる論点です。
下書き、メモ、参考文献を残しておく。 指摘されたとき、自分の L2 英語が関係したと思うなら、話を解決してくれるのは推敲の履歴と資料を示すことです。担当教員と統計的有意性を議論しても、おそらく解決しません。
続きを読む