ポスター発表とAI検出:なぜスコアが信頼できなくなるのか
ポスター発表は箇条書き、短いラベル、表のエントリで構築される。TurnitinのFAQは、モデルが箇条書きや非散文コンテンツのAIを確実に検出しないと述べている。あるヘルプ記事は表を信頼できないリストに追加している。その結果、パーセンテージとハイライトされる内容との間に大きなギャップが生じる。以下に、ポスター形式の文書でこのメカニズムがどのように機能するか、そしてなぜスコアが誤解を招く可能性があるかを説明する。
HumanPen チーム
· 5 分
短い答え
ポスターはエッセイや学術論文のように書かれない。箇条書き、短いフレーズ、視覚要素に依存している。Turnitinの文書は、モデルが適格な散文文のみを分析し、非散文形式のAIを確実に検出しないと述べている。ポスターが文書として提出される場合、パーセンテージはわずかな散文を反映する一方で、ハイライトはほとんど何も表示しない可能性がある。両者の間の乖離は既知の動作であり、バグではない。
箇条書きは適格なテキストではない
FAQは何が適格なテキストとしてカウントされるかについて明確である:
「This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.(この適格テキストには散文文のみが含まれ、標準的な文法的文で書かれたテキストブロックのみを分析し、リスト、箇条書き(短い非文構造)、その他の非文構造などの他の種類の文章を含めないことを意味する。)」
FAQはまた次のように述べている:
「The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures).(モデルは非散文またはコードの形のAI生成テキストを確実には検出せず、箇条書き(短い非文構造)のような短い形式・非従来型の文章も検出しない。)」
次の文が結果を説明している:
「This means that a document containing several different writing types would result in a disparity between the percentage and the highlights.(これは、複数の異なる種類の文章を含む文書が、パーセンテージとハイライトの間の乖離をもたらすことを意味する。)」
ポスターの場合、この乖離は極端である。ポスター上のテキストの大部分は箇条書きか短いラベルである。ポスターを文書として提出して高いAIパーセンテージを得た場合、そのパーセンテージはわずか数個の適格な散文段落に基づいている可能性があり、ポスターの大部分を占める箇条書きは検出器にとって見えないままである。
あるヘルプ記事が表をリストに追加する
Turnitin のヘルプ記事 Using the AI Writing Report は、モデルの限界が FAQ の一覧より広いと述べています。
「The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies.(モデルは非散文(詩、台本、コードなど)の形のAI生成テキストを確実には検出せず、箇条書き、表、注釈付き書誌のような短い形式・非従来型の文章も検出しない。)」
その記事の次の文:
「This means that a document containing several different writing types would result in a disparity between the percentage and the highlights.(これは、複数の異なる種類の文章を含む文書が、パーセンテージとハイライトの間の乖離をもたらすことを意味する。)」
ポスターは結果、比較、タイムラインに頻繁に表を使用する。表が確実に検出されないものとしてリストされている場合、ポスターのコンテンツのかなりの部分がモデルの信頼できるカバレッジの外に落ちる。表示されるパーセンテージは、表と箇条書きリストの間に挟まれたわずかな散文段落から計算される可能性がある。
2023年に表で何が起きたか
2023年8月からの重要なアップデートがある。リリースノートは次のように述べている:
「We are now able to process long-form prose text in tables.(表内の長文形式の散文テキストを処理できるようになった。)」
次の文は次の通りである:
「Resubmit to reprocess existing submissions that contain tables.(表を含む既存の提出物を再処理するために再提出せよ。)」
これは、長文形式の散文文(表のセル内の完全な文法的文)を含む表が処理されるようになったことを意味する。表内の短いラベル、数字、データエントリは依然として非散文であり、モデルの分析の外に残る。ポスターにとって、これは部分的な改善である。各セルに完全な文を含む結果表は分析されるようになる。裸の数字と短いラベルを含む表はそうならない。
検出メカニズムとポスターコンテンツ
FAQは提出物がどのように処理されるかを説明している:
「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score.(論文がTurnitinに提出されると、提出物から文が抽出され、予測分析のために重なり合うセクションに分割される。各セグメントはAI検出モデルによって分類され、テキストが人間またはAI生成である確率を示す0から1までの値が与えられる。これらのセグメント内の各適格文はセグメントのスコアを継承する。)」
適格な散文文のみが抽出される。その後、集約が文書レベルのスコアを生成する:
「These sentence scores are further aggregated and used to compute the overall document AI writing score.(これらの文スコアはさらに集約され、文書全体のAI執筆スコアの計算に使用される。)」
ポスターの場合、抽出ステップは非常に少数の文しか取得しない可能性がある。ポスター上の数少ない散文段落は、要旨、短い導入、結論的なコメントである可能性がある。それ以外はすべて箇条書きと表のエントリである。スコアはその少ない散文のセットから計算され、狭いサンプルを反映していることを意味する。Turnitin AI執筆レポートの読み方は、数字とページの間の同じギャップから出発している。
短い文書と全か無かの問題
文書として提出されるポスターは短い。FAQはこれについて警告している:
「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.(数百語しかない短い文書では、重なる機会のない単一セグメントで予測しているため、予測は主に「全か無か」になる。)」
次の文:
「This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.(これは、AI生成コンテンツと元のコンテンツが混在したテキストの一部が、完全にAI生成としてフラグが立つ可能性があることを意味する。)」
適格な散文がわずか300または400語のポスターは、まさにこの範囲に該当する。これほど少ないセグメントでは、平均化効果はない。高いスコアの単一セグメントが文書全体をAI生成としてラベル付けする可能性がある。パーセンテージとハイライトの乖離に関するFAQの次の文は、ここで非常に目立つようになる。高いパーセンテージを見ても、ポスター自体にはほとんどハイライトされたテキストがない可能性があり、これはAI執筆スコアが欠落している、一貫していない、またはダウンロードできない理由のケースの一つである。
誤検知とポスターの反復的な言語
FAQは誤検知を引き起こす傾向があるものを説明している:
「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.(誤検知(人間が書いたテキストを誤ってAI生成としてフラグを立てること)には、構造的変化の少ないコンテンツ、文字通り自分自身を繰り返すテキスト、新しいアイデアを発展させずに言い換えられたテキストが含まれることがある。)」
ポスターの散文は反復的になる傾向がある。同じ主要な発見が要旨、結果セクション、結論に現れる。スペースが限られているため、言語は圧縮され均一であり、均一性はAI検出器が測定するものが分類器が捉えていると述べていることに近い。FAQは続く:
「If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.(インジケーターがそのようなテキストにより多くのAI執筆を示す場合、示されたパーセンテージを見る際にそれを考慮に入れることをお勧めする。)」
ポスターにとって、この助言は二重に関連する。散文は短く、反復的で、構造的に均一である。3つの要因すべてが誤解を招くスコアのリスクを複合的に高める。
あなたにとってこれが何を意味するか
ポスター発表がTurnitinのAIスコアを受け取った場合、以下の点に留意されたい:
- 箇条書きと短いラベルは適格なテキストではない。スコアはそれらを反映していない。
- Turnitinのあるヘルプ記事は、表も確実に検出されないと述べているが、2023年8月以降、表内の長文形式の散文は処理されている。
- パーセンテージとハイライトの乖離は、複合形式の文書にとって予想される動作である。
- 短い適格な散文は、セグメントの重なりが最小限の「全か無か」予測を引き起こす。
- ポスターの散文は反復的で均一であり、FAQが説明する誤検知のプロファイルに一致している。
- ハイライトが少ない高いパーセンテージは、決定的な判定としてではなく、注意して扱うべきである。
フラグが立った箇所に対処したい場合、Turnitinレポートをインポートして、それらに取り組む。適格な箇所は無料で再実行できる。
続きを読む