会議論文とTurnitinのAI検出: 知っておくべきこと

会議論文は密度が高く、短く、均一な学術的文体で書かれる。ページ制限により著者は論証を圧縮せざるを得ず、それは人間の執筆を区別するのに役立つ構造的変化を除去する。Turnitinの文書が偽陽性パターン、ファイル要件、実際の検出メカニズム、そして「burstiness」と「perplexity」がモデルの測定対象ではない理由について述べている内容を以下に示す。

HumanPen チーム

· 6 分

短い回答

会議論文はAI検出にとって難しい立場にある。Turnitinが少数の数百語の適格散文を持つ文書について説明する「全か無か」の問題を引き起こすのに十分なほど短い。FAQの偽陽性プロファイルに一致する方法論と関連研究の要約が密集している。また、モデルが適格テキストとして分析しない箇条書き、図のキャプション、表の項目も含んでいる。目に見えるパーセンテージは、期待よりもはるかに小さい論文の一部を反映している可能性がある。

会議論文が偽陽性プロファイルに一致する理由

FAQは偽陽性を起こしやすい特定のテキストタイプを特定している:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(偽陽性(人間が書いたテキストをAI生成として誤ってフラグすること)には、構造的変化の少ないコンテンツ、文字通り繰り返されるテキスト、または新しいアイデアを展開せずに言い換えられたテキストが含まれることがある。)

会議論文はこれらの基準のいくつを満たしている。ページ制限は著者を効率的で均一な文へと促す。関連研究のセクションは研究全体を各一~二文に凝縮し、それは新しいアイデアを展開しない言い換えである。要旨、序論、結論は同じ主張が複数の場所に現れる必要があるため、繰り返しの枚組み言葉を共有することが多い。FAQは続く:

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(我々の指標がそのようなテキストでより多くのAI執筆を示す場合、示されたパーセンテージを見る際にそれを考慮に入れることを推奨する。)

この助言は会議論文について特に真劃に受け取るべきである。

ファイル要件と書式

採点について論じる前に、Turnitinが実際に何を受け入れるかを扱う必要がある。Turnitinのヘルプ記事が制約を指定している:

"File must be written in a supported language: English, Spanish, Japanese"(ファイルはサポートされる言語で書かれている必要がある: 英語、スペイ語、日本語)

この言語の記述は製品より一リリース遅れである。Turnitinは2026年8月18日に現代標準アラビア語を追加し、リストを四つにしたが、上述の要件ページは本記事の執筆時点ではそう示すように編集されていなかった。同じ情報源が受け入れられる形式とサイズ制限を挙げている:

"Accepted file types: .docx, .pdf, .txt, .rtf"(受け入れられるファイルタイプ: .docx、.pdf、.txt、.rtf)

追加要件には100MB未満のファイル、少なくとも300語の散文、および30,000語以下が含まれる。会議論文について、300語の最小値は重要である。図、表、数式を含む6ページの論文は、非散文コンテンツを除去した後、300語未満の適格散文しか持たない可能性がある。30,000語の上限は問題にならない可能性が高いが、散文の最小値は問題になり得る。

会議論文がLaTeXでPDFにエクスポートされる場合、書式は受け入れられる。DOCXを提出する場合、モデルはテキストを同じ方法で処理する。書式自体はスコアを変えないが、その書式での適格散文の量は変える。

検出メカニズムが論文を処理する方法

FAQは論文をスコアに変えるパイプラインを説明している:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(論文がTurnitinに提出されると、提出物からの文が抽出され、予測分析のために重複するセクションに分割される。各セグメントはAI検出モデルにより分類され、テキストが人間またはAI生成である確率を示す0から1の値を与えられる。これらのセグメント内の各適格文はセグメントのスコアを引き継ぐ。セグメントは重複するため、一部の文は複数のスコアを持つ可能性があり、それらは単一のスコアにまとめられる。これらの文のスコアはさらに集計され、文書全体のAI執筆スコアの計算に使用される。)

会議論文について二つの点が際立つ。第一に、適格文のみが抽出される。FAQは適格テキストを定義する:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures."(この適格テキストは散文文のみを含み、標準的な文法的文で書かれたテキストブロックのみを分析し、リスト、箇条書き(短い非文構造)や他の非文構造のような他の種類の執筆を含めないことを意味する。)

第二に、パーセンテージはその適格散文のみを反映する。FAQは次のように明確にする:

"This percentage is not necessarily the percentage of the entire submission."(このパーセンテージは必ずしも提出物全体のパーセンテージではない。)

10ページの会議論文は図、表、箇条書きリストの数ページを含む可能性がある。AIスコアは散文文のみをカバーする。40%のスコアは論文の40%がAI生成として読まれることを意味しない。適格散文の40%がそうであることを意味する。

短い論文と全か無かの効果

会議論文は雑誌論文よりも短い。非散文コンテンツを除去した後、典型的な会議論文の適格散文はFAQが警告する範囲に落ちる可能性がある:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."(数百語しかない短い文書では、重複する機会なしに単一のセグメントで予測するため、予測は主に「全か無か」になる。)

結論は直接的である:

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."(これは、AI生成とオリジナル内容の混合であるテキストが、完全にAI生成としてフラグされる可能性があることを意味する。)

会議論文が合計3,000語であっても、図のキャプション、表の項目、箇条書きリストを除去した後の適格散文ははるかに少ない可能性がある。セグメントが少ないことは各々がより重みを持つことを意味する。高いスコアのセグメント一つが全体のパーセンテージを急激に押し上げる可能性がある。

モデルが実際に測定するもの

Turnitinの検出器が「burstiness」と「perplexity」を評価するという一般的な信じ込みがある。FAQはこれに直接答えている:

"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions."(我々のモデルは「burstiness」、「perplexity」や公の議論で時に言及される他の個別指標のような特定のシグナルを評価するよう明示的にプログラムされていない。)

次の文が代わりに何が起こるかを説明する:

"Instead, it learns statistical patterns from our training data."(代わりに、我々の訓緻データから統計的パターンを学習する。)

FAQは次に分類器が実際に集中するものを説明する:

"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."(我々の分類器は語の確率におけるこれらの違いを検出するよう訓緻され、人間の執筆者の特定の語確率シーケンスに熟練している。)

これはモデルが訓緻データから学習した語の選択パターンを見ることを意味する。文の長さの変化や語彙の希少性を単独では測定しない。これを理解することは、圧縮された慣用的な表現を持つ会議論文が間違っていると感じるスコアを引き起こす理由を説明するのに役立つ。効率的な学術散文の語パターンは、モデルがAI生成の訓緻例から学習したパターンに似ている可能性がある。

単一のスコアは評決ではない

レポートガイドはスコアがどのように使用されるべきか、されるべきでないかについて明確である:

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."(我々のAI執筆検出モデルは常に正確eとは限らない(人間が書いたテキスト、AI生成テキスト、AI言い換えテキストを誤って識別する可能性がある)ため、学生に対する不利な措置の唯一の根拠として使用されるべきではない。)

次の文がその点を強調する:

"It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred."(学術的不正行為が起きたかどうかを判断するには、組織の特定の学術方針の適用と併せて、さらなる精査と人間の判断が必要である。)

会議論文が査読に出される場合も同じである。高いAIスコアを持つプログラム委員会のメンバーまたは雑誌の編集者は、ベンダー自身の説明によれば、その背後に人間の判断を必要とする情報を持っており、発見ではない。

これがあなたにとって何を意味するか

会議論文が高いTurnitin AIスコアを受け取った場合に留意すべき点を以下に示す:

  • 会議論文は偽陽性プロファイルに一致する: 均一な構造、言い換えられた関連研究、セクション間の繰り返しの枚組み言葉。
  • 300語の散文の最小値は、図が多い論文から非散文コンテンツを除去した後に満たされない可能性がある。
  • パーセンテージは適格散文のみを反映し、提出物全体ではない。
  • 短い適格散文は、重複するセグメントが少ない「全か無か」の予測を引き起こす可能性がある。
  • モデルは訓緻データから学習した語確率パターンを測定し、「burstiness」や「perplexity」ではない。
  • スコアはいかなる判断の唯一の根拠とされるべきではない。

フラグされた箇所に対処したい場合、Turnitinレポートをインポートしてそれらに取り組め。適格な箇所は無料で再実行できる。

続きを読む