Similarity Report の整合性フラグ:隠しテキストと置換文字

レポートには、テキストの一致率とは無関係のタブがもう一つあります。投稿直前の原稿を何かのツールに預ける前に、ここは理解しておく価値があります。

HumanPen チーム

· 7 分

短い答え

Similarity Report には、パーセンテージとは別に Flags タブがあります。そこで示されるのは、文書化されている二つのパターン、つまり隠しテキスト(白地に白の文字、見えなくされた引用符)と置換文字(別のアルファベットの類似文字に置き換えられた文字)です。ドキュメントによれば、類似文字はスキャンの前に自動的に元の文字へ戻されるため、類似性の照合はそのまま行われます。フラグは明示的に不正の認定ではなく、それでも人の目をそこへ向ける赤い印を提出物に付けます。

Flags タブとは何か

ガイドはこれを一文で説明しています。「Turnitin's algorithms look deeply at a document for any inconsistencies that would set it apart from a normal submission. If we notice something strange, we Flag it for you to review.」(Turnitin のアルゴリズムは、通常の提出物とは異なる点がないかを文書の隅々まで調べます。何か不自然な点を見つけたら、確認できるようにフラグを付けます。)

何かが検出されると、提出物の上、Flags タブの横に数字が出ます。フラグの種類が一つなら 1、両方なら 2 です。タブを開くと Integrity Flags for Review パネルが表示され、文書自体には「a red flag with a number inside indicating the flag type and red boxes around all suspicious text related to that flag.」(フラグの種類を示す数字が入った赤い旗と、そのフラグに関連する不審なテキストすべてを囲む赤い枠)が現れます。

ただし書きは出典にそのまま書かれていて、しかも両方向に効きます。「A flag is not necessarily an indicator of a problem. However, we recommend you focus your attention there for further review.」(フラグは必ずしも問題を示すものではありません。ただし、そこに注意を向けてさらに確認することをお勧めします。)

つまり、これは非難ではありません。原稿の一部が赤い枠で囲まれ、レビュー担当者にまさにその箇所をよく見るよう促す、というだけのことです。

隠しテキスト

この手口の出どころについて、ドキュメントは異例なほど率直です。「Paper mills and authors looking to hinder similarity matching abuse text manipulation techniques by trying to pass plagiarized content off as genuine. These techniques are commonly found on YouTube and social media platforms as ways of 'cheating Turnitin'.」(ペーパーミルや、類似性照合を妨げたい著者は、盗用したコンテンツを真正なものとして通すためにテキスト操作の手法を悪用します。こうした手法は YouTube やソーシャルメディアで、Turnitin を欺く方法としてよく出回っています。)

例が二つ挙げられています。

見えない引用符。 ファイルには存在するのに、表示上は見えない引用符です。文書化されている帰結は具体的です。「could influence the amount of quoted material recognized in a document. When a user excludes well-referenced matches using the Exclude Quotes functionality, in a manipulated document this would also hide plagiarized content.」(文書内で認識される引用素材の量に影響を及ぼす可能性がある。利用者が Exclude Quotes 機能で十分に参照された一致を除外すると、操作された文書では盗用コンテンツまで隠すことになる。)

白地に白の文字。 「A user may set the color of a block to text to white rendering it invisible on the white background of the paper. This can be to manipulate the word count or break up plagiarized text with hidden characters.」(利用者がテキストブロックの色を白に設定すると、用紙の白い背景に溶けて見えなくなる。これは語数を操作したり、隠し文字で盗用テキストを分断したりするために行われ得る。)

この文の後半に注目してください。テキストを分断し、照合エンジンが語の連なりを認識できなくするための隠し文字です。その文字がテキストのどこに入るのかはガイドに書かれておらず、私たちが代わりに埋めることもありません。書かれているのは、それがソフトウェアの探している対象であり、見逃すようなものではないということです。

置換文字と、その細工が二重に失敗する理由

ここは丁寧に読む価値があります。人が入力するよりも、ツールの内部に仕込まれている可能性が高い手法だからです。

「Some characters in different alphabets can look similar enough that to the naked eye, it is difficult, if not impossible, to tell them apart.」(アルファベットが違えば、肉眼では見分けがつかないほど、あるいは不可能なほどよく似た文字が存在する。)ラテン文字とまったく同じに見えるキリル文字を語の途中に紛れ込ませると、ページは普通に見えるまま、照合エンジンが探している文字列が断ち切られます。

文書化された反応は二部構成で、誰も触れないのは最初の部分です。

「Turnitin automatically swaps these characters out when scanning a submission so they will not affect the Similarity Report. However, by replacing characters, the intent is to try and interrupt a similarity match.」(Turnitin は提出物をスキャンする際、これらの文字を自動的に置き換えて Similarity Report に影響しないようにする。しかし文字を置き換えるのは、類似性の照合を妨げようとする意図によるものである。)

つまり置換は比較の前に元へ戻され、照合はそのまま成立します。そのうえで、その試みはフラグとして報告されます。この手法は、狙った数値を下げないどころか、それまでなかった印を一つ付け加えることになります。

意見ではなく引用で言えることはめったにありません。文書化された回避手法が、機能しないと文書化されている、というのは珍しい例です。

なぜこれは人ではなくツールへの問いなのか

三語に一語ずつキリル文字の 'о' を貼り付けていく著者は、まずいません。しかしソフトウェアはそれをやります。一瞬で、目に見えないまま、原稿全体にわたって。しかもあなたには見えません。同じに見えることこそがこの手法の肝なのですから。

だからこそ、ファイルを何かに渡す前に問うべきなのです。戻ってきたものに、入れたときにはなかった文字が含まれていないか、と。

特別なツールがなくても確認できます。ただし先に、一見もっともらしくて機能しない確認方法は除外しておきましょう。

よくある文字の出現回数を数えても何もわかりません。書き直しはテキストを長くする傾向があり、文字数もそれに伴って増えるからです。私たち自身の前後ファイルでは、どこにも文字を置き換えていないのに、ラテン文字の「a」が 4,631 から 5,092 に、「e」が 6,970 から 8,005 に増えました。文字を数えて数が増えても、わかるのは文書が長くなったということだけです。

数ではなく目録を比べてください。送ったファイルと戻ってきたファイルのプレーンテキストを書き出し、それぞれに現れる異なる文字を一覧にして、後の一覧にあって先の一覧にないものを探します。ラテン文字に見えるキリル文字やギリシャ文字。ゼロ幅スペース。ソフトハイフン。出現回数が変わるのは想定内です。あなたのファイルに一度もなかった文字が現れるのは想定外です。

そして、結果を誰が負うのかという構造的な点が二つあります。フラグは提出物に付き、そこにはあなたの名前があります。そして、その文字を入れたツールは、レポートが読まれるときにはその場にいません。

私たちがあなたの文字についてすること、しないこと

私たちは、この手法が置かれているのと同じ分類にいます。だからこそ、言わずに済ませるのではなく、はっきり述べるのが誠実だと考えています。

HumanPenというツール は文を書き直します。見えない文字を挿入することはなく、他のアルファベットの類似文字に置き換えることもなく、文字を白に着色することもありません。その必要がないからです。上で引いたドキュメントによれば、置換は照合の前に元へ戻され、その過程でフラグが立ちます。つまりこの手法が確実に生み出すのは、あなたの原稿に付く赤い枠だけです。

この記事を公開する前に、私たち自身の出力で目録比較を実施しました。対象は前後 4 組です。毎回、各出力に現れる異なる文字の集合は、入力の集合の部分集合でした。新しいものはなく、キリル文字もギリシャ文字もゼロ幅のものもありませんでした。非 ASCII 文字の数は増えるどころか減りました。あるファイルではエムダッシュが 58 から 13 に、湾曲アポストロフィが 41 から 6 になりました。また、比較が探す対象をきちんと捉えられるかも確認しました。出力のコピーにキリル文字の「о」とゼロ幅スペースを一つずつ仕込み、もう一度実行したところ、両方が一覧に挙がりました。

これらは私たちのファイルであり、コーパスは公開していません。ですから数値は私たちのものとして、手順はあなたのものとして受け取ってください。あなた自身の前後で実行してみてください。私たちがお返ししたものについても、ぜひ。

よくある質問

フラグは、何かを非難されたという意味ですか。 いいえ。ドキュメントは、フラグは「is not necessarily an indicator of a problem」(必ずしも問題を示すものではありません)としつつ、レビュー担当者がそこに注意を向けることを勧めています。これは確認の促しであって、認定ではありません。

類似文字で類似性スコアは下がりますか。 ドキュメントによれば、下がりません。提出物のスキャン時にそれらの文字は自動的に置き換えられ、Similarity Report に影響しないようになる、とあります。さらに、その試みはフラグとして報告されます。

フラグの種類はいくつありますか。 文書化されているのは二つ、隠しテキストと置換文字です。タブには、検出された種類の数に応じて 1 または 2 が表示されます。

投稿前に自分のファイルを確認できますか。 レポートではできません。レポートはレビュー担当者側で生成されるからです。ファイルそのものを調べることはできます。送り出したバージョンと戻ってきたバージョンに現れる異なる文字を一覧にして、後の一覧にあるのに先の一覧にない文字を探してください。代わりに文字数を数えてはいけません。書き直しでテキストは長くなるので、文字数はひとりでに増えます。白抜きや、背景と同じ色の文字がないかも確認してください。

続きを読む