類似度 44% なのに一致元は数件——Turnitin の高スコアをどう読むか

レポートには類似度 44% とあるのに、その下のソース一覧はほとんど空。この割合はソースの数ではありません。一致した語数の割合です。本ページでは、その計算方法、ソースが少数でも高スコアになる理由、そして指導教員側の設定でスコアが変わる理由を解説します。

HumanPen チーム

· 5 分

まず結論から

一致元が数件しかないのに類似度が 44% でも、矛盾ではありません。システムの不具合でもありません。この割合はソース数ではなく語数を数えたもの、つまり提出文書の語のうち Turnitin のデータベース内のテキストと一致した割合です。長いソースが一つあるだけ——頼りにした論文一編、自分自身の過去の提出物、あるいは正しく引用した一節——で、一致語数のかなりの部分を占めることがあります。

さらに、このスコアは設定に左右されます。指導教員は引用、参考文献、過去の提出物を除外できます。同じ文書でも設定が違えば数字は変わります。つまり、ソースが少ないのに高スコアという場合は、見出しのパーセンテージではなく、一致箇所の分布を読むべきだということです。

画面に表示されているもの

レポート画面には、上部のパーセンテージと、その下の一致元一覧という二つが並んで表示されます。数値が大きいのに一覧が短いと、「44% もあるのに一致は 7% 分だけ」とでも言いたくなるような、どうも引っかかる見え方になります。この二つの数字は連動しているはずだと感覚が教えてくるからです。

いいえ、連動しません。パーセンテージとソース一覧は、別の測定値です。パーセンテージは文書全体から算出された一つの数値。一方ソース一覧は、一致した語がどこから来たかの内訳です。そして、一つのソースが大量の語を供給することがあります。

混乱の正体はこの形に尽きます。語数を数える見出しの数値、ソース数を数える一覧、そしてこの二つを結びつける規則は存在しない、ということです。

このパーセンテージの正体

Turnitin 自身の学生向けガイドが、この数値を正確に定義しています。類似度スコアとは、提出文書に含まれる一致テキストの割合、すなわち全体の類似度のことです。計算方法は、提出文書の総語数を、データベース内のソースと一致した語数で割る、というものです。

この定義から、二つの帰結が導かれます。

一つ目。パーセンテージは、一覧に載ったソースの数とは無関係です。文書の語数に対する一つの割合にすぎません。語の 44% が一致していれば——たとえ相手が一つのソースだけであっても——スコアは 44% と表示されます。

二つ目。データベースは巨大で、中身も多様です。Turnitin のガイドは、それをインターネット上の現在および過去のコンテンツ、数千の定期刊行物・学術誌・出版物、そして過去に Turnitin へ提出された論文群だと説明しています。そのどれと一致しても、同じ語数としてカウントされます。ソースが一編の長い論文でも、二十の短いページでも変わりません。

ソースが少数でも高スコアになる理由

ソース一覧が短いのに高い割合が出る、具体的なパターンは次のとおりです。

一つの長いソース。 論文のかなりの部分が単一の記事の言い換えや引用であれば、その一つのソースが一致語数の大部分を占めます。ソース一覧は短いのに、割合は大きい、という状態です。

自分自身の以前の草稿。 Turnitin の公式シナリオには、同じ論文の草稿を複数回提出する学生が挙げられています。その結果、最終稿が以前の版に対して 100% を記録することがあります。ソースは一つ(自分自身)、パーセンテージは最大値、というわけです。

正しく引用・参照されたテキスト。 学生向けガイドには、提出物がデータベースの一部と一致する可能性は高い、正しく使われた引用や参照も一致としてハイライトされる、とあります。引用箇所は実際の一致であり、割合は他の語と同じようにこれを数えます。

文書内での繰り返し。 自分の論文の中で同じフレーズや定義を何度も繰り返していて、そのフレーズがデータベースに一か所存在する場合、繰り返しのそれぞれが一致テキストとしてカウントされることがあります。

共通しているのはこういうことです。パーセンテージは語数の割合であり、その語は一つか二つのソースに対して積み上がりうる、ということです。

スコアは設定次第で変わる

同じ文書でも、指導教員がレポートをどう設定したかによって、異なるパーセンテージが出ます。この点は Turnitin 自身のシナリオにも記載されています。

指導教員は、該当する場合に類似度スコアを下げる目的で、Similarity Report から引用を除外するよう設定できます。公式の例の一つには、引用が多く参考文献も充実している学生の提出物が挙げられています。レポートから引用と参考文献を除外するまでは、スコアは高いままです。

つまり、表示されているパーセンテージは、文書レポート設定の両方から決まる値です。引用を除外しているかどうか、参考文献を除外しているかどうか、過去の提出物を除外しているかどうか。指導教員側の設定が変われば数字も変わります。文書そのものは変わっていません。

これは、クラスメート同士や草稿同士でスコアを比較するときに効いてきます。似た文書についての、二つの異なるレポートを比べている可能性があるからです。

自分のレポートの読み方

見出しのパーセンテージを眺めるのはやめて、一致箇所の分布を読むようにしてください。

まず、ソース一覧を開いてハイライトされた一致箇所を見てください。件数ではなく、テキストそのものです。何が一致しているでしょうか。引用元として示した記事からの長い引用でしょうか。繰り返してしまった定義でしょうか。以前の草稿の一段落でしょうか。それぞれ意味が異なり、パーセンテージだけでは見分けられません。

次に、設定がどうなっているかを確認してください。そのレポートは引用を除外して生成されたものでしょうか。参考文献は。過去の提出物は。答えによって、その数字が自分の文書について何を意味するかが変わります。これらの設定を管理しているのは指導教員です。パーセンテージが実際に何を数えているのかを知るには、尋ねるのがいちばん早い方法です。

三つ目は、公式の見解を踏まえて数字を位置づけることです。許容されるスコアに固定の基準はない、というのがその見解です。Turnitin の学生向けガイドは、許容される一致テキストの量は学校、指導教員、課題ごとに異なりうるとしたうえで、期待される水準についてはシラバス、課題の指示、または指導教員に確認するよう勧めています。

ソースが少ないのにスコアが高いというのは、判決ではなく問いかけです。その答えはハイライトされたテキストと設定の中にあって、パーセンテージの中にはありません。

要するに

44% なのにソース一覧が短くても、矛盾ではありません。類似度のパーセンテージは一致した語数、つまり総語数のうちの割合を数えているのに対し、ソース一覧はソースの数を数えています。そして、長いソース一編、以前の草稿、正しく引用されたテキストが、語数の大きな部分を供給しえます。さらにスコアは設定に左右されます。指導教員は引用、参考文献、過去の提出物を除外でき、同じ文書でも数字は変わります。ハイライトされた一致箇所を読み、設定を確認してください。高スコアの意味はそこにあります。

続きを読む