Turnitin にスキャン PDF を拒否されたとき:画像ベースのファイルが提出できない理由

印刷した下書きをスキャンして PDF に保存し、アップロードしたら "Your submission must contain 20 words or more."(提出物には 20 語以上のテキストが含まれていなければなりません。)というエラーで失敗した。あるいはファイルは送信できたのに、レポートがいつまでも表示されない。Turnitin のサポートページには、なぜこうなるのかがはっきり書かれています。提出の処理には「抽出可能で、選択できるテキスト」が必要で、スキャンしたページはテキストではなく画像だからです。ファイルの要件、正確なエラーメッセージ、そして何が実際の解決策なのか(提出前に画像をテキストに変換すること)も、すべて文書化されています。この記事では、そのルールと直し方を順にたどります。

HumanPen チーム

· 4 分

短い答え

スキャンした PDF(画像ベースのファイル全般)が Turnitin の提出で弾かれるのは、Turnitin が抽出可能で選択できるテキストを要求するのに対し、スキャンしたページはテキストではなく画像だからです。Turnitin 自身のサポートページには、ファイルに少なくとも 20 語の抽出可能な本文テキストが含まれている必要があり、スキャン文書・画像ベースの PDF・フォーム・ポートフォリオは自動的に拒否されると書かれています。解決策も記載されています。提出前に画像をテキストに変換する(OCR)か、テキストを提出欄に直接貼り付けることです。画像を変換せずにフォーマットだけを変えても意味がありません。

提出の処理が本当に必要としているもの

Turnitin のサポートページ「Why am I unable to submit my paper to Turnitin?」(なぜ自分の論文を Turnitin に提出できないのですか?)には、Similarity Report を生成できるファイルの技術的な条件が次のように並んでいます。

"Supported file types: Your file must be in a supported format (e.g., .docx, .pdf, .txt, .rtf)."(対応ファイル形式:ファイルは .docx、.pdf、.txt、.rtf などの対応フォーマットである必要があります。)
"Size & length limits: The file must be under 100 MB and fewer than 800 pages."(サイズと長さの制限:ファイルは 100 MB 未満、800 ページ未満でなければなりません。)
"Minimum word count: The document must contain at least 20 words of extractable prose text."(最小語数:文書には抽出可能な本文テキストが少なくとも 20 語含まれていなければなりません。)
"No images or scanned text: The text in your document must be selectable and copyable. Scanned documents, image-based PDFs, forms, or portfolios will be automatically rejected."(画像やスキャンテキストは不可:文書内のテキストは選択・コピーできなければなりません。スキャン文書、画像ベースの PDF、フォーム、ポートフォリオは自動的に拒否されます。)

キーワードは「抽出可能」です。テキストはカーソルで選択でき、コピーできなければなりません。処理が読むのはファイルのテキスト層であって、ピクセルではありません。

実際のエラーメッセージとその意味

このケースで最も多いエラーは、Turnitin のヘルプセンターに次のように記載されています。

"The error message 'Your submission must contain 20 words or more' indicates that the file you are attempting to submit does not meet the minimum requirement of 20 words of extractable text."(エラーメッセージ「Your submission must contain 20 words or more」は、提出しようとしているファイルが抽出可能なテキスト 20 語という最小要件を満たしていないことを示しています。)
"This commonly occurs when the submitted document does not contain enough extractable text. For example, the file may consist primarily of images rather than selectable text, or it may contain fewer than 20 words."(これは、提出された文書に抽出可能なテキストが十分に含まれていない場合によく起こります。たとえば、ファイルの大部分が選択可能なテキストではなく画像で構成されている場合や、20 語未満しか含まれていない場合です。)

公式のセルフチェックは、コピーして貼り付けてみるテストです。

"Try highlighting the text in your document and copying and pasting it into another application. If you cannot select or copy the text, the document may contain images instead of extractable text."(文書内のテキストを強調表示し、別のアプリケーションにコピーして貼り付けてみてください。テキストを選択もコピーもできない場合、その文書には抽出可能なテキストではなく画像が含まれている可能性があります。)

テキストを選択してコピーできないなら、そのファイルは処理する側から見れば画像です。人間の目にスキャンがどれほどきれいに見えても関係ありません。

スキャンしたファイルは、変換するまで画像のままです

Turnitin の提出エラーのページは、この問題を次のように端的に述べています。

"If you scanned the document you are trying to submit, the document is likely an image. In order to submit a document that has been scanned, you must use a program to convert the image into text."(提出しようとしている文書をスキャンした場合、その文書はおそらく画像です。スキャンした文書を提出するには、画像をテキストに変換するプログラムを使う必要があります。)

同じページには、その背後にあるチェックも説明されています。

"The file you are trying to submit does not contain at least 20 words or 100 characters of text."(提出しようとしているファイルには、少なくとも 20 語または 100 文字のテキストが含まれていません。)

つまり解決策は「同じスキャンを別のフォーマットで書き出す」ことではありません。解決策は、画像をテキスト層に変換すること(OCR)、あるいはテキストを提出欄に直接貼り付けることです。

スキャン PDF と一緒に失敗しやすいもの

Turnitin のファイル要件のページは、関連する拒否理由をまとめています。

"Turnitin will not accept PDF image files, forms, or portfolios, files that do not contain highlightable text (e.g. a scanned file - usually an image), documents containing multiple files or files created with software other than Adobe Acrobat."(Turnitin は、PDF の画像ファイル、フォーム、ポートフォリオ、強調表示できるテキストを含まないファイル、例えばスキャンしたファイル、通常は画像、複数のファイルを含む文書、Adobe Acrobat 以外のソフトウェアで作成されたファイルを受け付けません。)

同じガイドは、PDF をどのように作成すべきかも勧めています。

"Turnitin recommends using Adobe Acrobat or Microsoft Word 365 to create PDF files. PDFs generated by other applications may not always be processed successfully."(Turnitin は、PDF ファイルの作成に Adobe Acrobat または Microsoft Word 365 の使用を推奨しています。他のアプリケーションで生成された PDF が、常に正常に処理されるとは限りません。)

見た目は違っても原因は同じ、関連する失敗例:

  • 最初のページが画像だけでテキストを含まない場合、ファイルの処理全体が失敗することがあります。
  • ベクター画像が密集したファイルは、処理に時間がかかりすぎたり、処理自体が失敗したりすることがあります。
  • パスワードで保護されたファイルは拒否されます。

これらはすべて、処理が必要とする形でテキストを読めないという点で共通しています。

スキャンしたファイルを実際に直す方法

Turnitin 自身のガイドは、実行可能な手順を次の順で示しています。

  1. ファイルに抽出可能なテキストがあるか確認します。テキストの一部を選択して、プレーンテキストエディターにコピーしてください。何もコピーできなければ、そのファイルは画像です。
  2. OCR ソフトで画像をテキストに変換し、その結果に目を通してください。OCR は文字の誤りを混入させることがあります。
  3. 変換してテキストベースになったファイルを再提出する(または課題のテキスト入力欄に直接貼り付ける)。

重要な境界線はここです。テキストがまだピクセルのままなら、フォーマットを変換しても、例えば PNG から PDF にしても、何も変わりません。処理が比較できるようにするには、テキストが選択可能な文字として存在していなければなりません。

要点

スキャンした PDF が Turnitin の提出で失敗するのは、はっきり文書化された理由があります。処理には抽出可能で選択できるテキストが少なくとも 20 語必要で、スキャンしたページは画像だからです。Turnitin 自身のページがその最小値を示し、画像ベースの PDF の自動的な拒否を明言し、公式のセルフチェックも提示しています。テキストを選択してコピーできないなら、それは処理にとってテキストではありません。解決策は、画像をテキストに変換して(OCR)見直すこと、あるいはテキストを提出欄に貼り付けることであり、同じスキャンを別のフォーマットで書き出し直すことではありません。ルールを理解し、公式の方法でファイルを確認すれば、このエラーはもう謎ではなくなります。

続きを読む