Turnitin 拒绝我的扫描 PDF:为什么图片型文件提交失败
你把打印稿扫成 PDF,上传时被拒:「Your submission must contain 20 words or more」。或者文件上传了,但报告永远不出来。Turnitin 官方支持页把原因写得清清楚楚:提交流程需要可提取、可选中的文本,而扫描页是图片。文件要求、精确报错、以及真正能修好文件的办法(提交前把图片转成文本),全部有官方文档。这篇文章讲规则和修法。
HumanPen 团队
· 4 分钟
短回答
扫描 PDF(或任何图片型文件)提交失败,是因为 Turnitin 要求可提取、可选中的文本——扫描页是图片不是文本。官方支持页写明文件必须包含至少 20 词可提取的散文文本,且扫描件、图片型 PDF、表单、作品集会自动拒绝。修法同样有官方文档:提交前把图片转成文本(OCR),或把文本直接粘贴进提交框。只换文件格式不转换图片,没有用。
提交流程到底需要什么
Turnitin 官方支持页「Why am I unable to submit my paper to Turnitin?」列了文件要生成相似度报告必须满足的技术规则:
"Supported file types: Your file must be in a supported format (e.g., .docx, .pdf, .txt, .rtf)."(受支持的文件类型:您的文件必须采用受支持的格式(例如 .docx、.pdf、.txt、.rtf)。)
"Size & length limits: The file must be under 100 MB and fewer than 800 pages."(文件大小与长度限制:文件必须小于 100 MB 且少于 800 页。)
"Minimum word count: The document must contain at least 20 words of extractable prose text."(最低字数要求:文档必须包含至少 20 个字的可提取散文文本。)
"No images or scanned text: The text in your document must be selectable and copyable. Scanned documents, image-based PDFs, forms, or portfolios will be automatically rejected."(不接受图像或扫描文本:您文档中的文本必须能够被选择和复制。扫描文档、基于图像的 PDF、表格或作品集将被自动拒绝。)
关键词是 extractable(可提取)。文本必须能用光标选中、能复制——流水线读的是文件的文本层,不是像素。
具体报错与它的含义
这种失败最常见的报错写在官方帮助中心:
"The error message 'Your submission must contain 20 words or more' indicates that the file you are attempting to submit does not meet the minimum requirement of 20 words of extractable text."(错误消息 'Your submission must contain 20 words or more' 表示您尝试提交的文件未达到 20 个字可提取文本的最低要求。)
"This commonly occurs when the submitted document does not contain enough extractable text. For example, the file may consist primarily of images rather than selectable text, or it may contain fewer than 20 words."(当提交的文档未包含足够的可提取文本时,通常会出现此情况。例如,文件可能主要由图像而非可选文本组成,或者包含的字数少于 20 个。)
官方的自查法是复制粘贴测试:
"Try highlighting the text in your document and copying and pasting it into another application. If you cannot select or copy the text, the document may contain images instead of extractable text."(尝试高亮显示文档中的文本,并将其复制粘贴到另一个应用程序中。如果您无法选择或复制文本,则该文档可能包含的是图像,而不是可提取的文本。)
如果文本选不中、复制不了,从流水线的角度看这个文件就是图片——不管扫描件在人类眼里多清晰。
扫描件在转换之前就是图片
Turnitin 的提交错误页直接点名了问题:
"If you scanned the document you are trying to submit, the document is likely an image. In order to submit a document that has been scanned, you must use a program to convert the image into text."(如果您扫描了要提交的文档,该文档很可能是一个图像。为了提交已扫描的文档,您必须使用程序将图像转换为文本。)
同一页还写了底层的检查:
"The file you are trying to submit does not contain at least 20 words or 100 characters of text."(您尝试提交的文件未包含至少20个单词或100个字符的文本。)
所以修法不是「把同一份扫描换个格式导出」,而是把图片转换成文本层——OCR——或者把文本直接粘贴进提交框。
怎么真正修好一个扫描文件
Turnitin 的官方指导给了可行的路径,按顺序:
- 检查文件有没有可提取文本:选中并复制一段到纯文本编辑器。如果复制不出来,文件就是图片。
- 用 OCR 程序把图片转成文本,然后人工校对——OCR 可能引入字符错误。
- 重新提交转换后的文本版文件(或把文本直接粘贴进作业的文本输入框)。
最关键的边界:只转换格式(比如 PNG 转 PDF)没用,如果文本仍然是像素。文本必须作为可选中的字符存在,流水线才能比较它。
底线
扫描 PDF 提交失败,原因有官方文档:流水线要求至少 20 词可提取、可选中文本,而扫描页是图片。Turnitin 自己的页面写明了下限、点名了图片型 PDF 自动拒绝,还给了官方自查法:如果选不中复制不了,对流水线来说它就不是文本。修法是把图片转成文本(OCR)并校对,或者把文本直接粘贴进提交框——而不是把同一份扫描换个格式再导出。理解规则,用官方方法检查文件,这个错误就不再是谜。
继续阅读