Turnitin hat mein gescanntes PDF abgelehnt: Warum bildbasierte Dateien beim Einreichen scheitern

Sie haben Ihren ausgedruckten Entwurf gescannt, als PDF gespeichert – und das Hochladen scheiterte mit "Your submission must contain 20 words or more." (Ihre Einreichung muss mindestens 20 Wörter enthalten.) Oder die Datei ging durch, aber ein Bericht erschien nie. Die Support-Seiten von Turnitin beschreiben genau, warum das passiert: Die Verarbeitung braucht extrahierbaren, auswählbaren Text – und eine gescannte Seite ist ein Bild. Die Dateianforderungen, die genauen Fehlermeldungen und das, was die Datei tatsächlich repariert (das Bild vor dem Einreichen in Text umwandeln), sind alle dokumentiert. Dieser Artikel geht die Regeln und die Lösung Schritt für Schritt durch.

HumanPen-Team

· 4 Min. Lesezeit

Kurze Antwort

Ein gescanntes PDF (oder jede bildbasierte Datei) scheitert bei Turnitin, weil Turnitin extrahierbaren, auswählbaren Text verlangt – und eine gescannte Seite ein Bild ist, kein Text. Auf der eigenen Support-Seite von Turnitin steht, dass die Datei mindestens 20 Wörter extrahierbaren Fließtext enthalten muss und dass gescannte Dokumente, bildbasierte PDFs, Formulare oder Portfolios automatisch abgelehnt werden. Auch die Lösung ist dokumentiert: Wandeln Sie das Bild vor dem Einreichen in Text um (OCR) oder fügen Sie den Text direkt in das Eingabefeld ein. Das Format zu wechseln, ohne das Bild umzuwandeln, hilft nicht.

Was die Verarbeitung tatsächlich braucht

Die Support-Seite von Turnitin "Why am I unable to submit my paper to Turnitin?" (Warum kann ich meine Arbeit nicht bei Turnitin einreichen?) listet die technischen Regeln für Dateien auf, aus denen ein Similarity Report entstehen soll:

"Supported file types: Your file must be in a supported format (e.g., .docx, .pdf, .txt, .rtf)." (Unterstützte Dateitypen: Ihre Datei muss in einem unterstützten Format vorliegen, zum Beispiel .docx, .pdf, .txt oder .rtf.)
"Size & length limits: The file must be under 100 MB and fewer than 800 pages." (Größen- und Umfangsgrenzen: Die Datei muss unter 100 MB bleiben und weniger als 800 Seiten haben.)
"Minimum word count: The document must contain at least 20 words of extractable prose text." (Mindestwortzahl: Das Dokument muss mindestens 20 Wörter extrahierbaren Fließtext enthalten.)
"No images or scanned text: The text in your document must be selectable and copyable. Scanned documents, image-based PDFs, forms, or portfolios will be automatically rejected." (Keine Bilder und kein gescannter Text: Der Text in Ihrem Dokument muss auswählbar und kopierbar sein. Gescannte Dokumente, bildbasierte PDFs, Formulare und Portfolios werden automatisch abgelehnt.)

Das entscheidende Wort ist extrahierbar. Der Text muss sich mit dem Cursor auswählen und kopieren lassen – die Verarbeitung liest die Textebene der Datei, nicht die Pixel.

Die genaue Fehlermeldung und was sie bedeutet

Der häufigste Fehler für diesen Fall ist im Hilfe-Center von Turnitin dokumentiert:

"The error message 'Your submission must contain 20 words or more' indicates that the file you are attempting to submit does not meet the minimum requirement of 20 words of extractable text." (Die Fehlermeldung „Your submission must contain 20 words or more" weist darauf hin, dass die Datei, die Sie gerade einreichen wollen, die Mindestanforderung von 20 Wörtern extrahierbarem Text nicht erfüllt.)
"This commonly occurs when the submitted document does not contain enough extractable text. For example, the file may consist primarily of images rather than selectable text, or it may contain fewer than 20 words." (Das kommt häufig vor, wenn das eingereichte Dokument nicht genug extrahierbaren Text enthält. Die Datei kann zum Beispiel überwiegend aus Bildern statt aus auswählbarem Text bestehen oder weniger als 20 Wörter enthalten.)

Der offizielle Selbsttest ist ein Kopier-und-Einfügen-Test:

"Try highlighting the text in your document and copying and pasting it into another application. If you cannot select or copy the text, the document may contain images instead of extractable text." (Versuchen Sie, den Text in Ihrem Dokument zu markieren und in eine andere Anwendung zu kopieren und einzufügen. Lässt sich der Text nicht auswählen oder kopieren, enthält das Dokument womöglich Bilder statt extrahierbarem Text.)

Wenn sich der Text nicht auswählen und kopieren lässt, ist die Datei aus Sicht der Verarbeitung ein Bild – ganz gleich, wie gut der Scan für menschliche Augen aussieht.

Gescannte Dateien bleiben Bilder, bis Sie sie umwandeln

Die Fehlerseite von Turnitin spricht das Problem direkt an:

"If you scanned the document you are trying to submit, the document is likely an image. In order to submit a document that has been scanned, you must use a program to convert the image into text." (Wenn Sie das Dokument gescannt haben, das Sie einreichen möchten, ist es wahrscheinlich ein Bild. Um ein gescanntes Dokument einzureichen, müssen Sie ein Programm verwenden, das das Bild in Text umwandelt.)

Dieselbe Seite erklärt die zugrunde liegende Prüfung:

"The file you are trying to submit does not contain at least 20 words or 100 characters of text." (Die Datei, die Sie einreichen möchten, enthält nicht mindestens 20 Wörter oder 100 Zeichen Text.)

Die Lösung ist also nicht, denselben Scan in ein anderes Format zu exportieren. Die Lösung ist, das Bild in eine Textebene umzuwandeln – OCR – oder den Text direkt in das Eingabefeld einzufügen.

Was neben gescannten PDFs sonst noch scheitert

Die Seite mit den Dateianforderungen von Turnitin fasst verwandte Ablehnungen zusammen:

"Turnitin will not accept PDF image files, forms, or portfolios, files that do not contain highlightable text (e.g. a scanned file - usually an image), documents containing multiple files or files created with software other than Adobe Acrobat." (Turnitin akzeptiert keine PDF-Bilddateien, Formulare oder Portfolios, keine Dateien ohne markierbaren Text, etwa eine gescannte Datei – in der Regel ein Bild, keine Dokumente, die mehrere Dateien enthalten, und keine Dateien, die mit anderer Software als Adobe Acrobat erstellt wurden.)

Dieselbe Anleitung empfiehlt, wie PDFs erstellt werden sollen:

"Turnitin recommends using Adobe Acrobat or Microsoft Word 365 to create PDF files. PDFs generated by other applications may not always be processed successfully." (Turnitin empfiehlt, PDF-Dateien mit Adobe Acrobat oder Microsoft Word 365 zu erstellen. PDFs aus anderen Anwendungen lassen sich unter Umständen nicht immer erfolgreich verarbeiten.)

Verwandte Fehler, die anders aussehen, aber dieselbe Ursache haben:

  • Die erste Seite enthält nur ein Bild und keinen Text – dann kann die Verarbeitung der Datei ganz scheitern.
  • Dateien mit dichten Vektorgrafiken brauchen zu lange oder lassen sich gar nicht verarbeiten.
  • Passwortgeschützte Dateien werden abgelehnt.

All dies sind Fälle, in denen die Verarbeitung den Text nicht so lesen kann, wie sie es braucht.

Wie sich eine gescannte Datei wirklich reparieren lässt

Die Anleitung von Turnitin selbst nennt den gangbaren Weg – in dieser Reihenfolge:

  1. Prüfen Sie, ob die Datei extrahierbaren Text enthält: Markieren Sie einen Teil des Textes und kopieren Sie ihn in einen einfachen Texteditor. Lässt sich nichts kopieren, ist die Datei ein Bild.
  2. Wandeln Sie das Bild mit einem OCR-Programm in Text um und lesen Sie das Ergebnis anschließend Korrektur – OCR kann falsche Zeichen erzeugen.
  3. Reichen Sie die umgewandelte, textbasierte Datei erneut ein – oder fügen Sie den Text direkt in das Textfeld der Aufgabe ein.

Die Grenze, auf die es ankommt: Das Format zu wechseln, etwa von PNG zu PDF, bringt nichts, solange der Text aus Pixeln besteht. Der Text muss als auswählbare Zeichen vorliegen, bevor die Verarbeitung ihn vergleichen kann.

Unterm Strich

Ein gescanntes PDF scheitert bei Turnitin aus einem dokumentierten Grund: Die Verarbeitung verlangt mindestens 20 Wörter extrahierbaren, auswählbaren Text, und eine gescannte Seite ist ein Bild. Die eigenen Seiten von Turnitin nennen das Minimum, sprechen die automatische Ablehnung bildbasierter PDFs aus und liefern den offiziellen Selbsttest: Lässt sich der Text nicht auswählen und kopieren, ist er für die Verarbeitung kein Text. Die Lösung heißt: Bild in Text umwandeln (OCR), Korrektur lesen oder den Text in das Eingabefeld einfügen – nicht denselben Scan in ein anderes Format exportieren. Wer die Regel versteht und die Datei auf die offizielle Weise prüft, für den ist die Fehlermeldung kein Rätsel mehr.

WEITERLESEN