Turnitin hat mein gescanntes PDF abgelehnt: Warum bildbasierte Dateien beim Einreichen scheitern
Sie haben Ihren ausgedruckten Entwurf gescannt, als PDF gespeichert – und das Hochladen scheiterte mit "Your submission must contain 20 words or more." (Ihre Einreichung muss mindestens 20 Wörter enthalten.) Oder die Datei ging durch, aber ein Bericht erschien nie. Die Support-Seiten von Turnitin beschreiben genau, warum das passiert: Die Verarbeitung braucht extrahierbaren, auswählbaren Text – und eine gescannte Seite ist ein Bild. Die Dateianforderungen, die genauen Fehlermeldungen und das, was die Datei tatsächlich repariert (das Bild vor dem Einreichen in Text umwandeln), sind alle dokumentiert. Dieser Artikel geht die Regeln und die Lösung Schritt für Schritt durch.
HumanPen-Team
· 4 Min. Lesezeit
Kurze Antwort
Ein gescanntes PDF (oder jede bildbasierte Datei) scheitert bei Turnitin, weil Turnitin extrahierbaren, auswählbaren Text verlangt – und eine gescannte Seite ein Bild ist, kein Text. Auf der eigenen Support-Seite von Turnitin steht, dass die Datei mindestens 20 Wörter extrahierbaren Fließtext enthalten muss und dass gescannte Dokumente, bildbasierte PDFs, Formulare oder Portfolios automatisch abgelehnt werden. Auch die Lösung ist dokumentiert: Wandeln Sie das Bild vor dem Einreichen in Text um (OCR) oder fügen Sie den Text direkt in das Eingabefeld ein. Das Format zu wechseln, ohne das Bild umzuwandeln, hilft nicht.
Was die Verarbeitung tatsächlich braucht
Die Support-Seite von Turnitin "Why am I unable to submit my paper to Turnitin?" (Warum kann ich meine Arbeit nicht bei Turnitin einreichen?) listet die technischen Regeln für Dateien auf, aus denen ein Similarity Report entstehen soll:
"Supported file types: Your file must be in a supported format (e.g., .docx, .pdf, .txt, .rtf)." (Unterstützte Dateitypen: Ihre Datei muss in einem unterstützten Format vorliegen, zum Beispiel .docx, .pdf, .txt oder .rtf.)
"Size & length limits: The file must be under 100 MB and fewer than 800 pages." (Größen- und Umfangsgrenzen: Die Datei muss unter 100 MB bleiben und weniger als 800 Seiten haben.)
"Minimum word count: The document must contain at least 20 words of extractable prose text." (Mindestwortzahl: Das Dokument muss mindestens 20 Wörter extrahierbaren Fließtext enthalten.)
"No images or scanned text: The text in your document must be selectable and copyable. Scanned documents, image-based PDFs, forms, or portfolios will be automatically rejected." (Keine Bilder und kein gescannter Text: Der Text in Ihrem Dokument muss auswählbar und kopierbar sein. Gescannte Dokumente, bildbasierte PDFs, Formulare und Portfolios werden automatisch abgelehnt.)
Das entscheidende Wort ist extrahierbar. Der Text muss sich mit dem Cursor auswählen und kopieren lassen – die Verarbeitung liest die Textebene der Datei, nicht die Pixel.
Die genaue Fehlermeldung und was sie bedeutet
Der häufigste Fehler für diesen Fall ist im Hilfe-Center von Turnitin dokumentiert:
"The error message 'Your submission must contain 20 words or more' indicates that the file you are attempting to submit does not meet the minimum requirement of 20 words of extractable text." (Die Fehlermeldung „Your submission must contain 20 words or more" weist darauf hin, dass die Datei, die Sie gerade einreichen wollen, die Mindestanforderung von 20 Wörtern extrahierbarem Text nicht erfüllt.)
"This commonly occurs when the submitted document does not contain enough extractable text. For example, the file may consist primarily of images rather than selectable text, or it may contain fewer than 20 words." (Das kommt häufig vor, wenn das eingereichte Dokument nicht genug extrahierbaren Text enthält. Die Datei kann zum Beispiel überwiegend aus Bildern statt aus auswählbarem Text bestehen oder weniger als 20 Wörter enthalten.)
Der offizielle Selbsttest ist ein Kopier-und-Einfügen-Test:
"Try highlighting the text in your document and copying and pasting it into another application. If you cannot select or copy the text, the document may contain images instead of extractable text." (Versuchen Sie, den Text in Ihrem Dokument zu markieren und in eine andere Anwendung zu kopieren und einzufügen. Lässt sich der Text nicht auswählen oder kopieren, enthält das Dokument womöglich Bilder statt extrahierbarem Text.)
Wenn sich der Text nicht auswählen und kopieren lässt, ist die Datei aus Sicht der Verarbeitung ein Bild – ganz gleich, wie gut der Scan für menschliche Augen aussieht.
Gescannte Dateien bleiben Bilder, bis Sie sie umwandeln
Die Fehlerseite von Turnitin spricht das Problem direkt an:
"If you scanned the document you are trying to submit, the document is likely an image. In order to submit a document that has been scanned, you must use a program to convert the image into text." (Wenn Sie das Dokument gescannt haben, das Sie einreichen möchten, ist es wahrscheinlich ein Bild. Um ein gescanntes Dokument einzureichen, müssen Sie ein Programm verwenden, das das Bild in Text umwandelt.)
Dieselbe Seite erklärt die zugrunde liegende Prüfung:
"The file you are trying to submit does not contain at least 20 words or 100 characters of text." (Die Datei, die Sie einreichen möchten, enthält nicht mindestens 20 Wörter oder 100 Zeichen Text.)
Die Lösung ist also nicht, denselben Scan in ein anderes Format zu exportieren. Die Lösung ist, das Bild in eine Textebene umzuwandeln – OCR – oder den Text direkt in das Eingabefeld einzufügen.
Wie sich eine gescannte Datei wirklich reparieren lässt
Die Anleitung von Turnitin selbst nennt den gangbaren Weg – in dieser Reihenfolge:
- Prüfen Sie, ob die Datei extrahierbaren Text enthält: Markieren Sie einen Teil des Textes und kopieren Sie ihn in einen einfachen Texteditor. Lässt sich nichts kopieren, ist die Datei ein Bild.
- Wandeln Sie das Bild mit einem OCR-Programm in Text um und lesen Sie das Ergebnis anschließend Korrektur – OCR kann falsche Zeichen erzeugen.
- Reichen Sie die umgewandelte, textbasierte Datei erneut ein – oder fügen Sie den Text direkt in das Textfeld der Aufgabe ein.
Die Grenze, auf die es ankommt: Das Format zu wechseln, etwa von PNG zu PDF, bringt nichts, solange der Text aus Pixeln besteht. Der Text muss als auswählbare Zeichen vorliegen, bevor die Verarbeitung ihn vergleichen kann.
Unterm Strich
Ein gescanntes PDF scheitert bei Turnitin aus einem dokumentierten Grund: Die Verarbeitung verlangt mindestens 20 Wörter extrahierbaren, auswählbaren Text, und eine gescannte Seite ist ein Bild. Die eigenen Seiten von Turnitin nennen das Minimum, sprechen die automatische Ablehnung bildbasierter PDFs aus und liefern den offiziellen Selbsttest: Lässt sich der Text nicht auswählen und kopieren, ist er für die Verarbeitung kein Text. Die Lösung heißt: Bild in Text umwandeln (OCR), Korrektur lesen oder den Text in das Eingabefeld einfügen – nicht denselben Scan in ein anderes Format exportieren. Wer die Regel versteht und die Datei auf die offizielle Weise prüft, für den ist die Fehlermeldung kein Rätsel mehr.
WEITERLESEN
Warum sich Ihr Turnitin-Ähnlichkeitswert nach dem Abgabedatum geändert hat – der Regenerierungsmechanismus
5 Min. Lesezeit
Turnitin-BerichteWas eine 0% Turnitin-Ähnlichkeitsrate wirklich bedeutet — Drei mögliche Interpretationen
4 Min. Lesezeit
Turnitin-BerichteWarum werden verschiedene Abschnitte meiner Arbeit mit unterschiedlichen AI-Prozentsätzen markiert? So funktioniert Turnitins Erkennungspipeline
5 Min. Lesezeit