Turnitin a refusé mon PDF numérisé : pourquoi les fichiers faits d'images échouent au dépôt
Vous avez numérisé votre brouillon imprimé, vous l'avez enregistré en PDF, et le dépôt a échoué avec "Your submission must contain 20 words or more." (votre dépôt doit contenir au moins 20 mots). Ou bien le fichier est parti, mais aucun rapport n'est jamais apparu. Les pages d'assistance de Turnitin décrivent exactement ce qui se passe : le circuit de traitement a besoin d'un texte extractible et sélectionnable, or une page numérisée est une image. Les exigences relatives au fichier, les messages d'erreur exacts et ce qui répare vraiment le fichier, à savoir convertir l'image en texte avant le dépôt, sont tous documentés. Cet article passe en revue les règles et la marche à suivre.
L'équipe HumanPen
· 4 min de lecture
Réponse courte
Un PDF numérisé, ou tout fichier constitué d'une image, échoue au dépôt parce que Turnitin exige un texte extractible et sélectionnable, et qu'une page numérisée est une image, pas du texte. La page d'assistance de Turnitin indique elle-même que le fichier doit contenir au moins 20 mots de texte extractible, et que les documents numérisés, les PDF constitués d'images, les formulaires ou les portfolios sont automatiquement rejetés. La solution est documentée elle aussi : convertissez l'image en texte avec un OCR avant le dépôt, ou collez le texte directement dans la zone de dépôt. Changer le format du fichier sans convertir l'image ne sert à rien.
Ce dont le circuit de traitement a réellement besoin
La page d'assistance de Turnitin "Why am I unable to submit my paper to Turnitin?" (pourquoi je n'arrive pas à soumettre mon devoir à Turnitin ?) liste les règles techniques que doivent respecter les fichiers censés produire un Similarity Report :
"Supported file types: Your file must be in a supported format (e.g., .docx, .pdf, .txt, .rtf)." (types de fichiers pris en charge : votre fichier doit être dans un format pris en charge, par exemple .docx, .pdf, .txt ou .rtf.)
"Size & length limits: The file must be under 100 MB and fewer than 800 pages." (limites de taille et de longueur : le fichier doit faire moins de 100 Mo et moins de 800 pages.)
"Minimum word count: The document must contain at least 20 words of extractable prose text." (nombre de mots minimum : le document doit contenir au moins 20 mots de texte extractible.)
"No images or scanned text: The text in your document must be selectable and copyable. Scanned documents, image-based PDFs, forms, or portfolios will be automatically rejected." (pas d'images ni de texte numérisé : le texte de votre document doit être sélectionnable et copiable. Les documents numérisés, les PDF constitués d'images, les formulaires ou les portfolios seront automatiquement rejetés.)
Le mot clé, c'est extractible. Le texte doit pouvoir être sélectionné au curseur et copié : le circuit de traitement lit la couche de texte du fichier, pas les pixels.
Le message d'erreur exact et ce qu'il signifie
L'erreur la plus fréquente dans ce cas est documentée dans le centre d'aide de Turnitin :
"The error message 'Your submission must contain 20 words or more' indicates that the file you are attempting to submit does not meet the minimum requirement of 20 words of extractable text." (le message d'erreur « Your submission must contain 20 words or more » indique que le fichier que vous essayez de déposer ne respecte pas l'exigence minimale de 20 mots de texte extractible.)
"This commonly occurs when the submitted document does not contain enough extractable text. For example, the file may consist primarily of images rather than selectable text, or it may contain fewer than 20 words." (cela se produit couramment lorsque le document déposé ne contient pas assez de texte extractible. Par exemple, le fichier peut être constitué principalement d'images plutôt que de texte sélectionnable, ou contenir moins de 20 mots.)
Le test officiel à faire soi-même est un simple copier-coller :
"Try highlighting the text in your document and copying and pasting it into another application. If you cannot select or copy the text, the document may contain images instead of extractable text." (essayez de surligner le texte de votre document, puis de le copier et de le coller dans une autre application. Si vous ne pouvez pas sélectionner ni copier le texte, c'est que le document contient peut-être des images au lieu de texte extractible.)
Si vous ne pouvez pas sélectionner et copier le texte, le fichier est une image du point de vue du circuit de traitement, quelle que soit la qualité apparente du scan.
Un fichier numérisé reste une image jusqu'à ce que vous le convertissiez
La page d'erreur de dépôt de Turnitin nomme le problème sans détour :
"If you scanned the document you are trying to submit, the document is likely an image. In order to submit a document that has been scanned, you must use a program to convert the image into text." (si vous avez numérisé le document que vous essayez de déposer, il s'agit probablement d'une image. Pour déposer un document numérisé, vous devez utiliser un programme qui convertit l'image en texte.)
La même page explique le contrôle sous-jacent :
"The file you are trying to submit does not contain at least 20 words or 100 characters of text." (le fichier que vous essayez de déposer ne contient pas au moins 20 mots ou 100 caractères de texte.)
La solution n'est donc pas « d'exporter le même scan dans un autre format ». La solution, c'est de convertir l'image en une couche de texte avec un OCR, ou de coller le texte directement dans la zone de dépôt.
Comment réparer vraiment un fichier numérisé
La propre documentation de Turnitin donne la marche à suivre, dans l'ordre :
- Vérifiez si le fichier contient du texte extractible : sélectionnez une partie du texte et copiez-la dans un éditeur de texte brut. Si rien ne se copie, le fichier est une image.
- Convertissez l'image en texte avec un logiciel d'OCR, puis relisez le résultat : l'OCR peut introduire des erreurs de caractères.
- Déposez à nouveau le fichier converti, désormais basé sur du texte, ou collez directement le texte dans le champ de saisie du devoir.
La limite qui compte : changer le format, par exemple de PNG à PDF, ne sert à rien si le texte reste des pixels. Le texte doit exister sous forme de caractères sélectionnables avant que le circuit de traitement puisse le comparer.
L'essentiel
Un PDF numérisé échoue au dépôt pour une raison documentée : le circuit exige au moins 20 mots de texte extractible et sélectionnable, et une page numérisée est une image. Les pages de Turnitin elles-mêmes fixent le minimum, nomment le rejet automatique des PDF constitués d'images et donnent le test officiel : si vous ne pouvez pas sélectionner et copier le texte, ce n'est pas du texte pour le circuit. La solution consiste à convertir l'image en texte avec un OCR et à le relire, ou à coller le texte dans la zone de dépôt, et non à réexporter le même scan dans un autre format. Comprenez la règle, vérifiez votre fichier à la manière officielle, et l'erreur cesse d'être un mystère.
CONTINUER LA LECTURE
Pourquoi votre score de similarité Turnitin a changé après la date limite — le mécanisme de régénération
5 min de lecture
Rapports de détectionCe que signifie vraiment un score Turnitin à 0 % — Trois lectures possibles
4 min de lecture
Rapports de détectionPourquoi différentes sections de mon devoir affichent-elles des pourcentages d'IA différents ? Le processus de détection de Turnitin expliqué
5 min de lecture