Turnitin ha rifiutato il mio PDF scansionato: perché i file basati su immagini non vengono accettati

Hai scansionato la tua bozza stampata, l'hai salvata come PDF e il caricamento è fallito con "Your submission must contain 20 words or more." (la tua consegna deve contenere almeno 20 parole). Oppure il file è stato caricato, ma il report non è mai comparso. Le pagine di supporto di Turnitin spiegano esattamente perché: la pipeline di consegna ha bisogno di testo estraibile e selezionabile, e una pagina scansionata è un'immagine. I requisiti del file, i messaggi di errore esatti e ciò che risolve davvero il problema, cioè convertire l'immagine in testo prima di consegnare, sono tutti documentati. Questo articolo passa in rassegna le regole e la soluzione.

Team HumanPen

· 4 min di lettura

Risposta breve

Un PDF scansionato, o qualsiasi file basato su immagini, non supera la consegna su Turnitin perché Turnitin richiede testo estraibile e selezionabile, e una pagina scansionata è un'immagine, non testo. La stessa pagina di supporto di Turnitin dichiara che il file deve contenere almeno 20 parole di testo estraibile e che i documenti scansionati, i PDF basati su immagini, i moduli e i portfolio vengono rifiutati automaticamente. Anche la soluzione è documentata: converti l'immagine in testo con un OCR prima di consegnare, oppure incolla il testo direttamente nel campo di consegna. Cambiare il formato del file senza convertire l'immagine non serve a nulla.

Ciò che serve davvero alla pipeline di consegna

La pagina di supporto di Turnitin "Why am I unable to submit my paper to Turnitin?" (perché non riesco a consegnare il mio elaborato su Turnitin?) elenca le regole tecniche per i file che dovrebbero generare un Similarity Report:

"Supported file types: Your file must be in a supported format (e.g., .docx, .pdf, .txt, .rtf)." (tipi di file supportati: il tuo file deve essere in un formato supportato, per esempio .docx, .pdf, .txt o .rtf.)
"Size & length limits: The file must be under 100 MB and fewer than 800 pages." (limiti di dimensione e lunghezza: il file deve essere sotto i 100 MB e avere meno di 800 pagine.)
"Minimum word count: The document must contain at least 20 words of extractable prose text." (numero minimo di parole: il documento deve contenere almeno 20 parole di testo estraibile.)
"No images or scanned text: The text in your document must be selectable and copyable. Scanned documents, image-based PDFs, forms, or portfolios will be automatically rejected." (niente immagini o testo scansionato: il testo nel tuo documento deve essere selezionabile e copiabile. I documenti scansionati, i PDF basati su immagini, i moduli e i portfolio verranno rifiutati automaticamente.)

La parola chiave è estraibile. Il testo deve poter essere selezionato col cursore e copiato: la pipeline legge il livello di testo del file, non i pixel.

Il messaggio di errore esatto e cosa significa

L'errore più comune in questo caso è documentato nel centro assistenza di Turnitin:

"The error message 'Your submission must contain 20 words or more' indicates that the file you are attempting to submit does not meet the minimum requirement of 20 words of extractable text." (il messaggio di errore «Your submission must contain 20 words or more» indica che il file che stai cercando di consegnare non soddisfa il requisito minimo di 20 parole di testo estraibile.)
"This commonly occurs when the submitted document does not contain enough extractable text. For example, the file may consist primarily of images rather than selectable text, or it may contain fewer than 20 words." (questo accade di solito quando il documento inviato non contiene abbastanza testo estraibile. Per esempio, il file può essere composto principalmente da immagini invece che da testo selezionabile, oppure può contenere meno di 20 parole.)

Il controllo ufficiale da fare da solo è una prova di copia e incolla:

"Try highlighting the text in your document and copying and pasting it into another application. If you cannot select or copy the text, the document may contain images instead of extractable text." (prova a evidenziare il testo nel tuo documento, a copiarlo e incollarlo in un'altra applicazione. Se non riesci a selezionare o copiare il testo, il documento potrebbe contenere immagini al posto di testo estraibile.)

Se non riesci a selezionare e copiare il testo, dal punto di vista della pipeline il file è un'immagine, indipendentemente da quanto la scansione appaia nitida a un essere umano.

I file scansionati restano immagini finché non li converti

La pagina degli errori di consegna di Turnitin dice il problema senza giri di parole:

"If you scanned the document you are trying to submit, the document is likely an image. In order to submit a document that has been scanned, you must use a program to convert the image into text." (se hai scansionato il documento che stai cercando di consegnare, molto probabilmente è un'immagine. Per consegnare un documento scansionato devi usare un programma che converta l'immagine in testo.)

La stessa pagina spiega il controllo sottostante:

"The file you are trying to submit does not contain at least 20 words or 100 characters of text." (il file che stai cercando di consegnare non contiene almeno 20 parole o 100 caratteri di testo.)

Quindi la soluzione non è «esportare la stessa scansione in un altro formato»: la soluzione è convertire l'immagine in un livello di testo con un OCR oppure incollare il testo direttamente nel campo di consegna.

Che altro fallisce insieme ai PDF scansionati

La pagina dei requisiti dei file di Turnitin raggruppa i rifiuti correlati:

"Turnitin will not accept PDF image files, forms, or portfolios, files that do not contain highlightable text (e.g. a scanned file - usually an image), documents containing multiple files or files created with software other than Adobe Acrobat." (Turnitin non accetta file PDF immagine, moduli o portfolio, file che non contengono testo evidenziabile, per esempio un file scansionato, di solito un'immagine, documenti che contengono più file o file creati con software diverso da Adobe Acrobat.)

La stessa guida raccomanda come dovrebbero essere creati i PDF:

"Turnitin recommends using Adobe Acrobat or Microsoft Word 365 to create PDF files. PDFs generated by other applications may not always be processed successfully." (Turnitin consiglia di usare Adobe Acrobat o Microsoft Word 365 per creare file PDF. I PDF generati da altre applicazioni potrebbero non essere sempre elaborati correttamente.)

Errori correlati che sembrano diversi ma hanno la stessa radice:

  • La prima pagina contiene un'immagine e nessun testo: il file può non essere elaborato affatto.
  • I file con immagini vettoriali dense possono richiedere troppo tempo o non essere elaborati.
  • I file protetti da password vengono rifiutati.

Tutti questi casi sono la stessa cosa: la pipeline non riesce a leggere il testo come le serve.

Come sistemare davvero un file scansionato

La guida di Turnitin indica la strada praticabile, in ordine:

  1. Controlla se il file ha testo estraibile: seleziona e copia una parte del testo in un editor di testo semplice. Se non si copia nulla, il file è un'immagine.
  2. Converti l'immagine in testo con un programma OCR, poi rileggi il risultato: l'OCR può introdurre errori nei caratteri.
  3. Invia di nuovo il file convertito, ora basato su testo, oppure incolla direttamente il testo nel campo di testo del compito.

Il confine che conta: cambiare formato, per esempio da PNG a PDF, non serve a nulla se il testo è ancora fatto di pixel. Il testo deve esistere come caratteri selezionabili prima che la pipeline possa confrontarlo.

In sintesi

Un PDF scansionato non supera la consegna su Turnitin per un motivo documentato: la pipeline richiede almeno 20 parole di testo estraibile e selezionabile, e una pagina scansionata è un'immagine. Le pagine di Turnitin indicano il minimo, dichiarano il rifiuto automatico dei PDF basati su immagini e forniscono il controllo ufficiale: se non riesci a selezionare e copiare il testo, per la pipeline non è testo. La soluzione è convertire l'immagine in testo con un OCR e rileggerlo, oppure incollare il testo nel campo di consegna, non riesportare la stessa scansione in un altro formato. Capisci la regola, controlli il file nel modo ufficiale e l'errore smette di essere un mistero.

CONTINUA A LEGGERE