Turnitin détecte-t-il l'IA dans un PDF ?
La plupart des gens arrivent à cette question par la bande. Le portail de rendu veut un PDF, ou la revue veut un PDF, et chemin faisant vous commencez à vous demander si le format lui-même change ce qu'un détecteur voit. Il change moins que vous ne le pensez, et ce qu'il change n'est pas ce qu'on met en avant.
L'équipe HumanPen
· 5 min de lecture
La réponse courte
Oui. Le PDF fait partie des quatre types de fichiers acceptés par Turnitin pour un AI Writing Report, aux côtés de .docx, .txt et .rtf. Déposer un PDF ne retire pas votre document de l'analyse d'écriture par IA. Ce que le format change, c'est le contenu de votre fichier, et cela a de vraies conséquences ailleurs dans votre dépôt.
La liste des types de fichiers acceptés
Tiré directement des exigences relatives aux fichiers pour un AI Writing Report :
« Accepted file types: .docx, .pdf, .txt, .rtf » (types de fichiers acceptés : .docx, .pdf, .txt, .rtf)
La même courte liste fixe aussi la règle de langue : « File must be written in a supported language: English, Spanish, Japanese » (le fichier doit être rédigé dans une langue prise en charge : anglais, espagnol, japonais). Cette ligne a quelques jours de retard sur le produit — l'arabe moderne standard a été ajouté le 18 août 2026 et la page des exigences n'a pas été retouchée depuis —, comptez donc quatre langues. Si c'est la règle de langue qui vous intéresse et non le format, nous l'avons décortiquée à part dans Turnitin peut-il détecter l'IA dans des copies rédigées dans d'autres langues.
C'est toute la réponse sur la question du format. Il n'existe pas de filière PDF distincte, pas de traitement plus léger, rien dans les exigences publiées qui traite un type accepté différemment d'un autre.
Ce que le rapport lit à l'intérieur de votre PDF
La même chose que dans un fichier Word : de la prose. Turnitin l'appelle qualifying text et la décrit sur la page consacrée aux questions fréquentes sur la détection.
« This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. » (ce texte admissible ne comprend que des phrases de prose, c'est-à-dire que nous n'analysons que les blocs de texte rédigés en phrases grammaticales complètes, à l'exclusion d'autres types d'écriture comme les listes, les puces — structures courtes qui ne sont pas des phrases — ou d'autres structures qui n'ont pas la forme d'une phrase.)
Ensuite : « This percentage is not necessarily the percentage of the entire submission. » (ce pourcentage n'est pas nécessairement celui de l'ensemble du dépôt).
Le pourcentage affiché sur le PDF d'un mémoire est donc une statistique portant sur la prose continue qu'il contient, et non sur les pages. Turnitin indique ailleurs qu'un document réunissant plusieurs types d'écriture « would result in a disparity between the percentage and the highlights » (entraînerait un écart entre le pourcentage et les surlignages) ; c'est la raison documentée pour laquelle vos passages surlignés ne semblent jamais correspondre au chiffre. Pour aller plus loin sur la lecture de cet écart : comment lire un rapport d'écriture IA de Turnitin.
Les tableaux et la bibliographie
Deux points précis qui comptent pour tout ce qui a la forme d'un mémoire, tous deux tirés des notes de version du modèle de détection de l'écriture IA de Turnitin.
La prose présente dans les tableaux est traitée : « We are now able to process long-form prose text in tables. » (nous sommes désormais capables de traiter la prose longue dans les tableaux). La ligne suivante ajoute la condition qu'on oublie : « Resubmit to reprocess existing submissions that contain tables. » (redéposez le travail pour retraiter les dépôts déjà existants qui contiennent des tableaux). Les rapports déjà produits ne se mettent pas à jour tout seuls.
Les bibliographies sont exclues : « We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report. » (nous avons corrigé un bug qui surlignait occasionnellement de l'écriture IA à l'intérieur des références listées dans une bibliographie. Les bibliographies sont désormais exclues lors du traitement du rapport d'écriture IA.) Même réserve, mêmes mots : « Resubmit to reprocess existing submissions that contain highlighted reference sections. » (redéposez le travail pour retraiter les dépôts déjà existants qui contiennent des sections de références surlignées.)
Si vous avez devant vous un rapport dont la bibliographie est surlignée, vérifiez la date de génération avant de conclure quoi que ce soit sur vos références. Vérifiez aussi quel rapport vous tenez : la documentation de Turnitin indique que les surlignages d'écriture IA « are not visible in the Similarity Report » (ne sont pas visibles dans le Similarity Report), et des entrées de référence concordantes sont monnaie courante dans un rapport de similarité, puisqu'un style citationnel sert précisément à faire formater la même source de la même façon par tout le monde.
Ce qu'un export au format PDF change réellement
Pas la détection. Le document.
Exporter en PDF aplatit la mécanique d'un fichier Word : les champs, la table des matières générée, les renvois et la numérotation automatique cessent d'être des objets vivants pour devenir du texte imprimé. Cela compte si vous avez encore des révisions devant vous, et cela compte davantage quand le trajet se fait dans l'autre sens, parce que faire sortir du texte d'un PDF pour le remettre dans un document est précisément l'endroit où la numérotation et la structure se cassent sans faire de bruit (ce qui se casse dans un document long).
La règle pratique est ennuyeuse. Continuez à réviser dans le fichier source. Exportez le PDF en dernier, à partir de la version que vous déposez réellement.
La taille du document change le comportement
Une ligne à garder en tête :
« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » (dans les documents courts, qui ne comptent que quelques centaines de mots, la prédiction sera surtout « tout ou rien », car nous prédisons sur un seul segment, sans possibilité de chevauchement.)
Et ce qui la suit : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (cela signifie qu'un texte mêlant du contenu généré par l'IA et du contenu original peut être signalé comme entièrement généré par l'IA.) Un PDF d'une page n'est pas une version réduite de la même mesure. C'est une mesure plus grossière.
Que vous voyiez seulement un score
Deux barrières distinctes, et aucune ne concerne votre fichier. Turnitin indique que la détection de l'écriture IA « is only be available to customers that license Turnitin Originality » (n'est disponible que pour les clients titulaires d'une licence Turnitin Originality ; la grammaire est de leur fait), avec une voie d'accès complémentaire pour les comptes iThenticate 2.0. Et il précise que seuls les enseignants et les administrateurs peuvent voir l'indicateur, en ajoutant que « with the PDF download feature, instructors can download and share the AI report with students » (avec la fonction de téléchargement PDF, les enseignants peuvent télécharger le rapport IA et le partager avec les étudiants).
Ce dernier point est le PDF que la plupart des étudiants finissent réellement par avoir entre les mains : un PDF du rapport, et non un PDF qu'ils ont déposé. Cela vaut la peine de préciser duquel des deux il est question.
Questions fréquentes
Déposer un PDF est-il plus sûr que déposer un fichier Word ? Non. Les deux figurent sur la même liste de formats acceptés, et l'analyse décrite dans la documentation de Turnitin ne les distingue pas.
Et un PDF qui ne contient que des images de pages scannées ? Il n'y a aucune prose à extraire d'une image, et voir là un moyen de passer au travers est déjà une mauvaise idée en soi. Un PDF fait d'images de pages ne peut être ni fouillé, ni cité, ni annoté par la personne qui le lit, ce qui est généralement une exigence de dépôt quelque part dans les documents. Et la position de Turnitin elle-même est que le score d'IA « should not be used as the sole basis for adverse actions against a student » (ne doit pas servir de seul fondement à des mesures défavorables envers un étudiant) : c'est donc la personne, et non la statistique, qui décide. Faire disparaître la statistique ne fait pas disparaître la personne qui lit.
Mon PDF a un score de similarité mais aucun pourcentage d'IA. Les deux sont indépendants. La documentation de Turnitin indique que le score de similarité et le pourcentage d'écriture IA « are completely independent and do not influence each other » (sont totalement indépendants et ne s'influencent pas l'un l'autre). Des chiffres d'IA manquants renvoient à la licence, aux règles de langue ou à la question de savoir qui est autorisé à voir l'indicateur, pas à votre fichier (la différence en détail).
Un PowerPoint exporté en PDF reçoit-il un rapport IA ? Le PDF figure sur la liste des formats acceptés, donc mécaniquement oui. Mais les diapositives sont surtout faites de puces, et les puces ne sont pas du texte admissible : la prose sur laquelle le rapport peut travailler peut donc ne représenter qu'une petite fraction de ce qui figure sur les diapositives.
CONTINUER LA LECTURE