Turnitin entraîne-t-il son IA avec votre travail ? Ce que dit la FAQ officielle
Une inquiétude fréquente chez les étudiants : Turnitin a mon travail, est-ce qu'ils entraînent leur IA avec ? Est-ce que je peux leur demander de le retirer ? La FAQ officielle ne répond à aucune des deux questions par un simple oui ou non. Elle indique que le modèle est entraîné sur un échantillon représentatif de textes académiques générés par IA et authentiques, plus un vaste corpus interne, sans jamais affirmer que les copies des étudiants en sont exclues. Sur la suppression, elle indique que les clients peuvent demander une suppression complète de leurs copies, mais pas de suppressions partielles. Cette page reprend le texte exact, ce qu'il promet et ce qu'il ne promet pas, et ce que cela signifie pour un étudiant qui veut sortir son travail du système.
L'équipe HumanPen
· 4 min de lecture
La réponse courte
La FAQ de Turnitin ne dit pas que la copie que vous déposez sert à entraîner son modèle de détection de l'IA — et elle ne dit pas non plus qu'elle en est exclue. Le texte officiel indique que le modèle est entraîné sur « a representative sample » (un échantillon représentatif) de textes académiques générés par IA et authentiques, et que les modèles de Turnitin sont aussi « trained on our vast inhouse corpus of academic data. » (entraînés sur notre vaste corpus interne de données académiques).
Ce sur quoi vous pouvez agir, c'est la suppression : la FAQ indique que les établissements peuvent demander une suppression complète de leurs copies, et que les suppressions partielles ne sont pas prises en charge. La FAQ présente cela comme une demande émanant de l'établissement et ne décrit aucune démarche individuelle permettant à un étudiant de retirer sa propre copie. Le fait de détenir par ailleurs un droit à l'effacement au titre du droit de la protection des données, comme le RGPD, est une question juridique que cette FAQ ne traite pas.
Le texte officiel sur l'entraînement
La FAQ de Turnitin sur la détection de l'IA répond à « How was Turnitin's model trained? » (Comment le modèle de Turnitin a-t-il été entraîné ?) par ceci :
« Our model is trained on a representative sample of data spread over a period of time, that includes both AI generated and authentic academic writing across geographies and subject areas. » (Notre modèle est entraîné sur un échantillon représentatif de données réparties sur une période de temps, qui comprend à la fois des écrits académiques générés par IA et authentiques, de différentes zones géographiques et de différentes disciplines.)
Une deuxième réponse de la FAQ, portant sur le modèle utilisé pour la détection, va plus loin :
« More importantly, our models are also trained on our vast inhouse corpus of academic data. » (Plus important encore, nos modèles sont également entraînés sur notre vaste corpus interne de données académiques.)
Aucune des deux phrases ne nomme les copies d'étudiants comme faisant partie des données d'entraînement, et aucune des deux ne les exclut. « Authentic academic writing » (écrits académiques authentiques) et « inhouse corpus of academic data » (corpus interne de données académiques) sont ce que le texte officiel fait de plus précis pour décrire d'où viennent les mots — et les deux formulations laissent ouverte la question de votre copie.
C'est toute l'histoire de la partie « entraînement » : la FAQ ne nie pas que les copies déposées puissent figurer dans les données d'entraînement, et elle ne le confirme pas non plus.
Le texte officiel sur la suppression
La question de la FAQ sur la suppression des données est traitée du point de vue du client, c'est-à-dire de l'établissement :
« Yes, customers can request a full deletion of their submissions; we cannot support partial data deletion requests to delete only the AI writing component of the submission data. » (Oui, les clients peuvent demander une suppression complète de leurs copies ; nous ne pouvons pas traiter de demandes de suppression partielle visant à effacer uniquement la composante d'écriture par IA des données de la copie.)
Il en découle deux conséquences.
Premièrement, la suppression est possible en principe, mais c'est l'établissement qui en fait la demande. Une université qui veut voir ses copies effacées peut demander la suppression complète des données qui lui appartiennent. Deuxièmement, vous ne pouvez pas supprimer uniquement la composante IA : il n'existe pas d'option « supprimer le score d'IA et garder la copie », et la FAQ ne décrit aucune démarche de suppression individuelle pour un étudiant.
La question « puis-je demander que mon travail soit retiré ? » a donc, si l'on s'en tient à ce que décrit cette FAQ, une réponse directe : pas par cette FAQ, qui ne prévoit qu'une démarche institutionnelle. Tout droit dont vous disposeriez directement relève du droit de la protection des données de votre juridiction, pas de ce document.
Ce que la FAQ dit sur le référentiel
La même FAQ contient la phrase que la plupart des étudiants cherchent en réalité, à propos d'une inquiétude très voisine :
« No, it does not. There is no separate repository for AI writing detection, and customers retain the ability to choose whether to add their student papers into the repository or not. » (Non, il n'en a pas. Il n'existe pas de référentiel distinct pour la détection de l'écriture par IA, et les clients conservent la possibilité de choisir d'ajouter ou non les copies de leurs étudiants au référentiel.)
Cela couvre le « référentiel de détection de l'IA » : l'idée que Turnitin classe votre copie dans une base de données spéciale dédiée à la détection de l'IA. La FAQ indique qu'il n'existe pas de référentiel distinct pour la détection de l'écriture par IA, et que la décision d'ajouter des copies au référentiel de similarité appartient à l'établissement.
Le mot « entraîner » n'apparaît pas dans cette réponse. Un référentiel de détection de l'IA et des données d'entraînement sont deux choses différentes, et la FAQ les maintient séparées : pas de référentiel distinct pour la détection, aucune déclaration sur l'entraînement.
Ce que cela change pour vous
Si vous êtes étudiant, que vous avez déposé une copie et que vous vous inquiétez maintenant de son utilisation, le résumé honnête est le suivant :
- La FAQ officielle ne confirme pas que votre copie entraîne le modèle, et ne promet pas non plus le contraire.
- Les déclarations officielles les plus proches décrivent les données d'entraînement comme « authentic academic writing » (écrits académiques authentiques) et un « inhouse corpus » (corpus interne), et aucune des deux n'exclut les copies d'étudiants.
- La suppression existe, mais c'est une suppression complète au niveau de l'établissement, pas un retrait au niveau de l'étudiant, et les suppressions partielles ne sont pas prises en charge.
- La réponse « pas de référentiel distinct » porte sur le stockage pour la détection de l'IA, pas sur l'entraînement.
Ce que vous pouvez faire de ces informations : si ce qui vous inquiète, ce sont les résultats de détection de l'IA sur votre propre copie, les questions pratiques sont la lecture du score et la nouvelle vérification, pas la propriété des données. Si votre inquiétude est institutionnelle, l'interlocuteur est l'administrateur Turnitin de votre université : c'est le « client » dont parle la FAQ lorsqu'elle évoque les demandes de suppression.
L'essentiel
La FAQ de Turnitin ne confirme ni n'infirme que les copies déposées entraînent ses modèles d'IA. Le texte officiel décrit les données d'entraînement comme un échantillon représentatif d'écrits académiques authentiques plus un vaste corpus interne, et ne dit rien qui exclue le travail des étudiants. Sur le retrait, la seule voie officielle est une demande au niveau de l'établissement pour une suppression complète — aucune suppression individuelle par un étudiant n'est décrite. Si vous voulez savoir à quoi votre établissement s'est engagé, la personne à qui demander est l'administrateur Turnitin de votre université, pas l'assistance de Turnitin directement.