Turnitin détecte-t-il Perplexity AI ? Ce que dit la documentation
Les étudiants se demandent si le contenu généré par Perplexity AI sera repéré par Turnitin. La FAQ publie une liste des modèles dont elle peut détecter le contenu et annonce qu'elle va continuer à s'étendre. La liste couvre les outils bâtis sur les LLM cités. Voici ce que la documentation dit réellement.
L'équipe HumanPen
· 4 min de lecture
La réponse courte
La FAQ de Turnitin publie une liste de modèles d'écriture par IA dont elle peut détecter le contenu, parmi lesquels GPT, Gemini, Claude, LLaMA, Mistral, Deepseek, Nova, Grok et o1-mini. La liste se termine par « and tools based on these LLMs as well. » (ainsi que les outils basés sur ces LLM.) La FAQ indique également : « We will continue to expand our detection capabilities to other models in the future. » (Nous continuerons à étendre nos capacités de détection à d'autres modèles à l'avenir.) Perplexity AI est un outil de recherche capable de générer du texte à l'aide de modèles de langage sous-jacents. Que le détecteur de Turnitin signale ou non un contenu issu de Perplexity dépend du modèle sous-jacent qui a produit le texte et du fait que ce modèle ou sa famille figure sur la liste de détection. La FAQ reconnaît que les capacités de détection ne sont pas figées : « As we iterate and develop our model further to better detect newer LLMs, it is likely that our detection capabilities will also change, affecting the AI percentage. » (À mesure que nous faisons évoluer et développons notre modèle pour mieux détecter les LLM plus récents, il est probable que nos capacités de détection changent elles aussi, ce qui affectera le pourcentage d'IA.)
Ce que couvre la liste de modèles
La FAQ fournit une liste des modèles dont elle peut détecter le contenu. La phrase d'introduction emploie la formulation « peut détecter le contenu de », suivie d'une liste séparée par des virgules. La liste inclut les grandes familles de LLM : GPT, Gemini, Claude, LLaMA, Mistral, Deepseek, Nova, Grok et o1-mini. Elle se conclut ainsi :
« and tools based on these LLMs as well. » (ainsi que les outils basés sur ces LLM.)
La phrase suivante : « We will continue to expand our detection capabilities to other models in the future. » (Nous continuerons à étendre nos capacités de détection à d'autres modèles à l'avenir.)
Cela signifie que la liste couvre non seulement les modèles nommés, mais aussi les outils bâtis dessus. Si un outil comme Perplexity AI fait transiter sa génération de texte par l'une des familles de LLM listées, le résultat peut relever de la clause « outils basés sur ces LLM ». Turnitin détecte-t-il Claude, Copilot ou Gemini ? passe en revue les entrées nommées.
Comment fonctionne le détecteur
Le modèle de détection traite le texte en le divisant en segments chevauchants et en attribuant des scores de probabilité :
« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. » (Lorsqu'un devoir est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections chevauchantes pour l'analyse de prédiction. Chaque segment est classé par le modèle de détection d'IA et reçoit une valeur comprise entre 0 et 1, qui désigne la probabilité que le texte soit plutôt humain ou généré par l'IA.)
Le modèle n'est pas programmé pour évaluer la burstiness ou la perplexité en tant que métriques nommées : « Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. » (Notre modèle n'est pas explicitement programmé pour évaluer des signaux spécifiques tels que 'burstiness,' 'perplexity,' ou d'autres métriques individuelles parfois évoquées dans les discussions publiques.) La phrase suivante : « Instead, it learns statistical patterns from our training data. » (Au contraire, il apprend des régularités statistiques à partir de nos données d'entraînement.) La même FAQ indique : « Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers. » (Nos classifieurs sont entraînés à détecter ces différences de probabilité des mots et connaissent bien les séquences de probabilité de mots propres aux rédacteurs humains.) Le détecteur évalue donc des régularités de probabilité des mots apprises des données d'entraînement, et non des métriques de surface. La collision de noms mérite d'être éclaircie à part : Turnitin utilise-t-il la perplexité et la burstiness ?
Les capacités de détection évoluent
La FAQ indique explicitement que la détection n'est pas figée :
« As we iterate and develop our model further to better detect newer LLMs, it is likely that our detection capabilities will also change, affecting the AI percentage. » (À mesure que nous faisons évoluer et développons notre modèle pour mieux détecter les LLM plus récents, il est probable que nos capacités de détection changent elles aussi, ce qui affectera le pourcentage d'IA.)
La phrase suivante : « However, for a submitted document, the AI percentage will change only if it's re-submitted again to be processed. » (Cependant, pour un document déjà soumis, le pourcentage d'IA ne changera que s'il est soumis à nouveau pour être traité.)
Cela signifie que le modèle de détection est mis à jour pour cibler les LLM plus récents. Si Perplexity AI ou un autre outil utilise un nouveau modèle qui ne figure pas encore sur la liste, un décalage peut subsister jusqu'à la prochaine mise à jour du modèle de détection. Les documents déjà notés ne sont pas réévalués automatiquement.
Ce que le détecteur peut manquer
La FAQ reconnaît un compromis :
« In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. » (Afin de maintenir ce faible taux de 1 % de faux positifs, il se peut que nous manquions une partie du texte rédigé par IA dans un document.)
Le détecteur est réglé pour éviter les faux positifs, même au prix de manquer une partie du texte d'IA. Un outil produisant un texte dont les régularités de probabilité des mots se rapprochent de l'écriture humaine serait plus difficile à détecter, du moins jusqu'à la mise à jour du modèle de détection. La promesse de « continue to expand our detection capabilities » (continuer à étendre nos capacités de détection) fait contrepoids, mais il existe un décalage inhérent entre la sortie de nouveaux outils et la couverture de détection. Ce même décalage explique si Turnitin détecte les humaniseurs d'IA.
Ce que cela signifie pour vous
Pour résumer ce que nous avons vu :
- Turnitin publie une liste de modèles dont il peut détecter le contenu, parmi lesquels GPT, Gemini, Claude et d'autres.
- La liste couvre « tools based on these LLMs as well, » (les outils basés sur ces LLM également,) donc les outils qui passent par des modèles listés peuvent être détectables.
- La FAQ promet d'étendre la détection à d'autres modèles à l'avenir.
- Les capacités de détection évoluent avec le temps, au fil des mises à jour du modèle.
- Le détecteur accepte de manquer une partie du texte d'IA en échange d'un faible taux de faux positifs.
- Les documents déjà notés ne sont pas réévalués automatiquement lorsque le modèle change.
Si vous recevez un rapport d'IA Turnitin et souhaitez traiter les passages signalés, importez le rapport et travaillez dessus. Les passages éligibles peuvent être relancés gratuitement.
CONTINUER LA LECTURE