Pourquoi Turnitin signale les propositions de recherche comme étant de l'IA
Les propositions de recherche sont des documents courts et structurés qui utilisent beaucoup de langage méthodologique et de résumés de littérature reformulés. Ces caractéristiques correspondent à ce que la documentation de Turnitin décrit comme sujet aux faux positifs. Voici comment fonctionne le mécanisme de détection pour les propositions, ce que les améliorations passées ont résolu, et pourquoi un seul score IA ne devrait jamais servir de base unique pour un jugement.
L'équipe HumanPen
· 5 min de lecture
En bref
Les propositions de recherche reposent sur un ensemble restreint de structures conventionnelles. Les sections méthodologiques décrivent des procédures standards, et Turnitin a signalé toute ma section méthodologique explique à quoi cela ressemble une fois que cela se produit. Les revues de littérature résument les travaux antérieurs sous forme reformulée. Ces modèles sont courants et correspondent à ce que la documentation de Turnitin identifie comme territoire de faux positifs. Les propositions courtes de seulement quelques centaines de mots rencontrent un risque supplémentaire : le détecteur les traite comme « tout ou rien » car il n'y a pas assez de texte pour le chevauchement des segments. Le résultat est que des propositions genuinely rédigées par des humains peuvent retourner des scores IA élevés sans aucune implication de l'IA.
Ce que dit Turnitin sur les faux positifs
La FAQ décrit des qualités de texte spécifiques qui peuvent déclencher des faux positifs :
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Parfois, les faux positifs — qui identifient à tort un texte écrit par un humain comme étant généré par l'IA — peuvent inclure du contenu sans beaucoup de variation structurelle, un texte qui se répète littéralement, ou un texte qui a été reformulé sans développer de nouvelles idées.)
Cette description correspond étroitement aux propositions de recherche. Une section méthodologique qui décrit l'échantillonnage intentionnel et les entretiens semi-directifs utilise un langage qui apparaît dans des milliers de propositions. Les revues de littérature condensent des études complexes en phrases de résumé, ce qui est de la reformulation par nature, et la reformulation a tendance à faire augmenter le score, comme l'explique pourquoi la reformulation fait augmenter votre score IA Turnitin. Aucune de ces activités ne développe de nouvelles idées à ce moment-là. La phrase suivante de la FAQ est importante :
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si notre indicateur affiche une quantité plus élevée de rédaction IA dans un tel texte, nous vous conseillons de prendre cela en considération lorsque vous examinez le pourcentage indiqué.)
C'est une reconnaissance explicite que le pourcentage seul ne suffit pas pour les documents ayant ces caractéristiques. Un score élevé sur une proposition doit être considéré comme un signal à examiner, pas comme un verdict définitif.
Comment fonctionne le mécanisme de détection
Pour comprendre pourquoi les propositions sont vulnérables, il faut examiner comment Turnitin traite une soumission :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score." (Lorsqu'un document est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections qui se chevauchent pour l'analyse de prédiction. Chaque segment est classifié par le modèle de détection IA et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit probablement humain ou généré par l'IA. Chaque phrase admissible dans ces segments hérite du score du segment.)
L'expression clé est « phrase admissible ». La FAQ précise ce qui compte comme texte admissible :
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Ce texte admissible comprend uniquement des phrases en prose, ce qui signifie que nous analysons seulement des blocs de texte écrits dans des phrases grammaticales standards et n'incluons pas d'autres types d'écriture tels que les listes, les puces (structures courtes non phrastiques) ou d'autres structures non phrastiques.)
Pour les propositions, cela signifie que les paragraphes de méthodologie, la prose des revues de littérature et le texte de justification narrative sont tous analysés. Les questions de recherche formatées en puces ou les tableaux chronologiques avec des entrées courtes ne le sont pas. L'écart entre ce qui est noté et ce qui apparaît sur la page peut prêter à confusion lorsque vous ne voyez que le pourcentage.
Documents courts et le problème du tout ou rien
De nombreuses propositions de recherche sont courtes. Une proposition de thèse peut faire entre 1 500 et 3 000 mots. Une section narrative de demande de subvention peut être encore plus courte. La FAQ aborde cela directement :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents plus courts contenant seulement quelques centaines de mots, la prédiction sera principalement « tout ou rien » car nous prédisons sur un seul segment sans possibilité de chevauchement.)
La phrase suivante rend la conséquence claire :
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Cela signifie qu'un texte mélangeant du contenu généré par l'IA et du contenu original pourrait être signalé comme entièrement généré par l'IA.)
Même les propositions de plus de quelques centaines de mots peuvent être affectées si la prose admissible est concentrée dans quelques paragraphes denses. Moins de segments signifient moins de moyenne, et un seul segment à score élevé peut faire grimper le pourcentage global de manière significative.
Ce que Turnitin a amélioré en 2023
Turnitin a apporté des modifications pour réduire certains faux positifs. Une note de publication de mai 2023 décrit une correction :
"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (Depuis le lancement, nous avons observé une incidence plus élevée de détection de faux positifs dans les premières ou dernières phrases d'un document. Souvent, ces phrases consistent en un contenu d'introduction ou de conclusion rédigé de manière générique. Par conséquent, nous avons modifié notre logique de détection pour aider à réduire ces faux positifs.)
Cette amélioration concerne les propositions car leurs introductions suivent souvent un schéma : énoncer le problème, décrire l'écart, présenter la question de recherche. La même note mentionne un autre raffinement :
"We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (Nous avons également travaillé à rendre la détection des limites de nos segments plus précise, ce qui pourrait entraîner dans de rares cas un changement de limites par rapport à une version précédente.)
Il s'agissait d'améliorations de 2023, pas de défauts actuels. Si vous compariez le score d'une proposition avant et après cette mise à jour, vous auriez pu constater une réduction. Les modèles structurels sous-jacents que nous avons décrits précédemment existent toujours dans la rédaction de propositions aujourd'hui.
Un seul score ne suffit pas
La FAQ est explicite sur les limites du score de rédaction IA :
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Notre modèle de détection de rédaction IA peut ne pas toujours être précis (il peut identifier à tort du texte écrit par un humain, généré par l'IA ou reformulé par l'IA), il ne devrait donc pas être utilisé comme seule base pour des actions défavorables contre un étudiant.)
La phrase suivante renforce cela :
"It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Il faut un examen plus approfondi et un jugement humain en conjonction avec l'application par une organisation de ses politiques académiques spécifiques pour déterminer s'il y a eu inconduite académique.)
Une source séparée de Turnitin présente le score comme un élément d'information parmi d'autres :
"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy." (Il n'est pas conçu pour fournir des réponses définitives de manière isolée. Plus important que n'importe quel outil, il y a l'éducateur qui voit le score et prend des décisions en équilibrant ces informations avec sa connaissance personnelle de ses étudiants, de leur travail et de la politique institutionnelle.)
La phrase suivante complète la pensée :
"When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended." (Lorsque les éducateurs examinent le score de rédaction IA et l'utilisent comme un simple point de données plutôt que comme une réponse définitive, alors il est utilisé comme prévu.)
Pour les propositions de recherche, cela signifie qu'un pourcentage élevé d'IA devrait susciter une conversation, pas une conclusion. Ce que votre instructeur doit faire lorsque votre pourcentage d'IA est élevé correspond aux directives du fournisseur que cette conversation est censée suivre.
Ce que cela signifie pour vous
Si votre proposition de recherche a reçu un score IA Turnitin élevé, voici ce qu'il faut garder à l'esprit :
- Les propositions utilisent un langage conventionnel, reformulé et structurellement uniforme que la FAQ identifie comme territoire de faux positifs.
- Les propositions courtes avec une prose limitée peuvent produire des prédictions « tout ou rien » car il y a trop peu de segments pour le chevauchement.
- Le pourcentage ne reflète que la prose admissible, pas votre document entier.
- Turnitin a amélioré la gestion des premières et dernières phrases en 2023, mais la vulnérabilité fondamentale du langage des propositions demeure.
- Le score IA devrait servir de point de données unique, pas de base unique pour le jugement.
Si vous souhaitez traiter les passages signalés, importez votre rapport Turnitin et travaillez-les. Les passages éligibles peuvent être réexécutés sans frais.