Étudiants internationaux et résultats AI : ce qu'il faut savoir sur l'écriture en langue seconde
Rédiger en anglais académique quand ce n'est pas sa langue maternelle, c'est déjà assez difficile sans s'inquiéter de la détection AI. La FAQ de Turnitin indique que les données d'entraînement ont intégré des apprenants en langue seconde pour limiter les biais. Mais le détecteur analyse toujours les schémas de probabilité des mots, et certaines caractéristiques d'écriture exposent à des faux positifs. Voici ce que cela implique pour les étudiants internationaux.
L'équipe HumanPen
· 4 min de lecture
En bref
La FAQ de Turnitin affirme que les données d'entraînement du modèle ont « took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model » (tenu compte de groupes statistiquement sous-représentés tels que les apprenants en langue seconde, les utilisateurs d'anglais originaires de pays non anglophones, les étudiants inscrits dans des collèges et universités aux effectifs diversifiés, ainsi que des disciplines moins courantes comme l'anthropologie, la géologie, la sociologie et d'autres, afin de minimiser les biais lors de l'entraînement de notre modèle). Il s'agit d'une affirmation de Turnitin elle-même, pas d'une conclusion vérifiée de manière indépendante. L'inclusion dans l'ensemble d'entraînement signifie que le modèle a été exposé à des écrits en langue seconde pendant son entraînement. Mais le détecteur fonctionne toujours en classifiant les schémas de probabilité des mots dans le texte. Si votre écriture partage des schémas statistiques avec de l'anglais généré par AI, le détecteur peut la signaler, que l'anglais soit ou non votre langue maternelle. Comprendre cet écart entre l'affirmation sur l'entraînement et le mécanisme de détection est essentiel pour répondre à un signalement.
Ce que Turnitin affirme sur les biais
La FAQ aborde directement la question des biais :
« While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model. » (« Lors de la création de notre ensemble de données échantillon, nous avons également tenu compte de groupes statistiquement sous-représentés tels que les apprenants en langue seconde, les utilisateurs d'anglais originaires de pays non anglophones, les étudiants inscrits dans des collèges et universités aux effectifs diversifiés, ainsi que des disciplines moins courantes comme l'anthropologie, la géologie, la sociologie et d'autres, afin de minimiser les biais lors de l'entraînement de notre modèle. »)
Voici la déclaration de l'entreprise elle-même concernant sa méthodologie d'entraînement. Elle indique que les données d'entraînement ont été conçues pour inclure des échantillons d'écriture diversifiés. Mais elle ne fournit aucun chiffre, aucun résultat de test, ni aucune validation externe des niveaux de biais. L'affirmation est que l'écriture en langue seconde était représentée dans l'entraînement. Ce que l'affirmation ne dit pas, c'est que l'écriture en langue seconde est immunisée contre les faux positifs. Le modèle a été entraîné sur des données diversifiées, mais il classe toujours selon les schémas de probabilité des mots. Pourquoi les rédacteurs non natifs en anglais sont plus souvent signalés par les détecteurs AI passe en revue la recherche sur cet écart.
Comment le détecteur lit votre texte
Le pipeline de détection fonctionne de la même manière, quel que soit l'auteur du texte :
« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score. » (« Lorsqu'un document est soumis à Turnitin, des phrases de la soumission sont extraites et segmentées en sections qui se chevauchent pour l'analyse de prédiction. Chaque segment est classifié par le modèle de détection AI et reçoit une valeur entre 0 et 1, indiquant la probabilité que le texte soit généré par un humain ou par AI. Chaque phrase admissible dans ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul score. Ces scores par phrase sont encore agrégés et utilisés pour calculer le score global AI du document. »)
Le détecteur ne connaît pas votre parcours linguistique. Il n'ajuste pas sa classification selon que vous êtes locuteur natif ou non natif de l'anglais. Il lit les caractéristiques statistiques de vos séquences de mots et les classe. Si vos schémas d'écriture en anglais, peut-être influencés par une formation formelle qui met l'accent sur certaines phrases et structures académiques, chevauchent les schémas que le modèle associe au texte généré par AI, le score peut être plus élevé que prévu.
Faux positifs et écriture en langue seconde
La FAQ liste les caractéristiques de texte sujettes aux faux positifs :
« Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. » (« Parfois, les faux positifs (textes rédigés par des humains incorrectement signalés comme générés par AI) peuvent inclure du contenu sans grande variation structurelle, du texte qui se répète littéralement, ou du texte qui a été reformulé sans développer de nouvelles idées. »)
La phrase suivante : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (« Si notre indicateur affiche une quantité plus élevée d'écriture AI dans un tel texte, nous vous conseillons de prendre cela en compte lors de l'examen du pourcentage indiqué. »)
Certaines de ces caractéristiques peuvent être plus fréquentes dans l'écriture académique en langue seconde. Les locuteurs non natifs apprennent souvent l'anglais par le biais de modèles structurés et de phrases académiques répétées, ce qui peut produire une écriture avec moins de variation structurelle. Des transitions comme « moreover, » « furthermore, » et « in addition » sont enseignées comme connecteurs standard, et leur usage répété peut produire le genre de structure uniforme que décrit la FAQ. Cela ne signifie pas que l'écriture en langue seconde est toujours signalée. Cela signifie que les caractéristiques associées aux faux positifs peuvent chevaucher les schémas courants dans l'écriture en langue seconde issue d'un enseignement formel. Savoir s'il faut écrire différemment est une autre question : devez-vous changer votre façon d'écrire pour éviter d'être signalé.
Vous ne pouvez pas voir votre propre score
Autre point que les étudiants internationaux doivent connaître. La FAQ déclare : « only instructors and administrators are able to see the indicator » (« seuls les enseignants et les administrateurs peuvent voir l'indicateur »). Les étudiants ne peuvent pas consulter leur propre score AI. La FAQ poursuit : « However, with the PDF download feature, instructors can download and share the AI report with students » (« Cependant, grâce à la fonction de téléchargement PDF, les enseignants peuvent télécharger et partager le rapport AI avec les étudiants »). Si vous vous inquiétez de votre score, le seul moyen de le voir est de demander à votre enseignant de vous partager le rapport PDF. Vous ne pouvez pas effectuer la même vérification vous-même via un compte étudiant. Une fois le PDF en main, comment lire un rapport AI Turnitin est l'étape suivante.
Que faire si vous êtes signalé
Pour résumer ce que nous avons vu :
- Turnitin affirme que ses données d'entraînement ont inclus des apprenants en langue seconde pour minimiser les biais, mais ne fournit aucun chiffre pour vérifier cette affirmation.
- Le détecteur lit les schémas de probabilité des mots quel que soit l'auteur du texte ou sa langue maternelle.
- Les caractéristiques sujettes aux faux positifs, comme la faible variation structurelle, peuvent chevaucher les schémas courants dans l'écriture académique en langue seconde.
- Les étudiants ne peuvent pas voir leur propre score AI. Seuls les enseignants le peuvent, mais ils peuvent partager le PDF.
- Le score AI et le score de similarité sont des mesures indépendantes.
Si vous avez un rapport Turnitin montrant quels passages ont été signalés, importez le rapport et travaillez sur ces passages spécifiques. Les passages éligibles peuvent être relancés sans frais supplémentaires.
CONTINUER LA LECTURE