Turnitin hat den eigenen Detektor auf Vorurteile gegenüber Englischlernenden getestet. Das Ergebnis hat zwei Hälften.

Bei Einreichungen über 300 Wörtern meldet Turnitin, dass der Unterschied zwischen L2- und L1-Schreibenden klein und statistisch nicht signifikant ist. Bei Einreichungen zwischen 150 und 300 Wörtern fand dieselbe Auswertung einen größeren Unterschied, deutlich über dem eigenen Zielwert von 1 %. Und Turnitin nennt eine Einschränkung zur eigenen Stichprobe, die zählt, wenn Sie auf Universitätsniveau schreiben.

HumanPen-Team

· 6 Min. Lesezeit

Die kurze Antwort, mit beiden Hälften

Turnitin hat genau diese Frage selbst untersucht und das Ergebnis veröffentlicht. Die Antwort hat zwei Hälften, und sie weisen in entgegengesetzte Richtungen.

Bei Einreichungen ab 300 Wörtern war der Unterschied in der Falsch-Positiv-Rate (FPR) zwischen L2- und L1-Schreibenden klein und statistisch nicht signifikant. Bei Einreichungen zwischen 150 und 300 Wörtern stellte dieselbe Auswertung einen größeren Unterschied fest, deutlich über dem eigenen Zielwert von 1 %.

Ob Sie von dem beruhigenden Befund erfasst werden, hängt also davon ab, wie lang das war, was Sie eingereicht haben. Es gibt außerdem eine Einschränkung, die Turnitin zur eigenen Stichprobe nennt; sie zählt, wenn Sie auf Universitätsniveau schreiben, und sie steht weiter unten.

Was getestet wurde

Turnitin zog für jede Kombination zweier Variablen bis zu 2,000 Texte heran: L2-Englisch (Englisch als Fremdsprache, English Language Learner) gegen L1-Englisch (englische Muttersprache) sowie „zu kurz" (zwischen 150 und 300 Wörtern) gegen „lang genug" (300 Wörter oder mehr). Die Datensätze gehörten nicht zum Trainingsdatensatz ihres Detektors.

Das Ergebnis, das es in die Schlagzeile schafft

Für Dokumente, die das Minimum von 300 Wörtern erreichen, meldet Turnitin, dass der Unterschied in der Falsch-Positiv-Rate zwischen L2- und L1-Schreibenden klein und statistisch nicht signifikant ist:

"For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target." (Bei Dokumenten, die unsere Mindestwortzahl von 300 Wörtern erfüllen, ist der Unterschied in der Falsch-Positiv-Rate (FPR) zwischen englischen L2-Schreibenden (ELL) und englischen L1-Schreibenden (Muttersprachlerinnen und Muttersprachlern) gering und statistisch nicht signifikant, was zeigt, dass unser Detektor zwischen diesen beiden Gruppen nicht verzerrt. Zudem liegt die FPR jeder Gruppe zwar etwas über unserem Gesamtzielwert von 0,01 (1 %), weicht aber in keiner der beiden Gruppen signifikant von diesem Zielwert ab.)

„Not statistically significant" (statistisch nicht signifikant) heißt, dass der gefundene Unterschied Zufall sein könnte. Es heißt nicht, dass der Unterschied null ist, und es heißt nicht, dass es keine Verzerrung gibt. Und die Falsch-Positiv-Rate beider Gruppen lag über dem Zielwert von 1 %, nur nicht in einem Ausmaß, das der Test als bedeutsam einstufte. „Slightly higher" (etwas höher) ist nicht dasselbe wie „at or below." (auf dem Zielwert oder darunter).

Das Ergebnis, das es nicht in die Schlagzeile schafft

Bei Dokumenten zwischen 150 und 300 Wörtern fand dieselbe Auswertung das Gegenteil. Der Unterschied zwischen L2- und L1-Schreibenden war größer, und die Falsch-Positiv-Rate lag signifikant über dem Zielwert von 1 %:

"Conversely, for documents that are (Umgekehrt gilt für Dokumente, die als) "too short," („zu kurz" gelten:) we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum." (In diesen Fällen haben wir einen größeren Unterschied in der FPR zwischen diesen beiden Gruppen von Schreibenden festgestellt, und er liegt signifikant über unserem Zielwert von 0,01 FPR. Das bestätigt erneut unsere frühere Erkenntnis, dass Detektoren für KI-Texte längere Textproben brauchen, um KI-generierte Inhalte korrekt zu erkennen und falsch positive Ergebnisse möglichst gering zu halten.)

Dieselbe Untersuchung, am selben Detektor, ergab ein Ergebnis für längere Texte und ein anderes für kürzere. Die Überschrift des Blogbeitrags trägt das eine. Das andere steht im Textkörper.

Was tatsächlich in der Stichprobe steckte

Turnitin schreibt dazu:

"Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation." (Die meisten englischen L2-Dokumente sind kurze überzeugende oder informierende Schreibaufgaben, die dem Essaykorpus der Sekundarstufe aus dem Automated Scoring and Assessment Prize (ASAP) am nächsten kommen. Eine vergleichbare Sammlung öffentlich zugänglicher vollständiger Texte auf Universitätsniveau von L2- und L1-Schreibenden stand für diese Auswertung nicht zur Verfügung.)

Die L2-Texte in dieser Auswertung sind überwiegend Essays auf dem Niveau der Sekundarstufe. Wenn Sie eine Universitätsarbeit schreiben, eine Literaturübersicht, einen Laborbericht, ein Kapitel Ihrer Abschlussarbeit, dann ist das nicht das, was getestet wurde. Turnitin sagt, dass sie keine öffentlich zugängliche Sammlung von Texten auf Universitätsniveau von L2- und L1-Schreibenden finden konnten, um diesen Vergleich damit durchzuführen. Der Befund „not statistically significant" (statistisch nicht signifikant) gilt für kurze überzeugende und informierende Essays auf Sekundarstufenniveau. Ob er auch für die Art von Dokument gilt, die Sie tatsächlich einreichen, kann diese Auswertung nicht beantworten.

Die Grenze von 300 Wörtern

Turnitin führt die Mindestlänge von 300 Wörtern direkt auf diese Untersuchung zurück. Nach der Auswertung von 800,000 Dokumenten und dem Befund, dass kurze Einreichungen die Falsch-Positiv-Rate nach oben trieben, verlangten sie 300 Wörter:

"Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission." (Unsere Auswertung von 800,000 Dokumenten, weiter oben in diesem Blog erwähnt, zeigt bei kurzen Einreichungen (unter 300 Wörtern) eine etwas höhere Falsch-Positiv-Rate, als uns lieb ist. In so kurzen Textproben stecken möglicherweise nicht genug Signal und nicht genug Merkmale, um die verräterischen Verteilungsunterschiede von KI-Texten zu erkennen. Um sicherzustellen, dass unsere Falsch-Positiv-Rate unter 1 % bleibt, haben wir die Mindestlänge für Einreichungen, die unsere Prüfung auf KI-Text bearbeitet, zügig auf 300 Wörter angehoben.)

Die Mindestlänge existiert, weil kurze Texte Probleme gemacht haben. Der beruhigende Befund gilt nur oberhalb dieser Schwelle. Unterhalb hat dieselbe Auswertung genau den Unterschied gefunden, den Sie kennen sollten.

Und die Studie von Liang?

Vielleicht haben Sie Schlagzeilen zu einer Studie von Liang gelesen. Turnitin geht direkt darauf ein:

"Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short." (Liangs Behauptung stützt sich auf eine kleine Sammlung von gerade einmal 91 Übungsessays für den TOEFL (Test of English as a Foreign Language), die alle kürzer als 150 Wörter sind. Die Prüfung auf KI-Text von Turnitin war in diese Auswertung nicht einbezogen, vielleicht auch deshalb, weil wir für so kurze Dokumente keine Vorhersagen abgeben.)

Was Sie daraus machen können

Liegt Ihre Einreichung über 300 Wörtern, sagen die eigenen Daten von Turnitin: Der Unterschied zwischen den Falsch-Positiv-Raten von L2 und L1 ist klein und statistisch nicht signifikant. Das ist keine Garantie, dass Sie nicht markiert werden. Es heißt, dass die Auswertung keine starken Belege dafür gefunden hat, dass L2-Schreibende systematisch schlechter dastehen, jedenfalls nicht in der Stichprobe, die sie hatten.

Was Sie tatsächlich nutzen können:

Prüfen Sie vor dem Einreichen Ihre Wortzahl. Wird ein Abschnitt unter 300 Wörtern markiert, sagt die Auswertung des Detektors selbst, dass kurze Texte einen größeren Unterschied zwischen L2- und L1-Schreibenden und insgesamt eine höhere Falsch-Positiv-Rate erzeugen. Sie können Ihre Dozentin oder Ihren Dozenten bitten, die Prüfung auf dem vollständigen Dokument laufen zu lassen statt auf einem kurzen Auszug.

Fragen Sie, was Sie markiert hat und bei welchem Schwellenwert. Wenn Turnitin eingesetzt wurde, sind die Mindestlänge von 300 Wörtern und die Angabe „slightly higher than 1%" (etwas über 1 %) konkrete Punkte, die Sie bei der Person ansprechen können, die den Flag prüft.

Bewahren Sie Ihre Entwürfe, Notizen und Quellen auf. Wenn Sie markiert werden und glauben, dass Ihr Englisch als Zweitsprache eine Rolle gespielt hat, dann sind es Ihre Überarbeitungshistorie und Ihre Unterlagen, die das Gespräch klären. Mit Ihrer Professorin oder Ihrem Professor über statistische Signifikanz zu streiten, wird es vermutlich nicht.

WEITERLESEN