Undetectable AI gegen Turnitin: Was in der Dokumentation wirklich steht
Wenn Sie denselben Text durch den Detektor von Undetectable AI und durch Turnitin laufen lassen, fallen die Werte oft unterschiedlich aus. Das ist zu erwarten: Die beiden Tools nutzen verschiedene Modelle, die mit anderen Daten trainiert wurden und nach anderen Bewertungskonventionen arbeiten. Hier steht, was die Dokumentation von Turnitin über die Funktionsweise des eigenen Detektors sagt – und warum die Werte nicht zueinander passen werden.
HumanPen-Team
· 5 Min. Lesezeit
Undetectable AI und Turnitin sind zwei getrennte Systeme
Der Detektor von Undetectable AI und die KI-Schreiberkennung von Turnitin stammen von unterschiedlichen Teams und basieren auf unterschiedlichen Modellen. Beide wurden mit eigenen Daten trainiert und ordnen Text nach eigenen Kriterien ein. Wenn zwei Detektoren verschiedene Modelle verwenden, liefern sie für denselben Text verschiedene Werte. Eine Passage, die Undetectable AI mit 70 % KI bewertet, kann bei Turnitin mit 25 % abschneiden – oder umgekehrt. Keines der beiden Ergebnisse ist damit falsch. Es sind Wahrscheinlichkeitsangaben aus verschiedenen Modellen, die mit verschiedenen Datensätzen trainiert wurden.
Einen allgemeingültigen KI-Erkennungswert, auf den sich alle Tools einigen, gibt es nicht – darauf geht warum derselbe Text bei jedem Detektor anders bewertet wird näher ein. Jeder Detektor erstellt seine eigene Schätzung. Wer Werte aus verschiedenen Tools so behandelt, als würden sie dieselbe Sache in denselben Einheiten messen, kommt unweigerlich durcheinander.
Wir stellen keine Behauptung darüber auf, welches Tool treffsicherer ist. Wir geben wieder, was die Dokumentation von Turnitin über das eigene System sagt – und warum dieses System Werte liefert, die nicht zu denen von Undetectable AI passen werden.
Wie die Bewertung bei Turnitin abläuft
Turnitin dokumentiert ein ganz bestimmtes Verfahren, das zum KI-Schreibwert führt:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." („Wenn eine Arbeit bei Turnitin eingereicht wird, werden die Sätze der Einreichung extrahiert und für die Vorhersageanalyse in überlappende Abschnitte unterteilt. Jeder Abschnitt wird vom KI-Erkennungsmodell klassifiziert und erhält einen Wert zwischen 0 und 1, der die Wahrscheinlichkeit dafür angibt, dass der Text eher von einem Menschen oder von einer KI stammt. Jeder in Frage kommende Satz innerhalb dieser Abschnitte übernimmt die Bewertung des Abschnitts. Da sich die Abschnitte überlappen, können manche Sätze mehrere Bewertungen haben, die dann zu einer einzigen Bewertung zusammengefasst werden. Diese Satzbewertungen werden weiter aggregiert und daraus der gesamte KI-Schreibwert des Dokuments berechnet.")
Das Verfahren besteht also darin, Sätze zu extrahieren, sie in überlappende Einheiten zu zerlegen, jeden Abschnitt zu bewerten, die Satzbewertungen zusammenzufassen und daraus einen Prozentwert für das gesamte Dokument zu bilden. Andere Detektoren, auch Undetectable AI, arbeiten womöglich mit anderen Aufteilungen, anderen Vorhersageeinheiten oder anderen Verfahren für die Zusammenfassung. Die beiden Tools werden für denselben Text keine übereinstimmenden Zahlen liefern.
Die Dokumentation von Turnitin stellt außerdem klar, dass der Prozentwert für KI-Schreibweise und der Similarity-Wert zwei getrennte Dinge sind. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." („Der Similarity-Wert und der Prozentwert für die KI-Schreiberkennung sind vollkommen unabhängig voneinander und beeinflussen sich nicht gegenseitig.") Der Similarity-Wert gibt an, wie viel Prozent des eingereichten Dokuments mit Text übereinstimmen, der sich in der umfassenden Inhaltesammlung findet, gegen die Turnitin auf Ähnlichkeiten prüft. Ein Dokument kann eine hohe Ähnlichkeit und einen niedrigen KI-Wert aufweisen – oder umgekehrt. KI-Bericht und Similarity Report von Turnitin im Vergleich zeigt, was die beiden Zahlen jeweils zählen. Die beiden Zahlen beeinflussen sich nicht gegenseitig.
Die von Turnitin genannte Fehlalarmquote
Turnitin nennt ein klares Ziel für die Fehlalarmquote:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." („Wir bemühen uns, die Wirksamkeit unseres Detektors zu maximieren und zugleich unsere Fehlalarmquote – also dass vollständig von Menschen geschriebener Text fälschlich als KI-generiert eingestuft wird – bei Dokumenten mit mehr als 20 % KI-Schreibweise unter 1 % zu halten.")
An anderer Stelle formuliert die Dokumentation es so: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." („Anders ausgedrückt: Wir stufen möglicherweise eines von 100 vollständig von Menschen geschriebenen Dokumenten fälschlich als KI-geschrieben ein.") In dieser Formulierung fällt die Einschränkung „mehr als 20 % KI-Schreibweise" weg. Die Fassung mit der Schwelle von 20 % ist präziser.
Um dieses Ziel zu belegen, beschreibt Turnitin das eigene Testverfahren: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." („Um unser Testverfahren abzusichern und statistische Trends bei Fehlalarmen zu erkennen, führen wir vor jedem Update und vor jeder Veröffentlichung eines neuen Modells Tests an über 700.000 weiteren akademischen Arbeiten durch, die vor der Veröffentlichung von ChatGPT geschrieben wurden, um unsere Fehlalarmquote von unter 1 % weiter zu bestätigen.")
So stellt Turnitin das eigene System dar. Was dieses eine Prozent über ein Jahr mit Einreichungen gerechnet bedeutet, erklärt was eine Fehlalarmquote von 1 % bedeutet. Undetectable AI kann andere Genauigkeitsziele verfolgen, andere Validierungsverfahren nutzen oder schlicht keine vergleichbaren Zahlen veröffentlichen. Einen direkten Vergleich der Genauigkeit können wir nicht ziehen. Wir können nur wiedergeben, was in der Dokumentation von Turnitin steht.
Was bei kurzen Dokumenten passiert
Die Länge eines Dokuments beeinflusst, wie der Detektor von Turnitin den Text verarbeitet. Bei kurzen Dokumenten verhält sich der Bewertungsmechanismus anders. In der Dokumentation heißt es:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." („Bei kürzeren Dokumenten mit nur wenigen hundert Wörtern fällt die Vorhersage meist nach dem Muster „alles oder nichts" aus, weil wir die Vorhersage für ein einziges Segment treffen und keine Möglichkeit zur Überlappung haben.")
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." („Das bedeutet, dass mancher Text, der eine Mischung aus KI-generierten und eigenen Inhalten ist, als vollständig KI-generiert gekennzeichnet werden kann.")
Der Überlappungsmechanismus, der die Werte in längeren Dokumenten ausmittelt, greift nicht, wenn der Text aus einem einzigen Segment besteht. Ein paar hundert Wörter mit gemischtem menschlichem und KI-Anteil können mit 100 % zurückkommen – einer der Mechanismen hinter warum Turnitin bei Ihrer Arbeit 100 % KI anzeigt. Bei kurzen Eingaben ist das ein strukturell bedingtes Verhalten.
Wenn Undetectable AI dasselbe kurze Dokument anders bewertet, liegt das unter anderem daran, dass die beiden Tools kurze Eingaben nicht auf dieselbe Weise verarbeiten.
Wie niedrige Werte angezeigt werden
Turnitin unterdrückt Zahlenwerte unter 20 %. In der Dokumentation heißt es:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." („Um das mögliche Auftreten von Fehlalarmen zu vermeiden, werden für KI-Erkennungswerte im Bereich von 1 % bis 19 % weder ein Wert noch Markierungen vergeben. Wird im Bericht KI unterhalb der Schwelle von 20 % erkannt, wird dies nun mit einem Sternchen (*%) angezeigt, ohne dass ein Prozentwert vergeben wird.")
Ein Dokument, das das Modell von Turnitin auf 8 % KI schätzt, zeigt im Bericht ein Sternchen – nicht die Zahl 8 %. Der Text wird nicht markiert. Die Begründung lautet, dass in einem Bereich mit geringer Aussagekraft mögliche Fehlalarme gar nicht erst auftauchen sollen; genauer beschrieben ist das unter was das Sternchen (*%) beim KI-Wert von Turnitin bedeutet.
Undetectable AI zeigt Werte in diesem Bereich womöglich als vollen Prozentwert an. Andere Tools markieren Text vielleicht schon ab dem kleinsten Wert über null. Turnitin unterdrückt unterhalb von 20 % bewusst beides: die Zahl und die Markierungen. Wegen dieser Bewertungskonvention geben die beiden Tools für dasselbe Dokument mit niedrigem KI-Anteil sehr unterschiedliche Ergebnisse aus.
Was das für Sie bedeutet
Wenn Sie die Ergebnisse von Undetectable AI und Turnitin für dasselbe Dokument vergleichen, hier die Zusammenfassung:
- Getrennte Modelle, getrennte Werte. Undetectable AI und Turnitin arbeiten mit unterschiedlichen Erkennungsmodellen. Dass die Werte übereinstimmen, ist nicht zu erwarten.
- Turnitin bewertet über Abschnitte und Zusammenfassung. Sätze werden extrahiert, in überlappende Einheiten zerlegt, bewertet, zusammengefasst und aggregiert. Der KI-Wert und der Similarity-Wert sind vollkommen unabhängig voneinander.
- Turnitin peilt eine Fehlalarmquote von unter 1 % an – für Dokumente mit mehr als 20 % KI-Schreibweise, abgesichert durch Tests mit über 700.000 weiteren akademischen Arbeiten, die vor ChatGPT geschrieben wurden.
- Kurze Dokumente werden nach dem Alles-oder-Nichts-Prinzip bewertet. Ein paar hundert Wörter können mit 0 % oder 100 % zurückkommen, selbst bei gemischtem Text.
- Werte unter 20 % erscheinen als Sternchen. Im Bereich von 1 % bis 19 % wird weder ein Prozentwert noch eine Markierung angezeigt.
Passagen, die die Voraussetzungen erfüllen, können kostenlos erneut durchlaufen werden.
WEITERLESEN