StealthWriter und Turnitin im Vergleich: Was die Dokumentation wirklich sagt
Behandeln Sie einen Detektorwert von StealthWriter nicht so, als wäre er dasselbe wie ein Turnitin-Wert für KI-Text. StealthWriter definiert seinen öffentlich ausgewiesenen Wert als den Anteil, der als natürlich eingestuft wird; Turnitin dokumentiert dagegen eine eigene Berechnung für KI-geschriebenen Text samt eigenen Anzeigeregeln. Dieser Artikel erklärt die veröffentlichte Funktionsweise von Turnitin und zeigt, wo Vergleiche zwischen zwei Werkzeugen an ihre Grenzen stoßen.
HumanPen-Team
· 5 Min. Lesezeit
Die Werte sind nicht austauschbar
Die FAQ von StealthWriter definieren den Detektorwert als den Anteil der Eingabe, den das Werkzeug als natürlich einstuft. Turnitin beschreibt einen Prozentsatz für KI-Text, der nach dem weiter unten dokumentierten Verfahren entsteht. In den geprüften Quellen findet sich keine Umrechnungsregel zwischen diesen beiden Bezeichnungen; eine Zahl des einen Produkts lässt sich daher nicht in eine Zahl des anderen übersetzen.
Einen allgemeingültigen KI-Erkennungswert, auf den sich alle Werkzeuge einigen, gibt es nicht – und warum derselbe Text bei jedem Detektor anders ausfällt zeichnet nach, woher diese Kluft kommt. Jeder Detektor erzeugt seine eigene Schätzung. Wer Werte aus verschiedenen Werkzeugen behandelt, als würden sie dieselbe Sache in denselben Einheiten messen, sorgt nur für Verwirrung.
Wir behaupten nicht, welches Werkzeug genauer arbeitet. Für diesen Artikel wurde kein herstellerübergreifender Test zur Genauigkeit oder zur Übereinstimmung nachvollzogen. Jedes Ergebnis muss gegen die Definition gelesen werden, die der jeweilige Anbieter selbst aufstellt.
Wie Turnitin zu seinem Wert kommt
Turnitin dokumentiert ein ganz bestimmtes Verfahren, um zum Wert für KI-Text zu gelangen:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Wird eine Arbeit bei Turnitin eingereicht, werden die Sätze der Einreichung herausgezogen und für die Vorhersageanalyse in überlappende Abschnitte zerlegt. Jeder Abschnitt wird vom KI-Erkennungsmodell eingeordnet und erhält einen Wert zwischen 0 und 1, der angibt, wie wahrscheinlich der Text von einem Menschen oder von einer KI stammt. Jeder in Frage kommende Satz innerhalb dieser Abschnitte übernimmt die Bewertung des Abschnitts. Weil sich die Abschnitte überlappen, können manche Sätze mehrere Werte haben, die dann zu einem einzigen Wert zusammengefasst werden. Diese Satzwerte werden anschließend weiter zusammengerechnet, um den KI-Wert des gesamten Dokuments zu berechnen.)
Das Verfahren besteht darin, Sätze herauszuziehen, sie in überlappende Einheiten zu zerlegen, jeden Abschnitt zu bewerten, die Satzwerte zusammenzuführen und daraus einen Prozentwert für das ganze Dokument zu bilden. Die öffentlichen Seiten von StealthWriter, die für diesen Artikel geprüft wurden, dokumentieren keine vergleichbare Kette aus Zerlegung und Zusammenrechnung. Nach der heutigen Quellenlage lässt sich deshalb nicht sagen, ob StealthWriter dieselbe Methode verwendet oder eine andere.
Die Dokumentation von Turnitin stellt außerdem klar, dass der Prozentsatz für KI-Text und der Similarity-Wert zwei getrennte Dinge sind. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Der Similarity-Wert und der Prozentsatz der KI-Text-Erkennung sind völlig unabhängig voneinander und beeinflussen sich nicht.) Der Similarity-Wert gibt an, wie viel Prozent übereinstimmender Text im eingereichten Dokument gefunden wurde, wenn es mit der umfangreichen Inhaltesammlung von Turnitin für den Ähnlichkeitsabgleich verglichen wird. Ein Dokument kann eine hohe Ähnlichkeit und einen niedrigen KI-Anteil haben – oder umgekehrt. Turnitin-Bericht zu KI-Text und Similarity-Bericht im Vergleich hält die beiden auseinander. Die zwei Zahlen haben keinen Einfluss aufeinander.
Die Fehlalarmquote, die Turnitin selbst nennt
Turnitin veröffentlicht ein ausdrückliches Ziel für Fehlalarme:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Wir sind bestrebt, die Wirksamkeit unseres Detektors zu maximieren und dabei unsere Fehlalarmquote – also den Fall, dass vollständig von Menschen geschriebener Text fälschlich als KI-generiert eingestuft wird – unter 1 % zu halten, und zwar für Dokumente mit mehr als 20 % KI-Text.)
An anderer Stelle formuliert die Dokumentation dasselbe so: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (Mit anderen Worten: Wir könnten eines von 100 vollständig von Menschen geschriebenen Dokumenten als KI-geschrieben kennzeichnen.) In dieser Umschreibung fällt die Einschränkung „mehr als 20 % KI-Text" weg. Die Fassung mit der Schwelle von 20 % ist die präzisere. Was diese Schwelle über Ihren eigenen Wert aussagt und was nicht, steht in Ist 20 % KI zu hoch?.
Um dieses Ziel zu belegen, beschreibt Turnitin seinen Testrahmen: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Um unseren Testrahmen zu stärken und statistische Entwicklungen bei Fehlalarmen zu erkennen, führen wir vor jeder Aktualisierung und vor jeder Veröffentlichung eines neuen Modells Tests mit über 700.000 zusätzlichen akademischen Arbeiten durch, die vor dem Erscheinen von ChatGPT geschrieben wurden, um unsere Fehlalarmquote von unter 1 % weiter zu bestätigen.)
Das ist die Auskunft, die Turnitin über das eigene System gibt. StealthWriter kann andere Genauigkeitsziele verfolgen, andere Validierungswege gehen oder gar keine vergleichbaren Zahlen veröffentlichen. Einen unmittelbaren Vergleich der Genauigkeit können wir nicht ziehen. Wir können nur wiedergeben, was in der Dokumentation von Turnitin steht.
Was bei kurzen Dokumenten passiert
Wie lang ein Dokument ist, beeinflusst die Verarbeitung durch den Detektor von Turnitin. Bei kurzen Dokumenten verhält sich die Bewertung anders. Die Dokumentation sagt dazu:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Bei kürzeren Dokumenten mit nur wenigen hundert Wörtern fällt die Vorhersage meist als „alles oder nichts" aus, weil wir auf der Grundlage eines einzigen Abschnitts vorhersagen und keine Möglichkeit zur Überlappung haben.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Das heißt, dass mancher Text, der eine Mischung aus KI-generierten und eigenen Inhalten ist, als vollständig KI-generiert gekennzeichnet werden kann.)
Der Überlappungsmechanismus, der die Werte in längeren Dokumenten ausmittelt, greift nicht, wenn der ganze Text ein einziger Abschnitt ist. Ein paar hundert Wörter mit gemischtem menschlichem und KI-Anteil können mit 100 % zurückkommen – einer der Wege, die in Warum Turnitin Ihre Arbeit für 100 % KI hält beschrieben sind. Das ist ein Verhalten, das aus der Struktur kurzer Eingaben folgt.
Dieses Verhalten bei kurzen Eingaben ist für Turnitin dokumentiert. Die geprüften Seiten von StealthWriter beschreiben nichts Entsprechendes für kurze Eingaben; darum unterstellt dieser Artikel StealthWriter weder denselben noch einen abweichenden Mechanismus.
Wie niedrige Werte angezeigt werden
Turnitin blendet Zahlenwerte unter 20 % aus. Die Dokumentation sagt dazu:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Um mögliche Fehlalarme zu vermeiden, werden für KI-Erkennungswerte im Bereich von 1 % bis 19 % weder ein Wert noch Markierungen vergeben. Wird im Bericht KI unterhalb der Schwelle von 20 % festgestellt, so wird dies nun mit einem Sternchen (*%) angezeigt, und es wird kein Prozentsatz vergeben.)
Ein Dokument, das das Modell von Turnitin auf 8 % KI schätzt, zeigt im Bericht ein Sternchen, nicht die Zahl 8 %. Markierungen werden im Text nicht gesetzt. Die Begründung lautet, mögliche Fehlalarme in einem Bereich geringer Sicherheit gar nicht erst anzuzeigen; damit befasst sich Was das Sternchen (*%) bei einem Turnitin-KI-Wert bedeutet.
Die Sternchenregel gehört zu Turnitin. Die geprüften Seiten von StealthWriter definieren zwar ihren eigenen Wert, dokumentieren aber nicht, wie derselbe Fall eines niedrigen Wertes bei ihnen angezeigt würde. Ohne einen eigenen dokumentierten Test lässt sich daraus weder eine Umrechnung noch ein Unterschied in der Anzeige ableiten.
Was das für Sie bedeutet
Wenn Sie Ergebnisse von StealthWriter und Turnitin für dasselbe Dokument vergleichen, hier die Kurzfassung:
- Unterschiedliche Definitionen, keine Umrechnungsregel. StealthWriter definiert einen Natürlichkeitsprozentsatz, Turnitin dokumentiert einen Wert für KI-Text. Die geprüften Quellen liefern keine Zuordnung zwischen beiden.
- Turnitin bewertet durch Zerlegen und Zusammenrechnen. Sätze werden herausgezogen, in überlappende Einheiten zerlegt, bewertet, zusammengeführt und aufaddiert. Der KI-Wert und der Similarity-Wert sind vollständig unabhängig.
- Turnitin peilt unter 1 % Fehlalarme an, und zwar für Dokumente mit mehr als 20 % KI-Text, bestätigt an über 700.000 zusätzlichen akademischen Arbeiten, die vor ChatGPT geschrieben wurden.
- Kurze Dokumente bekommen Alles-oder-Nichts-Werte. Ein paar hundert Wörter können mit 0 % oder 100 % zurückkommen, selbst bei gemischtem Text.
- Werte unter 20 % erscheinen als Sternchen. Im Bereich von 1 % bis 19 % wird weder ein Prozentwert noch eine Markierung angezeigt.
Passagen, die die Voraussetzungen erfüllen, können kostenlos erneut durchlaufen werden.
WEITERLESEN