Pangram gegen Turnitin: Warum die beiden KI-Werte nicht zusammenpassen

Eine Zeitschrift, eine Hochschule oder eine Publikationsplattform hat Ihren Text durch Pangram laufen lassen, und daneben liegt Ihnen ein Turnitin-Wert vor. Die beiden widersprechen sich. Der Grund ist konkreter als die Rede von den verschiedenen Modellen: Die beiden Anbieter berichten nicht einmal dieselbe Art von Kennzahl, und darunter zählen sie verschiedene Einheiten auf verschiedenen Korpusbeständen. Hier steht, was jeder von beiden veröffentlicht – und was Sie mit zwei Zahlen anfangen können, die sich nicht zur Deckung bringen lassen.

HumanPen-Team

· 19 Min. Lesezeit

Die kurze Antwort

Ein Pangram-Ergebnis und ein Turnitin-Ergebnis sind keine zwei Messungen derselben Größe; eine Lücke zwischen ihnen ist also zu erwarten und kein Beweis dafür, dass eines von beiden kaputt ist. Das Whitepaper von Turnitin vom August 2024 hält fest, dass das Unternehmen „accuracy" (Genauigkeit) nicht als Kennzahl verwendet. Die Startseite von Pangram, abgerufen am 15. September 2026, trägt das Abzeichen „99.9%+ Accuracy" (Genauigkeit über 99,9 %). Unter der Überschrift gehen die beiden erneut auseinander: Die FAQ von Turnitin beschreiben Sätze, die innerhalb überlappender Segmente bewertet werden, und einen Prozentwert, der über den qualifizierenden Text gebildet wird, während Pangrams Model Card eine Vorhersage auf Token-Ebene mit drei Klassen und Dokumentanteilen beschreibt, die nach Zeichen gewichtet sind. Die Zahl, die Folgen hat, ist die aus dem Werkzeug, mit dem Ihre Institution ihre Entscheidung trifft.

Die beiden Anbieter sind sich nicht einig, welche Kennzahl sie berichten

Das Whitepaper von Turnitin, Turnitin's AI Writing Detection Model Architecture and Testing Protocol, datiert auf August 2024, sagt dazu:

„Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed." (Turnitin verwendet „accuracy" nicht als Kennzahl, weil sie sich zu leicht manipulieren lässt und zu stark von dem jeweiligen Datensatz abhängt, auf dem sie berechnet wird.)

Der nächste Satz liefert den Grund – und Sie können die Rechnung selbst nachvollziehen:

„For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system." (Nehmen wir zum Beispiel einen Datensatz mit 100 Texten, von denen 99 von Menschen geschrieben sind. Ein einfacher, naiver Algorithmus, der alle Texte als „von Menschen geschrieben" einstuft, käme in diesem Datensatz auf 99 % Genauigkeit, obwohl er als System zur Erkennung von KI-Texten wertlos ist.)

An diesem Beispiel lohnt es sich, etwas mitzunehmen. Ein Detektor, der nie etwas markiert, liegt bei 99 von diesen 100 richtig; die Zahl bewegt sich also mit der Zusammensetzung des Testsets, nicht mit der Güte des Detektors. Das Whitepaper sagt, Turnitin „uses two main metrics to test AIW-2: recall and FPR" (verwendet zwei Hauptkennzahlen, um AIW-2 zu testen: Recall und FPR), und definiert beide im selben Abschnitt mit durchgerechneten Beispielen.

Pangram veröffentlicht eine Genauigkeitszahl auffällig platziert. Das Abzeichen auf der Startseite lautet „99.9%+ Accuracy" (Genauigkeit über 99,9 %; Stand 15. September 2026). Die Seite für den Hochschulbereich trägt beide gleichzeitig: „99.98% accuracy" (99,98 % Genauigkeit) im ersten Satz und 52 Zeichen weiter, im selben Banner, ein Abzeichen „99.9%+ Accuracy" (Genauigkeit über 99,9 %), dazwischen nur „Detects AI Assistance Free Credits" (erkennt KI-Unterstützung – kostenlose Gutschriften). Die Model Card von Pangram für Pangram 4 vom 29. Juli 2026 stellt die Genauigkeit überhaupt nicht heraus: Sie berichtet Falsch-Positiv- und Falsch-Negativ-Raten, aufgeschlüsselt nach Korpus, Sprache und Domäne.

Die beiden Schlagzahlen sind also nicht ein hoher und ein niedriger Wert für dieselbe Eigenschaft. Ein Anbieter hat einen schriftlichen Einwand gegen die Kennzahl veröffentlicht, mit der der andere wirbt. Wir sagen nicht, dass eine der beiden Entscheidungen falsch ist, und beides ist kein Geheimnis: Beide Aussagen stehen heute auf öffentlichen Seiten.

Was jeder der beiden Werte tatsächlich zählt

Beide Systeme geben einen Prozentwert zurück. Die Prozentwerte entstehen aus unterschiedlichem Ausgangsmaterial.

Turnitin (FAQ und Whitepaper vom August 2024)Pangram (Model Card Pangram 4, 29. Juli 2026)
Klassifizierte EinheitSätze, zu überlappenden Segmenten zusammengefasstTokens, zu Segmenten variabler Länge decodiert
Umgang mit ÜberlappungenSätze in mehreren Segmenten erhalten mehrere Bewertungen, „which are then pooled into a single score" (die dann zu einem einzigen Wert zusammengefasst werden)„predictions for tokens that appear in multiple windows are aligned and averaged" (Vorhersagen für Tokens, die in mehreren Fenstern vorkommen, werden abgeglichen und gemittelt), innerhalb eines Inferenzfensters von 512 Tokens
Worauf sich der Dokument-Prozentwert beziehtNur qualifizierender Text. „this percentage is not necessarily the percentage of the entire submission" (dieser Prozentsatz ist nicht notwendigerweise der Prozentsatz der gesamten Einreichung)Das analysierte Dokument. `fraction_human`, `fraction_ai_assisted` und `fraction_ai` sind „character-weighted" (zeichengewichtet) und „sum to 1.0" (summieren sich auf 1,0)
Anzahl der KlassenZwei. Der Prozentwert erfasst Text, der „likely generated by AI or likely generated and modified by an AI paraphraser or bypasser" (wahrscheinlich von KI erzeugt oder wahrscheinlich von KI erzeugt und von einem KI-Paraphrasierer oder Umgehungswerkzeug überarbeitet) istDrei: `Human` (von Menschen geschrieben), `AI-Assisted` (KI-unterstützt), `AI-Generated` (KI-generiert)
Mindestlänge300 Wörter Prosa50 Wörter
Niedrige Werte1 % bis 19 % zeigt ein Sternchen, ohne Prozentwert und ohne Hervorhebungen`prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise (liefert die Kurzform „von Menschen geschrieben", wenn menschliche Zeichen mindestens 90 % ausmachen, „KI", wenn KI-generierte Zeichen mindestens 80 % ausmachen, und sonst „gemischt")

Die Zeile zum Nenner ist die, die wehtut. Die FAQ von Turnitin sagen, dass der angezeigte Prozentwert „the amount of qualifying text within the submission" (die Menge an qualifizierendem Text in der Einreichung) abdeckt, und dass „If text within the submission is not considered long-form prose text, it will not be included." (Wenn Text in der Einreichung nicht als längere Prosa gilt, wird er nicht einbezogen.) Die Anteile von Pangram erfassen den analysierten Text und ergeben zusammen 1,0. Füttert man beide Systeme mit einer Arbeit, die eine lange Literaturliste, ein Inhaltsverzeichnis und ein paar Tabellen enthält, arbeiten sie schon bevor eines der Modelle läuft nicht auf demselben Textkörper. Wie Sie einen Turnitin-Bericht zur KI-Erkennung lesen geht durch, was in den Nenner von Turnitin fällt und was nicht.

Warum die 1 % und das 1 von 10.000 nicht auf derselben Skala liegen

Das sind die beiden Zahlen, die man nebeneinander legt – und teilt man die eine durch die andere, kommt ein Verhältnis heraus, das nichts bedeutet. Beide heißen Falsch-Positiv-Rate. Keine von beiden ist so gemessen wie die andere.

Die FAQ von Turnitin nennen ein Ziel:

„We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Wir bemühen uns, die Wirksamkeit unseres Detektors zu maximieren und dabei unsere Falsch-Positiv-Rate – also vollständig von Menschen geschriebene Texte fälschlich als KI-generiert einzustufen – bei Dokumenten mit mehr als 20 % KI-Text unter 1 % zu halten.)

Diese angehängte Bedingung trägt das Gewicht der Aussage, und das Whitepaper erklärt, woher sie kommt. Ein Dokument gilt als KI-generiert, wenn mehr als 20 % seiner Satzbewertungen eine Satzschwelle überschreiten, und das Whitepaper sagt, dass „the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%)." (sowohl der Dokumentanteil-Cutoff von 20 % als auch die vorab festgelegte Modellschwelle so gewählt wurden, dass die Falsch-Positiv-Rate auf Dokumentebene unter 0,01 (1 %) bleibt). Cutoff und Rate sind Teile ein und desselben Mechanismus, keine unabhängige Behauptung darüber. Was eine Falsch-Positiv-Rate von 1 % bedeutet, wenn eine Universität 75.000 Arbeiten einreicht rechnet es durch.

Die FAQ auf Pangrams Startseite nennen eine Rate:

„Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents." (Die Falsch-Positiv-Rate von Pangram – also die Rate, mit der menschliche Dokumente fälschlich als KI markiert werden – liegt derzeit bei 1 von 10.000. Diese Zahl wird über eine Zusammenstellung öffentlicher Datensätze mit mehreren zehn Millionen geschriebener Dokumente berechnet.)

Die Model Card nennt eine engere Zahl mit einem benannten Korpus: „At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples." (Am Produktions-Betriebspunkt erreicht Pangram 4 eine Falsch-Positiv-Rate von 0,0041 % – etwa 1 von 24.000 – auf 1.000.000 von Menschen geschriebenen englischen FineWeb-Evaluationsbeispielen.) Eine zweite Tabelle auf der Card schlüsselt die Rate nach Domäne auf; die Zeile für akademisches Schreiben weist 0,019 % über 62.971 Einträge aus, mehr als der allgemeine englische Wert darüber.

Unterschiedliche Kennzeichnungsregeln, unterschiedliche Betriebspunkte – und auf der Turnitin-Seite eine Rate, die erst oberhalb eines Cutoffs von 20 % gilt. Wir werden Ihnen also keinen rechnerischen Vergleich der beiden Zahlen hinlegen. Was Sie stattdessen tun können: fragen, woran jeweils gemessen wurde, und beide Anbieter beantworten das schriftlich. Die FAQ von Turnitin sagen, dass die Rate gegen „over 700,000 additional academic papers that were written before the release of ChatGPT" (über 700.000 weitere akademische Arbeiten, die vor der Veröffentlichung von ChatGPT geschrieben wurden) validiert wird. Pangrams Startseite führt ihre Rate auf „an aggregate of public datasets" (eine Zusammenstellung öffentlicher Datensätze) zurück, und die Model Card führt die engere Zahl auf FineWeb-Beispiele zurück, wobei akademisches Schreiben als eine von elf Domänenzeilen separat auftaucht. Das sind Antworten auf verschiedene Fragen, und genau das ist das Problem.

Ein Prozentwert kann ein Anteil sein – oder eine Konfidenz

Zwei Berichte können beide „99%" anzeigen und damit Unterschiedliches meinen; beide Anbieter sagen das in ihrer eigenen Dokumentation.

Die Model Card von Pangram behandelt die Dokumentzahlen als Anteile: Die drei Fraktionen sind zeichengewichtete Teile des Textes, die sich zu 1,0 summieren. Sie sagt auch ausdrücklich, dass die anderen Zahlen nicht das sind, wonach sie aussehen. ai_assistance_score ist „a continuous AI-involvement score, not the probability of the displayed discrete label" (ein fortlaufender Wert für den KI-Anteil, nicht die Wahrscheinlichkeit der angezeigten diskreten Klasse), und der Konfidenzwert eines Segments „measures the peakedness of the unconstrained CRF posterior, it is not a calibrated probability estimate." (misst die Spitzigkeit der ungebundenen CRF-Posterior-Verteilung; er ist keine kalibrierte Wahrscheinlichkeitsabschätzung). Einfach gelesen: Ein als High markiertes Segment ist eines, in dem die internen Werte des Modells eng um eine einzige Klasse lagen – und der Anbieter sagt Ihnen, Sie sollten das nicht in Odds umrechnen.

Die Ratgeberseite von Pangram für Lehrkräfte liest einen Prozentwert genau andersherum:

„If a segment of text gets a 99% AI score, that doesn't mean we necessarily think the entire text was AI-generated. Rather, we are 99% confident that AI was used to generate some portion of the text." (Wenn ein Textsegment einen KI-Wert von 99 % erhält, heißt das nicht zwangsläufig, dass wir den gesamten Text für KI-generiert halten. Wir sind vielmehr zu 99 % sicher, dass KI genutzt wurde, um einen Teil des Textes zu erzeugen.)

Die FAQ von Turnitin warnen ebenfalls vor der Anteilslesart: „Unlike our Similarity Report, the AI writing percentage does not necessarily correlate to the amount of text in the submission." (Anders als bei unserem Similarity Report korreliert der KI-Schreib-Prozentwert nicht notwendigerweise mit der Textmenge in der Einreichung.)

Bevor Sie zwei Prozentwerte vergleichen, klären Sie, wovon jeweils die Rede ist. Ist der eine ein Anteil an Zeichen und der andere ein Konfidenzniveau, konnten die beiden nie übereinstimmen – und keiner von beiden hat Sie belogen. Warum derselbe Text bei jedem Detektor anders abschneidet sammelt die übrigen Gründe.

Dieselbe Bezeichnung steht auf Zahlen mit unterschiedlichen Nennern

Eine Falsch-Positiv-Rate bedeutet nur zusammen mit der Menge an Dokumenten etwas, über die sie berechnet wurde. Beide Anbieter veröffentlichen mehrere Zahlen unter ein und derselben Bezeichnung, und ein Paar lohnt es, vollständig durchzugehen – denn die naheliegende Erklärung für die Lücke ist die falsche.

Zuerst Pangram, alles geprüft am 15. September 2026. Lesen Sie die rechte Spalte so aufmerksam wie die linke: Ein Teil der Streuung kommt daher, auf welcher Seite Sie gelandet sind, und ein Teil daher, woran die jeweilige Zahl gemessen wurde.

ZahlWo sie steht
„99.9%+ Accuracy" (Genauigkeit über 99,9 %)Abzeichen auf der Startseite und ein Abzeichen im Banner der Hochschulseite
„99.98% accuracy" (99,98 % Genauigkeit)Erster Satz desselben Banners, 52 Zeichen zuvor
„99.26% overall" (99,26 % insgesamt)Pangram vs. Turnitin, ein Beitrag vom 28. Juli 2026
Keine GenauigkeitszahlModel Card Pangram 4 vom 29. Juli 2026, die stattdessen FPR und FNR nach Korpus berichtet
„1 in 10,000" (1 von 10.000)FAQ auf der Startseite, über „an aggregate of public datasets" (eine Zusammenstellung öffentlicher Datensätze)
„roughly 1 in 24,000" (etwa 1 von 24.000)Model Card, über 1.000.000 englische FineWeb-Beispiele
„approximately 1 in 25,000" (ungefähr 1 von 25.000) für akademische EssaysDer Beitrag vom 28. Juli 2026
0,019 % für „Academic Writing (English)" (akademisches Schreiben, Englisch)Model Card, über 62.971 Einträge, höher als der eigene Gesamtwert

Turnitin produziert die mildeste Version davon innerhalb eines einzigen Dokuments: Das Whitepaper vom August 2024 gibt die Falsch-Positiv-Rate von AIW-2 auf Dokumentebene im Fließtext mit 0,5 % an und in Tabelle 1 mit 0,51 % – über demselben Bestand von 719.877 studentischen Arbeiten von vor 2019.

Wichtiger ist das Paar aus zwei Zahlen, die Turnitin beide als Falsch-Positiv-Rate auf Satzebene bezeichnet. Im Juni 2023 schrieb der Chief Product Officer:

„Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." (Unsere Falsch-Positiv-Rate auf Satzebene liegt bei etwa 4 %. Das bedeutet: Es besteht eine Wahrscheinlichkeit von 4 %, dass ein bestimmter Satz, der als KI-geschrieben markiert wurde, von einem Menschen stammt.)

Das Whitepaper vom August 2024 nennt 0,33 %, aus einem Stresstest mit Arbeiten, die vor 2019 eingereicht wurden und von denen es heißt: „All papers in this dataset are human written." (Alle Arbeiten in diesem Datensatz sind von Menschen geschrieben.)

Die verlockende Lesart: Dazwischen hat sich ein Modell geändert. Hat es auch – und es erklärt die Lücke nicht. Das Whitepaper sagt, AIW-1 startete im April 2023, und dass „In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model" (Im Dezember 2023 brachte Turnitin AIW-2 heraus, ein aktualisiertes und verbessertes Modell als Ersatz für AIW-1); das im Juni 2023 laufende Modell war also AIW-1. Schlagen Sie AIW-1 dann in Tabelle 2 desselben Whitepapers nach: Auf demselben Bestand von 719.877 Arbeiten liegt seine Falsch-Positiv-Rate auf Satzebene bei 0,42 %, nicht bei 4 %. Gleiches Modell, gleiche Bezeichnung, zwei Zahlen um eine Größenordnung auseinander. Die Versionsgeschichte bricht zusammen.

Was sich unterscheidet, ist die Menge, über die der jeweilige Prozentwert gebildet wird. Die 4 % sind bedingt durch einen Satz, der bereits markiert wurde: Von den Sätzen, die der Detektor markiert hat, kann dieser Anteil von Menschen stammen. Die 0,42 % und die 0,33 % laufen über Texte, die von vornherein vollständig von Menschen stammen: Von all diesen Sätzen wurde dieser Anteil markiert. Das beantwortet zwei verschiedene Fragen, und es gibt keinen Grund, warum sie nah beieinander liegen sollten. Die Definition der 4 % können Sie in Turnitins Erklärung vom Juni 2023 nachlesen.

Nichts davon ist ein ertappter Anbieter, und nichts davon ist eine veraltete Zahl. Es ist das, was passiert, wenn eine Wendung an mehrere verschiedene Messungen gehängt wird. Wenn Ihnen in einer Sitzung also eine Rate entgegengehalten wird, ist die Frage, die weiterführt: über welche Menge. Alle eingereichten Dokumente? Nur die bereits markierten Sätze? Nur der qualifizierende Text? Ein Prozentwert ohne die Menge, auf die er sich bezieht, lässt sich nicht prüfen – und auch nicht bestreiten.

Welche unabhängigen Tests es gibt – und was sie nicht klären

Eine begutachtete, frei zugängliche Studie hat beide Werkzeuge im Direktvergleich getestet. Who wrote this? Evaluating the reliability of AI detection tools in higher education, erschienen im International Journal for Educational Integrity am 29. Juni 2026, hat einen synthetischen Bestand von 160 englischen akademischen Arbeiten aufgebaut, je vierzig in vier Kategorien, jede mit mindestens 4.000 Wörtern.

Am Bestand der von Menschen geschriebenen Arbeiten gilt das Ergebnis für alle vier getesteten Werkzeuge: „all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers." (alle vier Werkzeuge ordneten 100 % der menschlichen Texte korrekt als „wahre Negative" ein – sie erhielten einen Wert zwischen 0 und 20 %. Das zeigt, dass keiner der Detektoren bei dieser Sammlung von Arbeiten dazu neigt, menschliches Schreiben fälschlich als KI-generiert zu markieren.) Am vollständig KI-generierten Bestand gingen die beiden Werkzeuge getrennte Wege. Die Studie berichtet, dass „Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)" (Turnitin 100 % der vollständig KI-generierten Arbeiten als falsche Negative einordnete – Werte zwischen 0 und 20 %), und dass „Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified." (Pangram das einzige Werkzeug war, das gut abschnitt, mit einer strengen Genauigkeit von 65 % und einer einschließenden Genauigkeit von 97,5 %, wobei nur ein Fall falsch eingeordnet wurde.)

Bevor Ihnen das jemand in die eine oder andere Richtung entgegenhält: Die Autoren setzen selbst ihre Grenzen. Der Umfang ihrer Forschung sei „the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category" (beschränkt auf 160 Arbeiten, vier KI-Erkennungswerkzeuge und ein GenAI-Modell – GPT-4o Deep Research – für die Kategorie „vollständig KI-generiert"), und die Ergebnisse seien „valid only for a specific snapshot in time" (nur für eine bestimmte Momentaufnahme gültig). Ihre Empfehlung an Institutionen ist der Satz, den man in eine Sitzung mitnehmen sollte: Erkennungswerkzeuge „should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy." (sollten nicht als alleiniger Beweis für Entscheidungen mit hohen Folgen genutzt, sondern in eine breitere Bewertungsstrategie eingebettet werden).

Ein Hinweis zur Formulierung, denn die bearbeitete Fassung verbreitet sich weiter als das Original. Der Schlusssatz der Studie lautet: „From the four AI detection tools studied here, at this moment only one produced satisfactory results." (Von den vier hier untersuchten KI-Erkennungswerkzeugen lieferte in diesem Moment nur eines zufriedenstellende Ergebnisse.) Pangrams eigene Zusammenfassung der Studie gibt ihn wieder als „only [Pangram] produced satisfactory results" (nur [Pangram] lieferte zufriedenstellende Ergebnisse), mit der Ersetzung in Klammern.

Zwei weitere Arbeiten werden in diesem Vergleich zitiert, und beide brauchen einen Vorbehalt. Ein Research Brief des Becker Friedman Institute der University of Chicago vom 6. Oktober 2025 sagt, dass „Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages" (Pangram unter den kommerziellen Optionen bei mittellangen bis langen Passagen praktisch keine Falsch-Positiv- und Falsch-Negativ-Raten erreicht). Turnitin wurde nicht getestet: Die vier Werkzeuge waren Pangram, Originality.ai, GPTZero und eine RoBERTa-Baseline. Der Korpus bestand aus 1.992 Passagen aus sechs Alltagsgenres, darunter Nachrichten, Blogs, Verbraucherbewertungen und Lebensläufe – keine studentischen Arbeiten. Dazu gibt es eine Verbindung, die man offenlegen sollte, und zwar mit beiden Hälften: Einer der beiden Autoren, Alex Imas, erscheint in einem unterzeichneten Erfahrungsbericht auf Pangrams Startseite, und das Working Paper trägt auf seiner ersten Seite die Zeile „All authors declare that they have no financial or personal conflicts of interest related to this study." (Alle Autoren erklären, dass sie keine finanziellen oder persönlichen Interessenkonflikte im Zusammenhang mit dieser Studie haben.) Das Paper ist beim Institut kostenlos herunterzuladen, zwei Klicks vom Brief entfernt. Gewichten Sie das, wie Sie es für angemessen halten; wir möchten lieber, dass Sie beide Fakten kennen als keinen.

Die zweite ist der Praxistest einer TechCrunch-Reporterin vom Juli 2026, der aus einem einzigen Artikel zwei Zahlen hervorbrachte: „Pangram gave it a 13% AI assisted score" (Pangram gab ihm einen KI-Unterstützungs-Wert von 13 %), und „when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score." (als ich Pangram denselben Artikel in voller Länge gab, so wie ich ihn geschrieben hatte, erhielt er einen Menschen-Wert von 100 %). Die Sitzung einer Journalistin ist kein Benchmark. Sie ist ein Beleg aus erster Hand dafür, dass die Art, wie ein Text eingereicht wird, die zurückkommende Zahl verändert – und genau in dieser Lage sind Sie, wenn zwei Institutionen zwei verschiedene Dateien laufen lassen.

Dann gibt es den Fall, in dem die beiden überhaupt nicht vergleichbar sind, weil nur eines von ihnen eine Zahl zurückgibt. Dieselbe begutachtete Studie vermerkt unter ihrer Hauptabbildung, dass „Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score" (Turnitin Arbeiten mit einem KI-Wert zwischen 0 % und 20 % als unsicher betrachtet und sie mit einem Sternchen statt mit einem Zahlenwert kennzeichnet), und dass deshalb „19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure." (19 vollständig KI-generierte, 7 hybride, 6 humanisierte und 3 vollständig menschliche Arbeiten in der Abbildung als fehlend codiert wurden). Das sind 35 von 160 Arbeiten ohne Turnitin-Wert, den man irgendetwas gegenüberstellen könnte. Wenn Ihr Turnitin-Ergebnis ein Sternchen ist, verteidigen Sie keinen niedrigen Wert – Sie haben gar keinen Wert; was das Sternchen (*%) bei einem Turnitin-KI-Wert bedeutet erklärt die Anzeigeregel dahinter.

Was Sie tun können, wenn die beiden Ergebnisse nicht zusammenpassen

Fangen Sie damit an, die Berichte zu bekommen – auf beiden Seiten hängen Sie von der Person ab, die sie laufen ließ. Die FAQ von Turnitin sagen: „The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students." (Der Indikator und der Bericht zur KI-Erkennung sind für Studierende nicht sichtbar. Mit der PDF-Download-Funktion können Lehrende den KI-Bericht jedoch herunterladen und mit Studierenden teilen.) Das Hilfe-Center von Pangram sagt, ein Ergebnis könne als Link geteilt werden, und Empfänger „will see the scan overview and segment details without having to create a Pangram account." (sehen die Scan-Übersicht und die Segmentdetails, ohne ein Pangram-Konto anlegen zu müssen). Fragen Sie nach beidem, und auf der Pangram-Seite ausdrücklich nach dem Teilen-Link statt nach einem Screenshot: Die Segmentansicht zeigt, welche Passagen die Zahl erzeugt haben, und ein Screenshot eines Prozentwerts zeigt Ihnen nichts, womit Sie arbeiten könnten.

Planen Sie nicht, den Vorgang direkt bei Pangram zu korrigieren. Die Feedback-Funktion hängt am Konto, das den Scan ausgeführt hat: Die Hilfeseite sagt, man solle „Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account" (das Ergebnis öffnen, zu dem Sie Feedback geben möchten – entweder direkt nach dem Scannen oder über die Seite „History / All Checks" in Ihrem Konto); darunter liegen Daumen-hoch und Daumen-runter. Ein Scan, den Ihr Professor ausgeführt hat, liegt nicht in Ihrem Konto.

Ebenso wenig haben wir einen veröffentlichten Einspruchsweg für die Person gefunden, die ein Ergebnis erhält. Wir haben am 15. September 2026 den Fließtext aller 256 in Pangrams Sitemap verzeichneten URLs gelesen, insgesamt 2.117.382 Zeichen, und jede Seite durchsucht. `appeal` („Einspruch", hier aber im Sinn von „anziehend") erscheint auf einer, in einem Blogbeitrag über Werbung. `dispute` („Streitigkeit") erscheint auf zwei: in der Schiedsklausel der Nutzungsbedingungen und in einem Partnerbeitrag über Urheberschaftsstreitigkeiten. `grievance` („Beschwerde"), `contest` („anfechten"), `redress` („Abhilfe"), `ombuds` („Ombudsstelle") und `request a review` („Überprüfung beantragen") erscheinen auf keiner der 256. Dieselbe Suche fand `false positive` („falsch positiv") auf 162 dieser Seiten und `student` („Studierende") auf 182 – daran erkennen Sie, dass der Zähler tatsächlich traf und nicht stillschweigend für jede Abfrage null zurückgab.

Eine Einschränkung zu dieser Zählung, denn es ist die Art Behauptung, die man widerlegen können sollte, wenn sie falsch ist: Eine Sitemap ist nicht die ganze Website. Die Seite, die dieser Artikel am häufigsten zitiert – Pangrams Model Card zu Pangram 4 – antwortet mit 200 und ist in dieser Sitemap nicht verzeichnet. Lesen Sie das Ergebnis also als 256 verzeichnete Seiten ohne einen solchen Weg darauf, nicht als Aussage über jede Seite, die Pangram hostet. Und lesen Sie es in beide Richtungen: Es heißt nicht, dass Pangram Korrekturen ablehnt, und es heißt ganz sicher nicht, dass Ihre Institution kein Verfahren hat. Es heißt, dass der Anbieter nicht die Adresse dafür ist.

Zwei Organisationen, die Pangram einsetzen, veröffentlichen einen eigenen Weg, und die sind es, die man kennen sollte. Substack sagt Autoren, sie sollten „select Report detection error" („Erkennungsfehler melden" auswählen) am KI-Erkennungsbericht, und dokumentiert eine Steuerung „Disable AI detection" (KI-Erkennung deaktivieren) für Entwürfe. Wiki Education, das die Wikipedia-Bearbeitungen seiner Teilnehmenden durch Pangram laufen lässt, sagt Lehrenden, was hinter den meisten der Fehler steckt, die es bestätigt hat: „If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen." (Wenn ein Studierender eine leere Gliederung speichert – etwa mit nur kurzen Aufzählungspunkten oder leeren Abschnittsüberschriften – oder eine erhebliche Menge Nicht-Prosa-Text einbaut, etwa Satzfragmente oder Literaturangaben, kann das den KI-Detektor auslösen. Nicht-Prosa-Text ist ein häufiger Faktor bei den meisten der bestätigten falsch positiven Ergebnisse, die wir gesehen haben.) Es schreibt außerdem, dass es Pangram „not use Pangram as definitive proof that the text was AI generated" (nicht als endgültigen Beweis dafür nutzt, dass der Text KI-generiert wurde), sondern „a way to flag which text needs additional human scrutiny for verifiability." (als Möglichkeit, zu markieren, welcher Text zusätzliche menschliche Prüfung auf seine Belegbarkeit braucht).

Dieser Punkt zum Nicht-Prosa-Text lässt sich an Ihrer eigenen Datei nachprüfen, und die Model Card von Pangram stützt ihn von Anbieterseite. Das Modell ist für Texte gedacht, die „of at least 50 words, written primarily in complete sentences" (mindestens 50 Wörter umfassen und überwiegend aus vollständigen Sätzen bestehen), und die Card listet auf, was außerhalb dieses Rahmens liegt, darunter „tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation" (Inhaltsverzeichnisse, Literaturverzeichnisse, vorlagenbasierte oder automatisiert erzeugte Texte, Anleitungen und technische Handbücher sowie Texte, die von mathematischer Notation dominiert werden). Sie ergänzt, dass „human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document" (von Menschen geschriebene Kopf- und Fußzeilen, Anleitungen und andere fremde Formatierungen vor der Prüfung eines Dokuments entfernt werden sollten), und dass „Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts." (Rohtext- und .docx-Dateien, wo verfügbar, PDFs vorzuziehen sind, weil das Einlesen von PDFs unbeabsichtigte Artefakte erzeugen kann.) Zwei konkrete Fragen also an die Person, die den Scan ausgeführt hat: War es ein PDF, und sind Literaturverzeichnis und Titelei mitgelaufen?

Ein paar Zeilen lohnen sich in einer Sitzung gerade deshalb zu zitieren, weil sie von den Anbietern kommen und nicht von uns. Die Pangram-Leitlinie für Lehrkräfte sagt: „we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures" (wir glauben, dass KI-Erkennung eine gute Möglichkeit ist, Arbeiten zu markieren, ein Erkennungsergebnis aber weitere Untersuchung verlangt, bevor irgendwelche Strafmaßnahmen folgen – die Schreibweise stammt von ihnen), und ergänzt: „A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong." (Eine von null verschiedene Falsch-Positiv-Rate bedeutet, dass jeder positive Treffer echt sein kann – oder der statistisch anomale Fall von eins zu zehntausend, in dem Pangram falsch liegt.) Die FAQ von Turnitin sagen: „Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies." (Turnitin stellt kein Fehlverhalten fest, sondern stellt Lehrenden Daten zur Verfügung, damit diese auf Grundlage ihrer akademischen und institutionellen Richtlinien eine fundierte Entscheidung treffen.)

Die Lehrkräfte-Seite von Pangram verweist außerdem auf Belege aus dem Schreibprozess und nennt Google Docs: „select File -> Version history -> See version history to see a full history of their writing process." („Datei -> Versionsverlauf -> Versionsverlauf ansehen" auswählen, um die vollständige Geschichte ihres Schreibprozesses zu sehen.) Wenn Sie diesen Verlauf haben, verschiebt sich das Gespräch weg von der Frage, wessen Prozentwert recht hat – und das ist die eine Frage, die die veröffentlichten Zahlen nicht klären können. Wie Sie den Versionsverlauf in Word, Google Docs und Overleaf aufbewahren behandelt, wo jedes Werkzeug ihn speichert, und fälschlich als KI markiert: wie Sie Einspruch einlegen und welche Beweise Ihre Universität akzeptiert den Rest des Verfahrens.

Was das für Sie bedeutet

  • Die beiden Anbieter berichten nicht dieselbe Kennzahl. Das Whitepaper von Turnitin vom August 2024 sagt, dass Genauigkeit nicht als Kennzahl verwendet wird; Pangram wirbt auf der Startseite und auf der Hochschulseite mit einem Genauigkeitswert.
  • Die Prozentwerte zählen Unterschiedliches. Der von Turnitin erfasst nur qualifizierende Prosa; die Anteile von Pangram sind zeichengewichtet über den analysierten Text und ergeben zusammen 1,0. Das Ziel von Turnitin, unter 1 % zu bleiben, ist außerdem an Dokumente mit mehr als 20 % KI-Text gebunden; es gibt also keine Rechnung, die daraus Pangrams 1 von 10.000 macht.
  • Fragen Sie, über welche Menge ein Prozentwert gebildet wurde, nicht welche Version ihn erzeugt hat. Turnitin veröffentlicht zwei Raten auf Satzebene: etwa 4 % (Juni 2023) und 0,33 % (Whitepaper August 2024). Dazwischen hat tatsächlich ein Modellwechsel stattgefunden, im Dezember 2023, und er erklärt die Lücke nicht: Das Whitepaper setzt das ältere Modell auf seinem Testkorpus bei 0,42 % an, nicht bei 4 %. Was die beiden trennt, ist die Menge. Die 4 % zählen nur bereits markierte Sätze; die 0,42 % und die 0,33 % laufen über Texte, die vollständig von Menschen stammen.
  • Klären Sie, ob Ihre Zahl ein Anteil oder eine Konfidenz ist, bevor Sie sie mit irgendetwas vergleichen.
  • Ein Sternchen ist kein niedriger Wert. In der begutachteten Studie hatten 35 von 160 Arbeiten überhaupt keinen Turnitin-Wert.
  • Richten Sie Ihren Einspruch an die Person, die den Scan ausgeführt hat. Die Feedback-Funktion von Pangram sitzt im Konto, das gescannt hat, und keine der 256 in der Sitemap verzeichneten Seiten enthält einen Einspruchsweg für die markierte Person. Fragen Sie nach dem Bericht selbst und nach dem Pangram-Teilen-Link mit seiner Segmentansicht.

Wenn Sie einen Turnitin- oder iThenticate-Bericht in der Hand haben, können Sie den Bericht importieren und an den Passagen arbeiten, die er markiert hat. Passagen, die die Voraussetzungen erfüllen, können kostenlos erneut durchlaufen werden.

WEITERLESEN