Mindestlänge für KI-Detektoren: Was fünf Anbieter selbst veröffentlichen

Den Absatz, den Sie gerade umgeschrieben haben, in einen kostenlosen Checker zu werfen, ist das Naheliegendste überhaupt – und genau der Fall, vor dem jeder dieser Anbieter in seiner eigenen Dokumentation warnt. Fünf von ihnen veröffentlichen eine Mindestlänge. Einer von ihnen hat zwei Selbstversuche veröffentlicht: Seine eigenen Leute schrieben eine kurze Passage von Hand, und das Tool nannte sie KI.

HumanPen-Team

· 10 Min. Lesezeit

Ab wie viel Text sagt der Wert eines KI-Detektors überhaupt etwas aus?

Jeder Detector in dieser Liste nennt eine Untergrenze, und ein einzelner Absatz liegt unter den meisten davon. Das sind die Zahlen der Anbieter selbst, aus ihrer eigenen Dokumentation, geprüft am 18. September 2026:

WerkzeugWas es selbst angibt
Copyleaks – harte Untergrenze"For the AI Detector to get an accurate reading, it requires a minimum of 350 characters" (damit der AI Detector zu einem genauen Ergebnis kommt, braucht er mindestens 350 Zeichen) (Zeichen, nicht Wörter)
Copyleaks – empfohlene Textmenge"we suggest testing text containing an average of 350 words" (wir empfehlen, Text mit durchschnittlich 350 Wörtern zu prüfen)
Winston AI"Minimum 300 characters. Texts under 600 characters may produce unreliable results and should be avoided." (Mindestens 300 Zeichen. Texte unter 600 Zeichen können unzuverlässige Ergebnisse liefern und sollten vermieden werden.)
Originality.aiAuf der Website mindestens 100 Wörter; in der API gibt es keine Untergrenze, dafür den Hinweis "accuracy is decreased for texts below 100 words" (die Genauigkeit ist bei Texten unter 100 Wörtern verringert)
ZeroGPT"At least 150–200 words; longer text (500–1,000+) improves stability." (Mindestens 150 bis 200 Wörter; längerer Text (500–1.000 und mehr) macht das Ergebnis stabiler.)
TurnitinUnter 300 Wörtern Fließtext gar kein KI-Wert

Zwei dieser Untergrenzen sind in Zeichen angegeben, der Rest in Wörtern – deshalb werden sie so leicht verwechselt. Die Umrechnung ist schnell gemacht: Im englischen Fließtext kommt ein Wort samt dem Leerzeichen dahinter auf etwa sechs Zeichen – über die 5.357 auf dieser Seite veröffentlichten Absätze gerechnet liegt der Median bei 6,0. Umgerechnet wird jede Untergrenze in der Tabelle zu einer Wortzahl: Winstons Untergrenze von 300 Zeichen entspricht etwa 50 Wörtern, seine Warnung, Texte unter 600 Zeichen zu meiden, etwa 100; die Untergrenze von Copyleaks bei 350 Zeichen entspricht etwa 58, und die von ihm empfohlene Textmenge liegt bei 350 Wörtern; bei Originality sind es 100; ZeroGPT verlangt mindestens 150 bis 200 und sagt, 500 bis 1.000 und mehr sei noch stabiler; bei Turnitin sind es 300. Halten Sie Ihre eigene Passage dagegen. Zur Einordnung: Wir haben dieselben 5.357 Absätze gegen dieselben Untergrenzen gezählt – 54 % erreichen die 300 Zeichen von Winston, 39 % die 350 Zeichen von Copyleaks, 6 % die 100 Wörter von Originality, 0,5 % die 150 Wörter von ZeroGPT, und die von Copyleaks empfohlenen 350 Wörter erreicht keine einzige. Der mittlere Absatz ist 51 Wörter und 312 Zeichen lang: über einer der sieben Untergrenzen in der Tabelle, den 300 Zeichen von Winston, und unter den anderen sechs.

Zwei Dinge werden hier gern in einen Topf geworfen, und es lohnt sich, sie zu trennen. Eine Untergrenze ist die Linie, unterhalb derer der Anbieter nicht mehr für seine eigene Zahl einsteht – nicht in jedem Fall die Linie, unterhalb derer gar nichts mehr zurückkommt. Manche dieser Tools liefern trotzdem einen Prozentwert: Originality.ai sagt über Scans in seiner API, sie "have no word count minimum" (haben keine Mindestwortzahl), und stellt gleich danach fest, dass die Genauigkeit unter 100 Wörtern sinkt. Andere verweigern sich schlicht, und Turnitin gehört dazu. Eine Zahl auf dem Bildschirm ist also für sich genommen kein Beleg dafür, dass das Tool die Textmenge für ausreichend gehalten hat.

Warum ausgerechnet der Absatz, den Sie gerade umgeschrieben haben, der schwierigste Fall ist

Die markierte Passage überarbeiten, genau diese Passage in einen Checker einfügen, die Zahl ablesen, entscheiden, ob Sie fertig sind. Das Hilfe-Center von Originality.ai setzt genau diesen Ablauf weit nach oben auf seine Liste der Ursachen für Fehlalarme:

You are more likely to receive false positives by only scanning part of the entire piece of content: a single paragraph, the intro, the conclusion, half of the paper... etc. (Wenn Sie nur einen Teil des gesamten Textes prüfen – einen einzelnen Absatz, die Einleitung, das Fazit, die halbe Arbeit usw. –, bekommen Sie mit größerer Wahrscheinlichkeit Fehlalarme.)

Der nächste Satz sagt, was Sie stattdessen tun sollen: "We can fix a lot of false positives by scanning the entire piece of content instead of a snippet. This just gives our tool more context and more content to go off of." (Viele Fehlalarme lassen sich dadurch beheben, dass der gesamte Text geprüft wird statt nur ein Ausschnitt. Unser Tool bekommt dadurch mehr Zusammenhang und mehr Material, an dem es sich orientieren kann.)

Auf derselben Seite stehen zwei Versuche, die der Anbieter mit sich selbst angestellt hat – seltener und nützlicher als jeder Rat:

  • Eine 50 Wörter lange Blog-Einleitung, von der Person, die diesen Hilfeartikel geschrieben hat, von Hand verfasst, kam mit 79 % KI zurück.
  • Ein 107 Wörter langes Fazit, ebenfalls von Hand geschrieben, kam mit 69 % KI zurück. Die Erklärung der Seite: Ein Fazit ist nicht nur kurz, sondern auch formelhaft – "You summarize everything before, give the reader more options and places to click, and finish up with any final calls to action." (Sie fassen alles Vorherige zusammen, geben dem Leser mehr Optionen und mehr Stellen zum Anklicken und schließen mit den letzten Handlungsaufforderungen ab.)

Beide Zahlen stammen aus einem von Menschen geschriebenen Text. Keine von beiden ist ein Beleg über Ihr Schreiben. Sie sind ein Beleg dafür, was ein kurzer, strukturell vorhersehbarer Auszug mit einem Wert macht – und Einleitung und Fazit eines Essays sind von Haus aus beides: kurz und vorhersehbar aufgebaut.

Kurze Auszüge verändern außerdem, wie stark die Formatierung ins Gewicht fällt. Auf der Seite zu den Grenzen des Copyleaks-Detectors heißt es, er lese Tausende von Mustern, "not just words or formatting" (nicht nur Wörter oder Formatierung), und dann folgt der Teil, der bei kurzen Texten zählt: "Numbering, bullets, and outline-style headers are only one small part of the overall signal, but in very short texts they can have a larger relative impact to overall AI detection scores." (Nummerierungen, Aufzählungszeichen und gliedernde Überschriften sind nur ein kleiner Teil des Gesamtsignals, können aber in sehr kurzen Texten einen größeren relativen Einfluss auf den KI-Wert haben.) Ein Methodenabsatz mit drei nummerierten Schritten hat genau diese Form.

Es gibt einen zweiten Grund, warum der umgeschriebene Absatz das denkbar schlechteste Textstück ist, und der hat nichts mit der Länge zu tun: Es ist der Teil Ihres Dokuments, der gerade am stärksten bearbeitet wurde. Die Seite von Originality sagt unverblümt, was die Nutzung von Tools mit ihrem Wert macht: "if a tool interacted with your content in any way, it will raise the AI score" (wenn ein Tool in irgendeiner Weise mit Ihrem Inhalt zu tun hatte, erhöht das den KI-Wert), und sie nennt Grammatikprüfer ausdrücklich neben Chatbots. Wie immer Sie diese Vorgabe bewerten: Sie bedeutet, dass der Absatz, an dem Sie gearbeitet haben, die meisten Bearbeitungsspuren trägt – und Sie verlangen vom Tool, ausgerechnet ihn allein zu beurteilen.

Ein Wert für den einzelnen Satz ist schwächer als der für das Dokument

Die meisten Detektoren färben heute einzelne Sätze ein, was dazu einlädt, den Bericht Satz für Satz zu lesen. Zwei Anbieter sagen ausdrücklich, dass diese kleineren Werte weniger Gewicht haben als der Wert für das Ganze.

Die API-Dokumentation von Winston AI ergänzt bei der Beschreibung der Satzwerte, die sie zurückgibt: "Please note that assessments on smaller samples are less accurate than the general score." (Bitte beachten Sie: Bewertungen auf kleineren Textmengen sind weniger genau als der Gesamtwert.)

Die Hinweise von GPTZero zur Hervorhebung einzelner Sätze gehen noch weiter, und sie beantworten eine Frage, die uns ständig gestellt wird – warum das Umschreiben der markierten Sätze den Wert nicht bewegt hat:

Some sentences in an otherwise AI or human document might not show up as highlighted. They may still have an effect on your score, but they aren't more likely than other parts of your document. (Manche Sätze in einem ansonsten als KI oder als menschlich eingestuften Dokument werden womöglich nicht hervorgehoben. Sie können sich trotzdem auf Ihren Wert auswirken, sind aber nicht auffälliger als andere Teile Ihres Dokuments.)

Und dann, gleich mit der Begründung: "You may find that adjusting an entire document changes your score more than just adjusting the sentences. This is because our detector holistically analyzes the document, and its prediction can depend on a pattern that affects the bulk of the text." (Sie werden vielleicht feststellen, dass die Bearbeitung eines ganzen Dokuments Ihren Wert stärker verändert als nur die Bearbeitung der Sätze. Das liegt daran, dass unser Detector das Dokument als Ganzes analysiert und seine Einschätzung von einem Muster abhängen kann, das den Großteil des Textes betrifft.)

Das ist der Anbieter, der selbst sagt: Die Markierungen sind keine vollständige Karte dessen, was die Zahl erzeugt hat. Was KI-Detektoren tatsächlich messen erklärt, wie diese Werte entstehen und warum die gängige Erklärung dafür überholt ist; die praktische Schlussfolgerung hier ist enger. Wenn Sie die markierten Sätze für die vollständige Liste dessen halten, was Aufmerksamkeit braucht, arbeiten Sie – in den Worten des Anbieters selbst – mit einer unvollständigen Karte.

Gleicher Text, gleiches Tool, anderes Ergebnis

Die Länge ist nicht das Einzige, was einen Wert verschiebt. Copyleaks lässt eine Institution zwischen drei Empfindlichkeitsstufen wählen und veröffentlicht, was jede Stufe mit den eigenen Fehlerraten macht:

StufeWie Copyleaks sie beschreibtFehlalarmeNicht erkannte Fälle
Extra Safe"Designed to minimize false positives by using additional AI detection based filters." (Dafür entwickelt, Fehlalarme durch zusätzliche Filter auf Basis der KI-Erkennung so gering wie möglich zu halten.)0,010 %0,5765 %
Balanced (Standard)"Ideal for detecting AI content while minimizing false positives." (Ideal, um KI-Inhalte zu erkennen und dabei Fehlalarme gering zu halten.)0,0295 %0,174 %
Extra Sensitive"Our most sensitive model, designed to flag AI text that was put through a 'humanizer' or text spinner." (Unser empfindlichstes Modell, dafür entwickelt, KI-Texte zu markieren, die durch einen 'Humanizer' oder einen Textumschreiber gelaufen sind.)0,1973 %0,063 %

Lesen Sie die erste und die letzte Zeile zusammen. Der Wechsel von der vorsichtigsten zur empfindlichsten Stufe vervielfacht die veröffentlichte Fehlalarmrate auf etwa das Zwanzigfache – und das ist ein Schalter auf dem Bildschirm eines anderen. Sie können nicht sehen, auf welcher Stufe er steht, und in einem Bericht, der Ihnen ausgehändigt wird, wird es nicht stehen.

Wenn also Ihre eigene Prüfung und die Prüfung Ihrer Hochschule auseinandergehen, gibt es mindestens drei ganz gewöhnliche Erklärungen, bevor jemand zu dem Schluss kommt, eines der beiden Tools sei kaputt: ein anderes Tool, eine andere Einstellung desselben Tools und eine andere Menge Text. Warum zwei KI-Detektoren unterschiedliche Werte liefern geht die übrigen durch.

Der Wert, der zählt, entsteht an der ganzen Datei

Was auch immer Sie zu Hause laufen lassen: Der Wert mit Konsequenzen entsteht durch das Tool Ihrer Hochschule, an der Datei, die Sie einreichen, mit deren Einstellungen. Für eine Einreichung unter 300 Wörtern Fließtext erzeugt Turnitin überhaupt keinen KI-Wert, und bei Dokumenten knapp oberhalb dieser Linie beschreibt es seine eigene Vorhersage als nahe an „Alles oder Nichts" – was das für kurze Arbeiten bedeutet ist ein eigenes Thema.

Die neueren Clarity-Aufgaben von Turnitin nennen im selben Sinn einen Arbeitsbereich: "For Turnitin Clarity to work optimally, we recommend a minimum word count of 300 words and a maximum of approximately 2,500 words" (damit Turnitin Clarity optimal arbeitet, empfehlen wir eine Mindestwortzahl von 300 Wörtern und ein Maximum von etwa 2.500 Wörtern), und wo die Erkennung von KI-Text eingeschaltet ist: "submissions must be between 300 and 30,000 words." (Einreichungen müssen zwischen 300 und 30.000 Wörtern liegen.)

Ob Sie überhaupt selbst prüfen können, hängt davon ab, was Ihre Hochschule freigeschaltet hat und welche Oberflächen Sie erreichen – eine eigene Frage mit einer eigenen Antwort: wie Sie Ihre Arbeit vor dem Einreichen prüfen.

Was Sie stattdessen tun können

  1. Prüfen Sie das ganze Dokument, nicht die Passage. Das ist die eine Änderung, die dem Rat jedes einzelnen Anbieters entspricht: kein neues Tool, kein neues Konto, keine neue Einstellung – nur dieselbe Prüfung auf mehr Text. Bei Tools, die nach Länge abrechnen, kostet das mehr – in der API-Dokumentation von Winston heißt es "Each word that is processed by the API consumes one credit" (jedes Wort, das die API verarbeitet, verbraucht ein Guthaben) –, und trotzdem ist es der Wert, zu dem ihre eigenen Seiten raten.
  2. Vergleichen Sie nur Gleiches mit Gleichem. Ein Vorher-Nachher-Vergleich sagt nur etwas aus, wenn Tool, Einstellungen und Textmenge auf beiden Seiten dieselben sind. Wer zwischen den zwei Messungen die Menge des Textes ändert, verändert die Messung schon dadurch.
  3. Rechnen Sie damit, dass sich die Zahl bewegt, ohne dass Sie den Text anfassen. Modelle bekommen neue Versionen. Die API-Dokumentation von Winston listet zweiundzwanzig auswählbare Versionen, von 2.0 bis 4.18, und wählt standardmäßig die neueste. Ein Wert von vor drei Wochen und ein Wert von heute müssen nicht vom selben Modell stammen.
  4. Behandeln Sie einen Wert aus Ihrer eigenen Prüfung in keiner Richtung als Urteil. Ein niedriger Wert zu Hause ist keine Entwarnung, weil das Tool Ihrer Hochschule ein anderes ist. Ein hoher Wert auf einem 60 Wörter langen Auszug ist ebenso wenig ein Befund: 60 Wörter überschreiten eine der sieben Untergrenzen oben und keine der übrigen.
  5. Heben Sie den Bericht auf, den Sie tatsächlich bekommen haben. Wenn es schon eine Markierung gab, zählt das Dokument, das Ihre Hochschule erstellt hat, nicht ein Wert, den Sie hinterher selbst erzeugt haben. Nach dem Umschreiben erneut prüfen behandelt, was ein solcher Vergleich zeigen kann und was nicht.

Häufige Fragen

Gibt es eine Wortzahl, ab der Detektoren verlässlich werden? Keiner dieser Anbieter behauptet einen Punkt, an dem sein Ergebnis gewiss wird. Veröffentlicht wird eine Untergrenze, unterhalb derer sie ihre Ergebnisse selbst für unzuverlässig erklären, und eine Richtung: je länger, desto stabiler. Copyleaks formuliert es so: "the accuracy of our detection increases as the text length increases" (die Genauigkeit unserer Erkennung nimmt zu, je länger der Text wird); bei ZeroGPT heißt es, längerer Text "improves stability" (macht das Ergebnis stabiler).

Mein 150 Wörter langer Absatz kam mit 80 % zurück. Heißt das, er ist zu 80 % KI? Nein – und die Verwechslung aufzuklären lohnt sich, weil sie in der Benennung dieser Werte schon eingebaut ist. Das Hilfe-Center von Originality.ai sagt es unmissverständlich: "an AI score of 90% doesn't mean that AI produced 90% of the content. It means that our tool is 90% confident that AI was used in some part to produce the content" (ein KI-Wert von 90 % bedeutet nicht, dass KI 90 % des Inhalts erzeugt hat. Er bedeutet, dass unser Tool zu 90 % sicher ist, dass KI an irgendeinem Teil des Inhalts beteiligt war). Eine Zahl für die Sicherheit und eine Zahl für den Anteil am Dokument sehen auf dem Bildschirm gleich aus und bedeuten Verschiedenes. Der Prozentwert von Turnitin ist noch einmal eine dritte Variante – ein Anteil am qualifizierenden Text.

Kann ich einfach ein paar Absätze zusammenlegen, um über die Untergrenze zu kommen? Genau das schlägt ZeroGPT vor: "consider merging sections before checking." (überlegen Sie, vor der Prüfung Abschnitte zusammenzufassen.) Das bringt Sie über eine Längenschwelle, aber der Wert beschreibt dann den zusammengelegten Block, nicht den Absatz, der Ihnen Sorgen gemacht hat. Wenn Ihre Frage eine bestimmte Passage betrifft, beantwortet keine Anordnung des Textes sie sauber – das ist die ehrliche Antwort, nicht die befriedigende.

Gelten diese Untergrenzen auch für den Turnitin-Bericht meiner Hochschule? Die Untergrenzen oben gehören jeweils zum eigenen Detector eines Anbieters. Turnitin hat eigene: unter 300 Wörtern Fließtext kein Wert, und in den Prozentwert gehen ohnehin nur Fließtextsätze ein. Listen, Tabellen und Aufzählungszeichen liegen außerhalb dessen, was gemessen wird – deshalb können Markierungen und Zahl auseinanderlaufen.

Quellen

WEITERLESEN