Warum Befehle an KI nicht zuverlässig Ihren AI-Score senken
Wer nach "instructions to lower AI rate" sucht, geht davon aus, dass der richtige Prompt die statistischen Werte verschieben kann, die der Detector ausliest. Doch ein Prompt wird von einem KI-Modell verarbeitet, das Text mit eigenen Wortwahrscheinlichkeitsmustern erzeugt. In Turnitins FAQ heißt es, das System könne von Paraphrasier- und Umgehungstools modifizierten Text erkennen. Dieser Mechanismus erklärt, warum Prompts allein keine zuverlässige Lösung sind.
HumanPen-Team
· 4 Min. Lesezeit
Die kurze Antwort
Ein Prompt ist ein Textbefehl, der von einem KI-Modell verarbeitet wird. Wenn Sie eine KI auffordern, "rewrite this to sound more human" oder "add burstiness and perplexity", generiert das Modell neuen Text basierend auf dieser Anweisung. Der neue Text weist weiterhin Wortwahrscheinlichkeitsmuster auf, und genau diese Muster analysiert Turnitins Klassifizierer. Der Detector sieht Ihren Prompt nicht – er erkennt nur die Ausgabe. Ob die Ausgabe niedriger bewertet wird, hängt davon ab, ob sich ihr Wortwahrscheinlichkeitsprofil stark genug von dem unterscheidet, was das Modell als KI-generiert gelernt hat. Das können Sie nicht durch bessere Befehle steuern. Das Modell trifft die Wortwahl, und genau diese Wortwahl erkennt der Detector.
Was der Detector sieht
Turnitins FAQ beschreibt den Prozess:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Wenn eine Arbeit bei Turnitin eingereicht wird, werden Sätze aus der Einreichung extrahiert und in überlappende Abschnitte für die Vorhersageanalyse unterteilt. Jeder Abschnitt wird vom KI-Erkennungsmodell klassifiziert und erhält einen Wert zwischen 0 und 1, der die Wahrscheinlichkeit angibt, dass der Text menschlich oder KI-generiert ist. Jeder qualifizierende Satz in diesen Abschnitten übernimmt die Punktzahl des Abschnitts. Da sich Abschnitte überlappen, können einige Sätze mehrere Punktzahlen haben, die dann zu einer einzigen Punktzahl zusammengefasst werden. Diese Satzpunktzahlen werden weiter aggregiert und zur Berechnung der gesamten Dokument-AI-Schreibpunktzahl verwendet.)
Der Detector liest statistische Merkmale von Wortfolgen in Ihrem Text. Er sieht nicht den Prompt, den Sie verwendet haben. Er weiß nicht, ob der Text generiert, umgeschrieben oder von einem Menschen bearbeitet wurde. Er sieht die endgültigen Wortfolgen und klassifiziert sie.
Warum "Burstiness anpassen" kein Hebel ist
Eine häufige Art von Befehl weist die KI an, "increase burstiness" oder "vary perplexity". Turnitins FAQ sagt:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Unser Modell ist nicht explizit darauf programmiert, bestimmte Signale wie 'Burstiness', 'Perplexity' oder andere einzelne Metriken auszuwerten, die manchmal in öffentlichen Diskussionen erwähnt werden.)
Der nächste Satz: "Instead, it learns statistical patterns from our training data." (Stattdessen lernt es statistische Muster aus unseren Trainingsdaten.)
Und von derselben Seite: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Unsere Klassifizierer sind darauf trainiert, diese Unterschiede in der Wortwahrscheinlichkeit zu erkennen und beherrschen die besonderen Wortwahrscheinlichkeitssequenzen menschlicher Schreiber.)
Das Modell berechnet keine Metrik namens Burstiness und prüft sie gegen einen Schwellenwert. Eine KI anzuweisen, "Burstiness zu erhöhen", bedeutet also, sie aufzufordern, etwas anzupassen, das der Detector möglicherweise nicht so misst, wie Sie denken. Was der Detector misst, sind Wortwahrscheinlichkeitsmuster, die aus Trainingsdaten gelernt wurden. Ob eine KI, die Text mit "mehr Burstiness" erzeugt, diese Muster tatsächlich in eine günstige Richtung verschiebt, können Sie nicht durch Lesen der Ausgabe verifizieren. Verwendet Turnitin Perplexity und Burstiness ist die längere Version dieser Frage.
KI, die KI umschreibt, erzeugt erkennbaren Text
Es gibt ein grundlegenderes Problem. Wenn Sie KI verwenden, um Text umzuschreiben, der als KI-generiert markiert wurde, erzeugen Sie Text, der von einem KI-Tool modifiziert wurde. Turnitins FAQ sagt:
"Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection." (Darüber hinaus kann es auch Fälle identifizieren, in denen KI-generierter Text von KI-Paraphrasier- oder Umgehungstools (auch Humanizer genannt) modifiziert wurde, um der Erkennung zu entgehen.)
Der Detector sucht nicht nur nach rohem KI-generiertem Text. Er sucht auch nach Text, der durch ein Paraphrasier- oder Umgehungstool gelaufen ist. Wenn Sie einen Prompt schreiben, der eine KI anweist, die Ausgabe einer anderen KI umzuschreiben, ist das Ergebnis funktional eine Paraphrasierer-Ausgabe. Der Detector ist darauf trainiert, diese Art von Text zu identifizieren. Dieses Ergebnis hat seinen eigenen Bericht: Ich habe KI-Text mit einer anderen KI paraphrasiert und Turnitin hat ihn trotzdem markiert.
Wenn das Umschreiben schiefgeht
Turnitins FAQ listet auch Text auf, der anfällig für falsch-positive Ergebnisse ist:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Manchmal können falsch-positive Ergebnisse (fälschliches Markieren von menschlich geschriebenem Text als KI-generiert) Inhalte ohne viel strukturelle Variation umfassen, Text, der sich buchstäblich wiederholt, oder Text, der paraphrasiert wurde, ohne neue Ideen zu entwickeln.)
Der nächste Satz: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Wenn unser Indikator eine höhere Menge an KI-Schreiben in solchem Text anzeigt, raten wir Ihnen, dies bei der Betrachtung des angegebenen Prozentsatzes zu berücksichtigen.)
Der dritte Punkt ist der, den man bemerken sollte. "Paraphrased without developing new ideas" (Paraphrasiert, ohne neue Ideen zu entwickeln) beschreibt, was passiert, wenn eine KI Text umschreibt, indem sie Wörter neu mischt, ohne Substanz hinzuzufügen. Der Detector sieht einheitliche Struktur und Wortmuster, die maschinell generiertem Paraphrasieren ähneln. Ein KI-Rewrite, der nur die Oberflächliches ändert, aber dieselbe Struktur beibehält, kann den Text näher an das Falsch-positiv-Profil bringen statt weiter davon weg. Die Bearbeitungen, die tatsächlich die Statistik verändern zeigt, wie die Alternative von Hand aussieht.
Was den Score tatsächlich verändert
Zusammenfassung des bisher Besprochenen:
- Ein Prompt wird von einem KI-Modell verarbeitet, das Text mit eigenen Wortwahrscheinlichkeitsmustern erzeugt. Der Detector sieht die Ausgabe, nicht die Anweisung.
- Das Modell berechnet Burstiness oder Perplexity nicht als benannte Metriken, sodass die Anweisung an eine KI, diese "anzupassen", möglicherweise nicht beeinflusst, was der Detector liest.
- Turnitin erkennt aktiv Text, der von Paraphrasier- und Umgehungstools modifiziert wurde – genau das entsteht, wenn KI KI-generierten Text umschreibt.
- Umschreiben, das nur Wörter neu mischt ohne Substanz hinzuzufügen, kann Text näher an das Falsch-positiv-Profil bringen.
- Was den Score verändert, ist die Änderung des Wortwahrscheinlichkeitsprofils der markierten Passagen, nicht das Schreiben eines besseren Prompts.
Wenn Sie einen Turnitin-Report haben, der zeigt, welche Passagen markiert wurden, importieren Sie ihn und arbeiten Sie speziell an diesen Passagen. Berechtigte Passagen können kostenlos erneut geprüft werden.
WEITERLESEN