AIGC-Erkennung bei englischen Facharbeiten: Was das bedeutet und wie sie funktioniert
„AIGC-Erkennung" ist der Begriff, den viele chinesische Forschende verwenden, wenn es um die Erkennung von KI-Texten in englischen Arbeiten geht. Der Erkennungsmechanismus ist derselbe, egal wie Sie ihn nennen. Die FAQ von Turnitin beschreiben eine Verarbeitungskette, die überlappende Textabschnitte nach Wortwahrscheinlichkeit klassifiziert. Wer den Mechanismus versteht, kann den eigenen Bericht richtig lesen.
HumanPen-Team
· 4 Min. Lesezeit
Die kurze Antwort
AIGC-Erkennung bei englischen Arbeiten bezeichnet denselben Vorgang wie die Erkennung von KI-Texten. Der Detektor von Turnitin zerlegt Ihren Text in überlappende Abschnitte, ordnet jedem Abschnitt eine Wahrscheinlichkeit zu, ob er von einem Menschen oder von einer KI stammt, und fasst diese Werte zu einem Prozentwert für das gesamte Dokument zusammen. Der Begriff „AIGC" (AI-generated content, also KI-generierte Inhalte) ist im chinesischen akademischen Umfeld verbreitet, aber der Erkennungsmechanismus ist derselbe, unabhängig davon, wie Sie ihn nennen. Der Detektor sucht nicht nach Signaturen oder Wasserzeichen bestimmter KI-Werkzeuge. Er liest statistische Muster in der Wortwahl, genauer: Muster der Wortwahrscheinlichkeit, die er beim Training gelernt hat. Der KI-Wert ist völlig unabhängig vom Similarity-Wert (Plagiatsprüfung), und den KI-Hinweis sehen nur Lehrkräfte oder Administratoren.
Wie die AIGC-Erkennung funktioniert
Die FAQ von Turnitin beschreiben die Verarbeitungskette so:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Wird bei Turnitin eine Arbeit eingereicht, werden die Sätze der Einreichung entnommen und für die Vorhersageanalyse in überlappende Abschnitte unterteilt. Jeder Abschnitt wird vom KI-Erkennungsmodell klassifiziert und erhält einen Wert zwischen 0 und 1, der angibt, mit welcher Wahrscheinlichkeit der Text vermutlich von einem Menschen oder von einer KI stammt. Jeder qualifizierende Satz innerhalb dieser Abschnitte übernimmt den Wert des Abschnitts. Da sich die Abschnitte überlappen, können manche Sätze mehrere Werte haben, die dann zu einem einzigen Wert zusammengefasst werden. Diese Satzwerte werden weiter aggregiert und dienen der Berechnung des KI-Schreibwerts für das gesamte Dokument.)
Der Detektor sucht nicht nach bestimmten Formulierungen, die „nach KI aussehen". Er klassifiziert Textabschnitte mit einem Modell, das statistische Muster aus Trainingsdaten gelernt hat. Jeder Abschnitt erhält eine Wahrscheinlichkeit, und diese Wahrscheinlichkeiten werden zusammengefasst und zu einem einzigen Prozentwert aggregiert. Der Prozentwert gibt an, welcher Anteil des qualifizierenden Textes vom Modell als wahrscheinlich KI-generiert eingestuft wird.
Worauf das Modell achtet
Zwei Aussagen aus den FAQ machen den Ansatz des Modells deutlich. Erstens: „Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Unser Modell ist nicht ausdrücklich darauf programmiert, bestimmte Signale wie 'burstiness', 'perplexity' oder andere einzelne Kennzahlen zu bewerten, die in öffentlichen Diskussionen gelegentlich erwähnt werden.) Der nächste Satz: „Instead, it learns statistical patterns from our training data." (Stattdessen lernt es statistische Muster aus unseren Trainingsdaten.) Zweitens: „Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Unsere Klassifikatoren sind darauf trainiert, diese Unterschiede in der Wortwahrscheinlichkeit zu erkennen, und sind mit den typischen Wortwahrscheinlichkeitsfolgen menschlicher Autoren vertraut.)
Das Modell berechnet keine benannten Kennzahlen wie Burstiness oder Perplexity. Es wurde aber mit Daten zur Wortwahrscheinlichkeit trainiert. Die Muster, die es lernt, drücken sich darin aus, wie Wörter gewählt und aneinandergereiht werden – nicht in Oberflächenmerkmalen wie der Variation der Satzlänge oder der Vielfalt des Wortschatzes. Deshalb reichen oberflächliche Änderungen, etwa ein paar Wörter auszutauschen oder Überleitungen einzufügen, womöglich nicht aus, um den Wert zu verändern. Der Detektor liest tiefere statistische Merkmale der Wortfolgen – worum es in Was KI-Detektoren jenseits von Perplexity und Burstiness messen geht.
Nur Fließtext wird analysiert
Die FAQ legen fest, was als auswertbarer Text gilt:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Dieser qualifizierende Text umfasst nur Prosasätze, das heißt: Wir analysieren nur Textblöcke, die in standardsprachlichen, grammatikalisch vollständigen Sätzen verfasst sind, und keine anderen Textarten wie Listen, Aufzählungspunkte (kurze Strukturen, die keine Sätze sind) oder andere satzferne Strukturen.)
Der nächste Satz: „This percentage is not necessarily the percentage of the entire submission." (Dieser Prozentsatz ist nicht notwendigerweise der Prozentsatz für die gesamte Einreichung.)
Für englische Facharbeiten bedeutet das: Ihre Methodik-Tabellen, Ihre Gleichungsblöcke, Ihre Bildunterschriften und Ihr Literaturverzeichnis sind von der KI-Analyse weitgehend ausgenommen. Der Prozentwert bezieht sich nur auf die Fließtextanteile Ihres Manuskripts. Eine Arbeit mit vielen Tabellen und Gleichungen hat weniger qualifizierenden Text, das heißt, der KI-Prozentwert steht für einen kleineren Teil des Dokuments, als es den Anschein hat. In Wie man einen Turnitin-Bericht zur KI-Erkennung liest wird Schritt für Schritt gezeigt, wo diese Lücke auf der Seite sichtbar wird.
AIGC-Wert und Similarity-Wert
Die beiden Werte sind zwei getrennte Messungen:
"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Der Similarity-Wert und der Prozentwert der KI-Schreiberkennung sind vollständig unabhängig voneinander und beeinflussen sich nicht gegenseitig.)
Ihr Similarity-Wert gibt an, wie viel Ihres Textes mit vorhandenen Quellen in der Datenbank übereinstimmt. Ihr AIGC-Wert gibt an, wie viel Ihres Textes das Modell als wahrscheinlich KI-generiert einstuft. Eine Arbeit kann einen hohen Similarity-Wert haben (durch korrekt zitierte Quellen) und einen niedrigen AIGC-Wert – oder einen niedrigen Similarity-Wert und einen hohen AIGC-Wert. An dem einen Wert zu arbeiten verändert den anderen nicht. Wenn Sie Ihren AIGC-Wert senken wollen, hilft es nicht, den Similarity-Wert zu senken, und umgekehrt; wo es meistens schiefgeht, ist, beide Werte für dasselbe zu halten.
Was zu tun ist, wenn Ihr AIGC-Wert hoch ist
Zusammenfassung des Bisherigen:
- Die AIGC-Erkennung bei englischen Arbeiten funktioniert genauso wie die Erkennung von KI-Texten: Sie klassifiziert Muster der Wortwahrscheinlichkeit in Fließtextabschnitten.
- Das Modell berechnet Burstiness und Perplexity nicht als benannte Kennzahlen, wurde aber mit Daten zur Wortwahrscheinlichkeit trainiert.
- Es werden nur Prosasätze analysiert. Tabellen, Gleichungen und Literaturverzeichnisse sind weitgehend ausgenommen.
- AIGC-Wert und Similarity-Wert sind vollständig unabhängig. Den einen zu verändern hat keinen Einfluss auf den anderen.
- Den KI-Hinweis sehen nur Lehrkräfte und Administratoren. Studierende können die PDF-Version bei ihrer Lehrkraft anfordern.
Wenn Sie einen Turnitin- oder iThenticate-Bericht haben, der zeigt, welche Passagen markiert wurden, importieren Sie den Bericht und arbeiten Sie an genau diesen Passagen. Passagen, die die Voraussetzungen erfüllen, können kostenlos erneut durchlaufen werden.
WEITERLESEN