Turnitin hat meinen gesamten Methodikteil markiert

Die eigentliche Frage ist nicht, warum das Modell denkt, Sie hätten in Kapitel drei betrogen. Sondern warum die Markierung als durchgehender Block kam und wovon der angezeigte Prozentsatz überhaupt ein Prozentsatz ist.

HumanPen-Team

· 13 Min. Lesezeit

Die kurze Antwort

Weil die Bewertung nicht Satz für Satz bei Ihren Sätzen ankommt. Turnitin beschreibt öffentlich, dass eine Einreichung in überlappende Segmente zerlegt wird, jedes Segment eine Wahrscheinlichkeit erhält und jeder qualifizierende Satz die Score der Segmente erbt, in denen er sitzt. Füttert man das Modell mit einem Textstück, das über zweitausend Wörter denselben Stil, dieselben Satzstrukturen und dasselbe Vokabular durchhält, gibt es für benachbarte Segmente kaum Anlass zu unterschiedlichen Bewertungen. Die Markierung erscheint dann eher als Band denn als Streuung. Die Methodik ist genau der Abschnitt, der absichtlich so geschrieben wird, und Turnitins eigene Darstellung, wo sich seine False Positives häufen, nennt zwei Eigenschaften, die dieses Genre konventionsbedingt haben muss. Das heißt nicht, dass die Zahl falsch ist. Es heißt nur, dass eine rote Wand über einem Abschnitt nicht vierzig separate Urteile über vierzig Sätze ist, und wer es so liest, wird das Falsche zu beheben versuchen.

Warum das als Block erscheint

Was Nutzer beschreiben, ist immer dasselbe Muster. Die Literaturrecherche ist sauber. Die Diskussion ist sauber. Dann beginnt das Methodikkapitel und die Markierung setzt beim ersten Satz unter der Überschrift ein und hört erst auf, wenn das Kapitel endet. Das sieht weniger danach aus, als hätte ein Modell verdächtige Passagen gefunden, und mehr danach, als hätte es ein verdächtiges Kapitel gefunden, weshalb der Anblick so beunruhigend ist.

Turnitin legt öffentlich dar, wie ein Score zustande kommt, und es lohnt sich, die beiden mittleren Sätze dieser Beschreibung zu lesen statt nur die Zusammenfassung:

"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score." (Jeder qualifizierende Satz in diesen Segmenten erbt den Score des Segments. Da Segmente sich überlappen, können manche Sätze mehrere Scores haben, die dann zu einem einzigen Score zusammengefasst werden.)

Die analysierte Einheit ist also ein Textfenster, nicht ein Satz. Ein Satz wird danach bewertet, in welcher Umgebung er steht. Daraus folgt für unsere Lesart, nicht von Turnitin veröffentlicht: Wo aufeinanderfolgende Sätze Fenster teilen und die Fenster einander ähneln, haben die daraus resultierenden Scores wenig Grund zu divergieren, und die abgeleitete Markierung kommt zusammenhängend heraus. Ein Band ist die erwartete Darstellung eines uniformen Textstücks. Es ist keine Zählung unabhängiger Befunde.

Das hat praktische Konsequenzen. Der erste markierte Satz in Ihrem Methodikkapitel ist nicht unbedingt der Punkt, an dem irgendetwas begann, denn ein Segment, das die Überschrift überspannt, enthält den letzten Absatz des Vorhergehenden. Leute verbringen echte Zeit damit, auf den ersten markierten Satz zu starren und zu überlegen, was genau an ihm falsch sein könnte. Nach der öffentlichen Beschreibung muss möglicherweise gar nichts speziell an ihm falsch sein.

Es bedeutet auch, dass die Arithmetik, nach der Leute greifen, nicht existiert. Man kann ein Band nicht durch seine Sätze teilen und einen Pro-Satz-Preis erhalten, und man kann einen Satz nicht subtrahieren und vorhersagen, was passiert. Wir haben das anhand der drei am weitesten verbreiteten Versionen auseinandergenommen in Wenn ich einen markierten Satz überarbeite, sinkt dann der Score.

Das ehrliche Limit bei all dem: Turnitin hat den groben Umriss der Pipeline veröffentlicht, nicht die Pooling-Funktion, die Aggregation oder die Segmentlänge. Alles oben steht für das, was die veröffentlichte Beschreibung über die Verteilung impliziert. Nichts davon erlaubt es irgendjemandem, eine Zahl vorherzusagen.

Wie viel Ihres Methodikkapitels wird überhaupt bewertet

Das Zweite, was zu klären ist, ist der Nenner, denn zwei Methodikkapitel mit denselben Informationen können dem Modell völlig unterschiedliche Textmengen präsentieren. Turnitin analysiert nur, was es qualifizierenden Text nennt:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." Der Satz unmittelbar danach ist der, auf den es hier ankommt: "This percentage is not necessarily the percentage of the entire submission." (Dieser qualifizierende Text enthält nur Prosa-Sätze, was bedeutet, dass wir nur Textblöcke analysieren, die in standardmäßigen grammatikalischen Sätzen verfasst sind und keine anderen Schreibformen wie Listen, Aufzählungspunkte (kurze Nicht-Satz-Strukturen) oder andere Nicht-Satz-Strukturen enthalten. Der unmittelbar darauffolgende Satz ist hier der entscheidende: Dieser Prozentsatz entspricht nicht unbedingt dem Prozentsatz der gesamten Einreichung.)

Schauen Sie nun, wie Ihre Disziplin diesen Abschnitt tatsächlich schreibt. Ein Laborprotokoll kommt als nummerierte Schritte, eine Reagenzien-Tabelle, eine Instrumentenliste und ein Einstellungsblock. Ein Methodikkapitel in Psychologie oder Pädagogik kommt als durchgehende Absätze: Teilnehmer, Materialien, Prozedur, Analyse, jedes ein Lauf aus ganzen Sätzen. Das sind aus Analyssicht zwei verschiedene Einreichungen, und die zweite kommt massiv zurück.

Wie der Abschnitt aufgebaut istWas in qualifizierenden Text eingehtWovon der Prozentsatz dann handelt
Nummerierte Schritte, Parametertabellen, Gerätelisten, GleichungenWenig davon, da das Meiste keine standardsprachlichen Sätze sindMeist die Prosa anderswo im Dokument, nicht dieser Abschnitt
Durchgehende Absätze, die Teilnehmer, Materialien und Prozedur beschreibenEffektiv alles davonEine Stichprobe, die fast vollständig aus konventioneller Prozeduralprosa besteht
Langform-Prosa in einer Tabellenzelle sitzendWird verarbeitet. Eine Release Note vom 9. August 2023 kündigte an, das Modell könne Langform-Prosatext in Tabellen verarbeiten, und fügte hinzu, dass bestehende Einreichungen erneut eingereicht werden müssen, bevor sie neu verarbeitet werdenDasselbe wie gewöhnliche Absätze, was Leute überrascht, die Text aus anderen Gründen in eine Tabelle verschoben haben

Es gibt eine kontraintuitive Konsequenz in der mittleren Zeile. Aus qualifizierendem Text ausgeschlossen zu sein ist kein Rabatt. Es entfernt die nummerierten Schritte und die Wertetabellen, die ohnehin nie wie generierte Prosa aussehen würden, und lässt den Teil Ihres Schreibens zurück, der am konventionellsten ist. Je schmaler die qualifizierende Stichprobe, desto vollständiger ist die Zahl eine Aussage über Ihre prozeduralen Absätze speziell.

Ein Ausschluss läuft andersherum und ist wissenswert, weil er einen häufigen Fehlalarm entfernt: Dieselbe Release Note von 2023 verzeichnet, dass Markierung innerhalb einer Bibliographie ein Bug war, dass Bibliographien jetzt beim Verarbeiten des AI Writing Report ausgeschlossen werden, und dass Einreichungen mit hervorgehobenen Referenzbereichen erneut eingereicht werden müssen, um neu verarbeitet zu werden. Wenn Sie einen alten Bericht mit aufleuchtendem Literaturverzeichnis ansehen, ist das, was Sie da sehen.

Die Lücke zwischen der Zahl und der Menge der Markierung auf der Seite folgt aus all dem, und Turnitin sagt es direkt, statt es zur Inferenz zu überlassen. Wie man einen Turnitin AI Writing Report liest arbeitet diese Lücke durch; Kann Turnitin eine ganze Thesis prüfen deckt ab, was bei den Längenlimits passiert, wo Kapitel-Einreichungen leben.

Das Genre antwortet auf die eigene Liste des Anbieters

Turnitin veröffentlicht eine Darstellung dessen, was seine False Positives tendenziell gemeinsam haben. Wortwörtlich:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Falschpositive Meldungen (fälschlicherweise als KI-generiert markierter menschlich verfasster Text) können manchmal Inhalte ohne große strukturelle Variation umfassen, Text der sich wortwörtlich wiederholt oder Text der ohne Entwicklung neuer Ideen paraphrasiert wurde.)

Der Satz danach richtet sich überhaupt nicht an Sie:

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Wenn unser Indikator in solchem Text einen höheren Anteil an KI-Schreiben anzeigt, raten wir Ihnen, dies bei der Betrachtung des angegebenen Prozentsatzes zu berücksichtigen.)

Zwei der drei Punkte auf dieser Liste beschreiben Dinge, die ein Methodikteil tun soll. Strukturelle Variation ist das, was eine Berichts-Checkliste die ganze Zeit entfernt: derselbe Rahmen für jede Messung, dieselbe Reihenfolge von Unterabschnitten, dieselbe Konstruktion für jedes Instrument, damit zwei identisch beschriebene Prozeduren vergleichbar sind. Literale Wiederholung ist, wie Sie signalisieren, dass zwei Bedingungen wirklich gleich behandelt wurden. Das ist der einzige Abschnitt einer Thesis, in dem es korrekt ist, elfmal dieselbe Satzform zu schreiben, und es ist auch der Abschnitt, in dem das teuer rückgängig zu machen ist. Was Sie dort sicher umformulieren können und was nicht, ist ein separates Problem mit eigenen Regeln, in Was Sie in Methodik und Ergebnissen sicher umformulieren können, und die weitergehende Frage, ob Sie Ihr Schreiben überhaupt anpassen sollten, steht in Sollten Sie ändern, wie Sie schreiben.

Wenn Sie den Abschnitt allein geprüft haben, haben Sie etwas anderes gemessen

Viel Panik in dieser Situation kommt von einer Selbstprüfung statt von einem institutionellen Bericht: Das Kapitel wird in irgendetwas eingefügt oder allein in eine Draft-Check-Einreichung gepostet und kommt mit einer Zahl zurück, die niemand sehen will.

Turnitin beschreibt kurze Einreichungen, die sich ihrer Art nach anders verhalten, nicht nur im Grad:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." Und der Satz, der folgt: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Bei kürzeren Dokumenten mit nur wenigen hundert Wörtern ist die Vorhersage meist alles oder nichts, da wir auf einem einzigen Segment ohne Überlappungsmöglichkeit vorhersagen. Der darauffolgende Satz: Das bedeutet, dass Text der eine Mischung aus KI-generierten und originalen Inhalten darstellt als vollständig KI-generiert markiert werden könnte.)

Ein allein eingereichtes Methodikkapitel ist ein Kandidat für diese Zone, und mehr noch als seine Wortzahl suggeriert, weil die nummerierten Schritte und Tabellen zuerst aus dem Nenner kommen. Es gibt auch einen Floor darunter: Ein AI Writing Report braucht mindestens 300 Wörter Prosa im Langform-Format, also kann ein kurzer Methodikteil allein möglicherweise gar keinen Bericht produzieren statt einen niedrigen. Und unterhalb des Anzeigethresholds gibt es nichts zu lesen: Ergebnisse über 0% und unter 20% werden als Sternchen ohne Zahl und ohne Highlights angezeigt, was bedeutet, dass eine echte Verbesserung und keine Verbesserung von Ihrem Standpunkt aus identisch aussehen.

Was ein roter Abschnitt nicht klärt

Es ist verlockend, den Mechanismus oben als Befund zu Ihren Gunsten zu behandeln. Ist er nicht. Alles auf dieser Seite erklärt, wovon die Zahl eine Messung ist. Nichts davon ist Evidenz darüber, wer Ihr Kapitel geschrieben hat, und es wirkt in beide Richtungen: Ein Band über Ihren Methodikteil ist kein Beweis für irgendetwas, und eine Erklärung, warum Bänder passieren, ebenso wenig.

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." Der nächste Satz ist, wo das Gewicht sitzt: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Unser KI-Schreiberkennungsmodell ist nicht immer zuverlässig (es kann menschlich verfasste, KI-generierte und KI-paraphrasierte Texte falsch identifizieren), daher sollte es nicht als einzige Grundlage für nachteilige Maßnahmen gegen einen Studierenden dienen. Der folgende Satz trägt das Gewicht: Es bedarf weiterer Prüfung und menschlichen Urteils in Verbindung mit der Anwendung der spezifischen akademischen Richtlinien einer Institution, um festzustellen, ob akademisches Fehlverhalten vorliegt.)
  • Ein Band ist eine Verteilung, keine Zählung. Es sagt Ihnen, die Scores des Modells waren über diesen Strecken uniform. Es sagt Ihnen nicht, wie irgendeiner davon konfident war.
  • Der Prozentsatz handelt von qualifizierender Prosa, also ist er nicht zwischen zwei unterschiedlich layouteten Kapiteln vergleichbar, und Kapitel-Prozentsätze zusammenzuzählen produziert eine Zahl, die auf nichts referiert.
  • Der Bericht wird von einem System generiert, dessen eigener Anbieter sagt, es könne Text falsch identifizieren, was ein Grund für eine Person ist, hinzusehen, statt den Output zu verwerfen.
  • Nichts davon ist in den meisten Setups von Ihnen überprüfbar. Der Indikator und Bericht sind für Studierende nicht sichtbar, obwohl eine Lehrkraft den Bericht als PDF herunterladen und teilen kann.

Tragen Sie diesen Artikel nicht als Argument in ein Meeting. Jemandem, der dieselben Help Pages schon gelesen hat, einen Klassifikator zu erklären, sieht eher nach Vorbereitung aus als nach einer Antwort, und es verlagert das Gespräch auf Boden, wo Sie über ein Modell statt über Ihre Arbeit streiten. Was tatsächlich Gewicht trägt, ist Provenienz: Drafts, das Protokoll, die Analyse-Datei, die Daten. Markiert, aber Sie haben es selbst geschrieben deckt ab, welche Evidenz sich zusammenzustellen lohnt, das Gespräch nach einem AI-Flag deckt ab, was das Meeting prozedural ist, und Versionshistorie als Evidenz deckt ab, wo der Record lebt, wenn Sie vorher nicht darüber nachgedacht haben.

Wenn der Abschnitt ohnehin überarbeitet wird

Manchmal ist die Entscheidung schon getroffen, von einem Supervisor oder von Ihnen, und die Frage wird, wie man es macht, ohne irgendetwas kaputtzumachen. Methodik ist der schlimmste Abschnitt in einer Thesis, um lässig umzuformulieren. Reihenfolge, Timing, Dosis, Gerät, Einstellungen, Entscheidungsregeln, Analyse-Population und Exklusionen sind der Inhalt, und ein flüssiger Satz, der leise einen davon fallen lässt, ist ein echter Defekt, wo ein steifer Satz es nicht war.

Die Kosten, die Leute unterschätzen, sind nicht das Umschreiben. Es ist die Re-Verifikation. Jeder Absatz, der angefasst wird, ist ein Absatz, den Sie jetzt gegen das Protokoll, den Analyse-Code und die Tabellen lesen müssen. Ein Plan, der ein ganzes Kapitel berührt, hat einen Korrekturlese-Job in Kapitelgröße geschaffen, weshalb der Umfang der Änderung mehr zählt als die Methode, mit der sie gemacht wird.

Das ist der Teil, um den HumanPen gebaut ist. Importieren Sie den Turnitin- oder iThenticate AI Writing Report für diese Einreichung und die Passagen, die er markiert, werden zum Umfang: Nur dieser Text wird umgeschrieben, alles andere ist eingefroren, und die eigene Beschreibung der Paragraphenregel der Site ist, dass "a paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm". Formeln, Figuren und Tabellenstrukturen sind nicht Teil des Text-Rewrites, was in diesem Abschnitt mehr zählt als anderswo im Dokument. Die Abrechnung zählt die tatsächlich umgeschriebenen Wörter statt der Datei, die Sie hochgeladen haben. Berechtigte Ergebnisse können KI kostenlos weiter senken.

Was das alles nicht ist, ist eine Vorhersage. Turnitins Modell ändert sich, die Display-Regeln haben sich schon geändert, und wir haben keine Möglichkeit, Ihnen zu sagen, was Ihr nächster Bericht sagen wird. Die Claims oben handeln davon, welche Wörter berührt werden und welche abgerechnet werden, was die zwei Dinge sind, die wir tatsächlich kontrollieren können.

Häufig gestellte Fragen

Warum ist mein ganzer Methodikteil markiert, obwohl ich jedes Wort selbst geschrieben habe? Weil die Klassifikationseinheit ein überlappendes Segment ist, nicht ein Satz, und Sätze die Scores der Segmente, die sie enthalten, erben und poolen. Ein langer Strecken in einem Register geschrieben gibt benachbarten Segmenten wenig zu differenzieren, also tendiert der Output dazu, zusammenhängend zu sein. Das ist eine Beschreibung, wie ein Band entsteht, keine Aussage, dass Ihr spezielles Band ein False Positive ist.

Bedeutet ein solider Markierungsblock, dass jeder Satz darin als KI beurteilt wurde? Nein, und die öffentliche Beschreibung ist der Grund. Ein Satz trägt einen Score, den er von den Segmenten, in denen er sitzt, geerbt hat, möglicherweise mehr als einen, gepoolt. Ein Band als Liste individueller Urteile zu lesen ist der Fehler, der zu Satz-für-Satz-Editing-Plänen führt.

Mein Methodikteil besteht meist aus nummerierten Schritten und einer Parametertabelle. Warum ist der Prozentsatz trotzdem hoch? Die sind möglicherweise gar nicht in der Analyse. Turnitin analysiert qualifizierenden Text, also Prosa in standardsprachlichen Sätzen, und es stellt fest, dass der Prozentsatz nicht notwendigerweise der Prozentsatz der gesamten Einreichung ist. Das Ausschließen der Schritte und Tabellen lässt die konventionellen Absätze als die Stichprobe zurück, die die Zahl beschreibt.

Sollte ich Vielfalt in meinen Methodikteil einbauen, damit er weniger repetitiv aussieht? Das ist eine Frage nach den Berichtsstandards Ihrer Disziplin, bevor es eine Frage nach einem Detektor ist, und die Wiederholung in einem Methodikteil erfüllt meist eine Aufgabe. Der eigene Rat des Anbieters zu Text mit diesen Eigenschaften richtet sich an denjenigen, der den Bericht liest, nicht an denjenigen, der ihn geschrieben hat.

Ich habe das Kapitel allein durch einen Checker laufen lassen und eine sehr hohe Zahl bekommen. Ist das die Zahl, die mein Supervisor sieht? Nicht notwendigerweise, denn es ist eine andere Einreichung. Turnitin sagt, Vorhersagen bei Dokumenten mit wenigen hundert Wörtern kommen meist alles oder nichts heraus, da es ein einziges Segment ohne Überlappung gibt, und dass gemischter Inhalt in dieser Situation als vollständig KI-generiert markiert werden kann. Ein Kapitel ist auch ein anderer Nenner als eine gesamte Datei.

Kann ich die False-Positive-Liste des Anbieters als Verteidigung zitieren? Es ist eine öffentliche Aussage über die Error Modes des Tools und sie richtet sich an denjenigen, der den Prozentsatz liest, also ist es fair zu wissen, dass sie existiert. Sie ist keine Evidenz über Ihr Dokument, und das Mitnehmen eines Mechanismus in ein Fehlverhaltens-Gespräch als Argument wirkt meist gegen Sie. Bringen Sie die Drafts und das Protokoll mit.