So funktioniert die Erkennung von KI-Text
Sieben Detektoren, sieben verschiedene Fragen. Was jeder von ihnen misst, worauf er sich stützt und wo er aufhört.
GPTErkennung schickt einen Text gleichzeitig an sieben Detektoren und zeigt den Score jedes einzelnen getrennt an, auf einer Skala von 0 bis 100. Fünf davon laufen direkt bei uns und messen jeweils eine Eigenschaft: die Abweichung von Ihren früheren Texten, die Nähe zur Vorlage der gewählten Textsorte, KI-typische Floskeln, maschinellen Satzrhythmus und versteckte Zeichen. Die anderen beiden sind eigenständige Modelle, OpenAI und ZeroGPT. Wir fassen sie nie zu einer Zahl zusammen, weil jeder eine andere Eigenschaft des Textes misst und ein Widerspruch zwischen ihnen selbst eine Information ist. Zu den Zahlen gehören eine Farbkarte des Textes und die Sätze, die die einzelnen Detektoren markiert haben. Kein Detektor für KI-Text ist hundertprozentig genau, das Ergebnis ist eine Grundlage, kein Urteil.
Was mit dem Text vor der Erkennung passiert
Zuerst wird die Sprache erkannt — Tschechisch, Slowakisch, Englisch oder Deutsch — anhand typischer Buchstaben und der häufigsten Wörter. Nach der Sprache richten sich die Floskellisten, die Vergleichsbeispiele und die Stilmaße. Bei anderen Sprachen fehlt einem Teil der Detektoren die Vergleichsgrundlage, das Ergebnis ist dann nur ein Anhaltspunkt.
Danach werden die Teile ausgeklammert, die der Autor nicht in eigenen Worten geschrieben hat oder die eine vorgegebene Form haben: Literaturverzeichnis, Zitate, Fußnoten, Bild- und Tabellenbeschriftungen, Inhaltsverzeichnis, ein Abstract in einer anderen Sprache, Danksagung, eidesstattliche Erklärung, wiederholte Seitenkopfzeilen sowie bei E-Mails und Briefen Anrede, Signatur und die zitierte vorherige Nachricht. Blieben sie drin, würden sie den Score verzerren. Die gewählte Textsorte bestimmt, was ausgeklammert wird und an welcher Vorlage der Text gemessen wird.
Die sieben Detektoren
Alle sieben laufen gleichzeitig. Antwortet einer nicht, gelten die anderen Zahlen weiter, es fehlt nur diese eine.
Stilabweichung
Wie stark der Stil des Textes von Ihren früheren Texten abweicht. Verglichen werden Eigenschaften, die man bewusst kaum verändert: Satz- und Wortlänge und ihre Streuung, Wortschatzreichtum, der Anteil langer und kurzer Wörter, Zeichensetzung, der Anteil von Großbuchstaben, diakritischen Zeichen und Ziffern sowie die Häufigkeit der gängigsten Wörter der Sprache. Die Passagen mit der größten Abweichung werden violett hervorgehoben.
Grundlage:Ihre eigenen Texte in derselben Sprache: bis zu fünfzig letzte Prüfungen derselben Textsorte und hochgeladene Mustertexte, die doppelt zählen. Prüfungen, bei denen ZeroGPT, KI-Floskeln oder die Stilabweichung selbst über 50 lagen, fließen nicht in die Basis ein, damit sie nicht von KI-Texten lernt.
Grenze:Sie greift erst ab sechs Texten mit mehr als 250 Zeichen. Sie misst eine Stiländerung, nicht KI — ein anderer Stil kann auch andere Gründe haben, etwa einen Mitautor, ein anderes Thema oder ein gründliches Lektorat.
Sortenvorlage
Wie genau der Text dem Aufbau der gewählten Textsorte folgt. Beobachtet werden gleich lange Absätze, ein in viele kurze Absätze zerhackter Text, Aufzählungen mit gleich langen Punkten, Überschriften, Zeilen in der Form „Begriff: Erklärung“, Dreieraufzählungen, Hashtags und ein Mangel an konkreten Angaben wie Zahlen und Namen.
Grundlage:Regeln für zehn Textsorten: Essay, Facharbeit, Betrachtung, Erzählung, Blog, Beitrag, Rezension, E-Mail, Motivationsschreiben und Bericht. Jede Sorte gewichtet die Signale anders — beim Essay zählen vor allem gleichmäßige Absätze, Dreieraufzählungen und Allgemeinheit, beim Bericht Überschriften, Aufzählungen und kurze Absätze.
Grenze:Null heißt nicht, dass ein Mensch geschrieben hat, und wer nach einer strengen Gliederung schreibt, etwa einen Bericht oder eine Facharbeit, kann hoch landen. Im Deutschen wird der Mangel an konkreten Angaben nicht gemessen, weil hier alle Substantive großgeschrieben werden.
KI-Floskeln
Wie viele für Sprachmodelle typische Wendungen und Formatierungen der Text enthält — etwa „in der heutigen schnelllebigen Zeit“, „es ist wichtig zu beachten“ oder „nicht zuletzt“, aber auch lange Gedankenstriche, Pfeile, Fettdruck, Markdown-Überschriften und -Tabellen oder Emoji. Gefundene Floskeln werden gelb hervorgehoben.
Grundlage:Eine Liste von mehr als 5.600 Wendungen auf Tschechisch, Slowakisch, Englisch und Deutsch, in der starke Floskeln doppelt zählen. Die Treffer werden auf hundert Wörter umgerechnet, ein längerer Text landet also nicht höher, nur weil er länger ist.
Grenze:Sie sieht nur, was auf der Liste steht. Wer in einem festen Amtsstil schreibt, kann hoch landen, und ein KI-Text, aus dem jemand die Floskeln gestrichen hat, niedrig. Eine einzelne Floskel beweist nichts, es kommt auf ihre Dichte an.
Maschineller Eindruck
Wie maschinell der Aufbau des Textes wirkt. Zur Hälfte bestimmt ihn, wie ähnlich lang die Sätze sind, zu dreißig Prozent abgenutzte Wendungen und zu zwanzig Prozent Wörter und Dreiwortfolgen, die sich im Text wiederholen.
Grundlage:Statistik des Textes selbst, ohne Vergleich mit anderen Texten. Die Humanisierung zeigt dieselbe Zahl, so sieht man, wie sich der maschinelle Eindruck nach dem Umschreiben verändert hat.
Grenze:Ein kurzer Text hat zu wenige Sätze, um den Rhythmus verlässlich zu messen. Ein knapper Fach- oder Amtsstil mit ähnlich langen Sätzen kann maschinell wirken, auch wenn ein Mensch ihn geschrieben hat.
Versteckte Zeichen
Unsichtbare Zeichen, die beim Kopieren mitwandern: Nullbreite-Leerzeichen, Steuer- und Richtungszeichen, ungewöhnliche Arten von Leerzeichen und Buchstaben mit diakritischen Zeichen, die aus zwei Zeichen zusammengesetzt sind. Bei einer hochgeladenen Datei sucht der Detektor außerdem nach einem signierten Herkunftsnachweis nach dem Standard C2PA.
Grundlage:Die Zahl solcher Zeichen pro tausend Zeichen Text. Manche kommen in normalem Schreiben überhaupt nicht vor, ein einziges reicht für 100. Auf 100 kommt auch eine Datei, deren Herkunftsnachweis mit gültiger Signatur angibt, dass der Inhalt von KI erstellt wurde.
Grenze:Null heißt nicht, dass ein Mensch geschrieben hat — es genügt, den Text umzuschreiben oder als reinen Text einzufügen, und die Zeichen verschwinden. Manche entstehen umgekehrt auch ohne KI, etwa beim Kopieren aus einem PDF.
OpenAI
Ein Sprachmodell von OpenAI liest den Text als Ganzes und schätzt, welcher Anteil von KI stammt. Es liefert auch die Sätze, die es zu diesem Urteil geführt haben, und diese werden blau hervorgehoben.
Grundlage:Vergleich mit Beispielen. Das Modell erhält acht Texte derselben Sorte und Sprache, von denen bekannt ist, dass KI sie geschrieben hat, dazu Beispiele menschlichen Schreibens aus Sprachkorpora. Derselbe Text erhält immer dieselben Beispiele. Ein langer Text wird in Teilen von bis zu zwölftausend Zeichen beurteilt und das Ergebnis nach ihrer Länge gewichtet.
Grenze:Es ist das Urteil eines anderen Sprachmodells, keine Messung, und es kann sich in beide Richtungen irren. Bei einem Grenzfall kann seine Schätzung zwischen zwei Prüfungen leicht abweichen.
ZeroGPT
Ein eigenständiger Detektor des Dienstes ZeroGPT. Er liefert den Anteil des Textes, den er für KI hält, und die markierten Sätze, die rot hervorgehoben werden.
Grundlage:Das eigene Modell des Dienstes ZeroGPT. Ein längerer Text wird in Teilen von bis zu zwölftausend Zeichen gesendet und das Ergebnis nach ihrer Länge gewichtet.
Grenze:Wie der Dienst den Score berechnet und an welchen Texten er gelernt hat, veröffentlicht er nicht, seine Zahl lässt sich also nicht von innen erklären. Er ist eine weitere unabhängige Sicht neben den anderen, kein Schiedsrichter.
So liest man das Ergebnis
Jede Zahl wird für sich gelesen und sagt nur, was ihr Detektor misst. Sechzig bei KI-Floskeln bedeutet, dass typische Wendungen dicht vorkommen, nicht dass sechzig Prozent des Textes von KI stammen. Stimmen die Detektoren bei denselben Passagen überein, ist die Grundlage stärker. Zeigt jeder woandershin, ist der Text ein Grenzfall und die Entscheidung muss sich auf mehr stützen.
Die Farben im Text zeigen, wer was markiert hat: violett die Passagen mit der größten Abweichung von Ihrem Stil, gelb KI-Floskeln, blau Sätze von OpenAI und rot Sätze von ZeroGPT. Prüfen Sie denselben oder einen überarbeiteten Text erneut, zeigt jede Zahl auch die Veränderung seit der letzten Prüfung.
Die Verlässlichkeit sinkt bei kurzen Texten, Übersetzungen, Texten von Nicht-Muttersprachlern und Texten, die KI nur überarbeitet hat. Das Ergebnis ist deshalb ein Anlass für ein Gespräch oder eine weitere Prüfung, kein Beweis.
Probieren Sie es an Ihrem eigenen Text
Text einfügen oder Datei hochladen und den Score sowie die konkreten Sätze ansehen, die verdächtig ausgefallen sind.
Erkennung starten