Wird jedes zehnte Wort durch ein Synonym ersetzt, sinkt die Erkennungsrate von KI-generiertem Text von 92 auf 66 Prozent. Diese Zahl hat OpenAI selbst veröffentlicht, als das Unternehmen textGrain vorstellte — ein neues System unsichtbarer Wasserzeichen für ChatGPT und Codex in der Europäischen Union.
Ein sichtbares Symbol zum Entfernen gibt es dabei nicht. Ein geheimer Schlüssel lenkt die Wortwahl des Modells minimal, hunderte Male über einen Text verteilt, und hinterlässt so ein statistisches Muster, das für Leser unsichtbar, für einen Algorithmus aber erkennbar ist. OpenAI entwickelte textGrain zusammen mit Forschern der University of Pennsylvania und der Yale University.
Der Zeitpunkt ist kein Zufall. Die Transparenzregeln des EU AI Act, die seit dem 2. August gelten, verpflichten Unternehmen dazu, KI-generierte Inhalte überprüfbar zu kennzeichnen. In den kommenden Wochen erhalten ChatGPT- und Codex-Nutzer in der EU — vom kostenlosen bis zum Enterprise-Plan — markierte Texte. Entwickler, die die API nutzen, können die Funktion bereits jetzt weltweit für ausgewählte Modelle aktivieren, allerdings ist sie standardmäßig deaktiviert und noch kein globaler Standard.
Der Detektor selbst bleibt vorerst abgeschottet: Zugriff erhalten nur geprüfte Forscher und zugelassene Organisationen, nicht jeder Arbeitgeber oder Lehrer, der einen Text überprüfen will. Und die Methode hat reale Grenzen: Bei einem Textabschnitt von 400 Token erreicht die Genauigkeit 95 Prozent bei einer Falsch-Positiv-Rate von 1 Prozent — werden aber ein Viertel der Wörter durch Synonyme ersetzt, fällt sie auf 17 Prozent. Kurze Antworten, mathematische Berechnungen und Übersetzungen lassen sich schwerer erkennen, und ein fehlendes Wasserzeichen beweist keineswegs menschliche Urheberschaft.
Interessant: Anthropic hatte für Claude zwei Monate zuvor eine ähnliche Kennzeichnung eingeführt und dafür Kritik von Nutzern geerntet, die fürchteten, Arbeitgeber könnten KI-Texte in ihrer Korrespondenz aufspüren. OpenAI scheint sich auf genau diese Debatte vorbereitet zu haben: Das Unternehmen betont ausdrücklich, dass das Wasserzeichen weder Konto noch Prompt noch das zugehörige Gespräch verrät — nur die Tatsache, dass ein Modell den Text geschrieben hat.



