Research
Wie Text-Wasserzeichen funktionieren
Ein Wasserzeichen kann in Text an zwei Orten sitzen: in der Statistik der Wortwahl, dort vom Modellanbieter beim Generieren eingebaut, oder in Zeichen, die man nicht sieht, direkt in den Text injiziert. Beide Familien haben sehr unterschiedliche Robustheitsgeschichten. Hier steht, was die veröffentlichte Forschung zu beiden sagt — und was unser Diagnose-Tool und der Rewriter tatsächlich damit machen.
Eine Signatur in der Wortwahl
Kirchenbauer et al., ICML 2023 (arXiv:2301.10226) haben das Schema vorgestellt, auf dem die spätere Forschung aufbaut. Bei jedem Generierungsschritt teilt eine Pseudozufallsfunktion, gesetzt durch die vorangehenden Tokens, das Vokabular in eine „grüne" und eine „rote" Liste — und das Modell wird sanft zu grünen Wörtern gedrängt. Jede einzelne Wortwahl ist unauffällig; über ein paar hundert Wörter wird der Überschuss an grünen Tokens zur statistischen Signatur. Der Text liest sich normal. Sichtbar ist nichts. Zur Erkennung braucht es den geheimen Schlüssel, der die grünen Listen erzeugt hat — es entscheidet also der Modellanbieter, wer prüfen darf, nicht die Leserin.
SynthID-Text: die Produktionsversion
Dathathri et al., Nature 2024 (Nature 634, 818–823) beschreibt SynthID-Text, Google DeepMinds Umsetzung dieser Idee in Gemini — das erste statistische Text-Wasserzeichen im Endkundenmaßstab, inzwischen quelloffen für andere Anbieter. Das Paper benennt die Grenzen selbst: Die Erkennung bleibt beim Anbieter (ohne Schlüssel kann niemand etwas verifizieren), die Zuverlässigkeit sinkt bei kurzem oder entropiearmem Text — Faktenantworten, Übersetzungen, Code — und die Robustheit ist für leichte Bearbeitungen gemessen, nicht für vollständige Rewrites.
Wer markiert Text heute? (Stand August 2026)
Google betreibt SynthID-Text produktiv in Gemini und ein zugangsbeschränktes SynthID-Detector-Portal — die Textprüfung bleibt beim Anbieter, hinter einer Warteliste. Anthropic hat am 11. August 2026 angekündigt, dass Claude-Modelle mit Release nach dem 2. August 2026 ein unsichtbares Text-Wasserzeichen auf Modellebene tragen, API eingeschlossen, ohne Opt-out; der Mechanismus ist nicht offengelegt, ein öffentliches Prüfwerkzeug existiert noch nicht. Das ersetzt den früheren Stand der Claude-API und ist für die Compliance-Dokumentation dieser Seite relevant. OpenAI liefert Text weiterhin unmarkiert aus — das fertige Text-Wasserzeichen liegt seit 2024 in der Schublade; die Provenance-Arbeit deckt Bilder und Audio über C2PA ab, einen Standard, der laut eigener Spezifikation eingefügten Klartext nicht begleiten kann.
Ein Fakt rahmt diese ganze Seite: Ohne den Schlüssel des Anbieters kann niemand einen einzelnen eingefügten Text auf ein modernes statistisches Wasserzeichen prüfen. Für gut konstruierte Verfahren ist das keine Ingenieurslücke, sondern ein Beweis — Christ, Gunn & Zamir (arXiv:2306.09194) konstruieren Wasserzeichen, die ohne Schlüssel rechnerisch nicht nachweisbar sind. Die publizierten Black-Box-Tests, die funktionieren (arXiv:2405.20777), befragen das erzeugende Modell mit Hunderten gezielter Anfragen — kein Eingabefeld. Jedes Tool, das behauptet, in deinem Text ein SynthID- oder Claude-Wasserzeichen zu sehen, verkauft etwas, das es nicht kann. Das gilt auch für uns: Unsere Limitations-Seite sagt das wörtlich.
Der grobe Verwandte: Zeichen, die man nicht sieht
Die zweite Familie rührt das Modell gar nicht an. Sie versteckt Markierungen im Text selbst: Leerzeichen ohne Breite zwischen Buchstaben, Richtungssteuerzeichen, Füllzeichen oder lateinische Buchstaben, die gegen identisch aussehende kyrillische getauscht werden (Homoglyphen). Manche Tools nutzen so etwas als primitive Herkunftsmarkierung oder als Kopier-Tracker; dieselben Zeichen werden auch adversarial eingesetzt — ein unsichtbares Leerzeichen mitten im Wort zerlegt es für jeden tokenbasierten Detektor, und die bidirektionalen Override-Zeichen sind der Baustein hinter den „Trojan Source"-Angriffen von Boucher & Anderson (arXiv:2111.00169). Keine Regulierung behandelt diese Zeichen als anerkanntes Markierungsverfahren, und sie sind trivial fragil: Text neu tippen oder einmal normalisieren, und sie sind weg.
Genau hier handelt diese Seite. Das Herkunfts-Panel der Diagnose zählt in jedem eingefügten Text unsichtbare Zeichen, Richtungssteuerzeichen, versteckte Leerzeichen-Varianten und per Homoglyph gefälschte Wörter (über eine kuratierte Confusables-Tabelle — ganze Wörter in fremder Schrift schlagen nie an). Auf den Score haben sie nie Einfluss, denn sie sagen nichts darüber, wie sich der Text liest. Der Rewriter entfernt sie aus seiner Eingabe und setzt gefälschte Buchstaben zurück auf Latein.
Wie viel überlebt Paraphrasieren?
Krishna et al., NeurIPS 2023 (arXiv:2303.13408) haben Detektoren gegen DIPPER antreten lassen, ein Paraphrase-Modell. Klassifikator-Erkennung brach zusammen (DetectGPT: von 70,3 % auf 4,6 % erkannte Positive bei 1 % Fehlalarmen). Wasserzeichen waren die robusteste getestete Methode — und verloren trotzdem rund ein Fünftel ihrer Erkennungen an einen einzigen Paraphrase-Durchgang. Sadasivan et al. 2023 (arXiv:2303.11156) gingen weiter: Rekursives Paraphrasieren drückt die Wasserzeichen-Erkennung Richtung Zufall, und ein Spoofing-Angriff kann einem Text sogar ein Wasserzeichen unterschieben, den das Modell nie geschrieben hat.
Der Gegenbefund ist real und verdient dieselbe Sichtbarkeit. Kirchenbauers Folgestudie zur Zuverlässigkeit (arXiv:2306.04634) zeigt, dass Wasserzeichen maschinelles wie menschliches Paraphrasieren besser überstehen als frühe Ergebnisse nahelegten — genug Text vorausgesetzt. Erkennung ist eine Funktion der Länge: Ein paar hundert Wörter paraphrasierter Ausgabe tragen oft noch eine lesbare Signatur, ein Tweet nicht. Das SynthID-Text-Paper berichtet dieselbe Kurve. Kurzer, stark bearbeiteter Text ist die Schwachstelle jedes Verfahrens; langer, leicht bearbeiteter Text ist der Bereich, in dem Wasserzeichen wirklich funktionieren.
Was das für deslopify bedeutet
Unser Rewriter paraphrasiert nicht Satz für Satz; er generiert den Text mit einem anderen Modell neu — Bedeutung, Fakten und wörtliche Zitate bleiben erhalten. Ein statistisches Wasserzeichen sitzt in der Wortwahl des Ursprungsmodells, also trägt neu generierter Text es nicht mehr — außer in dem, was wörtlich zitiert bleibt. Das ist eine Eigenschaft von Paraphrase, belegt in der Literatur oben, kein Feature, das wir gebaut haben — und wir messen, versprechen und optimieren hier nichts.
Der Grund ist derselbe wie bei unserer Haltung zur KI-Detektion: Herkunft sollte aus Offenlegung kommen, nicht aus einem Wettrüsten. Wer KI-generierten Text umschreibt und veröffentlicht, um die Öffentlichkeit zu informieren, kann nach den EU-Transparenzregeln weiterhin zur Offenlegung verpflichtet sein — ein verschwundenes Wasserzeichen lässt die Pflicht nicht verschwinden. Der Rewriter sagt das direkt neben seiner Ausgabe, und unser Artikel-50-Leitfaden sowie der Markierungs-Leitfadenerklären, was Offenlegung konkret verlangt. Wasserzeichen sind eine ehrliche Antwort auf die Frage „Woher kommt dieser Text?". Es selbst zu sagen ist die bessere.