Anthropic erklärt: So funktionieren Claudes Wasserzeichen
Unsichtbare Muster in der Wortwahl statt sichtbarer Labels: Anthropic legt technische Details offen und plant eine öffentliche Detektions-API.

Symbolbild · KI-generiert (AI IN LIFE)
Auf einen Blick
- Verfahren nach dem Vorbild von SynthID-Text (Google DeepMind, 2024)
- Wasserzeichen entsteht durch systematische Synonym-Entscheidungen
- Anthropic plant eine öffentliche Detektions-API
- Kompletter Rewrite entfernt das Muster; leichte Edits nicht
- Treiber: Transparenzpflichten des EU AI Act
Nach der Ankündigung vom 11. August hat Anthropic nun technische Details veröffentlicht, wie die unsichtbaren Wasserzeichen in Claude-generierten Texten funktionieren. Der Ansatz folgt dem SynthID-Text-Verfahren, das Google DeepMind 2024 vorgestellt hatte: Das Modell trifft bei bedeutungsgleichen Formulierungen — etwa „bewölkt“ oder „grau“ — systematische Wahlentscheidungen, die zusammen ein statistisch nachweisbares Muster ergeben.
Nach Angaben von Anthropic beeinträchtigt das Wasserzeichen die Qualität der Ausgaben nicht. Zur Überprüfung plant das Unternehmen eine eigene Detektions-API — ein grundlegend anderer Ansatz als klassische „KI-Detektoren“, die lediglich nach sprachlichen Auffälligkeiten suchen und notorisch unzuverlässig sind.
Grenzen bleiben: Leichte Bearbeitungen entfernen das Muster nicht vollständig, ein kompletter Rewrite, bei dem jedes Wort ersetzt wird, hingegen schon. Bei Programmcode greift das Verfahren kaum, weil funktionierender Code wenig sprachlichen Spielraum lässt — Kommentare können Wasserzeichen tragen, der ausführbare Code selbst nicht.
Treiber der Initiative ist nicht zuletzt der EU AI Act: Dessen Transparenz-Vorgaben verlangen, dass KI-generierte Inhalte als solche erkennbar sind. Anthropic positioniert sich damit als erster großer US-Anbieter, der Text-Wasserzeichen flächendeckend ausrollt.
Die Reaktionen sind gemischt: In Foren kündigten einzelne Abonnenten ihre Kündigung an, weil Wasserzeichen unerlaubte Nutzung am Arbeitsplatz oder in Prüfungen sichtbar machen könnten. Die Debatte über Nachweisbarkeit versus Privatsphäre dürfte die Branche noch länger beschäftigen.
Häufige Fragen
Sieht man das Wasserzeichen im Text?
Nein. Es ist unsichtbar und entsteht durch statistische Muster in der Wortwahl; nachweisbar ist es nur mit einem Detektions-Werkzeug.
Lässt sich das Wasserzeichen entfernen?
Leichte Bearbeitungen reichen nicht; erst ein vollständiger Rewrite, bei dem praktisch jedes Wort ersetzt wird, entfernt das Muster.
Gilt das auch für Code?
Kaum: Ausführbarer Code bietet zu wenig sprachlichen Spielraum. Wasserzeichen können allenfalls in Kommentaren stecken.


