Headerpicture

Wie das Wasserzeichen in Claude funktioniert

Anthropic versieht von Claude erzeugte Texte seit August 2026 mit einem Wasserzeichen, um die Vorgaben von Artikel 50 des AI Act zu erfüllen. Das Verfahren namens SynthID-Text fügt keine unsichtbaren Zeichen ein, sondern steuert die Auswahl der Token über einen geheimen Startwert im Zufallsgenerator. Der Nachweis erfolgt über einen statistischen Test, stößt bei kurzen Texten und einfacher Überarbeitung aber schnell an Grenzen.

Abonniere meinen Newsletter!


Wöchentliche Updates zu Tools, KI und digitalem Alltag. Ohne Buzzword-Bingo. E-Mail eintragen und los.

Seit August 2026 markiert Anthropic die Textausgaben von Claude mit einem Wasserzeichen. Der Anlass ist Artikel 50 des europäischen AI Act, der Anbieter zur maschinenlesbaren Kennzeichnung verpflichtet. Das Verfahren fügt dem Text keine unsichtbaren Steuerzeichen oder Metadaten hinzu. Die Textlänge bleibt gleich, und es gibt keine versteckten Bytes.

Die Markierung greift direkt im Generator des Modells an.

Token-Auswahl im Modell

Ein Sprachmodell arbeitet probabilistisch. Für jede Stelle im Satz ermittelt das System Wahrscheinlichkeiten für alle denkbaren nächsten Token, also für Wörter oder Silben. Normalerweise entscheidet an dieser Stelle ein Zufallsgenerator, welcher Kandidat genommen wird. Dieser Generator startet mit einem zufälligen Initialwert.

Anthropic nutzt stattdessen das Verfahren SynthID-Text, das Google DeepMind 2024 im Fachmagazin Nature vorgestellt hat. Der Startwert des Zufallsgenerators wird deterministisch aus einem geheimen Schlüssel und den unmittelbar zuvor generierten Token berechnet. Ohne diesen Schlüssel ist das Ergebnis statistisches Rauschen. Wer den Schlüssel besitzt, kann die Wahl exakt nachvollziehen.

Auf Basis dieses Startwerts weist das Verfahren jedem Token im Wortschatz einen Hilfswert zu, meist 0 oder 1. Die Auswahl läuft danach wie ein Turnier ab. 2 Token treten gegeneinander an, und der Begriff mit dem höheren Hilfswert gewinnt den Vergleich. Im fertigen Text landen dadurch überproportional viele Token mit einem hohen Hilfswert. Das Ergebnis unterscheidet sich optisch nicht von unmarkiertem Text, trägt aber eine messbare statistische Signatur.

Statistische Prüfung ohne Modell

Für den Nachweis braucht man das eigentliche Sprachmodell nicht. Die Prüfung ist ein reiner statistischer Test auf einer Zeichenkette.

Das Prüfwerkzeug nimmt den vorliegenden Text, wendet denselben geheimen Schlüssel an und berechnet die Hilfswerte der enthaltenen Token neu. Liegt der Durchschnittswert signifikant über dem Zufallswert eines normalen Textes, gilt das Wasserzeichen als erkannt. Das Verfahren ist rechentechnisch sparsam, hat aber eine harte Hürde: Den Schlüssel besitzt nur Anthropic.

Es gibt kein freies Prüfwerkzeug im Netz. Anthropic stellt lediglich eine Schnittstelle bereit und vergibt den Zugang restriktiv an Behörden, Medienhäuser und Forschungseinrichtungen. Als Entwickler oder Endnutzer kann man Texte derzeit nicht selbst verifizieren.

Einfluss auf Satzbau und Wortwahl

Technisch greift das Wasserzeichen in die Formulierung ein. Ein markierter Text verwendet an manchen Positionen andere Wörter als ein unmarkierter Text. Das passiert bei 2 normalen Durchläufen mit Temperaturwerten über 0 allerdings auch.

DeepMind hat das Verfahren vor der Veröffentlichung an knapp 20 Millionen Antworten des Modells Gemini untersucht. Das mathematische Versprechen lautet, dass die Wahrscheinlichkeitsverteilung über alle möglichen Schlüssel gemittelt identisch bleibt. In den Nutzertests von DeepMind schnitten die markierten Texte bei der Bewertung nicht messbar schlechter ab.

In der Praxis greift dieses Argument zu kurz, wie John Gruber zu Recht eingeworfen hat. Die statistische Gleichwertigkeit gilt über große Mengen von Antworten. Im Einzelfall greift sie nicht. Für das Modell mögen die Wörter grau und bewölkt denselben Rang in einer Wahrscheinlichkeitsverteilung haben. Für einen präzisen Satz macht die Nuance einen Unterschied. Wenn ein Pseudozufallswert die Wortwahl steuert, verliert das System an dieser Stelle redaktionelle Schärfe.

Grenzen bei Code und kurzen Fragmenten

Das Wasserzeichen funktioniert nur dort, wo Sprache Wahlmöglichkeiten bietet. Sobald ein Kontext eindeutig ist, versagt der Mechanismus. Folgt der Satzanfang Newtons berühmtestes Werk hieß Principia, bleibt für das nächste Token nur Mathematica. Eine Alternative existiert nicht, ohne die Aussage zu zerstören. An solchen Stellen vergibt das Verfahren keinen Hilfswert.

Aus demselben Grund schaltet Anthropic das Wasserzeichen bei der Generierung von Programmcode komplett ab. In Quelltexten verändert fast jedes Token die Semantik. Ein anderes Zeichen anstelle einer Klammer oder eines Variablennamens führt unmittelbar zu Syntaxfehlern oder Fehlfunktionen.

Dazu kommt das Problem der Textlänge. Ein statistischer Test benötigt eine Mindestmenge an Datenpunkten. Unter 50 Token ist das Verfahren unbrauchbar. Bei 100 Token erreicht die Erkennungsquote etwa 85 Prozent. Erst bei deutlich längeren Abschnitten wird der Test belastbar.

Anfälligkeit gegen Überarbeitung

Ein robuster Schutz für den Alltag ist das Verfahren nicht. Es übersteht fast keine manuelle Bearbeitung. Forscher des SRI Lab an der ETH Zürich haben nachgewiesen, dass einfaches Paraphrasieren das Wasserzeichen in über 90 Prozent der Fälle zerstört.

Dazu braucht es keine böse Absicht. Wer einen von Claude erstellten Rohtext durch ein zweites Modell schickt, um Grammatik oder Tonalität zu korrigieren, entfernt das Wasserzeichen automatisch als Nebeneffekt. Die Token-Reihenfolge ändert sich, die statistische Kette bricht ab, der Test liefert ein negatives Ergebnis.

Entsprechend vorsichtig muss man die Treffer bewerten. Ein positives Ergebnis besagt lediglich, dass ein Claude-Modell mit hoher Wahrscheinlichkeit an der Generierung beteiligt war. Ob das System den Text komplett formuliert oder lediglich einen Entwurf korrigiert hat, lässt sich nicht feststellen. Der Befund enthält weder Angaben zum Benutzerkonto noch einen Zeitstempel. Ein negatives Ergebnis belegt nichts. Der Text kann von OpenAI stammen, von einem lokalen Modell oder schlicht leicht redigiert worden sein.

Plattformbetreiber und Regulierer können mit dem Verfahren große Textbestände statistisch auswerten. Ein gerichtsfester Nachweis an einem einzelnen Text gelingt damit nicht.