KI-Text-Wasserzeichen: OpenAIs textGrain, Claudes SynthID-Markierung und wer sie prüfen darf
Was das Ergebnis einer Wasserzeichen-Prüfung belegen kann, wie viel Bearbeitung es übersteht und warum alle Fehlerraten, die man bisher lesen kann, vom Anbieter gemessen wurden, der den Schlüssel hält. Und was das für alle heißt, die mit diesen Modellen bewerten, schreiben oder bauen.
Am 5. Oktober hat OpenAI angekündigt, dass Text aus ChatGPT und Codex in der Europäischen Union „in den kommenden Wochen“ ein unsichtbares Wasserzeichen tragen wird und dass API-Kunden überall dasselbe Wasserzeichen schon heute einschalten können. Das System heißt textGrain. Es fügt keine Zeichen und keine versteckten Symbole hinzu. Es verändert leicht, welche Wörter das Modell wählt, und zwar nach einem Muster, das ein geheimer Schlüssel später wiedererkennen kann.
Anthropic war zwei Monate früher dran. Im August hat das Unternehmen angekündigt, dass unterstützte Claude-Modelle ihren Text in allen Produkten und in jedem Land markieren, mit einer Version des Verfahrens, das Google DeepMind 2024 in Nature veröffentlicht hat. Beide Firmen haben es wegen Artikel 50 des EU AI Act getan, und beide lösen die Erkennung gleich: Der Detektor ist nicht öffentlich. Forschende und bestimmte Organisationen können sich bewerben. Eine Lehrerin, ein Lektor oder eine Autorin, die ein einzelnes Dokument prüfen will, kommt nicht hinein.
Ich lese ein Wasserzeichen als Messinstrument und frage es dasselbe, was ich jedes Messinstrument frage: Wer hält es, wer hat seine Fehlerraten veröffentlicht, und wer kann den Test wiederholen? Für textGrain und Claude lauten die Antworten bisher: der Anbieter, der Anbieter (oder niemand), und bisher hat keine unabhängige Stelle ein Ergebnis veröffentlicht. Neu ist diese Kritik nicht. Ein Paper aus dem September, Watermarks Without Verification, argumentiert, dass diese fehlende Überprüfbarkeit „und nicht das Wasserzeichen selbst das eigentliche Governance-Versagen“ sei. Einen Monat später hat OpenAI Zahlen veröffentlicht, und damit lässt sich die Frage genauer stellen.
Was hat OpenAI mit dem textGrain-Wasserzeichen angekündigt?
Drei Dinge, in OpenAIs eigener Ankündigung:
Starting today, API customers globally will be able to opt in to text
watermarking for select models. Text watermarking will remain off by
default in the API. Over the coming weeks, we will add an invisible
watermark to eligible ChatGPT and Codex text output in the European Union.Das dritte ist ein Detektor: „Der Zugang ist zunächst auf zugelassene Forschende und Expertenorganisationen beschränkt.“ Das Help Center nennt die ersten Forschungspartner: John Thickstun an der Cornell University, Martin Vechev an der ETH Zürich und am INSAIT sowie das Kempelen Institute of Intelligent Technologies.
Für API-Kunden ist der Schalter eine Einstellung im Dashboard, kein Request-Parameter: Organization settings, Data controls, Text provenance, oder dasselbe in den Einstellungen eines Projekts, jeweils pro Modell. In der API-Referenz und im Changelog habe ich nichts gefunden, das pro Request funktioniert. Für ChatGPT lautet der Geltungsbereich „alle Tarife, nur in der EU“, und OpenAI sagt nicht, wie es entscheidet, wer in der EU ist.
OpenAI hat außerdem Erkennungsraten für sein ausgerolltes Wasserzeichen veröffentlicht, was Anthropic für sein eigenes nicht getan hat:
| OpenAIs Evaluation | Erkannt |
|---|---|
| Passagen mit 200 Tokens, Fragen aus dem Bereich Psychologie, 1 % Falsch-Positiv-Rate | etwa 80 % |
| Passagen mit 400 Tokens, ebenso | etwa 95 % |
| Antworten auf Mathematikaufgaben | „deutlich niedriger“, ohne Zahl |
| Passagen mit 400 Tokens, unbearbeitet (ein separater Test) | etwa 92 % |
| Ebenso, nachdem 10 % der Wörter durch Synonyme ersetzt wurden | 66 % |
| Ebenso, nachdem 25 % der Wörter durch Synonyme ersetzt wurden | 17 % |
| 24 Amtssprachen der EU, 1 % Falsch-Positiv-Rate | 42,2 % (Rumänisch) bis 69,0 % (Spanisch) |
Die Zeile zu den Sprachen stammt aus dem Help Center, laut dem OpenAI danach die Stärke des Wasserzeichens für Sprachen unter 60 % angehoben hat. Die Textlängen der Tests nennt es nicht, also lässt sich diese Zeile nicht direkt mit den englischen vergleichen.
Eine Benchmark-Tabelle für GPT-6 „Astra“ mit und ohne Wasserzeichen schwankt in beide Richtungen (GPQA Diamond 94,44 % gegenüber 93,94 %, Terminal-Bench 4.0 53,90 % gegenüber 56,06 %). OpenAIs Lesart: „Wir sehen keine nennenswerten Leistungsunterschiede.“ Der technische Bericht, gemeinsam mit Forschenden der UPenn und von Yale verfasst, enthält die Mathematik und keine Evaluationszahlen. OpenAI sagt, der Bericht werde „in den kommenden Wochen“ aktualisiert, und plant eine Open-Source-Veröffentlichung, ohne Datum.
Markiert Claude seinen Text mit einem Wasserzeichen?
Ja, und breiter. Anthropics Erklärtext vom 14. August und seine Support-Seite sagen, dass die Markierung für Output unterstützter Modelle gilt, über die API, die Claude-Apps, Claude Code, Cowork und Claude Tag, über AWS, Google Cloud und Microsoft Foundry, „überall, wo Claude angeboten wird, weltweit“. Die Abdeckung wird noch vervollständigt. Die Modelltabelle der Support-Seite enthält Modelle, die vor August erschienen sind, und der Rollout auf Bedrock soll bis zum 12. Oktober abgeschlossen sein. Keine der beiden Seiten erwähnt eine Möglichkeit, das Wasserzeichen abzuschalten.
Anthropics Begründung für den weltweiten Einsatz ist eine Zeile:
We're applying watermarking globally at launch because we don't yet have
a durable way to scope it by region.Das Verfahren ist „eine Version des von Google DeepMind veröffentlichten SynthID-Text-Ansatzes“. Anthropic beantwortet praktische Fragen, die OpenAI offenlässt. Wenn Claude deinen Text Korrektur liest, bleibt „sehr wenig (wenn überhaupt etwas), woran sich das Wasserzeichen festmachen kann“. Eine Übersetzung, die Claude anfertigt, wird markiert, „weil in diesem Fall jedes Wort von Claude gewählt wird“. Zur Bearbeitung: „Leichte Bearbeitung entfernt das Wasserzeichen wahrscheinlich nicht vollständig; eine komplette Neufassung, in der jedes Wort ersetzt wird, schon.“ Die Erkennung läuft über eine „Erkennungs-API in Private Preview“, offen für Aufsichtsbehörden, Strafverfolgung, Medien, Faktenchecker, unabhängige Forschende, Bildungseinrichtungen, zivilgesellschaftliche Gruppen in der EU und Unternehmen mit eigenen Pflichten aus dem AI Act.
Anthropic hat überhaupt keine Erkennungsrate veröffentlicht: keine Kurve nach Textlänge, keine Falsch-Positiv-Rate, keinen Bearbeitungstest.
Die Ankündigung im August hat die lautere Reaktion ausgelöst. TechCrunch hat festgehalten, dass Claude-Nutzer einwandten, sie hätten „die Anweisungen, den Kontext, die Entscheidungen“ geliefert, während Claude nur „das Werkzeug“ gewesen sei. In den Threads, die ich diese Woche gelesen habe, war eine wiederkehrende Reaktion auf OpenAI Erleichterung darüber, dass es auf die EU beschränkt bleibt, und mindestens eine Antwort schlug vor, zu Claude zu wechseln, um dem zu entgehen. Das hilft nichts.
Welche KI-Firmen markieren Text mit Wasserzeichen, und wo?
Stand 6. Oktober, nach den Seiten der jeweiligen Firma, soweit es sie gibt:
| Anbieter | Text-Wasserzeichen | Geltungsbereich | Zugang zur Erkennung |
|---|---|---|---|
| OpenAI | textGrain (eigenes Verfahren) | ChatGPT und Codex in der EU, Rollout läuft; API per Opt-in weltweit | Bewerbung, zugelassene Forschende und Organisationen |
| Anthropic | Version von SynthID-Text | Unterstützte Modelle auf allen Claude-Oberflächen und bei Cloud-Partnern, weltweit | API in Private Preview für berechtigte Organisationen |
| SynthID-Text | Gemini-App und Web; ein Google-Mitarbeiter hat im August bestätigt, dass Text aus der Gemini API markiert ist, nachdem er zuerst das Gegenteil gesagt hatte | SynthID-Detector-Portal, 2025 angekündigt, mit Warteliste für Journalisten und Forschende | |
| Mistral | Nicht angegeben | Die Rechtsseite von Vibe Code sagt Markierung und Erkennung „bis 2. Dezember 2026“ zu | Nicht angegeben |
| Meta, Microsoft | Keine Aussage zum Einsatz gefunden | Beide haben den Anbieter-Abschnitt des EU-Kodex unterzeichnet | Nicht angegeben |
| Chinesische Anbieter | Sichtbare Kennzeichnung und Datei-Metadaten seit 1. September 2025 vorgeschrieben; Wasserzeichen nur „empfohlen“ | China | Nicht angegeben |
OpenAI nutzt Googles SynthID bereits für Bilder und Audio, hat für Text aber ein eigenes Verfahren gebaut, für „mehr Kontrolle als mit SynthID oder TextSeal über das Gleichgewicht zwischen der Erkennbarkeit des Wasserzeichens und der Vielfalt der Antworten auf denselben Prompt“. TextSeal ist Metas Open-Source-Wasserzeichen für Text. Eine Ankündigung, dass es in einem Meta-Produkt läuft, habe ich nicht gefunden.
Was verlangt EU AI Act Artikel 50 für generierten Text?
Artikel 50 Absatz 2 ist der verbindliche Teil. Anbieter von Systemen, die Text, Bilder, Audio oder Video erzeugen, müssen sicherstellen, dass ihre Ausgaben „in einem maschinenlesbaren Format gekennzeichnet und als künstlich erzeugt oder manipuliert erkennbar“ sind, mit Lösungen, die „wirksam, interoperabel, belastbar und zuverlässig“ sind, „soweit dies technisch möglich ist“. Ein Wasserzeichen schreibt er nicht vor. Er gilt ab 2. August 2026, und ein Verstoß kann bis zu 15 Mio. EUR oder 3 % des weltweiten Jahresumsatzes kosten, je nachdem, welcher Betrag höher ist (für kleinere Unternehmen gilt der niedrigere der beiden).
Der Digital Omnibus, Verordnung (EU) 2026/1744, gibt Systemen, die vor dem 2. August auf dem Markt waren, Zeit bis zum 2. Dezember 2026. Das passt zu OpenAIs „in den kommenden Wochen“, zu Mistrals Datum 2. Dezember und dazu, dass Anthropic neue Modelle zum Start markiert und ältere noch nachzieht. Einige Presseberichte sagen, der Omnibus habe eine Übergangsfrist von sechs Monaten auf drei verkürzt. Der veröffentlichte Text nennt vier Monate.
Die Details stehen in zwei Dokumenten mit weniger Gewicht. Der Verhaltenskodex (Code of Practice), seit 10. Juni final, ist freiwillig, und der Omnibus hält fest, dass solche Kodizes keine Konformitätsvermutung begründen. Seinen Anbieter-Abschnitt haben Anthropic, Google, Meta, Microsoft, Mistral, OpenAI und andere unterzeichnet. Normalerweise verlangt er zwei Ebenen, signierte Metadaten plus ein unsichtbares Wasserzeichen, behandelt Freitext aber als ungeeignet für Metadaten, also reicht dort ein Wasserzeichen allein. Text unter 200 Tokens muss laut Kodex nicht mit einem Wasserzeichen versehen werden.
Bei der Erkennung ist der Standard des Kodex großzügig: kostenlos, mit unbeschränktem Zugang für Aufsichtsbehörden, Medien, Faktenchecker, unabhängige Forschende, Bildungs- und Forschungseinrichtungen und die Zivilgesellschaft. Text ist die Ausnahme:
Signatories may restrict access to detection mechanisms associated to
watermarking techniques for free-form text to the extent that they have a
lower level of reliability and robustness...Der Zugang darf dann auf verifizierte Fachnutzer beschränkt werden, und der Kodex sagt, jede Beschränkung werde „zeitlich begrenzt“ sein, ohne ein Datum zu nennen. OpenAI beruft sich auf den Kodex, wenn es seinen beschränkten Zugang beschreibt. Anthropics Liste berechtigter Gruppen folgt eng der Standardliste des Kodex.
Die Leitlinien der Kommission zu Artikel 50 vom 20. Juli, ebenfalls unverbindlich, nehmen Quellcode von der Pflicht aus, dazu SQL, Konfigurationsdateien, Infrastructure as Code, Kommentare, die zum Code gehören, und Nachrichten, die nur zwischen Maschinen ausgetauscht werden, etwa Verkehr von Agent zu Agent. Sie zählen „KI-generierte Übersetzungen von Text“ zu den geringfügigen Bearbeitungen, die keine Kennzeichnung brauchen. OpenAIs Hilfeseite führt seine Ausnahme für Code auf den Verhaltenskodex zurück. Tatsächlich stammt sie aus den Leitlinien. Anthropic markiert Claudes Übersetzungen, obwohl die Leitlinien das nicht verlangen würden.
Wie funktioniert ein Wasserzeichen in LLM-Text?
Ein Sprachmodell schreibt ein Token nach dem anderen und zieht jedes aus einer Wahrscheinlichkeitsverteilung. Ein Wasserzeichen greift in dieses Sampling ein, und nur in dieses, mit einem geheimen Schlüssel.
Das bekannteste frühe Design ist die Green List von Kirchenbauer und Kollegen an der University of Maryland (ICML 2023). Man hasht das vorherige Token mit einem Schlüssel, teilt mit dem Ergebnis das Vokabular in einen „grünen“ Anteil und einen „roten“ Rest und gibt grünen Tokens einen kleinen Bonus. Menschlicher Text trifft Grün etwa so oft, wie der Zufall erwarten lässt. Text mit Wasserzeichen trifft es öfter, und ein z-Test auf die Anzahl trennt die beiden. Mit einer 50/50-Aufteilung und einem moderaten Bonus hat das Paper 98,4 % der Generierungen mit 200 Tokens erkannt, bei einer Falsch-Positiv-Rate von 3 zu 100.000. Der Bonus verschiebt allerdings die Entscheidungen des Modells.
Scott Aaronson, damals bei OpenAI, hat 2022 ein Verfahren beschrieben, das sie im Mittel nicht verschiebt. Es wählt jedes Token mit einer schlüsselabhängigen Pseudozufallsfunktion, und zwar so, dass die Wahrscheinlichkeiten des Modells trotzdem eingehalten werden. Der Haken, wie der textGrain-Bericht es formuliert: „Bei festem Kontext und Schlüssel wählt es immer dasselbe Token.“ Gleicher vollständiger Kontext, gleicher Schlüssel, gleiche Einstellungen, gleiche Antwort.
Google DeepMinds SynthID-Text (Nature, Oktober 2024) nutzt Tournament Sampling: Es zieht viele Kandidaten-Tokens und schickt sie durch K.-o.-Runden, die jeweils eine andere schlüsselabhängige Funktion entscheidet. In einem Live-Test mit etwa 20 Millionen Gemini-Antworten unterschieden sich die Nutzerbewertungen für Antworten mit und ohne Wasserzeichen um Hundertstel eines Prozentpunkts, kein statistisch signifikanter Unterschied. Auf Gemma 7B hat es in einem separaten Benchmark die Generierungszeit um 0,57 % erhöht. Das ist das Verfahren, das Anthropic adaptiert hat.
textGrain behält Aaronsons Statistik, ohne die identischen Antworten. Es legt ein „Entropie-Budget“ fest, eine ideale Grenze dafür, wie viel der Zufälligkeit beim Sampling des nächsten Tokens das Wasserzeichen im Mittel beansprucht, und koppelt die schlüsselabhängigen Werte über einen Optimal-Transport-Schritt an die Entscheidungen des Modells. Über alle Schlüssel gemittelt bleibt jede Verteilung für das nächste Token gleich. Der Detektor „braucht nur den generierten Text und den geheimen Schlüssel“.
Alle diese Verfahren haben eine gemeinsame Grenze. Ein Wasserzeichen lebt in Entscheidungen, die das Modell auch anders hätte treffen können. Wenn das nächste Token fast sicher ist, gibt es nichts zu kippen. OpenAI sagt, Mathematik werde „deutlich niedriger“ erkannt, weil es „weniger Spielraum bei der Wortwahl“ gibt. Anthropic sagt, wo „eine exakte Ausgabe erforderlich ist ... wird das Wasserzeichen nicht angewendet“, und Code habe „generell weniger Wasserzeichen“, vor allem in Kommentaren. Zwei Schlüsse von mir folgen aus dem Mechanismus, keiner davon öffentlich getestet. Das Format allein sollte nicht den Ausschlag geben: Ein JSON-Feld mit einem Absatz Prosa hat so viel Spielraum wie der Absatz selbst. Und Text in einer kontrollierten Sprache, die gebaut ist, um die Wortwahl einzuschränken, etwa der ASD-STE100-Standard, den Karpathy für lesbaren Modell-Output empfohlen hat, sollte weniger Signal tragen.
Die einzige unabhängige Zahl zu Code, die ich gefunden habe, steht im Paper aus dem September. Die Autoren haben Googles Open-Source-Implementierung von SynthID auf zwei Open-Weight-Modellen laufen lassen. Bei Prosa war der Einfluss des Wasserzeichens auf die Qualität nicht größer als ein Wechsel des Random Seeds. Bei Code sank die Korrektheit auf einem Modell um drei Punkte und auf dem anderen war der Rückgang zu klein, um ihn zu messen, „während die Erkennung nahe am Zufall bleibt“. Das testet die öffentliche Implementierung, nicht Claude oder textGrain, und es ist trotzdem mehr, als einer der beiden Anbieter über die Erkennung von Wasserzeichen in Code veröffentlicht hat.
Wie wird ein Text-Wasserzeichen erkannt, und wer kann den Detektor nutzen?
Der Detektor ist ein statistischer Test mit Schlüssel. Er berechnet die schlüsselabhängigen Werte für den Text neu, bewertet sie (textGrain wertet nur das erste Auftreten jedes unterschiedlichen Kontextfensters, damit wiederholte Phrasen nicht doppelt zählen) und fragt, wie wahrscheinlich dieser Wert für Text ist, der mit dem Schlüssel nichts zu tun hat. Theoretisch wird die Falsch-Positiv-Rate vorab festgelegt, statt aus einem Benchmark geschätzt zu werden, und das ist ein echter Unterschied zu stilbasierten KI-Detektoren. In der Praxis ergänzt der textGrain-Bericht, dass ein produktiv eingesetzter Schlüssel „empirische Kalibrierungsprüfungen“ braucht.
Die Evidenz wächst mit Länge und Entropie. Kirchenbauers Green List erreichte 98 % bei 200 Tokens auf einem Basismodell. Kuditipudi und Kollegen (TMLR 2024) haben auf Basismodellen schon ab 35 Tokens erkannt, aber auf einem instruction-tuned Modell mit kurzen Antworten war nur etwa ein Viertel der Antworten erkennbar. OpenAI meldet etwa 80 % bei 200 Tokens. Kurze Chat-Antworten sind für jedes Verfahren der schwierige Fall.
Nur wer den Schlüssel hält, kann den Test rechnen, und jeder Anbieter hat seinen eigenen Schlüssel. Anthropic merkt an, dass sein Detektor nicht erkennen kann, ob Text von einer anderen KI stammt, „selbst wenn diese andere KI Wasserzeichen nutzte, hätte sie einen anderen Schlüssel“. Die Fehlerraten in OpenAIs Tabelle sind also Noten, die der Anbieter seinem eigenen Instrument gibt. Entfernungs-Tools lassen sich nicht gegen die echten Detektoren validieren. Und das Versprechen, dass ein Wasserzeichen den Nutzer nicht identifiziert, ist eine Behauptung, die nur der Schlüsselhalter prüfen kann.
Es gibt ein echtes Argument für den beschränkten Zugang, und OpenAI bringt es: „Angesichts des Risikos übersehener Wasserzeichen und falsch positiver Ergebnisse machen wir ihn zum Start nicht öffentlich verfügbar.“ Ein öffentlicher Detektor ist außerdem ein Orakel. Ein Angreifer kann ihn so lange abfragen, bis eine Bearbeitung gerade noch durchgeht, oder damit eine Fälschung bestätigen. Die Stealing-Angriffe weiter unten brauchen nur Modell-Output, der beschränkte Zugang stoppt sie also nicht, aber er nimmt dem Angreifer ein Mittel, das Ergebnis zu prüfen. Ein geschlossener Detektor muss aber nicht das einzige Design sein. Fairoze und Kollegen beschreiben ein öffentlich erkennbares Wasserzeichen, dessen Erkennungsalgorithmus „keine geheimen Informationen enthält“. Eine Patentanmeldung der University of California deckt eine in Text eingebettete Signatur ab, die sich mit einem öffentlichen Schlüssel verifizieren lässt. Die Erkennung privat zu halten ist eine Entscheidung, und eine teilweise vertretbare.
Für alle außerhalb einer zugelassenen Institution heißt das: Jede Website, die anbietet, Text auf „das ChatGPT-Wasserzeichen“ zu prüfen, macht etwas anderes, meist eine Stil-Klassifikation. Solche Klassifikatoren haben eine schwache Bilanz. OpenAIs eigener Klassifikator, im Januar 2023 gestartet, erkannte 26 % der KI-Texte und markierte 9 % der menschlichen Texte, bevor er am 20. Juli desselben Jahres „wegen seiner geringen Genauigkeit“ zurückgezogen wurde. Eine Studie in Patterns hat sieben Detektoren auf TOEFL-Aufsätze von Nicht-Muttersprachlern des Englischen angewendet und eine durchschnittliche Falsch-Positiv-Rate von 61 % gefunden. Ein Wasserzeichen vermeidet diese Art von Stil-Bias, aber nur für die, die es ausführen dürfen.
Wie werden KI-Text-Wasserzeichen entfernt oder gefälscht?
OpenAI hat die Wege im August 2024 aufgezählt, als es sein früheres Wasserzeichen zurückhielt: „Übersetzungssysteme, Umformulieren mit einem anderen generativen Modell oder das Modell bitten, zwischen jedes Wort ein Sonderzeichen einzufügen, und dieses Zeichen dann löschen, was die Umgehung durch böswillige Akteure trivial macht.“ Für textGrain bestätigen OpenAIs Unterlagen von 2026, dass die ersten beiden die Erkennung schwächen. Der dritte ist nicht öffentlich getestet.
Paraphrasieren ist am besten untersucht. Ein spezialisiertes Paraphrasierungsmodell, DIPPER, senkte die Erkennung der Green List von 100 % auf 57,2 % (NeurIPS 2023). Wiederholtes Paraphrasieren drückte sie nach fünf Runden unter 20 %, und menschliche Bewerter gaben dem Ergebnis trotzdem gute Noten. OpenAIs Zeile mit 25 % Synonymen zeigt denselben Effekt, wobei 17 % nicht null sind. Die Länge wirkt in die andere Richtung: Kirchenbauers Gruppe stellte fest, dass von Menschen stark paraphrasierter Text im Schnitt nach etwa 800 Tokens erkennbar war, bei einer Falsch-Positiv-Rate von 1 zu 100.000. Ein langer Aufsatz verrät mehr als eine kurze Antwort. Zhang und Kollegen haben bewiesen (ICML 2024, „Watermarks in the Sand“), dass starke Wasserzeichen unmöglich sind, wenn ein Angreifer die Qualität beurteilen und kleine Änderungen vornehmen kann, die, lange genug wiederholt, jeden vergleichbaren Text erreichen können. Ihr generischer Angriff hat drei veröffentlichte Verfahren bei geringem Qualitätsverlust entfernt.
Übersetzen ist der zweite Weg: die Antwort in einer anderen Sprache anfordern und sie mit einem Tool zurückübersetzen, das kein Wasserzeichen setzt. Bei den Verfahren, die auf der ACL 2024 getestet wurden, drückte das die Erkennung nahe an den Zufall. Wie viel übrig bleibt, hängt vom Design ab, und niemand hat einen Übersetzungstest von textGrain oder Claudes Markierung veröffentlicht. OpenAI und Googles SynthID-Dokumentation führen Übersetzung beide als Schwachstelle. Der Übersetzer muss unmarkiert sein, Claude kommt also nicht in Frage.
Der Trick mit Einfügen und Löschen bittet das Modell, nach jedem Wort ein Emoji oder Symbol zu setzen, und löscht diese dann. Die schlüsselabhängigen Werte wurden mit den Symbolen im Kontext berechnet, also passt das Muster nicht mehr, sobald sie weg sind. Kirchenbauers Paper schreibt ihn Riley Goodside zu.
Das Umschreiben mit einem Open-Weight-Modell ohne Wasserzeichen ist der Weg, über den am meisten geredet wird. Das SynthID-Paper benennt die Lücke selbst: Wasserzeichen bei offenen Modellen durchzusetzen, die „dezentral eingesetzt“ werden, ist schwierig. Text, der auf einem solchen Modell entstanden ist, hatte nie eine Markierung.
Fälschen ist die gefährliche Richtung, weil es bedeutet, dass der eigene Text eines Menschen positiv getestet wird. Jovanović, Staab und Vechev an der ETH Zürich schätzten (ICML 2024), dass ein Angreifer für unter 50 $ an API-Abfragen genug über mehrere frühere Verfahren lernen konnte, um sie sowohl zu fälschen als auch zu entfernen, mit über 80 % Erfolg. Dasselbe Labor hat die offene SynthID-Text-Implementierung untersucht. Fälschen war viel schwerer, etwa 4 %, mit 90.000 Abfragen etwa 15 %. Paraphrasieren hat es trotzdem in über 90 % der Fälle getilgt. Niemand hat textGrain öffentlich auf diese Weise getestet. Vechev ist inzwischen einer von OpenAIs Evaluationspartnern.
Wenige Wochen nach Anthropics Ankündigung ist ein Markt für Entfernung entstanden, mit Websites, die „Claude Watermark Remover“ anbieten. Ohne Zugang zu einem Detektor eines Anbieters kann keine davon zeigen, dass ihr Tool funktioniert. Die „Invisible Character Cleaner“, die noch aus dem Jahr 2025 stammen, berühren nichts davon. Damals fanden Leute schmale geschützte Leerzeichen in Output von OpenAIs o3 und o4-mini und nannten sie ein Wasserzeichen. Das Startup, das darüber berichtete, gab OpenAIs Antwort weiter, sie seien „eine Eigenheit von Reinforcement Learning in großem Maßstab“. Die heutigen Wasserzeichen haben keine Zeichen, die man entfernen könnte: OpenAIs „fügt keine versteckten Zeichen, unsichtbaren Leerzeichen oder ungewöhnlichen Satzzeichen hinzu“, und Anthropic sagt: „Dem Text wird nichts hinzugefügt, und es gibt keine versteckten Zeichen.“
Was kann ein KI-Text-Wasserzeichen beweisen, und was nicht?
OpenAIs Liste dessen, was ein Wasserzeichen dir nicht sagt, ist der nützlichste Teil seiner Ankündigung. Es misst keinen menschlichen Beitrag, begründet weder Eigentum noch Verantwortung und prüft keine Richtigkeit. Es „verknüpft keine Person, Organisation, kein Konto, keinen Prompt und keine Unterhaltung mit dem Text“. Und:
The absence of a detected watermark does not prove human authorship.Anthropic ergänzt, dass sein Detektor „‚Claude hat das geschrieben‘ nicht von ‚Claude hat das stark bearbeitet‘ unterscheiden kann“. Ein positives Ergebnis ist statistische Evidenz dafür, dass ein Modell viele der Wörter gewählt hat. Bei einer Falsch-Positiv-Rate über null und angesichts der Forschung zum Fälschen ist es nicht einmal dafür ein Beweis. Es sagt nichts darüber, wer die Ideen hatte oder ob die Nutzung des Modells erlaubt war.
Dann kommt die Menge dazu. OpenAI hat das 2024 gegen sich selbst angeführt: Es „auf große Textmengen anzuwenden, würde zu einer großen Gesamtzahl falsch positiver Ergebnisse führen“. Es hat auch ein Fairness-Bedenken geäußert: Wasserzeichen „könnten den Einsatz von KI als nützliches Schreibwerkzeug für Nicht-Muttersprachler des Englischen stigmatisieren“. Die Leitlinien nehmen Grammatikkorrekturen und leichtes Glätten aus, aber ein Modell, das einen Absatz für den Lesefluss umschreibt, wählt Wörter, und die Markierung kann nicht erkennen, warum.
Das Gesetz verlangt Markierungen, die „interoperabel“ und „belastbar“ sind. Jeder Anbieter nutzt seinen eigenen Schlüssel und seinen eigenen Detektor, und OpenAIs eigener Test zeigt eine Erkennung von 17 %, nachdem ein Viertel der Wörter geändert wurde. Ob das „soweit dies technisch möglich ist“ erfüllt, müssen die Aufsichtsbehörden beantworten, und die Text-Ausnahme im Kodex deutet darauf hin, dass sie die Lücke vorerst schon akzeptiert haben.
Wer hat Patente auf Wasserzeichen in LLM-Text angemeldet?
Die Anmeldungen, die ich verifizieren konnte, betreffen vor allem die oben beschriebenen Sampling-Verfahren. DeepMinds US20240320529A1, Priorität März 2023 und inzwischen an GDM Holding übertragen, deckt mehrstufige, schlüsselabhängige Wasserzeichen für jedes einzelne Token ab, mit abhängigen Ansprüchen, die das in SynthID-Text verwendete Turnier beschreiben. Die Gruppe der University of Maryland hinter der Green List hat US20250238634A1 angemeldet, Priorität Januar 2024, deren erster Anspruch breit ist: das Sampling eines Modells mit Pseudozufallswerten zu verändern, die Wörtern zugewiesen werden. Eine an die UC San Diego übertragene Anmeldung (die Suchliste nennt die Northeastern University), US20260113199A1, signiert die ersten Tokens mit einem Schlüsselpaar und bettet die Signatur in spätere ein, sodass sie sich mit einem öffentlichen Schlüssel verifizieren lässt. Baidus CN116340909A ist der Ausreißer: Es kodiert Nutzerinformationen in den visuellen Eigenschaften jedes Zeichens, um Screenshots zurückzuverfolgen. Genau das, sagen OpenAI und Anthropic, tun ihre Wasserzeichen nicht.
Ein veröffentlichtes Patent von OpenAI oder Anthropic auf ein statistisches Text-Wasserzeichen habe ich nicht gefunden. Das beweist wenig. US-Anmeldungen werden normalerweise etwa 18 Monate nach ihrem Prioritätsdatum veröffentlicht, neuere Anmeldungen sind also womöglich noch nicht sichtbar.
Was sollten Lehrende, Schreibende und Entwickler wegen KI-Text-Wasserzeichen tun?
Wenn du Texte anderer Leute bewertest oder lektorierst, kannst du heute keinen Text selbst prüfen. Deine Institution kann sich bei OpenAI und bei Anthropic bewerben, getrennt, und jeder Detektor sieht nur die Markierung seines eigenen Anbieters. Ein Dienst, der behauptet, auf das ChatGPT- oder Claude-Wasserzeichen zu prüfen, rät fast sicher anhand des Stils. Ein negatives Ergebnis beweist nichts, und ein positives ist Evidenz für die Beteiligung eines Modells, nicht für Schummeln.
Wenn du mit einem Modell schreibst, rechne damit, dass Claude-Output markiert ist, egal wo du bist, und ChatGPT-Output markiert ist, sobald der Rollout bei dir ankommt, falls du in der EU bist. Wenn ein Modell deinen eigenen Text Korrektur liest, bleibt wenig zu markieren. Wenn du ein Modell ganze Absätze umschreiben lässt, bleibt viel. Wenn ein Verlag oder Kunde zwischen KI-unterstützter und KI-geschriebener Arbeit unterscheidet, heb deine Entwürfe auf, denn das Wasserzeichen kann diese Unterscheidung nicht treffen.
Wenn du auf den APIs aufbaust, unterscheiden sich die Standardeinstellungen. OpenAIs Wasserzeichen ist aus, solange niemand in deiner Organisation es einschaltet, pro Projekt und pro Modell. Claudes ist an, und ein Opt-out ist nicht dokumentiert. Code, Konfiguration und Nachrichten zwischen Maschinen fallen nach den Leitlinien der Kommission nicht unter die Pflicht, und das ist eine rechtliche Grenze, keine technische Garantie, dass sie keine Markierung tragen. Kundenseitige Prosa, die dein Produkt erzeugt, fällt höchstwahrscheinlich darunter. Anthropics Rat an Entwickler ist direkt: „Du solltest selbst prüfen, was Artikel 50 von deinen Produkten und Diensten verlangt.“ Wenn du KI-Text zu Themen von öffentlichem Interesse veröffentlichst, kommt mit Artikel 50 Absatz 4 eine Offenlegungspflicht dazu, außer der Text hat eine menschliche Prüfung oder redaktionelle Kontrolle durchlaufen und jemand trägt die redaktionelle Verantwortung dafür.
Die nächsten Signale, auf die man achten sollte: ob die textGrain-Veröffentlichung Außenstehenden erlaubt, OpenAIs Kurven auf eigenen Modellen nachzubilden, ob Anthropic eine Fehlerrate veröffentlicht und ob die Beschränkung des Kodex für Text-Detektoren jemals aufgehoben wird.
Meine Lesart: Hier gibt es zwei getrennte Mängel, und nur eines davon lässt sich durch eine Entscheidung beheben. Das Signal ist fragil. Das kommt vom Verfahren und verschwindet vielleicht nie ganz. Das Instrument ist geschlossen. Das ist eine Entscheidung, zum Start vertretbar und vom Kodex gedeckt, und sie lässt sich rückgängig machen. Bis das passiert, ist ein Text-Wasserzeichen eine Messung, die der Anbieter durchführt und auf Anfrage meldet: echte Evidenz für eine Aufsichtsbehörde und sehr wenig für alle, die keine Zulassung bekommen.