11 augustus 2026 · 10 min leestijd

Claude zet nu een watermerk in zijn tekst, ook in wat mij hielp dit te schrijven

Vandaag bevestigde Anthropic dat Claude stilletjes een onzichtbaar watermerk in zijn tekst stopt. Elk model dat op of na 2 augustus uitkwam, doet dat op het moment van genereren, wereldwijd, zonder uitschakelknop en zonder uitzondering voor bedrijven. Als je mijn andere notities hebt gelezen, weet je dat ik team Claude ben, en je raadt vast dat Claude ook aan deze heeft meegeschreven. Dus volgens Anthropics eigen regels zijn sommige woorden die je nu leest, gemarkeerd. Toepasselijk onderwerp om het op te testen.

De kop die rondgaat, is "Claude kan nu AI-tekst herkennen". Dat is niet wat er gebeurde. Wat er gebeurde, is smaller, vreemder, en op één punt bijna het tegenovergestelde van wat mensen aannemen. Ik loop het even door.

Wat Anthropic echt zei

De aankondiging is geen onderzoekspaper. Het is een bijgewerkte helppagina, "How Claude marks AI-generated content". Het mechanisme, in hun woorden: wanneer een ondersteund Claude-model tekst genereert, weeft het een onmerkbaar watermerk rechtstreeks in de tekst zelf. Je ziet het niet, en het verandert niets aan de betekenis, kwaliteit of leesbaarheid.

Twee dingen die het uitdrukkelijk niet is. Het zijn geen metadata, en het zijn geen verborgen tekens. Het zit gebakken in de woordkeuze, dus het overleeft knippen en plakken en "kan sommige bewerkingen doorstaan". Het wordt op modelniveau toegepast, wat betekent: op elk oppervlak. claude.ai, de API, Claude Code, en Claude via AWS, Google Cloud of Microsoft Foundry. Ontwikkelaars kunnen het niet uitzetten. Geen gedocumenteerde uitzondering voor Team, Enterprise of nul-retentie.

Bestanden worden apart behandeld. Voor .svg-, .png- en .jpg-uitvoer hangt Anthropic er in plaats daarvan ondertekende C2PA-herkomstmetadata aan, wat iets heel anders is (daarover verderop meer). Het is het tekstwatermerk dat ertoe doet.

Waarom nu? Omdat de transparantieregels van artikel 50 van de Europese AI-verordening op 2 augustus afdwingbaar werden, en Anthropic de Praktijkcode van de Commissie over het markeren van AI-content ondertekende. Niet-naleving loopt op tot 15 miljoen euro of 3% van de wereldwijde omzet, dus "we markeren alles, overal" is het goedkoopste antwoord. Dit is een nalevingszet, verpakt als een herkomstfunctie. Het wordt niet gebracht als een anti-spieksmiddel, en zo moet je het ook niet lezen.

Nog één ding waarover ze opvallend eerlijk waren: er is nog geen publieke detector. Die "komt eraan". Dus op dit moment kan niemand buiten Anthropic een stuk tekst echt controleren. We markeren eerst en detecteren later.

Hoe een onzichtbaar tekstwatermerk werkt

Een taalmodel schrijft één token per keer, door te trekken uit een kansverdeling. Meestal zijn er meerdere bijna gelijkwaardige opties: "groot", "fors", "flink". Een statistisch watermerk gebruikt een geheime sleutel om die keuze stilletjes te sturen naar een pseudowillekeurige deelverzameling van toegestane tokens. Elke zin op zich leest nog steeds natuurlijk. Maar over een paar honderd tokens stapelt de sturing zich op tot een statistische vingerafdruk die een sleutelhouder kan meten, met een p-waarde, zonder enig zichtbaar teken.

Dit is academisch platgetreden terrein. Het "groene lijst"-schema (Kirchenbauer, 2023) knipt de woordenschat bij elke stap in tweeën en duwt naar de "groene" helft, waarna de detectie de groene tokens telt tegenover het toeval. De Gumbel-aanpak van Aaronson doet hetzelfde via cryptografische sampling. Googles SynthID-Text is de enige die op schaal draait, live in Gemini sinds 2024 en gevalideerd op bijna 20 miljoen antwoorden. Anthropic heeft niet gezegd tot welke familie de zijne behoort.

En dit is het punt dat al de rest bepaalt: het watermerk past alleen daar waar het model een echte keuze had. Proza met veel entropie, het vloeiende creatieve werk, draagt een sterk signaal. Tekst met weinig entropie draagt bijna niets, omdat er niets te sturen viel. Wat betekent:

  • Code wordt nauwelijks gemarkeerd. Identifiers, syntaxis en structuur liggen vast. Haal er een linter of formatter overheen en het schamele signaal dat er was, is weg. De eigenlijke code van Claude Code is hiervoor dus zo goed als onzichtbaar, terwijl zijn commit-berichten en uitleg wél normaal gemarkeerd worden.
  • Korte antwoorden worden nauwelijks gemarkeerd. Een oneliner of een enkele zin blijft onder de drempel. Betrouwbare detectie wil doorgaans een paar honderd woorden. Anthropics eigen kanttekening ("erg kort, te weinig tekst voor een betrouwbaar signaal") zegt hetzelfde in mildere bewoordingen.

De valkuil van het proeflezen

Dit is het punt waar ik elke professional echt even bij stil wil laten staan, want het werkt omgekeerd aan de intuïtie.

Stel dat je zelf een alinea schrijft en Claude daarna vraagt om die na te lezen, aan te scherpen of te vertalen. De uitvoer wordt door Claude gegenereerd, dus die kan het merk dragen, ook al komt elk idee erin van jou. Anthropic zegt het met zoveel woorden: tekst die je laat "nalezen, vertalen, samenvatten of omzetten" kan een Claude-merk dragen "ook als de onderliggende ideeën, tekst of data van elders komen".

Draai het nu om. Je genereert een eerste versie volledig met Claude en herschrijft die daarna grondig in je eigen stem, of je haalt hem door een andere taal en terug. Het merk verdunt en verdwijnt waarschijnlijk.

Lees die twee samen en de absurditeit valt op zijn plaats. Een menselijke schrijver die Claude alleen gebruikte om bij te schaven, komt er gemarkeerd uit. Iemand die er zwaar op leunde maar alles herschreef, komt er schoon uit. Het signaal is bijna het omgekeerde van "wie heeft het denkwerk gedaan". Zoals onderzoeker Ian Miers het samenvatte: een watermerk kan een mens met AI-hulp niet onderscheiden van pure AI. Daar is het ook nooit voor gebouwd.

Het houdt geen gevecht vol

Watermerken houden prima stand bij gewoon gebruik. Knippen en plakken, een paar woorden vervangen, proza licht herindelen: het signaal blijft. Tegen iemand die het echt wil verwijderen, is het onderzoek niet mals.

  • Parafraseren. Een recursieve parafrase-aanval (Sadasivan et al.) liet de detectie van gemarkeerde tekst dalen van 99,3% naar 9,7% ware positieven, terwijl menselijke beoordelaars de parafrase als goed van kwaliteit beoordeelden. Bijna volledige ontsnapping, amper kwaliteitsverlies.
  • Vertaalrondjes. Haal tekst door een andere taal en terug en de merken op tokenniveau spoelen weg. Het is een van de redenen die OpenAI gaf om zijn eigen watermerk in de kast te laten.
  • Stelen en vervalsen. Een team van ETH Zürich toonde dat je door een gemarkeerde API te bevragen genoeg van de regel kunt reconstrueren om die zowel weg te poetsen als, erger, te vervalsen, "voor minder dan 50 dollar" met "ruim 80%" succes. Vervalsen is de enge keerzijde: het merk op menselijke of kwaadaardige tekst plakken om een lab of een persoon als auteur op te laten draaien. Ze bevestigden dat SynthID op deze manier vervalsbaar is.

Een positieve detectie bewijst dus niet dat er AI is gebruikt, en het uitblijven ervan bewijst het tegendeel niet. Het merk kan op onschuldige tekst worden gefabriceerd en van schuldige tekst worden afgehaald door iedereen die er moeite voor doet.

Drie dingen die mensen blijven mengen

De meeste slechte berichtgeving komt voort uit het door elkaar halen van technieken die zich totaal anders gedragen. Hou ze uit elkaar:

Techniek Wat het is Overleeft knippen/plakken? Overleeft een vastberaden bewerking?
Statistisch / in-token watermerk Sturing geweven in de woordkeuze (Claude, Gemini) Ja Nee: parafrase of vertaling doodt het
Verborgen tekens Nulbreedte-spaties, U+202F, rare Unicode Soms Nee: elke "verwijderaar van onzichtbare tekens" haalt het eruit
C2PA-metadata Ondertekend manifest naast een bestand geplakt Nee N.v.t.: een screenshot of heropslag gooit het weg

De middelste rij is de "kastlijntjes en rare spaties"-paniek rond ChatGPT van vorig jaar. Die bleken vooral trainingsartefacten te zijn, geen bewust watermerk, en ze zijn sowieso met één klik weg. C2PA, de onderste rij, is cryptografisch zeker als het er is, maar valt eraf zodra je een screenshot of hercodering maakt, precies waarom het de "bestanden"-helft van Anthropics aanpak is en niet de "tekst"-helft. Claudes tekstmerk is de bovenste rij, en alleen die. Als een kop het "metadata" noemt, klopt het niet.

Het kerkhof van de detectoren

De reden dat ik dit goed wil krijgen, is dat we al weten hoe de film afloopt zodra instellingen een probabilistisch signaal als een vonnis behandelen.

OpenAI bracht begin 2023 een AI-tekstclassifier uit en trok die zes maanden later in. De eigen slotcijfers: hij markeerde correct 26% van de AI-tekst en markeerde ten onrechte 9% van de menselijke tekst. Een munt met stress.

Erger is de vertekening. De doorslaggevende Stanford-studie (in Patterns) liet zeven detectoren los op essays van niet-native Engelssprekenden en zag ze 61,3% van dat menselijke schrijfwerk ten onrechte als AI markeren, tegen zo'n 5,1% bij native schrijvers. Vereenvoudig de woordenschat en je laat de detector afgaan, of er nu een machine in de buurt was of niet. Echte studenten zijn hierom voor een tuchtcommissie gesleept, en dat is precies waarom een flink deel van de universiteiten hun detectoren stilletjes heeft uitgezet.

Een watermerk is een beter signaal dan die detectoren waren. Maar "beter dan iets kapots" is geen "bewijs", en de verleiding om elk groen lampje als een bekentenis te lezen, wordt enorm. Tel daar het vervalsingsrisico van hierboven bij op en je hebt een signaal dat in de beschuldigende richting te faken is. Bouw alsjeblieft geen beleid dat iemand hierop veroordeelt.

Waar ik uitkom

Het merk zelf stoort me niet zo. Het is onmerkbaar, het raakt de kwaliteit niet, en ik heb liever dat de grote labs een transparantiewet naleven dan dat ze hem bevechten. Lucas Beyer noemde het het eerste goede dat uit de Europese AI-regelgeving is gekomen, en op een rustige dag ben ik het half met hem eens.

Wat me wél stoort, is het gat tussen wat het is en waar mensen het voor zullen aanzien. Het is een zwak, door naleving gedreven "verwerkt door Claude"-signaal dat bij elke echte herschrijving sterft, geen vertaling overleeft, voor de prijs van een broodje weg te poetsen is, en dat volgens Anthropics eigen woorden "niet volledig sluitend" is. Het is geen leugendetector voor auteurschap, en de groep die het meest kans loopt zich eraan te branden als het daarvoor wordt versleten, is opnieuw de eerlijke schrijver die AI gebruikte om bij te schaven in plaats van om te denken.

Dus de juiste beweging is niet het merk vrezen en ook niet het proberen te verslaan. Het is zeggen wat je hebt gedaan. Ik gebruik Claude constant, deze notitie inbegrepen, en ik blijf je dat gewoon vertellen in plaats van je een detector te laten draaien die de vraag toch niet kan beantwoorden. Schrijf "gemarkeerd betekent verwerkt, niet geschreven" in je contentbeleid vóór je eerste geschil, niet erna. En als Anthropic die detector uitbrengt, zijn de cijfers om op te letten het percentage valse positieven en de minimale lengte. Als een van de twee slecht is, was de eerlijke vermelding sowieso al meer waard dan het watermerk.

Deze post draagt een watermerk. Ik vertel het je zelf. Dat is de versie van transparantie die wél werkt.


Gebaseerd op Anthropics helppagina "How Claude marks AI-generated content", het SynthID-Text-artikel in Nature (okt. 2024), Kirchenbauer et al. over groenelijst-watermerken, Sadasivan et al. over parafrase-aanvallen, het watermerk-steelwerk van ETH Zürich, de Stanford-studie in Patterns over detectorvertekening tegen niet-native schrijvers, OpenAI's eigen notitie over het stopzetten van zijn classifier, en de tekst van artikel 50 van de Europese AI-verordening. Een momentopname van 11 augustus 2026. Anthropics detector en de echte betrouwbaarheidscijfers zijn nog niet publiek, dus check support.claude.com voor je me citeert over hoe goed dit alles werkt.