Anthropic legt voor het eerst uit hoe zijn watermerktechnologie werkt

Het watermerk dat Claude op teksten zet, heeft geen invloed op de output en kost geen extra tokens, zegt Anthropic. Het systeem werkt vergelijkbaar met andere watermerktechnologieën voor AI, aldus het bedrijf. Anthropic brengt nu voor het eerst gedetailleerde informatie naar buiten over zijn plan om teksten in Claude van een watermerk te voorzien.

Dit nieuws in het kort

  • Het is voor het eerst dat Anthropic gedetailleerd uiteenzet hoe watermerken werken.
  • Het watermerk is afgeleid van SynthID, een AI-watermerktechnologie die door Google is ontworpen.
  • Het watermerk gebruikt de random number generator en meerdere voorspelde woorden in de tekst om de waarschijnlijkheid dat Claude de tekst heeft gegenereerd in te schatten.

Anthropic heeft een uitgebreide blogpost geschreven waarin het bedrijf uitlegt hoe de watermerktechnologie in Claude werkt. Het bedrijf maakte eerder deze maand bekend dat het onzichtbare watermerken toevoegt aan Claude-output. Tot nu toe was Anthropic vaag over hoe dat systeem werkt.

Anthropic benadrukt dat de watermerken in ieder geval onzichtbaar zijn, maar ook dat ze de output van Claude niet beïnvloeden. Ook kost het genereren van watermerken geen extra tokens en wordt het niet duurder als gebruikers op basis van output betalen. Anthropic bevestigt ook dat het watermerk verplicht is op grond van de Europese AI-verordening. Eerder deze maand gingen nieuwe regels in op grond waarvan AI-gegenereerde output als zodanig herkenbaar moet zijn.

Anthropic Claude stock. Bron: Samuel Boivin/NurPhoto via Getty Images

SynthID-afgeleide

Nu zegt Anthropic ook hoe het watermerk precies wordt aangemaakt. Dat is zoals veel experts al dachten. Het gaat om een aangepaste versie van SynthID, een watermerktechnologie die is bedacht voor Googles DeepMind-afdeling. Google gebruikt die technologie ook voor zijn eigen systemen.

Het systeem werkt door enkele woordkeuzes en de sleutel achter de random number generator in Claude te analyseren om te zien of een tekst inderdaad door Claude is geschreven. Llm's zijn, heel platgeslagen, woordvoorspellers – ze werden een paar jaar geleden nog wel eens 'fancy autocorrect' genoemd. Dat betekent dat een llm telkens voorspelt welk woord of teken logischerwijs op een ander woord of teken volgt.

Random number generator

In sommige gevallen moet een llm een exact antwoord geven, maar veel vaker kan de llm synoniemen gebruiken. Welk synoniem de llm als output geeft, wordt dan bepaald door een random number generator. Die RNG is ontworpen door Anthropic zelf en werkt met een sleutel. Het watermerk gebruikt die sleutel en een aantal voorspellingen in de tekst om te kijken of de gegeven woorden op die plek in de tekst inderdaad zijn gekozen door de random number generator. Hoe vaker dat gebeurt, hoe groter de zekerheid dat de tekst inderdaad door Claude is geschreven.

Om die reden werken de watermerken vooral goed bij tekstuele output. Daarbij is het namelijk mogelijk veel synoniemen te gebruiken. Bij exacte teksten, waarbij output altijd moet kloppen, is dat minder het geval. Daarom is het watermerk dat op code wordt toegepast veel minder betrouwbaar, al kan het systeem bijvoorbeeld wel de codedocumentatie analyseren.

De EU verplicht transparantie over AI-gebruik. Beeld: Tweakers
De EU verplicht transparantie over AI-gebruik. Beeld: Tweakers

Door Tijs Hofmans

Nieuwscoördinator

16-08-2026 • 12:02

58

Reacties (58)

Sorteer op:

Weergave:

Wat ik nog niet helemaal snap is of/hoe je generieke AI content kan detecten. Ik kan me voorstellen als je precies het model weet of vermoedt waar het mee gemaakt is, dat die dan vrij makkelijk kan zien wat voor hem de afwijkende woordkeuze is. Maar wat als je niet weet met welk model, of ook welke versie van een model, het gemaakt is? Kan je bijvoorbeeld over vele jaren nog de watermarks herkennen van de models van nu zonder dat die misschien uberhaupt nog ergens draaien? Of werkt het veel model-onafhankelijker? Dat je bijvoorbeeld altijd wel een paar verschillende synoniemen of zinsopbouwen kan gebruiken, en dat de kans dat je precies die allemaal samen gebruikt snel afneemt (product).

[Reactie gewijzigd door Zoijar op 16 augustus 2026 12:11]

Ik heb dezelfde vraagtekens. Klinkt alsof elke model aanbieder een eigen check moet krijgen/aanbieden waarmee te controleren is of een tekst is gegenereerd met een van hun modellen, met versie x y of z van hun RNG. De llm als woordvoorspeller kiest voor een specifiek woord (of keuze n uit k woorden op basis van de RNG) die net zo goed in de zin past als andere synoniemen, dat lijkt me ook vatbaar voor veranderingen over tijd/trainingsdata.
Wat ik nog niet helemaal snap is of/hoe je generieke AI content kan detecten.
Gaat nog niet, staat onderaan de FAQ van Anthropic:
How do I check if a piece of text was written by Claude?

We will soon be offering a watermark detection API. We’re in the process of working out the details of its implementation.
De Europese eisen stellen dat makkelijk herkenbaar moet zijn of een tekst of product gemaakt is door AI. Dat hoeft niet met het menselijk oog zichtbaar te zijn, maar het moet wel eenvoudig te verifiëren zijn.

Wat dat betreft is dit een mooie stap in transparantie van Anthropic, maar valt of staat dit met de eenvoud waarmee dat watermerk te verifiëren is. Gaat Anthropic een tool beschikbaar stellen die je als gebruiker op een tekst oid kunt loslaten, om te checken of het AI is? En gaan er dan Meta-tools komen die verschillende verificatie tools combineert? Want als een tekst gemaakt is met ChatGPT en je check of het watermerk van Claude erin herkenbaar is, kom je nog niet veel verder.

Wellicht een mooie taak voor Europa om zoiets te ontwikkelen, want zij zijn ook de hele ‘aanstichter’ van deze transparantie checks.

[Reactie gewijzigd door ZwolschBalletje op 16 augustus 2026 12:24]

Mijn vraag is, als het makkelijk te verifiëren is, is het dan ook niet makkelijk om deze verificatie te omzijlen? Dit klinkt als een race dat eigenlijk verloren is voor de kant dat de verificatie moet inbouwen, omdat het makkelijk te verifiëren moet zijn.

Denk niet dat het lang duurt voor je programma's ziet verschijnen welke erg eenvoudig deze verificatie eruit weten te slopen.
Om een watermark uit een door een LLM gegenereerd tekst weg te halen moet je de hele tekst laten herschrijven want meer werkt oplevert. De enige manier hoe ik zie dit nu te automatiseren is door een ander LLM, maar dan had je al van te voren de ander model ervoor kunnen gebruiken.

Maar hoe dan ook, je moet ook weten hoe het watermerk de gewichten aan de woorden wijzigt voordat je de tekst gaat herschijven, iets dat Anthropic niet prijs geeft.
Het klinkt alsof ze het wel moeten vrijgeven. Hoe kun je anders zeggen dat het makkelijk te verifiëren is? Dit leest voor mij alsof het een voorspelbaar resultaat moet geven met duidelijke "spelregels".

Maar dit hangt er ook vanaf hoe ver de term "makkelijk" hier gaat. Is een web tool waar je tekst kan plakken en de provider zegt ja of nee voldoende? Of moeten ze het openbaar maken zodat ieder een eigen detectie script kan schrijven hiervoor?
Ze maken een API, dus een webtool. Je hebt daardoor geen idee welke gewichten aan welke woorden hangen.

Maar zoals ik al stel dat je die info wel weet, ja je kan dan een tool maken die kan nagaan of er een watermerk op een stuk tekst zit. Dat betekend niet dat je die watermerk kan strippen want dan moet je zoals ik al zei de tekst herschrijven en andere woorden gebruiken. De enige manier om dat automatisch te doen en een goede resultaat te krijgen is het gebruik van een ander LLM maar dan vraag ik me af waarom je dan niet meteen een ander LLM gebruikte. Ja je zou een goedkopere LLM kunnen gebruiken voor dit deel maar dan heb je ook kans om fouten te introduceren in je tekst.
Voor afbeeldingen, film en geluid is dat eenvoudig te doen. Het is technisch mogelijk om een onzichtbaar industriestandaard watermerk te bedenken, vergelijkbaar met Cinavia bij Blu-ray.

Maar voor tekst lijkt me deze oplossing onwerkbaar: deze check is per model en modelversie anders. Dus iemand die wil checken of iets met AI is geschreven moet alle fabrikanten langs. Die checks kosten om tokens.
Als je een foto in chat gpt maakt, opslaat en upload op X dan staat er een tag bij dat het AI is. Als je van de foto een screenshot maakt en die opload, is de tag er niet. Dus er staat blijkbaar een simple regel in het bestand waar het vandaan komt.

[Reactie gewijzigd door Bulls op 17 augustus 2026 09:07]

Waarschijnlijk zet chatgpt iets in de exif data van de foto, dat X dan vervolgens herkend.
Dat verklaard dan ook waarom je screenshot wel werkt als normaal wordt gezien.
Oftewel een synoniemencheck er overheen en het watermerk werkt niet meer?
tsja, kan je zoveel moeite verwachten van mensen die AI gebruiken en doen alsof het hun eigen tekst is?
tsja, kan je zoveel moeite verwachten van mensen die AI gebruiken en doen alsof het hun eigen tekst is?
Nee dat denk ik niet. En anderzijds, boeit het? Wat mij betreft niet overal. Ik ben van plan om uitleg te genereren van onze codebase voor onze klanten. Met wat sturing van mijn kant. Een kennisbank dus, waarvan ik verwacht dat de AI er prima uit komt. Dit zal door mij gecontroleerd en aangevuld worden. Normaal zou ik daar de tijd niet voor hebben gehad en het zal me zorg wezen of mensen wel of niet weten dat een AI er bij geholpen heeft.

Het hangt er naar mijn mening enorm vanaf hoe het ingezet wordt. Ik erger me vooral aan de grote hoeveelheden 'slop' die er vooral op gericht zijn de gebruiker bezig te houden. Of zelfs te beinvloeden. Bijvoorbeeld videos die 30 minuten lang dezelfde meuk herhalen in andere woorden en eigenlijk niks toevoegen. Wanneer AI zinnig wordt ingezet en van toegevoegde waarde is, dan maakt het mij als consument geen fluit uit. Zolang het maar een bepaalde waarde heeft.

Ik lach me stuk om Harry Spotter 7. Overduidelijk AI, maar toch heeft het voor mij toegevoegde waarde. Ik denk dat we uberhaupt moeten leren 'nee' te zeggen content. Zoveel mensen blijven eindeloos scrollen, daar mag men zelf ook een stuk verantwoordelijkheid voor nemen. Juist nu er zoveel meer content beschikbaar komt door AI. Maargoed, helaas wordt AI ook gebruikt voor minder frisse doeleinden en dan is het fijn om te weten dat het vanuit een AI komt.
Maar het is natuurlijk de vraag of dat echt LLM gegenereerd is of door LLM geordend.

Ik gebruik LLM ook om teksten op te zetten, maar er zit genoeg eigen input in. De basis die ik erin dump laat ik omzetten naar iets leesbaarders en vervolgens pas ik aan.

Wat is hier anders aan dan iemand een ingesproken tekst te geven om uit te werken? Die persoon zal - zoland die serieus bezig is - ook fouten eruit halen en leesbaarheid verbeteren.

En zoals je zegt, dat scheelt tijd of in ieder geval gepuzzel met die zinnetjes waar je even niet uitkomt.

De slop waar je het over hebt is inderdaad een ramp. Zo ook de met 'AI' gegenereerde (Marktplaats) advertenties die dat witte houten ding beschrijven op een manier dat je denkt: daar is geen seconde tijd ingestoken.

En ik doe ook niet geheimzinnig over dat LLM geholpen heeft met opstellen / leesbaarder maken en met vertalingen.
Er komt vast een site die dat stroomlijnt. Je chat gewoon, maar je tekst wordt doorgestuurd naar, zeg, Claude, en het antwoord wordt ontmerkt voordat het gegeven wordt. Merk je niets van.
Als je het doorstuurt naar Claude, dan wordt vervolgens dat antwoord toch weer gewoon gewatermerkt?

Nevermind, las je comment wat anders bij een eerste lezing :). Of het waterdicht te krijgen is weet ik niet. Krijg wel het gevoel dat ze het vooral doen om andere AI generated content zelf te kunnen detecteren en te filteren, zodat daar geen training meer mee gebeurd. Dat is al langer een probleem, stilaan wordt alle nieuwe data die op internet te vinden is, met AI gegenereerd, dus het droogt op de kwalitatieve data die het model nog niet zelf heeft gezien.

[Reactie gewijzigd door Powerblast op 16 augustus 2026 21:16]

Klopt. Die bedrijven vernietigen massaal boeken, omdat scannen nadat de rug eraf gesneden is gemakkelijker is, en ze tekst van vóór 2022 nodig hebben. Ook zeldzame, oude boeken worden in grote aantallen vernietigd.
Onderschat de creativiteit en intelligentie niet van valsspelers. Ik denk altijd dat als ze die eigenschappen op een fatsoenlijke manier zouden gebruiken ze er ook wel zouden komen.
Wat is het resultaat als ik de gegenereerde tekst vervolgens terug in Claude stop met de vraag elk woord te vervangen voor een zo passend mogelijk synoniem? Of in ChatGPT?

Klinkt beetje flauw maar oprecht, werkt dit dan nog steeds?
Dan krijg je natuurlijk in je nieuwe tekst een nieuwe watermark.
Je zal wel een goede prompt moeten maken. Anders wordt die tekst onleesbaar, of gewoon opvallend door AI geschreven. Ik zou dan in eerste instantie meteen vragen om de tekst te schrijven met bv. typisch Antwerpse woordenschat.
Ik denk dat je de researchers van Google onderschat.
Oftewel een synoniemencheck er overheen en het watermerk werkt niet meer?
Klopt, maar een watermerk voor platte teksten is natuurlijk bijzonder lastig, zeker als het een korte tekst is. Bij een afbeelding heb je duizenden pixels met duizenden kleuren om mee te spelen, bij platte tekst het je het aantal woorden.
Bij platte tekst heb je letters, leestekens, spatiering en dergelijke. Meer dan alleen de woorden. Maar blijft lastig
Daar zal nog wel een hoop gesteggel van komen want waterdicht is dit niet....
Yeps. Dat doe ik nu toch al. Hybride teksten van mij en AI gaan daarna nog even door grammerly om de kantjes eraf te schaven. Die plaatst weer andere synoniemen omdat die van AI niet direct past in de tekst 'feeling' die ik wil bereiken.
Hoe gaat dit werken als je claude een tekst in het Engels laat schrijven en aan een andere llm vraagt om het te vertalen naar het Nederlands?
edit:
Het kan wel het werk van autonome ai Agents makkelijker zichtbaar maken.
En terwijl ik de Edit schrijf: als elke llm dit ingebouwd krijgt, dan helpt vertalen natuurlijk niet meer. Dan kan wellicht alleen een lokale ai helpen, tenminste ik ga er dan vanuit dat die dit niet krijgen/het daar vrij snel uitgeschakeld wordt door de community

[Reactie gewijzigd door Romborum op 16 augustus 2026 12:18]

Dan zit er een watermerk in van de andere llm?
Als je een lokale LLM draait niet, die zitten niet aan deze zooi gebonden. Plus er zijn 'uncensored' LLM's beschikbaar die alle regels in de wind gooien.

Dus er is altijd een oplossing. Behalve als je alleen kijkt tot aan ChatGPT, Claude en Gemini, dan houdt het op ja.
Dan krijg je het watermerk van de andere LLM.
Als je een lokale LLM draait niet, die zitten niet aan deze zooi gebonden. Plus er zijn 'uncensored' LLM's beschikbaar die alle regels in de wind gooien.
Dus er is altijd een oplossing.
Ja dat snap ik, maar de vraag is dan of deze lokale ongecensureerde modellen met de nieuwe verregaande Europese regels een illegale reliek worden. Het lijkt zo makkelijk gezegd, maar moet je je eens voorstellen dat je over 4 jaar op Tweakers niet meer mag zeggen waar je deze modellen kunt downloaden.
Dan blijft het altijd een duister hoekje, net zoals illegale games verder nergens genoemd worden, maar wel op Reddit bijcoorbeeld (hele subreddits zijn eraan gewijd).
haha :+ ja, dat was wel te verwachten... Ik blijf er ook bij dat deze EU wet, daar het misschien soms nuttig kan zijn, ook wel degelijk een false sense of security geeft. Eigenlijk het enige dat je er aan hebt is dat als je een "made by AI tag" ziet je zeker weet dat het met AI is gemaakt, maar het ontbreken van zo'n tag zegt helemaal niks over of het WEL met AI is gemaakt.
Als je Alfred Iedema heet zegt die tag helemaal niets! :+
Probeer die maar eens op een wat kortere tekst. Maakt er een puinzooi van, dan zie je niet meer dat het door AI gemaakt is maar dan lijkt het door een kleuter geschreven.
Het is dus perfect mogelijk dat een volledig menselijk geschreven tekst als AI gegenereerd aanzien wordt als je schrijfstijl toevallig "verkeerd" is?

Fijn als je hele zelfgeschreven doctoraat op die manier AI wordt aanzien en je er niks kan tegenin brengen..
Je kan er tegenin brengen dat er een aanmerkbare foutgevoeligheid in zit. Je kan zelfs voorbeeldteksten van voor 2020 erbij halen die ook een false positive geven.
Met een doctoraat van vele paginas gaat je dat niet lukken om elke keer precies dezelfde woordkeuze als een LLM te gebruiken. Als je veel content van dat LLM leest en onbewust op dezelfde manier begint te denken/schrijven ben je bij kortere teksten wellicht wel soms de klos.

Voor een doctoraat zou je echter wellicht door verschillende LLMs verschillende paginas kunnen laten genereren om de checker te verwarren.
Waar we misschien eens over na moeten denken is niet hoe we de wet en regels kunnen omzeilen, maar hoe we met elkaar om willen gaan. Het moet duidelijk zijn als iets door AI gegenereerd is. Dat kun je doen door bij een tekst te zetten dat het (deels) door AI gegenereerd is. Als je de boel wil belazeren, zal er altijd een manier zijn. Het is ook niet dat een lezer van een stuk tekst dit zelf door een AI-watermerk tool moet halen om te weten of hetgeen hij/zij/het/hen/hullie leest door AI gegenereerd is. Dat is de taak van degene die publiceert om daar eerlijk over te zijn.

Blijkbaar zitten hier nogal wat mensen die bang zijn 'door de mand te vallen' ofzo. Daar gaat het niet om. Ja, als jij al die tijd hebt gedaan alsof jij briljant bent, maar alles door AI hebt laten doen... Dan wel. Maar dat is dan meer een persoonlijkheids (cq normen en waarden) probleem, dan een AI probleem.

[Reactie gewijzigd door P. Rullenmand op 16 augustus 2026 14:22]

Hoe verifieer ik zo’n watermerk? Is daar al een unversele tool voor?
Is watermerktechnologie nou echt voor maatregel op regelgeving bedoeld of als IP middel voor toekomstige rechtszaken?
Het is ook nodig tegen de 'gekkekoeienziekte'.

De gekkekoeienziekte werd veroorzaakt doordat men koeien andere koeien ging voeren.

Bij AI is er iets vergelijkbaars: modellen worden slechter als je ze AI-slop uit oudere versies voert bij het trainen.
ff laten autoherschrijven met van die taaltooltjes zoals grammarly ofzo dus... (tenzij die OOK watermerken gaan toevoegen, maar lijkt me stug, die dingen zijn voor taal reparatie en niet content generatie)

Om te kunnen reageren moet je ingelogd zijn