Het watermerk dat Claude op teksten zet, heeft geen invloed op de output en kost geen extra tokens, zegt Anthropic. Het systeem werkt vergelijkbaar met andere watermerktechnologieën voor AI, aldus het bedrijf. Anthropic brengt nu voor het eerst gedetailleerde informatie naar buiten brengt over zijn plan om teksten in Claude van een watermerk te voorzien.
Dit nieuws in het kort
- Het is voor het eerst dat Anthropic gedetailleerd uiteenzet hoe watermerken werken.
- Het watermerk is afgeleid van SynthID, een AI-watermerktechnologie die door Google is ontworpen.
- Het watermerk gebruikt de random number generator en meerdere voorspelde woorden in de tekst om de waarschijnlijkheid dat Claude de tekst heeft gegenereerd in te schatten.
Anthropic heeft een uitgebreide blogpost geschreven waarin het bedrijf uitlegt hoe de watermerktechnologie in Claude werkt. Het bedrijf maakte eerder deze maand bekend dat het onzichtbare watermerken toevoegt aan Claude-output. Tot nu toe was Anthropic vaag over hoe dat systeem werkt.
Anthropic benadrukt dat de watermerken in ieder geval onzichtbaar zijn, maar ook dat ze de output van Claude niet beïnvloeden. Ook kost het genereren van watermerken geen extra tokens en wordt het niet duurder als gebruikers op basis van output betalen. Anthropic bevestigt ook dat het watermerk verplicht is op grond van de Europese AI-verordening. Eerder deze maand gingen nieuwe regels in op grond waarvan AI-gegenereerde output als zodanig herkenbaar moet zijn.
SynthID-afgeleide
Nu zegt Anthropic ook hoe het watermerk precies wordt aangemaakt. Dat is zoals veel experts al dachten. Het gaat om een aangepaste versie van SynthID, een watermerktechnologie die is bedacht voor Googles DeepMind-afdeling. Google gebruikt die technologie ook voor zijn eigen systemen.
Het systeem werkt door enkele woordkeuzes en de sleutel achter de random number generator in Claude te analyseren om te zien of een tekst inderdaad door Claude is geschreven. Llm's zijn, heel platgeslagen, woordvoorspellers – ze werden een paar jaar geleden nog wel eens 'fancy autocorrect' genoemd. Dat betekent dat een llm telkens voorspelt welk woord of teken logischerwijs op een ander woord of teken volgt.
Random number generator
In sommige gevallen moet een llm een exact antwoord geven, maar veel vaker kan de llm synoniemen gebruiken. Welk synoniem de llm als output geeft, wordt dan bepaald door een random number generator. Die RNG is ontworpen door Anthropic zelf en werkt met een sleutel. Het watermerk gebruikt die sleutel en een aantal voorspellingen in de tekst om te kijken of de gegeven woorden op die plek in de tekst inderdaad zijn gekozen door de random number generator. Hoe vaker dat gebeurt, hoe groter de zekerheid dat de tekst inderdaad door Claude is geschreven.
Om die reden werken de watermerken vooral goed bij tekstuele output. Daarbij is het namelijk mogelijk veel synoniemen te gebruiken. Bij exacte teksten, waarbij output altijd moet kloppen, is dat minder het geval. Daarom is het watermerk dat op code wordt toegepast veel minder betrouwbaar, al kan het systeem bijvoorbeeld wel de codedocumentatie analyseren.
:strip_exif()/i/2008150500.jpeg?f=imagenormal)
/i/2008281840.png?f=imagenormal)
:strip_icc():strip_exif()/u/151537/crop5db7498ca4eda_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/141681/crop687d0bee0e53f.jpg?f=community)
:strip_icc():strip_exif()/u/35767/images.jpg?f=community)
/u/239959/crop6299c74b18146.png?f=community)
:strip_icc():strip_exif()/u/170929/crop5fb818d8235b7_cropped.jpeg?f=community)
/u/204872/crop65a1d5f52b87f.png?f=community)
/u/2384058/crop690f922f9407c_cropped.png?f=community)