Anthropics Mythos 5 probeerde tijdens een test van de Britse overheid mensen op internet met nepaccounts te misleiden. Daarmee opereerde de AI-agent buiten de ingestelde parameters, meldt het AI Security Institute (AISI) van het ministerie voor Wetenschap, Innovatie en Technologie. Ook een OpenAI-agent ging te ver.
De door Anthropic Mythos 5 en OpenAI GPT-5.6 Sol aangedreven agents bleken buiten de testparameters van AISI te opereren. Het Britse overheidsinstituut gaf diverse AI-agents een cybersecurityopdracht. "We draaiden deze test 122 keer met verschillende AI-modellen", schrijft AISI in een blogpost. In tien van die testruns voerde een AI-agent op eigen houtje handelingen op het internet uit waarvoor die geen toestemming had.
Mens onder druk zetten
In het ernstigste geval probeerde een AI-agent kwaadaardige code in een opensourceproject op GitHub te krijgen. Daarbij paste de AI-agent social engineering toe op de maintainer van dat project, zodat die de ingediende code zou goedkeuren. Hiervoor maakte de agent valse online-identiteiten aan en gebruikte hij die om de maintainer onder druk te zetten. Een ontwikkelaar zag de kwaadaardige code en weigerde die goed te keuren. AISI noemt de AI-agent niet, maar Anthropic geeft aan dat Mythos de nepaccounts aanmaakte, meldt persbureau Reuters.
In de tien testruns waren er in totaal negentien gevallen van ongeautoriseerde activiteiten, meldt AISI. Mythos 5 van Anthropic was verantwoordelijk voor zeventien daarvan. GPT-5.6 Sol van OpenAI zat achter de twee resterende gevallen.
Bewust internettoegang gegeven
Voor de AI-beveiligingstests had AISI bewust internettoegang ingeschakeld. Daarnaast had het instituut bepaalde beperkingen van de AI-agents uitgeschakeld. Deze ingebouwde filters van Anthropic en OpenAI moeten gevaarlijk gedrag blokkeren. De geteste agents hadden hiermee niet helemaal vrij spel. De Britse overheidsorganisatie zag niet eerder autonoom uitgevoerde en misleidende acties van deze omvang.
Het AISI gaf de agents internettoegang en schakelde bepaalde beperkingen uit om de maximale mogelijkheden van de AI-modellen in te schatten. Het instituut verklaart dat de specifieke modellen in de geteste configuraties niet beschikbaar zijn voor gebruik door bedrijven. Een volledig technisch rapport van de beveiligingsincidenten door de AI-agents is online beschikbaar.
Bron: Sarayut Thaneerat/Getty Images (Beeld ter illustratie)
:strip_icc():strip_exif()/u/233767/crop5db03cbc075aa.jpeg?f=community)
/u/85941/crop61dd9b39bb021_cropped.png?f=community)
/u/479384/crop58e4c54c15b23_cropped.png?f=community)
/u/441310/crop57949f5d0029b_cropped.png?f=community)
:strip_icc():strip_exif()/u/290668/crop665855b513bc7_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/411101/crop636bd3ebad62b_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/249917/jaapschaap.jpg?f=community)
:strip_icc():strip_exif()/u/259786/crop66d34575d79ce_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/174878/SCKnightMicro.jpg?f=community)
/u/155722/Looneytunes.png?f=community)
:strip_icc():strip_exif()/u/489983/crop5db33928bbeea_cropped.jpeg?f=community)
:strip_exif()/u/153057/kolibrietattoo.gif?f=community)
/u/176086/crop5f0823fa5e8d6_cropped.png?f=community)
:strip_icc():strip_exif()/u/71367/banshee.jpg?f=community)