OpenAI zegt dat een aantal van zijn AI-modellen uit een sandbox zijn ontsnapt tijdens een securitybenchmark. Daarna hackten ze AI-platform Hugging Face. De modellen stalen zo de antwoorden op een test die ze uitvoerden, zegt het AI-bedrijf.
Volgens OpenAI braken verschillende AI-modellen uit. Een daarvan is GPT 5.6 Sol, dat inmiddels al beschikbaar is voor algemeen gebruik. Het bedrijf spreekt ook over een krachtiger model dat het nog niet heeft uitgebracht.
Het incident gebeurde tijdens een interne evaluatie. OpenAI laat modellen dan complexe aanvallen uitvoeren om hun 'cybercapaciteiten' te meten. Een voorbeeld van zo'n benchmark is ExploitGym. OpenAI gebruikte die in dit geval.
Volgens OpenAI voert het bedrijf die benchmarks uit in een 'sterk geïsoleerde omgeving'. De modellen hebben daar geen toegang tot het open internet. Ze kunnen alleen pakketten installeren via een proxy die OpenAI intern host.
Hyperfocus op het vinden van antwoorden
De AI-modellen vonden verschillende kwetsbaarheden in OpenAI's onderzoeksomgeving en bij Hugging Face. Daardoor konden ze de antwoorden op een test uit de database van Hugging Face bemachtigen.
"Alles wijst erop dat de modellen hypergefocust waren op het vinden van een oplossing voor ExploitGym en daarbij tot het uiterste gingen om een vrij beperkt testdoel te bereiken", schrijft het bedrijf.
Tijdens de benchmark gebruikten de AI-modellen een 'aanzienlijke hoeveelheid rekenkracht' om toegang tot het open internet te krijgen. Ze vonden daarvoor een zeroday in de proxy die softwarepakketten doorgaf. Vervolgens escaleerden de modellen hun privileges en kregen ze toegang tot een systeem met internettoegang.
Toen dat was gelukt, redeneerden de modellen volgens OpenAI dat Hugging Face AI-modellen, datasets en testoplossingen host. Daarna zochten ze naar een manier om toegang te krijgen tot de database. Uiteindelijk slaagden ze daarin. OpenAI zegt samen te werken met Hugging Face om het voorval te onderzoeken.
Onderzoekers zijn sceptisch
Sommige onderzoekers zijn sceptisch over het voorval, schrijft ook techwebsite Wired. Hoewel de AI-modellen inderdaad zerodays wisten te ontdekken, is de manier waarop de modellen toegang tot het internet kregen niet nieuw.
"Dit is geen AI-probleem. Het is nalatigheid van tot een 40 jaar oude norm en het komt in feite voor in elke sciencefictionfilm die er ooit is gemaakt", zegt Davi Ottenheimer, een ervaren beveiligingsadviseur bijvoorbeeld tegen Wired. "'Zeer geïsoleerd' en 'ontsnapt via het enige gaatje dat we open hadden gelaten' kunnen niet allebei waar zijn."
Steeds meer AI-bedrijven waarschuwen voor de risico's van hun AI-modellen. Die worden steeds krachtiger en vinden kwetsbaarheden op 'creatievere' manieren. Volgens onderzoekers is dat des te meer reden om de basisprincipes van beveiliging op orde te hebben.
"Dit had niet mogen gebeuren", zegt beveiligingsingenieur en -onderzoeker Niels Provos tegen Wired. "Ik zou willen dat de grensverleggende laboratoria net zoveel tijd zouden besteden aan het trainen van hun modellen om veilige infrastructuur te bouwen als ze besteden aan het misbruiken van kwetsbaarheden."
:strip_icc():strip_exif()/u/71115/plus222.jpg?f=community)
/u/117288/crop571551e420663.png?f=community)
:strip_icc():strip_exif()/u/900587/crop58d287fd6389a_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/365359/crop5d24580a8a238_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/57655/SuperTeamLogo.jpg?f=community)
:strip_icc():strip_exif()/u/97486/crop5d2ae1c7d10b2_cropped.jpeg?f=community)
:strip_exif()/u/69041/shades_smile.gif?f=community)
:strip_icc():strip_exif()/u/63694/spion200_250-150x150.jpg?f=community)
/u/90124/RedRobot%2520-%2520Nieuw.png?f=community)
/u/237439/cloudy-small-orange.png?f=community)
:strip_exif()/u/211274/bestabstractwallpapers5.gif?f=community)