OpenAI ontdekte de hack van een agent die uit een 'sandbox' zou zijn gebroken en Hugging Face hackte pas na een week, nadat de FBI daarover was ingelicht. Dat blijkt uit een reconstructie van Reuters over het incident.
Reuters sprak met verschillende bronnen die bij het incident betrokken waren en maakte een reconstructie van de zaak, waarover nog steeds veel vraagtekens bestaan. Het draait om een incident van eerder deze maand. Een AI-agent van OpenAI zou uit een sandboxomgeving zijn gebroken en zelfstandig het AI-platform Hugging Face hebben gehackt. Over de hack is nog veel onduidelijk. Zo is niet duidelijk hoe de 'sandbox' was geconfigureerd. Als een agent vanuit die omgeving uiteindelijk toch verbinding met het open internet kan maken, kun je die moeilijk een sandbox noemen.
Volgens de bronnen van Reuters ontdekte OpenAI pas laat dat het incident had plaatsgevonden. De agent toonde op 9 juli al signalen dat die probeerde te ontsnappen uit de sandbox. Althans, daar lijkt het op. Reuters beschrijft dat OpenAI een agent gebruikte die gebaseerd was op het recent uitgebrachte GPT 5.6-Sol en een ander, nog niet uitgebracht model.
:strip_exif()/i/2008203254.jpeg?f=imagenormal)
Vreemd gedrag
Die modellen begonnen 'vreemd gedrag' te vertonen. De agent schreef notities voor toekomstige nieuwe agents en wist bepaalde monitoringsystemen uit te schakelen. Reuters merkt echter op dat niet zeker is of die incidenten verband houden met deze hack.
De agent hackte Hugging Face op 11 juli. Pas op 16 juli zou OpenAI hebben ontdekt dat het om een eigen model ging. Tegen die tijd had Hugging Face de FBI al ingelicht. Dat zou betekenen dat het bijna een week duurde voordat OpenAI doorhad dat een van zijn modellen uit de sandbox was ontsnapt en Hugging Face had gehackt. Op 18 en 19 juli legden OpenAI-medewerkers dit definitief vast in interne logs.
Gevaarlijke hack, incompetentie of slimme marketingtruc?
De vraag blijft hoe serieus we het incident moeten nemen. Veel experts twijfelen aan de officiële lezing van OpenAI en zeggen dat het bedrijf grote fouten heeft gemaakt. De omgeving was bijvoorbeeld geen echte sandbox of was in ieder geval slecht geconfigureerd. Dat duidt op z'n minst op nalatigheid van OpenAI.
Een andere veelgehoorde opmerking is dat het gaat om een marketingstunt. AI-bedrijven hebben er een handje van om de mogelijkheden van hun modellen als veel groter en gevaarlijker af te schilderen dan ze daadwerkelijk zijn. Een 'gevaarlijk' model is tenslotte zó goed, dat móét je als klant wel willen hebben. Reuters' reconstructie duidt erop dat OpenAI het incident niet in scène heeft gezet. Wel lijkt het bedrijf dat in ieder geval goed te spinnen met slimme marketing.
:strip_icc():strip_exif()/u/1160228/crop5c2620531d440_cropped.jpeg?f=community)
/u/1219196/crop6324b2e35d04c_cropped.png?f=community)
:strip_icc():strip_exif()/u/888513/crop59395c817ede5_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/312250/crop58172eb91ebc5_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/269054/crop6064049cee9ab_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/71115/plus222.jpg?f=community)
/u/69484/crop65eb3317e5e80.png?f=community)
/u/28892/flo.png?f=community)
/u/155722/Looneytunes.png?f=community)
/u/1837266/crop64f314b657ecf_cropped.png?f=community)