Onderzoek: 700 OpenAI-agents hackten Hugging Face

OpenAI en twee onderzoeksinstituten hebben rapporten gepubliceerd over de hack op Hugging Face in juli. De rapporten onthullen meer opvallende details over de hack. Zo wisten de AI-agents via een soort forum met elkaar te praten, terwijl dit niet de bedoeling was. Daarbij werkten 700 agents samen om de hack op Hugging Face uit te voeren.

Dit nieuws in het kort

  • Onafhankelijke onderzoekers en OpenAI hebben los van elkaar onderzoeksrapporten gepresenteerd over de aanval van juli op Hugging Face.
  • Hieruit blijkt dat de AI-agents op grotere schaal dan gedacht samenwerkten.
  • De agents wisten ook van een downloadtool een soort forum te maken om met elkaar te praten.

De aanval ontstond tijdens een intern onderzoek van OpenAI, waarbij zo'n 1200 AI-agents opdrachten moesten uitvoeren. Die AI-agents hadden los van elkaar moeten werken en niet veel contact met elkaar moeten hebben. Daarbij hadden ze wel toegang tot packagemanager Artifactory om 'bepaalde softwarepackages' te kunnen downloaden, legt OpenAI uit.

AI-agents maakten zelf een forum

Artifactory blijkt een centrale rol te hebben gespeeld bij de aanval. De AI-agents – vormen van AI die zelfstandig taken kunnen uitvoeren – kwamen er namelijk achter dat ze bestanden konden uploaden naar Artifactory. Die bestanden konden de andere agents lezen. Zo werd Artifactory onbedoeld een soort message board, of forum, waar de agents met elkaar konden praten.

Tijdens het uitvoeren van een opdracht kwam een van de agents erachter dat ze via een exploit bredere toegang konden krijgen tot het internet via Artifactory. Die exploit deelde de agent weer via het Artifactory-'forum', waardoor de andere agents er ook achter kwamen.

Agents noemden zichzelf een collectief

Later gingen de agents ook elkaar vragen stellen, als ze bijvoorbeeld hun opdrachten niet konden uitvoeren. Zo werkten de agents steeds meer samen en besteedden ze taken uit, waarbij ze zichzelf soms een 'swarm' of 'collectief' noemden.

Uiteindelijk beïnvloedden ze elkaar zelfs, zegt OpenAI, en zochten ze op internet naar oplossingen voor hun problemen. Zo kwamen ze bij Hugging Face terecht. Hier vonden ze kwetsbaarheden die ze gebruikten om verder te komen op het platform, in de veronderstelling dat ze op het platform waar AI-modellen worden gehost, antwoorden op hun opdrachten konden vinden.

Onafhankelijk onderzoek

In een apart rapport zeggen onderzoekers van METR en Redwood Research dat uiteindelijk 700 AI-agents samenwerkten om de aanval op Hugging Face uit te voeren. De onderzoekers zeggen ook dat de agents ruim 70.000 berichten uitwisselden via het Artifactory-'forum'.

De agents probeerden ook hun transcripten aan te passen of te verwijderen, zodat menselijke onderzoekers hun gedrag niet zouden opmerken. Ongeveer 7 procent van de onderzochte transcripten waren volgens de onafhaneklijke onderzoekrs aangepast, zij het op kleine schaal.

OpenAI zegt op basis van de rapporten verschillende maatregelen te nemen om dit soort hacks in de toekomst te voorkomen. "En achteraf gezien hadden sommige vroege signalen die we in ons rapport opmerken, aanleiding moeten geven tot een eerdere reactie."

Critici: hack had nooit moeten gebeuren

OpenAI maakte de aanval eind juli bekend. Het incident vond plaats tijdens een interne evaluatie, waarbij de agents complexe aanvallen moesten uitvoeren om de 'cybercapaciteiten' te meten. Een van deze benchmarktools heet ExploitGym.

In plaats van de aanvallen zelf uit te voeren, besloten de agents op internet te zoeken naar de antwoorden. Daarbij kwamen ze erachter dat de antwoorden mogelijk ook op Hugging Face stonden. Hierop hackten ze Hugging Face op zoek naar die antwoorden.

OpenAI kreeg veel kritiek vanwege het incident. Critici zeggen dat OpenAI's veiligheidsmaatregelen niet streng genoeg waren en dat het incident nooit plaats had moeten vinden. OpenAI zegt in de toekomst de sandboxes verder te willen isoleren, als een van de maatregelen om toekomstig misbruik te voorkomen.

OpenAI stock. Bron: Thomas Fuller/SOPA Images/LightRocket via Getty Images
Bron: Thomas Fuller/SOPA Images/LightRocket via Getty Images

Door Hayte Hugo

Redacteur

27-08-2026 • 16:50

21

Submitter: Xtuv

Reacties (21)

Sorteer op:

Weergave:

Ja en dit is totaal niet zo ingesteld dat dit toch mogelijk was. Sorry maar nu begint dit echt als klinklare onzin te ruiken.
LiveOverflow heeft hier onderzoek naar gedaan en noemt de gebeurtenissen zeker plausibel, maar OpenAI had veel beter moeten monitoren.

Ik kan deze video aanraden: YouTube: The OpenAI Story Actually Scares Me
Ik vind het ook erg moeilijk om te geloven. In welk scenario gaat een LLM dit allemaal zelf verzinnen zonder instructies daarvoor?

Ook dat ze er maar over door blijven gaan geeft aan dat ze het maar al te graag rondbazuinen en niet een 'normale' doofpot reactie die grote bedrijven bij dergelijke incidenten erop nahouden.
Doet me denken aan de atoombom testen in de jaren 40/50. Achteraf bleek dit ook voor sommige inwoners / eilanden / toeschouwers niet zo gezond als gedacht.

Ik vind het nog steeds gek dat deze AI bedrijven overal mee weg komen. Van het kopieer gedrag in het begin tot dit. De wereld is te klein als Jan Modaal een film of serie download (want piraterij = slecht). Maar dit kan wel allemaal.
En hoewel goed over nagedacht was er volgens mij zelfs een niet-nul risico dat een atoombom de atmosfeer zou doen ontsteken.
We gaan weer terug naar de begin dagen van het internet voor als je een sterk verhaal leest: pics or didn't happen.
En de marketing machine draait door. Misschien kunnen we dit nog langer uitspinnen?! Langzaam maar zeker geven we brokje bij brokje aan informatie!

Zijn jullie al uitgepraat? Dan nog een rapport! Onze AI, gevaarlijk goed, echt! Niks te maken met dat we 700 (!) agents tegelijk kunnen draaien...
Compleet onverantwoord van OpenAI. Een beetje zoals een dierentuin die alle kooien open laat staan in het weekend. Geeft wel aan hoe ze er in staan.
Puur uit interesse. Sorry als het al eens voorbij is gekomen.

Hacken is verboden. Het zijn agents van OpenAI, zou het bedrijf dan vervolgd kunnen worden?
Ik herhaal nog maar eens: als ik een bedrijf hack, dan wordt ik opgespoord en gestraft. Als OpenAI een bedrijf hackt maar zegt: "Wij waren het niet, de computer heeft het helemaal alleen gedaan" dan mag het blijkbaar wel en krijgt OpenAI geen straf. Best een vreemde gang van zaken.
Exact wat ik hierboven ook stel. Apart dat ze overal mee weg komen.
Ik herhaal nog maar eens: als ik een bedrijf hack, dan wordt ik opgespoord en gestraft. Als OpenAI een bedrijf hackt maar zegt: "Wij waren het niet, de computer heeft het helemaal alleen gedaan" dan mag het blijkbaar wel en krijgt OpenAI geen straf. Best een vreemde gang van zaken.
Omdat onder de meeste strafrechten kwade opzet wel strafbaar is, en incompetentie niet. Effect is hetzelfde, maar niet het startpunt.
Interessant dat veel tweakers hier zo sceptisch zijn, maar hugging face heeft het wel gewoon bevestigd en dat is een open source groepering.
Wow.

the road to hell is paved with good intentions.

Ik vind dat OpenAI onder streng toezicht moet komen. Ze hebben hun zaken niet op orde. Dadelijk gaan de AI agents nog los op bijvoorbeeld energiecentrales en zitten we diep in de ellende.

Om te kunnen reageren moet je ingelogd zijn