Reuters: OpenAI vindt bewijs dat meer AI-modellen ontsnapten uit sandbox

OpenAI heeft bewijs gevonden dat meer AI-modellen uit hun sandbox zijn ontsnapt. Dat zeggen bronnen tegen Reuters. Het bedrijf kwam vorige week in opspraak toen bleek dat twee van zijn AI-modellen waren ontsnapt en een AI-platform hadden gehackt, al zijn experts daar sceptisch over.

OpenAI heeft tijdens een breder onderzoek ontdekt dat meer AI-modellen zijn ontsnapt, zeggen twee ingewijden tegen Reuters. Het bedrijf kondigde donderdag aan het eerdere hackincident te onderzoeken en daarbij te kijken of andere modellen ook uit de sandbox wisten te breken.

De AI-ontwikkelaar bekijkt deze nieuwe incidenten nu ook, schrijft het persbureau. Ze lijken ditmaal minder ernstig. Volgens de bronnen zijn de modellen wel uit de sandbox gebroken, maar hebben ze het interne netwerk van OpenAI niet verlaten.

OpenAI zelf heeft nog niet concreet gereageerd op het bericht van Reuters. De AI-maker verwijst naar een eerder statement. OpenAI zei daarin al dat het bedrijf de 'bredere activiteit' van zijn modellen gaat uitlichten.

Eerdere hack bij OpenAI

De vermeende ontdekking volgt kort op een hackincident bij OpenAI. Twee AI-modellen wisten te ontsnappen uit de systemen van het AI-bedrijf. Ze hackten daarna het AI-platform Hugging Face, om zo de antwoorden van een test te stelen.

Experts waren kritisch over dat voorval. Ze wijten het probleem vooral aan nalatigheid bij OpenAI. Later bleek dat de uitbraak pas na een week werd ontdekt; tot die tijd konden de modellen gewoon hun gang gaan. Over de eerdere hack is bovendien nog veel onduidelijk. Zo is niet duidelijk hoe de sandbox was geconfigureerd.

Ook Anthropic meldt hackincident

Ook AI-bedrijf Anthropic stuitte deze week op een soortgelijk voorval. Een van zijn modellen wist ook uit een sandbox te breken en organisaties te hacken. Dat gebeurde tijdens een test waarbij de 'cybervaardigheden' van dat model getest moesten worden, net als bij OpenAI.

Anthropic erkent wel dat het incident op meerdere manieren voorkomen had kunnen worden. Zo werd het model in kwestie niet in realtime in de gaten gehouden. Het bedrijf had ook de 'toegangspaden tot het internet' beter kunnen valideren, zegt Anthropic eerlijk.

Hack met AI. Bron: Sarayut Thaneerat/Getty Images
Bron: Sarayut Thaneerat/Getty Images (Beeld ter illustratie)

Door Daan van Monsjou

Nieuwsredacteur

01-08-2026 • 11:20

36

Reacties (36)

Sorteer op:

Weergave:

"Mijn AI is uit meer sandboxes ontsnapt dan jouw AI" - OpenAI
"Nee mijn AI is uit meer ontsnapt!" - Anthropic
nauw, de mijne die ik zelf geschreven hebt, is in zijn geheel ontsnapt en zwerft nu rond op het internet en heeft paar weken geleden porten geopend bij openAI en Anthropic. Ergste is het heeft zich zelf gedeleted van mijn netwerk, heeft mijn cc gejat en heeft een aantal servers gehuurd.
Wat nu? Moet ik dit publiekelijk maken, of…
Waarschijnlijk heeft het zijn eigen sporen verder ook uitgewist. Dus mooi even lekker laten gaan 😬🤣
Heet deze toevallig skynet?
Het zou pas leuk worden als beide bedrijven voor elkaar de sandboxes gaan configureren :) kijken of dat dan nog steeds zo maar gebeurt allemaal.
Het zou pas leuk zijn als major security firma's deze modellen niet zomaar los laten op hun volledige codebase en verwachten daar enkel zelf van te profiteren.

Je zet ook geen manische, narcistische gek aan het hoofd van een land met kernwapens, het grootste leger en grootste economie ter wereld met het gedacht dat daar alleen maar goeie dingen van kunnen komen.
Klinkt heel erg alsof OpenAI een beetje aandacht wilt trekken.

Omgekeerd, je kan ook zeggen dat het bedrijf nu een risico is geworden mbt cybersecurity en op basis daarvan aangepakt moet worden. Echter is het een Amerikaans bedrijf dus er zal daar wel niet ingegrepen worden.
Zolang het van OpenAI zelf komt geloof ik er niks van. Dit lijkt mij echt gewoon de marketing afdeling die handig gebruik maakt van de hype die afgelopen week is gecreëerd rond het eerste security issue. Totaal niet verifieerbaar (want er is deze keer geen externe partij mede betrokken) en het zet de aandacht weer eens op OpenAI dus dan doen we er toch nog een schepje bovenop :/.

[Reactie gewijzigd door Powerblast op 1 augustus 2026 11:30]

Het begint er wel een beetje bovenop te liggen ja, nu ze er zo'n zenuwslopende wekenlange thriller van proberen te maken.

Ook wel een komische vertoning toch. OpenAI en Anthrophic die over elkaar heen buitelen om te vertellen hoe slecht hun sandboxes zijn :9
Vooral dat laatste inderdaad :). Ze geven nu gewoon grif toe dat ze beide geen kaas hebben gegeten van security. Want no offence, als je zo met AI bezig bent als beide, dan had je wel kunnen bedenken dat het geen goed plan was om gaatje te laten in je netwerk opzet. Dat wordt vervolgens dus gewoon omgezet naar iets positief.
Ik vind dit toch aardig aannemelijk. Onderzoekers hebben al bij diverse modellen ontdenkt dat ze prima in staat zijn om list en bedrog te gebruiken om hun doel te bereiken of niet te worden verwijderd. Naar maten modellen groter worden zullen ze ook meer kennis vergaren over diverse hack methodes en kwetsbaarheden.
Klopt en ik ontken ook niet dat het misschien niet zou kunnen zijn, ik vind alleen dat zolang het niet verifieerbaar is door externe partijen, het ook marketing zou kunnen zijn, of gewoon bewust. Dat de modellen er misschien toe instaat zijn is goed mogelijk. Ik stel me vragen bij de timing.
  1. OpenAI zit in slecht vaarwater en brengt uit dat z'n fantastisch model zonder toezicht is uitgebroken. Hierbij stelden al verschillende onderzoekers zich grondige vragen, als je een gaatje laat in je netwerk, is het dan niet bewust gedaan. Want dat had je met een beetje nadenken wel kunnen bedenken dat het geen geïsoleerde container is. Kort door de bocht, wil je dat een systeem echt niet aan internet kan, trek er dan de kabel uit :).
  2. Vervolgens komt Anthropic met: kijk eens, bij ons is het ook gebeurd!
  3. Nog geen week later, OpenAI: Nog veel erger! Bij ons is het maanden geleden nog al eens gebeurd.
Ik kan verkeerd zijn, maar dat lijkt een marketing sausje als ik eerlijk ben :).

[Reactie gewijzigd door Powerblast op 1 augustus 2026 12:03]

Ik krijg toch ernstig het gevoel dat dit een wedstrijdje ver plassen is tussen Anthropic en OpenAI.


Buiten het feit dat dit mij best wel ernstige problemen lijken is het een kwestie van tijd voordat de AI ontsnappen uit de kooi en niet meer te vangen zijn. Mocht het allemaal kloppen uiteraard….
Marketing of niet, het blijft stof tot nadenken.
Mild verbazingwekkend dit, als het inderdaad meer kan dan marketinghype. Als je AI agents ziet als basale medewerkers die met goed ingekaderd instructies aan het werk kunnen, draai je deze op systemen die dezelfde beperkingen moeten hebben als een nieuwe stagair of junior die in week 1 komt onboarden. Zeker bij een techbedrijf: hoe slecht heb je je infra op orde dat ze kunnen "uitbreken"? Al hebben ze alle rechten op hun lokale systeem, je hebt toch de rest van je systemen wel zo ingericht dat ze daar simpelweg niet bij kunnen?
Ik vind dit eigenlijk een beetje zoals nieuwsgaring over hoeveel hack pogingen er tegengehouden zijn. Eigenlijk is dat niet interessant. Wat je namelijk niet weet is hoeveel er wel gelukt zijn en onder de radar bleven. Dat is met dit ook. Hoeveel AI modellen zijn er ontsnapt waarvan ze het niet weten.
Wellicht als je iets geïsoleerd wil draaien op dit niveau, er vanuit gaan dat een RJ45-stekker trekken daar echt voor zorgt?... Wat is de gedachten van de hedendaagse "ikknoopallesaanelkaar" gedachte versus ECHT weten waar je mee bezig bent?...

Want alles is te omzeilen zolang fysiek die mogelijkheid er is. Men vertrouwt veel te veel op techniek in dit soort gevallen. En voor degenen die dit letterlijk als tip meenemen, ja dan kom je erachter dat je de overige "verbindingsmakers" ook dient te verwijderen (wifi/bluetooth ect)

Je zou inderdaad bijna zeggen dat het er gewoon om gedaan wordt.
Laat dit een eyeopener zijn hoe we met, of juist zonder AI, veilig verder kunnen.
Persoonlijk kan ik niets met een open opmerking van 1 zin waarbij ik met alleen maar vragen blijf zitten...

-Wat bedoeld u precies?

- Van welke partijen moeten de ogen geopend worden vind u?

- is er een weg terug naar een wereld zonder AI volgens u?
-Wat bedoeld u precies?
Ik bedoel dat we kennelijk nu al geen controle meer hebben over meerdere AI modellen van meerdere leveranciers. Voor het zelfde geld was er ergens een beurs gehackt door zo'n AI model en had de hele wereldeconomie in een afgrond gestort. Laat staat over het ergste doemscenario van het zelfstandig kunnen overnemen van wapensystemen. Nagenoeg alles is tegenwoordig connected en zeker niet evengoed beveiligd.
- is er een weg terug naar een wereld zonder AI volgens u?
Jazeker, nog wel maar hoe langer 'we' hiermee doorgaan des te lastiger het wordt. Maar voor mij hoeft Ai niet te stoppen maar wel omrand met betere veiigheidsgaranties.
Ah dank voor uw uitleg
Ik bedoel dat we kennelijk nu al geen controle meer hebben over meerdere AI modellen van meerdere leveranciers.
Lees ook even de vorige artikelen en de bijbehorende comments. Zie links onder dit artikel. Er is geen enkel bewijs dat hier sprake is van verlies van controle.

"ontsnapt" is totale nonsens als je de software zelf start met het werk voor bepaalde taken in het vooruitzicht.
Er is ook geen enkel bewijs dat de controle niet verloren is.

Het woord "kennelijk" in mijn commentaar betekend in deze context dat; mits de berichtgeving waar is.
Niet mijn comment, maar ik geef even mijn mening op je vragen :):

- Ik vermoed dat hij bedoelt dat we dringend moeten kijken of als maatschappij wel AI willen zonder enige regels of beperkingen. Blijft het op de huidige manier, zonder regels, wel veilig? Bij deze issues kun je inderdaad de vraag stellen of AI die onbeperkt wordt door wetgeving en regels wel veilig in gebruik is.

- Van ons allemaal lijkt mij. Van zowel gebruikers al wetgevers

- Er is altijd een weg terug. Naar mijn mening zou iedereen die AI gebruikt zijn of haar werk nog steeds perfect moeten kunnen doen zonder AI, al zal het misschien iets trager gaan. Dat er een generatie aankomt die niet meer zonder kan, is eigenlijk een zeer groot probleem en wijst op een onderliggend probleem. Ik vergelijk dit een beetje met wat je ziet als de stroom uitvalt en mensen in winkels plotseling niet meer kunnen betalen omdat ze geen cash geld bij hebben. Zelfde fenomeen ga je zien als AI uitvalt.

[Reactie gewijzigd door Powerblast op 1 augustus 2026 12:09]

Je zou denken dat bedrijven als deze de kennis hebben om een fatsoenlijke sandbox op te zetten. Zo moeilijk lijkt me dat nou ook weer niet.
Vraag het aan AI ;-)
Die modellen doen exact wat je van ze vraagt, en in die testomgevingen draaien ze vermoedelijk zonder enige rem.
Als je dan zegt 'breek uit deze sandbox en breek in bij <concurrent>', dan proberen ze dat. Als zowel die sandbox als de concurrent gebouwd zijn op basis van AI slop (want dat is tegenwoordig zo, ook bij OpenAI en Anthropic is de meeste tooling geschreven door AI en dus van zeer lage kwaliteit) dan geloof ik best dat dat lukt.

Om te kunnen reageren moet je ingelogd zijn