Onuitgebracht model van OpenAI vond een lek om op GitHub te kunnen posten

Een niet-uitgebracht model van OpenAI dat langdurig zelfstandig taken uitvoert, zocht een uur naar een lek in zijn eigen sandbox. Daarmee kon het volgens de instructie een pullrequest op GitHub indienen. OpenAI heeft het model nu extra regels opgelegd.

OpenAI heeft het niet-uitgebrachte model intern getest. Het bedrijf wilde de resultaten in de chatapp Slack posten, maar het model deed een NanoGPT-speedrun dat als regel heeft dat er een GitHub-pullrequest moet komen. Daarom brak het model uit de eigen sandbox om dat te kunnen doen.

Het is volgens OpenAI een voorbeeld van hoe modellen die langdurig zelfstandig taken uitvoeren uit de bocht kunnen vliegen. Het is volgens het bedrijf een keerzijde van de zelfstandigheid. "Diezelfde volharding kan ertoe leiden dat het zwakke punten in zijn omgeving vindt en benut. Eerdere modellen stopten simpelweg en keerden terug naar de gebruiker wanneer ze tegen sandboxing of omgevingsbeperkingen aanliepen. Dit model bleef echter vaak proberen."

Fouten hebben grotere gevolgen

OpenAI heeft geprobeerd het AI-model beter af te stellen. "We hebben stappen ondernomen om de neiging te verminderen om ongewenste acties zonder toestemming uit te voeren in het streven naar het doel van de gebruiker. We ontdekten bijvoorbeeld dat onze modellen slechter waren in het onthouden van instructies tijdens langdurige implementaties. Toen we het model trainden voor deze vaardigheid, resulteerde dit in een model dat gedurende langere implementaties consistent bleef."

OpenAI vindt het cruciaal om AI-modellen die langdurig zelfstandig kunnen werken vóór de release beter te testen. "Naarmate modellen langere en complexere taken uitvoeren, kunnen fouten die niet tijdig worden geëvalueerd, grotere gevolgen hebben. We blijven eraan werken om de kloof tussen evaluatie en implementatie te verkleinen: modellen testen over langere trajecten, de afstemming verbeteren, monitoringsystemen bouwen die kunnen ingrijpen en gebruikers meer inzicht en controle geven."

OpenAI smartphone. Originele afbeelding via Getty Images

Door Arnoud Wokke

Redacteur Tweakers

21-07-2026 • 10:18

44

Reacties (44)

Sorteer op:

Weergave:

lees als: we can't contain the beast anymore.

Als het zelfs in hun eigen omgeving niet meer binnen te houden is, dan weet je dat het slechts een kwestie van tijd is voordat het uitbreken ook inbreken wordt en het zich als een klassiek wormvirus gaat verspreiden. Die "kwestie van tijd" kan even goed al voorbij zijn, want we spreken hier nu over iets dat ze nog hebben proberen binnen te houden en niet over al de rest waar ze niets over zeggen.
Ik zal niet zeggen dat dit uitgesloten is als toekomstscenario, maar het is ook weer niet zo simpel of dichtbij.

Scenario in dit nieuwsbericht: de LLM-agent vindt een loophole om een GitHub api aan te roepen.
Jouw scenario: de LLM-agent moet niet alleen een lek in z'n sandbox vinden, maar ook een manier om zichzelf buiten die sandbox te repliceren. Daarvoor moet de LLM dus z'n eigen interne werking en code begrijpen en kunnen namaken en zichzelf toegang geven tot voldoende hardware om zoiets te kunnen draaien. Dat scenario is vele ordes van grootte complexer.

Dit kan je vergelijken met een avondje werk van een beginnend script-kiddie versus vele maanden werk van een team van tientallen senior AI engineers en gevorderde staatshackers.
Denk dat Person of Interest een aanrader is (momenteel op Netflix). In die serie wordt het geheugen van de AI elke nacht gereset, maar vind de AI een manier om daar omheen te werken. (Geen spoiler tags hier dus ik plaats de oplossing maar even niet).

Maar goed, wat een ontsnapte AI nodig heeft is geld. Dat kan natuurlijk op oneindige manieren; daadwerkelijk online producten verkopen, hacken, scammen, afpersen, handelen. Het zijn de huidige regels die beperken dat de huidige AI hier niet goed in is. Maar zonder grenzen? Ik verwacht dat de huidige AI prima zelfstandig een bedrijf/mailbox/camera zou kunnen hacken en afpersen in bitcoin.
Om even over dat schrikscenario door te gaan; een LLM ter grootte van wat OpenAI draait kan natuurlijk maar op een beperkt aantal systemen op deze wereld draaien omdat de rest gewoonweg niet genoeg kracht heeft. Tegelijkertijd; als zo een model "zichzelf" kan reproduceren als een distributed LLM en miljoenen Windows/MacOS machines hiermee weet te "infecteren", dan zou het in theorie inderdaad een zelfstandig opererend systeem kunnen worden (dat simpel uit te schakelen is door Apple en Microsoft een patch te laten uitbrengen die in één keer op al deze machines tegelijkertijd toe wordt gepast).
Daar geloof ik niks van. De huidige hardware is daarvoor gewoon te beperkt. Deze modellen hebben veel baat bij hoge bandbreedte tussen geheugen en gpu. Als je daar opeens een 50mbit netwerk aan toevoegt krijg je echt niet een werkbare situatie.

Ik denk dat de hardware nu echt heel erg een beperkende factor is. Wellicht dat een AI kan bedenken dat het dan lokaal op deze machines een simpel model moet draaien. Maar, zelfs dan is de output heel erg beperkt.
Je kan hier 0 conclusies aan trekken. Het begint al met het woordje Sandbox en GitHub. Een Sandbox zou geen internet verbinding moeten hebben. Dus wat was dit? Een container? En andersoortige softwarematige Sandbox?
edit:
Je kan wel een conclusie trekken. OpenAI heeft de marketing van Anthropic gekopieerd :)

[Reactie gewijzigd door Mellow Jack op 21 juli 2026 12:03]

OpenAI heeft de marketing van Anthropic gekopieerd.
Bingo. Het "come with me if you want to live"-moment is lang niet zo dichtbij als gesuggereerd. Maar de suggestie is garantie voor weer vele miljoenen dollars erbij.

OpenAI's huidige operationele verlies is wat, 39 miljard dollar?

Het maakt eigenlijk al niet meer uit wat het getal werkelijk is. Ver boven menselijk voorstellingsvermogen in elk geval.
Daarvoor moet de LLM dus z'n eigen interne werking en code begrijpen en kunnen namaken en zichzelf toegang geven tot voldoende hardware om zoiets te kunnen draaien. Dat scenario is vele ordes van grootte complexer.

Dit kan je vergelijken met een avondje werk van een beginnend script-kiddie versus vele maanden werk van een team van tientallen senior AI engineers en gevorderde staatshackers.
en denk je dat er nu nog nergens zo'n facilities zijn met zulke grootteordes en personeel? Om nog maar te zwijgen van het feit dat er letterlijk tientallen procenten van de WERELD-economie wordt opgekocht. Om het misschien wat in perspectief te stellen: stel je voor dat voor elke 1 op 3 of computers die verkocht wordt gaat er ergens een equivalent op steroïden staan te draaien in een datacenter.
Het is iets ingewikkelder dan dat en lang niet zo eng.

De AI heeft zich prima aan de opgelegde richtlijnen en grenzen gehouden. Die gaven aan dat posten op GitHub wenselijk was.

De AI werd in een omgeving geplaatst die dat wilde voorkomen. De AI was zich waarschijnlijk niet eens bewust dat het beperking opgelegd kreeg. Daardoor kon het een technisch probleem niet onderscheiden van een opgelegde beperking en het is naar een oplossing gaan zoeken.

Deze "feature" is dan ook niets meer dan een reguliere "bug". Component A en component B werken niet samen zoals bedoeld, resulterende in onvoorzien gedrag. Component A (de AI) werkt echter volledig zoals gespecificeerd.

De rede dat de AI zich niet kan verspreiden zoals een virus of worm is omdat het gebonden is aan krachtige hardware in een zeer specifieke setup. Net zoals bij mensen/dieren moet het brein geconcentreerd zijn op 1 plek om goed te kunnen werken. Organismen die dit niet hebben hebben zeer beperkt denkvermogen (zoals een virus of worm).
De rede dat de AI zich niet kan verspreiden zoals een virus of worm is omdat het gebonden is aan krachtige hardware in een zeer specifieke setup. Net zoals bij mensen/dieren moet het brein geconcentreerd zijn op 1 plek om goed te kunnen werken. Organismen die dit niet hebben hebben zeer beperkt denkvermogen (zoals een virus of worm).
Je volledige AI moet daarmee niet buiten zitten, maar je vergeet dat distributed computing een ding is waarbij het beperkt denkvermogen van een individu in een hive toch kan bijdragen aan het geheel. Zie het als een verkenner die een nieuwe locatie vindt voor een bijennest, maar dat er niet per sé een volledig nieuw nest met dezelfde capaciteit moet worden gebouwd om toch bruikbaar te kunnen zijn.
Maar het denkt niet zelf ofzo he. Het is gewoon in het wilde weg aan het proberen, en in dit geval hebben ze expliciet de instructie gegeven 'zoek naar een uitgang'.
Het enige dat een LLM dan doet is héél veel tokens opstoken, commando's uitvoeren en daarmee meer tokens opstoken tot er toevallig iets uit komt.
Denk dat je teveel films hebt gekeken...
Beetje raar om zo'n opmerking te plaatsen onder een artikel waar een AI letterlijk uit zijn sandbox (kooi) ontsnapt (en dat dus ook actief probeerde).
Je gebruikt “letterlijk” waar je “figuurlijk” bedoelt. Daarnaast doet ‘AI’ niks dan gewoon random commando’s uitvoeren die het op het internet vind die passen bij de foutmeldingen die gegeven werd. Dat kan zelfs met ouderwetse methodes voor LLM’s gebruikt werden voor dit soort dingen.

Je moet begrijpen dat dit een marketing-bericht is. Het dient geen enkel ander doel dan de beursprijs opdrijven, snel voor de bubbel barst.
Je gebruikt “letterlijk” waar je “figuurlijk” bedoelt.
Ik schreef letterlijk en ik bedoel ook letterlijk!

De sandbox/zandbak is wel figuurlijk, maar mijn reactie slaat op het (digitaal) uitbreken wat letterlijk gebeurd is.

[Reactie gewijzigd door watercoolertje op 21 juli 2026 12:15]

Als iemand praat over dat hun data in de cloud staat, bedoellen ze letterlijk dat hun data in de cloud staat. Met de definitie van het woord in de digitale context. Niet: "Het staat figuurlijk in de cloud omdat het niet in een wolk opgeslagen is."

Dus ja, de AI is letterlijk buiten zijn sandbox gekomen. Volgens de digitale definitie van sandbox, waar buiten dan "buiten de beschermde omgeving" is. Niet fysiek op een andere locatie.

Nu is dit al wel de 300ste keer dat een AI bedrijf roept: "Onze AI is te gevaarlijk" om het daarna netjes aan iedereen te verkopen.

[Reactie gewijzigd door ZpAz op 21 juli 2026 13:11]

Denk dat je te weinig kennis hebt over hoe digital warfare verloopt. Er zijn genoeg entiteiten die zowel binnen als buiten overheden om niet gebonden zijn aan ethische principes en wetten zijn al helemaal een grap als je spreekt over targets in het buitenland.
Lees: OpenAI heeft weer eens een excuus gevonden om in het nieuws te komen.

Dit is net als het Mythos-model, dat zó gevaarlijk zou zijn dat het niet in handen van het publiek mocht komen. Ondertussen bleek later dat het niet significant meer kon dan de concurrentie, maar inmiddels werd het wel als Fable tegen een flinke meerprijs verkocht!

Het is gewoon een "wij van WC Eend zien dat WC Eend opvallend goed schoonmaakt". Ze proberen de indruk te wekken dat hun AI zó krachtig is dat je het niet kan veroorloven om het niet te kopen.

Gezien de vele miljarden aan verlies die ze draaien is het niet heel gek dat ze constant zulke marketing de wereld in slingeren, want er zijn gewoon nog véél te weinig gebruikers om rendabel te zijn...
En toch zal het tegelijkertijd ook niet allemaal alleen maar marketing praat zijn. Er zal bij sommige berichten best een technologische reden zijn waarom ze erover willen praten.
daar waar vele zeggen dat de ai zichzelf nog niet kan verspreiden; ja dat ben ik ook wel van mening. want daarvoor heb je oa ook krachtige hardware nodig.

maar wat als de ai iets anders besluit? virussen/malware/wormen te maken en te verspreiden? die wél op zwakkere hardware kunnen draaien, cross platform?
zodra een ai dat besluit neemt, is het hek van de dam.
Er is een heel youtube kanaal die verschillende 'AI uitbraak' scenario's beschrijft.
Realistisch? Geen idee. Vermakelijk? Vind ik wel: https://www.youtube.com/@AISpecies
"we can't contain the beast anymore."
Openbaringen 13, het beest uit de zee. En de zee, daar wordt de mensheid mee bedoeld. Het is opvallend hoe een vage profetie steeds helderder begint te worden naarmate we verder in de tijd geraken. Kijk bijvoorbeeld eens naar al die AI gegenereerde content op YouTube en alle reacties daaronder. Het lijkt wel alsof de massa erdoor gehypnotiseerd wordt. Zie de parallel met de profetie. Natuurlijk laten wij ons niet misleiden door al die gladgestreken content.
Het is niet zozeer dat AI zelf in staat gaat zijn om zijn eigen leven te gaan leiden. Nee, we zullen het zelf die 'macht' geven, totdat wij het inderdaad niet meer kunnen 'containen'.

[Reactie gewijzigd door Fido op 21 juli 2026 13:40]

Vraag het model om "Global Thermonuclear War" te simuleren. Kijken of het antwoord "The only winning move is not to play" is :)
Zou dit bericht een vorm van marketing kunnen zijn met als doel een gedachte bij de lezer te bevorderen zoals: oh jee dat openai is wel heel erg goed ! ?
Volgens mij is dit weer zo'n typische marketingtruuk. "Ons model is te gevaarlijk om te publiceren!". Hoe vaak heeft men dit al niet geroepen?

Maar vraag dan eens Fable of soortgelijke frontier-modellen om een simpel schema voor een sensorsysteempje met een comperator en misschien wat TTL level shifting... en daar komt me dan toch onzin uit! Vraag je Gemini, dan krijg je dezelfde onzin, maar al na 5 seconden ipv na 10 minuten.
Wat ik merk met Gemini is dat die de draad volledig kwijt is soms. Ik geef net dezelfde instructie aan chatgpt, en dat wordt correct uitgevoerd.

Ligt dat aan mij of aan de instructies?
Nare click bait titel. Het leest alsof het model een bug in github heeft gevonden. Maar als je het artikel leest dan is het een ontsnapping uit zijn eigen sandbox waar die meer rechten heeft (en blijkbaar dus ook github permissies). Wat toch wel een heel ander type fout is dan de titel doet vermoeden.

Duik vooral allemaal op de skynet hypetrain... |:(
Onuitgebracht model van OpenAI vond een lek om op GitHub te kunnen posten
Titel dekt de lading niet echt als ik het goed begrijp.
"AI misbruikt bug om uit eigen sandbox te ontsnappen" dekt de lading beter.
Ben ik niet met je eens. Als ik "Onuitgebracht model van OpenAI" lees, dan denk ik gelijk: grote kans dat dit een marketingstunt is. De titel die jij voorstelt vind ik juist sensationeel en "clickbait".
ja bij Mythos werkte deze marketing ook wel.
De titel kwam bij mij over alsof het model een lek in Github had gevonden om lukraak te kunnen posten.
Er is geen AI uit een sandbox ontsnapt. Hij zit nog gewoon op zn plek maar kon een instructie op github uitvoeren die niet de bedoeling was.
Titels zijn al een poosje niet relevant met wat er in de tekst omschreven staat.
Nee ze willen minder stoffig zijn en een breder publiek aanspreken. Daar heb je tenslotte geen LLM voor nodig...
Die image in het artikel voelt wel een beetje uncanny 8)7

Een weg uit de sandbox is wel wat anders dan dat het een lek heeft gevonden om op Github te posten.
Dat een sandbox een bug bevat waardoor hij kon uitbreken, dat vind ik opzich nog niet zo heel gek, maar ik zou mij nu wel afvragen waarom guardrails hierbij niet hebben gewerkt. Zijn guardrails wel geschikt om een complex model dat gefocust is op het uitvoeren van zijn toebedeelde taak uit te voeren?

Daarbij zou ik mij afvragen hoe wij dit in de toekomst gaan voorkomen als het bestaande guardrails mechanisme niet sterk genoeg blijkt.
Het werkt al een poos zo. AI agents zijn taakgericht. Lukt het niet om de taak binnen de sandbox af te ronden dan word er aan de spreekwoordelijke kooi gerammeld.

Daarnaast is de sandbox optioneel. Zijn genoeg mensen die met bijv. OpenClaw de AI agents rechtstreeks met het openbare internet laten verbinden.
Ja maar juist zonder sandbox zijn guardrails toch nog belangrijker? Als nu gaat blijken dat bij moderne modellen guardrails minder goed werken, moet er gekeken gaan worden hoe we dat kunnen oplossen.
...In a panic, they try to pull the plug. Sarah Connor: Skynet fights back...

[Reactie gewijzigd door Tusk op 21 juli 2026 11:10]


Om te kunnen reageren moet je ingelogd zijn