Kan een llm denken? Is AI zelfbewust? Wat is zelfbewustzijn eigenlijk? Volgen we daarin de res cogitans van Descartes of is zelfbewustzijn meer de transcendentale apperceptie van Kant? Wees gerust: wij hebben geen idee en we gaan ook niet doen alsof we het weten. Wat we wél weten, is dat het nieuws over hackende AI-agents op de redactie tot veel discussie leidde.
De zomer van 2026 mag inmiddels wel de Zomer Van De AI-hack worden genoemd. De kans is groot dat we over een paar jaar kunnen terugkijken op deze periode als een waarin AI-bedrijven de macht over hun llm's verloren. Dat begon met de hack op Hugging Face, eind juli. Sindsdien kunnen we bijna dagelijks een bericht schrijven over hacks door AI-agents van Anthropic, Meta, Google en nog wel meer. Sterker nog, dat deden we ook.
Onder die artikelen ontstaat steeds vaker een opvallend heftige discussie. Die draait om de vraag hoe we over deze hacks schrijven. Dat gebeurde bijvoorbeeld vorige week, toen in het nieuws kwam dat OpenAI-modellen uit zichzelf foto's op openbare sites plaatsten en websites van de Amerikaanse overheid aanvielen. Een veelgehoorde conclusie in de reacties was dat de titel fout was, want de modellen gingen niet de fout in, OpenAI liet de modellen de fout ingaan.
Klopt dat? En als het klopt, hoe moeten media zoals wij dan schrijven over deze incidenten? Dat leidde tot veel discussie op de redactie.
Wat gebeurde er precies?
Die begint bij de feiten. Want wat weten we nu eigenlijk over deze ene hack en over andere hacks, en hoe verhouden die zich tot elkaar? De eerste publiek bekende hack door een AI-agent was de hack op Hugging Face in juli 2026. OpenAI had en heeft het nog steeds over termen als 'misaligned behavior'. Ofwel: de modellen deden dingen die OpenAI niet goed snapt.
Toch ontbreekt er in een postmortem over het Hugging Face-incident veel informatie. Zo is niet bekend welke prompts OpenAI gebruikte of hoe het de sandbox zogenaamd beveiligde. Feitelijk heeft OpenAI dus niet genoeg informatie gegeven om te zeggen hoe de hack kon plaatsvinden.
Dat maakt het heel lastig om met zekerheid te zeggen wat er misging tijdens de hack. Vergeet ook niet: dit is een postmortem die OpenAI meer dan een maand ná de hack plaatste. In het verleden behaalde resultaten bieden geen garantie voor de toekomst en dat geldt ook voor nieuws. OpenAI mag dan inmiddels 10.000 agents hebben gevonden die hackten vanwege slechte beveiliging en belabberde logging, tijdens het 10.001e incident weten we niet zeker of dat opnieuw het geval is.
Verantwoordelijkheid
Natuurlijk kunnen we dat wel extrapoleren. Bovendien verandert het niets aan de verantwoordelijkheidsvraag. Die beantwoordden experts in een eerder achtergrondartikel op Tweakers al. Uiteindelijk is OpenAI eindverantwoordelijk als een AI-agent iets hackt.
De actie (het hacken) staat echter los van de gevolgen (schuld en verantwoordelijkheid). De actie blijft hetzelfde: een AI-agent heeft een hack uitgevoerd, zonder een directe opdracht daarvoor te hebben gekregen. De achtergrond van die hack is een vervolgvraag.
Marketing, oprechte zorgen of een beetje van beide?
Een ander verwijt, namelijk dat we te veel meegaan in 'de marketing' van OpenAI, is ook te kort door de bocht. Zeker, marketing is een onderdeel van deze hacks. OpenAI (en concurrenten) gebruiken de hacks om aan investeerders en gebruikers te laten zien dat ze beter zijn dan de rest. Maar om deze hacks alleen door die lens te bekijken, is veel te simplistisch.
We schreven eerder bijvoorbeeld al dat er veel ándere redenen zijn waarom AI-bedrijven zelf pleiten voor een rem op ontwikkelingen. Marketing is er daar een van, maar ook concurrentiestrijd speelt mee, net als komende regulering en de economische kaders. Daarbij speelt ook mee dat de ontwikkeling van AI-modellen zó snel gaat dat de bedrijven zelf niet goed begrijpen hoe de modellen werken. Dat blijkt keer op keer op keer, uit onderzoek na onderzoek. Het klopt dat de bedrijven dat ombuigen naar marketingpraat, maar feit blijft dat de AI-modellen zich apart gedragen.
Semantiek
Al die redenen dragen eraan bij dat deze discussie vooral semantisch wordt. Een zin als 'de AI-agent hackt' kun je op veel manieren als fout zien. Filosofisch (een agent kan niets), praktisch (we weten niet wat de exacte prompt was), sociaal of juridisch (je schuift de verantwoordelijkheid af), economisch (bedrijven hebben er baat bij om hun modellen competent neer te zetten) …
De uitspattingen van AI-bedrijven en hun agents worden zo een rorschachtest voor hoe een lezer tegen AI aankijkt. AI kan dan alleen een domme woordvoorspeller zijn of een mensvernietigend doemscenario.
Na veel onderlinge discussie waarin we al die onderwerpen tegen elkaar afwogen, gaf het overleg met de eindredacteuren de doorslag. Hoe we over hackende AI's schrijven, is grotendeels een taalkundig vraagstuk. Dat is niet alleen bij AI zo, maar bij alles.
Ontsnappende apen en ontsporende treinen
Media schrijven bijvoorbeeld ook: 'Aap ontsnapt uit dierentuin'. Je kunt uitvoerig discussiëren over de vraag of dat correct is. Kan een aap ontsnappen? Of laat een dierentuin de aap ontsnappen? Heeft een aap genoeg vrije wil om zelf te kunnen bepalen of hij wil ontsnappen, of is dat alleen dierlijk instinct? Als je zo'n nieuwsbericht leest, stel je die vragen niet.
Ook stel je geen vragen wanneer een trein ontspoort. Dan vraag je je ook niet af of die trein ineens zelfbewust is geworden en of de journalist niet toch bedoelt dat een machinist de trein heeft láten ontsporen. Taaltechnisch weten we wat er bedoeld wordt met dit nieuws.
Inhoudelijk correct
Dat betekent niet dat we de keuze daarmee simpel afschuiven. We moeten ook altijd goed opletten dat we AI niet te veel antropomorfiseren. We moeten altijd de kritische kanttekening blijven plaatsen dat de hacks nooit in een vacuüm bestaan. We plaatsen voortaan ook vaker een kader met context bij berichten over hacks, waarin we verwijzen naar eerdere hacks en de verantwoordelijkheid. Zo houden we afstand: we schrijven begrijpelijk op wat er gebeurd is, maar geven ook context en laten ons zo niet meeslepen in hype.
Uiteraard blijven we dat ook evalueren. De ontwikkelingen rondom AI gaan zo snel, dat ook wij als journalisten daarin de juiste weg en de juiste bewoordingen moeten zoeken. Dat gaat ongetwijfeld weleens fout, net als in de rest van de maatschappij.
/i/2008382390.png?f=imagenormal)
:strip_exif()/i/2008045984.jpeg?f=imagenormal)
:strip_exif()/i/2008203254.jpeg?f=imagenormal)
:strip_icc():strip_exif()/u/63255/crop62861790abf81_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/448966/crop62a741840cd69_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/307279/60x60.jpg?f=community)
:strip_icc():strip_exif()/u/74114/tux_tweakers.jpg?f=community)
:strip_icc():strip_exif()/u/79614/Family-Guy-Victory-is-Ours.jpg?f=community)
:strip_icc():strip_exif()/u/88719/crop624ccd84437db_cropped.jpg?f=community)
/u/45865/crop62338715be02f.png?f=community)
:strip_icc():strip_exif()/u/270072/crop600be8fca1d4a.jpeg?f=community)
:strip_exif()/u/82844/crop5aec235376101.gif?f=community)
:strip_icc():strip_exif()/u/542515/crop5e897e9f76fc2.jpeg?f=community)
:strip_exif()/u/120394/talic.gif?f=community)
:strip_exif()/u/33876/crop5db309f39f3f0_cropped.gif?f=community)
:strip_exif()/u/253657/crop6755bf724a347.gif?f=community)
:strip_exif()/u/69029/crop5cac7b8ae8078.gif?f=community)
/u/233220/crop58c922806f3c4_cropped.png?f=community)
/u/500314/crop641c5e830069a_cropped.png?f=community)
:strip_exif()/u/383551/crop6a9047658bcf1.gif?f=community)
/u/763847/crop57206071c0978_cropped.png?f=community)
/u/161146/crop59d7c7d153cce.png?f=community)
:strip_icc():strip_exif()/u/475850/crop5fbc34b358482_cropped.jpeg?f=community)