GPT-6 Astra speelt Portal zelfstandig uit voor 571,18 dollar aan tokens

Met GPT-6 Astra is het tijdperk van artificial general intelligence (agi) aangebroken, suggereerde OpenAI vorige week. Of dat zo is, is afwachten, maar de AI blijkt in ieder geval goed in één ding: de game Portal. De AI speelde de game helemaal uit. Dat kostte wel een flinke duit: 571,18 dollar aan tokens.

Een gebruiker genaamd Cozyblaze verbond het AI-model met de game, spotte Videocardz. Vervolgens navigeerde GPT-6 zelf door de game en loste het puzzels op.

De agent ontving visuele informatie van de game en voerde via een gekoppelde toolset acties uit. Daarnaast kreeg de agent via de set-up de coördinaten van de speler. Cozyblaze gebruikt verder Astra's nieuwe contextmanagementsysteem. Dat betekent dat de AI ook beslissingen neemt op basis van de beschikbare informatie.

Cozyblaze filmde de gameplay van GPT-6. Dat leverde een video van net geen twee uur op. Dat lijkt een strakke tijd om testkamers te doorlopen en companion cubes te knuffelen, maar het AI-model deed er veel langer over om de game te voltooien. Het spel pauzeerde steeds als het model moest 'nadenken'. Zodra het model weer input verstuurde, ging de game weer verder en voerde hij de instructies uit. Die pauzes zijn uit de video gehaald. In werkelijkheid speelde GPT-6 Portal in krap 24 uur uit.

OpenAI introduceerde GPT-6 Astra vorige week. Het model is sinds zaterdag beschikbaar voor betalende gebruikers. Het bedrijf stelt dat het nieuwe model computers en webbrowsers beter kan bedienen dan zijn voorganger. Verder kan het zelfstandig functionele websites bouwen en 'opgepoetste' documenten, spreadsheets en presentaties maken, aldus OpenAI. Het bedrijf heeft niet bekendgemaakt of het model een sterke voorliefde voor testen heeft.

Door Eveline Meijer

Nieuwsredacteur

07-09-2026 • 15:03

49

Reacties (49)

Sorteer op:

Weergave:

Daarnaast kreeg de agent via de set-up de coördinaten van de speler.
Dus er werd vals gespeeld op het gebied van ruimtelijk inzicht. Het model werd met meer informatie over het spel gevoed als die een normale speler beschikbaar heeft en zou gebruiken om het spel te spelen.

[Reactie gewijzigd door The Zep Man op 7 september 2026 15:08]

Als de AI gevoed wordt met absolute coördinaten is het niet zo spannend inderdaad.
Als je de video bekijkt valt al gauw op dat deze AI niet het level hoeft te bekijken om er achter te komen hoe deze puzzels moet oplossen. Deze schijnt het effect van zaken uit één deel van een kamer op andere delen van de kamer welke hij nog niet gezien heeft al wel te kennen en loopt door de levels heen alsof hij alle puzzels al 100x heeft gedaan en de kamer binnen loopt met de oplossing paraat.

Wat betreft de waarde van die tokens, voor een paar tientjes aan tokens zou ik dit nog best een prestatie vinden. Voor het genoemde bedrag zou ik toch zeker verwachten dat hij het met alleen visuele input en geen voorkennis kan oplossen.
Genoeg mensen die Portal niet uitgespeeld krijgen op die tijd hoor, al zou je ze het dubbele betalen.

[Reactie gewijzigd door Lawyerson op 7 september 2026 23:56]

Portal duurt doorgaans zo'n 10 uur dus 24 is wel erg traag hoor.
Geef ze een walktrough en ze redden het wel, en die zijn online genoeg te vinden.
De video is 2 uur, maar dat is dus zonder de lange denktijden, wat dus 24 uur was.
Het is voor AI inderdaad een andere uitdaging dan voor een nieuwe speler. Maar dat zet je ook weer aan het denken, want misschien is het toch een interessante vergelijking en helpt het om AI beter te begrijpen. Want wat de AI mist aan ruimtelijk inzicht en propbleemoplossend vermogen - waar de mens beter in is - moet het gecompenseert worden met voorkennis en toegang to meer/andere informatie. En dan kan het blijkbaar al aardig meekomen.

Dus een AI hoeft niet per se slimmer te zijn. Als het maar genoeg informatie krijgt en de compute om het te verwerken, zal het van de meeste mensen kunnen winnen.
Als je ChatGPT vraagt over de levels in portal zonder deze op internet op te zoeken dan krijg je gelijk antwoord. Kortom, het zit in het model gebakken
Wat dingen over de inhoud van de levels wellicht. Maar dat moet de agent nog wel vertalen van tekst naar daadwerkelijk de game spelen.
Ik probeerde dit ook uit het originele artikel te halen.
Maar hij lijkt inderdaad met absolute coördinaten te werken van de player en de elementen in de game. Dat is inderdaad wel een beetje vals spelen. Eigenlijk heeft hij dus een soort text versie van de game uitgespeeld, want volgens mij was het beeld dus geen input.

En misschien dat met genoeg tijd AI zelf daar ook wel achter zou kunnen komen; misschien zou het alleen nog veel meer tijd en tokens kosten.
Een mens heeft hier in bepaalde mate ook weer "gevoel" voor wat een LLM niet heeft, dus je zou kunnen stellen dat hij wel een handje hulp mag hebben bij die oriëntatie. Ik vraag me af waar de LLM de coordinaten voor kan gebruiken. Uit de log is daar niet veel duidelijks over te vinden.
Mogelijk dat je hier een verkeerde indruk krijgt.

Uit de bron:
The agent received visual information from the game and could perform actions through the connected toolset. The latest setup also provided the player’s coordinates.
Die "toolset" doet het doorgeven. En wat het doorgeeft zijn coördinaten van Chell, de persoon die je in Portal speelt. Als AI niet weet waar het spel character zich bevindt in-game, dan komt het nergens.

Dus: "player" (spelcharacter) ≠ "gamer" (de persoon met de controller of muis/keyboard)
Fijn dat AI alles kan wat het leven leuk maakt. Kan ik eindelijk meer werken!
Nou inderdaad. Terwijl AI druk aan het schrijven en digitale kunst aan het maken is kan ik de vaatwasser doen en het eten klaarmaken. Zou fijn zijn als dat andersom was 🙃
Ik zag toevallig deze vandaag passeren: https://imgur.com/a/X3UcHbZ

Spot on. Jammer genoeg.
Nee, stop AI in human android body en stuur het naar werk. En je mag verder spelen :P hij zal voor je liegen, dat je ziek in bed ligt ;)
Use internet aan of uit?

Anders zoekt de "AGI" gewoon de bestaande walkthrough op het internet...
Deze modellen bezitten enorm veel kennis (dat is juist hun sterkste kant). Al die kennis van walkthroughs zit gewoon in het model getraind, want het hele internet staat er vol mee.
"zoeken" als in steam hacken om te weten welke game het is en daarna ook nog eens bij valve inbreken om de sourcecode van het leveldesign en de source-engine te stelen.
Uit, de web-search tool was niet beschikbaar gemaakt. Naar de snelheid van het spel zou het best kunnen dat deze ingebouwde kennis heeft, maar dat is niet heel makkelijk te bepalen.

Uit de logs is wel te zien dat er wel daadwerkelijk geredeneerd wordt:
The hatch is still blocked by the dispenser’s body. I’m checking the other two alcoves for a clearer route into the space above the room.

The northern alcove has an open hatch with no dispenser in the way. I’m setting up a launch there, using angled shots so the floor portal fits beneath the opening.

The standing launch reached the northern shaft successfully. I’ll use that timing at the marked southern hatch, then crouch after leaving the floor portal to clear the ledge.

The southern dispenser has retracted, and the marked hatch is now clear. I’m taking the launch through it.

I can see the next room through the hatch. The launch needs a little more height to clear its entrance, so I’m building momentum before the transfer.
Ik heb wel het idee dat hier niet de volledige "gedachten" van de LLM in gelogd zijn, die zijn er wel, maar waarschijnlijk dus niet opgeslagen. Een LLM denkt bij code bijvoorbeeld ontzettend veel na en genereerd veel "gedachten-tekst". Het zou interessant zijn om dat ook te kunnen lezen.

[Reactie gewijzigd door Bouwer21000 op 7 september 2026 22:41]

Die gedachten tekst is vaak mooi in de richting maar niet betrouwbaar. Die is ook maar wat mensen willen horen. Er zijn al genoeg gevallen bekend dat het model intern van alles doet dat de gedachtentekst niet bereikt, of dat de gedachtentekst juist wordt opgeklopt om indrukwekkend over te komen.

De waarheid ligt veel dieper verscholen.
Ergens wel, maar het is net als een mens toch wel relatief transparant. Een LLM redeneert op basis van voorgaande tokens, waarin zijn thinking-tokens. Dus de tool-aanroepen die hij doet worden ook daadwerkelijk beinvloed door die gedachten. Natuurlijk is het wel lastig om de onderliggende relatie tot de trainingsdata en dergelijke te achterhalen.
Maar heeft de AI niet gewoon in zijn "speurtocht" naar de oplossing een online walktrough of playtrough gebruikt?
Uiteraard, want onderdeel van de trainingsdata.
Gezien de hoeveelheid informatie er beschikbaar is portal, vind ik het twijfelachtig om te stellen dat het "speelt" en niet gewoon informatie haalt van het internet om stappen te herhalen die het kan vinden. Dit zou interessanter zijn als dit zou worden uitgevoerd zonder toegang tot die informatie en het is mij niet duidelijk of dit zo was.
Het heeft geen toegang tot websearch, dat staat uitgelegd in de git repository.

We kunnen alleen niet alle achterliggende "gedachten" lezen, dus het is niet geheel te herleiden hoeveel er geredeneerd is en hoevel deze weet over het spel.

[Reactie gewijzigd door Bouwer21000 op 7 september 2026 22:42]

Hoe werkt het schieten van de portals? Het gaat ongelooflijk snel. Bijvoorbeeld op 7:31, als je het vertraagt, schiet het de oranje portal, maar draait het heel snel om en schiet het de blauwe? Of toch niet? Het ging zo snel dat het maar 1 frame duurde. Hetzelfde geldt voor 8:40 (en waarschijnlijk alle andere keren dat het schiet), het schiet de oranje portal recht vooruit, de portal verschijnt rechtsboven op het platform. Bewoog het binnen het frame om te richten en te schieten, en eindigde de animatie daarna normaal?

Edit: Oké, ik heb het net teruggespeeld op 0,25x snelheid, het lijkt erop dat de cursor net trilde toen het gebeurde, dus het gebeurde zo snel dat het niet werd geregistreerd in de rendering of de video.
het kostte $571,18 aan tokens, maar wat waren de werkelijke kosten om dit te doen? Bij vorige frontier modellen lagen de werkelijke kosten ongeveer 4x hoger dan wat de gebruiker betaalde. Niet heel gek dus dat MS zijn plannen voor AI hulp hebben geschrapt op XBOX.
Dat zijn de werkelijke kosten. Ik kan op een abbo van 100 euro met het grootste gemak 20.000 dollar aan tokens verbranden.
Ik vraag me ook af wat de echte-wereld kosten zijn in deze. Hoeveel kWh aan rekenkracht en hoeveel drinkwater dit heeft gekost.
Volgens mij is dat alleen maar speculatie. De daadwerkelijke kosten zijn uiteindelijk moeilijk te berekenen, ook omdat het gaan om investering in de infrastructuur en niet alleen water en stroom.

Bij API-betaling (wat hier volgens mij het geval is) krijg je in de regel hogere prijzen gerekend dan een 20$-abonnement, dus die zullen denk ik in beperkte mate "gesubsidieerd" zijn.
Misschien zou je het The Talos Principle moeten laten spelen en dan zien of de KI voor de test slaagt die in het spel zit ingebouwd voor menselijke intelligentie. Voor welk einde kiest GPT6?
Dus AI 1 (GPT-6) heeft AI 2 (GladOS) verslagen? Krijgt Portal nu een nieuwe eindbaas?
Jeuj. Lekker hoor. Een spel van nog geen 50$ uitspelen voor $570 en er zelf geen enkele lol aan beleven.
Dat was nu juist ook helemaal niet het punt, zie deze reeks aan tweets van de originele auteur: https://x.com/cozyblazex/status/2096383114851533097
And... GPT-6 Astra has autonomously completed Portal! I didn’t expect this to happen so soon, but I’m glad we've made so much progress here.

[...]

There are still many problems to solve, and it's not a proper benchmark per se, but watching a general-purpose agent autonomously navigate, and make it all the way through the game feels like a small glimpse of that original vision becoming real.

Om te kunnen reageren moet je ingelogd zijn