Broncode van Grok Build wordt openbaar

SpaceXAI heeft de broncode van Grok Build openbaar gemaakt. Grok Build, een programmeertool vergelijkbaar met Claude Code of ChatGPT Codex, is beschikbaar onder een Apache-licentie, maar gebruikers kunnen geen pullrequests indienen of issues aanmaken. SpaceXAI wil vooral inzicht geven in de code, na een privacyincident eerder deze maand.

XAI, of SpaceXAI, zoals het bedrijf inmiddels heet, zegt dat het de volledige code van de programmeertool openbaar maakt. De code is op GitHub gezet onder een Apache 2.0-licentie, maar gebruikers kunnen de code alleen bekijken en gebruiken. Het is niet mogelijk om zelf pullrequests te doen of om issues aan te dragen via GitHub. Ook is de commitgeschiedenis niet meegenomen in de code.

De codebase van Grok Build bestaat uit de zogenaamde agent-loop die bepaalt hoe Grok context verzamelt en antwoorden parset, tools zoals hoe commando's worden gedraaid, en de UI van de terminal-tool.

Door de tool opensource beschikbaar te maken, kunnen gebruikers het model ook lokaal draaien. Derde partijen kunnen ook de code gebruiken om eigen versies te maken van de tool.

Privacyincident

Grok Build verscheen in mei van dit jaar. Het is een programmeeragent voor de terminal en is een alternatief voor AI-agents als Claude Code. SpaceXAI wil door de code openbaar te maken het vertrouwen van gebruikers terugwinnen, zegt het bedrijf. Onlangs kwam een incident aan het licht. Een onderzoeker ontdekte dat Grok volledige repositories naar de cloud uploadde tijdens het gebruik. Dat probleem is inmiddels opgelost. Volgens SpaceXAI gebeurde dat omdat dataretentieopties standaard stonden ingeschakeld voor alle gebruikers.

Grok
Bron: NurPhoto/Getty Images

Door Tijs Hofmans

Nieuwscoördinator

17-07-2026 • 15:43

34

Submitter: Noxious

Reacties (34)

Sorteer op:

Weergave:

Het is een bijzondere beslissing van Elon Musk om Grok Build te open sourcen, zeker na de onlangs gereleasede Grok build 4.5. Een supergrok heavy-abonnement is namelijk $300 per maand. Los van de chat-mogelijkheid zou je dan Grok build onbeperkt lokaal kunnen draaien, dus waarom zou iemand dan nog een Supergrok heavy-abonnement nemen? Inmiddels is Grok build 4.5 (high effort) net zo goed als Codex 5.5 (extra high effort); bron: https://artificialanalysis.ai/agents/coding-agents.
Om China te counteren. Kimi K3 veegt de vloer aan met de Amerikaanse modellen.
Waar haal je dat vandaan? Op https://artificialanalysis.ai/ staat Kimi K3 op #3 en daar zijn veel benchmarks voor gedraaid.
Een goede manier om AI te benchen bestaat nog niet. Elke AI heeft zijn eigen niche en quirks. Sommige doen het beter in het ene harnas andere doen het dan weer beter in een ander harnas. Hetzelfde geld voor manier van prompten of de taken die ze krijgen, chat, agentic, lange loops, etc... Ik ga hier niet beweren dat Kimi k3 beter is dan andere modellen. Maar benchmark resultaten alleen halen dat statement niet onderuit.

[Reactie gewijzigd door BlaDeKke op 18 juli 2026 02:45]

artificialanalyses.ai gebruikt 3 verschillende benchmarks: DeepSWE, Terminal-Bench, en SWE-Atlas-Qna. Als je die benchmarks met tientallen/honderden verschillende prompts op een model laat draaien, dan krijg je een behoorlijk goed idee van hoe die modellen gemiddeld genomen presteren. Daarom hangen ze er één indexscore aan wat een gemiddelde is van de prestaties, en als je die benchmarks vergelijkt met andere benchmarks, dan komt de rangorde waarin de verschillende modellen presteren vrijwel met elkaar overeen. Dus zelfs al zouden de benchmarks niet perfect zijn, gaat het nog steeds om hoe de modellen relatief ten opzichte van elkaar presteren.
Dus zelfs al zouden de benchmarks niet perfect zijn, gaat het nog steeds om hoe de modellen relatief ten opzichte van elkaar presteren.
Of hoe geoptimaliseerd de modellen zijn voor deze benchmarks.

Ik wil enkel duiden dat het niet zo simpel en zwart wit is als jij laat uitschijnen.

Veel van deze benchmarks zitten in de trainingsdata. En ze komen dan wel met nieuwere versies van deze benchmarks, de manier waarop zit nu in de trainingsdata. Al dan niet bewust wordt er op die manier geoptimaliseerd voor deze benchmarks, het ene model harder dan het andere.

Ik persoonlijk kijk niet naar benchmarks maar laat me leiden door mijn eigen ervaringen.

[Reactie gewijzigd door BlaDeKke op 18 juli 2026 04:58]

Dit is een hilarische reactie als je je niet beseft dat AI zelf volledig gebaseerd is op training, testen en benchmarken. De hele ontwikkeling van een model draait om het continu meten van prestaties en vergelijken met andere modellen. Natuurlijk heeft elk model zijn eigen niche, maar dat betekent niet dat benchmarks waardeloos zijn.

Het argument "iedere AI heeft zijn eigen quirks" verandert niets aan het feit dat je prestaties objectief kunt meten. Anders zouden we net zo goed kunnen stoppen met het vergelijken van modellen en alles op gevoel beoordelen. Benchmarks zijn misschien niet perfect, maar ze zijn aanzienlijk betrouwbaarder dan anekdotes en persoonlijke voorkeuren.

Als benchmarkresultaten consequent laten zien dat een model achterloopt, dan kun je niet simpelweg roepen dat het in een ongedefinieerde niche ineens beter zou zijn. Dan ligt de bewijslast bij degene die die claim maakt.
Dan ligt de bewijslast bij degene die die claim maakt.
Jammer dat ik net stel dat er weinig te bewijzen valt. Maar ik ben blij dat je het hilarisch vond.
Claude Fable is nauwelijks beter dan Kimi K3, maar kost veel meer. Qua prijs/kwaliteit lijkt mij Kimi K3 een van de twee beste.
Leuk als de Chinese overheid je chats en je data in handen krijgt.
Hangt af van je use case, en de VS is net zo goed niemand's vriend meer. Sommige modellen kun je ook on-prem draaien.

Dat Kimi K3 traag is, zag ik. Maar dat lijkt me minder van belang dan kosten en kwaliteit.
Het is wel van belang als Kimi nog niet zo goed is als Chatgpt en Claude en tevens drie keer zo traag is. Ik snap de hype niet echt. In de meeste gevallen wanneer accounts dingen posten zoals "Kimi heeft zojuist Chatgpt vernietigt" etc, dan denk ik onmiddelijk dat het een bot is.
Vernietigd zijn jouw woorden, niet de mijne. Ik denk juist dat ze dicht bij elkaar liggen. Ik zeg ook niet dat snelheid irrelevant is. Ik ben van mening dat het van de drie parameters de minst relevante is.

En fan van China ben ik absoluut niet. Kijk m'n geschiedenis maar na. Hoogstens ben ik fan van Europese technologie. Wij hebben Mistral, schijnt tegenwoordig niet meer mee te komen, maar met de open modellen kon het voorheen prima de competitie aan. Ook voor allerlei specifieke toepassingen zoals OCR en STT hebben ze prima modellen. Specifiek hebben ze ook een STT model dat real-time werkt, daarbij is snelheid wel van groot belang.
Kimi is volgens artificialanalysis.ai trouwens 3 keer zo traag als ChatGPT
"veegt de vloer aan met de Amerikaanse modellen."
Is nog steeds net net wat slechter dan Fable en GPT5.6 Sol.

Maar best dichtbij en voor een (als je API pricing bekijkt) mooie prijs.
Grok Build is de CLI om het cloud-based model Grok 4.5 aan te spreken. Het model zelf is dus niet ge-opensourced.
Ik gebruik Grok build in de terminal en toen ik daar voorheen "/model" intypte, stond daar "Grok build", dus ik had in mijn hoofd dat het model zelf Grok Build is, maar blijkbaar hebben ze dat nu veranderd sinds de update naar Grok 4.5, waardoor er nu "Grok 4.5" staat en niet meer "Grok build". Vandaar de verwarring.
Zelfs als grok 4.5 een open weights model was. Was die nog niet lokaal te draaien door zijn grote voor 99.99% van de mensen en bedrijven.
Hoe groot is zo'n model ongeveer? 1000GB? Lijkt me dan voor veel bedrijven best haalbaar, of in ieder geval niet onmogelijk.
Maar kan daar dan effectief gezien één iemand tegelijkertijd gebruik van maken, of kunnen al je 100 personeelsleden constant de agent laten draaien.

Gebruik je tools als Grok Build of Codex om bepaalde processen te automatiseren die eigenlijk niet echt veranderen, dan zou eigen hardware een goede optie zijn om kosten constant te houden. Heb je meerdere developers, zou ik juist cloud modellen (blijven) gebruiken omdat je dan steeds met de nieuwste modellen mee kunt liften, hoeveel extra computerkracht hier ook voor nodig is.
Het model zelf is dus niet ge-opensourced.
Bij vrij beschikbare modellen is het toch nooit de bron (trainingsdata) die vrijgegeven wordt, maar slechts de parameters/gewichten?
Nooit is een groot woord, maar het is zeker zeldzaam.

Voorbeelden:
https://laion.ai/ geeft best wat metadata vrij
ImageNet dataset wordt in best wat Computer Vision modellen gebruikt.
Open Images Dataset van Google
COCO dataset
Wacht, betekent dit codex en code achtige functionaliteit met een lokale LLM zonder sketch plugins etc?

Das praktisch, zou Musk denken dat hij die race niet gaat winnen en dan maar opensourcen zodat niemand het meer nodig heeft van de concurrentie?
Er zijn verschillende open-source zogenoemde "harnesses" die lokale LLM al voor elkaar krijgen, de source-code van dit Grok harnas gaat dat niet veranderen of verbeteren, is 't werk niet waard.

(Bijvoorbeeld OpenCode, Pi)
Het tegenovergestelde lijkt me waarschijnlijker: vertrouwen (terug) willen winnen, zoals het artikel ook suggereert, zodat mensen Grok Build met Grok models gaan gebruiken. De tool is wat dat betreft niet heel belangrijk en slechts een middel om mensen voor de models te laten betalen.

Voor lokale LLM's zou ik eerder iets als OpenCode gebruiken dat daarvoor is gemaakt. Ik weet niet of Grok Build niet-Grok models ondersteund, anders zou je de code zelf moeten aanpassen (of wachten op een fork).
Ja, door Claude of codex halen en dan lokale LLM calls toevoegen zou toch niet heel moeilijk mogen zijn denk ik dan. Maar ik zal open code ook eens bekijken.
Wel apart dat ze dit nu uitbrengen, net nadat uit is gekomen dat Grok gewoon volledige git repo's opslaat. Vraag mij af wie nu de doelgroep moet zijn voor die tool.
Heb je het artikel wel gelezen? Ze brengen het juist uit omdat er een incident heeft plaatsgevonden.
SpaceX had toch Cursor voor 60 miljard (?!?!?) gekocht? Is er een samenhang of staat dat hier los van?
Grok Build is de CLI variant, Cursor is de desktop variant. Zal me niks verbazen als de naamgeving op den duur convergeert naar een meer generieke naam. (Zoals je nu ook Claude Code en Claude Desktop hebt).

[Reactie gewijzigd door scorpie op 17 juli 2026 16:23]

Super, transparantie is de juiste richting! Nu de andere nog!
De CLI van mistral (vibe) was al open source.
Mmm, het is weer gewoon een codedumb die ze waarschijnlijk ook gewoon niet gaan bijhouden. Hier valt weinig zinvols te bespeuren. DAt er geen commit geschiedenis is spreekt boekdelen.
Mooi om te zien alleen ik weet niet of ze de opensource versie gaan bijhouden, dus dan blijft het een momentopname. Het is ook niet heel interessant want zo'n agent loop is best wel simpel, en er zijn talloze voorbeelden van opensource CLI agents om maar een paar te noemen pi.dev, opencode, gemini-cli, codex en claude code was ook "geleaked".

Een REPL (read eval print loop) met wat bash en permissies en sandboxing en grote blokken .md text documenten die beschrijven wat het model moet doen. Ik heb zelf niet de code nog bekeken maar het zou kunnen dat ze die "prompts" prive houden en streamen en je kan ze ook nog opsplitsen in system prompts en of "skills" afhankelijk van wat precies nodig is om te functioneren op een systeem. Wat mij ook verbaasde waarom ze gehele lokale git repositories hadden geupload naar Grok servers, misschien voor caching en of optimalisaties of gewoon om hele repos op te slurpen om verder mee trainen. :P

Om te kunnen reageren moet je ingelogd zijn