Claude Opus 5 is uit en presteert zoals Fable 5 voor half de tokenkosten

Anthropic heeft Claude Opus 5 uitgebracht. Het model is volgens de maker op veel vlakken vergelijkbaar met Fable 5, maar het kost half zoveel aan tokens.

Claude Opus 5 is per direct beschikbaar, zegt Anthropic. Het model scoort in benchmarks veel hoger dan het voorgaande model, Opus 4.8. In de meeste benchmarks is Opus 5 vergelijkbaar met Fable 5, zegt Anthropic.

Wel geeft het bedrijf tegen VentureBeat een belangrijke nuancering. Opus 5 doet het vooral heel goed bij taken met een specifieke uitkomst. Benchmarks bevatten vooral zulke vragen, waardoor het model daarop goed scoort. In de praktijk kan Fable 5 waarschijnlijk veel taken beter uitvoeren.

Benchmarks Claude Opus 5
Benchmarks van Claude Opus 5.

Daar staat tegenover dat Opus 5 veel minder kost dan Fable 5. De tokenkosten zijn vergelijkbaar met die van Opus 4.8, zegt Anthropic. Opus 5 kost vijf dollar per miljoen inputtokens en 25 dollar per miljoen outputtokens. Dat betekent dat Opus 5 per token precies half zoveel kost als Fable.

Er komt ook een Fast Mode beschikbaar voor Opus 5. Daarmee is de tool 2,5 keer zo snel. Dat kost twee keer zoveel tokens.

De tokeneconomie wordt steeds belangrijker

AI-bedrijven maken steeds vaker bekend hoeveel hun nieuwe AI-modellen kosten. Een jaar geleden lag de nadruk nog veel meer op prestaties en benchmarkcijfers. AI-bedrijven waren toen vaak vaag over de exacte kosten van de modellen. Maar de economische kant van AI-modellen wordt steeds belangrijker. Steeds meer bedrijven gebruiken AI-modellen in de praktijk, maar de kosten daarvan kunnen snel oplopen. Door verschillende modellen te gebruiken voor specifieke taken kunnen ontwikkelaars en de bedrijven waarvoor ze werken zuiniger omgaan met tokens. Daarom wordt het steeds belangrijker dat gebruikers weten wat de tools hen kosten.

Claude Opus 5

Door Tijs Hofmans

Nieuwscoördinator

24-07-2026 • 21:09

45

Submitter: LordPan

Reacties (45)

Sorteer op:

Weergave:

Wat zijn die tokens eigenlijk?

Moet ik die extra betalen ?
Tokens zijn woorden of delen van woorden of leestekens, getallen etc die omgezet worden naar een geheel getal waarmee de LLM kan werken. Aan het einde worden output tokens weer terug omgezet in tekst.

Je hebt input tokens (prompt, vraag, agentic prompts, afbeeldingen etc) en output tokens, antwoord. Input tokens zijn doorgaans goedkoper dan output tokens. Deze zijn aangegeven met verschillende prijzen met miljoen tokens. Bijvoorbeeld $5/1m input en $25/1m output in het geval van claude opus.

Er zijn 2 verbruiksmodellen: abonnement en credit.

Als je een abonnement hebt betaal je voor een bepaald aantal tokens (meestal niet nader gespecificeerd, kan per provider en over tijd verschillen in hoeverre dit gesubsidieerd wordt, naar gelang de datacenter capaciteit en andere factoren).

Hoe complexer het model hoe sneller je je toelage per tijdslimiet ziet krimpen. In het geval van Claude is er elke 5 uur een limiet en een week limiet. Als je een van de limieten op hebt verbruikt moet je wachten totdat de tijd voorbij is en je verbruikslimited weer gereset wordt (welke maar eerst op is geraakt).

Met een abonnement betaal je dus niet extra voor tokens, tenzij je er zelf voor kiest. Als je abonnement limiet is bereikt kun je dmv pre-paid tokens kopen die niet gesubsidieerd zijn en dus veel duurder (de $5/1m input en $25/1m output).

Context is alle tokens die momenteel in een sessie actief zijn, input en output tokens, zeg maar de hele conversatie. Dit kan met programmeren of grote stukken tekst snel oplopen.

Je moet daarom letten op je context verbruik: 1m tokens context max, maar bij 150K context verbruik geldt een hoger tarief of gaat je abbo sneller op. Context vergt duur geheugen, en zoals je weet is geheugen veel duurder momenteel. Zit je context vol dan start je een nieuwe sessie en is de LLM alles vergeten, tenzij je het opslaat in een bestand, meestal een samenvatting of een nieuwe selectie van tekst uit meerdere bestanden voor vervolg vragen/verwerking/programmeer opdracht.

De mate van subsidie wordt momenteel geschat dat je voor 't $200 max plan ongeveer $5000 aan tokens krijgt. Daar draaien ze verlies op. Ze maken wel winst op pre-paid credits, meestal bij commercieel gebruik.
Het werkt erg goed om zo tussen de 120k en 150k Fable of Opus een "continuation prompt" te laten genereren die je dan als bestand aan je eerste prompt van een nieuwe conversatie toe kan voegen en de opdracht "continue" geeft.
Hele kleine nit hier die wellicht voor andere lezers illustratief is, waar het token inderdaad een getal is, is hetgene waar de LLM mee werkt normaal gesproken naar mijn weten een vector die opgezocht wordt op basis van het token.

Dit is een vector met een zeer groot aantal dimensies die als het ware de 'betekenis' van het token op een wiskundige manier vertegenwoordigen.
Heb je voor dat laatste een bron? Ben benieuwd.
Heb je voor dat laatste een bron? Ben benieuwd.
Bron of niet, heel er zal hij er niet van af zitten. 1 complexe taak met opus heeft mij ooit bijna 40 euro gekost, terwijl het ongeveer anderhalf keer mijn 5 uurse limiet was bij een x5 abonnement. Losse tokens kopen is echt ontiegelijk duur. Er is ook een reden waarom je de API niet mag gebruiken als je een abonnement hebt. De API is enkel als je met credits werkt en deze kosten lopen heel erg snel hard op.
Wat hij zegt klopt. Bij Github kon ik laatst het werkelijke verbruik van mijn abonnement zien en dat was een schrikbarend gat. Github heeft ook hun hele abonnementsstructuur omgezet en is peperduur geworden.
Een token is ongeveer gelijk aan een woord in een zin. (In het echt ligt het wat complexer en genuanceerder)

De kosten per token zijn dus als het ware hoeveel moeite het kost om een bepaalde input (de prompt die je stuurt plus alle context die de software mee stuurt, zoals bestaande projectcode en web search etc etc) te verwerken, en vervolgens een kostenplaatje voor de output (daadwerkelijke uitkomst van de opdracht) per token ("woord")
Dat ligt aan wat voor een abonnement je hebt afgesloten bij Antropic. Als je een Pro of Max abonnement hebt dan zit daar al een bepaalde hoeveelheid aan "tokens" in .. en die kan je verbruiken binnen de verschillende limieten die er zijn (tijdsblokken van 5 uur .. en maximum per week). Maar omdat je een abonnement hebt .. krijg je effectief meer tokens voor je geld.

Je kan ook een API toegang nemen .. en daarmee betaal je gewoon voor elke gebruikte input en output tokens.

En een "token" is een woord, of een lettergreep of "iets" wat door een LLM model vertaald kan worden naar een "getal" .. wat dan weer gebruikt kan worden om te bepalen welke getallen logischerwijs bij elkaar horen op basis van de de voorgaande getallen. (Okee... Wel heel simpel gezegd, maar je betaalt dus per woord/lettergreep )
Ik volg dat ook niet altijd; volgens mij is het een virtuele munt die je betaald aan de AI dienstverlener.
De waarde van de tokens, en resultaten, wisselt per aanbieder. En ook de lengte, complexiteit van prompt speelt mee. En soms is een klein maar complex antwoord, duurder dan uitgebreide code analyse.
Schiet mij maar lek :+ draai sinds kort lokaal een AI model. Niet snel, maar voorlopig wel goed genoeg
Achter de schermen worden heel veel tokens gegenereerd (thinking) die je wel betaald maar niet krijgt. Dus het is zowiezo behoorlijk schimmig allemaal.
Dat is niet schimmig, je rekent met tokens het werk van de ai af. Daar valt het interne denk werk ook onder.

Niet anders dan bij een mens overigens. Daar krijg je ook alleen de output aan het einde van een denkproces.
Komt volgens mij vooral vanwege het verschil tussen een model en de applicatie eromheen.

Het makkelijkste voorbeeld is het zoeken. Je stuurt een prompt. Een LLM gebruikt jouw prompt om output te genereren in de vorm van zoek opdrachten. De resultaten worden weer in een LLM gestopt om te bepalen of de zoekopdracht voldoende info heeft opgeleverd. Zo ja, dan genereert de LLM een antwoord. Zo niet dan genereert het LLM weer een zoekopdracht. Zo kan het loopje blijven gaan. Jij stelt een korte vraag maar de hoeveelheid tekst dat het model moet verwerken groeit met elke zoekopdracht enorm.

Voor code is het simpeler. Voor code heeft het model vaak geen additionele informatie nodig en is het puur het verwerken van je prompt. Daar is het visueel heel zichtbaar want het is beperkt tot jou input en de output van het model zonder al teveel magie op de achtergrond
edit:
Als je een model lokaal draait is dat heel zichtbaar. Stel een relatief oud model bijvoorbeeld de vraag wie de burgermeester is van Rotterdam. Je krijgt vaak Aboutaleb als antwoord. Geef je model daarna bijv DuckDuckGo als tool. of een webscraper voor Wikipedia. En je krijgt ineens altijd het juiste antwoord. Dat is niet omdat je model ineens veel slimmer is geworden. Nee, de resultaten van DuckDuckGo worden gewoon toegevoegd aan je input prompt waardoor het model het juiste antwoord al in de input krijgt meegestuurd. Niks schimmige aan...

[Reactie gewijzigd door Mellow Jack op 24 juli 2026 23:54]

Iets wat mensen per direct mee moeten stoppen met het kopen ervan als ze die bubbel eindelijk willen laten barsten
bedrijven* en dat gaat niet gebeuren
Het laten barsten van een bubbel is geen doel op zich.

En, tsja, bij het bedrijf waar ik werk hebben we recent een hulpbotje gebouwd, die 2 a 3 euro per dag kost, maar je ook soms wel een uur of 2 a 3 aan uitpluiswerk scheelt (het helpt hoofdzakelijk met log-analyse)...

De maandkosten van dat ding liggen daarmee onder het uurtarief van een beetje competente IT'er, en het scheelt ons team in totaal richting een kwart FTE aan (uitzoek)werk. (Ook al niet het leukste klusje)

Dat is een blijvertje!

(huidige) AI gaat dus niemand van mijn team vervangen, maar is wel druk op weg om een onmisbaar hulpmiddel te zijn, met name bij troubleshooting.

Oftewel, die bubbel is niet alleen maar lucht!

[Reactie gewijzigd door Keypunchie op 24 juli 2026 23:00]

Dat lijkt mij dan ook een veel nuttigere toepassing dan meer dan 100k aan tokens verbranden in een loop om een volledig vibe coded app te maken.
Of ook: python voorbeeld algoritme en dan functie omzetten naar julia—>40x sneller
Er is naar mijn mening ook wel een verschil tussen vibe coden met kennis en zonder kennis. Ik heb bijv. een hekel aan front end (bijv JavaScript). De ene keer ga ik redelijk gericht te werk en stuur ik het model continue inhoudelijk bij. De andere keer merk ik dat het neerkomt op trial & error. Als je het model inhoudelijk kan bijsturen werkt het vrij goed en heb je niet zoveel nodig. Trial & error is daarentegen echt vaak een verspilling van compute
Die kun je gebruiken op de kermis. Maar alleen op piekerdag, niet op andere dagen.
Wat zijn die tokens eigenlijk?
De gegeven antwoorden zijn misschien onnodig complex.

Een vraag deel je op in brokjes, die gaan in een zwarte doos, en dan komen er weer brokjes (antwoord) uit. Dat zijn input-tokens en output-tokens. Grofweg zou je kunnen spreken van lettergrepen, maar bijvoorbeeld ook leestekens of emoji.

De vraagbrokjes (of input-tokens) worden in parallel verwerkt en daarom zijn ze goedkoop. Maar de antwoordbrokjes (of output-tokens) komen er in serie uit, dus daarom zijn ze duur.

Je kunt economisch gezien dus beter een gedetailleerde vraag stellen en vragen om een kort antwoord. Je hebt er alleen mee te maken als je AI via een API wilt integreren met je software, anders is een abonnement waarschijnlijk de beste value for money.
Computerphile heeft een leuke video over wat tokens zijn. En waarom je zo snel zo veel gebruikt.
Wat voor mij alleen maar aangeeft dat ze een beetje in paniek zijn. GPT-5.6 komt uit een ineens zijn alle limieten gereset... en "gratis" Fable credits... en nu een zuiniger optie!

Ontlopen die modellen elkaar inmiddels nog echt wel? De één iets beter in beredeneren, de ander in code, een ander in plaatjes. Het wordt belangrijker om snel te kunnen schakelen tussen modellen dan om "de beste" te vinden. Daar gaat het te snel voor.
Tja, het aantal Codex-gebruikers is sinds de release van Gpt 5.6 in een week van 6 miljoen naar 10 miljoen gegaan. Sol heeft vergelijkbare prestaties als Fable, maar is drie keer goedkoper, dus Anthropic moest wel wat doen, want met Opus 4.8 konden ze de boot niet trekken, en niet iedereen wil gelijk €100 of €200 per maand betalen voor een abonnement om Fable te kunnen gebruiken.

En daarnaast heeft OpenAI die irritante 5-uurslimiet verwijderd en voeren ze regelmatig resets uit (bij elke miljoen nieuwe gebruikers sinds de release van 5.6 tot nu toe) en soms ook banked resets, waarbij je zelf kunt bepalen wanneer je reset. Dus als je dan moet kiezen tussen Codex of Claude code, dan is de keuze snel gemaakt voor de meeste mensen.

[Reactie gewijzigd door Dynamix86 op 24 juli 2026 21:58]

Ik werk al een tijdje gelijktijdig met claude code and openai codex. Met codex krijg ik meer voor elkaar, echter wel meer babysitten, terwijl met claude die gewoon veel beter zelf aan de slag kan en zelf ook bugs vind. Maar die verdraaide 5 uur limit. aaargh
Ik heb zelf ook Claude Code, en sinds kort ook Codex, en wat mij opvalt is dat Codex zelfs met Sol echt veel dommere dingen doet. De benchmarks zijn misschien goed, maar als je ziet hoe het dan soms tot een werkende oplossing komt... Dat is vaak echt extreem kortzichtig en dom.Daar vind ik Claude Opus 4.8 toch in mijn ogen een stuk sterker. Die begaat ook af en toe wel flaters, maar veel minder groot dan ik via Codex zag.

Ik gebruik dus gewoon mijn Claude tot de 5 uur limiet op is (die 5 uur kan je trouwens zelf starten. Stuur een goedemorgen om 7u voor je naar het werk vertrekt en tegen de middag zit je aan de reset, kan je na de lunch aan de volgende batch beginnen). En pas als ik bij Claude aan de limiet zit ga ik verder met Codex.

Ben dus heel benieuwd om volgende week Opus 5 te proberen.
Mwah, het is vooral de ingebouwde 'reasoning' die in een cirkeltje met zichzelf tokens verstookt die soms een stapje beter wordt, en de tooling eromheen die ook is ingetrained (dus wanneer tools moeten worden aangeroepen en hoe), maar de kern van de modellen is nog altijd gebaseerd op ruis en is niet zo gek veel beter geworden, vooral veel groter.
Het lijkt erop dat de llms wel een beetje aan het einde komen van wat haalbaar is. Je ziet dat anthropic en openai aan het huilie doen zijn bij Trump dat Chinese modellen gevaarlijk zijn en dat open modellen hetzelfde is als nuclear materiaal uitdelen (en dat voor een bedrijf als openai). Ze zijn op weg de politiek voor hun karretje te spannen om zo een monopoliepositie op de markt te krijgen (en dat is vrij normaal in de usa waar kapitalisme en vrije marktdenken snel wijken als het ze uitkomt).
Iemand Opus 5 al geprobeerd, en is het echt zo dat het minder kost? Op de een of andere manier was Fable 5 bij mij best oke en niet heel slurpend gek genoeg..
Ik had dus exact dezelfde ervaring, terwijl mijn collega het tegenovergestelde had. Ik vermoed dat er of een bug in zit (zat?), of dat ze wellicht experimenteren tussen verschillende users. Mijn collega en ik doen ongeveer het zelfde, en ik loop vrijwel niet tegen limieten aan, en hij binnen het uur.
Ja, die lijken vrijwel hetzelfde.

Ik vroeg om een oude patch the importeren en dat werd geblocked omdat er api calls in zitten die met hacking geassocieerd werden.

Automatisch gedowngrade van fable naar opus 5, en van opus 5 naar 4.8
Bij mij slurpte fable 5 echt wel substantieel meer. Vooral met meer research taken of grotere opdrachten.
Ik had het idee dat fable 5 stuk minder goed presteerde dan opus 4.8 in claude code.
Weinig meerwaarde nu dan om Fable te gebruiken.

Ik ben benieuwd of dezelfde guardrails zijn ingesteld op Opus als dat ze bij Fable hebben gedaan voor biological en hacking topics waar een fallback werd uitgevoerd.
Nee, maar het model is daar specifiek niet (zo goed) op getraind, waardoor dat dus blijkbaar niet hoef.
Iedere keer als Anthropic een model dat beter dan de top tier model was, kwam er een nieuwe nog betere. Dus binnenkort Fable 6?
Anthropic paar dagen geleden: hier heb je gratis $100 aan Fable - nice!

Anthropic nu: hier heb je standaard iets dat net zo goed is - nice?
Hier heb je een stad in Frankrijk - nice? :+
Hier heb je een jonge knappe lerares die - nice?
Zeggen we 'half iets' in een titel als die van dit artikel als we de helft van iets bedoelen in het Nederlands? Of is dit een anglicisme (half the token cost)? Men kan namelijk wel een half brood zeggen. Of de halve kosten. Maar 'half de kosten', klinkt gewoon niet goed?

(Indien de titel wordt aangepast, hij was 'Claude Opus 5 is uit en presteert zoals Fable 5 voor half de tokenkosten'.)

[Reactie gewijzigd door erikieperikie op 24 juli 2026 22:55]

Claude Opus 5 is uit en presteert zoals Fable 5 voor half de tokenkosten
Bovenstaande gaat over euros die je nodig hebt om prestatie X te realiseren.

Onderstaande gaat over het aantal tokens dat nodig is om prestatie X te realiseren.
Anthropic heeft Claude Opus 5 uitgebracht. Het model is volgens de maker op veel vlakken vergelijkbaar met Fable 5, maar het kost half zoveel aan tokens.
Deze twee zijn niet met elkaar te vergelijken tot de prijsverschillen tussen input en output tokens erbij vermeld worden.

Onder de tabel wordt nog wat extra informtie over de kosten gegeven, maar het laat zich lezen als een VWO Wiskune-A examenopgave:
Daar staat tegenover dat Opus 5 veel minder kost dan Fable 5. De tokenkosten zijn vergelijkbaar met die van Opus 4.8, zegt Anthropic. Opus 5 kost vijf dollar per miljoen inputtokens en 25 dollar per miljoen outputtokens. Dat betekent dat Opus 5 per token precies half zoveel kost als Fable.

Er komt ook een Fast Mode beschikbaar voor Opus 5. Daarmee is de tool 2,5 keer zo snel. Dat kost twee keer zoveel tokens.

[Reactie gewijzigd door Recursio op 24 juli 2026 22:08]

Ik zie nooit Gemini in een vergelijking. Is die dan zoveel slechter?
Google loopt momenteel wel licht achter met hun modellen. Ze staan al een tijdje niet meer in de top10 beste modellen.
Misschien ligt het aan mij maar al die modellen vind ik echt heel verwarrend. Maak het wat overzichtelijker en minder complex.
Ik moet voor het eerst wat met een AI agent gaan doen, maar snap er echt de ballen niet van. Heb via een premium Perplexity abonnement een design laten schrijven, maar als ik zo kijk naar uit de uitleg over tokens gaat die me HEEL veel kosten. Dat is echt een document van meerdere pagina's die omschrijft wat en hoe het er moet komen. Zo te zien red ik het dan niet met een 1 persoon abbo op een van de goedkopere modellen.

Om te kunnen reageren moet je ingelogd zijn