Anthropic: Claude Fable 5.1 kost gemiddeld kwart minder door lagere cachekosten

De AI-programmeertool Claude Fable kost volgens Anthropic met versie 5.1 ongeveer 25 procent minder dan versie 5. Dat komt omdat de kosten van cachegebruik dalen. Volgens de AI-maker zijn de prestaties van het nieuwe model ook aanzienlijk verbeterd. Claude Fable 5.1 en het niet-openbare Mythos 5.1 zijn nu beschikbaar.

Anthropic Fable

Uit metingen van Anthropic zelf blijkt dat vooral de nauwkeurigheid bij het gebruik van agents sterk verbetert. Zo zouden agents wetenschappelijk onderzoek tot twee keer zo goed uitvoeren en tot een kwart beter programmeren.

Tegelijkertijd nemen de verwachte kosten van het model af doordat de prijs voor cachegebruik daalt. Het programmeermodel gebruikt cachegeheugen om eerder verwerkte context opnieuw te benutten. Tot dusver bestond veertig procent van de 'workload' van Claude Fable uit cachegebruik. Bij gemiddeld gebruik daalt dat aandeel naar zo'n vijftien procent.

De prijs voor het daadwerkelijke gebruik van Claude Fable blijft hetzelfde, namelijk 10 dollar per miljoen inputtokens en 50 dollar per miljoen outputtokens.

Claude Fable is een afgekaderde versie van het krachtige Mythos

Anthropic Claude Fable 5 is een variant van het krachtige Mythos-model. Deze programmeertool is zo goed in het vinden van beveiligingslekken, dat deze ook ontzettend goed is in het vinden van exploits. Daarom werd Mythos voor een zeer select publiek uitgebracht. Fable is de publiek beschikbare versie met verder aangescherpte veiligheidsmaatregelen.

Door Yannick Spinner

Redacteur

02-09-2026 • 11:15

52

Submitter: protected22

Reacties (52)

Sorteer op:

Weergave:

Volgens de AA benchmarks is de kostprijs bijna 4x zo duur is als Sol max, en 17% duurder op dan Fable 5 Max, ondanks de verlaagde cachekosten.


https://artificialanalysis.ai/articles/claude-fable-5-1
Ik zit op het Max plan en blaas met 5.1 duidelijk sneller door mijn 5-uurs limiet heen dan met 5.0. Mijn ervaring tot dusver is dat 5.1 zeker niet goedkoper is. Ik gebruik hem nu met de effort lager (doorgaans Medium) en dat maakt het wat beter behapbaar. Mijn toepassing is C# programmeren binnen een Unity omgeving.

[Reactie gewijzigd door Rynji op 2 september 2026 12:11]

Ik denk dat het ook een kwestie is van het juiste model voor de vraag kiezen. Ik doe ook veel in C# en vaak is Sonnet met een iets hogere effort al meer dan voldoende. Sterker zo nu en dan schroef ik het model terug omdat een fable te graag dingen wil fixen die eigenlijk niet zo relevant zijn.
Gewoon in de prompt zeggen dat het zelf moet kijken welke delen van de opdracht door een goedkopere sub-agent uitgevoerd kan worden. Dan maakt Fable de prompt en start het een zelfstandige sub-agent met bijvoorbeeld Haiku of Sonnet. Dat scheelt al veel tokens voor simpele sub taken.
Exact dat laatste fable gaat op allerlij sidequests waar ik helemaal niet om Vraag en dat maakt pr’s te rommelig.
ik ben als hobbyist ook een game aan het maken via claude.
Sowieso dat ik hier enige backlash voor krijg maar ik heb gewoon geen developer skills, mijn IT kennis zit in andere gebieden.
Echter gebruik ik sonnet voor de coderen.

Ik benader mijn agents dan ook als een soort van werknemer
Programer: Sonnet
RTS Architect: OPUS
MCP Operator: Sonnet
3D Artist: OPUS
Creative Director: Fable
Librarian: Sonnet
Media operator: Opus
Studio Advisor: Fable
De totale kosten van een relatief complexe prompt zijn alsnog vrij hoog. Ik heb een poging gedaan om een website met wat pagina's te genereren maar, mijn budget op openrouter was niet toereikend. Ik begrijp ook van content creators dat de prijs voor een dergelijke prompt vaak al hoger is dan 15 EUR.

Het is best moeilijk om te begrijpen wat de relatie is tussen input/output/cache tokens en dat wat je uiteindelijk aan het model vraagt.
Maar goed, voor 15 euro huur je ook geen Indiër meer in op Fiverr. Die Indiër levert dan wel nog altijd beter werk dan de slop die er uit een LLM komt, maar als je het resultaat van een LLM prima vindt is 15 euro niks.
Vervolgens gebruik die Indiër weer een LLM en doet zichzelf 5x per uur verhuren ;)
Ja precies dit, fiverr is 90% ai prompting in huur
Ja die Indiërs doen niets meer zelf op Fiverr hoor. Zelfs als je expliciet vraagt of het zonder AI gedaan kan worden. Echt veel wordt tegenwoordig met AI gedaan op fiverr. Of je nou een 3d render wil (je krijgt uiteindelijk gewoon een imagegen afbeelding) of een Figma design, tot code.

In die zin vervangen de LLM's wat Fiverr eigenlijk was voor mijn gevoel.
Waarom zou je het niet zelf doen?

Mijn eigen ervaring is dat ik zelf meer dan een factor 10 productiever ben dan een Indiër. Daarbij ook veel betere kwaliteit lever. Inderdaad de kwaliteit die LLMs leveren is vaak dramatisch, tenzij je heel precies formuleert (Dus ook vanzelfsprekendheden als good practices benoemd) wat het moet creëren. Maar zelfs dan is de kwaliteit soms ondermaats. Daarbij kost dut vaak net zoveel tijd of meer dan het compleet zelf doen.
Mijn punt was dat als je een LLM zo'n prompt helemaal uit zichzelf laat uitvoeren en accepteert dat de kwaliteit ruk is dat je niet echt kunt klagen over die 15 euro. Daar kun je geen Indiër voor inhuren die het met nét iets betere kwaliteit oplevert (zeg maar absolute minimum, waarbij LLM's een flink stuk ónder het minimum zitten).

Mijn voorkeur gaat ook uit naar zelf doen, met of zonder AI tooling, maar dat was niet de vergelijking die hier speelde.
Rule of thumb is dat je liever meer input tokens geeft (duidelijke prompt met verifieerbare doelen, veel voorkauwen), om minder output tokens te generen (minder reasoning nodig, sneller betere output).
Cache tokens via VS code extension / claude desktop / CLI zijn sessie gebaseerd en tot 1 uur actief.
Cache via API, is per sessie (dus als je die niet meer stuurt heb je 0 cache) en dan ook nog eens maar 5 minuten actief.

Maar hoeveel impact cache kan hebben, met mijn Pro subscription (a $20,-) haal ik ongeveer $1200,- uit cached tokens VS normale API kosten. En dat is dan met Sonnet / Opus gebruik en niet eens elke week het volledige weekly limit gebruikt.
Deze week is gisteravond weekly limit gereset (normaal vrijdag avond) dus zal nu meer gebruiken dan normaal.
Het model is stevig aan de prijs. Maar de resultaten zijn geweldig. Beste wat ik heb gezien. En ik heb ze zo ongeveer allemaal. Dingen die veel context nodig hebben en begrip zoals reverse engineering leveren een veel vlugger, veel beter resultaat dan de andere AI's

En ja local dos assembly reversen doet hij ondanks de guards prima

Ik kan het ook met de kleinere modellen doen, maar 3 keer bijsturen is net zo duur als 1 duurdere vraag.
Niet dat max effort echt representatief is. Da's vergelijkbaar met het brandstofverbruik meten op de topsnelheid, voor het meeste werk is het niet nodig en erg inefficiënt. Op medium effort is Fable 5.1 vrij competitief qua prijs/prestaties. Zeker voor agentic coding-tasks waar je te maken hebt met heel veel tool calls en daarmee cache reads.

[Reactie gewijzigd door Bouwer21000 op 2 september 2026 14:25]

Komt goed uit want Anthropic gaat de "bonus" limieten binnenkort 25% verlagen
Fable werd sowieso al niet binnen de limieten van een reguliere Teams Seat bekostigd, maar was "pay-as-you-go".

Dit nog even afgezien van de data retention problemen... (dat gaan ze dan wel oplossen met dat je zelf de "safety logs" kan bewaren, maar ik heb zo het vermoeden dat die oplossing alleen voor Enterprise gaat gelden).
Fable zit standaard bij de Premium versie van de teams abbonementen en alleen extra verbruik is pay as you go. Je hebt wel een aparte week limiet voor Fable los van alle andere modellen.
Laat ik nou net geen premium hebben :D

Aan het einde van de week heb ik altijd nog wat limiet over. Die zet ik dan vaak in voor prive-vibe-coding... vind mijn werkgever geen probleem. Maar als ik kosten ga maken voor mijn "hoeveel-augurken-zijn-er-in-de-koelkast"-tracker, denk ik dat die er wel wat van gaat zeggen.

[Reactie gewijzigd door Keypunchie op 2 september 2026 11:43]

Wij hebben meestal zo'n 90% van de maximale tokens op einde week (heb even de stats bekeken) heel af en toe moeten we betalen voor gebruik wanneer we op specifieke dagen dingen af willen krijgen.
enig idee hoe dit gaat zijn als de werkelijke kostprijs betaalt moet worden? Want alle AI-bedrijven maken nu grandioos verlies op hun tokens. Stel dat het 4x zo duur wordt, enig idee of die waarde er voor jullie dan in zit op ben je dan gewoon op dinsdagochtend door je budget voor de week heen en ga je verder zonder LLM?
Goede vraag keer 4 zou nog lukken daarboven zeker niet meer. Dan zouden we de AI nog specifieker gaan inzetten voor waar de waarde het hoogste is, daarnaast verwacht ik dat we uiteindelijk als de techniek wat verder en goedkoper is gaan overschakelen op lokale modellen. De hardware daarvoor is nu nog te duur en combinatie met de verwachte besparing. Maar bij x vier bereik je dat punt sneller.


Daarnaast hebben we heel bewust nergens in onze primaire dagelijkse procedures AI in gebruik.
Wat doen we wel buiten coden.
  1. Eenmalig stappen plannen genereren om vragen te beantwoorden van gebruikers.
  2. Analyse van tickets.

    Dus als er geen AI is dan gaat het coden wat langzamer maar de klant merkt er verder op dagelijkse basis weinig van.
Niet los van de andere modellen. Als je week limiet bereikt is, heb je ook geen fable meer. De globale week limiet is voor alles
Maar daar zijn ze toen weer op teruggekomen en toen zat het juist wel in het abbonement. Wel had ik na je limieten pay-as-you-go aanstaan en dat kostte flink wat.
Is Fable praktisch te gebruiken? Ik werd zo vaak terug gegooid naar een ander model dat ik eigenlijk een heel tevreden gebruiker van Opus 5.0 ben. Wat ik niet begrijp, vertaalt 25% minder gebruik zich ook naar 25% minder token verbruik. Of merk ik hier als gebruiker niet zo veel van? (behalve een minder aangetast geweten door het verminderde gebruik van AI en de druk op water en energie)
Fable is zeker praktisch te gebruiken. Hoe beter de code base geschikt is voor AI Agents hoe beter hij het doet. Wat ons vooral opvalt is dat Fable vaak voor dezelfde taken wat sneller is.

En beter werk levert bij architectuur keuzes hoewel nog steeds niet heel goed.
Volgens mij stoelt Anthropic in belangrijke mate op de koppeling tussen de modellen en Claude Code: Mensen gebruiken de Anthropic Modellen omdat Claude Code daaraan gekoppeld is. Hoe goed de modellen zijn, lijkt een minder grote overweging te zijn.

Gegeven de toenemende concurrentie met bijv. Opencode en Deepseek Harness lijkt mij dat de prijs van de modellen wel omlaag zal moeten: Claude is te duur in vergelijking met de concurrentie en het is maar de vraag of de modellen van Anthropic beter zijn, ook wat kwaliteit betreft is zit de concurrentie Anthropic op de hielen.
Eigenlijk is Google heel genereus - als je een gratis account maakt op aistudio.google.com kun je haast onbeperkt doorwerken op heel veel van hun modellen. Je kunt wel tegen het maximum aanlopen, maar dan moet je wel heel goed je best doen.
(Momenteel is `Flash latest` de beste keuze voor veel zaken, omdat `Pro` nog steeds op 3.1 staat, tegen Flash op 3.7, en je Flash kunt zeggen lang na te denken, waardoor het min of meer als Pro werkt.)

Het is moeilijk iets vergelijkbaars bij andere aanbieders te vinden - zeker als je een 1M token context window wilt. Ik probeer het met de Jan Arend-serie, maar andere systemen, ondanks hun beloften van slim omgaan met kleinere context windows, missen heel wat van wat er werkelijk gebeurt in die kronieken.
interessant, kun je die google modellen ook gebruiken op een coding projectje (via Cursor of Claude Code achtige omgeving), of alleen binnen die ai studio?

[Reactie gewijzigd door Menesis op 2 september 2026 12:35]

Ria Matsijs gebruikte het om Coq-bewijzen te debuggen, en Gemini schijnt vrij goed te zijn in Python coderen.

Je kunt het via een API en een sleutel ook op je eigen computer draaien, maar daar weet ik verder niets van.
Uit interesse: wat doe je dan precies met die LLM's en de Jan Arend-serie?
3.7 Flash is überhaupt in alle aspecten vele malen beter dan 3.1 Pro, dat model is inmiddels nogal verouderd.
Bullsh*t. 99% cache hit en ben al door mn Max 20 weekly usage heen voor Fable.


Zelfde workload onder OAI Pro Max met Sol 5.6 xhigh ging twee dagen mee.
Bullsh*t. 99% cache hit en ben al door mn Max 20 weekly usage heen voor Fable.


Zelfde workload onder OAI Pro Max met Sol 5.6 xhigh ging twee dagen mee.
Ik vind het vrij knap wat je doet. Ik heb ook een Max 20 maar kom ondanks zwaar gebruik zelden tegen mijn limieten aan. Wat je misschien vergeet is dat de effort niet altijd op high of max hoeft om reguliere of iets complexere taken correct uit te laten voeren.

Ik zet hem doorgaans altijd op low of medium, en alleen complexe zaken op max. Maar het verschil in resultaat is niet zo groot.

Bij Opus heb ik het standaard wel op max staan omdat het anders echt zaken overslaat en vergeet, al gaat het sinds opus 5 al een heel stuk beter moet ik zeggen.
Dank voor de hint maar nee, daar heb ik niks vergeten. Mijn setup draait vrij zwaar op vele subagents die paralel werken. En dan ook een paar projecten naast elkaar.
De laatste dagen gingen de credits bij codex ook snel op. De aanname is dat er minder cache hits zijn en minder performance omdat ze Astra aan het testen/uitrollen zijn. De verwachting is een dezer dagen..
Ik werk vooralsnog met Codex Sol Ultra, maar ben in sommige gevallen (scope drift, eindeloos reruns doen, etc) niet echt tevreden.

Hoe verhoudt Claude zich tot Codex? Iemand die ervaring heeft? Beter, slechter, zelfde?
Heb zelf wat vibe coded apps draaien voor eigen gebruik, gemaakt door Codex en verbeterd door Claude. Claude heeft er best wel wat bugs uitgehaald door enkel de source code te lezen.

Sindsdien gebruik ik eigenlijk voornamelijk Claude.

Code inhoudelijk kan ik het niet beoordelen, ben zelf niet een developer. Juist daarom gebruik ik het enkel voor interne/hobby achtige dingen. Niet iets wat aan het internet gekoppeld is in ieder geval.

[Reactie gewijzigd door Zackito op 2 september 2026 12:43]

Als je het andersoms doet krijg je hetzelfde. Haha. Het schrijven van code is voor modellen wat moeilijker dan het bekritiseren van code door anderen geschreven.

Ben hier van Claude afgestapt, maar voornamelijk omdat ik z'n "you're right about half of it and its the half that matters" antwoorden me de neusgaten uitkomen, welke maar terug blijven komen na een tijdje ook al heb je een AGENTS.md file / voice ingesteld die zegt dat ie dat niet moet doen.

[Reactie gewijzigd door ZpAz op 2 september 2026 13:24]

Ik ben een kleine 3 kwart jaar geleden van Codex naar Claude gegaan omdat Codex toch keer op keer in een soort loop bleef hangen als je toch bugs had. Claude heeft die tijd ook gehad, maar sinds Opus 4.8 ongeveer is dat echt wel voorbij. En zeker met Fable gaat het echt perfect. Ik heb een complex en erg groot systeem.

Ik weet overigens niet hoe vandaag de dag codex functioneert, maar gezien claude voor mij al nagenoeg perfect werkt heb ik ook geen behoefte te willen migreren.
scope drift
Ik zou dan aanraden om de effort lager te zetten. Als je 'm op Ultra zet gaat ie met liefde langer door dan nodig is.

In mijn ervaring zijn de modellen van Claude en GPT niet heel veel anders. De harnasses heb ik geen ervaring mee, maar ik stel me zo voor dat het weinig uitmaakt.
Dank voor de tip. Hopelijk is de kwaliteit dan wel even goed
Tot dusver bestond veertig procent van de 'workload' van Claude Fable uit cachegebruik. Bij gemiddeld gebruik daalt dat aandeel naar zo'n vijftien procent.
Euhm, als het cache gebruik daalt, dan worden de kosten toch hoger? Verwerking van zaken uit cache is altijd goedkoper dan iets wat niet gecached is.
Niet geheel onbelangrijk om te melden: dit is het eerste Anthropic model waarin het verborgen watermark zit.
Nee dat zat al in de andere modellen, https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content

New models will mark AI-generated content from day one. Claude models launched in the EU on or after August 2, 2026 will support machine-readable marking at launch. Generated text will carry embedded watermarks, and generated files will include digitally signed provenance metadata where supported.
Incorrect, het gaat om modellen die op of na 2 augustus worden gelanceerd, en Fable 5.1 is het eerste model dat na die datum is gelanceerd. Fable/Opus 5 hebben het watermerk er nog niet inzitten en gaan dat ook niet krijgen.

De eerste zin zegt dit al (new models) en ook de tweede zin bevestigd dit (launched(!) on or after).

[Reactie gewijzigd door TheDevilOnLine op 2 september 2026 17:26]

Als je verder leest dan zie je dat oudere moddellen dit ook gaan krijgen, als ze dat al niet hebben, daar is anthropic vaag over.
Correct, maar dat wordt dan weer apart gelanceerd, dus Fable 5.1 is het eerste model waar marking in zit. En als je daar over twijfelt, genereer dan content in elk model en gooi het door de detector van anthropic.

Om te kunnen reageren moet je ingelogd zijn