Claude Fable 5.1 kost gemiddeld 25 procent minder door lagere cachekosten

De AI-programmeertool Claude Fable kost volgens Anthropic met versie 5.1 ongeveer 25 procent minder dan versie 5. Dat komt omdat de kosten van cachegebruik dalen. Volgens de AI-maker zijn de prestaties van het nieuwe model ook aanzienlijk verbeterd. Claude Fable 5.1 en het niet-openbare Mythos 5.1 zijn nu beschikbaar.

Anthropic Fable
Anthropic Claude Fable

Uit metingen van Anthropic zelf blijkt dat vooral de nauwkeurigheid bij het gebruik van agents sterk verbetert. Zo zouden agents wetenschappelijk onderzoek tot twee keer zo goed uitvoeren en tot een kwart beter programmeren.

Tegelijkertijd nemen de verwachte kosten van het model af doordat de prijs voor cachegebruik daalt. Het programmeermodel gebruikt cachegeheugen om eerder verwerkte context opnieuw te benutten. Tot dusver bestond veertig procent van de 'workload' van Claude Fable uit cachegebruik. Bij gemiddeld gebruik daalt dat aandeel naar zo'n vijftien procent.

De prijs voor het daadwerkelijke gebruik van Claude Fable blijft hetzelfde, namelijk 10 dollar per miljoen inputtokens en 50 dollar per miljoen outputtokens.

Claude Fable is een afgekaderde versie van het krachtige Mythos

Anthropic Claude Fable 5 is een variant van het krachtige Mythos-model. Deze programmeertool is zo goed in het vinden van beveiligingslekken, dat deze ook ontzettend goed is in het vinden van exploits. Daarom werd Mythos voor een zeer select publiek uitgebracht. Fable is de publiek beschikbare versie met verder aangescherpte veiligheidsmaatregelen.

Door Yannick Spinner

Redacteur

02-09-2026 • 11:15

19

Submitter: protected22

Reacties (19)

Sorteer op:

Weergave:

Volgens de AA benchmarks is de kostprijs bijna 4x zo duur is als Sol max, en 17% duurder op dan Fable 5 Max, ondanks de verlaagde cachekosten.


https://artificialanalysis.ai/articles/claude-fable-5-1
De totale kosten van een relatief complexe prompt zijn alsnog vrij hoog. Ik heb een poging gedaan om een website met wat pagina's te genereren maar, mijn budget op openrouter was niet toereikend. Ik begrijp ook van content creators dat de prijs voor een dergelijke prompt vaak al hoger is dan 15 EUR.

Het is best moeilijk om te begrijpen wat de relatie is tussen input/output/cache tokens en dat wat je uiteindelijk aan het model vraagt.
Maar goed, voor 15 euro huur je ook geen Indiër meer in op Fiverr. Die Indiër levert dan wel nog altijd beter werk dan de slop die er uit een LLM komt, maar als je het resultaat van een LLM prima vindt is 15 euro niks.
Vervolgens gebruik die Indiër weer een LLM en doet zichzelf 5x per uur verhuren ;)
Ja die Indiërs doen niets meer zelf op Fiverr hoor. Zelfs als je expliciet vraagt of het zonder AI gedaan kan worden. Echt veel wordt tegenwoordig met AI gedaan op fiverr. Of je nou een 3d render wil (je krijgt uiteindelijk gewoon een imagegen afbeelding) of een Figma design, tot code.

In die zin vervangen de LLM's wat Fiverr eigenlijk was voor mijn gevoel.
Rule of thumb is dat je liever meer input tokens geeft (duidelijke prompt met verifieerbare doelen, veel voorkauwen), om minder output tokens te generen (minder reasoning nodig, sneller betere output).
Cache tokens via VS code extension / claude desktop / CLI zijn sessie gebaseerd en tot 1 uur actief.
Cache via API, is per sessie (dus als je die niet meer stuurt heb je 0 cache) en dan ook nog eens maar 5 minuten actief.

Maar hoeveel impact cache kan hebben, met mijn Pro subscription (a $20,-) haal ik ongeveer $1200,- uit cached tokens VS normale API kosten. En dat is dan met Sonnet / Opus gebruik en niet eens elke week het volledige weekly limit gebruikt.
Deze week is gisteravond weekly limit gereset (normaal vrijdag avond) dus zal nu meer gebruiken dan normaal.
Ik zit op het Max plan en blaas met 5.1 duidelijk sneller door mijn 5-uurs limiet heen dan met 5.0. Mijn ervaring tot dusver is dat 5.1 zeker niet goedkoper is. Ik gebruik hem nu met de effort lager (doorgaans Medium) en dat maakt het wat beter behapbaar.
Komt goed uit want Anthropic gaat de "bonus" limieten binnenkort 25% verlagen
Fable werd sowieso al niet binnen de limieten van een reguliere Teams Seat bekostigd, maar was "pay-as-you-go".

Dit nog even afgezien van de data retention problemen... (dat gaan ze dan wel oplossen met dat je zelf de "safety logs" kan bewaren, maar ik heb zo het vermoeden dat die oplossing alleen voor Enterprise gaat gelden).
Maar daar zijn ze toen weer op teruggekomen en toen zat het juist wel in het abbonement. Wel had ik na je limieten pay-as-you-go aanstaan en dat kostte flink wat.
Fable zit standaard bij de Premium versie van de teams abbonementen en alleen extra verbruik is pay as you go. Je hebt wel een aparte week limiet voor Fable los van alle andere modellen.
Laat ik nou net geen premium hebben :D

Aan het einde van de week heb ik altijd nog wat limiet over. Die zet ik dan vaak in voor prive-vibe-coding... vind mijn werkgever geen probleem. Maar als ik kosten ga maken voor mijn "hoeveel-augurken-zijn-er-in-de-koelkast"-tracker, denk ik dat die er wel wat van gaat zeggen.

[Reactie gewijzigd door Keypunchie op 2 september 2026 11:43]

Wij hebben meestal zo'n 90% van de maximale tokens op einde week (heb even de stats bekeken) heel af en toe moeten we betalen voor gebruik wanneer we op specifieke dagen dingen af willen krijgen.
Is Fable praktisch te gebruiken? Ik werd zo vaak terug gegooid naar een ander model dat ik eigenlijk een heel tevreden gebruiker van Opus 5.0 ben. Wat ik niet begrijp, vertaalt 25% minder gebruik zich ook naar 25% minder token verbruik. Of merk ik hier als gebruiker niet zo veel van? (behalve een minder aangetast geweten door het verminderde gebruik van AI en de druk op water en energie)
Fable is zeker praktisch te gebruiken. Hoe beter de code base geschikt is voor AI Agents hoe beter hij het doet. Wat ons vooral opvalt is dat Fable vaak voor dezelfde taken wat sneller is.

En beter werk levert bij architectuur keuzes hoewel nog steeds niet heel goed.
Bullsh*t. 99% cache hit en ben al door mn Max 20 weekly usage heen voor Fable.


Zelfde workload onder OAI Pro Max met Sol 5.6 xhigh ging twee dagen mee.
Volgens mij stoelt Anthropic in belangrijke mate op de koppeling tussen de modellen en Claude Code: Mensen gebruiken de Anthropic Modellen omdat Claude Code daaraan gekoppeld is. Hoe goed de modellen zijn, lijkt een minder grote overweging te zijn.

Gegeven de toenemende concurrentie met bijv. Opencode en Deepseek Harness lijkt mij dat de prijs van de modellen wel omlaag zal moeten: Claude is te duur in vergelijking met de concurrentie en het is maar de vraag of de modellen van Anthropic beter zijn, ook wat kwaliteit betreft is zit de concurrentie Anthropic op de hielen.
Eigenlijk is Google heel genereus - als je een gratis account maakt op aistudio.google.com kun je haast onbeperkt doorwerken op heel veel van hun modellen. Je kunt wel tegen het maximum aanlopen, maar dan moet je wel heel goed je best doen.
(Momenteel is `Flash latest` de beste keuze voor veel zaken, omdat `Pro` nog steeds op 3.1 staat, tegen Flash op 3.7, en je Flash kunt zeggen lang na te denken, waardoor het min of meer als Pro werkt.)

Het is moeilijk iets vergelijkbaars bij andere aanbieders te vinden - zeker als je een 1M token context window wilt. Ik probeer het met de Jan Arend-serie, maar andere systemen, ondanks hun beloften van slim omgaan met kleinere context windows, missen heel wat van wat er werkelijk gebeurt in die kronieken.

Om te kunnen reageren moet je ingelogd zijn