Verbeterde DeepSeek V4 Flash kost per taak 60 procent minder dan GPT-5.6 Luna

DeepSeek heeft V4 Flash 0731 uitgebracht, een verbeterde versie van de in april verschenen V4 Flash. Deze nieuwe versie doet nauwelijks onder voor GPT-5.6 Luna van OpenAI, maar is wel zo'n 60 procent goedkoper.

Dat blijkt uit de Artificial Analysis Intelligence Index, die AI-modellen op verschillende gebieden beoordeelt. Het gaat bijvoorbeeld om wiskunde, programmeren en redeneren.

Het verbeterde model krijgt in de index 50 punten, evenveel als Gemini 3.6 Flash en slechts één punt minder dan GPT-5.6 Luna. Ter vergelijking: de vorige versie van V4 Flash scoorde 40 punten. Het model is dan ook op veel gebieden verbeterd. Het is vooral beter geworden in agentic taken, waarbij het zelfstandig beslissingen neemt en acties uitvoert. Volgens Artificial Analysis doet het dat nu vrijwel even goed als GPT-5.6 Luna. Verder hallucineert het veel minder dan voorheen.

De intelligentie van GPT-5.6 Luna en DeepSeek V4 Flash is nagenoeg gelijk, maar de prijzen zijn dat niet. OpenAI verlaagde de prijzen van GPT-5.6 Luna onlangs met 80 procent. Zelfs na die prijsdaling zijn de kosten per taak bij DeepSeek V4 Flash 60 procent lager dan bij GPT-5.6 Luna, aldus de Intelligence Index.

Aan de architectuur van DeepSeek V4 Flash is verder niets gewijzigd. V4 Flash 0731 bevat net als zijn voorganger 284 miljard parameters en heeft een contextvenster van een miljoen tokens. DeepSeek V4 Flash 0731 is beschikbaar via Hugging Face.

Artificial Analysis Intelligence Index
DeepSeek V4 Flash 0731 in de Artificial Analysis Intelligence Index. Bron: Artificial Analysis

Door Eveline Meijer

Nieuwsredacteur

03-08-2026 • 12:54

51

Submitter: brezhtnev

Reacties (51)

Sorteer op:

Weergave:

Draai dit al het hele weekend in Hermes. Het is echt een giga sprong voorwaarts, alweer!

Zeer dicht bij State of the Art modellen en op openrouter is een cache hit slechts $0,0028 per miljoen tokens.

Voor een vergelijking tussen modellen, kijk hoe groot het verschil in kosten: https://openrouter.ai/com...lm-5.2/moonshotai/kimi-k3

Dat is praktisch gratis! Een klein model zelf hosten op een Macbook kost nog meer aan elektriciteit denk ik.

Maar dat gaan we komende weken zien want er komt een nieuwe versie van het legendarische model Qwen 3.6 36B!

Wat een tijd om mee te maken. Wekelijkse de grens van menselijke kennis verlegd.

[Reactie gewijzigd door ApexAlpha op 3 augustus 2026 13:19]

Hoe vergelijkt het met fable? Ik kan het plaatje in het artikel zien, maar ik vraag jou persoonlijke ervaring, want die benchmarks zijn maar synthetisch. Ik doe zelf nog weinig met open modellen als deepseek.
Fable steekt er nog wel bovenuit puur op kwaliteit.

Maar Deepseek v4 is 90% van de kwaliteit voor 0,001% van de prijs vergeleken met Fable.
De kracht van de claude taal modellen zit hem vooral in het geheugen dat ze hebben. En met name Fable weet heel erg goed te herinneren wat je zelfs een paar maanden geleden hebt aangepast.
Ja ik hou die 'kennis' lokaal in Hermes of een eigen code harnas met geheugen.
Ik werk met DeepSeek op mijn supercomputer, conclusie, In alle opzichten veel beter, en binnenkort voorbij openAI voor een fractie van de kosten. Go China Go.
Laten we het hopen want fable is geweldig maar niet echt goedkoop te noemen. En concurrentie is alleen maar goed.
In programmeren zijn deze modellen niet erg goed, maar als je bijv met fable een uitgebreid plan maakt. Vraagt of deze dit zo wil uitwerken dat ook 'slechtere' modellen er mee aan de slag kunnen. Dan komen ze aardig ver zolang je hun handje goed vast houd.

Natuurlijk voor het gros van de mens lijkt het geweldig, die reviewen de code verder niet.
Een hybride oplossing. Daar experimenteer ik ook al wat mee voor kosten management.
Ik vrees altijd met grote vrezen bij Openrouter voor de non-cache hits. Ik snap dat een 'cached hit' bestaat uit iemand die onlangs iets soortgelijks gevraagd heeft? Maar .. hoe lang is de TTL van die cache dan en wat zou het doen voor mijn Openclaw om dat te gaan gebruiken? Ik heb de Openrouter/auto geprobeerd maar jakkerde er in één nacht $15 doorheen omdat er ergens een job leek te blijven hangen, en de openrouter/free modellen zijn niet heel erg geweldig. Hoewel het op dit moment redelijk werkt loop ik vooral tegen API limieten aan.
Ik gebruik enkel deepseek v4 flash, en ik doe bijna een maand met een tientje met 24/7 Hermes.

Juist al die toolcalling is zeer standaard en praktisch altijd een cache hit wel.
Wat ik erg fijn vind aan Deepseek is dat je geen abonnement hoeft te nemen: Je kunt er even een tientje in werpen en je tegoed blijft zonder tijdslimiet geldig. Als privépersoon kan je met een tientje zo meerdere maanden vooruit, afhankelijk van hoe intensief je het gebruikt.

Claude, OpenAI e.d. willen je allemaal abonnementen verkopen: Je betaalt iedere maand weer, ongeacht of je je tegoed nu gebruikt of niet.
Bij andere partijen kan je ook direct api credits kopen, inclusief Claude.

De goedkopere subscripties zijn vaak een stuk goedkoper als je het echt veel gebruikt, maar duurder als je ze weinig gebruikt. Dus wat beter is hangt geheel van je eigen situatie af.
Ik vind het alleen niet zo fijn om mijn data langs een Chinese api te laten lopen, ook al begin ik hetzelfde van Amerikaanse providers te denken onderhand.
Ik weeg dat van geval tot geval af. Ik heb een speciaal account aanngemaakt dat in een chroot draait, alleen daar mogen agenten in draaien, ik gebruik meestal Opencode. Voor veel toepassingen is het niet zo belangrijk dat de boel naar China of Amerika gaat

Mocht je vertrouwelijke gegevens hebben, er is tegenwoordig Loes.AI. Ontwikkeld en gehost in Holland en is zo slecht nog niet.
Volgens mij gaan de cache hits meer over vervolgvragen en tool calls waarbij steeds nieuwe prompts startende met de gehele voorgaande historie gedaan worden.

Als jij je 3e bericht stuurt, dan stuur je ook op nieuwe je 2 voorgaande berichten berichten en de antwoorden mee. Dan is het dus heel fijn als die input tokens wat goedkoper zijn.
De cache hits zijn jouw teksten die al vooraf getokenized zijn, in Transformers gepropt en daarna in KV tensors gestoken, en ingeladen zijn in de VRAM van een server. Ik vermoed dat het hier ook overstapt naar RAM en misschien zelfs NVMe storage, maar dat idee krijg ik van de cache hits / misses bij ChatGPT 5.6 en Opus 5.


In elk geval is het omzetten van tokenized tekst naar KV tensors een redelijk klusje, en daarna is het vooral tokens genereren, wat redelijk vlot gaat.


Het gaat hier dus wel om identieke cache: bit voor bit moet je hele stuk identiek zijn. De enige cache die dus zo'n beetje gedeeld kan worden tussen mensen is de system prompt - alles daarna is eigenlijk alleen jouw unieke cache. Maar zo zou je dus 1 pittige prompt laten werken met een goeie response, en vanaf deze 200k tokens in cache doorwerken - ook als je stapjes terug gaat en je vraag aanpast kan dit stukje cache gebruikt worden.

Het is tegelijkertijd dus een soort "reservering" van jouw context op een fysieke machine ergens.

Met elk volgend bericht wat je stuurt hoeft de hele input (system + jouw vragen + LLM's antwoorden) dus niet meer opnieuw opgebouwd te worden in KV-cache, tot aan de generatie.
Als je je API key van deepseek zelf gebruikt ipv via openrouter werkt het nog een stuk beter en sneller. Dit kan je ook bij openrouter zelf doen. Zodat hij de standaard server overruled.
Oh goede tip. Geven ze voorrang aan eigen queries?
Er zit een ratelimiet op hoe snel je queries kan afvuren. Openrouter zal als een enkele klant gezien worden en dus redelijk snel in de wacht gezet worden, terwijl jij zelf nimmer genoeg prompts kunt genereren om die ratelimiet te halen.
Durf ik niet te zeggen werkte bij mij een stuk sneller en natuurlijk goedkoper dan via openrouter. overigens kan je natuurlijk ook gewoon rechtstreeks apikey van deepseek zelf gebruiken in opencode etc.
Wat doe je in Hermes met dit model? Is dit bread & butter voor algemene taken of bijv. ook coden?

Heb Hermes tijdje draaiend gehad, nu weer even terug naar Opencode; ben er nog niet uit wat handiger/beter is.

Sinds vorige week Kimi K3 in gebruik, maar ook wel Deepseek V4 Pro gebruikt in de afgelopen tijd. Zal Hermes eens testen met de nieuwe Flash zoals je suggereert.
Hermes is (vooral) de sysadmin van mijn homelab. Daarnaast heb ik een Telegram chat waarbij hermes ook toegang heeft tot de apps in het cluster met read-only rechten zodat ik dingen kan vragen over de kalender, emails, documenten, lamp uitzetten in Home Assistant, film downloaden etc...

Dat laatste doe ik wel met een lokaal model ivm privacy. Maar alle infra beheren doet Deepseek v4 flash nu standaard.

Tot zaterdag wisselde ik ook wel eens naar Kimi voor hardnekkige bugs of langdurige sysadmin opdrachten maar met deze update niet meer nodig.
Ah lachen! Ja dat stukje personal assistant lijkt me vooralsnog het meest interessant. Ik heb het alleen nog niet aangedurft te koppelen met e-mail (Google Workspace). Moet wel zeggen dat ik vandaag bijv. een mailtje kreeg met API info van een leverancier en dat ik dacht; "check email from x and implement the api in a new feature branch" ofzo. Terwijl ik zelf onderweg en buiten de deur ben...

Eerder al eens Hermes alle projectwerk laten degeren naar Opencode, maar dat was niet heel betrouwbaar en hij deed vrij veel alsnog zelf.

Kimi K3 bevalt mij goed moet ik zeggen, stukje duurder wel, maar niks vergeleken bij de grote frontier models natuurlijk.
Ik draai op mijn mac Qwen 3.6. Komt binnenkort 3.8 van uit en die kan lokaal je emails en zo wel doorlopen, catgoriseren enzo.

zo doe ik dat, want ik wil ook geen privedata naar deepseek.
Ah, ja dat stukje lokaal hoop ik binnenkort ook nog eens te tackelen op een servertje. Buiten dat moet ik zeggen; alleen al connecten met Google Workspace vind ik spannend, buiten het gebruikte model om zeg maar.

Voor mij zou het echt enorm win-win zijn als ik een personal assistant heb die een beetje triage doet op m'n e-mail, planning en afspraken. Ben een chaoot en spendeer veel tijd aan "wat moet ik doen".
Hermes zit wel echt vol met security issues, heb het zelf gelijk verwijderd en zelf maar wat gebouwd. Want die gevibecode projecten wil ik niet in mijn homelab.
Lijkt me juist de plek voor gevibecode projecten, niet?

Overigens is de kwaliteit afhankelijk van het model dat je gebruikt, niet het harnas per se.
Je bedoelt zeker Qwen 3.8 27B https://www.reddit.com/r/LocalLLaMA/comments/1ve0psn/qwen3827b_announced_alongside_qwen38max/

Zelfs V4 Flash 0731 kan ik straks locaal draaien op mijn rog flow z13 128GB met 40+tok/s, welke bijna Opus 4.8 performance levert. v4 pro zal Fable overtreffen terwijl het vele malen kleiner is.

Stel je eens voor wat we over 12 maanden locaal kunnen draaien.
Ik bedoelde eigenlijk de 35B-a3b varient, de MOE.

Hopelijk upgraden ze die ook maar ook de nieuwe dense variant ben ik erg benieuwd naar.
Tja, benchmarks....
Als je even naar de afbeelding met de benchmark scores kijkt, zie je dat Fable 5 minder scoort dan Opus 5. Als je van beide modellen gebruik hebt gemaakt (ik gebruik het voor wiskunde, bewijzen en dergelijke, en zo nu en dan programmeren) merk je dat dit nergens op slaat, Fable 5 is een groter model met echt nauwkeurigere antwoorden en een stuk meer natuurlijk inzicht (wiskundige intuïtie, eleganter programmeren, etc).

Kortom, deze benchmarks zijn erg onbetrouwbaar, er wordt veel gedaan aan het optimaliseren van LLMs specifiek voor de benchmark tests, terwijl de intelligentie van een model totaal anders kan zijn in de praktijk.

Je kan puur op basis van één zon getal echt niet concluderen dat het model evengoed is als Gemini 3.6 flash, en nauwelijks onder doet aan GPT 5.6 Luna...

Ik zou als journalistieke redactie toch echt een beetje voorzichtiger zijn met claims uit de AI wereld direct overnemen, er valt vaak veel op af te dingen. (denk ook aan de marketing claims over het losbreken van LLMs en hacks, of claims over Opus 5, van Anthropic zelf)
Het zou maar zo kunnen dat er nog zoveel te optimaliseren is dat er zwaar overschat wordt hoeveel rekenkracht er nodig is.

Nog even los van al die datacenters die nu gebouwd worden moeten gaan concurreren met de datacenters die over 10 jaar gebouwd worden met nieuwere hardware.

We gebruiken nu x86 CPU's met veredelde videokaarten.

Gaaf dat het kan. Maar wat zijn de kansen dat dat de meest efficiënte manier is.

Nu worden er miljarden gestoken in de hoop op een monopoliepositie. Terwijl de Westerse bedrijven nu al om de oren geslagen worden door de Chinezen op sommige fronten.

En toen bleken de miljarden aan hardware geen monopolie te geven en over een paar jaar net zo veel waard als een miljoen Overlayprojectoren.

Of het is net als het uitsterven van de videochip producenten 25 jaar geleden.

Die strijdt legt AMD en Nvidia ook geen windeieren achteraf.
Het zou maar zo kunnen dat er nog zoveel te optimaliseren is dat er zwaar overschat wordt hoeveel rekenkracht er nodig is.

Nog even los van al die datacenters die nu gebouwd worden moeten gaan concurreren met de datacenters die over 10 jaar gebouwd worden met nieuwere hardware.

[...]

Nu worden er miljarden gestoken in de hoop op een monopoliepositie. Terwijl de Westerse bedrijven nu al om de oren geslagen worden door de Chinezen op sommige fronten.

En toen bleken de miljarden aan hardware geen monopolie te geven en over een paar jaar net zo veel waard als een miljoen Overlayprojectoren.

Of het is net als het uitsterven van de videochip producenten 25 jaar geleden.

Die strijdt legt AMD en Nvidia ook geen windeieren achteraf.
Ik vindt het ook jammer dat de rest van het Westen ook altijd de VS maar blijft volgen. Je ziet toch al heel duidelijk dat het pad wat de Amerikanen met AI zijn ingeslagen helemaal niet het beste pad is. Het is vooral de volume zo snel mogelijk opkrikken en het overal in proppen in de hoop dat het werkt.

Ik dacht dat Nieuwsuur een keer reportage gemaakt had over hoe veel verfijnder de Chinezen AI inzetten. Niet domweg het maar in features stoppen zonder concreet doel, nee echt een plan hebben.

We moeten als Westen gewoon erkennen dat China ons technologisch gaat inhalen of zelfs al ingehaald heeft. Alleen met zo'n factcheck kan je weer kijken naar hoe je beter moet worden. Het gaat op den duur ons ook duur te komen staan dat we ze nu voor allerlei zaken uitsluiten.

Je motiveert China in de huidige manier alleen nog maar meer. Nog onafhankelijker worden van anderen, waarbij wij alleen maar afhankelijker gaan worden van China.

Nu weet ik dat je als land met CCP aan de macht al een groot voordeel hebt tegenover een democratie, maar ik vind dat we het al een tijdje gewoon niet slim aanpakken.

Nieuwsberichten als dit bevestigen deze vermoeden.
We gebruiken nu x86 CPU's met veredelde videokaarten.
De grote jongens gebruiken helemaal geen x86 CPU's...
Klein beetje off topic. Maar ik vind de uitslagen van die intelligence testen maar weinig voorspellend van de daadwerkelijke inteligentie van een model. Heb zelf een claude, en zelf met opus 5 max maakt ie nog gewoon hele basale "denk" fouten. Moet je weer aan een computer gaan lopen uitleggen waarom het niet klopt (en dan maakt ie bijna altijd de fout nog een keer). Leuk dat ie dan een conjecture oplost of de linux kernel doorlicht, maar ik merk er zelf niet zo veel van
+1 maar dat maakt voor de youtube benchmarks niet uit. Die bouwen een landingspagina na of whatever.
Ik hoop stiekem dat China even stevig aan de AI-boom gaat schudden om te laten zien dat je ook goede resultaat kan neerzetten met minder.

Nee, ik wil geen China vs VS kant expliciet kiezen, maar ik denk dat het flink opschalen hoe nu de Amerikaanse bedrijven doen niet de manier is om AI groot te maken.

Het is wel een beetje typisch waar de VS voor staat... alles groot. Kijk maar naar bijvoorbeeld hun auto's. De auto's staan niet bijzonder bekend om hun kwaliteit, hun prettige rijvermogen of oog voor detail. Nee, het stond (voor de opkomst van verduurzaming van auto's) vooral bekend om het formaat en de grote bruto motoren & PK's.

Ik denk niet dat het in ons belang als EU is dat China grootser wordt, maar er lijkt ten minste een duidelijk plan achter te zitten.

[Reactie gewijzigd door Pasteis op 3 augustus 2026 13:16]

Is dit voor of na het feit dat Luna 80% goedkoper is geworden, want als dit nog met de oude data is, dan is het dus niet meer zo.
OpenAI verlaagde de prijzen van GPT-5.6 Luna onlangs met 80 procent. Zelfs na die prijsdaling zijn de kosten per taak bij DeepSeek V4 Flash 60 procent lager dan bij GPT-5.6 Luna, aldus de Intelligence Index.
Na, zoals ook in het artikel staat
Staat vrij duidelijk in het artikel
Based China die nog steeds hun top-end modellen echt open-source uitgeeft.
open weights =/= open source

de enige echte open source modellen komen voornamelijk uit labs in de VS, en volgens mij eentje uit FR, eentje uit JP, eentje is een UAE + VS samenwerking

er bestaan geen chinese open source modellen, op mogelijk kleinschalige uni projecten na

[Reactie gewijzigd door angushansen op 3 augustus 2026 14:21]

Ik vraag me een beetje af waarom het zo goedkoop is. Is het een investering aan hun kant om klanten te winnen, of <alu hoedje> gebruiken ze alle invoer als trainingsdata voor het volgende model?
Als je al een beetje machine met gpu hebt kun je dit ook nog best ok lokaal draaien ook. Hier een Xeon 2698v4 / 256gb ddr4 ram met een rtx3090. Ik draai de lossless Q8 versie met 10 tokens per seconde. Prima snelheid voor agent coding!

Heb je 128gb ram en een GPU kun je nog prima de Q3 of Q4 versie draaien.

Hier te downloaden: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
Ik vind Deepseek sowieso altijd al vrij sterk in het toetsen van zijn eigen antwoord, je ziet Deepseek als je het denken aanzet heel vaak zijn eigen antwoord keuren en ook webbronnen die hij raadpleegt keurt hij regelmatig omdat hij ze niet betrouwbaar genoeg acht. Ik heb Deepseek zeker wel eens aan het hallucieren gehad, dat ik bij vragen over de Commodore 128 teksten kreeg die op de Commodore 64 van toepassing waren, maar ChatGPT ontspoort naar mijn ervaring veel makkelijker.

Om te kunnen reageren moet je ingelogd zijn