Verbeterde DeepSeek V4 Flash kost per taak 60 procent minder dan GPT-5.6 Luna

DeepSeek heeft V4 Flash 0731 uitgebracht, een verbeterde versie van de in april verschenen V4 Flash. Deze nieuwe versie doet nauwelijks onder voor GPT-5.6 Luna van OpenAI, maar is wel zo'n 60 procent goedkoper.

Dat blijkt uit de Artificial Analysis Intelligence Index, die AI-modellen op verschillende gebieden beoordeelt. Het gaat bijvoorbeeld om wiskunde, programmeren en redeneren.

Het verbeterde model krijgt in de index 50 punten, evenveel als Gemini 3.6 Flash en slechts één punt minder dan GPT-5.6 Luna. Ter vergelijking: de vorige versie van V4 Flash scoorde 40 punten. Het model is dan ook op veel gebieden verbeterd. Het is vooral beter geworden in agentic taken, waarbij het zelfstandig beslissingen neemt en acties uitvoert. Volgens Artificial Analysis doet het dat nu vrijwel even goed als GPT-5.6 Luna. Verder hallucineert het veel minder dan voorheen.

De intelligentie van GPT-5.6 Luna en DeepSeek V4 Flash is nagenoeg gelijk, maar de prijzen zijn dat niet. OpenAI verlaagde de prijzen van GPT-5.6 Luna onlangs met 80 procent. Zelfs na die prijsdaling zijn de kosten per taak bij DeepSeek V4 Flash 60 procent lager dan bij GPT-5.6 Luna, aldus de Intelligence Index.

Aan de architectuur van DeepSeek V4 Flash is verder niets gewijzigd. V4 Flash 0731 bevat net als zijn voorganger 284 miljard parameters en heeft een contextvenster van een miljoen tokens. DeepSeek V4 Flash 0731 is beschikbaar via Hugging Face.

Artificial Analysis Intelligence Index
DeepSeek V4 Flash 0731 in de Artificial Analysis Intelligence Index. Bron: Artificial Analysis

Door Eveline Meijer

Nieuwsredacteur

03-08-2026 • 12:54

100

Submitter: brezhtnev

Reacties (100)

Sorteer op:

Weergave:

Draai dit al het hele weekend in Hermes. Het is echt een giga sprong voorwaarts, alweer!

Zeer dicht bij State of the Art modellen en op openrouter is een cache hit slechts $0,0028 per miljoen tokens.

Voor een vergelijking tussen modellen, kijk hoe groot het verschil in kosten: https://openrouter.ai/com...lm-5.2/moonshotai/kimi-k3

Dat is praktisch gratis! Een klein model zelf hosten op een Macbook kost nog meer aan elektriciteit denk ik.

Maar dat gaan we komende weken zien want er komt een nieuwe versie van het legendarische model Qwen 3.6 36B!

Wat een tijd om mee te maken. Wekelijkse de grens van menselijke kennis verlegd.

[Reactie gewijzigd door ApexAlpha op 3 augustus 2026 13:19]

Ik vrees altijd met grote vrezen bij Openrouter voor de non-cache hits. Ik snap dat een 'cached hit' bestaat uit iemand die onlangs iets soortgelijks gevraagd heeft? Maar .. hoe lang is de TTL van die cache dan en wat zou het doen voor mijn Openclaw om dat te gaan gebruiken? Ik heb de Openrouter/auto geprobeerd maar jakkerde er in één nacht $15 doorheen omdat er ergens een job leek te blijven hangen, en de openrouter/free modellen zijn niet heel erg geweldig. Hoewel het op dit moment redelijk werkt loop ik vooral tegen API limieten aan.
De cache hits zijn jouw teksten die al vooraf getokenized zijn, in Transformers gepropt en daarna in KV tensors gestoken, en ingeladen zijn in de VRAM van een server. Ik vermoed dat het hier ook overstapt naar RAM en misschien zelfs NVMe storage, maar dat idee krijg ik van de cache hits / misses bij ChatGPT 5.6 en Opus 5.


In elk geval is het omzetten van tokenized tekst naar KV tensors een redelijk klusje, en daarna is het vooral tokens genereren, wat redelijk vlot gaat.


Het gaat hier dus wel om identieke cache: bit voor bit moet je hele stuk identiek zijn. De enige cache die dus zo'n beetje gedeeld kan worden tussen mensen is de system prompt - alles daarna is eigenlijk alleen jouw unieke cache. Maar zo zou je dus 1 pittige prompt laten werken met een goeie response, en vanaf deze 200k tokens in cache doorwerken - ook als je stapjes terug gaat en je vraag aanpast kan dit stukje cache gebruikt worden.

Het is tegelijkertijd dus een soort "reservering" van jouw context op een fysieke machine ergens.

Met elk volgend bericht wat je stuurt hoeft de hele input (system + jouw vragen + LLM's antwoorden) dus niet meer opnieuw opgebouwd te worden in KV-cache, tot aan de generatie.
Ik gebruik enkel deepseek v4 flash, en ik doe bijna een maand met een tientje met 24/7 Hermes.

Juist al die toolcalling is zeer standaard en praktisch altijd een cache hit wel.
Wat ik erg fijn vind aan Deepseek is dat je geen abonnement hoeft te nemen: Je kunt er even een tientje in werpen en je tegoed blijft zonder tijdslimiet geldig. Als privépersoon kan je met een tientje zo meerdere maanden vooruit, afhankelijk van hoe intensief je het gebruikt.

Claude, OpenAI e.d. willen je allemaal abonnementen verkopen: Je betaalt iedere maand weer, ongeacht of je je tegoed nu gebruikt of niet.
Ik vind het alleen niet zo fijn om mijn data langs een Chinese api te laten lopen, ook al begin ik hetzelfde van Amerikaanse providers te denken onderhand.
Ik weeg dat van geval tot geval af. Ik heb een speciaal account aanngemaakt dat in een chroot draait, alleen daar mogen agenten in draaien, ik gebruik meestal Opencode. Voor veel toepassingen is het niet zo belangrijk dat de boel naar China of Amerika gaat

Mocht je vertrouwelijke gegevens hebben, er is tegenwoordig Loes.AI. Ontwikkeld en gehost in Holland en is zo slecht nog niet.
Ja en Loes spamt je ook onder met e-mails. Vreselijk irritant.
Daarvoor zijn email aliases, gaan naar je main inbox maar kan je uitzetten.
Dat is eigenlijk geen oplossing.
"Er wordt teveel ingebroken via de ramen"
"Neem je toch tralies voor je ramen?"
Nee, we moeten het probleem, Loes of inbrekers, aanpakken. Anders is het dweilen met de kraan open.
Loes is gewoon Mistral in een Nederlands jasje. Nederland heeft geen eigen LLM.
Dat is direct de minst betrouwbare bron. Iemand die zijn product als echt verkoopt. Maar dit is gewoon een harnas. Is geen taalmodel. Zonder Mistral en OpenAI zou dit niet werken. Het is gewoon een Harnas net als 100'en platforms online nu die gewoon je prompt iets andere values geven om vervolgens het antwoord van een api van OpenAI of Mistral te pakken.
Dan moet je toch wel even onderbouwen hoe je tot die conclusie komt. Wat daar wordt uitgelegd is dat het in basis Qwen is, dat doorgetraind is op een Nederlands corpus om het Nederlandse waarden aan te leren. Dan zie ik geen link met OpenAI en Mistral en als het op eigen GPU's gehost wordt is het in ieder geval niet van buitenlandse infrastructuur afhankelijk.
Als ze beweren dat de basis Qwen is waar haal je dan in godsnaam vandaan dat dit een nieuwe taalmodel is. Het is een Harnas zoals ik al zei en je zelf nu beweert. Ze hebben 1 versie van Qwen aangepast maar ze kunnen de taalmodel helemaal niet upgraden. Dan zullen ze weer wachten tot de volgende versie van Qwen uitkomt. Ze zijn geen nieuw Taalmodel. Gewoon een Harnas wat ook ChatGPT en Mistral ondersteund als je de API's van Chatgpt of Mistral gebruikt. Dat beweren ze op hun website en natuurlijk gaan ze marketten dat het een LLM is. Maar dat is het helemaal niet.

Als je een Android Skin maakt blijft het gewoon Android ook al noem je het One UI of Samsung OS.
Dat Loes een nieuw geheel taalmodel is wil ik niet beweren, maar als jij een taalmodel doortraint en zelf host, dan voldoet dat mijn inziens in hoge mate aan de wens tot soevereiniteit: Gevoelige gegevens gaan niet langer de grens over en training op een eigen corpus zorgt ervoor dat de antwoorden overeenkomen met onze principes.
Dat maakt het nog steeds geen taal model. De taalmodel is de onderliggende functie die dat model stuurt en dat is gewoon een rechtstreekse kopie van Qwen maar aangepast. Deze mensen hebben geen idee hoe ze een taalmodel moeten trainen en ontwikkelen. Ze weten alleen hoe ze het moeten marketen en aanpassen. En als jij hier op tweakers gaat beweren dat dit een taal model is dan heb je absoluut geen idee wat AI is. Men beweert veel te makkelijk dat iets een taalmodel is met een paar aanpassingen in de harnas, maar dat maakt het nog steeds gewoon een harnas. Als je zelf je harnas beschikbaar stelt voor Open AI en Mistral beweer je letterlijk dat je een Harnas gebruikt en de onderliggende model draait op 1 van die LLM's. Een harnas is gewoon een set regels die via een api werkt en in geval van Loes draaien ze Qwen lokaal om kosten te besparen maar is en blijft het nog altijd Qwen met een Skin. Is gewoon feitelijk wat het is.

Deepseek, Qwen, GLM, Claude, Gemini, OpenAI, Mistral, Grok, Kimi K, Mini Max & Muse Spark(Meta) zijn LLM modellen die van de grond zijn gemaakt en niet draaien op een ander model. Loes zou niet kunnen bestaan of werken zonder het onderliggende model. Ze hebben Qwen lokaal draaien die gewoon de regeltjes van Loes volgt. Maar vraag voor de grap Loes even wat er in Tiananmen Square in 1989 is gebeurd en kijk wat voor je antwoord je krijgt. Hij zal waarschijnlijk zwijgen en doen alsof het nooit is gebeurd.
Ik verklaar mij niet schuldig aan de aanklacht dat ik gezegd heb dat Loes een vanaf nul ontwikkeld taalmodel is. :)

Dat expert ben in KI ga ik ook niet beweren. Althans, ik ben het op een bepaalde manier wel vanuit mijn informatica-opleding, maar dat is meer de achterliggende theorie. Maar goed, volgens mij is het fijntunen van een model wel iets anders dan een model in een harnas hangen en mevrouw zegt het eerste gedaan te hebben.

Het gaat er natuurlijk om wat Loes werkelijk is, niet wat beweerd wordt. Het lijkt mij een terechte vraag of Loes antwoord geeft over gevoelige kwesties over China. Ik heb haar even een snelle vraag gesteld:

https://chat.loes.ai/s/758e3958-02e4-437d-aba1-3ac108c778b9

Geslaagd. Wil je dat ik haar nog verder aan de tand voel over China?
Bij andere partijen kan je ook direct api credits kopen, inclusief Claude.

De goedkopere subscripties zijn vaak een stuk goedkoper als je het echt veel gebruikt, maar duurder als je ze weinig gebruikt. Dus wat beter is hangt geheel van je eigen situatie af.
Je hoeft nooit een abonnement te nemen voor LLM's als je api's gebruikt. Deepseek is gewoon goedkoper dat is het enige verschil. Maar OpenAI heeft Luna 80% goedkoper gemaakt afgelopen week. Dat komt wel heel dichtbij de prijs van Deepseek voor echt een groot kwaliteits verschil
Ik ben niet heel onder de indruk, hoor. In het plaatje hierboven staat Luna slechts 1 punt hoger dan Flash? Vanzelfsprekend is dat de "long context"-versie, die aangeprezen wordt voor $0.40 input $0.04 cache en $1.80 output. Deepseek Flash wordt met 1M context aangeprezen voor $0.14 input, $0.0028 cache en $0.28 output. Met name het verschil in output is te groot.
Luna kost 20 cent input 1.20 output.

En wie beweert dat Luna maar 1 puntje hoger zit? Heb je Luna geprobeerd en vergeleken? Ik heb 100'en analyzes gedaan tussen Luna, Sonnet 5, Terra, Sol, Opus en Fable. Luna op Medium(laagste) doet het beter dan Sonnet 5 en in 2/3e van de gevallen ook Opus in mijn usecase. De cijfers die deze modellen verkopen kun je niet serieus nemen. Dat is niet jou usecase. Je moet het 1 met 1 vergelijken in jou usecase, en modellen van OpenAI geven wel degelijk beter antwoord dan Deepseek. Daarom kost Deepseek ook zo weinig. Wie beweer volgens jou dat Luna slechts 1 punt hoger is dan Deepseek? Een tweakers artikel zonder data die Deepseek op zijn woord moet geloven?

Volgens Claude zou Opus beter presteren dan Fable. Toch wilt iedereen nog steeds Fable gebruiken en niet Opus 5. Tot nu toe heb ik alleen maar hallucinaties en slechte ervaringen met Opus 5. Ik vond 4.8 zelfs beter.
De versie met gereduceerde context kost 20/120 cent:

https://developers.openai.com/api/docs/pricing

Die ene punt is de grafiek bovenaan dit artikel: 51 voor Luna, 50 voor Flash. Als je persoonlijke analyses hebt gedaan, heb je natuurlijk ervaring, daar kan ik niet tegenop. Maar... gezien Flash 0731 net een paar dagen geleden gepubliceerd is, heb je die ervaring niet opgedaan met de vorige versie van Flash?
Weet jij uberhaubt wat dat betekent?

Er is geen sprake van gereduceerde context. Luna kost 20/120 cent. Dat is wat het gewoon kost. Maar als jij je chats niet compressed en over het budget gaat (dus hoger dan 272k context window) dan ga je meer betalen voor alles daarboven.

Voor een Hermes Agent ga je never nooit bij die context window komen. Hermes Agent werkt niet zo en 95% van usecases waar je een api gebruikt komt de context window niet van te pas. Alleen als jij een agent hebt die jou hele project in 1 chat moet begrijpen kom je aan die context window. Als je niet in dit veld werkt snap ik dat je aannames maakt maar ik werk in dit veld
Volgens mij gaan de cache hits meer over vervolgvragen en tool calls waarbij steeds nieuwe prompts startende met de gehele voorgaande historie gedaan worden.

Als jij je 3e bericht stuurt, dan stuur je ook op nieuwe je 2 voorgaande berichten berichten en de antwoorden mee. Dan is het dus heel fijn als die input tokens wat goedkoper zijn.
Hoe vergelijkt het met fable? Ik kan het plaatje in het artikel zien, maar ik vraag jou persoonlijke ervaring, want die benchmarks zijn maar synthetisch. Ik doe zelf nog weinig met open modellen als deepseek.
Fable steekt er nog wel bovenuit puur op kwaliteit.

Maar Deepseek v4 is 90% van de kwaliteit voor 0,001% van de prijs vergeleken met Fable.
De kracht van de claude taal modellen zit hem vooral in het geheugen dat ze hebben. En met name Fable weet heel erg goed te herinneren wat je zelfs een paar maanden geleden hebt aangepast.
Ja ik hou die 'kennis' lokaal in Hermes of een eigen code harnas met geheugen.
Indd hier ook, heb alles tm deepseek v4 flash lokaal draaien. Je geeft anders zoveel prijs, je wij beseffen het niet eens.
Ik werk met DeepSeek op mijn supercomputer, conclusie, In alle opzichten veel beter, en binnenkort voorbij openAI voor een fractie van de kosten. Go China Go.
Laten we het hopen want fable is geweldig maar niet echt goedkoop te noemen. En concurrentie is alleen maar goed.
In programmeren zijn deze modellen niet erg goed, maar als je bijv met fable een uitgebreid plan maakt. Vraagt of deze dit zo wil uitwerken dat ook 'slechtere' modellen er mee aan de slag kunnen. Dan komen ze aardig ver zolang je hun handje goed vast houd.

Natuurlijk voor het gros van de mens lijkt het geweldig, die reviewen de code verder niet.
Een hybride oplossing. Daar experimenteer ik ook al wat mee voor kosten management.
Wat doe je in Hermes met dit model? Is dit bread & butter voor algemene taken of bijv. ook coden?

Heb Hermes tijdje draaiend gehad, nu weer even terug naar Opencode; ben er nog niet uit wat handiger/beter is.

Sinds vorige week Kimi K3 in gebruik, maar ook wel Deepseek V4 Pro gebruikt in de afgelopen tijd. Zal Hermes eens testen met de nieuwe Flash zoals je suggereert.
Hermes is (vooral) de sysadmin van mijn homelab. Daarnaast heb ik een Telegram chat waarbij hermes ook toegang heeft tot de apps in het cluster met read-only rechten zodat ik dingen kan vragen over de kalender, emails, documenten, lamp uitzetten in Home Assistant, film downloaden etc...

Dat laatste doe ik wel met een lokaal model ivm privacy. Maar alle infra beheren doet Deepseek v4 flash nu standaard.

Tot zaterdag wisselde ik ook wel eens naar Kimi voor hardnekkige bugs of langdurige sysadmin opdrachten maar met deze update niet meer nodig.
Ah lachen! Ja dat stukje personal assistant lijkt me vooralsnog het meest interessant. Ik heb het alleen nog niet aangedurft te koppelen met e-mail (Google Workspace). Moet wel zeggen dat ik vandaag bijv. een mailtje kreeg met API info van een leverancier en dat ik dacht; "check email from x and implement the api in a new feature branch" ofzo. Terwijl ik zelf onderweg en buiten de deur ben...

Eerder al eens Hermes alle projectwerk laten degeren naar Opencode, maar dat was niet heel betrouwbaar en hij deed vrij veel alsnog zelf.

Kimi K3 bevalt mij goed moet ik zeggen, stukje duurder wel, maar niks vergeleken bij de grote frontier models natuurlijk.
Ik draai op mijn mac Qwen 3.6. Komt binnenkort 3.8 van uit en die kan lokaal je emails en zo wel doorlopen, catgoriseren enzo.

zo doe ik dat, want ik wil ook geen privedata naar deepseek.
Ah, ja dat stukje lokaal hoop ik binnenkort ook nog eens te tackelen op een servertje. Buiten dat moet ik zeggen; alleen al connecten met Google Workspace vind ik spannend, buiten het gebruikte model om zeg maar.

Voor mij zou het echt enorm win-win zijn als ik een personal assistant heb die een beetje triage doet op m'n e-mail, planning en afspraken. Ben een chaoot en spendeer veel tijd aan "wat moet ik doen".
Hermes zit wel echt vol met security issues, heb het zelf gelijk verwijderd en zelf maar wat gebouwd. Want die gevibecode projecten wil ik niet in mijn homelab.
Lijkt me juist de plek voor gevibecode projecten, niet?

Overigens is de kwaliteit afhankelijk van het model dat je gebruikt, niet het harnas per se.
juist het harnas en dus Hermes code zelf heb ik het over. Zijn wel wat alternatieven maar de meeste zijn onveilig. Heb ook alle rust alternatieven geprobeerd. Naja ik heb liever geen gevibecode projecten thuis draaien ivm privacy :) niet voor niks alles dichtgetimmerd.
Dat is praktisch gratis! Een klein model zelf hosten op een Macbook kost nog meer aan elektriciteit denk ik.
Iemand eigenlijk een idee in welke mate deze Chinese modellenbureau gesubsidieerd worden om de token prijs laag te houden? Zit dat in dezelfde grootordes als Chatgpt en consoorten, of meer/minder/niet?
Wat een tijd om mee te maken. Wekelijkse de grens van menselijke kennis verlegd.
Ik snap je punt maar het is maar hoe je er naar kijkt en het gebruikt. Ik maak me stilaan toch ook zorgen voor het afstompen van de menselijke kennis, als ik zie hoe verslaafd sommige er aan zijn. Waarmee ik niet wil zeggen dat dat bij jou het geval is, versta me dus niet verkeerd :).
Iemand eigenlijk een idee in welke mate deze Chinese modellenbureau gesubsidieerd worden om de token prijs laag te houden?
Niet. Althans, dat kan ik niet met 100% zekerheid zeggen, maar:
Inference providers (bedrijven die open-weight modellen voor je draaien en waar jij dan per token kunt afrekenen voor het gebruik) draaien Chinese modellen vaak voor dezelfde kosten als de Chinese partij zelf. Als voorbeeld het recente Kimi K3, wat je bij Kimi kunt afnemen voor $3 input en $15 output (per miljoen tokens) en bij Melious.ai (een Duitse inference provider) voor €3 input en €15 output.

Ik vermoed dat alle providers hun token-prijzen niet subsidiëren. De subsidie zit op hun abonnementsmodellen, bij claude kun je bijvoorbeeld voor $200/maand gerust 100x zoveel ($20.000) aan tokens verbranden (tegen de tokenprijzen van claude zelf). Maar als je dat dus had gedaan op hun API-pricing dan zou je gewoon $20k betalen.

[Reactie gewijzigd door TheRien op 3 augustus 2026 16:57]

Was het niet Plato die aan het zagen was dat door de komst van boeken de kennis zou verdwijnen? De ironie is dat we enkel maar weten over plato door zijn boeken.

AI is een waanzinnig hulpmiddel. We moeten er alleen voor zorgen dat we de maatschappij niet ontwrichten door de drang naar innovatie. Zeker nu dat innovatie in Amerika enkel en alleen nog gedreven wordt door geld. De tijden van het creëren van een utopische leefwereld zijn al lang de deur uit.
Als je je API key van deepseek zelf gebruikt ipv via openrouter werkt het nog een stuk beter en sneller. Dit kan je ook bij openrouter zelf doen. Zodat hij de standaard server overruled.
Oh goede tip. Geven ze voorrang aan eigen queries?
Durf ik niet te zeggen werkte bij mij een stuk sneller en natuurlijk goedkoper dan via openrouter. overigens kan je natuurlijk ook gewoon rechtstreeks apikey van deepseek zelf gebruiken in opencode etc.
Er zit een ratelimiet op hoe snel je queries kan afvuren. Openrouter zal als een enkele klant gezien worden en dus redelijk snel in de wacht gezet worden, terwijl jij zelf nimmer genoeg prompts kunt genereren om die ratelimiet te halen.
Je bedoelt zeker Qwen 3.8 27B https://www.reddit.com/r/LocalLLaMA/comments/1ve0psn/qwen3827b_announced_alongside_qwen38max/

Zelfs V4 Flash 0731 kan ik straks locaal draaien op mijn rog flow z13 128GB met 40+tok/s, welke bijna Opus 4.8 performance levert. v4 pro zal Fable overtreffen terwijl het vele malen kleiner is.

Stel je eens voor wat we over 12 maanden locaal kunnen draaien.
Ik ben benieuwd hoe je aan 40t/s komt?

Momenteel draai ik DeepSeek V4 Flash 0731, de Q2 (!) variant met 131k context op (ook) n 128G Strix Halo, maar met de default llamacpp parameters kom ik nog niet verder dan 15 tokens per seconde. Aardig, maar te langzaam om als daily driver te gebruiken momenteel.

Overigens lijkt het tot zover wel een heel fijn model te zijn, met m'n beperkte real-world ervaring.

Wat een maand, wat een maand: GLM 5.2, Kimi K3, Laguna, DeepSeek V4 0731, en zometeen Qwen 3.8... het kan niet op...
keyword: straks.

De software stack is nog niet zo ver, geef het wat tijd.

Momenteel haal ik met DeepSeek-V4-Flash-0731-UD-IQ3_XXS 18 tok/s decode en 215 tok/s prefill zonder DSpark, die nu niet werkt. Met DSpark kun je ~30-40 tok/s verwachten. De Q2 variant zal nog iets sneller zijn.

Dit is single stream, multi stream wordt interessanter en is 40+ tok/s makkelijk haalbaar.

Wat ik nu haal is met https://github.com/Nathanw1014/strix-halo-llamacpp op CachyOS.

Houd deze in de gaten voor Rocm + DSpark en multi streams https://github.com/antirez/ds4

En de revolutie gaat verder met GLM-5.3 -> Kimi-K3.1 -> Deepseek V4 Ultra
Bedankt, die aparte Strix Halo build kende ik nog niet. Zelf draai ik voornamelijk "latest" stock llamacpp builds, via het geweldige open source Lemonade Server, zie https://lemonade-server.ai/

Er zitten vrij veel AMD developers op dat project, wat betekent dat er in ieder geval veel getest wordt met AMD hardware ;) - verder is het project back-end onafhankelijk, en kun je elke back-end erin pluggen (vLLM, ROCm, NPU (!), ...).

Vaak zijn stabiele lokale LLMs voor mij belangrijker dan iets snellere optimized versies, maar het beste van beide werelden, EN stabiel, EN snel, klinkt heel goed.
Ik bedoelde eigenlijk de 35B-a3b varient, de MOE.

Hopelijk upgraden ze die ook maar ook de nieuwe dense variant ben ik erg benieuwd naar.
De voornaamste reden waarom ik zelf iets zou hosten is niet de prijs (zelfs als je de electriciteit gratis zou kunnen krijgen door bijvoorbeeld zonnepanelen, dan nog is er de kost van de hardware), maar eerder het concept "sovereignty", dus dat ik mijn eigen AI model kan beheren en niet afhankelijk ben van een externe provider die mij zou kunnen afsluiten, afluisteren, censureren of de voorwaarden éénzijdig aanpassen.
Mag ik vragen wat je Hermes zoal laat doen? Ben erg benieuwd naar je use-cases!
Welke deepseek versie gebruikte jij hiervoor op Hermes? Ik draai de Pro(Reasoning) variant want de vorige flash versie maakte wel eens fouten die de Pro niet maakte. Heb jij ervaring met de Pro variant? En zou je zeggen dat de nieuwe flash beter is?
Tja, benchmarks....
Als je even naar de afbeelding met de benchmark scores kijkt, zie je dat Fable 5 minder scoort dan Opus 5. Als je van beide modellen gebruik hebt gemaakt (ik gebruik het voor wiskunde, bewijzen en dergelijke, en zo nu en dan programmeren) merk je dat dit nergens op slaat, Fable 5 is een groter model met echt nauwkeurigere antwoorden en een stuk meer natuurlijk inzicht (wiskundige intuïtie, eleganter programmeren, etc).

Kortom, deze benchmarks zijn erg onbetrouwbaar, er wordt veel gedaan aan het optimaliseren van LLMs specifiek voor de benchmark tests, terwijl de intelligentie van een model totaal anders kan zijn in de praktijk.

Je kan puur op basis van één zon getal echt niet concluderen dat het model evengoed is als Gemini 3.6 flash, en nauwelijks onder doet aan GPT 5.6 Luna...

Ik zou als journalistieke redactie toch echt een beetje voorzichtiger zijn met claims uit de AI wereld direct overnemen, er valt vaak veel op af te dingen. (denk ook aan de marketing claims over het losbreken van LLMs en hacks, of claims over Opus 5, van Anthropic zelf)
Het zou maar zo kunnen dat er nog zoveel te optimaliseren is dat er zwaar overschat wordt hoeveel rekenkracht er nodig is.

Nog even los van al die datacenters die nu gebouwd worden moeten gaan concurreren met de datacenters die over 10 jaar gebouwd worden met nieuwere hardware.

We gebruiken nu x86 CPU's met veredelde videokaarten.

Gaaf dat het kan. Maar wat zijn de kansen dat dat de meest efficiënte manier is.

Nu worden er miljarden gestoken in de hoop op een monopoliepositie. Terwijl de Westerse bedrijven nu al om de oren geslagen worden door de Chinezen op sommige fronten.

En toen bleken de miljarden aan hardware geen monopolie te geven en over een paar jaar net zo veel waard als een miljoen Overlayprojectoren.

Of het is net als het uitsterven van de videochip producenten 25 jaar geleden.

Die strijdt legt AMD en Nvidia ook geen windeieren achteraf.
We gebruiken nu x86 CPU's met veredelde videokaarten.
De grote jongens gebruiken helemaal geen x86 CPU's...
ChatGPT draait toch op Azure clusters met Nvidia A100 kaarten en Epyc CPU's?
En meer en meer op ARM..
Ongetwijfeld. Maar dat maakt het niet beter. Dit design is gegroeid om heel veel verschillende dingen te kunnen doorrekenen en daarmee een Jack of all trades te zijn.

Arm gebruik ik nu ook om met een verbruik van tienden van Watts dit te typen.

Zosnel een Chinees (laten we eens zeggen Huawei) een dedicated AI chip ontwerpt kunnen de A100's en CPU's op basis van ARM, x86 of RISC-v desnoods bij het grofvuil. Omdat die ineens idioot veel verbruiken per token.

En dit is met zoveel geld op het spel eerder snel dan ver in de toekomst.

Maar de A100 orders staan al zwart op wit.
Het zou maar zo kunnen dat er nog zoveel te optimaliseren is dat er zwaar overschat wordt hoeveel rekenkracht er nodig is.

Nog even los van al die datacenters die nu gebouwd worden moeten gaan concurreren met de datacenters die over 10 jaar gebouwd worden met nieuwere hardware.

[...]

Nu worden er miljarden gestoken in de hoop op een monopoliepositie. Terwijl de Westerse bedrijven nu al om de oren geslagen worden door de Chinezen op sommige fronten.

En toen bleken de miljarden aan hardware geen monopolie te geven en over een paar jaar net zo veel waard als een miljoen Overlayprojectoren.

Of het is net als het uitsterven van de videochip producenten 25 jaar geleden.

Die strijdt legt AMD en Nvidia ook geen windeieren achteraf.
Ik vindt het ook jammer dat de rest van het Westen ook altijd de VS maar blijft volgen. Je ziet toch al heel duidelijk dat het pad wat de Amerikanen met AI zijn ingeslagen helemaal niet het beste pad is. Het is vooral de volume zo snel mogelijk opkrikken en het overal in proppen in de hoop dat het werkt.

Ik dacht dat Nieuwsuur een keer reportage gemaakt had over hoe veel verfijnder de Chinezen AI inzetten. Niet domweg het maar in features stoppen zonder concreet doel, nee echt een plan hebben.

We moeten als Westen gewoon erkennen dat China ons technologisch gaat inhalen of zelfs al ingehaald heeft. Alleen met zo'n factcheck kan je weer kijken naar hoe je beter moet worden. Het gaat op den duur ons ook duur te komen staan dat we ze nu voor allerlei zaken uitsluiten.

Je motiveert China in de huidige manier alleen nog maar meer. Nog onafhankelijker worden van anderen, waarbij wij alleen maar afhankelijker gaan worden van China.

Nu weet ik dat je als land met CCP aan de macht al een groot voordeel hebt tegenover een democratie, maar ik vind dat we het al een tijdje gewoon niet slim aanpakken.

Nieuwsberichten als dit bevestigen deze vermoeden.
Klein beetje off topic. Maar ik vind de uitslagen van die intelligence testen maar weinig voorspellend van de daadwerkelijke inteligentie van een model. Heb zelf een claude, en zelf met opus 5 max maakt ie nog gewoon hele basale "denk" fouten. Moet je weer aan een computer gaan lopen uitleggen waarom het niet klopt (en dan maakt ie bijna altijd de fout nog een keer). Leuk dat ie dan een conjecture oplost of de linux kernel doorlicht, maar ik merk er zelf niet zo veel van
+1 maar dat maakt voor de youtube benchmarks niet uit. Die bouwen een landingspagina na of whatever.
Ik hoop stiekem dat China even stevig aan de AI-boom gaat schudden om te laten zien dat je ook goede resultaat kan neerzetten met minder.

Nee, ik wil geen China vs VS kant expliciet kiezen, maar ik denk dat het flink opschalen hoe nu de Amerikaanse bedrijven doen niet de manier is om AI groot te maken.

Het is wel een beetje typisch waar de VS voor staat... alles groot. Kijk maar naar bijvoorbeeld hun auto's. De auto's staan niet bijzonder bekend om hun kwaliteit, hun prettige rijvermogen of oog voor detail. Nee, het stond (voor de opkomst van verduurzaming van auto's) vooral bekend om het formaat en de grote bruto motoren & PK's.

Ik denk niet dat het in ons belang als EU is dat China grootser wordt, maar er lijkt ten minste een duidelijk plan achter te zitten.

[Reactie gewijzigd door Pasteis op 3 augustus 2026 13:16]

Als je al een beetje machine met gpu hebt kun je dit ook nog best ok lokaal draaien. Hier een Xeon 2698v4 / 256gb ddr4 ram met een rtx3090. Ik draai de lossless Q8 versie met 10 tokens per seconde. Prima snelheid voor agent coding!

Heb je 128gb ram en een GPU kun je nog prima de Q3 of Q4 versie draaien.

Hier te downloaden: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF

[Reactie gewijzigd door savale op 3 augustus 2026 17:09]

Het gaat toch om de hoeveelheid geheugen van de videokaart?
Wat doe je dan met die 256 GB Ram voor de CPU?
Klopt, maar 150gb VRAM is nogal prijzig. Grotendeels offloaden naar de CPU werkt ook prima, mits het hele model in (cpu) RAM geladen kan worden.
Enkel CPU ~4 tokens/sec
CPU + RTX3090 ~10 tokens/sec.

hoogstwaarschijnlijk zou een 2e RTX3090 het geheel wel boven de 15 tokens/sec tillen.
Ok, ik dacht eigenlijk dat zulke grote modellen op de CPU draaien onwerkbaar langzaam werd. Maar valt dus mee kennelijk. Gebruik je dan de embedded GPU van de CPU, of heeft die Xeon geen embedded GPU?
Nee geen igpu want die is er niet, een rtx 3090
Dit ligt heel erg aan het model. DeepSeek Flash is een MoE (mixture-of-experts) model, die zijn een stuk sneller omdat er per token een subset van het model gebruikt wordt om de output te berekenen. Het model is onderverdeeld in 256 experts. Per token gebruik je er 7. Dit vereist dus pakweg 2.5% van de rekenkracht van een niet-MoE model (wat jij waarschijnlijk in gedachten hebt).

Dit maakt het mogelijk ze langzaam op een stevige CPU met aardig wat RAM te draaien. Nu zijn er onderdelen van het model die nog steeds relatief zwaar zijn, als je dan een kleinere GPU erbij hebt om specifiek die berekeningen te doen, dan gaat het al weer een stuk beter. Je hoeft dus niet het hele model in VRAM te laden.

Bij mij past het model niet eens in RAM en wordt er naar disk geswapped, en ik haal nog steeds 12 tokens/sec (96GB RAM + 24GB VRAM). Let wel, als ik genoeg VRAM had om het hele model daarin te laden, dan zou dat een factor sneller zijn. Maar 10+ tokens/sec is bruikbaar.

Let wel, niet alles is blijdschap: context inladen (prefill) is relatief traag met zo'n setup. Van niets een chat opbouwen is prima, maar als je een chat in moet laden van gisteren met honderd lange reacties van jezelf en de LLM, dan kun je wel even koffie gaan halen.

Desalniettemin is het natuurlijk goed dat je modellen zoals dit thuis kan draaien als je dat echt wilt. Dit is nu een nieuwe publieke "baseline" van LLM die voor iedereen voor altijd beschikbaar is.
Ok, bedankt voor je toelichting!
Nog een vraag:
AMD heeft tegenwoordig redelijk betaalbare APU's, met een vrij goede iGPU, waarbij je een groot deel van het CPU RAM aan de iGPU kunt toewijzen (Unified Memory Architecture). Dan kan je b.v. van 128GB Ram 96 aan de iGPU toewijzen.
Zou je daarmee dan niet zulke MoE modellen erg goed kunnen draaien? De iGPU zou het toch een stuk sneller moeten kunnen doen dan een CPU?
Je idee is goed, maar het ligt echt aan het specifieke model, hardware, software, en waar je het mee vergelijkt. Low-end vs high-end units maakt een groot verschil. Geheugensnelheid en bandbreedte, de rekencapaciteit van de iGPU, etc.

De Strix Halo en DGX Spark vind ik licht teleurstellen in dat aspect, maar als je ze vergelijkt met een puur traditionele CPU dan zijn ze geweldig. Als je ze vergelijkt met dedicated GPU met veel VRAM dan zijn ze tragisch. Alhoewel met puur CPU vergelijken nooit eerlijk is omdat ze veel sneller geheugen hebben dan een normale PC, dus het is niet alleen het feit dat het geheugen unified is wat het verschil maakt. In dit geval is de Strix Halo niet sneller dan mijn eigen bak inde praktijk (maar wel goedkoper).

Macs zitten in een ietwat ander schuitje. De hebben nog veel sneller geheugen, maar voor de M5 mistte ze wat rekenkracht waardoor de prefill tragisch was. En je moet eigenlijk MLX gebruiken, meen ik, geen GGUF.

Ik ben erg benieuwd naar de praktijk prestaties van M5/Ultra/Studio, en Medusa Halo, mochten deze beschikbaar komen met 256GB unified RAM. Twee DGX Sparks gelinkt doen het momenteel ook redelijk goed.

Anyway, zoals ik zei, het ligt echt aan het specifieke model, hardware, software, en waar je het mee vergelijkt. En dan ook nog wat je use-case is. Maar veel mensen hebben inderdaad de Strix Halo of DGX Spark precies voor dit. Bestte is wachten op de exacte benchmarks voor wat jij wil op de hardware die je voor ogen hebt, voorspellen blijft moeilijk.

[Reactie gewijzigd door BoomSmurf op 5 augustus 2026 22:50]

Ik gebruik alleen Deepseek vanaf het begin. Omdat hun efficiency toen al 9 keer beter was.
Dus ook klimaat vriendelijk. (y)

Dat is is meteen ook de reden waarom de USA AI Bubble veel harder gaat barsten.
Het idee dat meer altijd beter is werkte 100 jaar geleden misschien nog, maar nu niet meer.
Met het barsten van die USA AI Bubble valt natuurlijk ook goed geld te verdienen.
Nvidia aandeeltjes gaan dan ook in de uitverkoop. Gewoon even wachten.
Nuance : US beursgenoteerde bedrijven (en dochterbedrijven) verbieden intern het gebruik van Chinese modellen over API, dat gaat niet direct veranderen. Kan me inbeelden dat véél revenue bij Anthropic en OpenAI daar vandaan komt. Niet van particulieren of hobbyisten. De USA AI bubble kan nog wel even verder. In onze bedrijvengroep (meerdere beursnotaties) zijn de uitgaven omtrent AI in H1/26 (tov H2/25) ruwweg x20 gegaan.
Er zijn nog meer landen in de wereld dan China en de VS.
Bedrijven dwingen om duurder uit te zijn kan tijdelijk een goed idee lijken...
Investeren in AI is makkelijk maar heel duur, de klappen opvangen bij een zeepbel is moeilijk.
Slimme economische oorlogsvoering van China, ze maken het praktisch onmogelijk voor de grote US based bedrijven om de gigantische investeringen terug te verdienen en dat gaat steeds duidelijker worden bij investeerders.
Dat is nog maar de vraag , als het allemaal beter en goedkoper kan dan is er toch ook veel meer hardware nodig aangezien het dan meer toegepast gaat worden.
Is dit voor of na het feit dat Luna 80% goedkoper is geworden, want als dit nog met de oude data is, dan is het dus niet meer zo.
OpenAI verlaagde de prijzen van GPT-5.6 Luna onlangs met 80 procent. Zelfs na die prijsdaling zijn de kosten per taak bij DeepSeek V4 Flash 60 procent lager dan bij GPT-5.6 Luna, aldus de Intelligence Index.
Na, zoals ook in het artikel staat
Staat vrij duidelijk in het artikel

Om te kunnen reageren moet je ingelogd zijn