DeepSeek lanceert V4.1-Flash en stopt met V4-Pro

Het Chinese AI-bedrijf DeepSeek heeft V4.1-Flash uitgebracht, een nieuwe versie van zijn AI-model. Wie vanaf komende week nog V4-Pro wil gebruiken, komt automatisch uit bij V4.1-Flash, dat volgens het bedrijf beter presteert en veel goedkoper is.

Het gaat om een mixture-of-experts-model met 552 miljard parameters, meldt DeepSeek. Daarvan zijn er telkens acht miljard actief bij input en zestien miljard bij output. Daardoor gebruikt V4.1-Flash volgens DeepSeek een kwart van het geheugen en een achtste van de opslag om prompts uit te voeren.

Omdat V4.1-Flash sneller en goedkoper is dan V4-Pro, stopt DeepSeek met V4-Pro totdat V4.1-Pro uitkomt. Wanneer dat is, zegt het bedrijf niet. V4-Flash en V4-Flash-Vision-Exp zijn gelijk niet meer beschikbaar. Verzoeken aan die modellen komen direct uit bij V4.1-Flash. V4.1-Flash is fors goedkoper bij gebruik van de api. Klanten betalen 60 dollarcent per miljoen outputtokens, tegenover 1,98 dollar voor V4-Pro.

DeepSeek

Door Arnoud Wokke

Redacteur Tweakers

10-09-2026 • 18:31

25

Submitter: MarvinJames

Reacties (25)

Sorteer op:

Weergave:

Het gaat snel bij DeepSeek. Vrij recent nog de 0731 update voor V4 Flash en enkele weken geleden V4 Flash Vision. De experts zijn native MXFP4, dus het model is betrekkelijk compact en snel. V4.1 lijkt een stuk gegroeid te zijn, maar met quantization en wellicht expert streaming is het hopelijk nog goed presterend lokaal te draaien. In de praktijk doet V4 Flash 0731 het met een hybride 2-bit/4-bit quantization nog erg goed en is daarmee prima bruikbaar op een 128GB systeem, met voldoende headroom voor context.
Er wordt gezegd dat deze versie minder druk op het GPU-geheugen zet: Het gaat niet langer om die 552 miljard parameters die in snel geheugen moeten, maar om de 8/16 miljard parameters die actief zijn. Een server met veel hoofdgeheugen en een kleinere GPU zou daarom zinnig zijn. Wellicht verklaart dit ook waarom V4.1 zo snel is.

[Reactie gewijzigd door dmantione op 10 september 2026 20:40]

Wat je beschrijft is feitelijk van toepassing op alle MoE-modellen. Dat is ook waar ik naar verwees: expert streaming. Dat kan vanaf een snelle SSD of hoofdgeheugen van een systeem. Maar bij V4.1 is er nog iets nieuws t.o.v. V4: engram parameters.
Er missen volgens mij wat woorden in jouw reactie, maakt het moeilijk te begrijpen.
Klopt helemaal, gecorrigeerd.
Ik gebruik 0731 echt voor vanalles. Het is echt super goedkoop (open router) en voldoet voor de meeste taken prima. Zeker als je dit binnen tools gebruikt die taken opdelen.

Die dynamiek waarbij de Chinese leveranciers voor goedkope modellen zorgen en de westerse leveranciers voor de “frontier” modellen vind ik fijn. Dan hou je alsnog een keuze afhankelijk van de taak.
Mijn go-to modellen voor algemene onderwerpen zijn Gemma 4 26b en 31b. Voor technisch zaken en agentic werk zijn DeepSeek V4 Flash 0731 en Qwen3.8-Flash-Next allebei heel sterk.
Hoe kan het zo zijn dat alle modellen op ongeveer hetzelfde tijdstip vrijgeven. Het lijkt wel of ze bang zijn om iets te verliezen ipv iets te doen zoals ze het willen
Dat krijg je in een markt met moordende concurrentie waar iedereen flink verlies maakt. Je kunt gewoon niet achter blijven
Dat zie je ook bij Gemini. Pro 3.5 had problemen, dus werden in rap tempo snel Flash 3.6, 3.7. en 3.8 geleverd. zodat ze niet al te zeer op achterstand zouden komen.

Inmiddels is Pro 3.5 opgegeven, en zijn ze met de training van Pro 4 bezig.
Hoe kan het zo zijn dat alle modellen op ongeveer hetzelfde tijdstip vrijgeven.
? Kun je uitleggen wat je hiermee bedoeld? De Amerikaanse en Chinese bedrijven brengen CONSTANT nieuwe (varianten van hun) modellen uit...
Dit geeft wel aan hoe men in paniek is in AI boerenland. Men komt nu langzaam tot het inzicht dat investeringen lastig terug te verdienen zijn. Bovendien wordt de waarde van dit soort complexe modellen al snel minder na introductie.

Compleet equivalent aan de kloksnelheid race in de jaren 90 of de megapixel race begin van deze eeuw.

Het gaat niet lang meer duren of iets oudere of open source modellen goed genoeg zijn voor het gross van de gebruikers waarmee het hele verdienmodel onderuit gaat

[Reactie gewijzigd door fenrirs op 10 september 2026 19:17]

moet je wel nog de hardware hebben om het te draaien
Deepseek 4 Flash q1 kreeg ik aan het draaien op 128GB ram en 16GB GPU, maar wel langzaam.
Ooit van de term "varkensmarkt" gehoord?
Nee, varkenscyclus daarintegen wel.
ik ben snotverkouden, je moet me vergeven ;). Maar die bedoelde ik idd
Ja, het geheel van vraag naar en aanbod van varkens. Ik begrijp niet helemaal wat die varkensmarkt met dit onderwerp te maken heeft.
Het is juist op dat punt dat de Chinezen serieuze vooruitgang boeken. Ja je hebt nog steeds stevige hardware nodig, maar het komt steeds dichter in de buurt van hardware die te koop is.
Ik heb hier een server die stof verzamelt met een 5800x en 128gb geheugen.

Er zit alleen geen videokaart in.

Zosnel de AI bubbel klapt gaat geheugen en videokaarten heel betaalbaar worden vermoed ik.
De tijd doet altijd vanzelf z'n werk. De peperdure systemen van vandaag zijn de koopjes van morgen. Het is een kwestie van tijd dat iedereen een prima functionerend AI-systeem tot z'n beschikking kan hebben. Wel zal het altijd zo zijn dat cloud-hardware en -modellen er op vooruit lopen. Het is maar waar je het voor nodig hebt.
Zag benchmarks dat deze heel dicht bij Astra in de buurt komt voor 1.4% van de kosten. Fijn dat China een betaalbaar alternatief bied.

https://x.com/OpenDesignHQ/status/2097620919778955617
Het is ook niet raar dat ze het goedkoper aanbieden, aangezien een groot deel van de techniek is gekopieerd.
Net of die amerikanen alle slimme dingen zelf verzinnen. En copyright doen ze ook in amerika gewoon niet aan bij het trainen.
Recent voor een journalling app van Gemini-flash naar Deepseek iver gestapt. De kosten zijn tot 10-20 keer goedkoper. Komt nog bij dat Google de prijzen in januari fors verhoogd. Per week verbrand ik zo'n 5 miljoen tokens voor 50 cent.

Om te kunnen reageren moet je ingelogd zijn