Nvidia brengt aanpasbaar opensource-AI-model uit dat op één gpu draait

Nvidia brengt een opensource-AI-model uit dat aanpasbaar is en lokaal draait op een enkele gpu. De mogelijke aanpassingen die gebruikers en ontwikkelaars kunnen maken, zijn voor het trainen van Nemotron 3.5 Lightning. Daarmee krijgt het bijvoorbeeld een eigen schrijfwijze of programmeerstijl.

Nemotron 3.5 Lightning is gratis beschikbaar op AI-platformen als Hugging Face, ModelScope, OpenRouter en bij Nvidia zelf. Het draait lokaal op computers met Nvidia-hardware. De gpu-maker noemt de eigen RTX-pc's en DGX Spark-workstations, maar ook AI-systemen van producenten als Acer, ASUS, Dell, GIGABYTE, HP, Lenovo, MSI en Supermicro. Het AI-model kan ook opschalen voor gebruik op servers in datacenters en cloudomgevingen.

Nvidia stelt dat zijn nieuwe AI-model dankzij de aanpassingsmogelijkheden en toegang tot lokale apps, bestanden en andere tools gepersonaliseerde AI-agents mogelijk maakt. Deze agents kunnen gebruikers helpen met hun e-mails en agenda's, dagelijkse smarthometaken en lokaal programmeerwerk.

Sneller, beter

Nemotron 3.5 Lightning is volgens Nvidia tot wel vier keer sneller in het genereren van tokens dan 'open modellen in zijn klasse'. Ook zou het nieuwe AI-model 30 procent sneller zijn in het uitvoeren van taken. Het bedrijf specificeert in het persbericht niet met welke AI-modellen het zijn nieuwe openweight-AI-model vergelijkt. In een technische blogpost noemt Nvidia onder meer Qwen3.6-35B en Gemma 4 26B.

Nemotron 3.5 Lightning, positionering Beeld: Nvidia
Nemotron 3.5 Lightning, positionering Beeld: Nvidia

Door Jasper Bakker

Nieuwsredacteur

11-08-2026 • 17:37

23

Reacties (23)

Sorteer op:

Weergave:

Hoeveel GB vram heb je dan nodig dus? Wordt mij niet heel duidelijk
De vergelijking met Qwen3.6-35B en Gemma 4 26B doet mij vermoeden dat het minimum 24 GB of 32GB zal zijn, afhankelijk van de kwantisaties van het model en de context. Ter vergelijking: Met NVFP4 voor het model en FP8 voor de context neemt Gemma 4 26B zo'n 17GB à 20 GB in.
Dus met andere woorden: Nvidia was waarschijnlijk van plan om rond deze tijd al de RTX 50 Super kaarten op de markt te hebben, want momenteel heeft Nvidia geen betaalbare kaarten met 24 GB VRAM om deze modellen op te draaien, en met de 50 Super series zouden ze tenminste de 5070 Ti hebben.
Dat valt hier niet per se uit op te maken. De ontwikkelcycli van modellen zijn vele malen korter dan die van grafische kaarten, en als je meer context wil kost dat ook meer geheugen. Ik heb wat beter naar de parameters van het model gekeken, en 32GB lijkt me nu waarschijnlijker, omdat de contextomvang 1M is.
Op huggingface zie ik een 5090 als compatible hardware in de tabel, dus ik vermoed dat het nu minstens 24GB zal zijn.
Minimaal 16GB vram voor zover ik kan achterhalen. Gezien de sizing zou 24GB+ ideaal zijn. Verder hebben ze het over H100 en DGX hardware en daar draait het prima onder.
30B x 0.65 = 19,5

Dus zeg maar ongeveer 20GB
Ik ben erg benieuwd mijn arc kaart kan niet echt speterende modellen kwijt in 12Gb. ik denk dat dit meer een DGX dingentje wordt.
Wat een rare tekstkeuze 'één GPU'? Qwen en Gemma kunnen ook prima 1 GPU draaien, je gaat alleen offloaden naar CPU (en geheugen) en je tokens/sec zakt in elkaar. Daarbij is 'één GPU' nog eens breed getrokken, wil je deze volledig op GPU draaien moet je alsnog tegen de 30GB geheugen op je GPU hebben, en dat clubje is niet bijzonder groot.
meeste mensen kunnen Qwen3.5 ook gewoon draaien op één GPU... wel 8B int4 en dat is niet echt een helder licht.
Uiteraard, maar dat zal wel gezien worden als 'andere klasse' (ik draai zelf Ministral 14B ook volledig op de GPU).
Onder KI-enthousiastelingen zal, als het om videogeheugen gaat, er toch een andere weging zijn dan onder degenen die hun systeem vooral voor spellen hebben gebouwd. Dit model is toch echt meer gericht op de eerste van de twee populaties.
Ja en dan staat er in het grafiekje een 80GB H100... 1 kaart van 40k eur :+
Is er een technische reden voor dat dit niet op AMD-kaarten draait? Ik vind vendor lock-in niet echt bij de spirit van open-source passen.
Technisch lijkt me niets in de weg te zitten om deze via LM studio op een W7900, maar of die zo snel is als de Nvidia varianten... dat denk ik niet.
Als het past, want ik zie dat de kleinste versie NVFP4 vereist. De BF16 versie past niet in de 48GB van een W7900, dat begint bij ca 70GB.
Waarschijnlijk omdat het gebaseerd is op CUDA.

Inmiddels wat verder naar gekeken en de delen die nu dan CUDA praten kun je wel porten naar bijvoorbeeld OpenCL of ROCm zodat het op any / AMD GPU goed kan werken.

[Reactie gewijzigd door VHware op 11 augustus 2026 18:07]

Ik ben benieuwd welke GPU's het gaan worden waar dit model op kan draaien. Een top-of-the-line GPU is alsnog niet te betalen...
Sneller, beter
Wat dat betreft ben ik een beetje skeptisch geworden als het om Nvidia gaat, ze kunnen hele mooie grafiekjes maken, maar die moet je soms met een korreltje zout nemen.
Je kan het in theorie draaien op 1 RTX 3090. vLLM gebruikt W4A16 Fallback om NVFP4 modellen te draaien op "oudere" kaarten.
Is er ook zo iets voor AMD videokaarten om het lokaal te draaien (en dat het toch wel vlot werkt)?
VRAM Requirements for Local LLMs: The Complete Guide - 2026

[Reactie gewijzigd door WeirdScience op 11 augustus 2026 18:27]

Ik heb een Mac mini M1 met 16 GB ram. Zou dit model daar ook op kunnen draaien, via LM Studio bijvoorbeeld?

Om te kunnen reageren moet je ingelogd zijn