'Apple praat met start-up over tech die groot AI-model op iPhone laat draaien'

Apple voert gesprekken met PrismML over het gebruik van de technologie van de start-up, meldt The Information. PrismML claimt dat het Qwen 3.6, een zeer groot opensource-AI-model van Alibaba, draaiend heeft gekregen op een iPhone 17 Pro.

The Information schrijft niet hoe vergevorderd de gesprekken tussen Apple en PrismML precies zijn. Het medium schreef eerder dat de iPhone-fabrikant overnamekandidaten onderzoekt die kunnen helpen om AI-modellen te verkleinen. Op die manier kunnen de modellen op apparaten draaien in plaats van in de cloud.

PrismML verkleint taalmodellen door de gewichten terug te brengen tot 1bit of 1,58bit. Het bedrijf claimt op die manier Qwen 3.6, een model met 27 miljard actieve parameters, zo te hebben verkleind dat het op een iPhone 17 Pro kan draaien. Apples AFM 3 Core Advanced-model heeft 20 miljard parameters, maar gebruikt een 'sparse' architectuur. Daardoor zijn slechts 1 tot 4 miljard parameters tegelijk actief.

PrismML introduceerde eind maart de Bonsai-modellen. Dat zijn native 1bit-modellen die vanaf het begin zijn getraind met 1bit-gewichten, in plaats van 16bit- of 32bit-modellen die later zijn gecomprimeerd. Het Bonsai-model met 8 miljard parameters past in 1,15GB geheugen.

Siri. Bron: Apple

Door Imre Himmelbauer

Redacteur

10-07-2026 • 09:17

88

Submitter: protected22

Reacties (86)

Sorteer op:

Weergave:

uiteindelijk gaan dit soort initiatieven de geheugen markt waarschijnlijk meer helpen.

kleiner, minimale stroom, gaan belangrijk worden om niet alleen AI, maar zo'n beetje iedere bedrijfstak te laten overleven. Want nu veroorzaken geheugen problemen domweg veel te veel disruptie.

Gaat ook helpen met het kostenplaatje van AI, wat nog veel te hoog is om rendabel te zijn.
Volgens mij gaat dit eerder het probleem verleggen. Immers lokaal draaien betekend lokaal opslag en geheugen nodig voor elk apparaat.

Hiermee haal je dat werk/geheugen weg uit de datacenters (minder geheugen en opslag aldaar nodig), maar stop je dat in elke telefoon (meer geheugen en opslag aldaar nodig).

Overigens ben ik groot voorstander van lokaal draaien zonder internet nodig te hebben of data te hoeven delen met iemand anders.
(meer geheugen en opslag aldaar nodig).
Hebben mid-end/high-end telefoons niet al voldoende geheugen om het te kunnen doen? Dus dat ze niet 'nog (veel) meer' nodig hebben. We zagen een tijdje terug al dat geheugen als marketing gebruikt werd. (met onnodige hoeveelheden RAM). Niet zo erg als de megapixel-race natuurlijk :)

Aan de andere kant. Dan zullen mettertijd de 'low-end' telefoons ook wel meer geheugen krijgen, dus dan valt het daar weer op terug :)

Ik maak me om eerlijk te zijn eerder zorgen om het accuverbruik. Zeker als die AI-zaken op de achtergrond dingen voor je gaan doen. Als we kijken naar wat het Siri-mechanisme op dit moment doet. Dan zijn allemaal kleine achtergronddingetjes. (die al dan niet boeiend zijn).
Hoe groter het model, hoe meer geheugen het vraagt. Wat ik lees wordt 16 Gb geheugen nu geadviseerd als instap, en bij de hele grote hele slimme modellen 64 Gb geheugen.

En dan speelt inderdaad de GPU/CPU nog mee die de berekeningen moet gaan uitvoeren. Dus zelfs als een mid-range 16 Gb geheugen heeft, is de vraag of die processor/grafische kaart sterk genoeg is om het rekenwerk te kunnen uitvoeren.
Ik het artikel staat dat één van die modellen in pakkembeet 1,2GB loopt. Dat is natuurlijk nog steeds een boel als je 8-12GB RAM hebt. (zeker met de overhead van een gemiddeld mobiel OS (dat gigantisch veel op de achtergrond lijkt te doen, maar allicht kan zo'n AI-model een deel van die taken op zich nemen.) Maar dan wordt het een kwestie van slim toepassen?

Nou heeft die toko iets op een iPhone 17 laten draaien dat waarschijnlijk aanzienlijk groter is, natuurlijk, maar dat Bonsaimodel is dus wel aanzienlijk lichter, en mogelijk al voldoende voor iets dat op een telefoon moet draaien.

Qua rekenkracht zullen het eerder NPUs worden. En die zitten al sinds de iPhone 8 in Apple toestellen. Ik ga er een beetje vanuit dat andere (A-)merken dat ook wel hebben? Desalniettemin kan het alsnog fnuikend worden voor je accu.

Het is denk ik almetal lastig om te bepalen. In elk geval interessante tijden :)
Correct. De reden waarom geheugen en compute nu zo duur zijn is dat datacenters 24/7 draaien en dus ook 24/7 geld verdienen. Jouw lokale AI draait misschien maar 5% van de tijd, dan is de kostprijs per token dus 20x zo hoog.
Ja, maar die telefoon koop je zowiezo. Als deze dan een locaal model kan draaien die in 99% van de gevallen voldoende is, dan neemt deze werk weg van datacenters zonder de vraag naar hardware te verhogen.

Als ik zie wat kleine modellen op bescheiden hardware kunnen tegenwoordig. Ze doen voor veel gebruik praktisch niet onder voor SOTA.
Lokaal draaien met apple chips is beter en duurzamer dan een data center met inefficiënte nvidia chips.
Nee uiteindelijk gaat dit het probleem oplossen wanneer de client hardware snel genoeg wordt dan krijgen we als consument veel meer keuze vrijheid en daarmaa wordt het moeilijker voor centrale systemen om hun prijzen hoog te houden.

We hebben die cyclus in de IT industrie nu al meerdere malen gezien. Uiteindelijk zijn goedkope lokale oplossingen nodig om de hele markt onder druk te zetten en houden.
Ben voorstander van een telefoon zonder ai, volgende zal dus een Linux telefoon.worden
Volgens mij is het nog maar de vraag of dit zoveel beter is om geheugen/hardware, denk het niet.

Er zijn intiatieven om een model, als het ware, 1:1 om te zetten in een chip design.
Dat kan statisch zijn maar ook a la FPGA, dus (her)programmeerbaar.
Ook kan dit lokaal door CPU/GPU uitgevoerd worden.
In elk geval heb je dus voor x hoeveelheid devices opslag/hardware nodig, capaciteit die er in principe altijd is/moet zijn.
En dat dus bovenop de capaciteit die er nodig is om een werkbaar device, zonder deze overhead, te hebben.

Bij een hosted oplossing kun je capaciteit schalen. Dat is nagenoeg per definitie efficienter dan de capaciteit continue beschikbaar hebben, in de vorm van een eigen device.
Waarom zou je in godsnaam een FPGA gebruiken om een model in vast te leggen? Daar is een FPGA veel te flexibel voor.

Wat je voor AI nodig hebt zijn tensor cores voor de activatie-berekeningen en lokaal (HBM) geheugen voor de gewichten.
Klopt, maar waarom zou je je limiteren tot één versie, één model.
Wilde enkel aangeven dat er een aantal mogelijkheden zijn, omdat ze interessant zijn, maar allen zijn een toevoeging wat hardware aangaat, geen besparing.

[Reactie gewijzigd door lariekoek op 10 juli 2026 12:53]

Alle AI van dit moment past op een tensor core architectuur. Een FPGA is flexibeler, die kan desnoods een CPU nadoen, maar dat is dus veel te flexibel. De enige flexibiliteit die wil is het model.
Nou, dan ben je uiteindelijk uitgekomen op het punt die ik maakte.
Namelijk dat ongeacht de categorisch duidelijk andere vorm, het geen besparing is aan hardware, en zeker geheugen.

Begrijp niet helemaal waarom je doet alsof ik een voorkeur voor fpga heb maar prima.
Iets inhoudelijker, en toch simplified, "tensor cores" is marketingspeak.
Hoe, of waarmee, je je matrixmultiplicaties uitvoerd is niet aan de orde.
Je zult 'het model', links of rechts om, vast moeten leggen.

Dan is de enige interessante toevoeging, in tegenstelling tot wat je zelf ook aanhaalt, dat er dus initiatieven zijn om het anders te doen. Want matrixmultiplicaties, de stappen/uitkomsten of "gewichten", zijn vooraf bekend.
En daar gaan deze initiatieven over. Zie Etched (Sohu).

Denk dat de meesten hier de termen "asic", "fpga", "cpu", "gpu", cpu extensies/instructiesets, "accelerators", en ja, ook "tensor cores" hier prima begrijpen zonder over alles een afzonderlijke discussie te voeren en, stiekem toch ook wel het punt snapten?

[Reactie gewijzigd door lariekoek op 11 juli 2026 12:41]

Hailo / Mythic AI (okay, die laatste is geen fpga) of andere AI accelerators zijn dat wel afaik
"Er zijn intiatieven om een model, als het ware, 1:1 om te zetten in een chip design."

Voor zover ik begrijp zijn dit niet 'intiatieven', dit is de route waarop volop is ingezet. Logisch, GPU's zijn zeer flexibel en kunnen goed voor het trainen van LLM's gebruikt worden. Maar zodra een LLM gereed is, is een GPU hopeloos inefficient. Voor standaard AI gebruik is de geoptimaliseerde CPU de toekomst.

Bij hosted oplossingen kun je capaciteit schalen. Maar lokaal gebruik van AI, zonder afhankelijk te zijn hosted oplossingen is extreem belangrijk. Denk bijv. aan zelfrijdende auto's. AI moet daarvoor direct beschikbaar zijn, zonder latency die standaard komt met hosted oplossingen. En dan hebben we het nog niet eens over 'uitval' van een internetverbinding.
Als je een robot een bal wil laten vangen of een auto een object wil laten ontwijken... dan wil je geen latency...

En die markt voor 'lokale' AI (robots, zelfrijdende auto's, etc) is extreem groot....
Ook om privacy. Het is zorgwekkend hoeveel persoonlijke informatie, maar ook bedrijfsinformatie men over zo'n API stampt.
Neemt allemaal de vraag om hardware niet weg.
Zoals ik het zie (en ik werk vrijwel dagelijks met (voornamelijk) Claude en ChatGPT, en af en toe met een zelf gehoste Qwen in mijn lokale netwerk),zijn we nu echt bezig met een race. Anthropic en OpenAI proberen elkaar elke dag af te troeven, en de concurrenten volgen op een (in mijn ogen) aanzienlijke afstand, maar doen het ook niet onverdienstelijk.

De huidige situatie is denk ik niet heel lang meer houdbaar, en men is op een gegeven moment ook wel klaar met verbeteren van de modellen (al denk ik niet dat dat eind al in zicht is). Er zal snel een optimalisatieslag moeten komen waarbij we meer met minder kunnen doen. Af en toe hoor je al dat soort berichten langskomen - tegelijkertijd softwarematig en hardwarematig.
Hopelijk betekent dat dan ook dat de prijzen van hardware langzaam zullen gaan dalen.
De top-end modellen kosten inderdaad steeds meer, maar zowel Anthropic als OpenAI heeft ook kleinere modellen die minder kosten.

De kosten van Claude Code en Codex zijn inmiddels zo hoog, zelfs voor de zakelijke markt, dat ze nu echt op prijs beginnen te concurreren. Dat zie je terug in de prijs van de nieuwe GPT 5.6 modellen. Het basismodel kost de helft van GPT 5.5.
Claude is afgezien van Fable 5 nog gewoon op subscription bases.
Codex ook, maar de kosten werken zich terug in de limieten die je krijgt. Als je boven die limieten komt mag je tokens gaan kopen en dat word al snel een duur geintje. Zeker met modellen als Fable 5.

Naar verluid zijn die API kosten winstgevend en de abonnementen verlieslijdend. Als de AI bedrijven winstgevend moeten worden zullen ze dus vooral de kosten voor tokens omlaag moeten krijgen.

[Reactie gewijzigd door Wolfos op 10 juli 2026 14:05]

Afgezien van de kosten voor jou als gebruiker, schijnen de daadwerkelijke kosten nog veel hoger te zijn. Voor zover ik heb gelezen draaien al die grote AI providers flink verlies.
Maar dat is meestal niet op het 'draaien' van een al 'gebakken' model. Daar word wel iets aan marge gemaakt, dat het weer meteen word uitgegeven aan onderzoeken en nieuwe modellen en nieuwe hardware, hosting en hyperscale dc's is een ander verhaal.
uiteindelijk gaan dit soort initiatieven de geheugen markt waarschijnlijk meer helpen.

kleiner, minimale stroom, gaan belangrijk worden om niet alleen AI, maar zo'n beetje iedere bedrijfstak te laten overleven. Want nu veroorzaken geheugen problemen domweg veel te veel disruptie.

Gaat ook helpen met het kostenplaatje van AI, wat nog veel te hoog is om rendabel te zijn.
De tokens limitaties zijn goed, want dat zet bedrijven aan het nadenken om niet voor elke domme feature maar AI te gaan introduceren. Naast dat er natuurlijk nog een hoop randvoorwaarden zijn om AI effectief te draaien voor je processen... m.a.w. nog genoeg werk!
uiteindelijk gaan dit soort initiatieven de geheugen markt waarschijnlijk meer helpen.
Ik denk het niet. Het vervangt de servermarkt niet, maar het komt er bij.

Je kan niet alle gewichten simplificeren naar 1 bit totdat een sowieso al matig model van 16GB in 1GB past en verwachten dat het even goed presteert.

Als je een model zover kwantificeert dat het nog maar 1GB gebruikt, dan is het net alsof je een agent hebt die zoveel lijm heeft gesnoven dat het alleen nog maar kan hallucineren. Het zal je met volle overtuiging en taaltechnisch correct onzin kunnen vertellen, waardoor het eigenlijk is gereduceerd tot een vertaalmodel/spellingscontrole. Voor redeneren en complexe vragen moet je toch weer met een server praten met 80 miljard parameters van 16 bit en het geheugen om honderdduizend vragen tegelijk te kunnen verwerken.
De enige kracht die AI bedrijven momenteel hebben is dat zij de hardware bezitten die andere niet hebben. Ze hebben 0 baat bij AI modellen efficienter maken want alleen hun die het kunnen draaien is de enige manier om controle erop te houden en al het geld kunnen blijven graaien. Ik hoop dat deze bedrijven zoals Apple die voornamelijk bestaan uit hardware aan consumenten verkopen terug vechten en deze hele idioterij weten te stoppen! Anders zie ik het somber in voor deze wereld

[Reactie gewijzigd door ro8in op 10 juli 2026 09:31]

Die grote AI bedrijven geven vele miljarden uit aan hardware, en jij verwacht dat die niet willen dat hun eigen model op hun eigen hardware niet efficiënter draait? Natuurlijk is efficiëntie essentieel voor hun. Itt de gemiddelde software leverancier wiens software bij de klant draait, en ze geen drol uitmaakt wat de systeemvereisten zijn.
De indruk die ik momenteel vooral van die AI clubs krijg is dat efficiëntie totaal niet op het lijstje staat. Winnen, ten koste van alles, is het enige punt wat relevant is. Nummer 2 worden is geen optie.

Dus nee, ik denk niet dat ze dat willen. Zeker niet nu. En misschien wel niet de komende 2 jaar.
En dat doe je dus ook met efficiëntie. Ze kunnen meer draaien op hun servers als ze efficiënter zijn, en daardoor kunnen ze voorsprong nemen tov de concurrentie.
En dat doe je dus ook met efficiëntie. Ze kunnen meer draaien op hun servers als ze efficiënter zijn, en daardoor kunnen ze voorsprong nemen tov de concurrentie.
Ik ben het helemaal met je eens, maar ik zie ze dat niet doen momenteel. Efficiëntie is domweg geen onderdeel van de besluitvorming, lijkt het.
"Ik ben het helemaal met je eens, maar ik zie ze dat niet doen momenteel. Efficiëntie is domweg geen onderdeel van de besluitvorming, lijkt het."

Misschien kijk je niet goed....
Efficiëntie interesseert ze helemaal niet. Voor hun energieopwekking gebruiken ze 50-60MW gasturbines single cycle.

Dat betekent dat ze door rond te draaien een generator aandrijven die energie opwekt, maar de verbrandingsgassen van 400+ graden blazen ze de atmosfeer in.
"De indruk die ik momenteel vooral van die AI clubs krijg is dat efficiëntie totaal niet op het lijstje staat. Winnen, ten koste van alles, is het enige punt wat relevant is."

Maar hoe - in vredesnaam - denk je dat je kunt winnen zonder efficency niet als prioriteit te zien?

Hoe werkt jouw logica?
Efficiency is ondergeschikt aan features, snelheid, etc.

Ze kopen liever nog een keer de volledige jaar productie aan RAM en GPU op, dan dat ze proberen het in minder te doen en efficiënter.

Dat is puur een observatie op basis van het gedrag wat ze tonen en het effect wat ze veroorzaken in andere markten. (onbetaalbare storage en memory, onbetaalbare stroom in de gebieden waar de datacentra staan).

Mijn logica werkt dus op basis van wat ik observeer.
Jouw redenatie heeft niets met observatie te maken.

Je hebt het sowieso niet alleen over gedrag (wat je kan observeren), maar ook over intentie (wat je niet kan observeren).

Je kunt wellicht zien dat ze een volledig jaar aan RAM en GPU's opkopen.
Maar je kunt niet zien dat ze dat liever doen dan de efficiency verbeteren.

Dat laatste is geen observatie maar een aanname. En 1tje die m.i. niet klopt.

Wat ik observeer is dat ze erg druk zijn met het maken van efficientere cpu's om AI goedkoper (minder energie) en sneller te maken. Je kunt daar 10tallen artikelen over vinden.
Daar steken ze vele miljarden in. Dat is ook logisch, want de miljarden aan 'schuld' zou zomaar de ondergang van een aantal bedrijven kunnen worden. Ik geloof niet in een bubbel die gaat barsten, maar het zal desalniettemin erg pittig worden voor een aantal bedrijven.
Ik zie ze - om die redenen - volop bezig zijn met efficiency. En het is ook bijzonder logisch dat ze dat doen.
De tokenkosten worden voor veel gebruikers/bedrijven een probleem. En degene die als eerste een high-end llm kan bieden tegen geringe kosten, die wordt schat-en-schatrijk.
En degene die als eerste een echt efficiente CPU kan bieden die gespecialiseerd is in AI, die wordt ook schat-en-schat-rijk. Dus zowel de AI bedrijven als de Hardware boeren zetten alles op alles om die efficiency te verbeteren.

Volgens jouw redenatie zijn die miljarden aan schuld volkomen irrelevant voor die bedrijven. Ze gooien liever miljarden over de balk dan dat ze wat efficienter zouden gaan werken. Een bijzonder absurde gedachte in mijn ogen.

Misschien dit even lezen (het gaat exact over de noodzaak van efficiency in AI). Het is een artikel van gisteren, maar zo zijn er vele artikelen over dit onderwerp:
https://techcrunch.com/2026/07/09/can-ai-answer-the-3-trillion-question/

[Reactie gewijzigd door pietvelleman op 10 juli 2026 16:42]

Ik hoop dat deze bedrijven zoals Apple die voornamelijk bestaan uit hardware aan consumenten verkopen terug vechten
En waarom niet gewoon het letterlijke voorbeeld uit het artikel? PrismML dus!

Ik heb liever 10 startups die dat mogelijk maken dan dat het weer bij big-tech ligt...
Veel startups hebben maar 1 strategie: overgenomen door big tech.

Dus je hebt 2 kansen in dit verhaal:
- de startup wordt opgeslokt door een van de big-techs
- de startup groeit door tot het big-tech is.
Ja dat is de realiteit, maar er werd toch HOOP uitgesproken, ik HOOP het dus niet...

En zelf doorgroeien is prima, lang niet alles wordt daar meteen big-tech van natuurlijk, maar dat is een kans, en dan heb je een extra big-tech ten koste van de andere dus iets minder big-tech dan :)

[Reactie gewijzigd door watercoolertje op 10 juli 2026 10:22]

Dit mechanisme werkt nu nog zo maar is niet houdbaar op langere termijn.

Uiteindelijk zullen ook deze bedrijven op efficiëntie en kosten moeten gaan sturen. Klanten zullen kiezen voor beste deal en dat zullen partijen zijn die een efficiënte dienstverlening aanbieden.
Dan zit je toch echt fout. Bedrijven die AI hardware maken zijn constant op zoek naar het efficienter maken, juist omdat power een grote uitdaging is. Één server grade AI chip kan wel 1-2kW verstoken. Dit soort chips zitten in een schaalbaar systeem, betekent dus dat je er, laten we zeggen, 30 stuks in een server rack zet. Dan heb je het over enorm veel energie, dat ook nog eens nodig is in koel capaciteit.

Momenteel is er nog veel gaande in R&D om AI uit te breiden, maar ook efficienter te maken, gezien de schaalbaarheid juist lastig wordt met veeleisende hardware. Je komt tegen limieten aan die alleen opgelost worden door optimalisering.
Ja precies goed punt. Om dit concreet te maken. Optronics voor sneller en zuiniger transport in plaats van koper. En bijvoorbeeld de Vera Rubin van Nvidia die eind dit jaar uitkomt. Deze zal naar verwachten ongeveer een factor 10 eficienter zijn en ook veel zuiniger. Ook zijn er al ontwerpen waarbij het geheugen bovenop de CPU of eigenlijk de cores geplakt wordt waardoor de afstand naar het geheugen weer kleiner wordt. En zijn er nieuwe ontwerpen om de hitte nog efficiënter af te voeren. Ziet er allemaal heel goed voor de komende 4 jaar wat er nog allemaal aankomt. En dan hebben we het nog over software optimalisatie.
Wat is er precies zo speciaal aan deze StartUp? Een groot model draaiend krijgen door het aantal bits terug te brengen is toch niks bijzonders?
1.58bits is wel héél laag, daar kun je niet eenvoudig “afronden”. Om voldoende granulariteit te hebben kun je eigenlijk alleen hopen om zo iets te bereiken door te kijken naar het benaderen van het volledige netwerk in plaats van het benaderen van de individuele parameters. Dat is een stuk lastiger.
Dat verhaal "afronden kan niet zomaar" kennen we al veel langer. En ik heb de eerste 1 bit modellen al in 2018 gezien, precies om jouw punt onderuit te halen.

Wat er nieuw is, staat er niet. Maar de methode hoe je zoiets traint maakt wel uit voor de kwaliteit.
Het gaat natuurlijk om de precieze technologie die wordt gebruikt om deze benadering te doen. Het doel van mijn post is om te laten zien dat er meer achter zit dan alleen afronden en dat er dus een heel vakgebied is ontstaan.

het feit dat er al CPUs waren in het jaar 2000 betekent niet dat nieuwe CPUs geen toegevoegde waarde hebben.
Snap ik ook niet helemaal. Je kan 2 bit quants gewoon zo downloaden. Snap ook niet waarom ze de 27B dense nemen als je ook de 35B mixture of experts kan nemen die veel sneller is. Iha zie je een scherpe drop-off in kwaliteit na Q4, dus dat is ook een beetje dubieus. Verder is het wat efficiente code schrijven specifiek voor apple chips, maar ook dat is allemaal wel bekend uit llama.cpp
Mooie ontwikkeling, al vraag ik me wel af wat het lokaal draaien van de modellen doet met de batterijduur.

iPhones staan niet bekend om hun ruime accu capaciteit. Vaak wordt die via OS optimalisaties gecompenseerd, maar hoe dat met LLM modellen moet gaan werken, heb ik mijn vraagtekens bij.
De truuk is natuurlijk dat apple altijd haar hardware afstemt op wat er draait. Een hele efficiënte NPU (of ANE, zoals apple 't noemt in M processoren) die heel erg fijn is getuned met het model waar er draait, maakt 't best zuinig. De grootste energievreter zit dan in de training van het model, en dat doen ze niet on device.
Maar.... Ik heb op mijn Galaxy S26 Ultra al een lokaal AI model draaien, Gemma 4. Dat gaat via de Google Edge Gallery. Ik dacht dat dit de reden was dat Apple ook met Google in zee is gegaan. Wat is dan het verschil met het AI model van deze nieuwe startup?
Wat is dan het verschil met het AI model van deze nieuwe startup?
Ik denk meer/groter model, met minder geheugen.
Ik heb het even aan Gemini gevraagd, haha. Heel erg in het kort: het verschilt niet zo heel veel. De architectuur is compleet anders, maar deze versie van Gemma 4 (26B) heeft 26 miljard parameters tegenover 27 miljard van Qwen 3.6.

Grootte van beide modellen gecomprimeerd is zo'n 16-18 GB.

Het zal dus vooral om de centen gaan denk ik.

Maar he, hoe meer AI modellen lokaal kunnen draaien hoe beter. Hoeven die AI datacenters niet al het geheugen van de markt te hoarden : )
Grootte van beide modellen gecomprimeerd is zo'n 16-18 GB.
Het geheugen-gebruik (RAM) is volgens PrismML veel lager dan gebruikelijk en daar gaat het dus ook om. Jij vergelijkt nu 2 reguliere modellen, en dat gaat dus niet het antwoord geven wat we zoeken.

Als die van Google 5GB nodig heeft (gewoon random gekozen) en die van PrismML maar 2GB (ook random gekozen) en de achterliggende modellen zijn vergelijkbaar (en dus even 'slim') dan heeft die 2de toch de voorkeur?

[Reactie gewijzigd door watercoolertje op 10 juli 2026 10:09]

Ik ben tegen AI. Het draait elke markt de nek om. Verslechterd de relatie tussen medemens door t overal op support te gooien.nee ik bedank.
Dat kan en je bezorgdheden snap ik, tot op zekere hoogte heb je ook gewoon gelijk. maar de realiteit is dat het hier nu is en dat het niet meer weg gaat. De kloof is reeds aan het ontstaan en wordt enkel groter. Je kan maar beter zorgen dat je weet wat er leeft en hoe het leeft, dan achteraf vast te stellen dat je niet meer mee kan. een beetje zoals het internet, alleen nu 100 keer sneller...
Ik haat AI niet maar ik ben er ook alles behalve blij mee. Ik zie ook alleen maar zaken die slechter geworden zijn door AI, en dat het ons links en rechts word opgedrongen voor zaken waar het niet voor nodig is en met enige regelmaat iets vervangt wat wel werkt door iets wat nu misschien werkt.

We hebben een hoop problemen, en AI draagt daar alleen maar negatief aan bij. Het kost een hoop energie en water, twee zaken waar we in NL van weten dat het op korte termijn een probleem word.

Het is bij veel bedrijven naar binnen gefietst door "AI specialisten" met onrealistische prognoses en kosten besparingen.

Daarnaast zijn de kosten onrealistisch laag, maar dat word nu langzaam aan minder. Leuk, want nu stijgen de operationele kosten van AI ineens en komt men er achter dat elke scheet die AI zou oplossen ineens best wel duur word.

0 problemen opgelost, best wel wat problemen verergert en een hoop nieuwe problemen wereld wijd gecreëerd. En dan zijn we er nog niet, want de echte economische schade komt nog als men er achter komt dat het geld erin niet terug komt.
Helemaal gelijk, er is veel verkwisting met ai, maar ik zie ook heel veel zaken die nú enorm veel sneller gaan met ai
Waarom ben je tegen AI? Ik ben wel nieuwsgierig, omdat de meeste beargumentatie voor dit standpunt veelal gebaseerd is op hele slechte argumenten, vooral ingegeven door een groot gebrek aan kennis. OF de argumenten gaan over het gebruik van AI, maar dat doen we zelf en zegt niks over AI.

AI is niet veel meer dan een taal model, dat gekoppeld is aan een grote database (platgeslagen). Het kan niet denken en doet verder niks, maar is eigenlijk een veredelde zoekmachine, die tevens in staat is statistiek en wat andere data mee te nemen in afweging van welk resultaat het beste bij je vraag past (nogmaals platgeslagen). Daarmee maakt AI het doorzeven van grote sets data op zoek naar bruikbare informatie een heel stuk makkelijker. De creatieve kant en interpretatie en beleving van de terugkoppeling blijven afhangen van bewuste levensvormen. Als je dat in acht houdt en AI gebruikt zoals het gebruikt zou moeten worden (hamer om te hameren, schroevendraaier om te schroeven en dus niet om te hameren) dan is er toch niks mis mee?
Waarom ben je tegen AI? Ik ben wel nieuwsgierig, omdat de meeste beargumentatie voor dit standpunt veelal gebaseerd is op hele slechte argumenten, vooral ingegeven door een groot gebrek aan kennis.
Ik ben tegen AI omdat het veel meer is dan een handig tooltje. Ik zie wie de grote gangmakers achter AI zijn. Wie de sociale kanalen en nieuwsvoorziening in handen hebben die ons moeten berichten over de voor- en nadelen van AI.

Dat doet ons dreamteam met als belangrijkste spelers: Peter Thiel, Sam Altman, Elon Musk, Jeff Bezos en Mark Zuckerman. Multimiljardairs met als grootste talent de grootste volstrekt egoïstische en op eigen gewin en macht geïnteresseerde klootzakken op aarde te zijn.

Kijk hoe deze mensen met hun eigen personeel omgaan en je krijgt een idee hoe ze met jouw baan en de maatschappij zullen omgaan. Verliezen mensen een goede baan en is het alternatief ergens moeten werken waar ze in een fles moeten pissen omdat de pauzes te kort zijn (Klagen? Ontslag!) dan vinden ze dat prima zolang het hun (economische) macht en invloed maar vergroot. Ze zijn al zo onmetelijk rijk dat alleen dat spel nog interessant voor ze is.

Dus ik kijk naar wie ons dat prachtige AI gereedschap aanbiedt waarmee we een betere en mooiere wereld zullen kunnen scheppen. Beter voor ons dreamteam uiteraard. Daarom ben ik tegen AI zolang het niet wereldwijd tot in detail gereguleerd wordt hoe en waar en onder welke voorwaarden het ingezet wordt. Voor dat AI ons dreamteam zoveel macht laat vergaren dat ze zich helemaal niets meer van onze regels en wetten hoeven aan te trekken.
Ah oké. Ik snap je. Maar je bent dus niet tegen AI, zoals ik van te voren al zei :P
Had het niet beter kunnen verwoorden! AI (de tech) an sich is heel handig (en kan potentieel levensreddend werken) binnen medisch, defensie, wetenschap, etc. Ook ik ben niet tegen AI an sich, maar wel hoe ermee wordt omgesprongen (ook klimaat technisch). Bovendien hebben veel minder bedrijven het echt nodig dan er nu wordt doorgeschemerd.

We gaan zien hoe dit immens spel zal eindigen…
En toch heb je er al mee te maken in het dagelijkse leven.

Als we zo blijven denken komen we op het 'hutje op de hei' principe en levensstijl.
Je kan ergens tegen zijn en toch soms (moeten) gebruiken? Ik haat de trein, en toch gebruik ik die soms.

Dus nee meteen zulke enorme gevolgen (op een hutje op de hei gaan wonen) slaat natuurlijk nergens op als je ergens niet blij mee bent of niet achter staat...

[Reactie gewijzigd door watercoolertje op 10 juli 2026 10:11]

Ik ben tegen AI. Het draait elke markt de nek om. Verslechterd de relatie tussen medemens door t overal op support te gooien.nee ik bedank.
“Een mobiele telefoon, nee hoor als ze mij willen bellen kan dat gewoon thuis, en als ik er niet ben hebben ze pech”
Ja, en waarom niet? Geeft je innerlijke mens veel rust kan ik je zeggen.
waarom heb ik models nodig op mijn telefoon? Ik bel, whatsapp, internet en gebruik wat apps.

Waarom heb ik dan in hemelsnaam resource vretende "AI" nodig? Wat ga ik daardoor beter of sneller kunnen doen?
Los van dat jouw argument natuurlijk hetzelfde is wat we altijd over nieuwe techniek horen... Het interessante hier is nou net dat het niet resource verslindend is, of in ieder geval niet in dezelfde mate. Als je met AI kunt doen wat je wil met een lokaal op je telefoon draaiend model, dan heb je daar dus geen groot datacenter voor nodig.
Sneller informatie vinden op je telefoon, sneller teksten schrijven, eenvoudiger foto’s bewerken en maken etc.
Automatische vertaling van gesprekken. Ondertiteling van filmpjes. .... etc.etc.

Ik denk dat veel mensen AI verwarren met een chat-machine...
Emails doorzoeken en samenvatten zonder ze aan een AI door te moeten geven. Een goed werkende tekst voorspelling van je on-screen keyboard. Oneindig veel mogelijk.
Rewind 20 jaar: waarom heb ik internet op mijn telefoon nodig? Rewind nog eens 15 jaar: waarom heb ik een mobiele telefoon nodig? Rewind naar de 80s: wat moet ik nou met een computer thuis?
Rewind naar de 80s: wat moet ik nou met een computer thuis?
Een werkstuk maken voor de basisschool met Fontasy natuurlijk, geprint op een vette 9-naalds matrixprinter ipv handgeschreven of getypt.
Wanneer de aanbieders van AI online een prijs gaan vragen die hun kosten dekt en een winstmarge er bovenop, dan wordt on premise, een lokaal draaiende AI plots de investering waard van de computer (en geheugen) die je er voor nodig hebt. Ik ben benieuwd hoe snel de AI zeepbel klapt.
Het zou ook gewoon een langzaam leeglopende ballon kunnen worden. Zelf denk ik dat AI bedrijven eerder hun aanbod gaan rationaliseren, of zich gaan specialiseren op 1 vorm van AI. Iedereen biedt nu LLM's, maar iets als LWM's zou best wel eens een interessante niche kunnen worden.
Ik denk dat AI veel toepassingen heeft, van videoedit ondersteuning tot ticketing tools, ingebouwd in applicaties.
Qwen3.6 is een 35B met 3B actieve 16bits parameters model. Het verandert dus steeds welke parameters actief zijn. In principe zou je steeds 'heel snel' die 3 miljard actieve parameters in en uit het geheugen kunnen swappen. Maar ik denk dat zie hier gebruik maken van hun trinaire (-1,0,1) quantisatie.

Dat betekent dat ze in plaats van 2 bytes keer 35 = 70 GB RAM, maar 1,56/8 keer 35 = 6,8 GB RAM nodig hebben om het volledige model in te laden. Het model wordt hier wel een stuk dommer door. Tenzij ze een hele goede method hebben gevonden om de afwijkingen door het model heen uit te smeren, richting het verwachtte antwoord van het originele model. Microsoft heeft ooit al eens 'bewezen' dat dit theoretisch mogelijk is.

Op arXiv: [2402.17764v1] The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits

(Technisch zou de titel iets van "1-trit" moeten bevatten.)

[Reactie gewijzigd door Henk Poley op 10 juli 2026 16:11]

Ik draai het zelf al een tijdje naar volle tevredenheid op een mini PC, in combinatie met Silly Tavern kan je er leuke dingen mee doen. Hoe meer er lokaal kan draaien des te beter dat is voor zowel de veiligheid als de privacy

Om te kunnen reageren moet je ingelogd zijn