Staar je niet al te blind op de kunstjes van de nieuwste modellen. Niet al deze kunstjes zijn even nuttig. De huidige generatie AI-servers genereren met een Llama3.1 8b model zo'n 2000 tokens per seconde. Dit is zeer snel te noemen. Hetzelfde model in de Taalas hardware chip haalt ruim 14000 tokens per seconde.
Een hardware oplossing heeft ook geen superduur en omvangrijk HBM-geheugen meer nodig. Wat de "pret" (lees: woekerwinsten van Micron, Samsung, SkHynix en NVidia) nogal drukt.
Ook bedrijfsmatig zijn die kleinere modellen vaak nuttiger. Want het is een vast gegeven. Dus als je 1 set van instructies hebt gefine-tuned voor dat specifieke model en de stap in dat specifieke bedrijfsproces, dan hoef je niet 's nachts je bed uit omdat de cloud-AI-aanbieder het dan nodig vond om hun model te wisselen. Ook is die hardware niet afhankelijk van het internet zelf, de grillen van diegene achter de knoppen van de cloud-AI-aanbieder enz.
Stel je voor: met een vergaande stroomstoring heb je niks meer nodig dan een aggegraat om AI produktiviteit in processen weer op te starten. En natuurlijk geen maandelijks terugkerende token kosten, alleen nog maar verbruikte electriciteit.
Is een in hardware vastgelegd model ideaal voor het creeeren van (nieuwe) code? Nee, daar heb je gelijk in. Maar met instantieuze AI die voor de meeste gevallen wel voldoende is en (heel) veel goedkoper en op locatie is te installeren...nee, mijn vriend, Taalas en andere bedrijven met soortgelijke LLM-in-een-chip-produkten gaan een groot probleem voor OpenAI en Anthropic vormen.
Niet noodzakelijk een probleem voor het produkt dat deze frontier labs leveren, maar voor hun kans om ooit nog winstgevend te worden. Dat was al voor dat dit nieuws naar buiten kwam al zeer twijfelachtig, maar nu?
Taalas heeft een online en interactieve demo (
chatbot) van zo'n 31b LLM-in-een-chip en het is zeer indrukwekkend te noemen.
Dit is een grappige prompt:
In a mysterious town, five unique individuals — a human, a werewolf, a vampire, an alien and an android — are standing in a line. Each has their own style of clothing, a favorite food, a unique hobby, and one particular fear. Perhaps most intriguing of all, one of them is a frightened android. They’re in a line, the puzzle is clear: What is the android’s greatest fear? The one afraid of heights is wearing a tuxedo. The human fears the Heat Death of the Universe. The one afraid of public speaking is eating a hot dog. The one wearing an “I ❤ Jupiter” T-shirt is standing to the left of the one in torn jeans. The one wearing an “I ❤ Jupiter” T-shirt is eating tacos. The werewolf enjoys performing complex equations. The one in a wedding dress stands to the right of the one in a Victorian bathing suit. The one in the middle is eating slime. The one who fears power-cuts is the first in line. The one who enjoys taxidermy stands beside the vampire. The one who enjoys singing stands next to alien. The one who eats batteries enjoys knitting. The one who fears snakes enjoys gardening. The one in a Victorian bathing suit is eating a banana. The one who enjoys taxidermy is standing next to the one eating tacos.
Gebruik deze prompt met chatjimmy.ai en zie een gegenereerd antwoord met 14k tokens per seconde. Dat is dus binnen een oogwenk. Probeer het eerst uit, daarna praat je al heel snel anders dan "software LLM is beter dan hardware LLM". Want dat is zeker niet waar voor elk gebruiksscenario waar je LLMs voor wil gebruiken. En als het ook nog eens veel minder energie nodig heeft...
Of je het beseft of niet, de huidige AI-server in een datacenter verbruikt in 1 uur net zoveel als jouw huis in 1 jaar verbruikt. En dan heb je echt alles in je huis op volle toeren draaien en dat 24/7. De opvolger van Blackwell, Rubin, daarvan word al gezegd dat deze 2 keer meer energie verstookt per server dan een server van de Blackwell-generatie. Want dat is de enige taal die NVidia tegenwoordig nog spreekt: "more power, More Power, MORE POWER!!!" per chip.
En dat is absoluut niet de goede kant op. Efficientie is het enige spel van belang. Hardware is daar veel beter in dan software, laten we eerlijk wezen.
**Edit: moet beter leren lezen, melde in deze post verkeerde specificaties van JimmyAI. Is nu aangepast.
[Reactie gewijzigd door GeroldM op 21 juli 2026 04:11]