AMD vergroot focus op AI-chips met overname van start-up Taalas

AMD neemt AI-chipmaker Taalas over voor een onbekend bedrag. De chips van de Canadese start-up vormen een aanvulling op het huidige AI-platform van AMD, met daarin onder meer de Helios-oplossingen van het bedrijf.

Taalas werd in 2023 opgericht en ontwikkelt chips die dataflows voor inferentie optimaliseren. Dat vermindert knelpunten in rekenkracht en geheugen die voorkomen bij generieke architecturen, stelt AMD in een persbericht.

De technologie van Taalas wordt geïntegreerd in het bestaande AI-portfolio van AMD. Dat portfolio bestaat onder meer uit de Helios-rackscaleoplossingen, de Instinct-gpu's, EPYC-cpu's en ROCm-software.

AMD is verder van plan om met de Instinct-gpu's en de technologie van Taalas oplossingen op systeemniveau te ontwikkelen. "AMD bouwt een full-stack AI-platform dat klanten de flexibiliteit geeft om de juiste compute-oplossingen in te zetten voor iedere AI-workload", zegt Vamsi Boppana, senior vice president van de AI Group bij AMD. De technologie van Taalas draagt daaraan bij door 'onderscheidende inferentieprestaties en -efficiëntie te leveren'.

De relevante autoriteiten moeten de overname nog goedkeuren.

AMD Helios fpa
Bron: AMD

Door Eveline Meijer

Nieuwsredacteur

10-08-2026 • 09:43

39

Submitter: Robit

Reacties (39)

Sorteer op:

Weergave:

Voor zover ik begrepen heb kan dit bedrijf kleine AI modellen in hardware programmeren waardoor ze minstens een factor 10 sneller worden, vergelijkbaar met ASICs voor bitcoin minen

https://www.cnbc.com/2026/08/06/amd-buys-taalas-startup-that-hardwires-ai-models-into-its-silicon.html?msockid=23c9166ea6166891180c00a5a76069ef

https://qz.com/amd-acquires-taalas-ai-inference-chip-startup-080726
Zo snel als dat de modellen nu gaan en zo veel verschillende modellen makers er nog zijn, ben ik wel benieuwd hoe model/maker specifiek dit is en hoeveel tijd er nodig is om de hardware te maken. Hosters van modellen zullen hier vast in geïnteresseerd zijn, want het maakt modellen waarschijnlijk veel sneller en/of goedkoper, maar stel dat het 6 maanden duurt om te maken en dan voor 1 specifiek model is, kan ik mij voorstellen dat het moeilijk word om (op dit moment) goed te kunnen gebruiken.

[Reactie gewijzigd door Gropah op 10 augustus 2026 15:21]

Uit een YouTube video van iemand die de technologie van dit bedrijf zeer nauwlettend in de gaten gehouden heeft heb ik begrepen dat hun technologie erop gericht om een aantal lagen van een model vast te leggen in silicium, waardoor ze een grote versnelling zouden halen.

Dit betekent echter wel dat de chip die geproduceerd wordt alleen dat model kan verwerken en niets anders.

Het idee in deze is dat zo'n chip dan zes maanden tot een jaar mee kan en dat er daarna, zodra er een verbeterd model gemaakt is, een nieuwe chip geproduceerd wordt die de oude vervangt.

Ze beweren zelf dat ze een test model van een chip gemaakt hebben op basis van het Llama 3.1 8B model en dat dat een factor 48 meer tokens per seconde per gebruiker kon verwerken dan hetzelfde model op een NVIDIA B200 (353 vs 16960).

Hoeveel hiervan waar is, is natuurlijk lastig in te schatten, want het zijn getallen die niet onafhankelijk geverifieerd zijn.

De trade-off tussen hun oplossing en een generieke oplossing op basis van een GPU is, dat je snelheid wint ten koste van flexibiliteit.

Zolang de kosten van de beperkte levensduur van de fixed model oplossing opwegen tegen de inkomsten die je ermee kunt genereren is het natuurlijk een interessante optie, maar terugverdientijd is natuurlijk de bepalende factor.

Hoe AMD deze technologie gaat integreren in hun producten is natuurlijk de vraag. misschien dat ze dit bedrijf als aparte product producent opnemen in hun bedrijf.

YouTube: Why did AMD just buy this REALLY WEIRD chip company?
Als je de snelheid even wil testen kan dit hier:

https://chatjimmy.ai
Een stelling die ze in de video analyseren is dat het halfjaarlijks bakken van een vast model haalbaar zou zijn als je ervan uitgaat dat in de toekomst het gros van de subtaken door simpele sub-agents uitgevoerd kan worden.

Mijn inziens schieten er daarom mede tal van bedrijven de grond uit die zich specialiseren op het classificeren en routeren van prompts op dit moment. Mede ook het bekende verhaal; dat de kosten voor de frontier labs de pan uit rijzen. Maar dus ook voor scenario's waarin delen van prompts bij dergelijke gespecialiseerde snelle/goedkope maar minder capabele modellen terecht komen. Ook bij announcements van frontier labs over de modellen zelf zie je regelmatig grote woorden over het kunnen opdelen en aansturen van nog meer sub-agents binnen dezelfde prompt.

Als AMD dat in z'n next-gen rack dan hardwarematig stukken beter gerouteerd krijgt dmv dergelijke 'hardcore 1' chips hebben ze een interessante usp te pakken.
Een USP is het zeker...vooral als je een kaar in je PC kunt zetten waar je zo'n module kan plaatsen, c.q. vervangen. Een beetje zoals het concept van cartridges in de eerste series van consoles (NES/SNES tijd).
Niet alleen dat. Maar denk ook aan edge compute waarbij je lokaal een ai model kunt hebben draaien wat efficiënt en snel is. Denk bijvoorbeeld aan medische producten of voor in een auto. Zo zou er ook getest kunnen worden op een bepaalde versie die daardoor gecertificeerd kan worden. (Ja brengt het nadeel van moeilijke hardware upgrades mee) maar vaak is certificering een langer en lastiger process dan een hardware module vervangen.

Maar ook zou je geavanceerdere ai op een battery powered device kunnen hebben draaien voor beveiliging, autonoom opererende robots, etc.
Het is zelfs dan nog steeds interessant, in iedergeval voor de gratis modelen die zeker vanaf nu minder vaak een verbetering zullen krijgen gezien de gigantisch stijgende kosten per token zullen de grote jongens zeker waarderen om die kosten te dempen voor klanten die geen centjes opleveren.
Maak bepaalde simpele modellen kan je erg lang gebruiken voor simpele taken. Ik zat pas op een website die het AI model had draaien op de chip zelf, ik geloof dat het 18.000 tokens per seconde kon doen ofzo. Je stelde een vraag en poef, een enorme lap tekst zonder enige vertraging. Weet niet meer welke site het was, zal eens zoeken.

edit: Ik denk dat het deze was: https://chatjimmy.ai/ en ik overdreef, hij kan maar 16.000 tokens per seconde. Het is een Llama 3.1 8B Asic zeg maar.

[Reactie gewijzigd door RobbertBink op 10 augustus 2026 13:47]

Waarschijnlijk https://chatjimmy.ai/, die word al meerdere keren in de comments hier genoemd als voorbeeld.
Ah sorry, ik loop weer achter. Maar goed, het is dus al beschikbaar. Ik denk dat dit eigenlijk best een hele sterke oplossing is voor de problemen zoals het hoge energie verbruik. Zoveel sneller is natuurlijk ook gewoon zoveel energiezuiniger, tenzij de vraag hierdoor ook x 100 gaat, maar dat lijkt me sterk.
6 maand om een chip te maken is al extreem snel.
Nee, ze doen dit met ASIC's. Dus modelspecifieke chips.

Ze zijn dus niet opnieuw te programmeren zoals met een FPGA wel het geval is.
Excuus, ik las het alsof ze dat on the fly konden veranderen. Klopt ASICs weldegelijk ja.

<leest terug>

Ik snap nu ook waarom:
AI modellen in hardware programmeren
Dat leest voor mij alsof het aan te passen is.
ASIC ... ? Is dat niet gekkenwerk in een wereld waar LLMs (machine learning) nog steeds in een rat race zit naar krachtigere modellen die minder hardware gebruiken ?

ASIC duurt meestal ~18 maanden van design, layout, simuleren/testen naar tapeout en fab. + miljoenen $$. Als je pech (foutje... in je design of processing) hebt ben je nog langer bezig.
ASIC ... ? Is dat niet gekkenwerk in een wereld waar LLMs (machine learning) nog steeds in een rat race zit naar krachtigere modellen die minder hardware gebruiken ?
Dat kan je toch gewoon blijven doen op de hardware waar dat nu op gebeurd? Tot die (na x maanden) op een ASIC kunnen draaien.

Modellen blijven wel komen maar de oude blijven vaak ook nog meedraaien, toch mooi als je die kan offloaden naar veel zuinigere/snellere hardware?

Hun product/showcase met Llama 3.1 8B laat al zien dat het nog op tijd is want dat model wordt ook gewoon nog gebruikt...

[Reactie gewijzigd door watercoolertje op 10 augustus 2026 11:08]

Er zijn al genoeg delen redelijk volwassen. Die kan je dan in een asic zetten.
Klopt, alleen als je kijkt naar de kosten per prompt zelfs voor de gratis modellen die lopen gewoon uit de hand. Ja de modellen worden sneller en maken (iets) minder fouten, maar ze zijn niet tot nauwelijks efficiënter en vooral fiks duurder.

Dus als je binnen een jaar het oudere model een stuk goedkoper kunt maken zelfs als het betekent dat het nieuwste model niet kan draaien op deze specifieke hardware nog steeds waardevol.

Daarnaast is de kans groot dat men het process kan versnellen zodra de samenwerking een aantal keer door het hele proces gelopen is.
neen, echt model gebakken op de chip.
FPGA kan later nog aangepast worden maar is een stuk trager en verbruikt veel meer energie.
https://chatjimmy.ai/ is een demo van Taalas waarbij ze het Llama 3.1 8B model gequantiseerd en op hun chip gebakken hebben. Ben benieuwd of het ze binnenkort lukt om dit op te schalen naar een groter model met een hogere nauwkeurigheid.
Immens snel! Zojuist geprobeerd met een geavanceerde prompt op Llama 3.1 8B op een 4090 FE, koste zo'n 38sec.

Het koste jimmy 'maar' 0,005s, ofwel 5ms.

[Reactie gewijzigd door hendymen op 10 augustus 2026 12:44]

Google zal er met Gemini voor de Pixel ook wel geïnteresseerd in zijn om in de toekomst lokale modellen te kunnen aanbieden. We zijn er nog niet, maar zal niet al te lang moeten duren.

In iedergeval voor de simpelste taken die de "assistent" uitvoert

[Reactie gewijzigd door TEAser_ op 10 augustus 2026 12:37]

Ian Cutress heeft hier toevallig net een video over gemaakt, en daarin zit een demo van https://chatjimmy.ai/. Deze chips worden hiervoor gebruikt en de reactie van de LLM komt echt onvoorstelbaar snel terug.
Voor iemand die praktisch alleen een nvidia gpu heeft voor workloads die toen nog alleen op nvidia werkt, kan ik nu ook gewoon AMD gebruiken om de nieuwste modellen enzo te draaien? PyTorch icm rocM die een beetje meekomt?
Kunnen ze niet beter een speciaal AI geheugen chip maken? die 10x efficiënter is als DDR6/7

Zal wat druk op de rest van de markt verlichten. (net als de crypto miners de GPU niet meer nodig hebben)

[Reactie gewijzigd door Bulls op 10 augustus 2026 11:21]

Storage & Compute zitten in dezelfde chip. Je hebt geen geheugenchips ernaast.

https://taalas.com/the-path-to-ubiquitous-ai/
Maar ze gebruiken wel de geheugen chips daar in toch? anders zou de vraag van AI niet zo groot zijn op die chips
Opzich zou dat een valide argument kunnen zijn waare het niet dat alle geheugen chip vormen slecht verkrijgbaar zijn.

Bijvoorbeeld de Ram en opslag in je telefoon zijn totaal niet geschikt voor AI. Dit houdt in dat de bestaande productie lijnen zijn omgebouwd om enkel geheugen te bakken dat wel geschikt is voor AI.

De personeel stakingen bij Samsung zijn de grootste teken geweest van dit voorval. Omzet was opeens 300-400% meer en het personeel kreeg helemaal niks ervoor terug behalve meer overwerk uren.
Dus het is niet dat ze alle ram opkopen maar juist de productie capaciteit van de machines, waardoor er minder overblijft voor consumenten chips
Niet alleen consumenten chips maar ja dat klopt.

Dit lukt enkel omdat de AI boeren twee tot drie keer zoveel betalen om alles om te bouwen. Uiteindelijk moet het terug verdiend worden en hopen ze dat consumenten het gaan betalen.

Het is letterlijk industriële scalping met een AI label.
Geheugen wordt gebruikt om het model in te laden en daarna continu te raadplegen bij het verwerken van elke token. In chipvorm hoeft dit niet, dus heb je geen geheugen nodig. En aangezien het allemaal al op 1 chip zit, kun je deze chip razendsnel raadplegen zonder tussenkomst van PCI-E lanes, RAM/VRAM en CPU/GPU.

Net zo snel als de tijd die het kost voor de chip om 1 complete cyclus te doorlopen. Met de gigaherzen van tegenwoordig is dat een flinke klap sneller dan dat je dat met GPU en het nieuwste type VRAM voor elkaar kan krijgen.

HBM geheugen is specifiek voor AI doeleinden ontworpen. Maar deze beslaan bijna 3 keer het oppervlak van 1 wafer dan een DDR5 RAM module in beslag neemt. En omdat het zoveel oppervlak meer vergt, is het meteen ook veel foutgevoeliger. Dus duurt het fabricage-proces voor de wafer al een stuk langer.

En daarna moeten meerdere wafer-lagen over elkaar heen worden gelegd en dan verbonden worden met flinterdunne gouden draadjes. Een procedure bekend onder de naam: 'Packagen'. Verbinden van lagen vereist een bijzonder hoge mate van precisie. Stel, je moet 8 lagen op deze manier verbinden, dan is het jammer als het bij de 8e laag misgaat. Al het goede werk bij de vorige lagen is dan meteen teniet gedaan.

Erger nog, in deze stage kun je de chip meteen weggooien en valt er niets van her te gebruiken. In de wafer stage zijn er nog mogelijkheden voor hergebruik van de basis materialen, al dan niet voor het maken van HBM geheugen.


Al die stappen consumeren heel snel alle beschikbare produktie-capaciteit bij de grote 3, foutgevoeligheid maakt de chips ook erg duur en daar komt het 'package' proces nog eens overheen.
Dank je voor de uitleg, dit maakt het stukken duidelijker
HC1 gebruikte On-chip SRAM. HC2 is onbekend. Maar deze jongens hebben nog niets wat in produktie gebruikt wordt dus de vraag naar geheugenchips komt niet bij hun vandaan. Als ze iets moois af hebben , dan gaan er wat chipbakkers deze chips maken ipv wat wij als consument nu graag willen kopen en duur is geworden ;-)
AMD heeft dit opgekocht om geen concurrent erbij te krijgen. Zeer twijfelachtig of we dit soort producten ooit gaan zien.

De eerste testkaart die ze hebben geproduceerd was van een zeer klein model en dat was al een relatief grote chip. Een front tier model zou nooit op een kaart passen, laat staan met verliezen of dat soort grote chips ooit realiteit kunnen worden.

Lijkt er meer op dat AMD FOMO bij de aankoop had.

Dit is al oud nieuws overigens.

Om te kunnen reageren moet je ingelogd zijn