AI voor cpu én gpu
AI is al jaren het belangrijkste thema tijdens Arm Tech Days, waar het bedrijf dieper ingaat op zijn nieuwe platform. En al jaren houdt Arm vast aan het standpunt dat een echte, losse npu niet nodig is. Van de kwart miljoen AI-apps in Google Play en de App Store draait 95 procent op de cpu, volgens eigen onderzoek.
Maar de cpu krijgt wel degelijk versterking voor AI-workloads. De vorig jaar geïntroduceerde module voor Scalable Matrix Extension 2 (SME2) wordt flink uitgebreid. Toen zei Arm aan één SME2-unit genoeg te hebben: AI-workloads zijn toch zelden parallel. Maar met de opkomst van agentic AI, ook op mobiel, draaien agents juist wel vele processen naast elkaar. En dan is de tweede SME2-unit die Arm nu in zijn clusters stopt heel welkom.
/i/2008348246.png?f=imagenormal)
En dat is niet alles, want ook de gpu krijgt een soort npu aan boord. De nieuwe Mali-gpu krijgt namelijk neural accelerators rechtstreeks in de shaders. Die moeten helpen om games vloeiender, in hoge resolutie en met een hoog detailniveau op je scherm weer te geven.
De nieuwe gpu bevat neural accelerators, die Arm NX noemt. De gpu, de vernieuwde cpu-cores en SME2-units in het cpu-cluster en de System Interconnect vormen samen Arm Compute Subsystems (CSS) for Mobile 2. Dat is Arms nieuwe platform voor clientapparaten. De eerste producten ermee verschijnen nog dit jaar.
Twee SME2-units voor parallelle AI
Het belangrijkste nieuws voor het cpu-cluster is de verdubbeling van Scalable Matrix Extension 2 (SME2). In het platform van vorig jaar zat een enkele SME2-unit in het cluster. Nu zijn dat er twee. SME2-units zijn voornamelijk bedoeld als AI-accelerators. Matrixberekeningen vormen namelijk de hoofdmoot van AI-berekeningen.
Voorheen draaiden AI-workloads vooral om generatieve AI-apps die directe interactie met de gebruiker hebben. De volgende stap is agentic AI, waarbij meerdere AI-agents allerlei taken moeten uitvoeren. Omdat veel meer taken parallel lopen, is een tweede SME2-unit nuttig.
Naast het aantal SME2-units is ook de kloksnelheid verhoogd. De enkele SME2-unit in het platform van vorig jaar draaide op 2GHz. De twee units in het nieuwe platform werken op maximaal 3GHz.
C2-Ultra: hogere prestaties op 2nm
Arm hield de deep dive vrij oppervlakkig. Los van de tweede unit voor SME2 waren er weinig details over de nieuwe cpu-cores. Wel deelde Arm wat prestatiedata, maar daarbij moet je onderscheid maken tussen de winst door een kleinere productienode en die door optimalisaties in de cores.
/i/2008348228.png?f=imagenormal)
De C2-Ultra-core moet 15 procent hogere singlethreadprestaties en 12 procent hogere multithreadprestaties leveren. Daarvan is 7 procent aan echte ipc-winst door ontwerpaanpassingen toe te schrijven. De rest is te danken aan de overstap van het 3nm-platform van vorig jaar naar een 2nm-node.
Die nieuwe node maakt ook hogere klokfrequenties mogelijk. De C1-Ultra piekte vorig jaar op 4,1GHz, maar de C2-Ultra draait op maximaal 4,45GHz.
De belangrijkste architectuurverbetering is dat de cores efficiënter worden benut. De execution engine is groter, waardoor de C2-Ultra-core meer bewerkingen tegelijk kan uitvoeren. Die engine, zeg maar de daadwerkelijke rekeneenheden, moet wel beziggehouden worden, en liefst met nuttige taken.
Aan de ene kant zorgt betere branch prediction daarvoor. Die voorspelt welke volgende berekeningen nodig gaan zijn. Een fout hier (een branch misprediction) zorgt ervoor dat berekeningen voor de verkeerd voorspelde aftakking onnodig zijn uitgevoerd. Dat kost zowel tijd als energie.
Aan de andere kant is smart speculation verbeterd en is het execution window vergroot. Dat moet ervoor zorgen dat er altijd instructies klaarstaan voor uitvoering, zelfs als de uitkomst van een vorige berekening nog niet beschikbaar is. Daardoor hoeven de cpu-cores nooit op werk te wachten en voeren ze zo min mogelijk onnodig werk uit. Dat moet niet alleen de prestaties verhogen, maar ook energie besparen.
DSU en geheugen: lagere latency, meer bandbreedte
Alle cores zitten in het corecomplex met de DynamIQ Shared Unit (DSU) als verbindende fabric. Deze DSU bevat naast de twee units voor SME2 ook de L3-cache. Die cache loopt op 2GHz, maar als er naar het werkgeheugen uitgeweken moet worden, is het nieuwe platform wel een stuk sneller.
/i/2008348226.png?f=imagenormal)
De latency van de dram-interface is dankzij een nieuwe SI L2 (de System Interconnect) 45 procent lager.
/i/2008348244.png?f=imagenormal)
Het nieuwe platform spreekt het geheugen niet alleen met een lagere latency aan, maar ondersteunt ook sneller geheugen. De Arm-chips uit 2026 ondersteunen Lpddr6-dram, terwijl het 2025-platform Lpddr5X voor de cpu en Lpddr6 alleen voor de gpu ondersteunde. Dat levert een klap meer bandbreedte op voor het geheugen: van 76,8GB/s naar 136GB/s.
Premium, Pro en Nano: de overige C2-cores
Naast de C2-Ultra zijn er natuurlijk nog andere cores. De bijna-Ultra-core is de Premium-core: die deelt de architectuur met de Ultra-core. De Premium-core is 35 procent kleiner dan de Ultra-core. Daardoor is minder waferoppervlak nodig en dalen de kosten.
Dan zijn er nog de Pro-core en de zuinige Nano-cores, beide met een eigen architectuur. De C2-Pro tikt ook iets sneller dan de C1-Pro. De kloksnelheid stijgt van 3,5GHz naar 3,6GHz. Daarnaast is de instruction translation lookaside buffer (itlb) vergroot van 32 naar 48 entry's. Zo kunnen instructies sneller opgezocht worden.
Samen met de (optionele) units voor SME2 zitten ze in het cpu-cluster. Je kunt het cluster, zoals je gewend bent, flexibel samenstellen. Zo heeft een mini-soc alleen een paar Nano-cores, zonder SME2-units aan boord. En aan de andere kant van het spectrum, in een high-end telefoon, kunnen bijvoorbeeld twee Ultra-cores en zes Pro-cores plus twee SME2-units zitten.
/i/2008348260.png?f=imagenormal)
Voor vergelijkingen met het platform van vorig jaar gebruikt Arm een soc met twee Ultra-cores, zes Pro-cores en een gpu met 14 cores.
Mali G2-Ultra NX: AI in de gpu
Volgens Arm is de convergentie met desktopgaming een van de belangrijkste ontwikkelingen binnen mobiel gamen. Gebruikers verwachten steeds meer van mobiele games en willen een ervaring die vergelijkbaar is met die van desktopgames. Dat betekent hoge framerates, veel details, hoge resoluties en realistische belichting.
/i/2008348214.png?f=imagenormal)
In de cpu zijn de AI-spierballen uitgebreid, maar in de gpu zaten ze tot dusver nog helemaal niet. Met de toevoeging van Arms Neural Accelerators komt daar verandering in. Die NX-units zijn volledig in de gpu geïntegreerd, maar draaien wel op hun eigen kloksnelheid.
Neural Accelerators
De Neural Accelerators zitten in de shadercores (die zorgen voor het 'gewone' renderen: rasterrendering of rasterized rendering) en hebben twee taken. Ten eerste schalen ze beelden op met Neural Super Sampling (NSS). Ten tweede verdubbelen ze met Neural Frame Rate Upscaling (NFRU) de framerate van de gpu door extra frames te genereren.
/i/2008348210.png?f=imagenormal)
Dat samenspel van beeld- en framerate-upscaling zorgt ervoor dat de shadercores nog maar een achtste van de frames daadwerkelijk hoeven te renderen. De resolutie-upscaling gebruikt een factor 2x2, zodat de resolutie verviervoudigt. Zo hoeven de shaders maar een kwart van de pixels van een frame te renderen.
Framerate verdubbelen
Vervolgens verdubbelt NFRU de framerate: tussen elk gerenderd en opgeschaald frame genereert deze engine een volledig extra frame. Zo halveert het werk voor de shaders dus opnieuw, en komen we uit op een achtste van de pixels die nog gerenderd hoeven te worden.
/i/2008348204.png?f=imagenormal)
Efficiëntere raytracing met nieuwe rtu
De Mali-gpu's ondersteunen al een paar jaar raytracing, en die techniek wordt steeds volwassener. De nieuwste implementatie moet realistischer belichting mogelijk maken door nog meer elementen te raytracen. Om de extra werklast te beperken, maakt ook de derde generatie raytracingunit (rtu) gebruik van handige technieken.
/i/2008348212.png?f=imagenormal)
Zo moeten hardwarematige opacity micromaps (omm) de rtu fijnmazig vertellen of een textuur (deels) voor rays transparant is of niet. Bij oudere versies moest die informatie aan de gpu gevraagd worden, wat de prestaties beperkte. Omm moet de framerates in raytracinggames tot zo'n 30 procent verhogen.
Driehoeken samenvoegen
Het aantal triangles in een frame belast het geheugen (zowel de cache als het externe dram) van de gpu zwaar. Een complexe scène bevat veel triangles, die elk als een aparte entiteit worden behandeld. In de derde generatie rtu worden triangles waar mogelijk gecombineerd. Als ze gedeelde randen hebben, vallen zo een of meer dubbele randen weg.
/i/2008348220.png?f=imagenormal)
Omdat raytracing steeds complexer moet worden om die desktopervaring te benaderen, zijn veel meer rays nodig dan de rtu's aankunnen. Dat levert een beeld met veel ruis op, die verhuld moet worden met denoisingfilters. Als je dat met de botte bijl doet, wordt het beeld wat wazig en mis je detail. Maar als je het netjes wilt doen, kost het veel energie om binnen het powerbudget van pakweg 1W voor de gpu te blijven.
Neural Super Sampling & Denoising
Arm lost dat op door Neural Super Sampling & Denoising (NSSD) in te zetten. Dat draait op de neural accelerators en probeert ruis te verwijderen zonder details wazig te maken.
/i/2008348218.png?f=imagenormal)
De NX-units moeten, samen met de vernieuwde rtu's van de derde generatie en verbeteringen in de shaders, zorgen voor die 'graphics met desktopkwaliteit'. Daarbij moet ook de executionengine, die geoptimaliseerd is voor Unreal Engine 5.5, helpen.
/i/2008348216.png?f=imagenormal)
Volgens Arms demo's en tests zouden de nieuwe Mali G2-Ultra NX-gpu's tot vier keer hogere framerates mogelijk maken. Bovendien zouden de gpu's zuiniger zijn dankzij minder dram-verkeer en efficiëntere inzet van de hardware.
CSS for Mobile 2: het complete platform
Ik noemde bij de prestatieverbeteringen van de cpu-cores al even de nieuwe node. Arm optimaliseert sinds kort niet alleen voor specifieke nodes, maar maakt ook de hardwareontwerpen. Dit jaar stappen de Britten over van een 3nm- naar een 2nm-procedé.
/i/2008348222.png?f=imagenormal)
Dat betekent meer transistors op hetzelfde oppervlak of kleinere chips. Kleinere transistors zijn ook zuiniger, want ze hebben minder energie nodig om te schakelen. De power-performancecurve is dan ook weer flink naar rechts verschoven. De cpu-cores presteren 15 procent beter. Het energiegebruik daalt bij gelijke prestaties met maar liefst 38 procent.
CSS for Mobile 2
Het complete platform heet, in navolging van vorig jaar, Compute Subsystems (CSS) for Mobile 2. Dat bestaat uit het C2-cpu-cluster inclusief de units voor SME2, de nieuwe Mali G2-Ultra NX-gpu en de system interconnect met de controllers voor geheugen en netwerk.
/i/2008348268.png?f=imagenormal)
Een van de rode draden, naast natuurlijk AI, is geheugentoegang. Of liever: minder geheugentoegang. Want voor het energiebudget is het 'duur' om van de soc naar 'buiten' te gaan. Daarom worden caches steeds groter en worden architecturen geoptimaliseerd om de juiste informatie uit het geheugen in die caches te laden.
De cpu doet dat onder andere met betere branch prediction en prefetchers en speciale instructies in de SME2-engine. De gpu doet dat voornamelijk door veel pixels niet te renderen maar te genereren. Dat moet de toegang tot dram het sterkst verminderen, tot wel 70 procent. Ook de framegeneratie en raytracingverbeteringen verminderen die toegang met respectievelijk maximaal 33 en 13 procent.
Hardware: Dimensity 9600
Het wachten is nu op hardware met dit nieuwe platform aan boord. De voorganger, CSS for Mobile, heeft inmiddels zijn weg gevonden in de MediaTek Dimensity 9500-chipset. Die wordt vooral in Chinese telefoons van OPPO en vivo gebruikt. De opvolger vind je in Dimensity 9600-producten. Die komen in toestellen van dezelfde fabrikanten.
/i/2008348240.png?f=imagenormal)
Maar losse of aangepaste versies van dit nieuwe platform komen natuurlijk ook in andere smartphones terug. Zo gebruikt Samsung in de Exynos-chipset de cpu-clusters en vormt CSS de basis voor veel andere socs. Dat is de kracht van het licentieprogramma van Arm: iedereen kan bouwblokken afnemen.
Software en ontwikkeltools
Dan is er nog de software, een steeds belangrijker speerpunt bij Arm. Want de productcycli van hardware worden steeds korter. Als fabrikanten vervolgens lange tijd bezig zijn het maximale uit de hardware te halen, is dat nogal inefficiënt.
Daarom stelt Arm frameworks en andere ontwikkeltools beschikbaar om de hardware te ontsluiten. Het KleidiAI-framework moet het ontwikkelen van AI-toepassingen met Arm-hardware al makkelijker maken, maar Arm voegt daar nu ook een AI Portal aan toe.
/i/2008348276.png?f=imagenormal)
Die AI Portal geeft ontwikkelaars kant-en-klare AI-toepassingen, die ze direct kunnen implementeren. Via de AI Portal heb je ook direct toegang tot geoptimaliseerde AI-modellen voor toepassingen die de units voor SME2, de NX-gpu en overige Arm-componenten gebruiken. En wil je je eigen modellen en applicaties implementeren, dan zijn daar ook optimalisatietools voor beschikbaar.
Conclusie: sneller, zuiniger en sterk gericht op AI
Arm wil met het 2026-platform nog nadrukkelijker AI-toepassingen ondersteunen. Daarbij verschuift de focus, geheel volgens de trend, van generatieve naar agentic AI. Vooral de extra unit voor SME2 en de geheugenoptimalisaties moeten daarvoor de nodige ondersteuning bieden.
Arm heeft ook de Mali-gpu sterk verbeterd. Ook de gpu leunt zwaar op AI om met een heel bescheiden energiebudget 'desktopgraphics' te leveren, of in ieder geval iets dat daarbij in de buurt komt. Pixels en frames worden voor een flink deel gegenereerd in plaats van gerenderd, zodat de gpu beelden met veel detail en hoge framerates kan tonen. En om het realisme verder te verhogen, wordt raytracing krachtiger, maar wel met de nodige trucs voor betere prestaties.
/i/2008348270.png?f=imagenormal)
Maar ook als je niets om AI op je telefoon geeft, is het nieuwe platform van Arm nog altijd interessant. Want het cpu-cluster is weer een stuk krachtiger geworden met de verbeterde cores. Die prestaties nemen verder toe dankzij een kleiner productieprocedé en ondersteuning voor sneller geheugen.
En tot slot kan je accu weer een poosje langer mee, want Arm heeft geprobeerd het CSS for Mobile 2-platform op alle fronten zuiniger te maken. En mocht je toch AI-tools gebruiken, dan maakt Arm het ontwikkelaars wel erg makkelijk, aan zowel de hardware- als softwarekant.
Redactie: Willem de Moor • Eindredactie: Monique van den Boomen