Waarom China's grootste AI-model niet draait om rekenkracht, maar om geheugen

·
Luister naar dit artikel~5 min
Waarom China's grootste AI-model niet draait om rekenkracht, maar om geheugen

Moonshot AI's Kimi K3 open-weight model is het grootste ooit met 2,8 biljoen parameters. Maar de echte innovatie zit in het ruilen van rekenkracht voor geheugen. Lees hoe dit werkt.

Toen Moonshot AI op 16 juli zijn Kimi K3 open-weight model lanceerde, was de wereld vooral onder de indruk van het aantal parameters: 2,8 biljoen. Dat maakt het het grootste open-weight model dat ooit is uitgebracht. In de industrie wordt dit de '3T-klasse' genoemd, een niveau dat geen enkel open model eerder had bereikt. De sprong van Moonshot is indrukwekkend: van iets meer dan 1 biljoen parameters naar 2,8 biljoen in één release. Daarmee laat het DeepSeeks 1,6 biljoen V4 Pro ver achter zich. Maar hier is het interessante: het aantal parameters zegt eigenlijk het minste over hoe het model echt werkt. ### Wat is Kimi K3 precies? Kimi K3 is een open-weight AI-model dat is ontworpen om te concurreren met de beste modellen ter wereld. Het bijzondere is niet alleen de grootte, maar vooral hoe het is gebouwd. Moonshot heeft namelijk een slimme truc uitgehaald: in plaats van meer rekenkracht te gebruiken, hebben ze ingezet op geheugenoptimalisatie. De natuurlijke conclusie zou zijn dat Moonshot de Amerikaanse exportbeperkingen heeft omzeild. Maar het technische blog van het bedrijf vertelt een ander verhaal: K3 ontwijkt de beperkingen niet, het verplaatst ze. Het ruilt rekenkracht in voor geheugen, op bijna elk niveau van het ontwerp. ### Waarom geheugen belangrijker is dan je denkt Twee dingen bepalen wat het kost om een groot model te draaien. Ten eerste: hoeveel berekeningen de machine moet doen om elk woord te produceren. Ten tweede: hoeveel van het model constant klaar moet staan en direct bereikbaar moet zijn. Het eerste is rekenkracht, het tweede is geheugen. De chip-exportcontroles hebben China hard geraakt. Moonshots ontwerp is een poging om minder rekenkracht te verbruiken. ### De truc: mixture-of-experts De belangrijkste techniek heet mixture-of-experts. In plaats van het hele model voor elk woord te gebruiken, splitst K3 zich op in 896 gespecialiseerde secties. Voor elk woord worden er maar 16 tegelijk gebruikt, ongeveer 1,8% van het totaal. De berekening per woord daalt enorm, maar het geheugengebruik blijft hetzelfde. Alle 2,8 biljoen parameters moeten namelijk nog steeds geladen en klaar staan. ### Quantisatie: de geheugenbesparing Moonshot pakte het geheugenprobleem direct aan. Ze trainden K3 om te werken met vier bits precisie per parameter in plaats van de gebruikelijke zestien. Dit heet quantisatie-aware training. Het bedrijf zegt dat het deze methode koos 'voor brede hardware-compatibiliteit', wat klinkt als een voorzorgsmaatregel voor het geval de chips niet van Nvidia zijn. De besparingen zijn aanzienlijk. Onafhankelijke analyse laat zien dat het model in dit formaat ongeveer 1,4 TB groot is, tegen 5,6 TB bij volledige precisie. ### Kimi Delta Attention: nog een geheugenbesparing De tweede verandering, Kimi Delta Attention, richt zich op een ander geheugenprobleem. Als een model een heel lang document verwerkt, bouwt het een lopende opslag op van alles wat het al heeft gelezen. Bij K3's limiet van een miljoen tokens, een paar duizend pagina's, wordt die opslag het grootste onderdeel in het geheugen. ### De commerciële kant Moonshot is opvallend direct over het commerciële belang. Ze hebben caching-code bijgedragen aan het open-source project vLLM en zeggen dat deze combinatie het mogelijk maakt om K3 concurrerend te prijzen ondanks de grootte. Het bedrijf raadt aan om K3 te draaien over 64 of meer accelerators die zo zijn verbonden dat ze als één geheel werken. Dit is dezelfde aanpak als achter Huaweis CloudMatrix-systemen. Het laat zien wat de echte oplossing is: geheugen kan worden verzameld over een groot aantal individueel onopvallende chips. Trainingskwaliteit rekenkracht kan niet op dezelfde manier worden samengesteld. ### Een paar dingen om te onthouden - Kimi K3 heeft 2,8 biljoen parameters, maar gebruikt maar 1,8% per keer - Het model is getraind met vier bits precisie, wat geheugen bespaart - De combinatie van mixture-of-experts en quantisatie maakt het uniek Of deze aanpak ook werkt op Chinese chips, dat is een vraag die het blog niet beantwoordt. Maar één ding is zeker: Moonshot heeft een innovatieve weg gekozen die de grenzen van wat mogelijk is verlegt.