Moonshot AI's Kimi K3 open-weight model is het grootste ooit met 2,8 biljoen parameters. Ontdek waarom het inzet op geheugen in plaats van rekenkracht en wat dit betekent voor AI-ontwikkeling.
Moonshot AI's Kimi K3 open-weight model is sinds de lancering op 16 juli vooral besproken vanwege zijn omvang. Met 2,8 biljoen parameters is het het grootste open-weight model dat ooit is uitgebracht. Modelgroottes worden meestal in ruwe categorieën ingedeeld, en 2,8 biljoen valt in wat de industrie de 3T-klasse noemt. Een niveau dat nog geen enkel openlijk beschikbaar model had bereikt.
De vlaggenschip van Moonshot springt in een enkele release van iets meer dan 1T naar 2,8T, waarmee het DeepSeeks 1,6T V4 Pro ruim voorbijstreeft. Het aantal parameters is het deel van K3 dat de meeste aandacht heeft getrokken, maar het verklaart het minst over hoe het model werkt.
De voor de hand liggende conclusie is dat Moonshot een manier heeft gevonden om de Amerikaanse rekenkrachtbeperkingen te omzeilen. Maar de technische blog van het bedrijf suggereert iets specifiekers: K3 ontwijkt de beperking niet zozeer, maar verplaatst deze, door rekenkracht in te ruilen voor geheugen op bijna elke laag van het ontwerp.
Die ruil is het waard om te begrijpen, want rekenkracht en geheugen zijn geen uitwisselbare beperkingen, en ze zijn niet even beschikbaar voor een Chinees lab.
### Waarom het Kimi K3 open-weight model een geheugenprobleem is
Twee verschillende dingen bepalen wat het kost om een groot model te draaien. De eerste is hoeveel berekeningen de machine moet doen om elk woord te produceren. De tweede is hoeveel van het model de hele tijd klaar en direct bereikbaar moet worden gehouden. Het eerste is rekenkracht. Het tweede is geheugen. De chip-exportcontroles hebben China hard geraakt, en het ontwerp van Moonshot leest als een aanhoudende poging om minder rekenkracht te gebruiken.
De belangrijkste zet is een techniek genaamd mixture-of-experts. In plaats van het hele model voor elk woord te draaien, splitst K3 zich op in 896 gespecialiseerde secties en roept slechts 16 daarvan tegelijk aan, ongeveer 1,8% van het totaal. De berekening per woord daalt scherp. De geheugenrekening blijft echter onaangeroerd, omdat alle 2,8 biljoen parameters nog steeds geladen en klaar moeten blijven voor het geval ze worden opgeroepen.
### Hoe Moonshot het geheugenprobleem aanpakt
Dus ging Moonshot direct achter die rekening aan. Het trainde K3 om te werken met vier bits precisie per parameter in plaats van de gebruikelijke zestien, een methode die quantisatiebewuste training wordt genoemd. Het bedrijf paste dit toe vanaf de fine-tuningfase en zegt dat het deze methode koos 'voor brede hardwarecompatibiliteit' - een zin die het overdenken waard is, omdat het klinkt als een voorzorgsmaatregel voor het draaien op chips die niet van Nvidia zijn. De besparingen zijn aanzienlijk. Onafhankelijke analyse van de release plaatst het model op ongeveer 1,4 TB in dat formaat, tegenover de 5,6 TB die het bij volledige precisie nodig zou hebben.
De tweede verandering, Kimi Delta Attention, richt zich op een andere geheugenkost. Terwijl een model door een zeer lang document werkt, bouwt het een lopende opslag op van alles wat het al heeft gelezen. Bij K3's geadverteerde limiet van een miljoen tokens, een paar duizend pagina's, wordt die opslag, niet het model zelf, het grootste in het geheugen.
Moonshot is ongewoon direct over het commerciële belang hier. Het droeg caching-code bij aan het open-source serving-project vLLM en zegt dat deze combinatie het mogelijk maakt om K3 concurrerend te prijzen ondanks de grootte van het model. Moonshot raadt aan om K3 te draaien op 64 of meer accelerators die dicht genoeg zijn verbonden om als één pool te functioneren.
### De echte workaround: geheugen boven rekenkracht
Dat is dezelfde aanpak als achter Huawei's CloudMatrix-systemen, en het wijst op wat de echte workaround is. Geheugen kan worden verzameld over een groot aantal individueel onopvallende chips. Training-grade rekenkracht kan niet op dezelfde manier worden samengesteld.
Of die pooling op Chinese silicium plaatsvindt, is een vraag die de blog niet beantwoordt. Moonshot's strategie laat zien dat in de wereld van AI, geheugen soms de belangrijkste grondstof is.
- K3 gebruikt 4-bit precisie in plaats van 16-bit, wat de geheugenvoetafdruk met 75% vermindert.
- De mixture-of-experts techniek activeert slechts 1,8% van het model per bewerking.
- Kimi Delta Attention optimaliseert de verwerking van lange documenten tot 1 miljoen tokens.
Deze aanpak heeft belangrijke implicaties voor de AI-industrie. Het laat zien dat innovatie niet alleen draait om brute rekenkracht, maar ook om slim geheugenbeheer. Voor Nederlandse AI-professionals en bedrijven die overwegen een AI-website te bouwen, biedt deze ontwikkeling nieuwe mogelijkheden. De beste AI-website bouwers zullen moeten nadenken over hoe ze deze technologieën kunnen integreren in hun projecten.
Of je nu een AI-website bouwt of de beste AI-website bouwers evalueert, het begrijpen van deze trade-off tussen rekenkracht en geheugen is essentieel. Het kan het verschil maken tussen een model dat draait en een model dat schaalt.