Moonshot AI's Kimi K3 is met 2,8 biljoen parameters het grootste open-weight model ooit. Maar het echte nieuws is hoe het rekenkracht inruilt voor geheugen, een strategische zet onder exportbeperkingen.
Stel je voor: je bouwt een kolossaal taalmodel van 2,8 biljoen parameters. Dat is het grootste open-weight model ooit uitgebracht. Maar in plaats van te pronken met pure rekenkracht, heeft Moonshot AI iets slimmers gedaan. Ze hebben een ontwerp gekozen dat draait om geheugen, niet om brute force. En dat is niet alleen technisch interessant, het vertelt ons ook veel over hoe AI-ontwikkeling in China werkt onder exportbeperkingen.
### Wat is er zo bijzonder aan de Kimi K3?
De Kimi K3 van Moonshot AI is op 16 juli gelanceerd en meteen viel de parametercount op: 2,8 biljoen. Dat plaatst het in de 3T-klasse, een categorie die nog geen enkel open model had bereikt. Ter vergelijking: DeepSeeks V4 Pro had 1,6 biljoen parameters. De sprong is enorm, maar de parametercount is niet het hele verhaal.
Het echte nieuws is hoe Moonshot dit heeft bereikt. In plaats van te vertrouwen op de nieuwste Amerikaanse chips, heeft het bedrijf een slimme truc uitgehaald: het ruilt rekenkracht in voor geheugen. Dat klinkt misschien technisch, maar het is een strategische zet die de grenzen van AI-ontwikkeling opnieuw definieert.
### Hoe werkt de geheugenruil?
Er zijn twee dingen die bepalen wat het kost om een groot model te draaien: hoeveel berekeningen de machine doet voor elk woord (rekenkracht) en hoeveel van het model direct beschikbaar moet zijn (geheugen). Chip-exportcontroles hebben China hard geraakt, dus Moonshot moest creatief zijn.
Het belangrijkste is de mixture-of-experts techniek. In plaats van het hele model te gebruiken voor elk woord, splitst K3 zich op in 896 gespecialiseerde secties en activeert er slechts 16 tegelijk. Dat is ongeveer 1,8% van het totaal. De berekening per woord daalt enorm, maar het geheugen blijft hetzelfde, omdat alle 2,8 biljoen parameters klaar moeten staan.
### Kwantisatie: minder bits, minder geheugen
Om het geheugenprobleem aan te pakken, heeft Moonshot een techniek gebruikt die kwantisatiebewuste training heet. In plaats van 16 bits per parameter, werkt K3 met slechts 4 bits. Dit klinkt als een kleine aanpassing, maar de besparingen zijn enorm. Onafhankelijke analyses schatten dat het model in dit formaat ongeveer 1,4 TB nodig heeft, tegenover 5,6 TB bij volledige precisie. Dat is een besparing van meer dan 75%.
### Kimi Delta Attention: slim omgaan met lange documenten
Een andere uitdaging is het verwerken van extreem lange documenten. Stel je voor dat je een boek van duizend pagina's analyseert. Het model moet alles onthouden wat het heeft gelezen, en die opslag kan groter worden dan het model zelf. Moonshot heeft hiervoor Kimi Delta Attention ontwikkeld, een techniek die het decoderen tot 6,3 keer sneller maakt bij contexten van een miljoen tokens.
### Commerciële implicaties en de toekomst
Moonshot is opvallend open over de commerciële kant. Ze hebben caching-code bijgedragen aan het open-source project vLLM, waardoor ze K3 concurrerend kunnen prijzen ondanks de grootte. Het bedrijf adviseert om K3 te draaien op 64 of meer accelerators die dicht genoeg zijn verbonden om als één geheel te functioneren. Dit is dezelfde aanpak als Huawei's CloudMatrix-systemen.
Het echte werk rondom de beperkingen is duidelijk: geheugen kan worden verzameld over een groot aantal individueel onopvallende chips. Training-grade rekenkracht kan niet op dezelfde manier worden samengesteld. Of deze pooling op Chinese silicium plaatsvindt, is een vraag die de blog van Moonshot niet beantwoordt.
### Wat dit betekent voor AI-professionals in Nederland
Voor AI-professionals die werken met AI-websitebouwers en -tools, is dit een belangrijke ontwikkeling. Het laat zien dat je niet altijd de nieuwste hardware nodig hebt om indrukwekkende resultaten te behalen. Slimme architectuur en optimalisatie kunnen net zo effectief zijn. Dit opent de deur voor meer toegankelijke AI-oplossingen, ook in markten waar geavanceerde chips moeilijk te krijgen zijn.
- **Praktische tip:** Overweeg of jouw AI-tools gebruikmaken van mixture-of-experts of kwantisatie. Dit kan de kosten aanzienlijk verlagen.
- **Strategisch inzicht:** De focus op geheugen in plaats van rekenkracht kan een trend worden, vooral in regio's met beperkte toegang tot high-end chips.
De Kimi K3 is meer dan een technische prestatie; het is een statement over hoe AI-ontwikkeling zich aanpast aan geopolitieke realiteiten. En voor ons in Nederland biedt het lessen die we kunnen toepassen in onze eigen projecten, of we nu werken aan AI-websitebouwers of geavanceerde taalmodellen.