NVIDIA's AI Supply Chain: Hoe Palantir Foundry en cuOpt de Toewijzing Transformeren

·
Luister naar dit artikel~5 min
NVIDIA's AI Supply Chain: Hoe Palantir Foundry en cuOpt de Toewijzing Transformeren

Ontdek hoe NVIDIA Palantir Foundry en cuOpt inzet om de toewijzing van zijn hardware-supply chain te automatiseren. Van wafer tot token: de uitdagingen en oplossingen.

Stel je voor: een wereldwijd netwerk van fabrieken, duizenden leveranciers en miljoenen componenten die allemaal op het juiste moment moeten samenkomen. Dat is de uitdaging waar NVIDIA voor staat bij de productie van zijn geavanceerde AI-hardware. Om dit te beheersen, vertrouwt het bedrijf op Palantir Foundry en cuOpt, een combinatie die de toewijzing van de supply chain automatiseert. ### Van wafer tot eerste token: de reis van een GPU NVIDIA meet de operationele doorlooptijd van 'wafer-out' tot 'first token'. Dat klinkt technisch, maar het komt neer op de tijd die nodig is om van een ruwe wafer een volledig werkend datacenter te maken. Deze periode valt uiteen in twee delen: - **Time-to-rack:** de tijd die nodig is om van fabrieksoutput naar een geassembleerd datacenter-systeem te komen. - **Time-to-token:** de tijd die nodig is voor stroom, koeling, netwerk en software die vanaf dag één klaar moet zijn. Elke stap telt, want vertraging betekent gemiste kansen in de snel evoluerende AI-markt. ### De complexiteit van NVL72 en Vera Rubin Neem bijvoorbeeld een NVIDIA Grace Blackwell NVL72-rack. Die bevat 18 compute trays, elk met twee Grace CPU's, vier Blackwell GPU's en 32 HBM3e geheugenpakketten. Die onderdelen komen van duizenden leveranciers, OEM's en designpartners over de hele wereld. En dan hebben we het nog niet over de volgende generatie: de Vera Rubin-architectuur. De supply chain die daarvoor wordt opgetuigd, is twee keer zo groot als die voor Grace Blackwell. Dat is een enorme uitdaging. De assemblage kan pas beginnen als alle onderdelen uit drie kanalen binnen zijn: directe voorraad, consignatievoorraad en externe leveranciers. Vroege zendingen moeten wachten op vertraagde componenten, wat de 'Time of Ownership' verlengt: de tijd tussen ontvangst van materialen en het vertrek van voltooide subassemblages. ### Wekelijkse herziening van toewijzingen Fabriekstoewijzingen worden wekelijks herzien over een rollende horizon van twee kwartalen. Dat gebeurt om beschikbaarheid van onderdelen, doorvoerlimieten en klantorders op elkaar af te stemmen. Het is een continu proces van plannen en bijsturen. ### Mixed-integer linear programming met cuOpt Om al deze afhankelijkheden te coördineren, bouwde het operations-team van NVIDIA het 'Digital Supply Chain Intelligence'-commandocentrum met Palantir Foundry. Foundry's Ontology modelleert faciliteiten, leveranciersverplichtingen, componentvoorraden en productiedoelen als onderling verbonden objecten en relaties. NVIDIA cuOpt, een open-source bibliotheek voor GPU-versnelde beslissingsoptimalisatie, leest deze operationele laag direct. Het formuleert de distributie als een mixed-integer linear program dat de Time of Ownership minimaliseert. De solver evalueert onderdeelbeperkingen over elke laag van de bill of materials. Naast wekelijkse leveringsschema's identificeert cuOpt ook actieve fabriekslimieten, zoals regionale assemblagecapaciteit versus beschikbaarheid van ruw geheugen. ### Training van Nemotron op kwalitatieve operationele data Wiskundige optimalisatie alleen bleek niet genoeg. Menselijke planners houden rekening met ongestructureerde factoren: transcripties van leveranciersgesprekken, regionale weersvoorspellingen, e-mailuitwisselingen met partners en geopolitieke gebeurtenissen. Daarom trainde NVIDIA de Nemotron 3.5 Lightning, een open-weight mixture-of-experts model met 30 miljard totale parameters en ongeveer 3 miljard actieve parameters per forward pass. De engineering-pipeline verwerkt historische data via NeMo Anonymizer om gevoelige velden te redigeren, NeMo Data Designer om trainingsvoorbeelden te balanceren met synthetische scenario's, en NeMo AutoModel voor low-rank adaptation (LoRA) terwijl de basisgewichten bevroren blijven. Palantir Autopilot beheert data lineage, model tracking en levering van aanbevelingen. ### Productiebenchmarks en toekomstige reinforcement learning Geëvalueerd op historische toewijzingsdata behaalde het getrainde Nemotron 3.5 Lightning-model een beslissingsnauwkeurigheid van 86,7%. Dat is aanzienlijk beter dan het grotere Nemotron 3 Ultra-model (55,5%) en het ongetrainde Lightning-basismodel (17,5%). Het getrainde model scoorde ook een gebalanceerde nauwkeurigheid van 58,6% en een macro-F1 van 57,5%, tegenover 42% en 39,5% voor Nemotron 3 Ultra. Fine-tuning voltooide op twee NVIDIA B200 GPU's binnen enkele minuten. Domein-fine-tuning verbeterde de toewijzingsbeslissingen, hoewel het voorspellen van productierisico's verder in de toekomst moeilijk bleef. Operationele keuzes, herzieningen van planners, overrides en waargenomen fabrieksoutput worden continu teruggeschreven naar de Palantir Ontology. NVIDIA bevestigde dat deze dataset zal worden gebruikt voor verdere reinforcement learning. > "De combinatie van Palantir Foundry en cuOpt stelt ons in staat om sneller en nauwkeuriger te reageren op veranderingen in de supply chain," aldus een NVIDIA-woordvoerder. De les? Zelfs in een wereld van geavanceerde AI blijft de menselijke factor belangrijk. Door kwalitatieve data te combineren met krachtige optimalisatie, zet NVIDIA een nieuwe standaard voor supply chain management.