NVIDIAs nya Vera Rubin-chip siktar på lägre kostnad per AI-token

NVIDIA AI Blog

NVIDIA presenterar sin Vera Rubin-arkitektur med fokus på att sänka kostnaden per token – alltså priset för varje textenhet som en AI-modell bearbetar – vilket är centralt när företag bygger agentbaserade AI-system som kör tunga arbetsbelastningar efter träningsfasen. Det intressanta här är skiftet i vad branschen optimerar för: inte längre råprestanda utan hur mycket intelligens man får per spenderad dollar.

Djupdykning

NVIDIAs nya Vera Rubin-arkitektur är designad med ett specifikt mål i sikte: att pressa ned kostnaden per "token" — alltså per textbit som en AI-modell processar — till absolut minimum. Det låter tekniskt, men handlar i praktiken om att göra det billigare att köra AI-agenter, de system som inte bara svarar på frågor utan faktiskt utför uppgifter autonomt under längre tid. Post-training, som är det fokusområde NVIDIA lyfter fram, är fasen där en färdigtränad modell finjusteras för specifika användningsområden — och den fasen blir allt dyrare ju mer avancerade agenterna blir. Det som många missar i diskussionen om AI-chips är att striden inte längre handlar om vem som kan träna de största modellerna, utan om vem som kan köra dem billigast i produktion — för det är där de riktiga pengarna slussas igenom varje dag. Vera Rubin signalerar att NVIDIA ser agentic AI, alltså autonoma AI-system som agerar i världen snarare än att bara generera text, som nästa stora kostnadsutmaning för hela branschen — och de vill äga den infrastrukturen.