OpenAIs eget chip ska slippa kompromissen mellan snabbhet och kapacitet

De flesta som bygger på AI-API:er har lärt sig att leva med en tyst kompromiss: vill du ha snabba svar per request, eller vill du stoppa in så många requests som möjligt parallellt? Normalt är det ett antingen-eller. OpenAIs hårdvaruchef Richard Ho påstår att Jalapeño gör det till ett både-och.
Jalapeño är ett ASIC, alltså ett chip designat för ett enda syfte, byggt ihop med Broadcom specifikt för AI-inferens. Inte träning, inte forskning, utan det OpenAI faktiskt gör i produktion varje sekund: köra färdiga modeller mot miljontals requests.
Det är värt att stanna vid vad det faktiskt innebär om det stämmer. Latens och genomströmning har traditionellt konkurrerat om samma hårdvaruresurser. Hög genomströmning kräver att chipet batchar requests och väntar in fler jobb innan det kör, vilket ökar latensen. Låg latens kräver att chipet prioriterar individuella requests direkt, vilket slösar kapacitet. Ett chip som verkligen klarar båda utan kompromiss vore en arkitekturell bedrift, inte bara ett marknadsföringspåstående.
OpenAI har ännu inte publicerat oberoende benchmarks, så Hos ord får tills vidare stå mot sig själva. Men riktningen är tydlig: efter år av beroende av Nvidia vill OpenAI äga hela stacken, inklusive kisel. Jalapeño är inte det första steget i den strategin, men det är det första med ett namn och en pressrelease.
För den som bygger produkter på OpenAI-API:er förändrar detta ingenting direkt idag. Men på sikt avgör just den här typen av hårdvarukontroll vad som är möjligt att erbjuda utan att förlora pengar på varje token, och det påverkar vad som händer med prissättning, hastighetsgränser och vilka modeller som faktiskt görs tillgängliga.


