Poolside AI tränade en 118-miljardersmodell som slår DeepSeeks öppna jätte
Poolside AI:s medgrundare Eiso Kant berättar hur ett litet forskarteam byggde en intern träningsinfrastruktur ('model factory') kapabel att producera Laguna S – en 118 miljarder parameters stor MoE-modell (Mixture of Experts, ett sätt att göra stora modeller mer effektiva) som enligt företaget slår DeepSeeks öppna viktmodell på runt en biljon parameters. Det intressanta är inte bara prestandan utan att ett relativt litet team lyckades bygga hela kedjan från grunden – och Kant antyder att det här bara är början.
Djupdykning
Poolside AI har gjort något ganska anmärkningsvärt: ett litet team har byggt en så kallad "model factory" – i princip en automatiserad pipeline för att träna, utvärdera och iterera på stora språkmodeller i industriell skala. Deras modell Laguna S är en 118 miljarder parameters Mixture-of-Experts-arkitektur (MoE betyder att modellen aktiverar olika specialiserade "experter" för olika uppgifter, istället för att alltid köra alla parametrar), och den slår alltså Thinkers öppna modell som är runt tio gånger större på pappret. Det som de flesta missar i den här historien är att parameterstorlek länge har fungerat som en slags statusmarkör i AI-världen – men det håller på att bli ett trubbigt mått, ungefär som att jämföra bilar på motorvolym när det egentliga måttet borde vara bränsleeffektivitet. Poolsides approach antyder att rätt träningsinfrastruktur och datakvalitet kan vara viktigare än råa resurser, vilket är en direkt utmaning mot antagandet att bara de allra rikast finansierade bolagen kan spela i toppskiktet. Om den logiken håller kommer vi se fler mindre teams producera modeller som konkurrerar med vad som kostat hundratals miljoner dollar att träna – och det förändrar hela maktdynamiken i branschen.