Startups satsar på nästa generation av språkmodeller
Sedan Googles banbrytande transformer-arkitektur (den teknik som ligger till grund för moderna AI-modeller) presenterades 2017 har hela branschen byggt vidare på samma grund – men nu börjar startups utmana den dominansen. Flera bolag forskar på alternativa arkitekturer som lovar att vara snabbare, billigare eller mer effektiva än dagens stora språkmodeller. Det är i grunden en satsning på att nästa stora genombrott inte kommer från att göra transformer-modeller ännu större, utan från att ersätta dem helt.
Djupdykning
Allt vi kallar "AI" idag – ChatGPT, Claude, Gemini – bygger på samma grundarkitektur som beskrevs i det där Google-pappret från 2017, och det är en smula alarmerande att ett fält som rör sig så snabbt fortfarande kör på samma motor sju år senare. Transformer-modeller (det är vad arkitekturen kallas) är extremt bra på att förutsäga nästa ord i en sekvens, men de är också slösaktiga – de kräver enorma mängder data, energi och beräkningskraft för att tränas, och de skalas dåligt när problemen blir mer komplexa. Det startupsarna i artikeln jagar är i grunden ett svar på frågan: vad händer om vi bygger om från grunden istället för att bara stapla fler GPU:er? Det de flesta missar i debatten om AI-kapprustningen är att marginalavkastningen på att göra befintliga modeller större börjar plana ut – mer data och fler parametrar ger inte längre lika dramatiska förbättringar som för tre år sedan, vilket är precis varför investerarna nu letar efter nästa arkitekturskifte snarare än nästa skalningshopp. Om något av dessa alternativ faktiskt slår igenom kommer det att göra nuvarande infrastrukturinvesteringar – Nvidias dominans, Microsofts Azure-satsningar, hela molnbranschens affärsmodell – delvis föråldrade overnight.