MUX: Ny metod låter AI tänka mer effektivt i komprimerade steg

arXiv cs.AI

Forskare föreslår MUX, en metod som komprimerar språkmodellers resonemangssteg till täta 'multiplexade' tokens i ett latent rum – i stället för att slösa beräkningskraft på att formulera varje delsteg i vanliga ord. Metoden är förlustfri, vilket innebär att de ursprungliga resonemangsstegen kan återkonstrueras fullt ut, och den slår befintliga latenta resoneringsmetoder i 32 av 32 testscenarier över fyra olika språkmodeller. Det intressanta här är inte bara hastighetsvinsten – utan att modellen faktiskt verkar resonera mer troget, inte bara snabbare.

Djupdykning

Språkmodeller som GPT och Claude "tänker" egentligen genom att producera ord för ord – varje resonemangssteg är ett enda delord, vilket är ungefär lika effektivt som att räkna på fingrarna. MUX löser detta genom att komprimera flera resonemangssteg till en enda "latent token" i ett abstrakt vektorrum, en matematisk superposition av flera ord på en gång – tänk det som att skicka flera radiokanaler simultant på samma frekvens istället för en i taget. Det som skiljer MUX från tidigare försök med latent reasoning är garantin om förlustfrihet: man kan faktiskt packa upp den komprimerade representationen och få tillbaka de ursprungliga resonemangsstegen, vilket förhindrar att modellen lär sig genvägar genom att smita från svår kognitiv belastning. Det de flesta missar här är att detta inte primärt handlar om hastighet – det handlar om att resonemang i latent rum verkar möjliggöra parallell utforskning av problemlösningsvägar, alltså att modellen kan "tänka" i flera riktningar samtidigt på ett sätt som sekventiell textgenerering strukturellt hindrar. Om det håller sig i prakten är vi på väg mot en arkitektonisk förändring i hur språkmodeller processar svåra problem, snarare än ännu en variant av "ge modellen mer tokens att tänka med."