Tre kompressionstekniker i kombination gör stora AI-modeller betydligt effektivare

arXiv cs.AI

Forskare föreslår ett ramverk kallat 'Compression Trinity' som kombinerar tre etablerade metoder för att krympa stora språkmodeller (LLMs): gleshet, kvantisering och lågrangsapproximationer – tekniker som var för sig brukar stöta på en effektivitetsgräns. Resultaten är konkreta: en av metoderna, SLiM, förbättrar noggrannheten med upp till 5,66% jämfört med tidigare toppmetoder och slår till och med okomprimerade modeller med samma parameterbudget med 0,6%. Det intressanta är att komprimerade modeller alltså kan bli bättre än sina fetare kusiner – inte bara billigare att köra.