LFM2.5: Nya komprimerade AI-modeller tränade med kvantiseringsmedveten destillation

Hugging Face Blog

Hugging Face har publicerat LFM2.5 Q4_0-checkpoints, komprimerade versioner av språkmodeller skapade via en teknik kallad kvantiseringsmedveten destillation – vilket innebär att modellerna tränas specifikt för att hålla hög kvalitet även när de krymps ner till 4-bitars precision. Det gör dem lättare att köra lokalt på vanlig hårdvara utan att prestandan försämras lika mycket som vid traditionell efterhandskomprimering. Intressant nog sker optimeringen redan under träningen, inte som ett separat steg efteråt.

Djupdykning

LFM2.5 är Liquid AIs senaste familj av språkmodeller byggda på deras egna "Liquid Foundation Models" – en arkitektur som inte är en vanlig transformer (alltså den typ av neural nätverksdesign som ligger bakom GPT och de flesta moderna AI-modeller) utan istället bygger på dynamiska system inspirerade av neurobiologi. Q4_0 syftar på en kvantiseringsteknik där modellens vikter komprimeras från 16- eller 32-bitars flyttal till 4-bitars heltal, vilket dramatiskt minskar minneskraven men brukar kosta i precision. Tricket här är att checkpointsen skapats via "quantization-aware distillation" – en metod där modellen tränas med kvantiseringsbegränsningarna inbyggda från start, istället för att man bara komprimerar en färdig modell i efterhand, vilket ger betydligt bättre kvalitetsbevaring. Det är egentligen en ganska sofistikerad lösning på ett grundläggande problem: hur gör du en stor modell tillräckligt liten för att köra lokalt på vanlig hårdvara utan att den blir dum? Det de flesta missar i diskussionen om modellstorlekar är att det inte enbart handlar om prestanda – det handlar om vem som kontrollerar infrastrukturen. Effektiva, komprimerade modeller som kan köras lokalt förskjuter makt från molnjättarna mot individer och organisationer som faktiskt äger sin data och sin beräkning.