Forskare kvantiserar hela hybridmodellen på 27B – utan prestandaförlust

arXiv cs.AI

Forskarteamet bakom 'Minima' visar att man kan trycka ner hela Qwen3-27B till 4-bitars precision (W4A4) – inklusive de rekurrenta lager som alla trodde var för känsliga – och ändå matcha full precision på sju olika riktmärken, med bara 0,52 procentenheter sämre snittresultat. Modellen tar 17,5 GiB minne och är 14–19 % snabbare vid prefill jämfört med referensrecepten. Den intressanta insikten: de 'sköra' grindlagren (gate projections) visade sig faktiskt vara de minst känsliga för kvantiseringsfel, vilket vänder upp och ned på ett vanligt antagande i fältet.