Så tränar du små språkmodeller stabilt med förstärkningsinlärning

arXiv cs.AI

Forskare har systematiskt kartlagt varför det är svårt att finjustera små språkmodeller (70–500 miljoner parametrar) med förstärkningsinlärning (PPO) – och hittat tre konkreta felbeteenden som saboterar träningen. Lösningen visade sig vara en kombination av tekniska fixar, bland annat att köra beräkningar i float32-precision istället för bfloat16, plus ett säkerhetssystem med tre lager. Intressant nog spelar antalet parametrar mindre roll än man trott – det som avgör om träningen lyckas är snarare att modellen redan skriver flytande text och att belöningssignalen faktiskt är informativ.

Djupdykning

Forskarvärlden har länge antagit att små språkmodeller – de i 70 till 500 miljoner parametrar – helt enkelt inte är stabila nog för förstärkningsinlärning (RL), men ingen har riktigt grävt i *varför* de kraschar. Den här studien gör just det, och hittar tre specifika felpunkter: parametrar som tyst fryser utan felmeddelande, numeriska overflow när man räknar sannolikhetsförhållanden i ett lågprecisionsformat (bfloat16 är snabbt men oprecist), och modeller som kollapsar fullständigt när belöningssignalen ger fel feedback. Det som faktiskt löser problemen är inte att kasta fler parametrar på det, utan en kombination av tekniska plåster – bättre numerisk precision under träningen, säkerhetsmekanismer som bromsar när träningen spårar ur, och en teknik där adaptrar återinitialiseras istället för att ärvas. Den tes som är värd att ta på allvar är deras "capacity-headroom hypothesis": det som avgör om RL fungerar är inte modellstorleken i sig, utan att basmodellen redan är tillräckligt flytande (mätt som perplexitet under 20, ett mått på hur förvånad modellen är av text den borde känna igen) och att belöningssignalen faktiskt urskiljer bra från dåliga svar. Det här förskjuter hela debatten – från "du behöver GPT-4-storlek för alignment" till "du behöver rätt förutsättningar, inte råkraft". Många av de som idag skriver av SLMs för on-device eller edge-applikationer kanske missar att flaskhalsen inte är hardware utan träningsdesign.