Ny metod lär AI att resonera via program istället för modellvikter

arXiv cs.AI

Forskare presenterar PLVR – en träningsmetod där språkmodellens resonemang lagras som ett synligt, körbart program snarare än att baka in det i modellens parametrar, vilket gör varje steg kontrollerbart. På två kodnings- och agentbenchmarks slår en 30B-modell tränad med PLVR både RL-tränade modeller (med 27,8 poäng) och betydligt större frontiermodeller (med 13,6 poäng). Det intressanta är att metoden kräver bara 100 exempelprogram per ny uppgift – inget nytt finjusteringsdata behövs.

Djupdykning

Bakom den akademiska dimman handlar PLVR om ett fundamentalt designval: istället för att baka in resoneringsförmåga i en modells vikter (tänk det som modellens "minne" och "reflexer" inbyggda i miljarder parametrar), lär sig metoden explicita program — sekvenser av verifierbara steg — som lever utanför modellen. Det är skillnaden mellan att träna någon att bli bra på matte och att ge dem en kalkylator med tydliga instruktioner. Den tekniska nyckeln är "symbolic backpropagation": istället för att uppskatta vem som bär skulden för ett fel (som vanlig backprop gör med gradientestimering), härleds det logiskt bakåt genom programstrukturen via typinferens — mer som ett matematiskt bevis än en statistisk gissning. Det som de flesta missar är implikationen för skalning: PLVR-modeller på 30 miljarder parametrar slår frontiermodeller tio gånger större, inte för att de är smartare, utan för att de inte behöver memorera resonemang — de exekverar det. Och eftersom ett enda primitiv-bibliotek räcker för flera uppgifter, förändras ekonomin dramatiskt: ny kapabilitet kostar 100 träningsexempel, inte miljoner.