Ny träningsmetod för AI-agenter kräver mindre minne och ger bättre resultat

arXiv cs.AI

Forskare presenterar SAPO, en ny metod för att träna AI-agenter (modeller som utför flerstegsuppgifter) som presterar 15 procentenheter bättre än PPO och 12 procentenheter bättre än GRPO – två vanliga träningstekniker. Det intressanta är att SAPO uppnår detta med lägre minneskrav och 33 procent kortare körtid per iteration, vilket adresserar ett klassiskt trilemma: man har tidigare behövt välja mellan kostnad, prestanda och stabilitet. Testerna gjordes med Qwen2.5-modeller på 1,5 och 7 miljarder parametrar.