Ny metod förbättrar inlärningseffektivitet för AI-agenter med verktygsanvändning

arXiv cs.AI

Forskare har tagit fram SPO++, en förbättrad träningsmetod för AI-agenter som använder verktyg – ett vanligt problem är att träningen bromsar in när agenter utför långa, oförutsägbara sekvenser av handlingar. Kärnfixen är teknisk men konkret: man normaliserar fördelen (hur mycket bättre eller sämre en handling var än förväntat) utifrån faktiska handlingstokens snarare än hela trajektorier, vilket ger mer korrekt inlärningssignal. I tester på ALFWorld och Math-TIR slår SPO++ sin föregångare SPO i inlärningseffektivitet.