CAFE: AI-agenter lär sig bättre när kritiker och agent tränas ihop

arXiv cs.AI

Forskare har utvecklat CAFE, ett ramverk där samma modell turas om att spela rollen som sökagent och kritiker – och det visar sig att de två rollerna behöver utvecklas parallellt för att ge bäst resultat. På sju olika testbenchmarks slår CAFE befintliga RL-baserade söksystem och minskar dessutom hallucinationer (när AI:n hittar på fakta). Det intressanta är egentligen insikten: en agent som tränas utan att dess feedback-mekanism också uppdateras planar ut – de är beroende av varandra.