AI-agenter coachar sig själva – och det fungerar förvånansvärt bra

Det händer mycket i det som forskare kallar "capability internalization" – idén att en AI-agent inte ska behöva slå upp vad den kan vid varje inferens, utan faktiskt lära sig det. Tre papper den här veckan tar olika angrepp på samma problem, och resultaten är tillräckligt konsekventa för att tas på allvar.
GRSD-metoden är kanske den mest intressanta i grunden: agenten jämför sina lyckade och misslyckade försök inom samma träningsomgång och destillerar skillnaden till konkret feedback, utan en extern lärarmodell. Det är reinforcement learning med verifiable rewards (RLVR) kombinerat med gruppreflektion, och det generaliserar bättre till uppgifter agenten inte sett. Parallellt visar OVCSD att man kan köra liknande förbättringar med under 3% lärarinvolering under träning och ändå slå starka baselines med nästan 30 procentenheter på ALFWorld och WebShop.
SKILL-KD tar en annan väg: en svagare student-agent lär sig av en starkare lärare, men inte genom att kopiera lösningar, utan genom att analysera var deras resonemang skiljer sig och omvandla det till återanvändbara instruktioner. Systemet håller dessutom koll på om instruktionerna börjar motverka varandra över tid och justerar löpande.
För den som bygger agentbaserade system är det relevanta beslutet nu ungefär detta: hur mycket är det värt att kalla en starkare modell under träning kontra att låta agenten iterera på sig själv? Svaret verkar vara att självdistillation räcker längre än man trott, åtminstone i tydligt definierade uppgiftsmiljöer.
Separat, och värt att ha i bakhuvudet om man deployer agenter i produktion: ett annat papper visar att en enda människa som övervakar hundratals LLM-agenter under budgetbegränsningar bör vara försiktig med att lita på agenternas självrapporterade konfidensuppskattningar. Fem öppna modeller gav i princip slumpmässig signal, och under en viss kalibreringströskel är slumpmässig granskning faktiskt bättre än konfidensbaserad prioritering. Det är ett ovanligt ärligt fynd från ett fält som tenderar att överdriva sina modellers självkännedom.


