PILOT: AI-agent som förbättrar sig själv medan den arbetar
arXiv cs.AI
Forskare har byggt ett system kallat PILOT där en övervakande AI-agent kan korrigera och styra om en arbetande agent i realtid – istället för att vänta tills uppgiften är klar. På benchmarken Terminal-Bench 2.0 slår PILOT jämförbara system med upp till 9,8 procentenheter, och antalet förbrukade tokens (beräkningsenheter) sjunker med nästan hälften. Det intressanta är inte bara prestandan utan idén: att självförbättring som sker live under körning är fundamentalt annorlunda än den traditionella modellen där man lär sig av misstag i efterhand.