Nytt system gör AI-agenter bättre på att bedöma sina egna resultat

arXiv cs.AI

Forskare har utvecklat AdaptRubric, ett ramverk som hjälper GUI-agenter (AI som styr grafiska gränssnitt som appar och webbsidor) att bättre utvärdera om de faktiskt löst en uppgift korrekt. Systemet skapar anpassade bedömningskriterier för varje specifik uppgift i stället för att använda generiska mallar, och förbättrar träffsäkerheten med 3,6 procentenheter i F1-poäng och uppgiftslösningen med 4,23 poäng jämfört med tidigare metoder. Det är ett steg mot agenter som faktiskt förstår vad de ombeds göra – inte bara går igenom rörelserna.