DRACO lär AI-agenter av detaljerad feedback – utan att veta om de lyckades

arXiv cs.AI

Forskare har utvecklat DRACO, en metod för att träna AI-agenter på långa, komplexa uppgifter där det saknas tydliga rätt-eller-fel-svar. Istället för ett enda slutbetyg bryter systemet ner bedömningen i dynamiska delkriterier och kopplar dem till de specifika steg i agentens beteende som faktiskt spelade roll – vilket ger mycket skarpare träningssignal. På benchmark-testet AppWorld presterade DRACO 15,9 procentenheter bättre än basmodellen, och håller sig stark även på uppgifter den aldrig tränats på.

Djupdykning

Det här handlar om ett klassiskt problem inom AI-träning: hur lär du en agent att göra rätt saker när du inte kan mäta om den lyckades? Tänk dig att träna någon på ett komplicerat jobb utan att kunna se slutresultatet, bara beteendet längs vägen. DRACO löser detta genom att dynamiskt generera bedömningskriterier under träningens gång och sedan fördela "beröm eller kritik" bakåt till de specifika steg som faktiskt förtjänade dem, istället för att ge hela episoden ett enda samlat betyg. Det låter tekniskt, men analogin är enkel: skillnaden mellan att säga "du spelade dåligt" efter en match kontra att säga "just det tredje draget i andra halvlek kostade dig". Det de flesta missar är att problemet inte primärt är algoritmiskt utan datamässigt. Alla jublar när LLM:ar klarar tydliga uppgifter med facit, men verkligheten för agentsystem som bokar resor, hanterar kod eller navigerar byråkrati är att det sällan finns ett enkelt "rätt svar" att jämföra mot. DRACO tar sig in i det här rummet utan att kräva en separat tränad attributionsmodell, vilket är anmärkningsvärt rent ingenjörsmässigt. Att sedan slå GRPO med faktisk ground-truth-signal på Tau-Bench, alltså att klara sig bättre utan facit än konkurrenter med facit, är det som verkligen borde väcka ögonbryn hos den som tränar agentsystem i produktion.