Ny AI-agent klarar långa webbuppgifter med över 80% träffsäkerhet

arXiv cs.AI

Kinesiska Wuying-Browser-Agent är ett ramverk för AI-agenter som självständigt navigerar riktiga webbplatser – inte bara enkla testmiljöer – och klarar i snitt 37,9 beslutssteg per uppgift. Modellen i 27-miljarders-parameterstorlek når 80,6% på WebVoyager och 66,7% på Online-Mind2Web, vilket är nytt rekord bland öppna modeller. Intressant nog pekar forskarteamet på att det inte är modellstorleken i sig som gör skillnaden, utan hur träning, felsåterhämtning och belöningssignaler är uppbyggda längs hela kedjan.

Djupdykning

De flesta browser-agenter ser bra ut i demo men kraschar i verkligheten — det är samma problem som självkörande bilar hade för tio år sedan: kontrollerade testmiljöer är inte riktiga vägar. Wuying-Browser-Agent tacklar detta genom att träna agenten explicit på att misslyckas och återhämta sig, istället för att bara visa den perfekta genomkörningar, vilket är en rejäl omtänkning av hur man bygger robusthet. De introducerar också ett eget benchmark (BrowserBench) med uppgifter på i snitt 37,9 steg — jämför det med befintliga tester som ofta är så korta att de inte ens exponerar de fel som uppstår när en agent måste hålla i 50 beslut i rad. DAO-GRPO, deras träningsmetod, löser ett klassiskt problem i förstärkningsinlärning: hur ger du agenten credit för ett bra beslut i steg 12 när felet inte dyker upp förrän i steg 40? Det som de flesta missar i all hype kring agenter är att problemet aldrig egentligen handlade om råstyrka eller modellstorlek — det handlade om vad du tränar på och hur du mäter, och det är precis det Wuying adresserar.