Nytt ramverk gör AI-agenter bättre på att hantera okända appar

arXiv cs.AI

Forskare har tagit fram CoAdapt-GUI, ett system som hjälper AI-agenter att använda mobilappar de aldrig tränat på – utan att behöva nya träningsexempel. På benchmark-testet AndroidWorld Plus ökade prestandan från 38,6% till 52,9%, vilket är en rejäl förbättring för ett länge knepigt problem. Kärntricket är att separera 'hur man gör saker generellt' från 'hur just den här appen ser ut', så att agenten kan återanvända sitt arbetsflödeskunnande utan att fastna i app-specifika detaljer.

Djupdykning

De flesta AI-agenter för mobilappar tränas på en fast uppsättning appar och kraschar mentalt så fort de möter något nytt – ungefär som en nyanställd som bara kan göra exakt det som stod i jobbeskrivningen. CoAdapt-GUI angriper det här problemet genom att skilja på *vad* agenten vet om hur uppgifter brukar lösas (arbetsflödeskunskap) och *hur* den faktiskt klickar runt i ett specifikt gränssnitt (policy). Genom att bara ta med sig den abstrakta procedurkunskapen – typ "för att byta lösenord brukar man gå via inställningar, sedan konto, och verifiera ändringen" – slipper agenten dra med sig massa Snapchat-specifika antaganden när den försöker lista ut hur Spotify funkar. LoRA-adaptern, som är ett sätt att finjustera en liten del av en stor AI-modell utan att behöva träna om hela grejjen, uppdateras sedan löpande baserat på vad agenten faktiskt lyckas med i den nya appen. Det folk missar är att hoppet från 38,6% till 52,9% på AndroidWorld Plus inte primärt kommer från smartare inlärning – det kommer från att *sluta ta med sig för mycket*. Den verkliga insikten är negativ: generalisering handlar lika mycket om vad du väljer att glömma som vad du tar med dig.