Nytt test visar att AI-agenter är dåliga på att kommunicera med användare

arXiv cs.AI

Forskare har lanserat AppWorld-UL, ett nytt testramverk med 516 uppgifter som mäter hur väl AI-agenter hanterar dialog med användare – till exempel att ställa följdfrågor eller säga ifrån när en instruktion inte går att genomföra. Det bästa befintliga systemet, Claude Opus 4.7, klarade bara 48,6% av uppgifterna totalt och rasade till 21,3% på de svårare sammansatta scenarierna. Det intressanta här är inte att AI misslyckas, utan varför: det är just konversationen med användaren – inte själva apphanteringen – som ställer till det.