Studie avslöjar grundläggande brister i hur AI-agenter hanterar fel och återförsök

arXiv cs.AI

Forskare analyserade 147 incidenter i ett produktionssystem där AI-agenter samordnar mjukvaruleverans, och fann att standardmetoderna för felhantering – lånade från vanliga webbtjänster – fungerar dåligt för agenter. Ett exempel: en loop med 54 på varandra följande lyckade verktygsanrop utlöste aldrig något larm, medan ett annat fel i onödan väckte fem agentkomponenter för ett problem som bara berörde två. Slutsatsen är att tillförlitlighet för AI-agenter behöver mätas per delegation (en avgränsad uppgift agenten fått) snarare än per enskilt meddelande – vilket är ett ganska fundamentalt skifte i hur man bygger sådana system.