Hur pålitliga är AI-agentsystem egentligen när de misslyckas?
arXiv cs.AI
Forskare har undersökt hur väl dagens felsökningsmetoder för multi-agentsystem (där flera AI-agenter samarbetar på komplexa uppgifter) faktiskt fungerar – och svaret är nedslående. Befintliga metoder lyckas bara återskapa fel i 67,97% av fallen och reparera dem i knappt 7% av fallen, vilket antyder att 'fixen' ofta bara beror på slumpen i LLM-genereringen snarare än en verklig lösning. Med ett mer målinriktat tillvägagångssätt, där man identifierar symtom och ingriper specifikt, steg reparationsgraden till 20,15% – fortfarande lågt, men en nästan trefaldig förbättring.