Nytt riktmärke avslöjar att AI-agenter misslyckas i mer än var fjärde situation
Forskare har testat sex ledande AI-modeller mot 580 verkliga scenarier och funnit att även den bästa konfigurationen bara klarar 74,8% av uppgifterna korrekt – ett tydligt tecken på att autonoma AI-agenter (system som självständigt använder verktyg och fattar beslut) ännu inte är tillförlitliga nog. Intressant nog misslyckas starka modeller på ett annat sätt än svaga: de starka är för försiktiga och undviker verktyg, medan de svaga väljer fel verktyg eller använder dem för ofta. En ny 'guardrail'-metod (ett skyddssystem som övervakar agenten i realtid) lyckades återta 19,9% av felen med bara 0,5% falsklarm.
Djupdykning
AI-agenter är program som inte bara svarar på frågor utan faktiskt utför uppgifter – bokar möten, söker i databaser, kör kod – och de gör det ofta utan att någon människa kollar av varje steg. GABench testar hur väl dessa agenter klarar av att använda rätt verktyg vid rätt tillfälle under press från fem olika typer av angrepp, ungefär som ett stresstest för en nyanställd som har tillgång till hela företagets system. Det som sticker ut i resultaten är inte att agenterna misslyckas – 74,8% på bästa konfiguration är faktiskt ganska dåligt när man tänker på vad som kan gå fel – utan att de misslyckas på motsatta sätt beroende på hur smarta de är. Starkare modeller är för försiktiga och vägrar använda verktyg när de borde, medan svagare modeller sprutar iväg och kallar på fel verktyg i onödan, som skillnaden mellan en paralyserad analytiker och en överivrig praktikant. Det de flesta missar här är att problemet inte handlar om att AI:n är "dum" – det handlar om att säkerheten måste byggas in i hur agenten körs, inte bara skrivas in som instruktioner i prompten. Guardrails som faktiskt övervakar exekveringen i realtid återhämtade nästan var femte fel utan att störa korrekt beteende, vilket är en fundamentalt annorlunda arkitektur än att bara be modellen att "vara försiktig". Ju fler verktyg och ju längre konversationskedjor, desto sämre prestanda – och det är exakt de scenarier som verkliga autonoma agenter i företagsmiljöer kommer att möta varje dag.