PeakBench: Nytt verktyg mäter hur bra AI-agenter hanterar parallella uppgifter utan att krascha
arXiv cs.AI
Forskare har lanserat PeakBench, ett riktmärke (benchmark) som testar om AI-agenter kan köra flera verktyg parallellt utan att överbelasta systemresurser – något befintliga tester i stort sett ignorerat. Problemet är välkänt i praktiken: kör verktygen i serie så är det säkert men långsamt, kör dem parallellt utan resurskoll så kraschar det. PeakBench separerar två vanliga felkällor – dålig planering kontra dålig schemaläggning – och visar att en agent kan vara duktig på det ena men katastrofal på det andra.