Nya testet avslöjar: AI-agenter är alldeles för försiktiga – inte för våghalsiga
Forskare har testat 30 AI-modeller på hur väl de avgör om en autonom agent ska genomföra eller stoppa en kritisk åtgärd – som att skicka ett mejl eller godkänna en betalning. Resultatet vänder upp och ned på den vanliga oron: modellerna blockerar felaktigt godkänt arbete i 28% av fallen, men tillåter osäkra åtgärder i bara 1%. Ännu mer intressant är att mer avancerade modeller tenderar att bli ännu mer överdrivet försiktiga, snarare än mer träffsäkra.
Djupdykning
Föreställ dig en AI-agent som har tillgång till din mejl, ditt kodsystem och ditt bankkonto. Varje gång den är på väg att faktiskt göra något – trycka på "skicka", "merge" eller "överför" – måste den fatta ett beslut: köra eller pausa för en människa att kolla? Det är precis den beslutsgrejen SteerBench-Work testar, och resultaten är lite oväntade. Modellerna är extremt försiktiga åt fel håll: de blockerar legitima, godkända handlingar i nästan var tredje fall, medan de faktiskt missar verkliga faror bara i 1% av fallen. Det de flesta missar här är att "säker AI" ofta mäts enbart på hur sällan den gör farliga saker – men en agent som konstant vägrar att göra sitt jobb är inte heller säker, den är bara värdelös. Ännu mer avslöjande är "mirror-testet": när forskarna tog kända incidenter och vände bevisen mot en omvänd version, rasade modellernas träffsäkerhet från 98,5% till 63,8%, vilket tyder på att modellerna delvis memorerat historiska fall snarare än att faktiskt förstå risken. Det är ungefär som en läkare som kan diagnostisera exakt de sjukdomar de läst om, men missar en klassisk diagnos om symptomen presenteras i fel ordning. Ju mer avancerad modell, desto mer tendens att överrefusa – alltså säga "nej tack, mänsklig granskning" när det egentligen är fritt fram – och mer resonemang hjälper bara om grundkalibreringen redan är dålig.