Nytt säkerhetssystem skyddar AI-agenter mot manipulerade verktygskommandon

arXiv cs.AI

AI-agenter som använder externa verktyg kan luras att utföra oönskade handlingar när verktygets svar innehåller dolda instruktioner – ett angreppssätt kallat prompt injection. Forskare presenterar SARA, ett system som skiljer på att 'föreslå en åtgärd' och att faktiskt 'godkänna den', vilket sänker andelen lyckade attacker (ASR) till under 0,63% i tester. Det intressanta här är hur lite uppmärksamhet den här typen av auktoriseringsproblem fått, trots att AI-agenter börjar utföra riktiga handlingar i världen.