NEXUS: Nytt säkerhetssystem övervakar AI-agenter i realtid

arXiv cs.AI

Forskare har byggt NEXUS, ett övervakningssystem som i realtid avgör om en AI-agent ska få utföra en handling, blockeras, eller be om bekräftelse – ungefär som en säkerhetsvakt som sitter och tittar på vad agenten gör. Systemet uppnår en F1-poäng på 0,949 på ett testbenchmark och lägger bara 0,2 millisekunder på varje beslut, vilket gör det praktiskt användbart utan märkbar fördröjning. Det intressanta är att AI-agenter börjar utföra riktiga handlingar i världen – skicka mejl, köra kod, boka saker – och då räcker det inte längre att bara hoppas att modellen beter sig väl.

Djupdykning

LLM-agenter — alltså AI-system som inte bara svarar på frågor utan faktiskt *gör saker* som att köra kod, skicka mejl eller radera filer — är på väg att bli vardag i företag och verktyg, vilket gör frågan om vad de får göra utan mänskligt godkännande extremt relevant. NEXUS är ett övervakningssystem som sitter mellan agenten och dess verktyg och i realtid avgör om en handling ska tillåtas, blockeras, eller om en människa borde tillfrågas först. Systemet kombinerar hårda regler (tänk brandvägg) med en statistisk riskbedömning som väger in hur farlig en specifik åtgärd faktiskt verkar vara i sitt sammanhang — vilket är mer nyanserat än att bara ha en svart-vit lista. Det som ofta missas i debatten om AI-säkerhet är att problemet sällan är att modellen blir "ond", utan att den gör något rimligt-klingande men katastrofalt i fel kontext, och det är exakt det gap NEXUS försöker täppa igen. 0,205 millisekunder median-latens är praktiskt taget ingenting — det betyder att du kan lägga det här lagret ovanpå en agent utan att märkbar fördröjning tillkommer, vilket tar bort det vanligaste motargumentet mot runtime-säkerhetssystem. Att koden och benchmarken är öppet publicerade är också ett drag som sätter press på hela branschen att börja mäta agenters beteende mer systematiskt snarare än att förlita sig på vaga påståenden om "ansvarsfull AI".