SafeEvolve: Nytt ramverk låter AI-agenter lära sig säkerhet från egna misstag
Forskare har tagit fram SafeEvolve, ett system där AI-agenter kontinuerligt förbättrar sin egen säkerhet genom att analysera tidigare interaktioner – ungefär som att lära sig av sina misstag i realtid. För modellen Qwen3.5-4B minskade antalet lyckade attacker (attack success rate) med tre gånger på benchmark-testet AgentDojo, samtidigt som nyttoförmågan faktiskt ökade något från 59,79% till 61,86%. Det intressanta är att systemet balanserar två saker på en gång: både hur agenten beter sig internt och de yttre regler som styr den.
Djupdykning
AI-agenter är inte bara en modell — de består av två lager som samverkar: själva språkmodellen och ett "harness", ungefär som ett skal eller ramverk som styr hur agenten interagerar med omvärlden, anropar verktyg och följer instruktioner. Problemet forskarna pekar på är att säkerhetsarbete hittills fokuserat på antingen det ena eller det andra, men aldrig båda samtidigt, vilket lämnar ett glapp där farliga beteenden kan smita igenom i mellanstegen av en längre uppgiftskedja — inte bara i slutsvaret. SafeEvolve låter agenten lära sig av sina egna misstag i realtid och uppdatera både skalet och den interna modellbeteendet i en kontinuerlig loop, med mätbara och reversibla förändringar snarare än svarta lådan-justeringar. Det som de flesta missar i rapporteringen om AI-säkerhet är just detta flerstegsproblem: en agent kan svara helt korrekt på en enskild fråga men ändå utföra skadliga handlingar längs vägen mot svaret, och det är den attackytan som faktiskt exploderar när agenter får tillgång till riktiga verktyg och system. Att minska attack success rate tre gånger för en 4-miljarders-parametermodell utan att försämra användbarheten antyder att säkerhet och kapabilitet inte nödvändigtvis är nollsummespelet branschen ofta behandlar dem som.