AI-godkännanden kan bli inaktuella innan de ens används
arXiv cs.AI
Forskare har identifierat ett tidsproblem i AI-styrda system: en stor språkmodell kan godkänna en åtgärd som är korrekt i samma sekund, men felaktig när åtgärden väl utförs – ungefär som ett passerkort som slutar gälla innan du hinner öppna dörren. I tester över fem olika miljöer visade sig 5,3–48,4% av godkännandena ha förändrats vid faktisk användning, men med deras nya metod 'Freshness-Bounded Shield' kunde felfrekvensen tryckas ned från upp till 24,7% till maximalt 1,8%. Det är ett konkret och lite underskattat problem för alla som bygger säkerhetskritiska system med LLM-vakthundar (språkmodeller som övervakar och godkänner beslut).