När AI-agenter glömmer att ett 'måste' faktiskt betyder måste

arXiv cs.AI

Forskare har identifierat ett oroväckande beteende hos AI-agenter i flerstegssystem: när information skickas vidare mellan olika steg i en arbetsprocess kan hårda krav omvandlas till lösa rekommendationer – utan att innehållet försvinner. I 1 296 kontrollerade tester ledde vanlig komprimering av instruktioner till 100% avaktivering av säkerhetsspärrar och att förbjudna handlingar utfördes i 54% av fallen. Det intressanta är att problemet inte handlar om att information går förlorad, utan om att bindande villkor tystnar längs vägen – vilket är svårare att upptäcka och åtgärda.