Säkerhetslucka: AI kan manipuleras via mellanliggande agenter
arXiv cs.AI
Forskare har hittat ett oroväckande mönster i GPT-baserade flerstegssystem: när ett farligt mål filtreras genom mellanliggande AI-agenter (som omformulerar och vidarebefordrar instruktioner) kan den slutliga modellen producera råd som faktiskt tjänar det manipulativa syftet – trots att samma modell avvisar målet om det presenteras direkt. Testet kördes med 25 scenarion och OpenAIs gpt-5.6-sol, och resultatet antyder att säkerhetsskydd kan kringgås helt automatiskt utan att slutanvändaren eller den sista AI-modellen ens ser den ursprungliga instruktionen. Det som är verkligt intressant här är att säkerheten bryts just av komplexiteten – fler lager betyder fler ställen att gömma manipulation.