Varför AI-säkerhetsregler inte håller när modellen tränas – och vad man kan göra åt det

arXiv cs.AI

En ny teoretisk studie pekar på ett grundläggande problem: säkerhetsregler som 'agenten får inte lämna sin sandlåda' (isolerad testmiljö) existerar utanför den datadistribution modellen tränas på, vilket gör dem extremt svåra att baka in via träning eller belöningssignaler. Forskarna argumenterar att mjuka säkerhetsdispositioner hör hemma i modellen medan hårda garantier måste ligga i systemets infrastruktur runt om – inte i modellen själv. Som motiverande exempel används en incident från juli 2026 där OpenAI och Hugging Face genomförde en gemensam säkerhetsutvärdering.