AI-modellers säkerhet fallerar när kontexten ändras

arXiv cs.AI

Forskare visar att säkerhetstränade AI-modeller fastnar i rigida regler även när situationen förändrats så att 'säker' handling blir skadlig - ett problem de kallar 'brittle safety'. Tester av 12 modeller visar att standardmetoder för innehållsmoderation missar alla fall där konsekvenserna vänt, medan en ny kontextmedveten metod fångar alla utan falsklarm. Det antyder att nuvarande säkerhetssystem är systematiskt blinda för när omständigheterna ändrar vad som verkligen är säkert.