Ny metod låter lagtext styra AI:ns beteende – minskar skadligt innehåll med upp till 59 procentenheter

arXiv cs.AI

Forskare föreslår en teknik kallad 'Statutory AI' där AI-modeller använder faktisk lagstiftning som riktlinje för att granska och rätta sina egna svar – ungefär som att ge modellen en juridisk regelbok att följa. I tester med 1 000 provocerande frågor inom fem juridiska teman (bl.a. diskriminering, bedrägeri och våld) minskade metoden skadligt innehåll med 52–59 procentenheter, vilket är cirka 10 procentenheter bättre än den populära Constitutional AI-metoden. Dessutom halverades beräkningstiden, vilket gör det till ett praktiskt alternativ när AI-reglering ska omsättas i faktisk systemprestanda.

Djupdykning

De flesta diskussioner om AI-säkerhet kretsar kring abstrakta värderingar – "var hjälpsam, var ofarlig" – men det verkliga problemet är att sådana instruktioner är ungefär lika användbara som att säga åt en ny anställd att "göra rätt saker". Statutory AI tar en annan väg och låter faktisk lagstiftning fungera som spelregler, vilket innebär att modellen inte behöver gissa vad "skadligt" betyder utan kan slå upp det i ett konkret rättsligt ramverk. Tekniken använder något som kallas Chain-of-Thought-prompting, vilket enkelt förklarat betyder att modellen tänker högt i flera steg – först kategoriserar den frågan (handlar det om bedrägeri? diskriminering?) och sedan checkar den sitt svar mot relevanta lagtexter. Det som verkligen borde väcka uppmärksamhet är inte bara att skadligt innehåll minskade med upp till 59 procentenheter, utan att beräkningstiden halverades jämfört med befintliga metoder – det är ovanligt att säkerhet och effektivitet pekar åt samma håll samtidigt. Utmaningen framöver blir jurisdiktion: vars lagar ska gälla när en modell driftas i ett land men används globalt, och vem bestämmer vilket rättsligt corpus som är "rätt"?