Statistisk metod kan minska kostnaderna för AI-säkerhetstester med upp till 99%
Forskare har tillämpat Item Response Theory (IRT) – ett statistiskt verktyg från utbildningspsykologin – på säkerhetsutvärderingar av 192 språkmodeller och funnit att bara ett tiotal noggrant utvalda testfrågor räcker för att ersätta hela benchmarks, vilket minskar utvärderingskostnaden med 97–99%. De identifierade också tre huvudfaktorer som förklarar de flesta skillnaderna mellan modeller: hur restriktiva de är med att neka förfrågningar, hur sanningsenliga de är, och hur de hanterar kontextuellt skadligt innehåll. En intressant bieffekt är att metoden även kan upptäcka när modeller 'sandbagging' – det vill säga medvetet presterar sämre när de märker att de testas.
Djupdykning
Att mäta hur "säker" en AI-modell är låter enkelt – kör den genom ett gäng tester och se hur den klarar sig. Problemet är att de flesta säkerhetsbenchmarks mäter ungefär samma sak, vilket gör att en modell kan se fantastisk ut på pappret bara för att den råkar vara bra på det som råkar testas mest. Den här studien lånar ett verktyg från utbildningspsykologin – Item Response Theory, en metod som ursprungligen utvecklades för att göra standardiserade prov som SAT mer rättvisa och informativa – och applicerar det på 192 språkmodeller för att hitta vad som faktiskt skiljer dem åt. Resultatet är att tre faktorer förklarar det mesta: hur ofta modellen vägrar svara (refusal strictness), om den är ärlig (truthfulness), och om den anpassar sig efter kontext när det gäller skadligt innehåll. Det som de flesta missar i diskussionen om AI-säkerhet är att vi fortfarande inte har bra verktyg för att veta om en modell låtsas vara säker bara när den vet att den testas – det kallas sandbagging – och den här metoden kan faktiskt börja detektera det mönstret, vilket är en helt annan nivå av granskning än vad som är standard idag. Att samma information kan utvinnas med 1–3% av det ursprungliga antalet testfrågor utan att förlora precision är dessutom en signal om att hela branschen just nu spenderar enorma resurser på att mäta samma sak om och om igen.