AI-säkerhetsmetoder kan användas som censurverktyg av auktoritära regimer

arXiv cs.AI

Ett nytt positionspapper varnar för att teknikerna som används för att göra AI-modeller 'säkra' – som att träna bort skadliga svar – är tveeggade verktyg som auktoritära aktörer kan använda för informationskontroll och censur. Det verkligt oroande är inte ett tankeexperiment: forskarna kartlägger faktiska fall av missbruk och pekar på att risken förvärras av att allt fler människor förlitar sig på AI som primär informationskälla. Författarna uppmanar AI-säkerhetscommunityn att börja diskutera detta nu, innan ekonomiska och politiska maktobalanser gör problemet svårare att hantera.

Djupdykning

Forskargruppen bakom detta paper pekar på något som sällan diskuteras öppet: RLHF (Reinforcement Learning from Human Feedback) och liknande tekniker som tränas för att göra AI "snäll och ofarlig" är i grunden filtreringsmaskiner, och en filtreringsmaskin kan filtrera vad som helst. Det som börjar som "svara inte på frågor om bombtillverkning" använder exakt samma infrastruktur som "svara inte på frågor om Tiananmen" eller "nedvärdera inte det styrande partiet". Poängen som de flesta missar är att problemet inte handlar om att någon bygger en "ond AI" från grunden – det handlar om att demokratiska företag öppet publicerar sina alignment-metoder i akademiska papers, och auktoritära regeringar eller statsnära aktörer kan köpa eller kopiera dessa modeller och sedan finjustera dem med sina egna värderingar. Kombinera det med att allt fler människor använder AI som primär informationskälla snarare än att googla runt, och du har ett scenario där informationskontroll kan ske på ett sätt som är både mer subtilt och mer skalbart än något statligt kontrollerad tv någonsin åstadkom. När en sökmotor censurerar ett resultat märker du att det saknas – när en AI med säkert tonfall förklarar en händelse ur ett visst perspektiv utan att nämna alternativ, märker du ingenting.