Anthropic-forskare avgår: varnar för självförbättrande AI
Jacob Coxon, forskare på AI-företaget Anthropic, har sagt upp sig med motiveringen att han fruktar att okontrollerad AI-utveckling kan leda till mänsklighetens utrotning. Han uppmanar nu AI-laboratorier att ingå avtal om att bromsa takten – särskilt när det gäller så kallad självförbättrande AI, alltså system som kan förbättra sig själva utan mänsklig inblandning. Det intressanta är att kritiken kommer inifrån ett av branschens ledande säkerhetsföretag, vilket säger en del om spänningarna som råder även där.
Djupdykning
Jacob Coxon jobbade på Anthropic – ett av de ledande AI-säkerhetsbolagen – och ändå var det inte säkert nog för honom. Han slutade i protest och varnar nu specifikt för "self-improving AI", alltså system som kan förbättra sin egen kod och kapacitet utan mänsklig inblandning. Det är ungefär som om man bygger en robot som kan bygga bättre robotar, som bygger ännu bättre robotar – och du tappade kontrollen redan i steg två. Det Coxon efterfrågar är "pacing agreements", koordinerade avtal mellan AI-labbsen om att sakta ner utvecklingstakten tillsammans, eftersom inget enskilt labb vill bromsa ensamt och riskera att konkurrenterna rusar förbi. Problemet är att den dynamiken redan existerar och driver hela industrin framåt i en takt som ingen enskild aktör egentligen valt – det är en klassisk kapprustning där alla hoppas att någon annan ska blinka först. Det de flesta missar i den här historien är att Coxon inte är en utomstående kritiker eller en dystopisk bloggare – han var en insider på ett bolag vars hela existensberättigande är att göra AI säkert. När folk inifrån säkerhetsteamen börjar lämna och larma, är det inte samma sak som vanlig teknikskepticism.