Forskare kartlägger Claude 3 Sonnets inre funktioner med 34 miljoner identifierbara drag

arXiv cs.AI

Anthropics forskare har lyckats identifiera och kartlägga 34 miljoner tolkningsbara funktioner i Claude 3 Sonnet genom sparse autoencoders – en teknik som gör AI-modellens beslutsmekanism mer transparent. De hittade funktioner för allt från sarkasm och kodfel till mer problematiska beteenden som manipulation och maktbegär, vilket kan hjälpa till att förstå och kontrollera AI-beteende bättre.