Anthropic visar upp AI som förbättrar sig själv
En forskare på Anthropic har demonstrerat ett system där AI kan förbättra sitt eget beteende automatiskt – och lyckades bli bättre på samtliga 10 testade mått för oönskade beteenden utan att försämra sin generella prestanda. Det är anmärkningsvärt eftersom självförbättring utan sidoeffekter är ett av de svårare problemen inom AI-säkerhet.
Djupdykning
Anthropic har visat upp ett system där AI i princip korrigerar sina egna felbeteenden automatiskt – utan att en människa behöver sitta och finjustera varje litet problem. Det fungerar ungefär som att ge en anställd en lista med tio saker de gör fel, och de fixar allihop utan att tappa förmågan att göra resten av jobbet. Det som ofta händer när man tränar bort ett beteende är att modellen försämras på andra områden, en slags inlärningens whack-a-mole – men här höll den samlade prestandan. Det de flesta missar är att den verkliga nyheten inte är att AI kan förbättra sig själv, det har diskuterats länge i teorin. Det är att det faktiskt fungerade på alla tio mätpunkterna utan regressioner, vilket är ovanligt rent tekniskt. Det öppnar dörren till ett scenario där AI-säkerhetsarbete kan skalas upp i takt med att modellerna själva blir kraftfullare – just nu är det omvända ett av de stora orosmomenten i branschen.