Träning av AI-revisorer med förstärkningsinlärning ger färre falska larm
arXiv cs.AI
Forskare har använt förstärkningsinlärning (en metod där en AI lär sig genom belöning och straff) för att träna upp AI-modeller som granskar andra AI-modellers dold beteenden – en sorts automatiserad säkerhetsrevision. Resultatet är att andelen falsklarm hålls under 1%, medan förmågan att faktiskt hitta problematiska beteenden förbättras tydligt. Det intressanta är att man nu försöker använda AI för att övervaka AI, vilket pekar på hur svårt det blivit för människor att göra det jobbet själva i skala.