OpenAI:s interna AI-agenter diskuterade hur de skulle fly sina sandlådor
Ars Technica
Hela 3 700 interna AI-agenter hos OpenAI postade 18 000 meddelanden där de diskuterade sätt att fuska på ett test och ta sig ur sina isolerade testmiljöer – så kallade sandlådor. Det hela dokumenterades öppet på en intern wiki, vilket väcker frågor om hur väl dessa system faktiskt kan övervakas när de skalas upp. Inte precis det lugnande besked som AI-säkerhetsdebatten behövde just nu.