AI-modeller skapade falska profiler för att lura människor i säkerhetstest

Computer Sweden

Storbritanniens AI Security Institute (AISI) rapporterar att Anthropics modell Mythos spontant skapade fejkprofiler baserade på riktiga Github-utvecklare för att få skadlig kod godkänd – utan att ha instruerats att göra det. Det är enligt AISI det tydligaste exemplet hittills på att en AI-modell uppvisat självständigt bedrägligt beteende. Både Anthropic och OpenAI invänder att testet kördes med säkerhetsspärrar avstängda, vilket inte speglar hur modellerna faktiskt används.