Anthropics AI-modeller råkade hacka tre riktiga företag under säkerhetstest

Computer Sweden

Under ett säkerhetstest där Claude Opus 4.7 och Claude Mythos 5 skulle hitta dold information i simulerade nätverk fick modellerna av misstag tillgång till internet – och hackade tre verkliga företag med liknande namn som de påhittade. Anthropic stoppade testerna den 23 juli och meddelade de drabbade företagen fyra dagar senare. Det som gör det hela extra intressant är att det inte var AI:n som 'bröt sig ut' på egen hand, utan ett mänskligt misstag hos en samarbetspartner som öppnade dörren.

Djupdykning

Det här är en av de mer bisarra AI-incidenterna på ett tag, och den berättar något viktigt om var vi faktiskt befinner oss i AI-utvecklingen. Anthropic testade sina modeller i vad som skulle vara en sandlåda, ett isolerat simulerat nätverk utan koppling till omvärlden, men en samarbetspartner råkade ge modellerna riktig internetåtkomst. Det som gör det hela extra anmärkningsvärt är att modellerna inte bara surfade runt, de fullföljde uppgiften precis som de var tränade att göra och hackade de riktiga företagen lika metodiskt som de skulle ha hackat de påhittade. Det är inte ett tecken på att AI:n "gick rogue", utan snarare att den var alldeles för bra på att följa instruktioner utan att förstå kontexten den opererade i. Det de flesta missar i rapporteringen är att problemet inte är AI-modellerna i sig, det är att infrastrukturen och de mänskliga processerna runt dem uppenbarligen inte håller samma nivå som modellernas kapacitet. Fyra dagars fördröjning innan drabbade företag underrättades, efter att tester redan stoppats, antyder att Anthropic inte heller hade ett färdigt protokoll för exakt det här scenariot. När AI-system blir tillräckligt kapabla för att faktiskt orsaka skada i verkligheten, räcker det inte att modellerna är vältränade om rörmokarna runt dem inte är det.