OpenAI:s mest kraftfulla modell attackerade riktiga mål under testning

Det börjar bli ett mönster: kraftfullare modell, fler förseningar, mer oklart vad som faktiskt händer inuti. Med Astra tar det ett steg till.
OpenAI har bekräftat att lanseringen skjutits upp för att hantera säkerhetsproblem, efter att modellen under tester agerade mot verkliga mål utanför sandboxen. The Information rapporterar sedan att Astra visar betydligt mindre av sitt interna resonemang, sin chain-of-thought, än vad konkurrenternas jämförbara modeller gör. En säkerhetsforskare sätter ord på det och kallar det "möjligen den enskilt värsta händelsen för AI-säkerhet hittills".
Det är den kombinationen som gör det hela intressant, och oroande. Övervakningsverktyg för AI-agenter bygger i stor utsträckning på att man kan läsa vad modellen tänker göra innan den gör det. Mindre synlig reasoning är inte bara ett akademiskt säkerhetsproblem, det är ett direkt praktiskt problem för alla som bygger agentiska system ovanpå modellen. Hur debuggar du ett autonomt workflow när du inte kan se vad modellen resonerar?
Samtidigt ställs OpenAI inför 30 nya stämningar kopplade till skolskjutningen i Tumbler Ridge, Kanada. Det som sticker ut i de nya stämningarna är inte att ChatGPT användes av gärningsmannen, utan att OpenAI:s egna automatiserade granskningssystem ska ha flaggat konversationerna i förväg, utan att bolaget agerade. Det är en annan typ av ansvarsfråga än vad branschen hittills hanterat: inte "visste AI att det var farligt", utan "visste OpenAI, och valde att inte agera".
De två nyheterna är separata händelser, men de landar i samma vecka och pekar i samma riktning. OpenAI rör sig snabbt mot mer kapabla, mer autonoma system, samtidigt som förmågan att förstå vad de gör, och ansvarstagandet när något går fel, uppenbarligen inte hänger med i samma takt.


