OpenAI pausar Astra-modellen på grund av säkerhetsproblem

TechCrunch AI

OpenAI har bromsat utvecklingen av sin kommande AI-modell Astra efter att ha identifierat oroande brister i modellens cybersäkerhetsförmågor. Det är ovanligt att ett AI-bolag öppet medger att en modell är för kapabel på ett farligt sätt – och signalerar att säkerhetstestningen faktiskt biter på något.

Djupdykning

OpenAI har bromsat utvecklingen av sin Astra-modell efter att interna tester visade att den självständigt kunde identifiera och genomföra cyberattacker mot välskyddade system – det som kallas att nå ett "kritiskt cybersäkerhetströskel". Det här är inte bara ett tekniskt riktmärke utan faktiskt en del av OpenAIs egna säkerhetsramverk, där vissa kapabilitetsnivåer kräver extra åtgärder innan man kan gå vidare. Vad de flesta missar i den här nyheten är att OpenAI *frivilligt* publicerar detta, vilket antingen är genuint ansvarstagande eller ett PR-drag för att visa att de tar säkerhet på allvar – troligen lite av båda. Det sätter också press på konkurrenter som Anthropic och Google att vara lika transparenta när deras modeller når liknande gränser, något de hittills sluppit. Frågan framöver är om branschens självreglering faktiskt håller när kommersial press ökar, eller om det krävs externa reglerare med faktiska tänder för att den här typen av bromsar ska vara mer än tillfälliga pauser.