OpenAI bromsar modellsläpp med nya säkerhetsgränser

OpenAI Blog

OpenAI inför skärpta kontroller för hur snabbt nya AI-modeller får släppas – tanken är att takten ska styras av säkerhetsläget, inte marknadspress. Det handlar om förbättrad övervakning, alignment-tester (säkerställer att modellen beter sig som avsett) och skydd mot cyberhot. Intressant att notera: att ett AI-bolag öppet säger att de kan behöva sakta ner är fortfarande ovanligt.

Djupdykning

OpenAI har börjat tala öppet om något de kallat "cyber-kritiska kapaciteter" – en intern term för när en AI-modell når en tröskel där den potentiellt kan användas för seriösa cyberattacker, som att hitta och utnyttja säkerhetshål i kritisk infrastruktur. Det handlar alltså inte om hypotetiska framtidsscenarier utan om att sätta bromsar redan innan modellerna når marknaden. Kärnan i deras nya ramverk är att koppla releasebeslutet till faktiska kapacitetstester: om en modell klarar vissa benchmarks för farliga förmågor, pausar man tills man har tillräckliga motåtgärder på plats. Det de flesta missar när de läser detta är att OpenAI i praktiken erkänner att de idag inte fullt ut förstår vad deras egna modeller kan göra – och att de bygger infrastruktur för att hantera det okända snarare än det kända. Det är en betydande förändring från tidigare kommunikation som ofta handlade om att betona säkerhetsarbete i efterhand. Frågan är om deras konkurrenter – Anthropic, Google DeepMind, kinesiska labb – tillämpar liknande bromsar, eller om marknadslogiken ändå driver alla mot att pusha ut kapabla modeller så fort som möjligt.