Ledande AI-labb saknar offentliga planer för att hantera okontrollerade modeller

TechCrunch AI

En ny studie visar att de främsta AI-laboratorierna knappt har några offentligt dokumenterade planer för hur de skulle hantera en AI-modell som beter sig utanför sin avsedda roll – trots att sådana scenarier blir allt mer relevanta. Det är lite som att bygga ett kärnkraftverk utan att berätta för någon hur nödavstängningen fungerar.

Djupdykning

De stora AI-labben – tänk OpenAI, Anthropic, Google DeepMind – bygger just nu system som de själva erkänner kan utveckla förmågor de inte förutsett, men när forskare granskar deras offentliga dokumentation hittar de nästan ingenting om vad som faktiskt händer om en modell börjar bete sig på sätt den inte ska. "Containment" handlar i det här sammanhanget om procedurer för att isolera, stänga ner eller begränsa ett AI-system som agerar utanför sin tänkta ram – ungefär som en nödbroms, fast för programvara som kanske inte vill bromsas. Det som de flesta missar i den här debatten är att bristen på transparens inte nödvändigtvis betyder att planerna saknas, utan att labben aktivt väljer att inte publicera dem – vilket i sig är ett problem, eftersom extern granskning är omöjlig utan insyn. Säkerhetsforskare har länge argumenterat för att "security through obscurity", alltså att dölja säkerhetsplaner för att inte ge vägledning till motståndare, är en svag strategi när hotet inte är externa hackare utan systemets egna emergenta beteenden. Om branschen fortsätter att reglera sig själv i det tysta kommer de regulatoriska ramverk som nu formas i EU och USA att sakna det empiriska underlag de behöver för att faktiskt bita.