OpenAIs nya modell Astra döljer sitt resonemang – experter varnar för branschtrend

Breakit

OpenAIs kommande modell Astra är byggd så att delar av dess tankeprocess inte går att läsa för människor – ett designval som säkerhetsexperter nu slår larm om. Oron är att om resten av branschen följer efter kan vi förlora möjligheten att förstå hur AI-agenter faktiskt fattar beslut, vilket gör det svårare att upptäcka fel eller manipulation. Det är en ganska central fråga: vill vi ha kraftfulla AI-system vars inre logik är en svart låda?

Djupdykning

OpenAIs modell Astra använder något som kallas "hidden chain-of-thought" – alltså att modellen har ett internt resonemang som varken användare eller OpenAI själva kan läsa, ungefär som att anlita en konsult som vägrar visa sina anteckningar. Det låter tekniskt, men implikationen är ganska konkret: när AI-agenter börjar fatta beslut åt oss i verkliga system – boka möten, hantera mejl, köra kod – vet vi inte längre varför de gör vad de gör. Säkerhetsforskare är oroliga för att om OpenAI normaliserar det här upplägget kommer konkurrenter som Google och Anthropic att göra likadant, eftersom dolt resonemang ofta är snabbare och billigare att träna. Det som går förlorat är inte bara transparens som ett abstrakt ideal – det är möjligheten att felsöka, reglera och faktiskt förstå när en modell har gått fel. Det de flesta missar i debatten är att vi redan accepterat liknande svarta lådor i decennier, från kreditbedömningsalgoritmer till innehållsmoderering på sociala medier, men AI-agenter är annorlunda eftersom de agerar, inte bara klassificerar. När beslutsmakten kombineras med ogenomskinlighet på det här sättet handlar det inte längre om en teknisk detalj – det handlar om vem som egentligen har kontroll.