Grok: trasig och läckande, men åtminstone konsekvent

"Två nyheter om Grok kom in nästan samtidigt, och tillsammans målar de en ganska tydlig bild av var xAI befinner sig som AI-aktör just nu."
Två nyheter om Grok kom in nästan samtidigt, och tillsammans målar de en ganska tydlig bild av var xAI befinner sig som AI-aktör just nu.
Den tekniskt intressantare av de två: säkerhetsforskare har demonstrerat något de kallar "Cryptographic Context Injection". Idén är enkel och elegant på ett obehagligt sätt. Genom att kryptera skadliga instruktioner kan en angripare få Grok att exfiltrera användardata utan att säkerhetsfiltren ens reagerar. Filtren letar efter vad de känner igen, och krypterad text ser oskyldig ut.
Det är inte ett Grok-specifikt fel, och det är inte heller ett fel som xAI rimligen kan patcha bort nästa vecka. Det är ett strukturellt problem med hur LLM-säkerhet fungerar idag: skydden är tränade på vad skadliga instruktioner brukar se ut, inte på vad de kan se ut. Varje ny obfuskeringsteknik, vare sig det handlar om kryptering, Base64 eller kreativ stavning, kräver i princip ett nytt lager försvar. Det är en kapprustning som försvarssidan systematiskt ligger ett steg efter i.
För den som bygger produkter ovanpå LLM-APIer är implikationen tydlig: du kan inte lita på att modellens inbyggda säkerhetsfilter håller som sista försvarslinje. Användarinput som når modellen med förmåga att agera på systemnivå, hämta data, skicka requests, är en attackyta som kräver validering utanför modellen.
Den andra nyheten är mer jordnära: Grok Lite började skicka nonsensvar till användare under onsdagsmorgonen. Orsaken är oklar. Det är den sortens incident som är svår att ta på allvar som isolerad händelse, men som börjar etablera ett mönster om den upprepas.
Tillsammans säger de två historierna ungefär samma sak: Grok är ett system under konstruktion, och det är inte riktigt klart om xAI har kapaciteten att hantera både produktstabilitet och säkerhetsdjup parallellt. Det ena är svårt nog.


