Nytt protokoll vill göra AI-beslut spårbara och manipuleringssäkra

arXiv cs.AI

Forskare föreslår AIREP, ett protokoll för att logga varje enskilt styrningsbeslut som ett AI-system fattar – till exempel när ett svar blockeras, redigeras eller eskaleras till en människa. Varje beslut sparas som ett signerat objekt i en SHA-256-hashkedja (en manipuleringssäker länkad logg), vilket gör det möjligt för vem som helst att verifiera att inget har ändrats eller raderats i efterhand. Det är i grunden ett försök att lösa ett grundläggande transparensproblem: just nu är det svårt att i efterhand bevisa vad ett AI-system faktiskt gjorde och varför.

Djupdykning

AIREP är i grunden ett standardiserat kvitto-system för AI-beslut – varje gång ett AI-system väljer att blockera, filtrera, eller skicka vidare ett svar skapas ett signerat objekt som vem som helst kan verifiera utan att behöva lita på den som skapade det. Hash-kedjan (tänk blockchain-logik fast utan kryptovalutor) betyder att om någon i efterhand försöker sudda ut ett beslut eller ändra ordningen syns det direkt vid omkontroll. Det som de flesta missar i diskussionen om AI-säkerhet är att problemet sällan är vad ett system gör just nu – det är att vi inte kan bevisa i efterhand vad det faktiskt gjorde, och varför. AIREP adresserar det hålet: istället för att ta ett företags ord för att deras AI följer policy X får externa granskare, regulatorer, eller journalister konkreta bevis att verifiera mot. Protokollet är medvetet leverantörsneutralt och har en inbyggd "neutralitetstest" för att hålla formatet rent från företagsspecifika tolkningar – vilket är en förutsättning för att det ska fungera som gemensam infrastruktur snarare än ännu ett proprietärt system som låser in användare. Det är ungefär samma logik som fick HTTP att vinna: öppna standarder för verifiering bygger förtroende på ett sätt som inga försäkringar från enskilda aktörer kan matcha.