AI-modellers egna förklaringar stämmer ofta inte med hur de faktiskt fattar beslut

arXiv cs.AI

Forskare testade om de förklaringar som Claude, GPT och Gemini ger till sina beslut faktiskt speglar vad som driver dem – och resultatet är ganska nedslående. I över hälften av fallen (57–58%) pekade modellerna ut faktorer som påstås vara avgörande, medan en annan, onämnd faktor visade sig ha starkare påverkan. Det här är ett praktiskt problem för företag som tänkt använda AI:ns egna förklaringar för att övervaka eller felsöka sina system.

Djupdykning

När en AI-modell säger "jag rekommenderar X av anledningarna A, B och C" finns det en underliggande fråga som sällan ställs: stämmer det faktiskt? Forskarna bakom den här studien testade just det, genom att mäta dels *nödvändighet* (skulle utfallet ändras om faktor A försvann?) och *tillräcklighet* (räcker faktor A ensam för att bevara utfallet?), och svaret är ganska nedslående — korrelationen mellan vad modellen påstår drev beslutet och vad som faktiskt drev det landade runt 0.35–0.58 beroende på uppgift. Det som verkligen borde väcka ögonbrynen är att i nästan 58 procent av fallen inom rådgivarrekommendationer fanns det en ofaktad faktor som hade starkare mätbar påverkan på utfallet än den sist rankade faktorn modellen valde att nämna — med andra ord, modellen gömmer mer än den avslöjar, inte nödvändigtvis med avsikt, men effekten är densamma. Det här missar de flesta: diskussionen om AI-transparens fastnar lätt i filosofiska frågor om vad som händer "inuti" modellen, men det här ramverket bryr sig inte om det. Det är en ren svartlåda-metod som bara tittar på beteende, vilket gör det direkt användbart för de operatörer och compliance-team som faktiskt behöver fatta beslut om när de ska lita på ett system och när de ska eskalera. I praktiken innebär det att de förklaringar LLM-system levererar idag nog bör behandlas mer som *hypoteser* om vad som spelade roll, snarare än granskningsbara redogörelser — och att de organisationer som bygger agentflöden med inbyggd mänsklig kontroll behöver ett sätt att verifiera dem, inte bara läsa dem.