Nya testet avslöjar att AI-modeller är känsliga för ledande information – även de bästa
Forskare har skapat AnchorBench, ett test som mäter hur mycket stora språkmodeller (LLMs) påverkas av 'ankringseffekten' – den kognitiva bias där ett första referensvärde drar senare bedömningar mot sig. Testet kördes på 14 modeller, och resultatet är lite obekvämt: även frontier-modeller med över 95% korrekthet i kontrollbetingelsen visade sig vara mottagliga för ledande information. Med andra ord räcker det inte att en modell är smart – den kan ändå manipuleras av hur frågan är formulerad.
Djupdykning
Ankaret är ett av de mest robusta fynden inom kognitiv psykologi – om du frågar folk att uppskatta Eiffeltornets höjd efter att ha visat dem siffran 1000, gissar de högre än om du visat dem 100. Nu visar AnchorBench att GPT-4 och kompisar faller i exakt samma fälla. Det som gör den här studien skarpare än tidigare är att de separerar på *hur* ankaret introduceras – kallas "pathway" – och om ankaret är rimligt eller uppenbart fel, vilket ingen riktigt gjort systematiskt innan. Den jobbiga slutsatsen är att en modell kan svara rätt 95% av tiden utan ankar, och ändå manipuleras ordentligt så snart du lirkar in ett trovärdigt referensvärde i rätt del av prompten. RAG (Retrieval-Augmented Generation, när modellen söker extern info och använder den som grund för svaret) visar sig vara en särskilt effektiv kanal för ankareffekten – vilket är oroväckande eftersom RAG just nu används för att göra AI-system mer faktabaserade, men alltså kan bli en bakdörr för påverkan om källorna är skeva.