Färdigheter kan göra AI-agenter sämre – inte bara bättre
Forskare testade AI-agenter med och utan inbyggda procedurfärdigheter i nästan 6 000 körningar och hittade ett oväntat mönster: de bästa färdigheterna vinner inte för att de hjälper mer, utan för att de stjälper mindre. Problemet är att en färdighet kan förändra agentens beteende redan genom att finnas i kontexten – även om den aldrig används – och tenderar att trycka undan den verifiering som agenten annars skulle göra själv. Det här är ett påminnelse om att genomsnittlig förbättring som enda mått döljer reella försämringar.
Djupdykning
Forskarna bakom den här studien gjorde något ganska enkelt men oväntat: istället för att bara mäta om AI-agenter blir bättre av att få inbyggda färdigheter (procedural skills – tänk "här är en steg-för-steg-guide för hur du hanterar kalenderinbjudningar"), mätte de också hur ofta agenterna faktiskt försämrades. Efter nästan 6 000 testkörningar visade det sig att de bästa färdigheterna inte vann för att de hjälpte mer – de vann för att de saboterade mindre. Det finns tre sätt de kan gå fel: en färdighet kan ändra agentens beteende bara genom att existera i kontextfönstret, även om den aldrig används (kallas "description osmosis"); den kan tvinga agenten att tolka sina indata på fel sätt; eller den kan stoppa agenten från att dubbelkolla sina egna svar. Det som verkligen sticker ut är att hela branschen optimerar för fel sak – man pumpar in mer procedurvägledning när den egentliga flaskhalsen är hur agenten förstår uppgiften från början och hur den verifierar att den faktiskt lyckades.