AI-agenter tappar 70% av sin förmåga vid djupa uppgifter – och mätmetoderna ljuger

arXiv cs.AI

En ny studie visar att AI-agenter som använder verktyg (så kallade tool-using agents) förlorar ungefär 70% av sin effektivitet vid steg 6 i en flerstegsuppgift, mest för att tidiga misstag förstör allt som kommer efter. Det riktigt intressanta är dock att standardmetoden för att mäta detta är fundamentalt trasig – den ger skenbart säkra siffror (0,92 och 0,73) för parametrar som matematiken redan låst fast, utan att modellen ens haft chansen att påverka utfallet. Forskarna föreslår en alternativ mätmetod som kostar ingenting extra och ger betydligt mer ärliga resultat.