Rätt svar, fel beräkning: varför AI-agenter behöver mer än träffsäkerhet

arXiv cs.AI

En ny studie pekar på ett grundläggande problem med hur vi utvärderar AI-agenter som jobbar med strukturerad data: ett korrekt svar kan ha tagits fram på fel sätt, utan giltig beräkning bakom. I testet på BIRD Mini-Dev-datasetet hade modellerna en 'felaktig spårfrekvens' (CAIT Rate) på hela 45–59%, vilket betyder att nästan varannan gång systemet fick rätt svar var beräkningsvägen ändå ogiltig. Forskarna föreslår ett nytt utvärderingskriterium kallat Trace Integrity – ungefär 'spårbarhet' – som kräver att hela beräkningskedjan ska gå att granska och reproducera.