Nytt ramverk avslöjar hur AI-modeller faktiskt löser matteproblem – inte bara om de får rätt svar

arXiv cs.AI

Forskare har tagit fram ett nytt utvärderingssystem för stora språkmodeller som tittar på hur modellen resonerar steg för steg, snarare än om slutsvaret blir rätt. Det intressanta fyndet: modeller med liknande slutresultat kan ha helt olika förmågor under huven – vilket betyder att dagens standardtester missar väsentlig information om vad modellerna faktiskt klarar av. Ramverket täcker både text- och bildbaserade matematikuppgifter och använder automatiserade pipelines för att generera detaljerade annoteringar.