Nytt fysik-test avslöjar: bästa AI-modellen klarar bara en tredjedel av olympiadnivå-problem

arXiv cs.AI

Forskare har lanserat PhysElite, ett nytt testramverk med 11 586 fysikproblem på olympiadnivå, för att mäta hur bra stora språkmodeller egentligen är på avancerad fysik. Resultaten är tydliga: den starkaste modellen klarade bara 33,7% av uppgifterna rätt, vilket antyder att dagens AI-modeller fortfarande har långt kvar till genuin expertförmåga inom naturvetenskap. Det intressanta är att testet även analyserar var i resonemangsskedena modellerna börjar tappa tråden – inte bara om svaret blir rätt eller fel.