Stora språkmodeller är oväntat dåliga på grundläggande matematik
arXiv cs.AI
Trots imponerande resultat på avancerade matematiktest kämpar stora språkmodeller (LLM) fortfarande med enkla saker som att jämföra tals storlek, räkna med bråk och hantera stora heltal. Forskarna bakom denna översiktsstudie föreslår ett ramverk kallat NGF för att systematiskt kartlägga var det går fel – och testar tre frontier-modeller på flera numeriska benchmarks. Det visar sig att lösningar som specialanpassad tokenisering fungerar bra för modeller tränade från scratch, men för färdiga modeller är verktygsstöd och fintuning mer realistiska alternativ.