Nytt riktmärke avslöjar att finansiella AI-modeller är sämre än de ser ut

arXiv cs.AI

Forskare har tagit fram FinRiskAtlas, ett kinesiskspråkigt riktmärke (benchmark) med 9 742 testfall som mäter hur bra stora språkmodeller faktiskt presterar i professionella finansiella granskningsflöden – inte bara om de kan finanskunskap i allmänhet. Resultaten från 33 modellkonfigurationer visar att generella finanspoäng kan ge upp till 18 poäng fel när man väljer modell för specifika arbetsuppgifter. Det intressanta: att en modell är bra på finanskunskap säger alltså ganska lite om den klarar de beslut den faktiskt ska stödja.