Nya riktmärket testar om AI verkligen förstår investeringslogik – eller bara låtsas

arXiv cs.AI

Forskare har byggt InvestLogicBench, ett riktmärke (benchmark) med över 200 000 dokumenterade investeringsbeslut från 151 verkliga investerare, för att testa om språkmodeller faktiskt resonerar rätt – inte bara råkar få rätt resultat. Testerna visade att fyra ledande språkmodeller fick nära 4/5 i logisk trovärdighet men bara 0,8–2,8/5 när det gäller att faktiskt grunda sina resonemang i marknadsdata. Det är en påminnelse om att en AI som verkar övertygande och en AI som tänker rätt är två ganska olika saker.