Nytt AI-ramverk når 95% träffsäkerhet på komplexa finansberäkningar

arXiv cs.AI

Forskare har byggt CIFQA, ett system där flera AI-agenter samarbetar men lämnar över all matematik till deterministiska Python-verktyg – i stället för att låta språkmodellen räkna själv. Resultatet är 95,5% korrekthet på beräkningstunga frågor om sparkonton, vilket slår betydligt större modeller. Det intressanta: en öppen 17-miljarders-modell i CIFQA-ramverket presterade bättre än mycket större frontier-modeller, vilket antyder att arkitektur spelar större roll än råstyrka.