Ny AI-agent tränad att göra tillförlitliga statistiska tester
AI-agenter baserade på stora språkmodeller gör ofta subtila logikfel när de analyserar data – och befintliga tester fångar inte upp det problemet. Forskarna bakom Fisher-R1 byggde ett nytt testramverk med 425 verkliga uppgifter inom ekonomi, biologi och medicin, och tränade sedan sin modell med förstärkningsinlärning (en metod där modellen belönas för korrekta svar). Resultatet: Fisher-R1-14B presterade 21% bättre än DeepSeek-V4-Pro i genomsnitt, och upp till 26% bättre på de svåraste uppgifterna.
Djupdykning
LLM-agenter kan redan idag skriva kod, köra analyser och spotta ur sig p-värden – men det visar sig att de ofta drar fel slutsatser även när matematiken stämmer. Problemet är subtilt: en modell kan korrekt beräkna ett statistiskt test men välja fel testmetod för datat, som att använda ett parametriskt test på data som bryter mot normalfördelningsantagandet. Det är ungefär som att räkna ut ett medelvärde perfekt på data där medianen är det enda meningsfulla måttet – svaret ser trovärdigt ut men är meningslöst. Det de flesta missar är att detta inte bara är ett AI-problem – det är ett problem som speglar hur svårt statistisk inferens faktiskt är för människor också, och att vi nu bygger system som kan automatisera den här typen av fel i industriell skala inom forskning. Fisher-R1 tränas med reinforcement learning där belöningen är statistisk korrekthet, inte bara att koden körs utan krasch, vilket är en viktig distinktion mot hur de flesta LLM:er tränas idag. Att en 14B-parametersmodell slår GPT-5.4 på just det här domänspecifika problemet antyder att specialiserad träningsdata och rätt belöningssignal kan väga tyngre än råstorlek – något som borde ge de stora labben lite att tänka på inför nästa kapprustning.