Nytt test visar hur bra AI-agenter klarar riktig biologisk forskning

arXiv cs.AI

Forskare har lanserat BixBench3, ett test som mäter hur väl AI-agenter kan genomföra fullskaliga beräkningsbiologiska analyser – från rådata till vetenskapliga resultat. Av 13 testade modeller presterar GPT 5.6 Sol bäst med poängen 0,48, medan Gemini 3.1 Flash Lite landar på 0,00, och varje uppgift kostar i snitt 43 dollar och tar 6,8 timmar. Intressant nog använde de bäst presterande agenterna färre tokens och var billigare än sämre alternativ – mer är alltså inte alltid bättre.