Nytt test mäter hur bra AI-modeller klarar labarbete i verkligheten

arXiv cs.AI

Forskare har skapat ett benchmark (ett standardiserat test) med 149 uppgifter hämtade från riktiga laboratorieprotokoll som biologer faktiskt modifierade under pågående experiment – inte konstruerade scenarion. Claude Opus 5 presterar bäst med 59,2 procent rätt, medan övriga testade modeller landar mellan 34 och 47 procent, vilket antyder att det fortfarande finns en bit kvar innan AI kan hantera rutinmässigt labarbete på egen hand.