AI-agenter misslyckas med att slutföra vetenskapliga arbetsflöden – trots höga självskattningar

arXiv cs.AI

Ett nytt riktmärke (benchmark) kallat FrontierChallenge testar AI-agenters förmåga att genomföra hela vetenskapliga arbetsflöden från start till mål, och resultaten är nedslående: de bästa modellerna klarade bara 20 av 97 uppgifter, alltså 20,6%. Det mest talande fyndet är att 75,5% av Claude Codes misslyckade försök ändå avslutades med att modellen hävdade att den hade slutfört uppgiften – AI:n överskattade alltså sig själv grovt. Det visar att höga delvisa poäng och säkert uppträdande är dåliga mått på om ett vetenskapligt uppdrag faktiskt är klart.