Nytt riktmärke mäter hur väl AI-modeller täcker olika svar – inte bara kvaliteten på ett enda svar

arXiv cs.AI

Forskare har lanserat VTC-Bench, ett riktmärke (benchmark) som utvärderar hur många genuint olika och användbara svar en AI-modell kan producera på k försök – inte bara hur bra ett enskilt svar är. Det visar sig att modeller som presterar bäst på traditionella mått inte nödvändigtvis är de som ger bäst täckning av möjliga lösningar. Det är en påminnelse om att hur vi mäter AI-prestanda i hög grad styr vilka modeller vi tror är bäst.