AI-domare klarar inte av att märka när svaren faktiskt blir sämre
arXiv cs.AI
En ny studie testar hur bra stora språkmodeller är på att fungera som 'domare' och utvärdera andra AI-svar – och resultatet är nedslående: även när modellerna konsekvent ger samma betyg (90%+ stabilitet) missar de faktiska kvalitetsförändringar i 68% av fallen. Ännu oroväckande är att ytliga, stilmässiga ledtrådar räcker för att förutsäga 55–67% av befintliga benchmark-etiketter, vilket antyder att populära utvärderingsdataset som MT-Bench är lättare att 'gissa sig till' än man velat tro.