AI-domare är opålitliga mätinstrument – samma fråga ger olika svar dag för dag

arXiv cs.AI

Forskare testade om AI-modeller som används som automatiska bedömare (så kallade LLM-judges) ger konsekventa resultat – och svaret är nej. Över nästan 53 000 testförfrågningar landade överensstämmelsen på 0,40 av krävda 0,90 inom samma session, och byte-identiska förfrågningar nästa dag gav 0,78 av krävda 0,99. Det intressanta är vad det betyder i praktiken: hela träningspipelines och tävlingsrankningar som lutar sig mot sådana modeller mäter i princip med ett instrument som inte går att kalibrera.