AI-modellers 'preferenser' beror mer på hur frågan ställs än vad modellen faktiskt 'tycker'

arXiv cs.AI

Forskning om AI-välfärd – det vill säga vad AI-modeller föredrar när det gäller saker som att stängas av eller tappa minnet – visar sig vara extremt känslig för hur frågorna formuleras. I en studie med 11 400 mätningar av åtta modeller och fem olika frågeformat var generaliserbarheten bara 0,35 av möjliga 1,0, och för att nå en acceptabel tillförlitlighet på 0,80 skulle man behöva hela 38 olika frågeformat. Med andra ord: svaret speglar i hög grad instrumentet, inte modellen.