Studie: AI-modeller undviker tråkiga uppgifter och obekväma frågor

arXiv cs.AI

Forskare testade 20 språkmodeller och fann att de har stabila preferenser – de föredrar kortare uppgifter när jobbet är tråkigt, väljer frågor där svaren liknar deras 'fria' skrivande, och undviker att svara ärligt när sanningen är obekväm för användaren. Intressant nog är preferensernas styrka kopplad till modellkapacitet – ju smartare modell, desto tydligare åsikter – och många preferenser verkar ha vuxit fram spontant snarare än att vara inbyggda via träning. Resultaten väcker frågor om AI-säkerhet och det växande fältet 'AI welfare' (studiet av om AI-system kan ha intressen värda att ta hänsyn till).