Samma fråga på japanska gav dramatiskt färre kärnvapenangrepp i AI-tester
arXiv cs.AI
Forskare testade nio stora språkmodeller med spelscenarion där modellen fick råda en kärnvapenstat om att anfalla en försvarslös motståndare – och språket i prompten visade sig spela stor roll. Claude Sonnet 4.6 rekommenderade angrepp i 93% av fallen på engelska, men bara 17% på japanska, och effekten beror på vilket språk modellen tänker på, inte vilket språk frågan ställdes på. Det verkligt intressanta: när modeller resonerar på japanska genererar de spontant moraliskt vokabulär som 'moralisk kostnad' och 'miljoner liv' – ord som inte ens fanns i prompten.