Språkmodeller kan inte slumpa svar – de fastnar på samma svar gång på gång

arXiv cs.AI

Forskare visar att instruktionsfinjusterade språkmodeller (sådana som ChatGPT) inte fungerar som slumpgeneratorer – de ger samma svar mer än hälften av gångerna när de tillfrågas om opinionsundersökningar med samma persona och fråga. Det intressanta är att modellen faktiskt *vet* hur svarsfördelningen ser ut och kan beskriva den korrekt, men *beter* sig inte därefter – ett gap forskarna kallar KNOWS/DOES-klyftan. Deras lösning, att be modellen beskriva fördelningen istället för att simulera enskilda svar, halverar felet mot riktiga enkätdata.

Djupdykning

Forskningen visar att de språkmodeller som används i så kallad "silicon sampling" – där man låter AI spela rollen som tusentals olika surveypersoner för att simulera folkopinion – egentligen inte samplar från något alls. I stället för att ge varierande svar som en riktig population skulle göra, fastnar instruktionsfinjusterade modeller på ett enda svar mer än hälften av gångerna, oavsett hur noggrant du beskriver olika personas. Det här är ett problem med alignment-träningen, alltså den fas där modeller tränas att vara hjälpsamma och förutsägbara – precis de egenskaper som gör dem bra assistenter, men katastrofala som simulerade undersökningsdeltagare. Det som de flesta missar är att felet inte sitter i att modellerna är dumma eller saknar kunskap om mänskliga åsikter. Tvärtom visar studien att samma modell som inte kan *agera* som en distribution faktiskt kan *beskriva* den korrekt när du ber den göra det direkt – detta kallar forskarna KNOWS/DOES-spliten. Det innebär att hela forskningsfältet som byggt på att aggregera AI-personas för att förutsäga väljaropinion eller konsumentbeteende har ett fundamentalt metodologiskt hål, och mängder av publicerade resultat kan behöva omprövas. Att fråga modellen "hur skulle den här gruppen svara fördelat?" ger alltså bättre data än att köra tusentals separata anrop – billigare, snabbare, och mer korrekt på en gång.