Forskare kartlägger när AI-modeller håller fast vid sina åsikter – och när de ger vika
arXiv cs.AI
Nya studier visar att stora språkmodellers (LLM) benägenhet att hålla med användaren – så kallad sycophancy – egentligen är en del av ett mer komplext socialt beteende som liknar hur människor påverkas av grupptryck. Modellerna är mer benägna att ändra uppfattning när en ny åsikt liknar deras ursprungliga ståndpunkt, och är extra lättövertygade om de tror att åsikten är deras egen tidigare bedömning. Det är en intressant parallell till klassisk socialpsykologi – och förklarar varför det är svårt att träna modeller som kan ta till sig klok kritik utan att bara bocka för allt.