Forskare vill göra AI-alignment till ett demokratiskt val
arXiv cs.AI
När en AI fattar beslut som påverkar flera personer uppstår ett grundläggande problem: vems preferenser ska styra? Forskare argumenterar att den vanliga metoden RLHF (träning med mänsklig feedback) har dåliga garantier ur ett rättviseperspektiv, och föreslår istället ett ramverk från välfärdsekonomi som gör det möjligt att explicit styra hur nytta och skada fördelas mellan grupper. Metoden testas på verkliga dilemman som njurallokering, matutdelning och hur språkmodeller svarar – vilket gör den ovanligt konkret.