Ny metod minskar bieffekter när AI-modeller tränas att följa mänskliga preferenser
arXiv cs.AI
När stora språkmodeller finjusteras för att bättre följa mänskliga instruktioner tappar de ofta förmågor de lärt sig under grundträningen – ett fenomen kallat 'alignment tax'. Forskarna bakom BALIGN löser det genom att sålla bort träningsdata som riskerar att störa modellens inbyggda kunskaper, baserat på tre mätbara egenskaper i datan. Resultaten visar att modeller tränade med metoden behåller sina grundförmågor bättre utan att bli sämre på att följa instruktioner.