Ny metod förbättrar hur AI-modeller uppdateras med ny fakta utan omträning
arXiv cs.AI
Forskare har tagit fram MO-IKE, en teknik som använder flermålsbaserad förstärkningsinlärning (RL) för att bättre styra vilka exempel som matas in i en språkmodell när man vill korrigera föråldrad kunskap – utan att behöva träna om modellen från grunden. På Llama-3.2 ökade träffsäkerheten vid faktakorrigeringar från 85 till 92 procent, och modellens förmåga att behålla oförändrad kunskap förbättrades med hela 23 procent. Det intressanta här är att problemet inte var bristen på RL, utan att tidigare metoder optimerade för ett mål i taget – ungefär som att finjustera en bil för toppfart men glömma bromsar och styrning.