Ny metod hjälper AI-modeller att 'glömma' oönskat beteende mer precist
Forskare har utvecklat GRACE, en metod för att få stora språkmodeller (LLMs) att selektivt glömma oönskad information – ett problem som kallas 'machine unlearning'. Det smarta är att GRACE klarar sig med bara några få exempelmeningar för att identifiera vad modellen ska glömma, i stället för att kräva stora färdigmärkta datamängder. I tester över två modellfamiljer och fyra olika unlearning-algoritmer förbättrade metoden modellens allmänna förmåga utan att tumma på kvaliteten på det som faktiskt skulle glömmas bort.
Djupdykning
AI-modeller är tränade på enorma mängder data, och ibland vill man i efterhand få dem att "glömma" specifik information – kanske träningsdata som visar sig vara upphovsrättsskyddad, personlig information, eller förmågan att generera skadligt innehåll. Det här kallas machine unlearning, och problemet är att du inte kan bara ta bort något ur en neural nätverks-hjärna som att radera en fil. Det knepiga som GRACE löser är att tidigare metoder förutsatte att du redan visste exakt vilken data som skulle glömmas – i verkligheten har du ofta bara några få exempel på det oönskade beteendet och måste lista ut resten själv. Det GRACE gör är att använda gradienter (alltså matematiska riktningar som beskriver hur modellens vikter påverkas av träningsdata) för att hitta vilken data som faktiskt driver det beteende du vill ta bort. Sedan balanserar metoden borttagningen mot att bevara modellens generella förmågor – det är den svåra avvägningen, för aggressivt glömmande tenderar att förstöra saker som inte har med problemet att göra. Det de flesta missar i unlearning-diskussionen är att det här handlar lika mycket om juridik och compliance som om teknik – GDPR:s "rätt att bli bortglömd" sätter faktisk press på AI-företag att kunna ta bort specifika personers data ur redan tränade modeller, och det är ett problem ingen riktigt har löst i stor skala än. GRACE är ett steg mot att göra det möjligt utan att behöva träna om modellen från grunden, vilket annars kostar miljoner dollar och flera veckors beräkningstid.