Nytt system gör det svårare att läcka bortglömd data ur AI-modeller
arXiv cs.AI
När företag vill radera känslig information från en tränad språkmodell räcker det inte att ta bort exakt de exempel man pekat ut – modellen kan fortfarande svara via omformuleringar och angränsande data. Forskarna bakom GRAPHSU bygger en graf över hur träningsexempel stödjer varandra och sprider raderingskraften dit den faktiskt behövs, vilket minskade informationsläckage med upp till 49,5 procentenheter jämfört med att bara radera de utpekade exemplen. Testerna gjordes på GPT-2 Medium och Llama-3.2-3B, och resultaten antyder att compliance-kraven kring AI-modeller är svårare att uppfylla än de flesta nog trott.