Nytt ramverk förbättrar AI:s kodgenerering med 3 procentenheter
arXiv cs.AI
Forskare har utvecklat RobustTests, ett ramverk som förbättrar hur stora språkmodeller lär sig skriva kod via reinforcement learning (en träningsmetod där modellen belönas för rätt svar). Nyckeltricket är att använda nästan-korrekta felaktig kod för att skapa bättre testfall, vilket minskar problemet med 'reward hacking' där modellen hittar kryphål i belöningssystemet. I praktiken gav metoden Qwen3-32B tre procentenheter bättre resultat på kodnings-benchmark LiveCodeBench jämfört med standardmetoder.