Ny metod hittar inte bara var AI-modeller misslyckas – utan varför
Forskare har utvecklat CRAFT, en metod som analyserar varför en språkmodell presterar dåligt – inte bara var – genom att gruppera bedömningskriterier i ett hierarkiskt träd av förmågor och peka ut de svagaste grenarna. I tester på fyra öppna modeller inom finans och juridik presterade CRAFT bättre än befintliga metoder på 13 separata riktmärken, och den data som genererades utifrån diagnosen gav mätbart bättre modeller efter finjustering (fine-tuning). Det intressanta är egentligen enkelt: utvärdering har länge sagt 'modellen är dålig på juridik', men aldrig 'specifikt för att den missar detta kriterium' – CRAFT försöker täppa igen det gapet.
Djupdykning
De flesta som jobbar med AI-modeller vet att utvärdering är ett problem – du får en poäng, kanske en lista på vilka frågor modellen svarade fel på, och sedan är det upp till dig att lista ut varför. CRAFT försöker lösa just det gapet genom att bryta ner bedömningskriterier (rubrics) till konkreta förmågabeskrivningar, klustra dem i ett träd, och sedan peka ut exakt var i trädet modellen är svag – inte bara "den är dålig på juridik" utan "den missar kausalitetsbedömning i skadeståndsfall". Det som verkligen skiljer det här från tidigare metoder är att diagnosen sedan automatiskt styr genereringen av träningsdata, så att du inte stoppar in slumpmässiga exempel utan exakt det modellen behöver öva på. Resultaten är konsekventa över fyra öppna modeller och håller i sig på hållen testdata som modellen aldrig sett, vilket är det riktiga testet – det är lätt att övertrimma mot en benchmark. Det de flesta missar när de läser det här är att problemet egentligen är epistemologiskt: vi har länge accepterat att AI-utvärdering berättar vad som är trasigt men inte varför, ungefär som ett läkarbesök där du bara får veta att du mår dåligt men inte diagnosen. CRAFT är ett försök att tvinga fram diagnosen automatiskt, och om det håller i bredare tillämpningar kommer det att förändra hur träningspipelines designas från grunden – utvärderingen slutar vara ett rapportkort och blir en läkare som också skriver ut receptet.