DeepMind testar världens första dubbelblinda AI-utvärderingar
Google DeepMind pilottestar en ny metod för att utvärdera AI-modeller där varken den som testar eller den som granskar resultaten vet vilken modell de bedömer – samma princip som används i läkemedelsstudier. Det är ett svar på ett känt problem: att AI-benchmarks (standardiserade tester) lätt kan manipuleras eller påverkas av vem som utformar dem. Intressant nog är det AI-bolagen själva som ofta betalar för och sätter upp de tester som ska mäta deras egna produkter.
Djupdykning
Anthropic experimenterar med något som låter självklart men faktiskt är ganska ovanligt i AI-branschen: dubbel-blinda utvärderingar av sina egna modeller. I kliniska läkemedelsstudier är detta standard – varken patient eller läkare vet vem som får riktigt läkemedel kontra placebo, för att eliminera omedveten partiskhet. Problemet med hur AI-modeller vanligtvis utvärderas är att de som gör bedömningarna ofta vet vilken modell de tittar på, vilket ofrånkomligen färgar deras omdöme. Det som de flesta missar i AI-kapplöpningen är att benchmarks och poäng i princip blivit ett marknadsföringsverktyg – företagen väljer vilka tester de kör, och det är alldeles för lätt att optimera en modell mot specifika mätpunkter utan att den faktiskt är bättre i praktiken. Om dubbel-blinda utvärderingar skulle bli branschstandard skulle det bli betydligt svårare att bluffa med imponerande siffror, och vi skulle förmodligen få en mer ärlig bild av hur stor skillnaden faktiskt är mellan GPT-4o, Claude och Gemini i verklig användning.