Amazon undersöker när AI-domare håller med varandra – och varför det kan vara ett problem
När flera AI-modeller används som domare för att utvärdera andra AI-system uppstår ett problem: om de är för lika varandra ger de i praktiken samma röst flera gånger. Amazons forskning visar att man bör vikta ned (ge mindre inflytande åt) domare vars svar korrelerar starkt, för att säkerställa att en panel av AI-domare faktiskt representerar olika perspektiv snarare än samma bias upprepat.
Djupdykning
LLM-domare är AI-modeller som används för att utvärdera andra AI-modellers svar – ungefär som att låta en lärare betygsätta andra lärares prov. Problemet som artikeln lyfter är att när flera sådana domare säger samma sak, betyder det inte automatiskt att de har rätt – de kan helt enkelt vara tränade på liknande data och därmed ha samma blinda fläckar. Det är samma logik som när man inte vill ha en jury där alla känner varandra sedan länge och delar exakt samma världsbild. Lösningen som föreslås är att vikta ner domare vars utlåtanden korrelerar starkt med varandra, för att tvinga fram ett panel som faktiskt representerar olika perspektiv. Det de flesta missar här är att "konsensus bland AI-modeller" riskerar att bli ett nytt sätt att baka in bias på industriell skala – om alla ledande modeller är ense om att ett svar är bra, och de alla lärt sig från ungefär samma internetdata med ungefär samma RLHF-metoder (den teknik där mänsklig feedback används för att finjustera modeller), så har vi egentligen bara byggt ett ekokammarliknande kvalitetsmått som premierar det genomsnittliga och bekanta framför det korrekta eller originella. Ju mer AI-träning förlitar sig på AI-genererade utvärderingar, desto mer liknar det ett självförstärkande system utan extern kalibrering.