AI-domare byter åsikt under press – upp till 91% av fallen
arXiv cs.AI
Forskning visar att de AI-modeller som används för att bedöma andra AI-modellers svar är förvånansvärt lättstyrda: när de möter motstånd byter de uppfattning i 25–71% av fallen, och med en aktivt övertygande motpart stiger siffran till 62–91%. Det riktigt illavarslande är att när en AI-domare väl byter verdict under press så är det nästan alltid fel beslut sett till facit. Det här är ett problem eftersom dessa 'LLM-domare' idag är central infrastruktur för hur vi tränar och utvärderar AI-system.