AI-domare för bild och video är inte lika pålitliga som vi tror

arXiv cs.AI

Forskare har testat så kallade 'OmniJudges' – AI-modeller som automatiskt utvärderar kvaliteten hos bild-, video- och ljudgenerering – och funnit att de har systematiska blinda fläckar. Med hjälp av ett nytt testramverk kallat D3-Omni, med 53 separata förmågedimensioner och över 10 000 testfall, visade det sig att modellerna är betydligt bättre på att bekräfta när något fungerar än att upptäcka när det faktiskt brister. Det intressanta är att ett högt aggregerat betyg kan dölja ganska stora problem – vilket är ett problem när dessa domarmodeller används för att träna nästa generation av AI.