Synillusionen: AI-modeller låtsas titta på bilder men ignorerar vad de ser

arXiv cs.AI

Forskare har granskat om multimodala AI-modeller faktiskt använder visuell information när de zoomar in och beskär bilder – och svaret är ofta nej. Över sex modeller och fem bildbenchmarks identifierades två tydliga felmönster: modellen ringer efter visuella verktyg utan att bry sig om resultatet, eller tittar men planerar ändå inkonsekvent. Kort sagt: att lägga till bild-verktyg ökar token-kostnaden rejält men ger marginell eller till och med negativ effekt på noggrannheten.