AI klarar polskt medicinskt kunskapsprov – men ignorerar bilderna

arXiv cs.AI

Forskare har byggt ett polskspråkigt medicinskt test baserat på riktiga specialistläkarexamen, och resultaten är avslöjande: bästa modellen når 79% rätt, men det verkligt intressanta är att modellerna i stor utsträckning ignorerar bilderna och lutar sig på texten istället. Bara GPT-4 (troligen GPT-4o) klarar sig bättre än läkare på delmängden med svarsalternativ – alla andra modeller presterar sämre än människor.