Nytt test avslöjar stora brister hos AI-modeller som analyserar medicinska vävnadsbilder

arXiv cs.AI

Forskare har byggt PathVU, ett nytt testramverk för att mäta hur väl multimodala språkmodeller (AI som kan tolka både text och bild) förstår patologibilder – alltså mikroskopbilder av vävnad som används vid cancerdiagnostik. Ramverket innehåller över 61 000 bilder och 308 000 testfrågor från 28 olika organ, och när 18 moderna AI-modeller utvärderades visade resultaten tydliga svagheter hos samtliga, även de mest avancerade. Det intressanta här är att modellerna klarar sig okej på att ge slutsvar, men kämpar när de måste resonera om detaljer på rätt skalningsnivå – precis det som en patolog faktiskt gör.

Djupdykning

AI-modeller som analyserar vävnadsprover har länge bedömts på ett ganska naivt sätt – kan de ge rätt diagnos? Men diagnostik i patologi fungerar inte så. En patolog zoomar in och ut, identifierar specifika cellstrukturer i ett område, relaterar dem till vävnadens makroarkitektur, och väger osäkerheter mot varandra. PathVU-benchmarken testar just det: om en modell faktiskt *ser* vad den påstår sig förstå, genom 14 olika uppgifter som kräver allt från att lokalisera regioner till att bedöma när det saknas tillräcklig information för att svara. Det modellerna faktiskt misslyckas med är avslöjande – inte de svåra diagnoserna, utan de grundläggande visuella uppgifterna som att räkna celler eller placera strukturer i relation till varandra, vilket antyder att nuvarande modeller lärt sig att *låtsas* resonera snarare än att faktiskt processa bildinnehållet på ett robust sätt. Med 61 000 bilder och drygt 300 000 samples från 28 organ finns det nu en rejäl grund för att faktiskt mäta det som spelar roll innan AI-verktyg börjar hittas i kliniska flöden på allvar.