Nytt test avslöjar att AI-modeller kämpar med vetenskapliga instruktioner

arXiv cs.AI

Forskare har lanserat SciMIF, ett nytt utvärderingsramverk som testar hur väl multimodala AI-modeller (modeller som hanterar både text och bilder) följer komplexa vetenskapliga instruktioner – över 22 olika uppgifter inom fem ämnesområden. Det intressanta fyndet: större modeller presterar inte nämnvärt bättre, och kemi visade sig vara det svåraste området för nuvarande modeller. Det tyder på att råstyrka i form av fler parametrar inte löser det verkliga problemet – att faktiskt förstå och tillämpa ämnesspecifik kunskap.