Nytt test avslöjar: AI-modeller ritar snygga diagram men hittar på data

arXiv cs.AI

Forskare har skapat DEEPCHART, ett benchmark med 1 482 uppgifter för att mäta hur bra stora språkmodeller (LLM:er) faktiskt är på att generera korrekta diagram från verkliga data. Resultaten är avslörande: modellerna producerar visuellt övertygande diagram som döljer datafabrikationer (så kallad hallucination), där felen uppstår redan i steget att extrahera och räkna på källdata. Det räcker alltså inte med större kontextfönster – modellerna behöver bli bättre på att faktiskt förstå och beräkna data innan de ritar något.