AI-modeller misslyckas med att räkna enkla händelser i video
arXiv cs.AI
En ny studie avslöjar att videomodeller som Gemini 3.6 Flash är överraskande dåliga på att räkna händelser i video – i situationer med många och snabba händelser är bara 0,2% av svaren korrekta. Forskarna testade 2 190 videor med studsande bollar, blinkningar och tillståndsövergångar, och fann att modellerna klarar sig hyfsat vid låga frekvenser (upp till 12 händelser vid 0,5–1,0 Hz) men kollapsar helt när tempot ökar. Det intressanta är att fler bildrutor per sekund förbättrar slutresultaten ytligt – men modellen återger ändå bara 3,7% av händelsesekvenserna korrekt, vilket avslöjar att bättre siffror inte nödvändigtvis betyder bättre förståelse.