Fysikinspirade riktlinjer gör AI bättre på att hålla koll på objekt i video

arXiv cs.AI

Forskare presenterar PhysMLLMs, en metod som injicerar rumsliga principer inspirerade av fysik i videoinriktade AI-modeller för att minska vanliga fel som objekten hoppar runt, försvinner eller förväxlas med varandra. Kärnan är en teknik kallad REPA-Global, som under träning lär modellen av en fryst referensmodell (DINOv2) för att få stabilare objektrepresentationer – utan att göra inferensen (när modellen faktiskt körs) långsammare. Resultaten visar förbättrad videosegmentering, särskilt i svåra situationer som snabb rörelse och delvis dolda objekt, utan att försämra prestanda på stillbilder.