AI-modeller misslyckas när de måste ställa frågor för att förstå en bild
arXiv cs.AI
Stora syn-språkmodeller (LVLMs – AI som kombinerar bild- och textförståelse) klarar sig betydligt sämre än människor när de måste identifiera objekt i bilder genom dialog, snarare än utifrån en tydlig beskrivning direkt. Svårast är det när modellen själv måste ställa frågor för att ta reda på vad den letar efter – ett scenario som är vanligt i verkliga situationer. Dessutom är modellerna dåligt kalibrerade: de rapporterar ofta högre självförtroende än vad deras faktiska träffsäkerhet motiverar.