Populärt sätt att testa AI-minne visar sig mäta fel sak

arXiv cs.AI

Forskning visar att en vanlig metod för att testa hur bra stora språkmodeller hanterar långa texter – att ta bort innehåll från mitten av prompten – egentligen mäter något helt annat: hur ofta rätt information råkar överleva klippningen. Vid 25% kontextbehållning klarade sig det relevanta svaret i under 1% av fallen. När forskarna istället tog bort bara irrelevant text (distraktorer) och behöll det viktiga, presterade Claude Haiku och Sonnet faktiskt bättre än med full kontext – vilket antyder att kortare men renare input kan hjälpa mindre modeller.