Fler GPU:er eller mindre cache? Forskning visar när det ena slår det andra

arXiv cs.AI

När en AI-modell får slut på minnesutrymme för sin KV-cache (det korttidsminne som håller konversationskontext) finns två vägar: köp fler GPU:er eller komprimera cachen. Ny forskning som testat Llama-2 i storlekarna 7B och 70B på A100-, A40- och H100-hårdvara finner att komprimering är 1,2–2,0 gånger billigare per miljon tokens – men bara för modeller under ungefär 36 miljarder parametrar på ett 80 GB-kort. För större modeller finns inget val: fler GPU:er är enda möjligheten, medan komprimering däremot kan ge upp till 16,5 gånger mer kapacitet per spenderad dollar jämfört med 1,21 gånger för åtta GPU:er.