Nytt riktmärke avslöjar att AI-agenter fastnar i gamla hjulspår vid prestandaoptimering
arXiv cs.AI
Forskare har tagit fram InferenceBench, ett test där AI-agenter får två timmar på sig att optimera hastigheten hos en LLM-server på en H100-GPU. Agenterna klarar sig hyfsat – upp till 8 gånger snabbare än en naiv PyTorch-baslinje – men slår inte ett enkelt hyperparametersök som når 11,5 gånger. Det intressanta är varför: agenterna känner till många tekniker men fastnar ändå i samma ramverk och spenderar budgeten på att justera detaljer snarare än att pröva genuint olika strategier.