Nytt ramverk effektiviserar hur AI-agenter anpassas och testas
arXiv cs.AI
Forskare har utvecklat HarnessLens, ett system som gör det billigare att förbättra de 'sele'-strukturer (instruktioner och verktyg) som styr hur språkmodellsagenter beter sig. Istället för att testa varje förändring mot hela uppgiftsmängden testar systemet bara mot relevanta beteenden – vilket gav 7,6–13,6% bättre prestanda på hållna testset med betydligt lägre beräkningskostnad. Intressant nog är problemet de löser klassiskt inom mjukvaruutveckling: hur hittar man regressioner (försämringar) utan att behöva köra hela testsviten?