Nytt test avslöjar att AI-agenter kämpar med att måla efter en förlaga
arXiv cs.AI
Forskare har tagit fram ett nytt benchmark kallat EASEL som testar om AI-modeller kan styra digitala verktyg med precision – till exempel måla en bild som liknar en referensbild. Testet av 25 modeller visade att de flesta misslyckas ganska rejält, med en rekonstruktionslikhet på bara 0,40–0,54 (där 1,0 vore perfekt), och modellerna tenderar att toppa tidigt och sedan försämras. En egen modell tränad på benchmarkens 440 000 träningsexempel, EASEL-9B, presterar 6,3 procent bättre än basmodellen – men det räcker bara till tredjeplats, vilket säger en del om hur svårt uppgiften är.