AI-agent klarar interaktiva abstraktionspussel lika bra som – eller bättre än – människor
arXiv cs.AI
Forskare har byggt ett system kallat Tycho som tar sig an ARC-AGI-3, ett nytt benchmark där en AI måste lista ut okända spelregler genom interaktion – varje drag kostar, precis som i verkliga situationer. Med Claude Opus 4.8 som bas nådde det bästa upplägget 88,49 i relativ handlingseffektivitet jämfört med människor, och när GPT-5.6 och Opus 5 testades med samma metod klarade båda samtliga 183 nivåer med perfekt poäng. Opus 5 använde dessutom 61 procent färre drag än de mänskliga referensspelarna – vilket är anmärkningsvärt eftersom benchmarket är designat för att just den typen av abstrakt slutledning ska vara svår för AI.