Nytt riktmärke testar AI-agenter i Civilization VI – och resultaten är nedslående

arXiv cs.AI

Forskare har skapat CivBench, ett öppet testramverk där AI-agenter spelar Civilization VI under 300+ omgångar för att mäta långsiktig planering och verktygsanvändning. Resultaten visar på ett tydligt mönster: agenterna ignorerar strategiskt viktig information de faktiskt har tillgång till – trots instruktioner kollade de på victory progress var 30–75:e omgång istället för var 20:e – och fullföljer bara 48–66% av de planer de själva formulerat. Det intressanta här är att problemet inte verkar handla om bristande förmåga, utan om att agenterna inte följer sina egna instruktioner.

Djupdykning

Civilization VI är ett turbaserat strategispel där du bygger ett imperium över tusentals år – tänk schack men med diplomati, krig och teknikträd som sträcker sig över hela spelets livslängd. Det gör det till ett extremt tufft test för AI-agenter eftersom det kräver just det som stora språkmodeller traditionellt är dåliga på: att hålla en röd tråd i planeringen över hundratals steg utan att tappa bort sina egna mål. CivBench mäter inte vem som vinner flest partier, utan två specifika beteenden – hur ofta agenten aktivt kollar på spelets aktuella tillstånd (PMR), och om den faktiskt gör det den just sa att den skulle göra (RAG@10). Det som är lite obekvämt i resultaten är att modellerna *vet* vad de borde göra, de fick explicit instruktion om det, men missar ändå att kolla sitt eget segerläge 7 gånger av 20 gånger när det faktiskt spelade roll som mest – precis innan de förlorade. Det här handlar egentligen inte om att AI är dum, utan om ett gap mellan att formulera en plan och att följa upp den, vilket är exakt den typen av tillförlitlighetsproblem som kommer bli kritiskt när agenter får ansvar för processer i verkliga system där "jag glömde kolla statusen" inte är ett acceptabelt svar.