Nytt test visar att AI-agenter kämpar med komplex reseplanering
arXiv cs.AI
Forskare har skapat LifePlanner, ett testramverk där AI-agenter får planera resor med hjälp av kartdata och riktiga inlägg från sociala medier – en betydligt stökigare miljö än vanliga benchmarks. Resultaten är talande: de bästa AI-modellerna klarar enkla sökuppgifter bra, men vid komplexa planeringsproblem sjunker godkännandefrekvensen till 40,2%. Det intressanta är att det inte handlar om modellstorlek – bristerna beror på att modellerna missar viktig information i stora datamängder och har svårt att hålla koll på flera krav samtidigt.