AI-agent lär sig okända spel genom att bygga egna regler i realtid

arXiv cs.AI

Forskare har byggt ett system kallat Twin som låter en AI-agent klara spel utan att på förhand känna till reglerna – istället konstruerar agenten en egen körbar modell av spelvärlden genom att observera vad som händer. Resultatet är imponerande: 179 av 183 nivåer i ARC-AGI-3 klarades (97,8%), och i 88% av fallen mer effektivt än människor. Det verkligt intressanta är att basmodellen ensam bara klarar 7,8% – det är alltså själva ramverket, inte modellens råa intelligens, som gör hela skillnaden.

Djupdykning

ARC-AGI-3 är ett riktmärke designat för att testa om AI verkligen kan resonera och anpassa sig till helt okända regler – inte bara memorera mönster från träningsdata. Det gör det till ett av de svårare proven för vad forskare kallar "generell intelligens." Det som Twin gör annorlunda är att agenten inte får reglerna serverade: den spelar, observerar vad som händer, bygger sedan ett körbart program som modellerar spelets logik, och får inte agera igen förrän programmet kan återskapa varje tidigare rörelse korrekt. Det är ungefär som att lära sig schack enbart genom att titta på vad som händer när man drar pjäserna, utan att någon berättar vad som är tillåtet. Det som de flesta missar i rapporteringen kring sådana här resultat är skillnaden mellan 7,8% och 93,3% – båda körs på exakt samma grundmodell. Den enda förändringen är det ramverk som omger den. Det betyder att en stor del av AI-kapacitet vi ser idag inte handlar om råa modellförmågor, utan om hur väl vi strukturerar tänkandet runt modellen – och det är ett designproblem, inte ett träningsproblem. Forskarnas egen slutsats är också en ovanlig ärlighet: att bygga världsmodellen visade sig vara det enkla, medan det verkligt svåra var att lista ut vad målet ens är. Det påminner mer om hur barn lär sig sociala normer än hur vi traditionellt tänkt på maskininlärning.