Två API-inställningar tredubblande GPT-5.6:s poäng på ARC-AGI-3

OpenAI Blog

OpenAI visar hur två API-inställningar – att spara resonemangstrådar mellan anrop och komprimera långa kontexter – tredubblande GPT-5.6:s resultat på ARC-AGI-3, ett test som mäter hur bra AI klarar nya problemtyper den inte tränat på. Det intressanta här är inte bara poängen i sig, utan att prestandalyftet kom utan att ändra modellen – enbart genom hur man konfigurerar anropen. En påminnelse om att mycket av AI-prestanda handlar om hur du ställer frågorna, inte bara vilken modell du använder.

Djupdykning

ARC-AGI-3 är ett av de svåraste AI-testerna som finns just nu – det mäter om modeller kan lösa helt nya problem de aldrig sett förut, vilket är kärnan i det som kallas "general intelligence." Det som artikeln beskriver är egentligen ganska elegant: genom att aktivera två API-inställningar – en som låter modellen behålla sitt resonemang mellan anropen, och en som komprimerar långa konversationer istället för att kasta dem – tredubblades poängen på testet utan att träna om modellen ens en sekka. Det de flesta missar här är att detta inte handlar om att GPT-5.6 plötsligt blivit smartare – det handlar om att den tidigare kastade bort sin egen tankeprocess varje gång den fick en ny fråga, som att lösa ett korsord och sedan riva ut sidan innan nästa ledtråd. När modellen får minnas hur den tänkte tidigare kan den bygga vidare på sina slutsatser istället för att börja från noll varje gång. Det säger egentligen något obekvämt om hur vi utvärderar AI: vi kör benchmarks på modeller med standardinställningar och drar slutsatser om vad AI "kan" – men de verkliga kapabiliteterna kan vara radikalt annorlunda beroende på hur man faktiskt konfigurerar systemet.