Qwen 3.8 27B är imponerande – men tänker alldeles för mycket

Simon Willison

Simon Willison har testat Qwen 3.8 27B, en ny öppen AI-modell, och konstaterar att den levererar starka resultat men har ett märkligt standardbeteende: den 'övertänker' uppgifter och lägger ner oproportionerligt mycket resonemang även på enkla frågor. Det är ett känt problem med så kallade reasoning-modeller (modeller tränade att tänka steg för steg innan de svarar) – mer tanketid hjälper inte alltid, och kan faktiskt bli ett problem för snabbhet och kostnad.

Djupdykning

Qwen 3.8B och 27B är Alibabas senaste open source-modeller, och de presterar imponerande på benchmarks – men det finns ett irriterande beteende inbyggt som många missar: modellerna aktiverar som standard sitt "tänkande läge", vilket innebär att de spenderar enorma mängder tokens på att resonera igenom problem innan de svarar, även när du bara frågar om vädret. Tokens är i det här sammanhanget ungefär som ord eller ord-delar som modellen processar – fler tokens betyder mer beräkningstid och högre kostnad. Det som händer i praktiken är att en enkel fråga kan generera hundratals rader intern monolog innan svaret kommer, vilket är ungefär som att anlita en konsult för att fixa ett trasigt gem och få tillbaka en 40-sidig rapport. Det de flesta missar i hypen kring Qwen 3 är att råa benchmarkresultat mäter förmåga, inte användbarhet. En modell som kroniskt övertänker enkla uppgifter är som en formel 1-bil i pendlingstrafik – tekniskt överlägsen, men fel verktyg för situationen. Alibaba har byggt in en växel för att stänga av tänkandet, men det är ett aktivt val användaren måste göra – och de flesta som bara plockar upp modellen och kör märker inte varför den är långsam och dyr förrän räkningen trillar in.