Forskare mäter när 'tänkande' AI faktiskt är värt pengarna
arXiv cs.AI
Att låta en AI-modell 'tänka längre' kostar tokens – och därmed pengar – men ger inte alltid bättre svar. Forskare testade 151 modell-benchmark-kombinationer och fann att uppgiftstypen avgör om det lönar sig: matematikkedjor och kodgenerering ger bra utdelning, medan faktaåtergivning (som MMLU-Pro) ger låg effektivitet trots att frågorna är svåra. En praktisk tumregel: slå på utökat resonemang selektivt, inte som standardläge.