AI-modeller är övertygade när de agerar – men har ofta fel

arXiv cs.AI

Forskare testade hur väl stora språkmodellers (LLM) självrapporterade säkerhet stämmer med verkligheten i ett brädspel med dold information – och fann att när modellerna var som mest säkra (≥50% säkerhet) hade de rätt i bara 1 av 62 fall. Det är ett problem eftersom många agentsystem låter modellens egna konfidenspoäng styra när den ska agera. Ännu mer oroande: en modell kan vinna spelet trots helt misskalibrade uppfattningar, vilket betyder att vanliga utvärderingsmått inte fångar felet.