AI:s medicinska resonemang är mest dekorativt – rätt svar, fel anledning

arXiv cs.AI

En studie av 14 AI-modeller visar att deras synliga tankekedjor (chain-of-thought) sällan faktiskt styr diagnoserna: i 72,9% av fallen ändrades inte svaret ens när forskarna medvetet förstörde resonemanget med kliniskt relevanta fel. Med andra ord – modellerna landar rätt av andra skäl än de skriver, vilket är ett problem om läkare ska lita på förklaringarna. Att ta bort tankekedjorna helt påverkade inte heller träffsäkerheten, vilket antyder att de fungerar mer som dokumentation än som faktisk logik.