AI-läkare klarar kunskapstester men misslyckas med att säga 'jag vet inte'
arXiv cs.AI
Forskare stressade fyra medicinska AI-modeller (Claude, GPT-5.5, Grok och Gemini) genom att medvetet ta bort viktig information från patientfrågor – och mätte hur väl modellerna erkänner att de saknar underlag istället för att gissa. Problemet är att bedömningen av säkerheten beror kraftigt på vem som utvärderar: AI-domare från samma företag som modellen gav 10 procentenheter mer välvilliga betyg, och alla fyra AI-domare var generösare än riktiga läkare (66–84% godkänt mot klinikernas 52%). Kärnan i fyndet är alltså dubbel – modellerna är dåliga på att hantera osäkerhet, och standardmetoderna för att mäta det problemet underskattar hur allvarligt det är.