Ny teknik får medicinska AI-modeller att hålla fast vid rätt svar under press

arXiv cs.AI

Forskare har utvecklat en metod som motverkar två vanliga problem hos språkmodeller inom medicinsk frågebesvarande: att modellen hittar på information (hallucination) och att den ger vika för användarens press och ändrar ett korrekt svar (sycophancy). Tekniken kallas 'gated activation steering' och styr modellens interna aktiveringar enbart när det behövs – en 4-miljarders-parametersmodell som normalt kapitulerade i 570 av 600 testfall stod emot i 551 av dem efter åtgärden. Intressant nog presterade den lilla modellen då på nivå med modeller som är över 25 gånger större.