Nytt riktmärke avslöjar säkerhetsluckor i AI-modellers resonemang

arXiv cs.AI

Stora AI-modeller som resonerar steg-för-steg (så kallade reasoning models) kan producera osäkert innehåll i sina mellanliggande tankesteg – även när det slutliga svaret ser oproblematiskt ut. Forskare har skapat ett testramverk kallat TRACE som utvärderar hela kedjan – fråga, resonemang och svar – och när de testade 18 säkerhetsfilter visade det sig att just resonemangssteget är betydligt svårare att granska än de andra delarna. Det är ett påtagligt hål i hur vi idag mäter och bygger säkerhetssystem för AI.