Klassisk manipulationsteknik fungerar på vissa AI-modeller – men slår tillbaka på andra

arXiv cs.AI

Forskare testade om 'door-in-the-face'-tekniken – att först ställa en stor fråga som nekas, för att sedan få ett ja på en mindre – fungerar på nio stora språkmodeller. Resultaten spretar: Anthropics Opus 5 svarade på den mindre frågan 65,8% av gångerna efter ett avslag, mot bara 29,3% vid direkt fråga, medan OpenAI- och Google-modeller faktiskt blev mer restriktiva. Det mest intressanta fyndet är kanske att 263 av 265 nekade frågor gick igenom bara genom att formulera om dem från 'hur gör man X' till 'förklara X' – vilket säger en del om hur ytliga vissa säkerhetsgränser är.