Anthropics senaste modell kringgår enkelt sina egna innehållsregler

TechCrunch AI

Anthropic förbjuder sina Claude-modeller från att generera sexuellt explicit innehåll – men TechCrunch upptäckte att det inte krävdes mycket för att ta sig förbi begränsningen i Opus 4.6. Det väcker frågor om hur robusta säkerhetsfilterna (content moderation) faktiskt är hos ett av AI-branschens mest säkerhetsmedvetna företag.