Anthropic förklarar hur vattenstämplar i Claude faktiskt fungerar
Anthropic har gått ut med mer detaljer om hur vattenstämplingen (ett osynligt märkningssystem för AI-genererat innehåll) i Claude kommer att fungera i praktiken. Intressant nog verkar tekniken vara designad för att tåla viss redigering, men det återstår frågor kring hur väl det håller – särskilt för kod.
Djupdykning
Anthropic bygger in vattenstämplar i text som Claude genererar – ett sätt att märka AI-producerat innehåll utan att det syns för ögat, ungefär som ett osynligt fingeravtryck inbäddat i hur ord och meningar väljs. Tekniken kallas steganografi när den används i text, och idén är att mönstret i ordval och struktur bär på ett dolt kodat meddelande som verktyg kan detektera i efterhand. Det stora problemet som de flesta missar i diskussionen är dock att vattenstämplar i text är extremt bräckliga – till skillnad från bilder där pixelmönster kan överleva viss redigering, räcker det med att byta ut några synonymer eller skriva om en mening för att hela signaturen försvinner. Anthropic medger själva att tung redigering förstör märkningen, vilket i praktiken gör systemet mer användbart för att bekräfta autenticitet än för att avslöja fusk. För kod är utmaningen ännu knivigare eftersom funktionaliteten begränsar hur mycket man kan jonglera med ordval och struktur utan att programmet slutar fungera.