Reddit låter AI läsa mellan raderna i forum-regler

Moderering på Reddit har länge vilat på frivilliga moderatorer med varierande ambitionsnivå och oändligt tålamod. Nu försöker Reddit automatisera en del av det jobbet med ett verktyg kallat Rules Hub, som använder LLM:er för att avgöra om ett inlägg bryter mot en regels syfte, inte bara dess bokstavliga formulering.
Det är en icke-trivial distinktion. Regelbaserad automoderering har funnits i evigheter, men den har alltid haft samma grundproblem: regler är skrivna av människor, och människor är dåliga på att förutse alla sätt en regel kan kringgås. En LLM som tolkar intentionen bakom "inga personangrepp" klarar kantfallen bättre än ett regex som letar efter svordomar.
Moderatorer konfigurerar själva vilka regler som ska gälla och vad som ska hända vid en träff. Reddit har alltså valt att behålla moderatorerna i loopen som regelägare, men delegera den faktiska bedömningen till modellen. Det är ett rimligt designval — moderatorer har kontext om sina communities som ingen central modell har.
Verktyget rullas ut i bredare test nu, med full lansering planerad senare i år. Parallellt börjar Reddit begränsa vad icke-inloggade besökare kan se, ett drag som uppenbart handlar om att driva kontoregistreringar snarare än moderering.
Den intressanta frågan här är inte om AI-moderering fungerar, utan var felbedömningarna hamnar. Regelbaserade system är deterministiska och granskningsbara. En LLM är varken det ena eller det andra. När en mod-appeal kommer in och svaret är "modellen tyckte att inlägget bröt mot regelns syfte" är det en helt annan konversation att föra än "boten flaggade orden X och Y".
För alla som bygger community-produkter eller moderationsverktyg är det värt att följa hur Reddit hanterar överklaganden och edge cases när utbyggnaden accelererar.
