Ny metod ska hindra AI från att svälja nonsens som fakta

arXiv cs.AI

Forskare har utvecklat DARKSIDE, ett granskningssystem som ska förhindra att stora språkmodeller (LLM:er) okritiskt behandlar påhittade källor och felaktiga påståenden som om de vore faktabaserade. Systemet håller koll på en 'uteslutningsstig' genom ett samtal och flaggar referenser som Warranted, Unattested, Misattributed eller Fabricated – och sätter ett riskbetyg på UNSAFE så snart något fabricerat dyker upp. Testet kördes mot 100 välformulerade men nonsensbaserade frågor inom allt från sjukvård till fysik, med Gemini 3 som modell och Claude Sonnet 4.6 som oberoende domare.

Djupdykning

Stora språkmodeller är egentligen sofistikerade mönsterigenkännare – de ser att något *låter* trovärdigt, men håller inte reda på om det faktiskt *är* det. Det är precis det som DARKSIDE försöker lösa: systemet bygger en explicit "uteslutningslogik" längs hela samtalet, ungefär som att föra protokoll över vilka påståenden som saknar stöd, är feltillskrivna eller rent ut sagt påhittade. Varje namngiven referens – en studie, ett begrepp, en auktoritet – klassificeras, och om andelen fabricerade källor överstiger noll flaggas hela analysen som osäker. Det riktigt intressanta med benchmarken BSBench är att den testar med "sofistikerat nonsens" – påhittade saker som låter akademiska och välgrundade, vilket är exakt det scenario där vanliga AI-säkerhetsfilter misslyckas mest kapitalt. Det de flesta missar är att problemet inte primärt handlar om att modellen "ljuger" – det handlar om att den saknar en intern tidslinje för diskursen. Den minns inte att den accepterade en felaktig premiss i mening tre när den bygger sin slutsats i mening femton. DARKSIDE försöker ge modellen just det: ett minne av vad som redan accepterats eller förkastats längs vägen. Om det här skalas upp och fungerar i praktiken utanför labbmiljö rör vi oss mot AI-system som inte bara genererar svar, utan aktivt auditar sin egen resoneringskedja i realtid – vilket vore ett fundamentalt skifte från hur dagens RAG-system (hämtning av extern kunskap för att komplettera modellen) fungerar idag.