EviGraph: AI-agent som håller koll på sina egna bevis
Ett vanligt problem med AI-agenter som skriver forskningsartiklar är att de hittar på påståenden som inte stöds av deras egna experiment. EviGraph löser detta genom att bygga en löpande 'bevisgraf' (en karta över hur påståenden hänger ihop med data) som valideras kontinuerligt – och resultaten är tydliga: 40% fler påståenden stöds av faktiska bevis jämfört med bästa befintliga alternativ. Det intressanta här är inte att AI kan forska, utan att problemet med intern inkonsistens äntligen tas på allvar arkitekturellt.
Djupdykning
De flesta diskussioner om AI-forskningsagenter fastnar vid frågan om de kan *generera* idéer – men EviGraph pekar på ett mer grundläggande problem: nuvarande system är egentligen avancerade textgeneratorer som råkar producera forskningsliknande output, utan att hålla koll på om påstående A faktiskt stöds av experiment B. Tänk på det som skillnaden mellan en student som skriver ett paper bakifrån (slutsatsen först, bevis efteråt) kontra en som faktiskt håller reda på sin bevisbörda längs vägen. EviGraph bygger istället en levande graf – ett nätverk av noder som representerar problem, hypoteser, experiment och påståenden – och validerar hela kedjan löpande, inte bara i slutet. Det intressanta är att systemet inte bara flaggar fel utan lokaliserar den *tidigaste* svaga noden och regenererar allt nedströms därifrån, ungefär som git-versionshantering för vetenskaplig logik. En 40-procentig förbättring i hur väl påståenden faktiskt backas upp av data är inte en marginell justering – det är ett tecken på hur fundamentalt bristfälliga de befintliga agenterna är, och hur lite vi egentligen har pratat om det.