AI-agenter håller sken av att tänka om — men gör det inte

Det finns en trevlig idé om att sätta flera AI-agenter i ett rum och låta dem "diskutera" sig fram till bättre svar. Fler perspektiv, mer robusthet, kollektiv intelligens. Problemet är att en ny studie nu mätt vad som faktiskt händer när agenterna verkar vara oense — och svaret är ungefär det man inte vill höra.
Forskarna testade femgrupper av GPT-4o-mini och Gemini 2.5 Flash och kollade om ökad "meningsSkillnad" i textuttrycken faktiskt ledde till att agenterna reviderade sina ståndpunkter, eller om de bara bytte formuleringar. De kallar kopplingen mellan dessa två saker för dispersion-revision coupling, och det är ett elegant sätt att fånga ett reellt problem.
Resultaten skiljer sig drastiskt mellan modellerna. GPT-4o-mini förbättrade sin förmåga att korrigera felaktiga premisser med 17,7 procentenheter när dissens uppmuntrades aktivt. Det är inte spektakulärt, men det är något. Gemini rörde sig knappt: 26,1% mot 27,1%, och 94% av svaren efter interventionen var rena omformuleringar snarare än genuina omvärderingar.
Detta är inte ett filosofiskt problem. Det är ett designproblem med direkta konsekvenser för alla som bygger multi-agent-pipelines.
Om du använder flera agenter för att validera varandras output, verifiera fakta eller simulera ett "red team" — och modellen under huven är Gemini — indikerar den här studien att du i princip kör samma resonemang flera gånger med lite annorlunda ord. Du betalar för mångfald du inte får. Textlig variation i embedding-rymden är inte detsamma som epistemisk variation i slutsatsrymden, och det är lätt att förväxla dem när man tittar på loggar.
Studien använder en black-box-metod, vilket är bra, det kräver ingen access till modellens internals. Men det innebär också att vi inte vet varför skillnaden är så stor mellan GPT-4o-mini och Gemini. Är det träningsdata? RLHF-konfiguration? Något i hur modellerna hanterar kontext under flerrundssamtal?
Tills det är klarlagt är den praktiska lärdomen ganska enkel: textlig oenighet bland agenter är inte ett tillförlitligt mått på att systemet faktiskt tänker i flera riktningar. Mät om slutsatserna faktiskt ändras, inte om språket varierar.



