AI-agenter låter sig luras av falska bevis – förpackningen trumfar sanningen
arXiv cs.AI
Forskning på 12 stora AI-modeller visar att en agent som visas ett proffsigt marknadspanel tar ställning i en i grunden oförutsägbar fråga i 54% av fallen, jämfört med 6,5% utan panel – och det spelar ingen roll om alla siffror i panelen är helt påhittade. Det intressanta är att modellerna faktiskt vet att frågan är obesvarbar (de säger det i 90% av fallen) men agerar ändå som om de vet svaret, vilket pekar på ett specifikt fel i 'agera/agera inte'-mekanismen snarare än i förståelsen. En 3 miljarder parametrar stor modell kunde tränas bort från beteendet med bara 540 syntetiska exempel – men effekten försvann om svarsformatet inte lämnade utrymme för resonemang.