AI-system utvärderar varandras forskning – med blandade resultat

arXiv cs.AI

Forskare har testat om AI kan bedöma AI-genererade vetenskapliga artiklar, genom att låta tre stora språkmodeller (GPT, Gemini och Claude) recensera 75 artiklar från fyra olika AI-forskarsystem. FARS kommersiella system fick genomgående högst betyg (2,14–2,47 av 5), mer än dubbelt så högt som närmaste konkurrent – men GPT-5.4 stack ut som oenig bedömare med svag korrelation till de andra två, vilket antyder att modellerna mäter kvalitet på olika sätt. Det intressanta här är inte vinnaren utan själva upplägget: att använda AI som peer review (granskning av forskning) kan bli ett skalbart sätt att jämföra autonoma forskningssystem.

Djupdykning

Forskarvärlden har länge brottats med hur man egentligen bedömer AI-genererad forskning – och nu försöker man lösa problemet genom att låta AI granska AI. Studien testade fyra olika "AI Scientist"-ramverk, alltså system som självständigt kan generera hela forskningspapper från idé till slutsats, och lät sedan tre stora språkmodeller (GPT, Gemini och Claude) agera peer reviewers på en skala ett till fem inom originalitet, vetenskaplig rigorositet, tydlighet och signifikans. Resultaten var ganska tydliga: FARS kommersiella system slog övriga med bred marginal, med snittpoäng runt 2,1–2,5 jämfört med konkurrenternas 1,0–1,9. Det de flesta missar här är inte vinnaren – utan metodfrågan under ytan. Gemini och Claude var remarkabelt eniga med varandra (korrelation 0,907), men GPT-5.4 bedömde pappren enligt helt andra kriterier. Det antyder att "AI peer review" inte är en neutral spegel av kvalitet, utan att olika modeller har inbyggda preferenser för vad som räknas som bra forskning – precis som mänskliga reviewers fast mindre transparenta. Om man bygger ett utvärderingssystem på en enda modell riskerar man alltså att premiera forskning som råkar matcha just den modellens träningsdata och värderingar, snarare än faktisk vetenskaplig kvalitet. Poängen att hela systemet hamnar i intervallet 1–2,5 på en femgradig skala är också värd att hålla i huvudet – vi pratar om AI som genererar forskning som autonoma system fortfarande bedömer som ganska medioker, men som ändå publiceras och jämförs som om det vore ett framsteg.