GPT-5 klarar 82% träffsäkerhet vid automatisk granskning av forskningslitteratur

arXiv cs.AI

Forskare har testat om LLMs kan ersätta manuell litteraturgranskning genom att låta GPT-4.1 och GPT-5 analysera 536 vetenskapliga artiklar om sjukdomsspridning – GPT-5 nådde 81,67% träffsäkerhet på artikelnivå mot GPT-4.1:s 77,95%. En intressant bieffekt: när de två modellerna är oeniga med varandra är det ett varningstecken för hallucinationer (påhittad information), medan hög enighet men låg träffsäkerhet snarare pekar på fel i det mänskliga referensmaterialet.