Nya studien avslöjar att AI-modeller bedömer forskningsartiklar helt annorlunda än människor

arXiv cs.AI

Forskare har testat hur fem stora språkmodeller bedömer vetenskapliga artiklar genom att analysera 11 000 AI-genererade recensioner av 1 000 forskningspapper. AI-modellerna visade sig vara betydligt mer positiva och mindre kritiska än mänskliga granskare, samtidigt som de ofta missar viktiga svagheter som människor identifierar - vilket ifrågasätter hur användbara de verkligen är för vetenskaplig peer review.