LLM-ramverk förbättrar kvalitetskontroll av provfrågor i stor skala
arXiv cs.AI
Forskare har byggt ett system som använder stora språkmodeller (LLM) för att automatiskt upptäcka när provfrågor i standardiserade tester råkar likna varandra för mycket – ett problem som kan snedvrida testresultat. Systemet, kallat AISA, mäter likhet längs två dimensioner (struktur och semantik) och presterar bättre än klassiska metoder som cosine similarity. Simuleringar visar att LLM-baserade likhetsbegränsningar i adaptiva datortester ger stabilare poänguppskattningar med minimala nackdelar.