GPT-4.1 och GPT-5 testad som domare för röstassistenter – fungerar, men inte alltid
arXiv cs.AI
Forskare har jämfört hur väl GPT-4.1 och GPT-5 kan bedöma kvaliteten på röstbaserade AI-agenter inom telekom och detaljhandel, jämfört med mänskliga utvärderare. Resultaten visar att AI-domarna fungerar bra i stor skala, men tillförlitligheten varierar beroende på vilken typ av mått man mäter – vissa konversationskvaliteter kräver fortfarande ett mänskligt öga. Slutsatsen pekar mot hybridsystem där AI sköter det repetitiva och människor kopplas in när kontextuell tolkning krävs.