Ny metod gör stora språkmodeller upp till 1,92 gånger snabbare vid textgenerering

arXiv cs.AI

Forskare har identifierat ett problem de kallar 'Residual Drift' i så kallad spekulativ avkodning (en teknik där en mindre hjälpmodell gissar nästa ord medan den stora modellen verifierar i ett svep) – när tidiga gissningar förkastas blir efterföljande kandidater ineffektiva och systemet tvingas till kostsamma omberäkningar. Deras lösning, ResiSpec, justerar hur förslag verifieras matematiskt utan att påverka kvaliteten på resultatet, och uppnår upp till 1,92 gånger högre hastighet jämfört med befintliga metoder. Det är ingen dramatisk omvälvning, men för företag som betalar stora summor för LLM-inferens (att köra modellen i produktion) är den här typen av effektivitetsvinster direkt lönsamma.