Ny metod låter små AI-modeller söka och resonera bättre utan dyr träning
arXiv cs.AI
Forskare har utvecklat OPDSearch+, en teknik som förbättrar hur små språkmodeller (3 miljarder parametrar) kombinerar webbsökning med logiskt resonemang – utan att behöva träna en specialiserad lärarmodell, vilket brukar vara kostsamt. Tricket är en tvåstegsprocess: först lär sig studentmodellen av en färdig instruktionsmodell medan den söker live, sedan förfinas den med förstärkningsinlärning (RL) från en stabilare startpunkt. Resultaten på sju fråge-och-svar-benchmarks är tydliga: 13,1% förbättring på HotpotQA och 8,5% på 2WikiMultihopQA jämfört med tidigare RL-baserade 3B-modeller.