Smarter tabellhantering sparar 41% av tokens i dokumentanalys

arXiv cs.AI

Forskare har hittat ett praktiskt knep för att få AI-modeller att förstå dokument med många tabeller mer effektivt: låt modellen först skanna lågupplösta versioner av tabellerna för att identifiera vilka som är relevanta, och läs sedan bara de utvalda tabellerna i full upplösning. Metoden sparar 41% av tokens (de 'enheter' som mäter hur mycket text en AI-modell bearbetar) och ger samtidigt 7 procentenheter högre träffsäkerhet jämfört med att läsa allt i full upplösning direkt. Intressant nog visar studien att kraftigt nedskalade tabeller, trots att de är svårlästa, fortfarande räcker för att avgöra om tabellen ens är relevant för frågan.