Nytt ramverk hittar fel i AI-genererade matematiska bevis med 84,5% träffsäkerhet
arXiv cs.AI
Språkmodeller kan producera långa matematiska bevis, men det är svårt att veta när de faktiskt har fel – och var felet uppstår. FaithSieve löser detta genom att bryta ner bevis i små logiska enheter och verifiera dem med ett formellt bevisverktyg (Lean), vilket ger 84,5% träffsäkerhet på att hitta det första felet jämfört med 75% för en vanlig AI-domare. Praktiskt innebär det att AI-genererad matematik kan granskas mycket mer tillförlitligt, vilket är viktigt nu när modeller används inom forskning och utbildning.