FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models
यह शोध पत्र FormalRewardBench प्रस्तुत करता है, जो 250 विशेषज्ञ-क्यूरेटेड प्राथमिकता युग्मों (preference pairs) का उपयोग करके औपचारिक प्रमेय सिद्ध करने (formal theorem proving) में रिवॉर्ड मॉडल्स के मूल्यांकन के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि फ्रंटियर LLMs प्रमाण गुणवत्ता मूल्यांकन में विशिष्ट थ्योरम प्रोवर्स से बेहतर प्रदर्शन करते हैं और विभिन्न इंजेक्ट की गई त्रुटियों से सही प्रमाणों को अलग करने में वर्तमान मॉडल्स की सीमाओं को उजागर करता है।