Process-Verified Reinforcement Learning for Theorem Proving via Lean
यह शोध पत्र एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो लीन (Lean) प्रूफ असिस्टेंट को एक प्रतीकात्मक प्रक्रिया ओरेकल (symbolic process oracle) के रूप में उपयोग करता है ताकि सघन, सूक्ष्म और सटीक टैक्टिक-स्तरीय फीडबैक प्रदान किया जा सके, जो पारंपरिक परिणाम-मात्र रिवॉर्ड विधियों की तुलना में MiniF2F और ProofNet जैसे बेंचमार्क पर प्रमेय सिद्ध करने के प्रदर्शन में महत्वपूर्ण सुधार करता है।