Verifiable Process Rewards for Agentic Reasoning
यह शोध पत्र वेरिफिएबल प्रोसेस रिवार्ड्स (VPR) को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो सुदृढीकरण सीखने (रिनफोर्समेंट लर्निंग) के लिए सघन, टर्न-लेवल पर्यवेक्षण उत्पन्न करने हेतु ऑब्जेक्टिव ओरेकल्स का लाभ उठाता है, जिससे दीर्घ-क्षित एजेंटिक तर्क में क्रेडिट असाइनमेंट में सुधार होता है और स्पार्स आउटकम-लेवल फीडबैक की तुलना में विविध रीजनिंग बेंचमार्क पर बेहतर प्रदर्शन और सामान्यीकरण प्रदर्शित होता है।