Evidence-State Rewards for Long-Context Reasoning
यह शोध पत्र मेवेन (Maven) को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो साक्ष्य अवस्था परिवर्तनों—जैसे कि जानकारी जोड़ने, जोड़ने या हटाने—को क्रिया-स्तर के पुरस्कारों को सौंपकर दीर्घ-संदर्भ तर्क (long-context reasoning) को बढ़ाता है, जिससे कई बेंचमार्क पर पारंपरिक केवल-परिणाम (outcome-only) विधियों से बेहतर प्रदर्शन करता है।