Understanding Diversity Collapse in RLVR via the Lens of Overtraining
यह शोध पत्र 'वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (RLVR) में "डाइवर्सिटी कोलैप्स" को ओवरट्रेनिंग के एक रूप के रूप में पहचानता है जो मॉडल की रीजनिंग बाउंड्री को संकुचित कर देता है, और "बेयसियन बाउंड्री गेटिंग" का प्रस्ताव करता है ताकि अनुकूलन (ऑप्टिमाइजेशन) को अनसुलझे प्रश्नों की ओर पुनर्निर्देशित किया जा सके, जिससे विविध रीजनिंग बेंचमार्क पर हाई- Pass@ प्रदर्शन में सुधार होता है।