On the optimization dynamics of RLVR: Gradient gap and step size thresholds
यह शोध पत्र "ग्रेडिएंट गैप" (Gradient Gap) को पेश करके 'वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग' (RLVR) के लिए एक सैद्धांतिक आधार स्थापित करता है ताकि अभिसरण गतिकी (convergence dynamics) की व्याख्या की जा सके और एक महत्वपूर्ण स्टेप-साइज़ थ्रेशोल्ड (step-size threshold) को व्युत्पन्न किया जा सके जो यह निर्धारित करता है कि सीखना सफल होगा या विफल, जिससे लेंथ नॉर्मलाइजेशन (length normalization) जैसे व्यावहारिक ह्यूरिस्टिक्स और सफलता दरों के ठहराव के लिए एक सिद्धांत-आधारित स्पष्टीकरण प्राप्त होता है।