Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
यह शोध पत्र एक नवीन डायनेमिक क्लिपिंग तंत्र का प्रस्ताव देकर 'वेरिफिएबल रिवार्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) में एंट्रॉपी कोलैप्स को संबोधित करता है, जो पॉलिसी एंट्रॉपी को सटीक रूप से नियंत्रित करने के लिए एक ग्रेडिएंट-प्रिजर्विंग परिप्रेक्ष्य का लाभ उठाता है, जिससे समयपूर्व अति-आत्मविश्वास को रोका जा सके और एलएलएम (LLM) तर्क प्रदर्शन को बढ़ाया जा सके।