Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards
यह शोध पत्र ACOER का प्रस्ताव करता है, जो एक नवीन रिवॉर्ड मैकेनिज्म है जो सही उत्तरों के लिए लेंथ पेनल्टी को अलग करके और डायनेमिक बजट नॉर्मलाइजेशन का उपयोग करके बड़े रीजनिंग मॉडल्स में एफिशिएंसी ट्रेनिंग को स्थिर करता है, जिससे रिवॉर्ड कोलैप्स को रोका जा सकता है और साथ ही सटीकता में उल्लेखनीय सुधार और टोकन जनरेशन में कमी आती है।