Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
यह शोध पत्र RLHF और RLVR में रिवॉर्ड हैकिंग को कम करने के लिए KL पेनल्टी के एक बेहतर विकल्प के रूप में ग्रेडिएंट रेगुलराइजेशन (GR) का प्रस्ताव करता है, जो रिवॉर्ड सटीकता को इष्टतम सपाटता (optimum flatness) से सैद्धांतिक रूप से जोड़कर और अनुभवजन्य रूप से यह प्रदर्शित करके कि GR प्रभावी रूप से पॉलिसी अपडेट को अधिक सपाट, अधिक सटीक रिवॉर्ड क्षेत्रों की ओर पक्षपाती बनाता है।