Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation
यह शोध पत्र AdaGRPO को पेश करता है, जो एक नवीन रूपरेखा (framework) है जो केवल उन नमूनों पर सुदृढीकरण शिक्षण (reinforcement learning) को चुनि적으로 लागू करके शोर-रोधी जनरेटिव अनुशंसा (noise-robust generative recommendation) को बढ़ाता है जहाँ नीति अनिश्चित है और रिवॉर्ड मॉडल भेदभावपूर्ण है, जिससे यह ऑफलाइन मेट्रिक्स और ऑनलाइन प्रोडक्शन ए/बी परीक्षणों दोनों में समान आरएल (uniform RL) दृष्टिकोणों से बेहतर प्रदर्शन करता है।