Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning
यह शोध पत्र यह प्रदर्शित करता है कि रिट्रीवल (retrieval), मल्टी-एविडेंस सिंथेसिस (multi-evidence synthesis) और रीजनिंग कार्यों को कवर करने वाली एक सावधानीपूर्वक क्यूरेट की गई, डेटा-केंद्रित रेसिपी, जो एक न्यूनतम आउटकम-आधारित GRPO सेटअप के साथ संयुक्त है, जटिल रिवॉर्ड इंजीनियरिंग पर निर्भर हुए बिना, लार्ज लैंग्वेज मॉडल्स में लॉन्ग-कॉन्टेक्स्ट रीजनिंग और एजेंटिक क्षमताओं को महत्वपूर्ण रूप से बढ़ाती है।