What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA
यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि प्रशिक्षण पाठ्यक्रमों की संरचना मेमोरी-ऑगमेंटेड आरएल (RL) एजेंटों को एक समान प्रदर्शन स्केलर के बजाय विशिष्ट बनाने के लिए एक सूक्ष्म-स्तरीय लीवर के रूप में कार्य करती है, जो यह प्रकट करता है कि मिश्रित-बेंचमार्क प्रशिक्षण सर्वोत्तम समग्र परिणाम देता है जबकि संकीर्ण आउट-ऑफ-डोमेन प्रशिक्षण विशिष्ट रूप से टेम्पोरल रीजनिंग को बढ़ाता है, और सिंगल-जीपीयू (single-GPU) शासन के लिए जीआरपीओ (GRPO) को अनुकूलित करने के लिए महत्वपूर्ण व्यावहारिक अंतर्दृष्टि पर प्रकाश डालता है।