Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
यह शोध पत्र सिंगल-रोलआउट एसिंक्रोनस ऑप्टिमाइजेशन (SAO) को प्रस्तुत करता है, जो एक स्थिर और कुशल एसिंक्रोनस सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो ग्रुप-वाइज सैंपलिंग को सिंगल-रोलआउट रणनीतियों से बदल देता है और जटिल कोडिंग एवं रीजनिंग बेंचमार्क पर GLM-5.2 जैसे बड़े पैमाने के एजेंटिक मॉडलों को सफलतापूर्वक प्रशिक्षित करने के लिए सख्त टोकन-लेवल क्लिपिंग का उपयोग करता है।