Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing
यह शोध पत्र स्ट्रैगलर-अवेयर ग्रुप कंट्रोल (SAGC) को प्रस्तुत करता है, जो एक गतिशील समूह-आकार नियंत्रक है जो स्ट्रैगलर विलंब (straggler delays) को कम करने के लिए समूह के आकार को अनुकूल रूप से समायोजित करके सिंक्रोनस ऑन-पॉलिसी सुदृढीकरण लर्निंग (on-policy reinforcement learning) को अनुकूलित करता है, जिससे प्रशिक्षण स्थिरता से समझौता किए बिना वॉल-क्लॉक दक्षता और मॉडल प्रदर्शन में सुधार होता है।