How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization
यह शोध पत्र DynaMO प्रस्तुत करता है, जो एक सैद्धांतिक रूप से आधारित ढांचा है जो LLMs के लिए सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) को अनुकूलित करता है, जिसमें संसाधन अक्षमता और प्रशिक्षण अस्थिरता को संबोधित करने के लिए विचरण-न्यूनतम अनुक्रम-स्तरीय रोलआउट आवंटन (variance-minimizing sequence-level rollout allocation) को व्युत्पन्न किया गया है और ग्रेडिएंट-जागरूक टोकन-स्तरीय लाभ मॉड्यूलेशन (gradient-aware token-level advantage modulation) को कार्यान्वित किया गया है।