Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
यह शोध पत्र "कॉन्टेक्स्टुअल रोलआउट बैंडिट्स" (Contextual Rollout Bandits) का प्रस्ताव करता है, जो एक एकीकृत न्यूरल शेड्यूलिंग फ्रेमवर्क है जो रोलआउट्स को कॉन्टेक्स्टुअल बैंडिट आर्म्स के रूप में मानता है ताकि उच्च-मूल्य वाले ऐतिहासिक डेटा को अनुकूल रूप से चुनने और पुन: उपयोग करने के लिए, बड़े भाषा मॉडलों के लिए सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (Reinforcement Learning with Verifiable Rewards - RLVR) में सैंपल दक्षता और प्रदर्शन में सुधार किया जा सके।