Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments
यह शोध पत्र PROVE को प्रस्तुत करता है, जो एक स्टेटफुल सर्वर लाइब्रेरी, एक डिपेंडेंसी-गाइडेड डेटा सिंथेसिस पाइपलाइन और एक नवीन प्रोग्रामेटिक रिवॉर्ड सिस्टम को संयोजित करके लाइव वातावरण में मल्टी-स्टेप टूल उपयोग के लिए प्रभावी सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) को सक्षम बनाता है, जिसके परिणामस्वरूप कई बेंचमार्क और मॉडल परिवारों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।