Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning
यह सर्वेक्षण एल्गोरिदम डिज़ाइन को MDP निर्माण, अन्वेषण और शिक्षण चरणों में वर्गीकृत करके LLMs में सुदृढीकरण अधिगम (Reinforcement Learning) के लिए एक मॉड्यूलर ढांचा प्रस्तुत करता है, जो क्रिटिक-मुक्त पॉलिसी ग्रेडिएंट्स और मोंटे कार्लो विधियों की ओर एक महत्वपूर्ण अनुसंधान पूर्वाग्रह को प्रकट करता है, जबकि वैल्यू-आधारित, ऑफ-पॉलिसी और बूटस्ट्रैपिंग तकनीकों में अनछुए अवसरों को उजागर करता है।