GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
यह शोध पत्र GROW को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो संदर्भ लंबाई की सीमाओं को दूर करने के लिए पूर्ण प्रक्षेप पथों (trajectories) को अवस्था-क्रिया नमूनों (state-action samples) में विघटित करके ओपन-वर्ल्ड विजन-लैंग्वेज मॉडल एजेंटों के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) को अनुकूलित करता है, जिससे 800 से अधिक माइनक्राफ्ट कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।