GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
यह शोध पत्र GROW को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो संदर्भ लंबाई की सीमाओं को दूर करने के लिए पूर्ण प्रक्षेप पथों (trajectories) को अवस्था-क्रिया नमूनों (state-action samples) में विघटित करके ओपन-वर्ल्ड विजन-लैंग्वेज मॉडल एजेंटों के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) को अनुकूलित करता है, जिससे 800 से अधिक माइनक्राफ्ट कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को Minecraft जैसा जटिल वीडियो गेम खेलना सिखा रहे हैं। रोबोट के पास एक कैमरा (उसकी आँखें) है और वह कीबोर्ड पर टाइप कर सकता है और माउस चला सकता है (उसके हाथ)। उसका लक्ष्य "घर बनाना," "सोना खदान से निकालना," या "किसी राक्षस को हराना" जैसे कार्य पूरे करना है।
लंबे समय तक, रोबोट को सिखाने का सबसे अच्छा तरीका सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) था। इसे ऐसे समझें जैसे आप रोबोट को एक मानव विशेषज्ञ के गेम खेलने का वीडियो दिखा रहे हैं और कह रहे हैं, "ठीक वैसा ही करो जैसा उन्होंने किया।" समस्या यह है कि घंटों तक मानव के बेहतरीन गेमप्ले के वीडियो ढूंढना महंगा है, और यदि रोबोट केवल उस वीडियो को रट लेता है, तो गेम में थोड़ा सा बदलाव होने पर वह भ्रमित हो जाता है।
फिर, शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग (RL) का उपयोग किया, विशेष रूप से GRPO नामक एक एल्गोरिदम। यह ऐसा है जैसे आप रोबोट को गेम खेलने देते हैं, उसे असफल होते देखते हैं, सफल होते देखते हैं, और परिणामों से सीखता है। हालाँकि, मानक GRPO में ओपन-वर्ल्ड गेम्स के लिए एक बड़ी खामी थी: इसने पूरे गेम सेशन को एक ही एकल पाठ (lesson) के रूप में माना।
समस्या: "बहुत लंबा" पाठ
कल्पना कीजिए कि आप केक बनाना सीख रहे हैं।
- मानक GRPO आपको एक 500 पन्नों की किताब देने जैसा है जिसमें आपके बचपन की कहानी, तीन दिन पहले का मौसम का विवरण, रेसिपी, और आपके पड़ोसी के कुत्ते की कहानी भी शामिल है, जो सब कुछ आपस में मिला हुआ है। यह कहता है, "आपने अंत में एक अच्छा केक बनाया, इसलिए इस पूरे 500 पन्नों के अध्याय में जो कुछ भी था, वह अच्छा था।"
- पेपर में, इसे "फुल ट्राजेक्टरी" (full trajectory) कहा गया है। जैसे-जैसे रोबोट Minecraft खेलता है, उसके देखे गए और किए गए कार्यों का इतिहास लंबा और लंबा होता जाता है। अंततः, "किताब" बहुत विशाल हो जाती है और उसमें अप्रासंगिक शोर (जैसे किसी ब्लॉक को खोजने से पहले 10 मिनट तक इधर-उधर घूमना) भर जाता है, जिससे रोबोट अभिभूत हो जाता है और यह समझ नहीं पाता कि वास्तव में किस विशिष्ट चाल ने सफलता दिलाई।
समाधान: GROW (द "रेसिपी कार्ड" अप्रोच)
लेखकों ने GROW (अलाइनिंग GRPO विद स्टेट-एक्शन मॉडलिंग) नामक एक नया फ्रेमवर्क प्रस्तावित किया है।
रोबोट को पूरी 500 पन्नों की किताब देने के बजाय, GROW गेम सेशन को छोटे, समझने योग्य रेसिपी कार्डों में काट देता है।
- स्टेट-एक्शन डिकंपोजिशन (State-Action Decomposition): GROW लंबे गेम सेशन को व्यक्तिगत क्षणों में तोड़ देता है: "ब्लॉक को देखना" + "माउस क्लिक करना" + "पिकैक्स का प्रहार।"
- स्मार्ट फीडबैक: यदि रोबोट अंत में सफल होता है, तो GROW यह नहीं कहता कि "पूरा गेम बहुत अच्छा था।" इसके बजाय, यह उन विशिष्ट कार्डों को देखता है जो जीत की ओर ले गए। यह कहता है, "आपने सोना खोजने से 5 सेकंड पहले जो चाल चली वह बहुत अच्छी थी। 20 मिनट पहले जब आप बस इधर-उधर घूम रहे थे, वह चाल? वह बस ठीक-ठाक थी।"
यह कैसे काम करता है (उपमा)
एक कोच की कल्पना करें जो एक सॉकर खिलाड़ी को प्रशिक्षित कर रहा है।
- पुराना तरीका (मानक GRPO): कोच पूरा 90 मिनट का मैच देखता है, खिलाड़ी को गोल करते हुए देखता है, और फिर चिल्लाता है, "बहुत बढ़िया! आपने पहले मिनट से लेकर आखिरी मिनट तक सब कुछ सही किया!" खिलाड़ी भ्रमित है क्योंकि उसने 10वें मिनट में एक बहुत खराब पास दिया था जिससे लगभग खेल हार जाता।
- GROW का तरीका: कोच गेम को छोटे हिस्सों में तोड़ देता है। "10वें मिनट में दिया गया वह पास ढीला था। लेकिन 80वें मिनट में आपने जो दौड़ लगाई? एकदम सटीक। और 89वें मिनट में किक? शानदार।" खिलाड़ी ठीक से समझ पाता है कि किन विशिष्ट कार्यों को दोहराना है।
"मैजिक" गणित
पेपर में हमें आश्वस्त करने के लिए एक गणितीय प्रमाण (सरोगेट एनालिसिस) शामिल है कि यह "पाठ को काटने" वाला दृष्टिकोण अभी भी वैध है।
- चिंता: इस प्रकार के सीखने के लिए मानक गणित आमतौर पर ठीक उसी शुरुआती बिंदु पर अलग-अलग प्रयासों की तुलना करने की आवश्यकता रखता है। GROW समय के विभिन्न क्षणों की तुलना करता है, जो सभी अलग-अलग हैं।
- परिणाम: लेखकों ने सिद्ध किया कि भले ही शुरुआती बिंदु अलग-अलग हों, रोबोट को मिलने वाला "स्कोर" अभी भी सटीक रूप से दर्शाता है कि उसकी रणनीति कितनी अच्छी है। यह एक छात्र को गणित के टेस्ट पर ग्रेड देने जैसा है: भले ही प्रश्न अलग-अलग हों, अंतिम स्कोर फिर भी बताता है कि वे गणित में बेहतर हो रहे हैं या नहीं।
परिणाम: गेम को जीतना
टीम ने 800 से अधिक विभिन्न Minecraft कार्यों पर GROW का परीक्षण किया, जिसमें गुफाओं में नेविगेट करने से लेकर आइटम बनाने और राक्षसों से लड़ने तक के कार्य शामिल थे।
- सफलता दर: GROW ने पिछले तरीकों की तुलना में काफी बेहतर प्रदर्शन किया। उदाहरण के लिए, "GUI कार्यों" में (आइटम बनाने के लिए गेम के मेनू का उपयोग करना), सफलता लगभग 39% से बढ़कर 68% हो गई।
- दक्षता (Efficiency): रोबोट केवल अधिक बार जीता ही नहीं; वह तेजी से जीता। कार्य पूरा करने के लिए उसे कम कदम उठाने पड़े क्योंकि उसने "शोर" को अनदेखा करना और उन चालों पर ध्यान केंद्रित करना सीख लिया जो वास्तव में मायने रखती थीं।
- सामान्यीकरण (Generalization): रोबोट ने केवल उन विशिष्ट खेलों को याद नहीं किया जिनका उसने अभ्यास किया था। उसने सामान्य कौशल सीखे (जैसे लक्ष्य को कैसे खोजें या मेनू का उपयोग कैसे करें) जिसने उसे उन नए, अनदेखे कार्यों में सफल होने में सक्षम बनाया जिन्हें उसने पहले कभी नहीं देखा था।
सारांश में
GROW एआई एजेंटों को ओपन-वर्ल्ड गेम खेलने के लिए सिखाने का एक स्मार्ट तरीका है। उन्हें उनके पूरे गेम सेशन के लंबे, अव्यवस्थित इतिहास से अभिभूत करने के बजाय, यह गेम को छोटे, स्पष्ट चरणों में तोड़ देता है। यह एआई को यह समझने में मदद करता है कि कौन से विशिष्ट कार्य सफलता की ओर ले जाते हैं, जिससे वह तेजी से सीख सकता है, बेहतर खेल सकता है, और भ्रमित हुए बिना नई चुनौतियों का सामना कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।