Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
यह शोधपत्र CrossHA को प्रस्तुत करता है, जो एक एकीकृत एजेंटिक मॉडल है जिसे सुपरवाइज्ड फाइन-ट्यूनिंग और मल्टी-टर्न ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन के संयोजन वाले एक नवीन पाइपलाइन के माध्यम से प्रशिक्षित किया गया है ताकि यह विषम एक्शन स्पेस के बीच स्वायत्त रूप से चयन और स्विच कर सके, जिससे माइनक्राफ्ट वातावरण के भीतर गतिशील, लॉन्ग-होरइजन कार्यों में अत्याधुनिक प्रदर्शन और अनुकूलनशीलता प्राप्त की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को Minecraft नामक वीडियो गेम खेलना सिखा रहे हैं। अतीत में, शोधकर्ताओं को गेम के अलग-अलग हिस्सों के लिए अलग-अलग "मस्तिष्क" बनाने पड़ते थे। एक मस्तिष्क चलने-फिरने में अच्छा था (सरल, चरण-दर-चरण कमांड का उपयोग करके), दूसरा मेनू पर क्लिक करने में अच्छा था (सटीक माउस मूवमेंट का उपयोग करके), और तीसरा उच्च-स्तरीय शॉर्टकट (जैसे "निकटतम पेड़ तक जाओ") का उपयोग करने में अच्छा था।
समस्या यह थी कि ये रोबोट कठोर थे। यदि किसी कार्य के लिए चलने और फिर मेनू पर क्लिक करने की आवश्यकता होती, तो रोबोट भ्रमित या अटक जाता क्योंकि उसे एक समय में केवल एक ही प्रकार की "भाषा" का उपयोग करने के लिए प्रशिक्षित किया गया था।
बड़ा विचार: "स्विस आर्मी नाइफ" एजेंट
यह पेपर CrossHA को पेश करता है, जो एक नए प्रकार का AI एजेंट है जो एक पूर्ण रसोई वाले मास्टर शेफ की तरह काम करता है। चम्मच या चाकू का उपयोग करने के लिए मजबूर होने के बजाय, CrossHA यह देखना सीखता है कि सामग्री (कार्य) क्या है और तुरंत निर्णय लेता है: "क्या मुझे अभी एक मोटा कटाव (एक सरल मूवमेंट) चाहिए या एक बारीक स्लाइस (एक सटीक क्लिक) चाहिए?"
यह पहला मॉडल है जो बिना किसी इंसान द्वारा हर कदम पर यह बताए कि क्या करना है, सहजता से अलग-अलग "एक्शन भाषाओं" के बीच स्विच कर सकता है।
उन्होंने इसे कैसे सिखाया (प्रशिक्षण रेसिपी)
शोधकर्ताओं ने केवल मॉडल पर डेटा नहीं डाला; उन्होंने एक तीन-चरणीय प्रशिक्षण पाइपलाइन का उपयोग किया, जो एक इंसान द्वारा जटिल कौशल सीखने के समान है:
"स्वाद लेने" का चरण (सुपरवाइज्ड फाइन-ट्यूनिंग):
सबसे पहले, उन्होंने मॉडल को लोगों द्वारा अलग-अलग तरीकों (कुछ चलते थे, कुछ क्लिक करते थे, कुछ शॉर्टकट का उपयोग करते थे) से गेम खेलने के हजारों उदाहरण दिखाए। यहाँ लक्ष्य केवल मॉडल को इन सभी विभिन्न तरीकों की "शब्दावली" सिखाना था ताकि वह उन सभी को समझ सके। यह एक छात्र को अंग्रेजी, स्पेनिश और फ्रेंच पढ़ने के लिए सिखाने जैसा था, लेकिन अभी उनसे कहानी लिखने के लिए नहीं कहा गया था।"स्प्रिंट" चरण (सिंगल-टर्न RL):
इसके बाद, उन्होंने मॉडल को छोटे, एक-चरणीय चुनौतियों के लिए दिया। यदि मॉडल ने किसी समस्या को गलत "भाषा" का उपयोग करके हल करने की कोशिश की (उदाहरण के लिए, हैंडल पर क्लिक करने के बजाय बंद दरवाजे के माध्यम से चलने की कोशिश करना), तो उसे कम स्कोर मिला। यदि उसने सही काम के लिए सही उपकरण चुना, तो उसे इनाम मिला। इसने मॉडल को एक क्षण के लिए कौन सा उपकरण चुनना है, इसके बारे में त्वरित, स्मार्ट निर्णय लेना सिखाया।"मैराथन" चरण (मल्टी-टर्न RL):
अंत में, उन्होंने मॉडल को पूरे, लंबे गेम खेलने दिया। लक्ष्य केवल एक कदम सही करना नहीं था, बल्कि पूरे मिशन को कुशलतापूर्वक पूरा करना था। मॉडल ने सीखा कि कभी-कभी एक "तेज लेकिन मोटे" तरीके का उपयोग करना एक खेत में चलने के लिए बेहतर होता है, लेकिन एक नाजुक वस्तु को बनाने के लिए एक "धीमे लेकिन सटीक" तरीके में स्विच करना आवश्यक है। इसने एक लंबी यात्रा के दौरान गति और सटीकता के बीच संतुलन बनाना सीखा।
परिणाम: यह क्यों मायने रखता है
शोधकर्ताओं ने इस मॉडल का परीक्षण Minecraft में 800 से अधिक विभिन्न कार्यों पर किया, जिसमें पेड़ों को काटना, जटिल चीजें बनाना और राक्षसों से लड़ना शामिल है।
- पुराना तरीका: रोबोट जिन्हें केवल एक विधि (जैसे केवल चलना) के लिए प्रशिक्षित किया गया था, वे चलने में बहुत अच्छे थे लेकिन बनाने (crafting) में बहुत खराब थे। वे एक ऐसे व्यक्ति की तरह थे जो केवल दौड़ना जानता है लेकिन दरवाजा खोलना नहीं जानता।
- CrossHA का तरीका: नया मॉडल सब कुछ करने में सर्वश्रेष्ठ था। यह केवल औसत स्कोर नहीं बना रहा था; यह इसलिए उत्कृष्ट था क्योंकि इसे पता था कि कब गियर बदलना है।
"स्मार्ट ड्राइवर" की उपमा:
एक कार चलाने की कल्पना करें।
- एक फिक्स्ड-एक्शन रोबट एक ऐसे ड्राइवर की तरह है जो केवल हाईवे पर गाड़ी चलाना जानता है। यदि वे कच्ची सड़क पर पहुँचते हैं, तो वे दुर्घटनाग्रस्त हो जाते हैं। यदि वे पार्किंग लॉट में पहुँचते हैं, तो वे रास्ता भटक जाते हैं।
- CrossHA एक कुशल ड्राइवर की तरह है जो जानता है कि हाईवे के लिए हाई गियर में कब शिफ्ट होना है (दक्षता) और एक तंग पार्किंग स्पॉट के लिए लो गियर में कब शिफ्ट होना है और सावधानी से स्टीयर करना है (सटीकता)। उन्हें यह बताने के लिए को-पायलट की आवश्यकता नहीं है कि उन्हें कब शिफ्ट करना है; वे बस सड़क को महसूस करते हैं और अनुकूलित होते हैं।
निचोड़
पेपर का दावा है कि एक ही मॉडल को इन सभी अलग-अलग "एक्शन स्पेस" में महारत हासिल करने के लिए प्रशिक्षित करके और इसे रिवॉर्ड्स के साथ सुदृढीकरण लर्निंग (ट्रायल एंड एरर) के माध्यम से सीखने देकर, उन्होंने एक ऐसा एजेंट बनाया है जो पिछले मॉडलों की तुलना में काफी स्मार्ट, लचीला और कुशल है जो केवल एक ही प्रकार के एक्शन तक सीमित थे।
उन्होंने यह साबित किया कि मॉडल एक जटिल, ओपन-वर्ल्ड गेम में 800 से अधिक विभिन्न चुनौतियों को संभाल सकता है, और अन्य सभी मौजूदा तरीकों से बेहतर प्रदर्शन कर सकता है। कोड और मॉडल अब दूसरों के उपयोग के लिए खुले हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।