When Does Muon Help Agentic Reinforcement Learning?
यह शोध पत्र यह प्रदर्शित करता है कि Group-in-Group Policy Optimization के दौरान विशेष रूप से हिडन वेट मैट्रिसेस (hidden weight matrices) पर Muon ऑप्टिमाइज़र लागू करना, स्पार्स-रिवॉर्ड एजेंटिक आरएल (sparse-reward agentic RL) कार्यों में AdamW की तुलना में काफी बेहतर प्रदर्शन करता है, जहाँ प्रदर्शन में होने वाली वृद्धि एडवांटेज एस्टीमेटर (advantage estimator), लर्निंग रेट और पॉलिसी ऑप्टिमाइज़ेशन रणनीति के बीच परस्पर क्रिया पर अत्यधिक निर्भर करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक विशाल, बिखरे हुए घर में छिपे खजाने को खोजने के लिए नेविगेट करना सिखा रहे हैं। रोबोट एक कोड से बना "मस्तिष्क" है, और हर बार जब वह एक कदम उठाता है, तो उसे एक शिक्षक से एक छोटा सा संकेत मिलता है कि वह कदम अच्छा था या बुरा। यह रीइन्फोर्समेंट लर्निंग (RL) की दुनिया है, जहाँ एक एजेंट 'ट्रायल एंड एर error' (प्रयास और त्रुटि) के माध्यम से सीखता है। इस कहानी में "शिक्षक" एक गणितीय उपकरण है जिसे ऑप्टिमाइज़र (optimizer) कहा जाता है, जो यह तय करता है कि प्रत्येक गलती या सफलता के बाद रोबोट के मस्तिष्क में कितना बदलाव किया जाना चाहिए। वर्षों से, सबसे लोकप्रिय शिक्षक एक विधि रही है जिसे AdamW कहा जाता है, जो एक सावधान और स्थिर कोच की तरह है जो फीडबैक की तीव्रता के आधार पर रोबोट के कदमों को समायोजित करता है।
हाल ही में, Muon नामक एक नया, अधिक चमकदार कोच आया है। Muon अपने प्री-ट्रेनिंग (शुरुआत से सीखने की प्रक्रिया) के दौरान रोबोटों को सिखाने में अविश्वसनीय रूप से तेज़ और कुशल होने के लिए प्रसिद्ध है, जो अक्सर आधे ऊर्जा के साथ काम करता है। लेकिन यहाँ बड़ा सवाल यह है: क्या Muon तब भी उतना ही अच्छा काम करता है जब वह एक ऐसे रोबोट को सिखा रहा हो जिसने पहले से ही बुनियादी बातें सीख ली हैं और अब एक विशिष्ट, कठिन कार्य में महारत हासिल करने की कोशिश कर रहा है? कुछ शुरुआती रिपोर्टों ने सुझाव दिया कि Muon इस "फाइन-ट्यूनिंग" चरण के लिए बहुत आक्रामक हो सकता है, जिससे रोबोट जो जानता है उसे भूल सकता है या भ्रमित हो सकता है। यह शोध पत्र इस रहस्य की गहराई में जाता है, और यह परीक्षण करता है कि क्या Muon उन एजेंटों को जटिल, लंबे समय तक चलने वाली पहेलियों (long-horizon puzzles) को हल करने के लिए सिखाने में एक गुप्त हथियार बन सकता है जहाँ पुरस्कार दुर्लभ और कठिन होते हैं।
द ग्रेट ऑप्टिमाइज़र शोडाउन (The Great Optimizer Showdown)
प्रयोगशाला में, शोधकर्ताओं ने एक उच्च-दांव वाली दौड़ आयोजित की। उन्होंने एक छोटे लेकिन सक्षम AI एजेंट (जो Qwen2.5-0.5B-Instruct मॉडल पर आधारित है) को लिया और उसे ALFWorld में पहेलियाँ सुलझाने का कार्य सौंपा, जो एक सिम्युलेटेड वातावरण है जहाँ एजेंट को वस्तुओं को उठाने, सफाई करने या उन्हें गर्म करने जैसे घरेलू काम करने होते हैं। पेच क्या था? एजेंट को कार्यों के एक लंबे क्रम के बिल्कुल अंत में ही "सफलता" का पुरस्कार मिलता है, और रास्ते में कुछ भी गलत करने पर उसे दंड मिलता है। यह एक भूलभुलैया को हल करने जैसा है जहाँ आप केवल तभी "आप जीत गए!" सुनते हैं जब आप निकास तक पहुँच जाते हैं, लेकिन हर गलत मोड़ के लिए आपको "बज़!" सुनाई देता है।
यह देखने के लिए कि क्या Muon मदद कर सकता है, शोधकर्ताओं ने केवल रोबोट को भूलभुलैया में नहीं फेंका; उन्होंने उसे अपने प्रदर्शन की व्याख्या करने के लिए तीन अलग-अलग प्रकार के "फीडबैक कोच" (जिन्हें एडवांटेज एस्टिमेटर्स/advantage estimators कहा जाता है) दिए:
- GRPO: यह कोच केवल अंतिम परिणाम को देखता है। "क्या आप खेल जीत गए? हाँ? बहुत बढ़िया! नहीं? फिर से कोशिश करें।" यह व्यक्तिगत कदमों की अनदेखी करता है।
- GiGPO: यह कोच अधिक स्मार्ट है। यह अंतिम परिणाम को देखता है लेकिन साथ ही उन क्षणों को एक साथ समूहित करता है जहाँ रोबोट को एक ही स्थिति का कई बार सामना करना पड़ा। यह पूछता है, "जब आप फ्रिज के सामने खड़े थे, तो क्या आपने आमतौर पर इसे सही ढंग से खोला था?"
- GraphGPO: सबसे परिष्कृत कोच, जो पूरी यात्रा को एक ग्राफ के रूप में मैप करता है, और विश्लेषण करता है कि प्रत्येक कदम लक्ष्य के कितने करीब था।
आश्चर्यजनक खोज
टीम ने प्रयोग चलाए, जिसमें पुराने भरोसेमंद AdamW कोच के खिलाफ नए Muon कोच को मुकाबला कराया गया। उन्होंने बाकी सब कुछ बिल्कुल समान रखा, केवल रोबोट के "छिपे हुए" मस्तिष्क भार (जटिल आंतरिक कनेक्शन) के लिए ऑप्टिमाइज़र को बदला, जबकि बुनियादी हिस्सों (जैसे शब्दों के शब्दकोश) को AdamW पर ही छोड़ दिया।
परिणाम पूरी तरह से इस बात पर निर्भर थे कि किस फीडबैक कोच का उपयोग किया गया था, और वे "औसत" और "अद्भुत" के बीच के थे।
"अद्भुत" क्षण: GiGPO
जब उन्होंने GiGPO कोच का उपयोग किया, तो Muon ने रोबोट को एक सुपर-लर्नर बना दिया।
- मानक AdamW कोच के साथ, रोबोट अंतिम परीक्षण दौरों में लगभग 29% मामलों में सफल हुआ।
- Muon के साथ, वह संख्या बढ़कर 54.6% हो गई।
- यह 88% का सापेक्ष सुधार है।
- इससे भी अधिक प्रभावशाली बात यह है कि जबकि AdamW वाला रोबोट एक निश्चित बिंदु के बाद पूरी तरह से विफल हो गया और कोई भी कार्य हल करने में असमर्थ रहा, Muon वाला रोबोट 200 अपडेट तक लगातार सीखता रहा और सफल होता रहा।
"औसत" क्षण: GRPO
जब उन्होंने सरल GRPO कोच (जिसे केवल अंतिम जीत की परवाह है) का उपयोग किया, तो Muon ने मदद तो की, लेकिन उतनी नाटकीय रूपता से नहीं। इसने सफलता को 16.1% से 26.8% तक सुधारा। यह एक जीत थी, लेकिन रोबोट उतना तेज़ या बेहतर नहीं सीख सका जितना कि GiGPO के साथ सीखा था।
"लगभग पहुँच गया" क्षण: GraphGPO
सुपर-स्मार्ट GraphGPO कोच के साथ, रोबोट AdamW के साथ पहले से ही बहुत अच्छा कर रहा था (लगभग 81% सफलता)। Muon ने एक विशिष्ट लर्निंग रेट पर इसे थोड़ा और ऊपर धकेल दिया (90.1% सफलता), और इसने AdamW की तुलना में लगभग 30 से 60 कदम पहले उस सफलता स्तर तक पहुँचना सीख लिया। हालाँकि, क्योंकि रोबोट पहले से ही शीर्ष के करीब था, इसलिए दोनों कोचों के बीच का अंतर फिनिश लाइन के करीब आते ही कम हो गया।
Muon क्यों जीता? (और वह हमेशा क्यों नहीं जीतता?)
शोधकर्ताओं के पास एक सिद्धांत था कि ऐसा क्यों हुआ। उन्हें संदेह था कि इसका संबंध शोर (noise) से है।
कल्पना कीजिए कि रोबोट का मस्तिष्क एक धुंधले जंगल के माध्यम से रास्ता खोजने की कोशिश कर रहा है।
- AdamW एक ऐसे यात्री की तरह है जो सबसे मजबूत, सबसे तेज़ रास्ते का अनुसरण करता है। यदि धुंध घनी है (उच्च शोर), तो यह फंस सकता है या भटक सकता है।
- Muon एक ऐसे यात्री की तरह है जो इलाके को समतल कर देता है, जिससे कमजोर, शांत रास्ते भी उतने ही दृश्यमान हो जाते जितने कि तेज़ रास्ते। यह तब बहुत अच्छा है यदि शांत रास्ते वास्तव में कहीं उपयोगी दिशा में ले जाते हैं।
पेपर सुझाव देता है कि GRPO सेटअप (सिंगल-टर्न, लो-रिवॉर्ड टास्क) में, "शांत रास्ते" ज्यादातर केवल रैंडम शोर (random noise) हैं। Muon का समतल करने वाला प्रभाव इस शोर को बढ़ा देता है, यही कारण है कि यह अन्य अध्ययनों में कभी-कभी विफल हो जाता है या संघर्ष करता है। हालाँकि, GiGPO सेटअप में, "स्टेप-लेवल" फीडबैक एक लाइटहाउस (प्रकाश स्तंभ) की तरह कार्य करता है। यह शोर को फ़िल्टर करता है और वास्तव में उपयोगी दिशाओं को उजागर करता है। क्योंकि GiG�ो स्पष्ट संकेत प्रदान करता है कि कौन से विशिष्ट कदम अच्छे थे, इसलिए Muon की कमजोर संकेतों को बढ़ाने की क्षमता एक अभिशाप के बजाय एक सुपरपावर बन जाती है।
यह पेपर क्या खारिज करता है
यह ध्यान रखना महत्वपूर्ण है कि इस अध्ययन ने क्या नहीं पाया। शोधकर्ताओं ने परीक्षण किया कि क्या सफलता केवल इसलिए थी क्योंकि Muon एक उच्च "लर्निंग रेट" (एक बड़ा स्टेप साइज) का उपयोग कर रहा था। उन्होंने AdamW की गति को Muon की गति के बराबर लाने की कोशिश की, लेकिन रोबोट तुरंत क्रैश हो गया और विफल हो गया। यह साबित करता है कि Muon की सफलता केवल बड़े कदम उठाने के बारे में नहीं थी; यह इस बारे में थी कि वह उन कदमों की गणना कैसे करता था।
साथ ही, पेपर यह दावा नहीं करता कि Muon हर चीज़ के लिए पूर्ण समाधान है। वास्तव में, यह स्पष्ट रूप से नोट करता है कि अन्य प्रकार के कार्यों (जैसे सिंगल-टर्न मैथ प्रॉब्लम्स) में, Muon अतीत में विफल रहा है। यहाँ की सफलता लॉन्ग-होरिज़न, स्पार्स-रिवॉर्ड टास्क के लिए विशिष्ट है जहाँ फीडबैक को सावधानीपूर्वक संरचित किया गया है (जैसे GiGPO के साथ)।
निष्कर्ष (The Bottom Line)
यह पेपर सुझाव देता है कि Muon एजेंटिक रीइन्फोर्समेंट लर्निंग के लिए एक शक्तिशाली उपकरण है, लेकिन केवल सही प्रकार के फीडबैक के साथ।
यदि आप एक AI को जटिल, बहु-चरणीय पहेलियों को हल करने के लिए सिखा रहे हैं, तो केवल Muon को शामिल करना पर्याप्त नहीं हो सकता है। आपको एक ऐसा फीडबैक सिस्टम चाहिए (जैसे GiGPO) जो समस्या को छोटे, स्पष्ट टुकड़ों में विभाजित करे। जब आप उपयोगी "शांत" रास्तों को देखने की Muon की क्षमता को शोर को फ़िल्टर करने की GiGPO की क्षमता के साथ जोड़ते हैं, तो AI काफी तेज़ी से सीखता है और अधिक पहेलियाँ हल करता है।
लेखक स्वीकार करते हैं कि यह एक एकल सीड (प्रयोग का एक रन) का उपयोग करने वाला एक "एक्सप्लोरेटरी" (अन्वेषणात्मक) अध्ययन है, इसलिए यह देखने के लिए और अधिक परीक्षण की आवश्यकता है कि क्या यह पैटर्न विभिन्न मॉडलों और कार्यों में बना रहता है। लेकिन परिणाम उत्साहजनक हैं: ऑप्टिमाइज़र और फीडबैक सिस्टम को एक साथ ट्यून करके, हम ऐसे AI एजेंट बना सकते हैं जो वास्तविक दुनिया की जटिलताओं को नेविगेट करने में बहुत बेहतर हो सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।