Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
यह शोध पत्र Pion को प्रस्तुत करता है, जो एक हाई-पास स्पेक्ट्रल ऑप्टिमाइज़र है जो शोर वाले ग्रेडिएंट घटकों को दबाकर और प्रति-हेड विशेषज्ञता को संरक्षित करके Muon में सुधार करता है, जिससे विज़न-लैंग्वेज-एक्शन प्रशिक्षण और सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (reinforcement learning) में बेहतर प्रदर्शन और स्थिरता प्राप्त होती है जहाँ Muon और AdamW संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Rethinkng Muon Beyond Pretraining" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।
बड़ी तस्वीर: रोबोट्स और तर्क (Reasoning) के लिए एक नया ऑप्टिमाइज़र
कल्पना कीजिए कि एक AI को प्रशिक्षित करना एक छात्र को पढ़ाने जैसा है। लंबे समय से, बड़े लैंग्वेज मॉडल्स (LLMs) के लिए सबसे अच्छा शिक्षक (ऑप्टिमाइज़र) AdamW रहा है। हाल ही में, Muon नामक एक नया, अधिक उन्नत शिक्षक आया है। Muon "प्रीट्रेनिंग" चरण के लिए बहुत अच्छा है—जहाँ AI सामान्य ज्ञान सीखने के लिए पूरे इंटरनेट को पढ़ता है। Muon AI के मस्तिष्क को एक वाद्य यंत्र की तरह मानकर काम करता है, यह सुनिश्चित करता है कि हर नोट (गणितीय दिशा) समान वॉल्यूम के साथ बजाया जाए ताकि साहसिक अन्वेषण (exploration) को बढ़ावा मिल सके।
हालाँकि, इस पेपर के लेखकों ने पाया कि जब आप इसे दो विशिष्ट, उन्नत कार्यों के लिए उपयोग करने की कोशिश करते हैं, तो Muon में एक बड़ी खामी होती है:
- रोबोट को सिखाना (VLA): एक स्मार्ट लैंग्वेज मॉडल को एक ऐसे रोबोट में बदलना जो देख सके, बोल सके और हिल-डुल सके।
- गणित/तर्क सिखाना (RLVR): कठिन समस्याओं जैसे गणितीय पहेलियों को हल करने के लिए AI को रिवॉर्ड्स (पुरस्कारों) का उपयोग करके सिखाना।
इन नए परिदृश्यों में, Muon अक्सर विफल हो जाता है, जिससे रोबोट अनाड़ी तरीके से चलता है या गणित हल करने वाला AI वह सब कुछ भूल जाता है जो उसने सीखा था। लेखक Pion नामक एक नया शिक्षक प्रस्तावित करते हैं जो इन समस्याओं को ठीक करता है।
समस्या: क्यों Muon नई स्थितियों में विफल होता है
समस्या को समझने के लिए, AI की सीखने की प्रक्रिया को कई स्पीकर्स (गणितीय दिशाओं) वाले एक साउंड सिस्टम के रूप में कल्पना करें।
1. रोबोट की समस्या ("लो-रैंक" का मुद्दा)
जब एक रोबोट को प्रशिक्षित किया जाता है, तो मस्तिष्क का वह हिस्सा जो हाथों को नियंत्रित करता है (एक्शन मॉड्यूल), बहुत सरल होता है। उसे केवल कुछ विशिष्ट दिशाओं में हिलने की आवश्यकता होती है।
- उदाहरण: कल्पना कीजिए कि एक गायक मंडली (choir) है जहाँ केवल 3 गायकों के पास सही बोल हैं, लेकिन बाकी 97 बस बेमतलब का शोर (humming) कर रहे हैं।
- Muon क्या करता है: Muon एक ऑडियो इंजीनियर की तरह है जो हर गायक की आवाज़ को बिल्कुल एक ही स्तर पर तेज़ कर देता है। यह उन 3 अच्छे गायकों को तो तेज़ करता ही है, लेकिन उन 97 शोर करने वाले गायकों को भी उसी वॉल्यूम पर तेज़ कर देता है। परिणाम? रोबोट शोर से भ्रमित हो जाता है और अनियंत्रित रूप से हिलने लगता है।
- समाधान: आपको एक ऐसी प्रणाली की आवश्यकता है जो अच्छे गायकों को तेज़ रखे लेकिन शोर करने वालों को शांत रखे।
2. गणित की समस्या ("लो सिग्नल-टू-नॉइज़" का मुद्दा)
जब आप रिवॉर्ड्स का उपयोग करके AI को गणित की समस्याएँ सुलझाने के लिए सिखाते हैं (RLVR), तो फीडबैक बहुत "शोर भरा" (noisy) होता है। AI अनुमान लगाता है, रिवॉर्ड प्राप्त करता है, और फिर से प्रयास करता है। सिग्नल (वास्तविक गणित का पाठ) कमजोर है, और शोर (रैंडम अनुमान) बहुत अधिक है।
- उदाहरण: कल्पना कीजिए कि एक तूफान के बीच किसी की फुसफुसाहट सुनने की कोशिश करना।
- Muon क्या करता है: Muon फुसफुसाहट और तूफान की हवा को समान रूप से तेज़ करने की कोशिश करता है। यह फुसफुसाहट को पूरी तरह से दबा देता है, जिससे AI "कोलैप्स" (collapse) हो जाता है और सीखना बंद कर देता है।
- समाधान: आपको एक ऐसे फिल्टर की आवश्यकता है जो फुसफुसाहट को बढ़ाता है लेकिन तूफान की हवा को रोकता है।
समाधान: पेश है Pion
लेखकों ने Pion (sPectral hIgh-pass Optimization on momeNtum) बनाया है। Pion को एक स्मार्ट ऑडियो इक्वलाइज़र के रूप में समझें जिसे Muon लगाना भूल गया था।
सभी वॉल्यूम को समान रूप से बढ़ाने के बजाय, Pion दो चरणों वाली प्रक्रिया का उपयोग करता है:
- प्रमोशन (Promotion): यह महत्वपूर्ण, स्पष्ट संकेतों (ध्वनि के "हेड") को बढ़ावा देता है।
- सप्रेशन (Suppression): यह सक्रिय रूप से शोर वाले, कमजोर संकेतों (ध्वनि की "टेल") को शांत करता है।
इसे "हाई-पास" (High-Pass) फ़िल्टर कहा जाता है। ठीक वैसे ही जैसे संगीत में एक हाई-पास फ़िल्टर कम बेस शोर को काट देता है ताकि स्पष्ट आवाज चमक सके, Pion गणितीय शोर को काट देता है ताकि उपयोगी सीखने की दिशाएं चमक सकें।
Pion की मुख्य विशेषताएं:
- ड्रॉप-इन रिप्लेसमेंट: यह मौजूदा ट्रेनिंग कोड में ठीक उसी जगह फिट बैठता है जहाँ Muon जाता है। इसके लिए अधिक कंप्यूटर पावर या समय की आवश्यकता नहीं है; यह उतना ही तेज़ है।
- पर-हेड मोड (Per-Head Mode): गणित की समस्याओं के लिए, Pion AI के मस्तिष्क के विभिन्न हिस्सों (जिन्हें "अटेंशन हेड्स" कहा जाता है) को व्यक्तिगत रूप से देख सकता है। यह ऐसा है जैसे यह महसूस करना कि कक्षा के कुछ छात्र ज्यामिति में अच्छे हैं जबकि अन्य बीजगणित में अच्छे हैं, और पूरी कक्षा को एक ही समूह मानने के बजाय उन्हें अलग-अलग होमवर्क देना।
परिणाम: रोबोट और गणित स्मार्ट हो गए
पत्रकारों ने Pion का परीक्षण दो मुख्य क्षेत्रों में किया:
1. वास्तविक रोबोट (VLA)
- परीक्षण: उन्होंने रोबोट को वस्तुओं (जैसे खीरा या क्यूब) को उठाने और उन्हें कटोरे या प्लेट में रखने के लिए प्रशिक्षित किया।
- परिणाम:
- AdamW: रोबोट संघर्ष करता रहा, अक्सर चीजें गिरा देता या लक्ष्य से चूक जाता।
- Muon: रोबोट बेहतर था लेकिन अभी भी झटके ले रहा था और कभी-कभी चीजों से टकरा जाता था क्योंकि वह बहुत अधिक शोर "सुन" रहा था।
- Pion: रोबोट सुचारू और सटीक था। एक परीक्षण में, Pion ने 1,500 स्टेप्स के बाद 100% सफलता दर हासिल की, जबकि Muon को 97% और AdamW को केवल 32% मिला।
- वास्तविक दुनिया: उन्होंने इसे एक वास्तविक भौतिक रोबोट आर्म (Franka Research 3) पर भी परखा, और Pion अभी भी जीत गया, अन्य की तुलना में बहुत अधिक विश्वसनीयता के साथ वस्तुओं को उठाने और रखने में सफल रहा।
2. गणितीय तर्क (RLVR)
- परीक्षण: उन्होंने AI मॉडल्स (Qwen3) को रिइन्फोर्समेंट लर्निंग का उपयोग करके गणित की समस्याएं (MATH और GSM8K डेटासेट) हल करने के लिए सिखाया।
- परिणाम:
- Muon: मॉडल कोलैप्स (collapse) हो गया। इसकी सटीकता लगभग शून्य तक गिर गई क्योंकि शोर ने सीखने के सिग्नल को दबा दिया।
- AdamW: मॉडल धीरे-धीरे लेकिन लगातार सीख रहा था।
- Pion: मॉडल ने AdamW की तुलना में तेज़ी से सीखा और उच्च सटीकता प्राप्त की, और शोर भरे गणितीय वातावरण में सफलतापूर्वक काम किया।
सारांश
यह पेपर तर्क देता है कि जबकि Muon AI ट्रेनिंग के शुरुआती "पढ़ने" (pretraining) चरण के लिए एक शानदार उपकरण है, यह रोबोट को नियंत्रित करने या गणित की समस्याओं को हल करने जैसे नाजुक कार्यों के लिए बहुत "तेज़" और बिना सोचे-समझे काम करने वाला है। Pion वह नया उपकरण है जो AI ट्रेनिंग के लिए 'नॉइज़-कैंसलिंग हेडफ़ोन' की तरह काम करता है: यह महत्वपूर्ण सीखने के संकेतों को स्पष्ट और तेज़ रखता है जबकि ध्यान भटकाने वाले शोर को शांत कर देता है, जिससे बिना किसी देरी के स्मार्ट रोबोट और बेहतर गणित हल करने वाले मॉडल मिलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।