Muown: Row-Norm Control for Muon Optimization
यह शोध पत्र Muown को पेश करता है, जो एक ड्रॉप-इन ऑप्टिमाइज़र है जो Muon में स्पेक्ट्रल नॉर्म ड्रिफ्ट (spectral norm drift) को रोकने के लिए स्पष्ट रूप से रो-मैग्निट्यूड वेक्टर्स (row-magnitude vectors) को नियंत्रित करता है, जिससे प्रशिक्षण स्थिरता में सुधार होता है, वेट डिके (weight decay) के प्रति संवेदनशीलता कम होती है, और विभिन्न मॉडल स्केल्स पर बेहतर परप्लेक्सिटी (perplexity) प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल डिजिटल मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) को कहानियाँ लिखने, गणित की समस्याओं को हल करने या आपसे चैट करने के लिए प्रशिक्षित कर रहे हैं। ऐसा करने के लिए, इस मस्तिष्क को अपने सर्किट के भीतर लाखों सूक्ष्म नॉब्स (वेट्स) को समायोजित करके सीखना होता है।
लंबे समय तक, इन नॉब्स को घुमाने का सबसे अच्छा तरीका AdamW नामक एक विधि था। हाल ही में, Muon नामक एक नई, तेज़ विधि आई। यह एक साइकिल से स्पोर्ट्स कार में स्विच करने जैसा था; इसने बेहतर और तेज़ी से सीखा। लेकिन इसमें एक पेच था: स्पोर्ट्स कार में अनियंत्रित होकर नियंत्रण से बाहर होने की प्रवृत्ति थी।
समस्या: "ड्रिफ्टिंग" इंजन
यह पेपर Muon के साथ एक विशिष्ट समस्या की पहचान करता है। जैसे-जैसे मॉडल प्रशिक्षित होता है, इसके आंतरिक कनेक्शनों का "आकार" (विशेष रूप से, इसके वेट मैट्रिसेस की पंक्तियों की ताकत) अनियंत्रित रूप से बढ़ने लगता है।
इसे एक गुब्बारे को फुलाने की तरह समझें।
- Muon यह समझने में बहुत अच्छा है कि गुब्बारे में हवा किस दिशा में फूँकनी है (दिशा)।
- हालाँकि, यह ज़रूरत से ज़्यादा हवा पंप करता रहता है, जिससे गुब्बारा बड़ा और बड़ा होता जाता है जब तक कि वह फट न जाए (संख्यात्मक त्रुटियां) या अस्थिर न हो जाए।
- मानक समाधान यह था कि गुब्बारे के चारों ओर एक डोरी बाँध दी जाए और जब भी वह बहुत बड़ा हो जाए, उसे कसकर खींचा जाए (Weight Decay)। लेकिन लेखक trouvé कि यह अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा था: इसने सीखने की प्रक्रिया को धीमा कर दिया क्योंकि इसने पूरे गुब्बारे को दबा दिया, यहाँ तक कि उन हिस्सों को भी जो ठीक थे।
निदान: समस्या के दो भाग
लेखकों, जिनका नेतृत्व काई लायन (Kai Lion) ने किया, ने यह देखने के लिए कि वास्तव में गुब्बारे के अंदर क्या बढ़ रहा है, इसके भीतर झाँका। उन्होंने महसूस किया कि कनेक्शन का "आकार" दो अलग-अलग भागों से बना है:
- परिमाण (Magnitude - वॉल्यूम): संख्याओं की पंक्ति कुल मिलाकर कितनी बड़ी है।
- सुसंगतता (Coherence - आकार): उस पंक्ति के भीतर संख्याएँ एक-दूसरे के सापेक्ष कैसे व्यवस्थित हैं।
उन्होंने पाया कि केवल परिमाण (Magnitude) ही अनियंत्रित रूप से बढ़ रहा था। आकार (Coherence) वास्तव में बिल्कुल ठीक व्यवहार कर रहा था और स्थिर था। गुब्बारा अपना आकार नहीं बदल रहा था; वह बस बड़ा हो रहा था।
समाधान: Muown (स्मार्ट पंप)
लेखकों ने Muown नामक एक नया ऑप्टिमाइज़र बनाया।
पूरे कनेक्शन को एक बड़े ढेर के रूप में मानने के बजाय, Muown काम को दो अलग-अलग कार्यों में विभाजित करता है:
- डायरेक्शन टीम (Muon): यह टीम वही करती है जिसमें Muon माहिर है: यह पता लगाना कि वेट्स को अपडेट करने की सही दिशा क्या है। वे इस हिस्से को अपरिवर्तित छोड़ देते हैं।
- वॉल्यूम टीम (नया): यह नया हिस्सा है। वे "परिमाण" (वॉल्यूम) को लेते हैं और इसे एक अलग, स्पष्ट चर (variable) के रूप में मानते हैं। वे इस वॉल्यूम को एक विशेष सेट के नियमों (एक विशिष्ट गणितीय ज्यामिति जिसे कहा जाता है) के तहत रखते हैं ताकि यह बहुत तेज़ी से न बढ़े।
उपमा:
कल्पना कीजिए कि आप एक ऐसी कार चला रहे हैं जहाँ स्टीयरिंग व्हील और एक्सीलेटरेशन पेडल आपस में जुड़े हुए हैं। यदि आप पहिया घुमाते हैं, तो एक्सीलेटर भी दब जाता है, जिससे कार अनियंत्रित रूप से तेज़ हो जाती है।
- Muon उस अटकी हुई कार की तरह था।
- Muown एक ऐसी कार की तरह है जहाँ स्टीयरिंग व्हील को एक्सीलेटर से अलग कर दिया गया है। आप अभी भी सटीक रूप से स्टीयरिंग चला सकते हैं (Muon के तर्क का उपयोग करके), लेकिन अब आपके पास एक्सीलेटर के लिए एक अलग, स्मार्ट क्रूज कंट्रोल है जो गति को ठीक वहीं रखता है जहाँ उसे होना चाहिए, बिना आपको धीमा किए।
परिणाम
लेखकों ने 124 मिलियन से लेकर 2.7 बिलियन पैरामीटर्स तक के मॉडल्स पर इसका परीक्षण किया। उन्हें यहाँ क्या मिला:
- बेहतर प्रदर्शन: Muown ने लगातार Muon, AdamW और अन्य प्रतिस्पर्धियों की तुलना में बेहतर परिणाम (कम "परप्लेक्सिटी", जो मॉडल के भ्रमित होने का एक माप है) दिए।
- अधिक सहनशील: Muon के साथ, आपको अपनी सेटिंग्स (लर्निंग रेट) के प्रति बहुत सावधान रहना पड़ता था। यदि आपने गलत सेटिंग चुनी, तो मॉडल विफल हो जाता। Muown बहुत अधिक मजबूत है; यह सेटिंग्स की एक विस्तृत श्रृंखला में अच्छा काम करता है, जैसे कि एक कार जिसका "स्वीट स्पॉट" व्यापक हो।
- कोई अतिरिक्त लागत नहीं: आमतौर पर, एक नया नियंत्रण सिस्टम जोड़ने से आपकी कार धीमी हो जाती है। लेकिन क्योंकि लेखकों ने इस नए "वॉल्यूम कंट्रोल" को इंजन के मौजूदा वर्कफ़्लो में सीधे एकीकृत किया, इसलिए इसने प्रशिक्षण प्रक्रिया में लगभग कोई अतिरिक्त समय नहीं जोड़ा।
- स्थिरता: "गुब्बारा" अब ड्रिफ्ट नहीं कर रहा था। स्पेक्ट्रल नॉर्म (कनेक्शन का आकार) स्थिर रहा, जिससे उन संख्यात्मक त्रुटियों को रोका गया जो मूल Muon में समस्या पैदा करती थीं।
सारांश
यह पेपर तर्क देता है कि लोकप्रिय Muon ऑप्टिमाइज़र में अस्थिरता उसकी दिशा खोजने की क्षमता में दोष नहीं थी, बल्कि उसके "वॉल्यूम" के अपडेट पर नियंत्रण की कमी थी। "वॉल्यूम" को "दिशा" से अलग करके और उन्हें अलग-अलग, विशिष्ट उपकरणों के साथ नियंत्रित करके, Muown भारी-भरकम सुधारों जैसे कि वेट डिके (weight decay) की आवश्यकता के बिना प्रशिक्षण को तेज़ और स्थिर रखता है। यह एक 'ड्रॉप-इन रिप्लेसमेंट' है जो प्रशिक्षण प्रक्रिया को सुचारू, तेज़ और अधिक विश्वसनीय बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।