← नवीनतम पेपर
🤖 machine learning

Muown: Row-Norm Control for Muon Optimization

यह शोध पत्र Muown को पेश करता है, जो एक ड्रॉप-इन ऑप्टिमाइज़र है जो Muon में स्पेक्ट्रल नॉर्म ड्रिफ्ट (spectral norm drift) को रोकने के लिए स्पष्ट रूप से रो-मैग्निट्यूड वेक्टर्स (row-magnitude vectors) को नियंत्रित करता है, जिससे प्रशिक्षण स्थिरता में सुधार होता है, वेट डिके (weight decay) के प्रति संवेदनशीलता कम होती है, और विभिन्न मॉडल स्केल्स पर बेहतर परप्लेक्सिटी (perplexity) प्राप्त होती है।

मूल लेखक: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल डिजिटल मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) को कहानियाँ लिखने, गणित की समस्याओं को हल करने या आपसे चैट करने के लिए प्रशिक्षित कर रहे हैं। ऐसा करने के लिए, इस मस्तिष्क को अपने सर्किट के भीतर लाखों सूक्ष्म नॉब्स (वेट्स) को समायोजित करके सीखना होता है।

लंबे समय तक, इन नॉब्स को घुमाने का सबसे अच्छा तरीका AdamW नामक एक विधि था। हाल ही में, Muon नामक एक नई, तेज़ विधि आई। यह एक साइकिल से स्पोर्ट्स कार में स्विच करने जैसा था; इसने बेहतर और तेज़ी से सीखा। लेकिन इसमें एक पेच था: स्पोर्ट्स कार में अनियंत्रित होकर नियंत्रण से बाहर होने की प्रवृत्ति थी।

समस्या: "ड्रिफ्टिंग" इंजन

यह पेपर Muon के साथ एक विशिष्ट समस्या की पहचान करता है। जैसे-जैसे मॉडल प्रशिक्षित होता है, इसके आंतरिक कनेक्शनों का "आकार" (विशेष रूप से, इसके वेट मैट्रिसेस की पंक्तियों की ताकत) अनियंत्रित रूप से बढ़ने लगता है।

इसे एक गुब्बारे को फुलाने की तरह समझें।

  • Muon यह समझने में बहुत अच्छा है कि गुब्बारे में हवा किस दिशा में फूँकनी है (दिशा)।
  • हालाँकि, यह ज़रूरत से ज़्यादा हवा पंप करता रहता है, जिससे गुब्बारा बड़ा और बड़ा होता जाता है जब तक कि वह फट न जाए (संख्यात्मक त्रुटियां) या अस्थिर न हो जाए।
  • मानक समाधान यह था कि गुब्बारे के चारों ओर एक डोरी बाँध दी जाए और जब भी वह बहुत बड़ा हो जाए, उसे कसकर खींचा जाए (Weight Decay)। लेकिन लेखक trouvé कि यह अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा था: इसने सीखने की प्रक्रिया को धीमा कर दिया क्योंकि इसने पूरे गुब्बारे को दबा दिया, यहाँ तक कि उन हिस्सों को भी जो ठीक थे।

निदान: समस्या के दो भाग

लेखकों, जिनका नेतृत्व काई लायन (Kai Lion) ने किया, ने यह देखने के लिए कि वास्तव में गुब्बारे के अंदर क्या बढ़ रहा है, इसके भीतर झाँका। उन्होंने महसूस किया कि कनेक्शन का "आकार" दो अलग-अलग भागों से बना है:

  1. परिमाण (Magnitude - वॉल्यूम): संख्याओं की पंक्ति कुल मिलाकर कितनी बड़ी है।
  2. सुसंगतता (Coherence - आकार): उस पंक्ति के भीतर संख्याएँ एक-दूसरे के सापेक्ष कैसे व्यवस्थित हैं।

उन्होंने पाया कि केवल परिमाण (Magnitude) ही अनियंत्रित रूप से बढ़ रहा था। आकार (Coherence) वास्तव में बिल्कुल ठीक व्यवहार कर रहा था और स्थिर था। गुब्बारा अपना आकार नहीं बदल रहा था; वह बस बड़ा हो रहा था।

समाधान: Muown (स्मार्ट पंप)

लेखकों ने Muown नामक एक नया ऑप्टिमाइज़र बनाया।

पूरे कनेक्शन को एक बड़े ढेर के रूप में मानने के बजाय, Muown काम को दो अलग-अलग कार्यों में विभाजित करता है:

  1. डायरेक्शन टीम (Muon): यह टीम वही करती है जिसमें Muon माहिर है: यह पता लगाना कि वेट्स को अपडेट करने की सही दिशा क्या है। वे इस हिस्से को अपरिवर्तित छोड़ देते हैं।
  2. वॉल्यूम टीम (नया): यह नया हिस्सा है। वे "परिमाण" (वॉल्यूम) को लेते हैं और इसे एक अलग, स्पष्ट चर (variable) के रूप में मानते हैं। वे इस वॉल्यूम को एक विशेष सेट के नियमों (एक विशिष्ट गणितीय ज्यामिति जिसे \ell_\infty कहा जाता है) के तहत रखते हैं ताकि यह बहुत तेज़ी से न बढ़े।

उपमा:
कल्पना कीजिए कि आप एक ऐसी कार चला रहे हैं जहाँ स्टीयरिंग व्हील और एक्सीलेटरेशन पेडल आपस में जुड़े हुए हैं। यदि आप पहिया घुमाते हैं, तो एक्सीलेटर भी दब जाता है, जिससे कार अनियंत्रित रूप से तेज़ हो जाती है।

  • Muon उस अटकी हुई कार की तरह था।
  • Muown एक ऐसी कार की तरह है जहाँ स्टीयरिंग व्हील को एक्सीलेटर से अलग कर दिया गया है। आप अभी भी सटीक रूप से स्टीयरिंग चला सकते हैं (Muon के तर्क का उपयोग करके), लेकिन अब आपके पास एक्सीलेटर के लिए एक अलग, स्मार्ट क्रूज कंट्रोल है जो गति को ठीक वहीं रखता है जहाँ उसे होना चाहिए, बिना आपको धीमा किए।

परिणाम

लेखकों ने 124 मिलियन से लेकर 2.7 बिलियन पैरामीटर्स तक के मॉडल्स पर इसका परीक्षण किया। उन्हें यहाँ क्या मिला:

  • बेहतर प्रदर्शन: Muown ने लगातार Muon, AdamW और अन्य प्रतिस्पर्धियों की तुलना में बेहतर परिणाम (कम "परप्लेक्सिटी", जो मॉडल के भ्रमित होने का एक माप है) दिए।
  • अधिक सहनशील: Muon के साथ, आपको अपनी सेटिंग्स (लर्निंग रेट) के प्रति बहुत सावधान रहना पड़ता था। यदि आपने गलत सेटिंग चुनी, तो मॉडल विफल हो जाता। Muown बहुत अधिक मजबूत है; यह सेटिंग्स की एक विस्तृत श्रृंखला में अच्छा काम करता है, जैसे कि एक कार जिसका "स्वीट स्पॉट" व्यापक हो।
  • कोई अतिरिक्त लागत नहीं: आमतौर पर, एक नया नियंत्रण सिस्टम जोड़ने से आपकी कार धीमी हो जाती है। लेकिन क्योंकि लेखकों ने इस नए "वॉल्यूम कंट्रोल" को इंजन के मौजूदा वर्कफ़्लो में सीधे एकीकृत किया, इसलिए इसने प्रशिक्षण प्रक्रिया में लगभग कोई अतिरिक्त समय नहीं जोड़ा।
  • स्थिरता: "गुब्बारा" अब ड्रिफ्ट नहीं कर रहा था। स्पेक्ट्रल नॉर्म (कनेक्शन का आकार) स्थिर रहा, जिससे उन संख्यात्मक त्रुटियों को रोका गया जो मूल Muon में समस्या पैदा करती थीं।

सारांश

यह पेपर तर्क देता है कि लोकप्रिय Muon ऑप्टिमाइज़र में अस्थिरता उसकी दिशा खोजने की क्षमता में दोष नहीं थी, बल्कि उसके "वॉल्यूम" के अपडेट पर नियंत्रण की कमी थी। "वॉल्यूम" को "दिशा" से अलग करके और उन्हें अलग-अलग, विशिष्ट उपकरणों के साथ नियंत्रित करके, Muown भारी-भरकम सुधारों जैसे कि वेट डिके (weight decay) की आवश्यकता के बिना प्रशिक्षण को तेज़ और स्थिर रखता है। यह एक 'ड्रॉप-इन रिप्लेसमेंट' है जो प्रशिक्षण प्रक्रिया को सुचारू, तेज़ और अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →