← नवीनतम पेपर
🤖 machine learning

Dimension-Free Saddle-Point Escape in Muon

यह शोधपत्र सैद्धांतिक रूप से स्थापित करता है कि Muon ऑप्टिमाइज़र एक गैर-रेखीय स्पेक्ट्रल शेपिंग तंत्र का उपयोग करके उच्च-आयामी LLM प्रशिक्षण परिदृश्यों में डायमेंशन-फ्री सैडल-पॉइंट एस्केप प्राप्त करता है, जिससे यह AdamW जैसे एलिमेंट-वाइज एडेप्टिव ऑप्टिमाइज़र्स को फँसाने वाले O(D)\mathcal{O}(D) आयामी अभिशाप (dimensional curse) को दरकिनार कर देता है।

मूल लेखक: Yanlin Long, Yufei Gu, Zeke Xie

प्रकाशित 2026-05-12
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanlin Long, Yufei Gu, Zeke Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Dimension-Free Saddle-Point Escape in Muon" पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: एक सपाट, अनंत मैदान में फंस जाना

कल्पना कीजिए कि आप एक विशाल, धुंधली घाटी में सबसे निचले बिंदु को खोजने की कोशिश कर रहे हैं (यह एक विशाल AI मॉडल को प्रशिक्षित करने का प्रतिनिधित्व करता है)। आमतौर पर, आप उम्मीद करते हैं कि आपको गहरे गड्ढे (लोकल मिनिमा) मिलेंगे जहाँ आप फंस सकते हैं। लेकिन आधुनिक AI में, परिदृश्य (landscape) अलग है। गहरे गड्ढों के बजाय, आप एक विशाल, पूरी तरह से सपाट पठार पर चल रहे हैं जो हर दिशा में मीलों तक फैला हुआ है।

गणित की भाषा में, इसे "सैडल पॉइंट" (saddle point) कहा जाता है। यह कुछ दिशाओं में सपाट होता है और कुछ दिशाओं में ढलान वाला होता है, लेकिन ढलान इतनी हल्की होती है कि यह एक सपाट फर्श जैसा महसूस होता है।

  • पुराना तरीका (AdamW): वर्तमान AI ट्रेनर आमतौर पर AdamW नामक विधि का उपयोग करते हैं। कल्पना कीजिए कि AdamW एक ऐसे हाइकर (पदमचारी) की तरह है जिसके पास एक बहुत ही संवेदनशील कंपास है जो जमीन पर मौजूद हर छोटे कंकड़ पर प्रतिक्रिया करता है। एक सामान्य घाटी में, यह बहुत अच्छा है। लेकिन इस विशाल, सपाट पठार पर, वे "कंकड़" वास्तव में हवा से उत्पन्न होने वाला रैंडम शोर (noise) हैं। क्योंकि यह पठार बहुत बड़ा है (हजारों आयामों चौड़ा है), हाइकर इस शोर से घबरा जाता है। ढलान की ओर चलने के बजाय, हाइकर एक उन्मत्त, रैंडम नृत्य (ब्राउनियन मोशन) करने लगता है, और बहुत लंबे समय तक एक ही जगह पर फंसा रहता है। पठार जितना बड़ा होगा, वह उतना ही अधिक समय तक फंसा रहेगा।

नया समाधान: Muon ऑप्टिमाइज़र

यह पेपर एक नया ऑप्टिमाइज़र पेश करता है जिसे Muon कहा जाता है। Muon को एक ऐसे हाइकर के रूप में न सोचें जो हर कंकड़ पर प्रतिक्रिया देता है, बल्कि एक स्मार्ट, हाई-टेक ड्रोन के रूप में सोचें जो एक विशेष रडार से लैस है।

पेपर का दावा है कि Muon के पास एक सुपरपावर है: डायमेंशन-फ्री एस्केप (Dimension-Free Escape)

  • दावा: चाहे पठार कितना भी विशाल क्यों न हो (चाहे वह 1,000 मील चौड़ा हो या 1,000,000 मील चौड़ा), Muon बाहर निकलने का रास्ता खोज लेगा और लगभग उसी समय में बाहर निकल जाएगा। यह समस्या जितनी बड़ी होती है, उतना धीमा नहीं होता।
  • परिणाम: जबकि पुराना हाइकर (AdamW) एक विशाल सपाट मैदान को पार करने में वर्षों ले सकता है, Muon उसे सेकंडों में पार कर लेता है।

Muon कैसे काम करता है: "स्पेक्ट्रल शेपिंग" (Spectral Shaping) फ़िल्टर

पेपर बताता है कि Muon एक चालाक तकनीक का उपयोग करता है जिसमें एक 5वें क्रम का बहुपद (5th-order polynomial) शामिल है (एक जटिल गणितीय सूत्र) जो AI की सीखने की प्रक्रिया के लिए नॉइज़-कैंसलिंग हेडफ़ोन की तरह कार्य करता है।

  1. शोर बनाम सिग्नल (Noise vs. Signal): AI का रास्ता दो चीजों से बाधित होता है:
    • सिग्नल (Signal): ढलान की ओर जाने वाली वास्तविक दिशा (नेगेटिव कर्वेचर)।
    • शोर (Noise): विशाल मॉडल के आकार से उत्पन्न होने वाला रैंडम स्टैटिक और हस्तक्षेप।
  2. फ़िल्टर: Muon एक गणितीय फ़िल्टर लागू करता है जो शोर को दबाता (squash) है और सिग्नल को बढ़ाता (amplify) है।
    • कल्पना कीजिए कि शोर लोगों की भीड़ के चिल्लाने जैसा है। Muon का फ़िल्टर भीड़ की आवाज़ को धीमा करके फुसफुसाहट में बदल देता है।
    • कल्पना कीजिए कि सिग्नल स्पष्ट निर्देश देने वाले एक व्यक्ति की आवाज़ है। Muon का फ़िल्कर उस व्यक्ति की आवाज़ को लाउडस्पीकर में बदल देता है।
  3. "लॉक" (The Lock): एक बार जब शोर की तुलना में सिग्नल पर्याप्त तेज हो जाता है, तो Muon सही दिशा पर "लॉक" हो जाता है। यह डगमगाना बंद कर देता है और एक सीधी, बैलिस्टिक रेखा (जैसे एक गोली) में चलना शुरू कर देता है।

दो-चरणीय पलायन योजना (Two-Phase Escape Plan)

पेपर में Muon के पलायन को दो अलग-अलग चरणों में वर्णित किया गया है:

  • चरण 1: इनक्यूबेशन (सिग्नल का इंतजार करना): शुरुआत में, Muon अपनी गति (momentum) इकट्ठा कर रहा होता है। यह एक रॉकेट की तरह है जो लॉन्चपैड पर बैठा है, काउंटडाउन कर रहा है। यह सिग्नल को सुन रहा है, शोर को फ़िल्टर कर रहा है, और इंतजार कर रहा है कि "सिग्नल-टू-नॉइज़ रेशियो" (SNR) कितना उच्च हो जाए। इस चरण में थोड़ा समय लगता है, लेकिन यह केवल इसलिए लंबा नहीं होता क्योंकि क्षेत्र बड़ा है।
  • चरण 2: बैलिस्टिक इजेक्शन (लॉन्च): एक बार जब सिग्नल पर्याप्त मजबूत हो जाता है, तो Muon एक "फेज़ लॉक" ट्रिगर करता है। यह अचानक त्वरित (accelerate) हो जाता है। पेपर इसे "डिटरमिनिस्टिक O(1) बैलिस्टिक इजेक्शन" कहता है।
    • सरल अनुवाद: यह डगमगाना बंद कर देता है और सीधे जाल से बाहर निकल जाता है। बाहर निकलने में लगने वाला समय स्थिर (Constant/O(1)) हो जाता है, जिसका अर्थ है कि इससे कोई फर्क नहीं पड़ता कि क्षेत्र कितना विशाल है; बाहर निकलने का समय समान रहता है।

पुराना तरीका क्यों विफल होता है ("कर्स ऑफ डायमेंशन")

पेपर गणितीय रूप से सिद्ध करता है कि ये विशाल क्षेत्रों में पुराना तरीका (AdamW) क्यों विफल होता है।

  • उपमा: कल्पना कीजिए कि आप घास के ढेर में सुई खोजने की कोशिश कर रहे हैं।
    • AdamW घास के हर एक टुकड़े को व्यक्तिगत रूप से देखता है। जैसे-जैसे घास का ढेर बढ़ता है (अधिक आयाम), सुई को खोजना कठिन होता जाता है क्योंकि घास का शोर सुई को दबा देता है। खोजने में लगने वाला समय घास के ढेर के आकार के साथ बढ़ता जाता है।
    • Muon घास के ढेर के आकार को देखता है। वह समझ जाता है कि सुई एकमात्र ऐसी चीज़ है जो घास जैसी नहीं दिखती। वह घास को पूरी तरह से अनदेखा कर देता है और सुई को पकड़ लेता है। घास के ढेर का आकार मायने नहीं रखता; वह छोटे ढेर में भी उतनी ही तेजी से सुई ढूंढ लेता है जितनी तेजी से एक विशाल पहाड़ में।

वास्तविक दुनिया का प्रमाण

लेखकों ने केवल गणित नहीं किया; उन्होंने इसका परीक्षण भी किया:

  1. सिमुलेशन: उन्होंने विभिन्न आकारों के "सपाट क्षेत्र" बनाए। Muon उनसे तुरंत बाहर निकल गया, जबकि AdamW उनमें लंबे समय तक फंसा रहा, विशेष रूप से सबसे बड़े क्षेत्रों में।
  2. मैट्रिक्स फैक्टराइजेशन (Matrix Factorization): उन्होंने बड़े डेटा मैट्रिसेस को तोड़ने के कार्य पर इसका परीक्षण किया। Muon अचानक "जाग गया" और अपनी क्षमताओं (रैंक विस्तार) का विस्तार किया, जबकि AdamW बहुत धीरे-धीरे रेंगता रहा।
  3. वास्तविक AI प्रशिक्षण: उन्होंने एक वास्तविक लैंग्वेज मॉडल (LLaMA-160M) पर इसका परीक्षण किया। उन्होंने मॉडल के "मस्तिष्क" (वेट्स) के अंदर देखा और पाया कि Muon ऊबड़-खाबड़, ऊबड़-खाबड़ इलाके को सुव्यवस्थित (smooth) कर रहा था, जिससे मॉडल AdamW की तुलना में बहुत तेज़ी से और अधिक सुचारू रूप से कम एरर रेट की ओर फिसल सका।

सारांश

पेपर का दावा है कि Muon विशाल AI मॉडल को प्रशिक्षित करने में एक प्रमुख बाधा को हल करता है। जब मॉडल बहुत बड़े हो जाते हैं, तो वे सपाट, भ्रमित करने वाले परिदृश्यों में फंस जाते हैं। पुराने उपकरण (AdamW) समस्या के विशाल आकार से पंगु हो जाते हैं। Muon शोर को अनदेखा करने और वास्तविक दिशा को पकड़ने के लिए एक विशेष गणितीय फ़िल्टर का उपयोग करता है, जिससे यह इन जालों से तुरंत बाहर निकल पाता है, चाहे AI मॉडल कितना भी विशाल क्यों न हो। यह एक धीमी, रैंडम संघर्ष को एक तेज़, सीधी रेखा वाली दौड़ में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →