← नवीनतम पेपर
🤖 machine learning

How Much Orthogonalization Does Muon Need?

यह शोध पत्र प्रदर्शित करता है कि एक कम लागत वाला, पांच-चरणीय क्यूबिक न्यूटन-शुलज़ ऑर्थोगोनलाइजेशन शेड्यूल अधिक महंगे म्यूऑन (Muon) वेरिएंट के तुलनीय प्रशिक्षण गुणवत्ता प्राप्त करता है, जो यह प्रकट करता है कि प्रभावी न्यूरल नेटवर्क प्रशिक्षण के लिए उच्च पोलर-डिकंपोजिशन सटीकता का सख्ती से आवश्यक होना अनिवार्य नहीं है।

मूल लेखक: Hua Huang

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hua Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल रोबोट (एक न्यूरल नेटवर्क) को एक नया काम करना सिखाने की कोशिश कर रहे हैं। इसे सीखने में मदद करने के लिए, आप इसे एक "मोमेंटम" अपडेट देते हैं—एक ऐसा धक्का जो उसके पिछले अनुभव के आधार पर उस दिशा में है जिसे वह सही समझता है। हालाँकि, कभी-कभी यह धक्का अव्यवस्थित या "तिरछा" (skewed) हो जाता है, जैसे एक कार जो फिसलन भरी सड़क पर मुड़ने की कोशिश कर रही हो जहाँ पहिए अलग-अलग दिशाओं में घूम रहे हों।

Muon ऑप्टिमाइज़र एक ऐसा टूल है जो इन अव्यवस्थित धक्कों को ठीक करने के लिए बनाया गया है। यह उस तिरछे अपडेट को "सीधा" करता है ताकि रोबोट कुशलता से आगे बढ़ सके। गणितीय रूप से, इस सीधा करने की प्रक्रिया को ऑर्थोगोनलाइज़ेशन (orthogonalization) कहा जाता है। इसे ऐसे समझें जैसे कागज के एक मुड़े हुए टुकड़े को लेकर उसे पूरी तरह सीधा और समकोण (perpendicular) करने के लिए प्रेस करना।

समस्या: "इस्त्री" (Ironing) कितनी सटीक होनी चाहिए?

यह पेपर एक बहुत ही व्यावहारिक सवाल पूछता है: हमें इन अपडेट्स को कितनी सटीकता से सीधा करने की आवश्यकता है?

गणित की दुनिया में, मैट्रिक्स को सीधा करने के कुछ "परफेक्ट" तरीके हैं (जैसे कि एक उच्च-स्तरीय, महंगा आयरन/प्रेस जो बहुत समय लेता है)। मानक Muon विधि एक जटिल, 5-चरणीय प्रक्रिया (जिसे "क्विंटिक" विधि कहा जाता है) का उपयोग करती है ताकि अपडेट को बहुत सटीक रूप से सीधा किया जा सके। यह एक पेशेवर स्टीम आयरन का उपयोग करने जैसा है: यह कागज को पूरी तरह सपाट करने के लिए 15 बार फेर (passes) लेता है।

लेखकों ने सोचा: क्या हमें वास्तव में इसे इतना परफेक्ट बनाने की आवश्यकता है? या क्या हम थोड़े तेज़, सस्ते तरीके से भी रोबोट को उतना ही अच्छा सीखने में मदद कर सकते हैं?

समाधान: "क्यूबिक" शॉर्टकट

लेखकों ने एक नई, सरल विधि विकसित की जिसे Cubic5 कहा जाता है।

  • पुराना तरीका (Muon-Jordan): एक जटिल 5-चरणीय फॉर्मूला का उपयोग करता है जिसमें अपडेट को सीधा करने के लिए 15 भारी गणनाएँ (मैट्रिक्स गुणा) आवश्यक होती हैं।
  • नया तरीका (Cubic5): एक सरल 5-चरणीय फॉर्मूला का उपयोग करता है जिसमें केवल 10 भारी गणनाएँ आवश्यक होती हैं।

इसे इस तरह सोचें:

  • पुराना तरीका एक नक्शे को सावधानी से मोड़ने के लिए 15 लोगों की टीम को काम पर रखने जैसा है।
  • नया तरीका 10 लोगों को काम पर रखने जैसा है जो नक्शे को लगभग उतना ही अच्छा मोड़ते हैं, लेकिन कम समय में।

उन्होंने इस नई विधि को यह महसूस करते हुए विकसित किया कि AI के प्रशिक्षण के लिए, "धक्का" (nudge) आखिरी दशमलव बिंदु तक गणितीय रूप से एकदम सटीक होने की आवश्यकता नहीं है। इसे बस "पर्याप्त अच्छा" होना चाहिए ताकि रोबोट प्रभावी ढंग से सीख सके। उन्होंने एक "शिथिल लक्ष्य" (relaxed target) निर्धारित किया: जब तक अपडेट मोटे तौर पर सीधा है, रोबोट ठीक से सीख जाएगा।

उन्होंने क्या पाया: "पर्याप्त अच्छा" वास्तव में बहुत बढ़िया है

शोधकर्ताओं ने अपने नए "Cubic5" विधि का परीक्षण पुराने "परफेक्ट" तरीकों और यहाँ तक कि एक सैद्धांतिक "परफेक्ट" विधि (एक बहुत सटीक गणितीय उपकरण जिसे SVD कहा जाता है) के विरुद्ध विभिन्न AI मॉडल पर किया, जिनमें छोटे मॉडल (जैसे GPT-2) से लेकर बहुत बड़े मॉडल (अरबों पैरामीटर वाले) शामिल थे।

यहाँ उनकी खोजें दी गई हैं:

  1. प्रशिक्षण की गुणवत्ता समान है: चाहे उन्होंने महंगी 15-चरणीय विधि का उपयोग किया हो, नई 10-चरणीय विधि का, या यहाँ तक कि उस सुपर-सटीक गणितीय उपकरण का, AI मॉडल लगभग एक समान मात्रा में ही सीख पाए। अंतिम "स्कोर" (वैलिडेशन लॉस) लगभग एक जैसा था।
  2. अधिक स्टेप्स का मतलब हमेशा बेहतर नहीं होता: आश्चर्यजनक रूप से, "परफेक्ट" विधि में अधिक स्टेप्स जोड़ने से हमेशा AI बेहतर नहीं सीखा। कभी-कभी, सरल विधि भी उतना ही अच्छा काम करती थी।
  3. "इस्त्री" (Ironing) को परफेक्ट होने की ज़रूरत नहीं है: सबसे महत्वपूर्ण खोज यह थी कि AI को इससे फर्क नहीं पड़ता कि अपडेट गणितीय रूप से "परफेक्ट" है या नहीं। उसे इससे फर्क पड़ता है कि अपडेट उपयोगी है। नया, सस्ता तरीका अपडेट को बस इतना आकार देता है कि AI सीख सके, बिना अनावश्यक सटीकता पर समय बर्बाद किए।

निचोड़ (The Bottom Line)

पेपर यह निष्कर्ष निकालता है कि Muon को अच्छी तरह से काम करने के लिए पूरी तरह से ऑर्थोगोनल होने की आवश्यकता नहीं है।

नई Cubic5 विधि एक "कम लागत वाला" विकल्प है। यह अपडेट को सीधा करने के लिए आवश्यक भारी काम (computational work) में लगभग एक-तिहाई की बचत करती है, जबकि परिणाम महंगे तरीकों के लगभग समान ही प्राप्त होते हैं।

रोजमर्रा की भाषा में: यदि आप केक बना रहे हैं, तो पुराना तरीका माइक्रोग्राम तक मापने के लिए लेजर स्केल से आटा मापने जैसा था। नया तरीका एक मानक मापने वाले कप का उपयोग करने जैसा है। पेपर यह सिद्ध करता है कि इस विशिष्ट रेसिपी (AI ट्रेनिंग) के लिए, मानक कप लेजर स्केल जितना ही अच्छा काम करता है, लेकिन यह बहुत तेज़ और आसान है। यह AI को अंतिम परिणाम की गुणवत्ता से समझौता किए बिना तेज़ी से प्रशिक्षित करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →