← नवीनतम पेपर
🤖 machine learning

Muonp^p: Muon with Fractional Spectral Powers

यह शोध पत्र Muonp^p को प्रस्तुत करता है, जो एक नवीन ऑप्टिमाइज़र है जो ग्रेडिएंट के सिंगुलर मानों (singular values) पर भिन्नात्मक स्पेक्ट्रल शक्तियों (fractional spectral powers) को लागू करके Muon और ग्रेडिएंट डिसेंट के बीच इंटरपोलेशन करता है, इन अपडेट्स को अनुमानित करने के लिए कुशल द्वै चर पुनरावृत्तियों (bivariate recurrences) का उपयोग करता है और मूल्यवान सिंगुलर स्पेक्ट्रम जानकारी को संरक्षित करते हुए बिलियन-स्केल मॉडलों की फाइनट्यूनिंग में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Yihe Dong, Will Sawin

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihe Dong, Will Sawin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, सुपर-स्मार्ट रोबोट (एक न्यूरल नेटवर्क) को बोलना, कोड लिखना या गणित की समस्याएँ हल करना सिखा रहे हैं। इसे सिखाने के लिए, आपको इसे उदाहरण दिखाने होंगे और इसकी गलतियों को सुधारना होगा। "ऑप्टिमाइज़र" (optimizer) वह शिक्षक पद्धति है जो यह तय करती है कि हर गलती के बाद रोबोट के मस्तिष्क में क्या बदलाव किए जाने चाहिए।

समस्या: "सब-या-कुछ-नहीं" वाला शिक्षक (Muon)

हाल ही में, एक लोकप्रिय शिक्षण पद्धति जिसे Muon कहा जाता है, प्रसिद्ध हुई। यह कैसे काम करती है, यहाँ बताया गया है:

कल्पना कीजिए कि रोबोट की गलतियाँ अलग-अलग "दिशाओं" या "आवृत्तियों" (frequencies) में आती हैं। कुछ दिशाएँ बहुत तेज़ और स्पष्ट होती हैं (dominant modes), जबकि अन्य धीमी फुसफुसाहट जैसी होती हैं (small singular values)।

  • पुराने शिक्षक (जैसे मानक ग्रेडिएंट डिसेंट) तेज़ दिशाओं पर चिल्लाते थे और धीमी आवाज़ों को नज़रअंदाज़ कर देते थे।
  • Muon ने एक "फ्लैट" (flat) शिक्षक बनने का निर्णय लिया। इसने सभी दिशाओं को देखा और कहा, "आइए हम उन सभी के साथ बिल्कुल एक जैसा व्यवहार करें!" इसने हर सुधार के वॉल्यूम को समतल कर दिया ताकि धीमी फुसफुसाहट को भी उतनी ही अटेंशन मिले जितनी तेज़ चीखों को मिलती है।

पकड़ (The Catch): हालांकि यह रोबोट को शुरुआत से सिखाने (pretraining) के लिए बहुत अच्छा है, लेकिन यह जानकारी का एक महत्वपूर्ण हिस्सा फेंक देता है: कि प्रत्येक दिशा वास्तव में कितनी मजबूत है। कभी-कभी, तेज़ दिशाएँ ही वे होती हैं जो वास्तव में मायने रखती हैं, और उन्हें फ्लैट करना एक सायरन की आवाज़ को कम करने जैसा है क्योंकि आप एक फुसफुसाहट सुनना चाहते हैं।

समाधान: "बिल्कुल सही" वाला शिक्षक (Muonp)

लेखकों ने इस शोध पत्र में Muonp पेश किया है। Muonp को एक ऐसे शिक्षक के रूप में सोचें जो "गोल्डिलॉक्स" (Goldilocks) ज़ोन (सही संतुलन) को खोज लेता है।

पूरी तरह से वॉल्यूम को फ्लैट करने के बजाय (Muon की तरह) या मूल तीव्रता को बनाए रखने के बजाय (मानक शिक्षकों की तरह), Muonp वॉल्यूम को बस थोड़ा सा कम करता है। यह एक गणितीय "डिमर स्विच" (जिसे p नामक संख्या द्वारा दर्शाया जाता है) का उपयोग करता है ताकि तेज़ दिशाओं की मूल शक्ति को कुछ हद तक बनाए रखा जा सके और साथ ही धीमी दिशाओं को बढ़ावा भी दिया जा सके।

  • यदि p = 0 है: तो यह मूल Muon है (पूर्ण सपाटपन/total flattening)।
  • यदि p = 1 है: तो यह मानक शिक्षक है (कोई बदलाव नहीं)।
  • यदि p बीच में कहीं है (जैसे 1/3): तो यह Muonp है। यह सुधारों के "आकार" को बनाए रखता है लेकिन उन्हें सुचारू (smooth) बनाता है।

कठिन हिस्सा: जादू की गणितीय ट्रिक

आप सोच सकते हैं, "ठीक है, बस वॉल्यूम को थोड़ा कम कर दो।" लेकिन विशाल मैट्रिसेस (रोबोट के मस्तिष्क) की दुनिया में, यह गणित करना अविश्वसनीय रूप से कठिन है। आमतौर पर, इन दिशाओं का वॉल्यूम बदलने के लिए, आपको मस्तिष्क के हर हिस्से को अलग करना पड़ता है, उसे मापना पड़ता है, और फिर वापस जोड़ना पड़ता है। यह धीमा और महंगा है।

लेखकों ने सिद्ध किया कि आप इस "वॉल्यूम डिमिंग" को एक सरल, एक-चरणीय रेसिपी के साथ नहीं कर सकते। आपको एक अधिक जटिल, दो-चरणीय रेसिपी की आवश्यकता है जो मूल मस्तिष्क संरचना को याद रखते हुए वॉल्यूम को समायोजित करती है।

उन्होंने एक नई, तेज़ रेसिपी (जिसे "बाइवेरियेट पॉलिनोमियल रिकरेंस" कहा जाता है) का आविष्कार किया जो एक जादु적인 शॉर्टकट की तरह काम करती है। यह कंप्यूटर को इन "डिम्ड" (dimmed) सुधारों को केवल मानक मैट्रिक्स गुणन (matrix multiplication) का उपयोग करके गणना करने की अनुमति देता है—वही तेज़ गणितीय चिप्स (GPUs) जिनके लिए कंप्यूटर पहले से ही बने हुए हैं। इसका मतलब है कि Muonp, Muon जितना ही तेज़ है, लेकिन अधिक स्मार्ट है।

उन्होंने क्या पाया: यह काम पर निर्भर करता है

इस शोध पत्र ने अरबों-पैमाने के मॉडलों पर इस नए शिक्षक का परीक्षण किया और एक दिलचस्प विभाजन पाया:

  1. नया मस्तिष्क बनाना (Pretraining):
    यदि आप एक रोबोट को शुरू से सिखा रहे हैं, तो "फ्लैट" शिक्षक (Muon) वास्तव में बेहतर है। आप एक मजबूत नींव बनाने के लिए हर संभव दिशा को समान रूप से खोजना चाहते हैं। Muonp, जो पुरानी "तेज़" दिशाओं को थामे रखता है, यहाँ थोड़ा कम प्रभावी था।

  2. एक विशेषज्ञ को फाइन-ट्यून करना (Finetuning):
    यदि आप एक रोबोट जो पहले से ही स्मार्ट है, उसे एक विशिष्ट नया कौशल (जैसे कोडिंग या गणित) सिखाते हैं, तो Muonp विजेता है।

    • क्यों? इस चरण तक, रोबोट पहले से ही बुनियादी बातें जानता है। "तेज़" दिशाएँ वे हैं जो नए कार्य के लिए महत्वपूर्ण हैं। Muonp उन महत्वपूर्ण दिशाओं पर ध्यान केंद्रित रखता है जबकि धीमी दिशाओं की भी मदद करता है।
    • परिणाम: गणितीय तर्क, कोडिंग और भाषा को समझने जैसे कार्यों पर, Muonp ने रोबोट को पुराने Muon और मानक शिक्षकों दोनों की तुलना में अधिक स्मार्ट, तेज़ और सटीक बनाया।

"करिकुलम" (Curriculum) का विचार

लेखकों ने एक चतुर ट्रिक भी आजमाई: उन्होंने अधिकांश प्रशिक्षण के लिए "फ्लैट" शिक्षक (Muon) का उपयोग किया, और फिर प्रशिक्षण के अंतिम कुछ चरणों के लिए "डिमर" शिक्षक (Muonp) पर स्विच कर दिया। यह अद्भुत रूप से काम कर गया। यह एक छात्र को बुनियादी बातें एक व्यापक ब्रश से सिखाने और फिर अंतिम विवरणों के लिए एक बारीक टिप वाले पेन पर स्विच करने जैसा है।

सारांश

Muonp लोकप्रिय Muon ऑप्टिमाइज़र का एक स्मार्ट और अधिक लचीला संस्करण है। यह सभी सीखने की दिशाओं को समान होने के लिए मजबूर नहीं करता है; इसके बजाय, यह उनके महत्व को धीरे से समायोजित करता है।

  • गणित: यह इन समायोजनों की गणना करने के लिए एक चतुर, तेज़ शॉर्टकट का उपयोग करता है जिससे कंप्यूटर धीमा नहीं होता है।
  • परिणाम: यह बड़े AI मॉडलों को फाइन-ट्यून करने के लिए सबसे अच्छा उपकरण है, जो उन्हें कोडिंग और गणित जैसे विशिष्ट कौशल को पहले से बेहतर तरीके से मास्टर करने में मदद करता है। हालाँकि, शुरुआत से प्रशिक्षण (training from scratch) के लिए, मूल "फ्लैट" Muon अभी भी चैंपियन है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →