← नवीनतम पेपर
🤖 machine learning

Approximate Muon with low-rank adapters

यह शोध पत्र sMuon को प्रस्तुत करता है, जो लो-रैंक पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग के लिए ऑब्जेक्टिव को लीनियराइज़ करके और इसे लीस्ट-स्क्वेयर्स के माध्यम से हल करके Muon ऑप्टिमाइज़र का अनुमान लगाने वाली एक कुशल विधि है, जिससे SFT और ReLoRA प्रीट्रेनिंग जैसे परिवेशों में Muon के प्रदर्शन लाभों को सक्षम बनाया जा सके जहाँ यह पहले LoRA के साथ असंगत था।

मूल लेखक: Ben Anson, Conor Houghton, Edward Milsom

प्रकाशित 2026-08-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ben Anson, Conor Houghton, Edward Milsom

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट को एक नया कौशल सिखाने की कोशिश कर रहे हैं, जैसे कि कविता लिखना या गणित की समस्याओं को हल करना। आप रोबोट के पूरे मस्तिष्क को शुरू से फिर से प्रशिक्षित (retrain) नहीं करना चाहते क्योंकि इसमें बहुत समय लगता है और भारी लागत आती है। इसके बजाय, आप उसके मौजूदा मस्तिष्क से एक छोटा, हल्का "प्रशिक्षण मॉड्यूल" (training module) जोड़ना चाहते हैं। इसे पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग (PEFT) कहा जाता है। इसे एक सामान्य-उद्देश्य वाले रोबोट पर एक विशेष हेडसेट लगाने की तरह समझें; हेडसेट उसे नया कौशल सिखाता है बिना रोबोट के मुख्य हार्डवेयर को बदले।

इन हेडसेट्स को बनाने का एक लोकप्रिय तरीका LoRA (लो-रैंक अडैप्टेशन) है। यह दो पतली, सपाट कागज़ की शीटों की तरह है जिन्हें जब एक के ऊपर एक रखा जाता है, तो वे नए कौशल का आकार बना लेती हैं। रोबोट को सिखाने के लिए, हमें एक ऑप्टिमाइज़र (optimizer) की आवश्यकता होती है—एक गणितीय कोच जो हेडसेट को बताता है कि बेहतर बनने के लिए अपने आकार को कैसे समायोजित किया जाए। सबसे सामान्य कोच को AdamW कहा जाता है, लेकिन एक नया और अधिक शक्तिशाली कोच है जिसे Muon कहा जाता है। Muon अपनी दक्षता के लिए प्रसिद्ध है जब यह प्रीट्रेनिंग (रोबोट को उसके पहले पाठ शुरू से सिखाना) कर रहा होता है। यह सुनिश्चित करके काम करता है कि रोबोट के मस्तिष्क के अपडेट पूरी तरह से संतुलित, "ऑर्थोगोनल" (orthogonal) तरीके से हों, जैसे कि एक नर्तक बिना डगमगाए एक पैर पर पूरी तरह से घूम रहा हो।

हालाँकि, एक समस्या है। जब आप LoRA हेडसेट को प्रशिक्षित करने के लिए Muon का उपयोग करने की कोशिश करते हैं, तो गणित विफल हो जाता है। Muon पूरे रोबोट के मस्तिष्क की परत (layer) को संतुलित करना चाहता है, लेकिन LoRA हेडसेट उस परत का केवल एक छोटा, लो-रैंक हिस्सा है। यह एक ऑर्केस्ट्रा के पूरे हिस्से को निर्देशित करने के लिए एक कंडक्टर की छड़ी का उपयोग करने जैसा है ताकि वह एक एकल वायलिन वादक को इस तरह से निर्देशित कर सके जो पूरे ऑर्केस्ट्रा के लिए तर्कसंगत हो; इसकी ज्यामिति (geometry) फिट नहीं बैठती। मानक समाधान यह रहा है कि ऑर्केस्ट्रा को अनदेखा कर दिया जाए और बस वायलिन वादक को अपने स्वयं के आधार पर घूमने के लिए कहा जाए, लेकिन इससे Muon का जादू खत्म हो जाता है। यह शोध पत्र पूछता है: क्या हम एक ऐसा तरीका खोज सकते हैं जिससे गणित टूटे बिना या गति धीमी हुए बिना Muon को इन छोटे हेडसेट्स के लिए काम करने के योग्य बनाया जा सके?

लेखक, बेन एनसन, कॉनोर हॉटन और एडवर्ड मिल्सम कहते हैं, हाँ। वे एक नई विधि पेश करते हैं जिसे sMuon (स्मॉल Muon) कहा जाता है। असंभव को थोपने के बजाय, वे एक चतुर गणितीय चाल का उपयोग करते हैं: वे समस्या को "लीनियराइज़" (linearize) करते हैं। कल्पना कीजिए कि आप एक विशाल, डगमगाते छाते को पकड़े हुए एक रस्सी पर चलने की कोशिश कर रहे हैं। पूरे छाते को एक साथ संतुलित करने के बजाय, आप एक पल के लिए मान लेते हैं कि छाता सिर्फ एक सीधी छड़ी है, एक आदर्श कदम की गणना करते हैं, और फिर समायोजन करते हैं। ऐसा करके, वे LoRA हेडसेट को अपडेट करने का सबसे अच्छा तरीका पाते हैं जो पूर्ण Muon नृत्य का अनुमान (approximate) लगाता है।

शोध पत्र में पाया गया है कि यह नया sMuon विधि आश्चर्यजनक रूप से अच्छा काम करती है। जब उन्होंने विभिन्न भाषा मॉडलों पर इसका परीक्षण किया, तो sMuon ने अक्सर मानक AdamW कोच और अन्य Muon प्रयासों से बेहतर प्रदर्शन किया। यह विशेष रूप से तब प्रभावशाली था जब इसे एक ऐसे रोबोट पर उपयोग किया गया जिसे पहले ही Muon के साथ प्री-ट्रेन किया गया था (जिसे Moonlight कहा जाता है), जहाँ sMuon ने ग्यारह में से छह अलग-अलग कार्यों में शीर्ष स्कोर प्राप्त किया। एक प्री-ट्रेनिंग प्रयोग में, sMuong ने त्रुटि दर को कम करने में अपने निकटतम प्रतिद्वंद्वी, एक विधि जिसे Riemannion कहा जाता है, के साथ बराबरी की, लेकिन इसने यह लगभग 30% तेज़ी से किया।

महत्वपूर्ण रूप से, लेखक दिखाते हैं कि उनकी विधि न केवल एक सैद्धांतिक विचार है, बल्कि व्यावहारिक भी है। जबकि अन्य उन्नत विधियों के लिए भारी, धीमी गणनाओं (जैसे जटिल मैट्रिसेस को खोलना और फिर से असेंबल करना) की आवश्यकता होती है, sMuon लगभग पूरी तरह से सरल मैट्रिक्स गुणन (matrix multiplications) पर निर्भर करता है—वह गणित जिसे आधुनिक कंप्यूटर चिप्स बिजली की गति से करने के लिए बनाए गए हैं। इसका मतलब है कि sMuon इतना तेज़ है कि इसे प्रक्रिया को धीमा किए बिना वास्तविक दुनिया के प्रशिक्षण में उपयोग किया जा सकता है। शोध पत्र सुझाव देता है कि पूरी परत की ज्यामिति का सम्मान करके, बजाय इसके कि LoRA के हिस्सों को अलग, असंबंधित टुकड़ों के रूप में माना जाए, हम बहुत कम अतिरिक्त लागत के साथ महत्वपूर्ण प्रदर्शन वृद्धि प्राप्त कर सकते हैं। यह एक याद दिलाता है कि कभी-कभी, एक विशाल रोबोट को नया कौशल सिखाने का सबसे अच्छा तरीका उसे एक छोटा, स्मार्ट और गणितीय रूप से सुरुचिपूर्ण धक्का देना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →