← नवीनतम पेपर
🤖 AI

LoRA-Muon: Spectral Steepest Descent on the Low-Rank Manifold

यह शोध पत्र LoRA-Muon को प्रस्तुत करता है, जो एक मेमोरी-कुशल ऑप्टिमाइज़र है जो लो-रैंक मैनिफोल्ड (low-rank manifold) के लिए Muon के स्पेक्ट्रल स्टीपेस्ट-डिसेन्ट नियम को अनुकूलित करता है, जो लर्निंग रेट्स की बेहतर ट्रांसफ़रेबिलिटी और ऐसा प्रदर्शन प्रदर्शित करता है जो अक्सर QR डिकंपोज़िशन या सेकंड-मोमेंट स्टोरेज की आवश्यकता के बिना डेंस बेसलाइन्स से भी बेहतर होता है।

मूल लेखक: Franz Louis Cesista, Katherine Crowson, Cédric Simal, Stella Biderman

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Franz Louis Cesista, Katherine Crowson, Cédric Simal, Stella Biderman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोट (एक डीप लर्निंग मॉडल) को एक नया कौशल सिखाने की कोशिश कर रहे हैं। आमतौर पर, आपको रोबोट के पूरे मस्तिष्क को फिर से लिखना पड़ता है, जिसमें बहुत अधिक समय और ऊर्जा लगती है। LoRA (लो-रैंक अडैप्टेशन) एक छोटे, अलग होने योग्य नोटबुक देने जैसा है, न कि उसके मस्तिष्क को फिर से लिखने जैसा। यह बहुत तेज़ और सस्ता है, लेकिन इसमें एक पेच है: इसे ट्यून करना बेहद कठिन है। यदि आप "लर्निंग नॉब" (लर्निंग रेट) को गलत दिशा में घुमाते हैं, तो रोबोट भ्रमित हो जाता है और नोटबुक के पन्ने (फैक्टर्स) तालमेल से बाहर हो जाते हैं।

यह शोध पत्र इस नए, स्मार्ट तरीके को पेश करता है जिससे आप उस नॉब को घुमा सकते हैं, जिसे LoRA-Muon कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "दो व्यक्तियों वाली नाव"

सोचिए कि LoRA नोटबुक एक एकल ब्लॉक नहीं है, बल्कि दो व्यक्तियों (फैक्टर A और फैक्टर B) से बनी एक नाव है जो नाव (वेट मैट्रिक्स WW) को चलाने के लिए मिलकर चप्पू चला रहे हैं।

  • पुराना तरीका (AdamW): कोच (ऑप्टिमाइज़र) व्यक्ति A और व्यक्ति B को स्वतंत्र रूप से चप्पू चलाने के लिए कहता है। यदि व्यक्ति A थक जाता है और व्यक्ति B उत्साहित हो जाता है, तो वे अलग-अलग दिशाओं में चप्पू चलाने लगते हैं। नाव गोल-गोल घूमने लगती है, और टीम विफल हो जाती है।
  • समस्या: कोच को उन्हें कितनी गति से चप्पू चलाने के लिए कहना चाहिए, यह इस बात पर निर्भर करता है कि नाव कितनी बड़ी है या उन दोनों व्यक्तियों का आकार क्या है। यदि आप नाव का आकार (रैंक) या लोगों का आकार (विड्थ) बदलते हैं, तो आपको फिर से शून्य से सही गति सीखनी पड़ती है।

2. समाधान: "घोस्ट बोट" (LoRA-Muon)

लेखकों ने महसूस किया कि दोनों व्यक्तियों को अलग-अलग कोचिंग देने के बजाय, उन्हें एक पूर्ण आकार के जहाज के रूप में स्वयं नाव को कोचिंग देनी चाहिए और फिर उस निर्देश को वापस दोनों व्यक्तियों पर प्रोजेक्ट करना चाहिए।

  • उपमा: एक "घोस्ट बोट" (भूतिया नाव) की कल्पना करें जो पानी में तैर रही है और जो रोबोट के पूर्ण-आकार के मस्तिष्क के आदर्श संस्करण का प्रतिनिधित्व करती है। Muon ऑप्टिमाइज़र एक कोच है जो एक विशेष "स्पेक्ट्रल" नियम (नीचे की ओर सबसे तीव्र, सबसे कुशल पथ खोजने का एक ज्यामितीय तरीका) का उपयोग करके इस घोस्ट बोट को स्टीयर करने का सटीक तरीका जानता है।
  • जादू: LoRA-Muon पूछता है, "यदि हम घोस्ट बोट को स्टीयर कर रहे होते, तो हम क्या करते?" यह उस आदर्श चाल की गणना करता है, और फिर उस चाल को व्यक्ति A और व्यक्ति B के बीच विभाजित करता है ताकि वे पूरी तरह से संरेखित (aligned) रहें।
  • परिणाम: क्योंकि वे घोस्ट बोट के पथ का अनुसरण कर रहे हैं, वे कभी भी तालमेल से बाहर नहीं होते। भले ही आप नाव या लोगों का आकार बदल दें, "घोस्ट बोट" उन्हें बिल्कुल वही गति बताती है। इसका मतलब है कि लर्निंग रेट विभिन्न आकारों और आकृतियों में पूरी तरह से ट्रांसफर होता है।

3. "स्प्लिट वेट डिके" ट्रिक

पुराने तरीके में, यदि आप नाव को थोड़ा छोटा करने की कोशिश करते हैं ताकि वह बहुत भारी न हो जाए (वेट डिके), तो आप गलती से व्यक्ति A और व्यक्ति B को अलग-अलग आकार दे सकते हैं, जिससे नाव झुक सकती है।

  • LoRA-Muon का समाधान: उन्होंने एक "स्प्लिट वेट डिके" नियम का आविष्कार किया। यह एक जादुई इलास्टिक बैंड की तरह है जो दोनों व्यक्तियों को एक साथ, पूर्ण सामंजस्य में खींचता और सिकोड़ता है, यह सुनिश्चित करता है कि नाव सीधी रहे और गणित बिल्कुल वैसा ही काम करे जैसा कि एक पूर्ण आकार के जहाज के लिए होता है।

4. यह प्रतिस्पर्धा से बेहतर क्यों है?

यह शोध पत्र इसकी तुलना दो अन्य विधियों से करता है: Spectron और LoRA-RITE

  • Spectron: यह एक ऐसे कोच की तरह है जो यह देखने के लिए देखता है कि व्यक्ति A और व्यक्ति B अभी कितने थके हुए हैं ताकि गति तय की जा सके। यदि आप गलती से व्यक्ति A को व्यक्ति B की तुलना में दोगुना बड़ा बना देते (गेज स्केलिंग इश्यू), तो Spectron भ्रमित हो जाता है और गति बदल देता है। यह मनमाने विकल्पों के प्रति संवेदनशील है।
  • LoRA-RITE: यह वास्तव में LoRA-Muon जैसा ही काम कर रहा है, लेकिन यह एक बहुत ही जटिल, भारी सेट के टूल्स (QR डिकम्पोज़िशन) का उपयोग कर रहा है। यह एक अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा है।
  • LoRA-Muon: यह ठीक वही स्मार्ट स्टीयरिंग करता है जो LoRA-RITE करता है, लेकिन यह एक हल्के, तेज़ टूल का उपयोग करता है। इसे काम करने के लिए भारी हथौड़े की आवश्यकता नहीं है, जिससे यह कंप्यूटरों के लिए तेज़ और कम मेमोरी लेने वाला बन जाता है।

5. प्रमाण: टिनी शेक्सपियर (Tiny Shakespeare)

लेखकों ने एक छोटे कार्य पर इसका परीक्षण किया: एक रोबोट को "टाइनी शेक्सपियर" (शेक्सपियर के नाटकों का एक छोटा डेटासेट) लिखना सिखाना।

  • रैंक 2 (छोटा नोटबुक): यहाँ तक कि एक बहुत छोटे नोटबुक (रैंक 2) के साथ भी, LoRA-Muon ने ठीक वही सटीक गति पाई जो एक विशाल, पूर्ण आकार के रोबोट की थी।
  • रैंक 32 (मध्यम नोटबुक): थोड़े बड़े नोटबुक के साथ, LoLO-Muon ने वास्तव में पूर्ण आकार के रोबोट से बेहतर प्रदर्शन किया, और औसत रूप से कम त्रुटि दर प्राप्त की।
  • "गेज" टेस्ट: उन्होंने जानबूझकर व्यक्ति A और व्यक्ति B के शुरुआती आकार के साथ छेड़छाड़ की। पुराने तरीकों (Spectron) ने भ्रम पैदा किया और खराब प्रदर्शन किया। LoRA-Muon ने उस गड़बड़ी पर ध्यान भी नहीं दिया; यह बिना रुके सीधा चलता रहा।

निचोड़ (The Bottom Line)

LoRA-Muon AI मॉडल को प्रशिक्षित करने का एक नया तरीका है जो मॉडल के "नोटबुक" संस्करण के साथ वैसा ही व्यवहार करता है जैसे कि वह "पूर्ण मस्तिष्क" संस्करण हो। यह इसे सक्षम बनाता है:

  1. नोटबुक के आकार या स्केल से कभी भ्रमित न होने के लिए।
  2. छोटे नोटबुक के लिए भी वही स्पीड सेटिंग्स का उपयोग करने के लिए, जैसा कि विशाल नोटबुक्स के लिए किया जाता है।
  3. पिछले स्मार्ट तरीकों की तुलना में तेज़ चलने और कम मेमोरी का उपयोग करने के लिए।

यह एक छोटे AI नोटबुक को ट्यून करने की कठिन कला को एक सरल, विश्वसनीय प्रक्रिया में बदल देता है जो बस काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →