← नवीनतम पेपर
🤖 machine learning

Can Muon Fine-tune Adam-Pretrained Models?

यह शोध पत्र प्री-ट्रेन्ड मॉडल्स की फाइन-ट्यूनिंग के लिए Adam से Muon पर स्विच करने के कारण होने वाले प्रदर्शन ह्रास (performance degradation) की जांच करता है, जो यह प्रदर्शित करता है कि परिणामी ऑप्टिमाइज़र मिसमैच (optimizer mismatch) सीखे गए ज्ञान को बाधित करता है और इसे LoRA जैसे तरीकों के माध्यम से अपडेट स्ट्रेंथ को सीमित करके प्रभावी ढंग से कम किया जा सकता है।

मूल लेखक: Xingyu Qu, Peigeng Huang, Samuel Horvath

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingyu Qu, Peigeng Huang, Samuel Horvath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: काम के लिए "गलत औज़ार"

कल्पना कीजिए कि आपके पास एक अत्यधिक कुशल कारीगर (AI मॉडल) है जिसने एक विशिष्ट सेट के औजारों का उपयोग करके वर्षों तक एक शिल्प सीखा है: एक हथौड़ा और छेनी (यह Adam ऑप्टिमाइज़र है)। उन्होंने एक सुंदर, जटिल मूर्ति (प्री-ट्रेंड मॉडल) बनाई है जो बोलना, लिखना और तर्क करना जानती है।

अब, एक नया, तेज़ और अधिक कुशल औज़ार आता है: एक लेज़र कटर (यह Muon ऑप्टिमाइज़र है)। इस पेपर के लेखकों ने यह देखना चाहा कि क्या वे उस मूर्ति को 'फाइन-ट्यून' (छोटे बदलाव करने) के लिए इस लेज़र कटर का उपयोग कर सकते हैं जिसे कारीगर ने हथौड़े से बनाया था।

खोज: जब उन्होंने हथौड़े से बनी मूर्ति पर लेज़र कटर का उपयोग करने की कोशिश की, तो परिणाम बहुत खराब रहे। मूर्ति टूटने लगी, अपना आकार खोने लगी, या पहले की तुलना में खराब प्रदर्शन करने लगी।

क्यों? पेपर बताता है कि हथौड़ा और लेज़र कटर अलग-अलग तरह से "सोचते" हैं।

  • हथौड़ा (Adam) व्यक्तिगत, सूक्ष्म समायोजन (जैसे एक बार में लकड़ी के एक दाने को छीलना) के आधार पर संरचनाएं बनाता है।
  • लेज़र (Muon) पूरे ब्लॉक को देखता है और एक ही बार में पूरी सतह को चिकना (smooth) करके संरचनाएं बनाता है।

जब आप हथौड़े द्वारा बनाई गई संरचना पर लेज़र का उपयोग करते हैं, तो लेज़र के "चिकने" समायोजन मूल कार्य की "छिलनी हुई" बनावट से टकराते हैं। इस टकराव को ऑप्टिमाइज़र मिसमैच (optimizer mismatch) कहा जाता है। यह मॉडल द्वारा पहले से सीखे गए ज्ञान को बाधित करता है, जिससे वह चीजों को "भूलने" लगता है या खराब प्रदर्शन करने लगता है।

समाधान: "स्टिकी नोट" विधि (LoRA)

लेखकों ने पूछा: क्या कोई ऐसा तरीका है जिससे हम हथौड़े से बनी मूर्ति को तोड़े बिना लेज़र कटर का उपयोग कर सकें?

उन्हें इसका उत्तर LoRA (लो-रैंक अडैप्टेशन) नामक तकनीक में मिला।

उपमा (Analogy):
मूल पत्थर की मूर्ति में सीधे न तराशने के बजाय (फुल फाइन-ट्यूनिंग), कल्पना करें कि आप मूर्ति के ऊपर एक साफ, लचीली प्लास्टिक की शीट (LoRA) लेते हैं और उसे ऊपर चिपका देते हैं।

  • आप मूल पत्थर की मूर्ति को बिल्कुल वैसा ही छोड़ देते हैं जैसा वह है (फ्रोज़न)।
  • आप केवल प्लास्टिक की शीट पर अपने नए बदलाव तराशते हैं।
  • लेज़र कटर (Muon) प्लास्टिक की शीट पर काम करता है।

यह क्यों काम करता है:
क्योंकि लेज़र कटर केवल नई प्लास्टिक शीट को छू रहा है, उसे नीचे की पत्थर की पुरानी हथौड़े-से-छिली हुई बनावट से लड़ने की ज़रूरत नहीं है। प्लास्टिक की शीट इतनी लचीली है कि वह आधार को तोड़े बिना लेज़र की शैली के अनुकूल हो सकती है।

पेपर दिखाता है कि जब उन्होंने इस "प्लास्टिक शीट" विधि (LoRA) के साथ लेज़र कटर (Muon) का उपयोग किया, तो परिणाम उतने ही अच्छे थे, या कभी-कभी हथौड़े (Adam) का उपयोग करने से भी बेहतर थे। मिसमैच की समस्या समाप्त हो गई।

सरल भाषा में मुख्य निष्कर्ष

  1. मिसमैच वास्तविक है: यदि आप Adam से प्रशिक्षित मॉडल लेते हैं और उसे सीधे Muon के साथ फाइन-ट्यून करने की कोशिश करते हैं, तो यह और खराब हो जाता है। यह एक ऐसी कार चलाने की तरह है जिसका स्टीयरिंग व्हील दूसरी कार के लिए डिज़ाइन किया गया है; कार ठीक से नहीं चलेगी।
  2. "प्लास्टिक शीट" इसे ठीक करती है: LoRA (प्लास्टिक शीट) का उपयोग करके, Muon Adam-प्रशिक्षित मॉडलों को प्रभावी ढंग से फाइन-ट्यून कर सकता है। दोनों विधियों के बीच का प्रदर्शन अंतर खत्म हो जाता है।
  3. कम ही अधिक है: पेपर ने पाया कि आप मूल मॉडल को जितना अधिक बदलने की कोशिश करेंगे, मिसमैच उतना ही अधिक नुकसान पहुँचाएगा। आप जितना कम बदलते हैं (पतली प्लास्टिक शीट/LoRA का उपयोग करके), लेज़र कटर उतना ही बेहतर काम करता है।
  4. कम भूलना: जब लेज़र कटर ने सीधे पत्थर में नक्काशी करने की कोशिश की (फुल फाइन-ट्यूनिंग), तो मॉडल अपने मूल ज्ञान (जैसे गणित या सामान्य ज्ञान) को "भूल" गया। प्लास्टिक शीट (LoRA) का उपयोग करने पर, मॉडल अपने मूल कौशल को बहुत बेहतर तरीके से याद रखता है।
  5. दक्षता (Efficiency): Muon पहले से ही प्रारंभिक प्रशिक्षण चरण के दौरान Adam की तुलना में तेज़ और कम मेमोरी का उपयोग करने के लिए जाना जाता है। यह पेपर सिद्ध करता है कि यदि आप LoRA विधि का उपयोग करते हैं, तो यह फाइन-ट्यूनिंग के लिए भी प्रभावी ढंग से उपयोग किया जा सकता है, जिससे और भी मेमोरी बचती है क्योंकि आपको उतने "स्टेट" वेरिएबल्स को स्टोर करने की आवश्यकता नहीं होती।

निष्कर्ष (Takeaway)

आपको उन सभी मॉडलों को फेंकने की आवश्यकता नहीं है जिन्हें "हथौड़े" (Adam) द्वारा प्रशिक्षित किया गया है। आप उन्हें बेहतर बनाने के लिए अभी भी तेज़ और अधिक कुशल "लेज़र" (Muon) का उपयोग कर सकते हैं, लेकिन आपको कोमल होना होगा। पूरे मॉडल को नया आकार देने के बजाय, बस उसके ऊपर एक छोटी, लचीली परत जोड़ दें (LoRA)। यह नए औज़ार को पुराने काम को तोड़े बिना काम करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →