← नवीनतम पेपर
🤖 machine learning

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

यह शोध पत्र MONA को प्रस्तुत करता है, जो एक नवीन ऑप्टिमाइज़र है जो तीव्र स्थानीय मिनिमा (sharp local minima) से बचने के लिए Muon फ्रेमवर्क में नेस्टरोव-शैली के त्वरण (Nesterov-style acceleration) को एकीकृत करता है और 1B से 68B पैरामीटर्स तक की भाषा मॉडलों (language models) में अत्याधुनिक अभिसरण (state-of-the-art convergence) और डाउनस्ट्रीम प्रदर्शन प्राप्त करता है।

मूल लेखक: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, सुपर-स्मार्ट रोबोट को मानवीय भाषा बोलना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको उसके मस्तिष्क के भीतर लाखों छोटे-छोटे नॉब्स (knobs) को एडजस्ट करना होगा। इन नॉब्स के लिए सही सेटिंग्स खोजने की प्रक्रिया को "ट्रेनिंग" कहा जाता है, और वह टूल जिसका उपयोग आप इन नॉब्स को घुमाने के लिए करते हैं, उसे ऑप्टिमाइज़र (optimizer) कहा जाता है।

लंबे समय तक, इस काम के लिए मानक टूल AdamW था। यह भरोसेमंद है, जैसे कि एक स्थिर, सतर्क पदयात्री जो छोटे कदम उठाता है और लगातार अपने नक्शे की जांच करता रहता है। हाल ही में, Muon नामक एक नया टूल आया। Muon एक ऐसे पदयात्री की तरह है जो पूरे पर्वत श्रृंखला को एक साथ देखता है, और नॉब्स के समूहों को एक एकल इकाई के रूप में मानता है। यह Muon को तेज़ और अधिक कुशल बनाता है, लेकिन इसमें एक दोष है: यह एक "तीक्ष्ण घाटी" (sharp valley) में फंस सकता है।

समस्या: तीक्ष्ण घाटी का जाल (The Sharp Valley Trap)

कल्पना कीजिए कि रोबोट की सीखने की प्रक्रिया का परिदृश्य ऊबड़-खाबड़ पहाड़ी इलाका है।

  • सपाट घाटियाँ (Flat valleys): ये बसने के लिए अच्छी जगहें हैं; इसका मतलब है कि रोबोट ने एक स्थिर, सामान्य समाधान खोज लिया है जो कई स्थितियों में अच्छा काम करता है।
  • तीक्ष्ण घाटियाँ (Sharp valleys): ये संकरी, गहरी खाइयाँ हैं। यदि रोबोट इनमें गिर जाता है, तो उसे लग सकता है कि उसने सबसे निचला बिंदु खोज लिया है, लेकिन वास्तव में वह एक बहुत ही विशिष्ट, नाजुक स्थान पर फंस गया है। यदि आप उसे थोड़ा सा भी हिलाते हैं, तो वह अपने "परफेक्ट" स्थान से बाहर गिर जाएगा और खराब प्रदर्शन करेगा।

AdamW और Muon दोनों गलती से इन तीक्ष्ण घाटियों में गिर सकते हैं और फंस सकते हैं। उनके पास यह "महसूस" करने का कोई तरीका नहीं है कि आगे की जमीन कैसी है ताकि वे जान सकें कि कोई स्थान बहुत तीक्ष्ण है या नहीं।

समाधान: MONA (Nesterov Acceleration के साथ Muon)

इस शोध के लेखकों ने एक नया टूल बनाया जिसे MONA कहा जाता है। MONA को सोनार चश्मे (sonar goggles) वाले Muon के रूप में समझें।

यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

  1. पुराना तरीका (Muon): Muon उस ढलान को देखता है जहाँ वह अभी खड़ा है और नीचे की ओर बढ़ता है। यह कुशलता से चलने में बहुत अच्छा है, लेकिन इसे यह नहीं पता कि आगे की जमीन एक हल्की ढलान है या किसी खड़ी चट्टान का किनारा।
  2. नया तरीका (MONA): कदम उठाने से पहले, MONA यह देखता है कि पिछले कदम से वर्तमान कदम तक ढलान में कैसे बदलाव आया है।
    • यदि ढलान अचानक बदल गई (जैसे किसी तीखी चट्टान से टकराना), तो MONA जानता है, "ओह, यह एक तीक्ष्ण घाटी है! चलिए यहाँ से बाहर निकलने के लिए ज़ोर से धक्का देते हैं।"
    • यदि ढलान बहुत धीरे-धीरे बदली (एक हल्की, सपाट घाटी), तो MONA कहता है, "यह सुरक्षित लग रहा है। चलिए यहाँ बस जाते हैं।"

MONA गणित में एक विशेष "एक्सेलरेशन टर्म" (acceleration term) जोड़ता है। यह वर्तमान दिशा और पिछली दिशा के बीच के अंतर की गणना करता है। यह अंतर एक सेंसर की तरह काम करता है जो इलाके की "तीक्षक्ष्णता" का पता लगाता है। यदि इलाका तीक्ष्ण है, तो यह रोबोट को गड्ढे से बाहर धकेलता है। यदि यह सपाट है, तो यह रोबोट को आराम करने देता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने तीन अलग-अलग आकार के भाषा मॉडलों (छोटे, मध्यम और विशाल, जो 1 बिलियन से 68 बिलियन पैरामीटर्स तक हैं) पर इस नए टूल का परीक्षण किया। उन्होंने इन्हें भारी मात्रा में टेक्स्ट (1 ट्रिलियन शब्दों तक) पर प्रशिक्षित किया।

  • बेहतर ट्रेनिंग: हर परीक्षण में, MONA ने मॉडलों को पुराने मानक (AdamW) और नए Muon दोनों की तुलना में तेज़ी से सीखने और एक बेहतर अंतिम अवस्था तक पहुँचने में मदद की।
  • स्मार्टर रोबोट: MONA के साथ प्रशिक्षित मॉडल सामान्य कार्यों, गणित की समस्याओं और कोडिंग में बेहतर थे। उदाहरण के लिए, एक 68-बिलियन पैरामीटर वाले मॉडल पर, MONA ने गणित और कोडिंग के बेंचमार्क पर सर्वश्रेष्ठ स्कोर प्राप्त किया।
  • फाइन-ट्यूनिंग (Fine-Tuning): प्रारंभिक प्रशिक्षण के बाद भी, जब उन्हें अतिरिक्त विशिष्ट प्रशिक्षण दिया गया (जैसे उन्हें विशेष रूप से कोडिंग लिखना सिखाना), तो MONA से शुरू हुए मॉडलों ने Muon से शुरू हुए मॉडलों की तुलना में बेहतर प्रदर्शन किया।

इसे व्यावहारिक बनाना (MONA-Lite)

लेखकों ने यह भी महसूस किया कि इस "सोनार" प्रणाली को जोड़ने से थोड़ा अधिक कंप्यूटर मेमोरी का उपयोग होता है। इसे ठीक करने के लिए, उन्होंने MONA-Lite नामक एक हल्का संस्करण बनाया।

  • उन्होंने मेमोरी डेटा को कंप्रेस करने की एक ट्रिक का उपयोग किया (जैसे हाई-डेफिनिशन वीडियो से स्टैंडर्ड डेफिनेशन में स्विच करना) और अतिरिक्त फाइलों को स्टोर किए बिना चलते समय ढलान के परिवर्तनों की गणना करने की एक विधि का उपयोग किया।
  • इससे आवश्यक अतिरिक्त मेमोरी लगभग 75% कम हो गई, जिससे इसे सीमित मेमोरी वाले कंप्यूटरों पर भी बिना किसी लाभ को खोए उपयोग करना आसान हो गया।

सारांश

संक्षेप में, MONA एक अपग्रेड है जो Muon ऑप्टिमाइज़र का उन्नत रूप है। यह Muon की गति और दक्षता को बनाए रखता है लेकिन इसमें एक "कर्वेचर सेंसर" (curvature sensor) जोड़ा गया है जो AI को सीखने के दौरान खराब, तीक्ष्ण स्थानों में फंसने से बचने में मदद करता है। इसके परिणामस्वरूप अधिक स्मार्ट, अधिक सक्षम भाषा मॉडल मिलते हैं जो गणित, कोडिंग और सामान्य तर्क में बेहतर होते हैं, और साथ ही इतने कुशल होते हैं कि उन्हें मानक हार्डवेयर पर चलाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →