MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
यह शोध पत्र MONA को प्रस्तुत करता है, जो एक नवीन ऑप्टिमाइज़र है जो तीव्र स्थानीय मिनिमा (sharp local minima) से बचने के लिए Muon फ्रेमवर्क में नेस्टरोव-शैली के त्वरण (Nesterov-style acceleration) को एकीकृत करता है और 1B से 68B पैरामीटर्स तक की भाषा मॉडलों (language models) में अत्याधुनिक अभिसरण (state-of-the-art convergence) और डाउनस्ट्रीम प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, सुपर-स्मार्ट रोबोट को मानवीय भाषा बोलना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको उसके मस्तिष्क के भीतर लाखों छोटे-छोटे नॉब्स (knobs) को एडजस्ट करना होगा। इन नॉब्स के लिए सही सेटिंग्स खोजने की प्रक्रिया को "ट्रेनिंग" कहा जाता है, और वह टूल जिसका उपयोग आप इन नॉब्स को घुमाने के लिए करते हैं, उसे ऑप्टिमाइज़र (optimizer) कहा जाता है।
लंबे समय तक, इस काम के लिए मानक टूल AdamW था। यह भरोसेमंद है, जैसे कि एक स्थिर, सतर्क पदयात्री जो छोटे कदम उठाता है और लगातार अपने नक्शे की जांच करता रहता है। हाल ही में, Muon नामक एक नया टूल आया। Muon एक ऐसे पदयात्री की तरह है जो पूरे पर्वत श्रृंखला को एक साथ देखता है, और नॉब्स के समूहों को एक एकल इकाई के रूप में मानता है। यह Muon को तेज़ और अधिक कुशल बनाता है, लेकिन इसमें एक दोष है: यह एक "तीक्ष्ण घाटी" (sharp valley) में फंस सकता है।
समस्या: तीक्ष्ण घाटी का जाल (The Sharp Valley Trap)
कल्पना कीजिए कि रोबोट की सीखने की प्रक्रिया का परिदृश्य ऊबड़-खाबड़ पहाड़ी इलाका है।
- सपाट घाटियाँ (Flat valleys): ये बसने के लिए अच्छी जगहें हैं; इसका मतलब है कि रोबोट ने एक स्थिर, सामान्य समाधान खोज लिया है जो कई स्थितियों में अच्छा काम करता है।
- तीक्ष्ण घाटियाँ (Sharp valleys): ये संकरी, गहरी खाइयाँ हैं। यदि रोबोट इनमें गिर जाता है, तो उसे लग सकता है कि उसने सबसे निचला बिंदु खोज लिया है, लेकिन वास्तव में वह एक बहुत ही विशिष्ट, नाजुक स्थान पर फंस गया है। यदि आप उसे थोड़ा सा भी हिलाते हैं, तो वह अपने "परफेक्ट" स्थान से बाहर गिर जाएगा और खराब प्रदर्शन करेगा।
AdamW और Muon दोनों गलती से इन तीक्ष्ण घाटियों में गिर सकते हैं और फंस सकते हैं। उनके पास यह "महसूस" करने का कोई तरीका नहीं है कि आगे की जमीन कैसी है ताकि वे जान सकें कि कोई स्थान बहुत तीक्ष्ण है या नहीं।
समाधान: MONA (Nesterov Acceleration के साथ Muon)
इस शोध के लेखकों ने एक नया टूल बनाया जिसे MONA कहा जाता है। MONA को सोनार चश्मे (sonar goggles) वाले Muon के रूप में समझें।
यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:
- पुराना तरीका (Muon): Muon उस ढलान को देखता है जहाँ वह अभी खड़ा है और नीचे की ओर बढ़ता है। यह कुशलता से चलने में बहुत अच्छा है, लेकिन इसे यह नहीं पता कि आगे की जमीन एक हल्की ढलान है या किसी खड़ी चट्टान का किनारा।
- नया तरीका (MONA): कदम उठाने से पहले, MONA यह देखता है कि पिछले कदम से वर्तमान कदम तक ढलान में कैसे बदलाव आया है।
- यदि ढलान अचानक बदल गई (जैसे किसी तीखी चट्टान से टकराना), तो MONA जानता है, "ओह, यह एक तीक्ष्ण घाटी है! चलिए यहाँ से बाहर निकलने के लिए ज़ोर से धक्का देते हैं।"
- यदि ढलान बहुत धीरे-धीरे बदली (एक हल्की, सपाट घाटी), तो MONA कहता है, "यह सुरक्षित लग रहा है। चलिए यहाँ बस जाते हैं।"
MONA गणित में एक विशेष "एक्सेलरेशन टर्म" (acceleration term) जोड़ता है। यह वर्तमान दिशा और पिछली दिशा के बीच के अंतर की गणना करता है। यह अंतर एक सेंसर की तरह काम करता है जो इलाके की "तीक्षक्ष्णता" का पता लगाता है। यदि इलाका तीक्ष्ण है, तो यह रोबोट को गड्ढे से बाहर धकेलता है। यदि यह सपाट है, तो यह रोबोट को आराम करने देता है।
उन्होंने क्या पाया?
शोधकर्ताओं ने तीन अलग-अलग आकार के भाषा मॉडलों (छोटे, मध्यम और विशाल, जो 1 बिलियन से 68 बिलियन पैरामीटर्स तक हैं) पर इस नए टूल का परीक्षण किया। उन्होंने इन्हें भारी मात्रा में टेक्स्ट (1 ट्रिलियन शब्दों तक) पर प्रशिक्षित किया।
- बेहतर ट्रेनिंग: हर परीक्षण में, MONA ने मॉडलों को पुराने मानक (AdamW) और नए Muon दोनों की तुलना में तेज़ी से सीखने और एक बेहतर अंतिम अवस्था तक पहुँचने में मदद की।
- स्मार्टर रोबोट: MONA के साथ प्रशिक्षित मॉडल सामान्य कार्यों, गणित की समस्याओं और कोडिंग में बेहतर थे। उदाहरण के लिए, एक 68-बिलियन पैरामीटर वाले मॉडल पर, MONA ने गणित और कोडिंग के बेंचमार्क पर सर्वश्रेष्ठ स्कोर प्राप्त किया।
- फाइन-ट्यूनिंग (Fine-Tuning): प्रारंभिक प्रशिक्षण के बाद भी, जब उन्हें अतिरिक्त विशिष्ट प्रशिक्षण दिया गया (जैसे उन्हें विशेष रूप से कोडिंग लिखना सिखाना), तो MONA से शुरू हुए मॉडलों ने Muon से शुरू हुए मॉडलों की तुलना में बेहतर प्रदर्शन किया।
इसे व्यावहारिक बनाना (MONA-Lite)
लेखकों ने यह भी महसूस किया कि इस "सोनार" प्रणाली को जोड़ने से थोड़ा अधिक कंप्यूटर मेमोरी का उपयोग होता है। इसे ठीक करने के लिए, उन्होंने MONA-Lite नामक एक हल्का संस्करण बनाया।
- उन्होंने मेमोरी डेटा को कंप्रेस करने की एक ट्रिक का उपयोग किया (जैसे हाई-डेफिनिशन वीडियो से स्टैंडर्ड डेफिनेशन में स्विच करना) और अतिरिक्त फाइलों को स्टोर किए बिना चलते समय ढलान के परिवर्तनों की गणना करने की एक विधि का उपयोग किया।
- इससे आवश्यक अतिरिक्त मेमोरी लगभग 75% कम हो गई, जिससे इसे सीमित मेमोरी वाले कंप्यूटरों पर भी बिना किसी लाभ को खोए उपयोग करना आसान हो गया।
सारांश
संक्षेप में, MONA एक अपग्रेड है जो Muon ऑप्टिमाइज़र का उन्नत रूप है। यह Muon की गति और दक्षता को बनाए रखता है लेकिन इसमें एक "कर्वेचर सेंसर" (curvature sensor) जोड़ा गया है जो AI को सीखने के दौरान खराब, तीक्ष्ण स्थानों में फंसने से बचने में मदद करता है। इसके परिणामस्वरूप अधिक स्मार्ट, अधिक सक्षम भाषा मॉडल मिलते हैं जो गणित, कोडिंग और सामान्य तर्क में बेहतर होते हैं, और साथ ही इतने कुशल होते हैं कि उन्हें मानक हार्डवेयर पर चलाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।