MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
यह शोध पत्र MONA को प्रस्तुत करता है, जो एक नवीन ऑप्टिमाइज़र है जो तीव्र स्थानीय मिनिमा (sharp local minima) से बचने के लिए Muon फ्रेमवर्क में नेस्टरोव-शैली के त्वरण (Nesterov-style acceleration) को एकीकृत करता है और 1B से 68B पैरामीटर्स तक की भाषा मॉडलों (language models) में अत्याधुनिक अभिसरण (state-of-the-art convergence) और डाउनस्ट्रीम प्रदर्शन प्राप्त करता है।