Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning
यह शोध पत्र Muon-OGD का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक निरंतर सीखने (continual learning) का ढांचा है जो Muon-शैली के स्पेक्ट्रल-नॉर्म ज्योमेट्री को ऑर्थोगोनल ग्रेडिएंट प्रोजेक्शन के साथ एकीकृत करके कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करता है, जिससे स्थिरता-प्लास्टिसिटी ट्रेड-ऑफ (stability-plasticity trade-off) में सुधार होता है और विविध बेंचमार्क पर मौजूदा यूक्लिडियन-नॉर्म-आधारित (Euclidean-norm-based) विधियों से बेहतर प्रदर्शन होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Muon-OGD" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: "स्पंज" प्रभाव (The "Sponge" Effect)
कल्पना कीजिए कि एक छात्र (एक Large Language Model, या LLM) है जो अविश्वसनीय रूप से बुद्धिमान है। वह फ्रेंच बोलना सीखता है, फिर वह स्पेनिश सीखना शुरू करता है। लेकिन यहाँ एक पेंच है: जैसे ही वह स्पेनिश सीखना शुरू करता है, वह फ्रेंच भूलने लगता है। इसे कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) कहा जाता है।
AI की दुनिया में, जब एक मॉडल कोई नया कार्य सीखता है, तो वह अक्सर उन "न्यूरल पाथवेज़" (neural pathways) को ओवरराइट कर देता है जिनका उपयोग उसने पुराने कार्य के लिए किया था। मॉडल एक स्पंज की तरह बन जाता है जो नई जानकारी को सोख लेता है लेकिन पुरानी चीज़ों को बाहर निकाल देता है।
पुराना समाधान: "ट्रैफिक पुलिस" (The "Traffic Cop")
वैज्ञानिकों ने इसे ऑर्थोगोनल ग्रेडिएंट डिसेंट (Orthogonal Gradient Descent - OGD) नामक विधि का उपयोग करके ठीक करने की कोशिश की है।
मॉडल के ज्ञान को एक विशाल, बहु-आयामी मानचित्र (map) के रूप में सोचें:
- पुराने कार्य: "फ्रेंच" का ज्ञान इस मानचित्र पर एक विशिष्ट लेन (lane) को घेरता है।
- नया कार्य: "स्पेनिश" सीखना एक कार (अपडेट) को मानचित्र पर चलाना चाहता है।
पुरानी विधि एक ट्रैफिक पुलिस की तरह काम करती है। वह कहती है, "आप स्पेनिश सीखने के लिए कहीं भी गाड़ी चला सकते हैं, लेकिन आपको 'फ्रेंच' वाली लेन में जाने से सख्ती से रोका जाता है।" यह नए सीखने के पथ को इस तरह प्रोजेक्ट (project) करता है कि वह पुराने पथ के बिल्कुल लंबवत (90-डिग्री के कोण पर) रहे।
दोष: यह ट्रैफिक पुलिस मान लेती है कि मानचित्र सपाट और एकसमान है, जैसे कि एक मानक ग्रिड (यूक्लिडियन ज्यामिति)। यह दूरी को "फ्रोबोनियस नॉर्म" (Frobenius norm) का उपयोग करके मापता है, जो एक मानक रूलर (पैमाने) से दूरी मापने जैसा है। हालाँकि, पेपर का तर्क है कि इन AI मॉडलों की आंतरिक संरचना एक सपाट ग्रिड नहीं है; यह एक जटिल, घुमावदार परिदृश्य (landscape) की तरह है जहाँ कुछ दिशाएँ "भारी" या अधिक महत्वपूर्ण होती हैं।
नया विचार: "माउंटेन गाइड" (Muon-OGD)
लेखकों ने देखा कि Muon नामक एक नया ऑप्टिमाइज़र अलग तरह से काम करता है। एक मानक रूलर के बजाय, Muon एक स्पेक्ट्रल नॉर्म (spectral norm) का उपयोग करता है।
उपमा (Analogy):
कल्पना कीजिए कि आप एक पहाड़ पर चढ़ रहे हैं।
- पुराना तरीका (Frobenius): आप जमीन पर रखे एक फ्लैट टेप मेजर से अपने कदम मापते हैं। आपको लगता है कि आप कुशलता से आगे बढ़ रहे हैं, लेकिन आप एक खड़ी चट्टान पर चढ़ रहे हो सकते हैं क्योंकि आपने इलाके के आकार पर ध्यान नहीं दिया।
- Muon का तरीका (Spectral Norm): आपके पास एक माउंटेन गाइड है जो इलाके के 3D आकार को समझता है। गाइड जानता है कि कुछ रास्ते "तीव्र" (उच्च प्रभाव वाले) हैं और कुछ "सौम्य" (कम प्रभाव वाले) हैं। गाइड आपको ऐसे कदम उठाने के लिए कहता है जो पहाड़ के आकार का सम्मान करते हों, न कि केवल सपाट दूरी का। यह आपको स्थिर रखता है और गलत दिशा में फिसलने से बचाता है।
Muon-OGD इन दोनों विचारों को जोड़ता है:
- यह ट्रैफिक पुलिस को बनाए रखता है (पुराने फ्रेंच ज्ञान की रक्षा के लिए)।
- लेकिन यह तय करने के लिए कि कदम कैसे उठाए जाएं, यह माउंटेन गाइड (Muon) को काम पर रखता है।
केवल यह कहने के बजाय कि "फ्रेंच लेन में मत जाओ," नया तरीका कहता है, "फ्रेंच लेन में मत जाओ, और साथ ही, ऐसे कदम उठाओ जो पहाड़ के 3D आकार का सम्मान करें ताकि आप फिसल न जाएं।"
यह कैसे काम करता है (The "Dual" Dance)
पेपर इस प्रक्रिया को कुशलतापूर्वक करने के लिए एक गणितीय विवरण देता है:
- सेटअप: मॉडल उन "संरक्षित लेन" (फ्रेंच ज्ञान) की पहचान करता है जिन्हें छुआ नहीं जाना चाहिए।
- सुधार (Correction): एक कदम उठाने से पहले, मॉडल एक "सुधारित पथ" (corrected path) की गणना करता है। वह पूछता है: "यदि मैं यह कदम उठाता हूँ, तो क्या मैं गलती से फ्रेंच लेन से टकरा जाऊँगा?"
- पुनरावृत्ति (Iteration): यह केवल एक बार अनुमान नहीं लगाता। यह एक त्वरित, आंतरिक लूप (जिसे डुअल इटरेशन कहा जाता है) चलाता है ताकि कदम को और बेहतर बनाया जा सके। यह एक डांसर की तरह है जो अपने पैर रखने की जगह को बार-बार सूक्ष्म रूप से एडजस्ट करता है ताकि वह सबसे कुशल दिशा में चलते हुए भी अपने पार्टनर के पैरों पर न पड़ जाए।
- साइन (The Sign): अंत में, यह कदम को सटीक "ऑर्थोगोनल" आकार में लाने के लिए एक गणितीय ट्रिक (न्यूटन-शुलज़ इटरेशन) का उपयोग करता है, जिससे यह सुनिश्चित होता है कि यह बिना नियमों को तोड़े सबसे कुशल चाल है।
परिणाम: एक बेहतर छात्र
लेखकों ने विभिन्न "स्कूली विषयों" (बेंचमार्क) पर इस नई विधि (Muon-OGD) का पुराने तरीकों के मुकाबले परीक्षण किया:
- मानक परीक्षण: टेक्स्ट क्लासिफिकेशन (जैसे समाचार लेखों को छाँटना)।
- कठिन परीक्षण: एक 15-कार्य स्ट्रीम (क्रमवार 15 अलग-अलग विषय सीखना)।
- विशेषज्ञता वाले परीक्षण: कोडिंग, गणित और मेडिकल रीजनिंग।
परिणाम:
हर परीक्षण में, Muon-OGD वाला छात्र बेहतर प्रदर्शन करता है।
- उन्होंने नए विषयों को (प्लास्टिसिटी/plasticity) अन्य की तरह ही अच्छी तरह सीखा।
- लेकिन वे पुराने विषयों को बहुत कम भूले (स्थिरता/stability)।
- वे विशेष रूप से कोडिंग, गणित और चिकित्सा जैसे विषयों में अपने कौशल को बरकरार रखने में बहुत अच्छे रहे, जबकि पुराने तरीके नए चीजें सीखते समय उनके पिछले कौशल खोने लगे थे।
सारांश
पेपर का दावा है कि AI के मस्तिष्क में "दूरी" को मापने के तरीके को बदलकर—एक फ्लैट रूलर से एक 3D माउंटेन गाइड में—और पुराने ज्ञान की रक्षा के लिए सख्त नियमों के साथ जोड़कर, हम AI को नई चीजें सिखा सकते हैं बिना यह भुलाए कि वह पहले से क्या जानता है। यह सीखने की प्रक्रिया को निरंतर बनाए रखने का एक अधिक स्थिर और कुशल तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।