Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates
यह शोध पत्र एक स्केलेबल, क्लोज्ड-फॉर्म नॉलेज एडिटिंग फ्रेमवर्क का प्रस्ताव करता है जो Mixture-of-Experts LLMs के लिए है, जो डेंस-लेयर बेसलाइन्स के तुलनीय एडिटिंग क्वालिटी बनाए रखते हुए प्रति-एक्सपर्ट अपडेट प्राप्त करने के लिए टेंसर स्ट्रक्चर्स और वुडबरी मैट्रिक्स आइडेंटिटी का लाभ उठाता है और 6 गुना तक त्वरण (एक्सेलरेशन) प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ी समस्या: एक विशाल पुस्तकालय को अपडेट करना
कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक विशाल, अत्यंत बुद्धिमान लाइब्रेरियन की तरह है जिसे लगभग सब कुछ पता है। हालाँकि, एक बार जब लाइब्रेरियन को प्रशिक्षित (train) कर दिया जाता है, तो उनका ज्ञान "स्थिर" (frozen) हो जाता है। यदि दुनिया बदल जाती है (जैसे, एक नया राष्ट्रपति चुना जाता है, या कोई वैज्ञानिक तथ्य सुधारा जाता है), तो लाइब्रेरियन पुराने, गलत उत्तर देते रहते हैं।
आमतौर पर, इसे ठीक करने के लिए, आपको लाइब्रेरियन को एक लंबे, महंगे रिट्रेनिंग सत्र के लिए वापस स्कूल भेजना पड़ता है। यह धीमा है, इसमें कंप्यूटर पावर का बहुत खर्च होता है, और इसमें इस बात का जोखिम रहता है कि लाइब्रेरियन उन चीजों को भूल जाएं जो वे पहले से जानते थे।
नॉलेज एडिटिंग (Knowledge Editing) एक शॉर्टकट है। पूरे लाइब्रेरियन को फिर से प्रशिक्षित करने के बजाय, आप बस उनकी मेमोरी में एक विशिष्ट फ़ाइल को बदल देते हैं। पिछले तरीकों ने "डेंस" (dense) मॉडल्स के लिए अच्छा काम किया (जहाँ मस्तिष्क का हर हिस्सा सक्रिय होता है), लेकिन वे आधुनिक मॉडल्स के साथ संघर्ष करते रहे।
नई चुनौती: "एक्सपर्ट्स" की टीम
आधुनिक AI मॉडल्स (जैसे OpenAI या DeepSeek द्वारा उपयोग किए जाने वाले) एक एकल विशाल मस्तिष्क का उपयोग नहीं करते हैं। वे एक मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts - MoE) आर्किटेक्चर का उपयोग करते हैं।
- उपमा (Analogy): कल्पना कीजिए कि एक विशाल लाइब्रेरियन के बजाय, आपके पास 100 विशेषज्ञ विशेषज्ञों की एक टीम है (एक इतिहासकार, एक कोडर, एक शेफ, एक डॉक्टर, आदि)।
- यह कैसे काम करता है: जब आप कोई प्रश्न पूछते हैं, तो एक "राउटर" (मैनेजर) प्रश्न को देखता है और केवल उन 4 या 8 विशेषज्ञों को जगाता है जो प्रासंगिक हैं। बाकी सोए रहते हैं।
- समस्या: यदि आप एक तथ्य को अपडेट करना चाहते हैं (जैसे, "फ्रांस की राजधानी पेरिस है"), तो पुराने एडिटिंग टूल्स को इस विशिष्ट टीम से बात करने का तरीका नहीं पता था। उन्होंने इस पूरी टीम को एक बड़े ढेर (blob) के रूप में मानने की कोशिश की, जो अक्षम और अव्यवस्थित था। इसे ठीक करने का मौजूदा तरीका (जिसे MoE-Edit कहा जाता है) विशेषज्ञों को एक लंबी लाइन में एक-एक करके अपडेट करने जैसा था, जिसमें बहुत समय लगता था।
समाधान: MoTE (स्मार्ट टीम मैनेजर)
लेखकों ने MoTE (Mixture-of-Experts Tucker Editor) नामक एक नया तरीका प्रस्तावित किया है। उन्होंने दो मुख्य तरकीबों का उपयोग करके इस समस्या को हल किया:
1. "शॉर्टकट" गणित (Woodbury Identity)
विशेषज्ञों को अपडेट करने के पुराने तरीके में एक विशाल, जटिल गणितीय पहेली को हल करना आवश्यक था जिसमें एक बहुत बड़े मैट्रिक्स (संख्याओं का ग्रिड) को उलटना (invert) शामिल था। यह एक मिलियन वर्गों वाली सुडोकू पहेली को हल करने जैसा था।
लेखकों ने Woodbury Identity नामक एक गणितीय ट्रिक का उपयोग किया।
- उपमा: उस मिलियन-वर्गों वाली पहेली को हल करने के बजाय, उन्होंने महसूस किया कि उन्हें केवल एक छोटे 50-वर्गों वाले पहेली को हल करने की आवश्यकता है जो उन बदलावों का प्रतिनिधित्व करती है जिन्हें आप करना चाहते हैं।
- परिणाम: यह एक ऐसे कार्य को जो घंटों लेता है, मिनटों में बदल देता है। वे बिना हर एक विशेषज्ञ के पूर्ण भार (weight) को "जगाने" या गणना करने के, ज्ञान को अपडेट कर सकते हैं।
2. टीम संरचना का सम्मान करना (Tensor Decomposition)
दूसरी ट्रिक यह थी कि विशेषज्ञ यादृच्छिक (random) नहीं हैं; वे संबंधित हैं। उन्हें एक साथ प्रशिक्षित किया गया था, इसलिए उनका ज्ञान एक विशिष्ट 3D आकार में जुड़ा हुआ है (एक सपाट कागज के बजाय पनीर के ब्लॉक की तरह)।
- उपमा: कल्पना कीजिए कि विशेषज्ञ एक गायक मंडली (choir) हैं। यदि आप गाने की पिच बदलना चाहते हैं, तो आप केवल एक व्यक्ति पर चिल्लाते नहीं हैं; आप पूरे समूह के सामंज्य (harmony) को समायोजित करते हैं।
- विधि: लेखकों ने Tucker Decomposition का उपयोग किया। यह विशेषज्ञों के "पनीर के ब्लॉक" (एक्सपर्ट वेट्स) को एक छोटे, कोर आकार में कंप्रेस करने का एक तरीका है जो समूह के सार को पकड़ता है।
- लाभ: इस छोटे "कोर" आकार को एडिट करके, वे स्वचालित रूप से सभी विशेषज्ञों को अपडेट करते हैं जो उनके संबंधों का सम्मान करता है। यह मॉडल को भ्रमित होने या अन्य चीजों को "भूलने" से रोकता है।
परिणाम: तेज़ और सटीक
पेपर ने कई आधुनिक AI मॉडल्स (जैसे Qwen और GPT-OSS) पर MoTE का परीक्षण किया और इसकी तुलना पिछले सर्वश्रेष्ठ तरीके (MoE-Edit) और मानक रिट्रेनिंग से की।
- गति: MoTE पिछले सर्वश्रेष्ठ तरीके की तुलना में 6 गुना तक तेज़ है। यह 1,000 तथ्यों को बहुत कम समय में एडिट कर सकता है।
- गुणवत्ता: यह तथ्यों को ठीक करने (Efficacy) और मॉडल के अन्य हिस्सों को खराब न करने (Specificity) में पिछले धीमे तरीकों के समान ही अच्छा है।
- दक्षता (Efficiency): यह इस तथ्य के माध्यम से हासिल करता है कि वह प्रत्येक लेयर के लिए पुनर्गणना करने के बजाय, प्रक्रिया के बिल्कुल अंत में एक बार भारी गणितीय गणना करता है और फिर उस परिणाम को अन्य लेयर्स में फैला देता है।
सारांश
यह पेपर MoTE पेश करता है, जो एक ऐसा टूल है जो हमें आधुनिक, "एक्सपर्ट-आधारित" AI मॉडल्स को तेज़ी से और सटीकता से अपडेट करने की अनुमति देता है। यह इसे दो तरीकों से करता है:
- अनावश्यक भारी गणनाओं से बचने के लिए एक गणितीय शॉर्टकट का उपयोग करना।
- विशेषज्ञों की टीम संरचना का सम्मान करना ताकि अपडेट सार्थक हों।
इसका अर्थ यह है कि हम AI मॉडल्स को शून्य से फिर से प्रशिक्षित किए बिना वास्तविक दुनिया के साथ अपडेट रख सकते हैं, जिससे बहुत अधिक समय और ऊर्जा की बचत होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।