← नवीनतम पेपर
💻 computer science

Data-Shard-Driven Expert Differentiation in Sparse MoE: A Three-Component System with FrozenPath Anchoring and Dual-Loop Refinement

यह शोधपत्र एक डिस्टिलेशन-मुक्त (distillation-free), ऑक्सिलरी-लॉस-मुक्त (auxiliary-loss-free) तीन-घटक प्रणाली प्रस्तावित करता है जो फ्रोजनपाथ एंकरिंग (FrozenPath anchoring), डेटा शार्ड बाइंडिंग (Data Shard binding), और ड्यूल-लूप रिफाइनमेंट (Dual-Loop refinement) को संयोजित करती है ताकि स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स (sparse Mixture-of-Experts) मॉडलों के इंक्रीमेंटल ट्रेनिंग के दौरान एक्सपर्ट होमोजेनाइजेशन (expert homogenization) और कैटास्ट्रोफिक लैंग्वेज ड्रिफ्ट (catastrophic language drift) को प्रभावी ढंग से समाप्त किया जा सके।

मूल लेखक: 庆君 张

प्रकाशित 2026-07-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: 庆君 张

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट को बोलना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह अविश्वसनीय रूप से ज्ञानी हो, लेकिन साथ ही तेज़ और कुशल भी। इसे करने के लिए, वैज्ञानिक एक चतुर तकनीक का उपयोग करते हैं जिसे "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) कहा जाता है। इसे एक विशाल मस्तिष्क के रूप में नहीं, बल्कि विशेषज्ञों की एक टीम के रूप में सोचें। जब रोबोट को किसी प्रश्न का उत्तर देने की आवश्यकता होती है, तो वह पूरी टीम से नहीं पूछता; वह केवल एक विशिष्ट विशेषज्ञ को जगाता है जो उस विषय में सबसे अच्छा है। यह ऊर्जा बचाता है और रोबोट को धीमा हुए बिना विशाल होने की अनुमति देता है।

हालाँकि, इन टीमों को प्रशिक्षित करने में एक बड़ी समस्या है। जब आप उन्हें नई चीजें सिखाते रहते हैं, तो विशेषज्ञ अक्सर बिल्कुल एक जैसा सोचने लगते हैं। वे सभी एक जैसे उबाऊ तथ्य सीखते हैं और एक-दूसरे की नकल (क्लोन) लगने लगते हैं। यह टीम बनाने के उद्देश्य को ही विफल कर देता; आपके पास बस एक व्यक्ति होने के समान ही होता। इससे भी बदतर, जैसे-जैसे वे नई चीजें सीखते हैं, वे कभी-कभी ठीक से बोलना भी भूल जाते हैं, और निरर्थक बातें बनाने लगते हैं। यह शोध पत्र इन AI विशेषज्ञों को बिना किसी दूसरे, और भी बड़े 'टीचर रोबोट' की देखरेख के, अद्वितीय और सटीक बनाए रखने के जटिल कार्य को सुलझाता है।


तीन-भागों वाली टीम जो संकट से बचाती है

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिसका नेतृत्व झांग किंगजुन (Zhang Qingjun) ने किया, खोजा कि इन "क्लोन" और "भूलने" की समस्याओं को ठीक करने के लिए, आपको जटिल गणितीय दंड या किसी शिक्षक रोबोट की आवश्यकता नहीं है। इसके बजाय, उन्होंने एक तीन-भाग वाली प्रणाली बनाई जो एक सुव्यवस्थित मशीन की तरह काम करती है। उन्होंने इसका परीक्षण Qwen2.5-0.5B नामक एक छोटे लेकिन शक्तिशाली मॉडल पर किया, जिसमें 24 लेयर्स और प्रत्येक लेयर में 4 विशेषज्ञ हैं। यहाँ बताया गया है कि उनके तीन घटक रोजमर्रा के रूपकों के साथ कैसे काम करते हैं।

1. फ्रोजनपाथ (FrozenPath): एक स्थिर लंगर

कल्पना कीजिए कि आप कलाकारों के एक समूह को नई शैलियों में पेंटिंग करना सिखा रहे हैं। यदि आप उन्हें बिना किसी मार्गदर्शन के स्वतंत्र छोड़ देते हैं, तो वे सीधी रेखा खींचना या बुनियादी रंगों को मिलाना भूल सकते हैं। वे निरर्थक चित्र बनाने लग सकते हैं।

फ्रोजनपाथ (FrozenPath) एक मास्टर कलाकार की तरह है जो कमरे के कोने में खड़ा है, समय में पूरी तरह से स्थिर। यह मास्टर अपनी पेंटिंग शैली को कभी नहीं बदलता। प्रशिक्षण के दौरान, नए कलाकार ("प्रशिक्षण योग्य विशेषज्ञ") पेंटिंग करते हैं, लेकिन उनकी अंतिम तस्वीर उनके अपने काम और मास्टर के अपरिवर्तित काम का मिश्रण होती है। शोध में पाया गया कि यह "जमा हुआ" (frozen) प्रतिरूप अत्यंत महत्वपूर्ण है। यह एक सुरक्षा जाल के रूप में कार्य करता है।

उनके परीक्षणों में, जब उन्होंने इस स्थिर लंगर को हटा दिया, तो मॉडल केवल थोड़ा खराब नहीं हुआ; बल्कि पूरी तरह से ध्वस्त हो गया। "परप्लेक्सिटी" (एक स्कोर जो मॉडल के भ्रमित होने को मापता है, जहाँ कम स्कोर बेहतर है) एक शानदार स्कोर 20 से बढ़कर एक भयानक 1318 हो गया। मॉडल "the 2|||||..." जैसी अस्पष्ट बातें उगलने लगा। लेखक इस बात पर जोर देते हैं कि यह केवल एक बोनस नहीं है; यह अस्तित्व के लिए एक आवश्यकता है। इसके बिना, पूरा सिस्टम टूट जाता है।

2. डेटा शार्ड (Data Shard): एक सख्त असाइनमेंट

अब, कल्पना कीजिए कि आपके पास एक कमरे में चार विशेषज्ञ हैं, और आप चाहते हैं कि वे एक-दूसरे से अलग बनें। यदि आप उन सभी पर खाना पकाने, अंतरिक्ष, इतिहास और खेल की किताबों का एक मिश्रित ढेर फेंक देते हैं, तो वे सभी एक ही चीज़ सीखेंगे और क्लोन बन जाएंगे।

डेटा शार्ड (Data Shard) विधि एक सख्त लाइब्रेरियन की तरह है जो किसी के छूने से पहले किताबों को छाँटता है। लाइब्रेरियन पुस्तकालय को चार अलग-अलग ढेरों (shards) में काट देता है। विशेषज्ञ A को केवल खाना पकाने की किताबें मिलती हैं, विशेषज्ञ B को केवल अंतरिक्ष की किताबें मिलती हैं, और इसी तरह। वे अन्य ढेरों को कभी नहीं देखते। क्योंकि वे पूरी तरह से अलग कहानियाँ पढ़ रहे हैं, उनके दिमाग स्वाभाविक रूप से अलग तरह से सोचने लगते हैं।

शोध ने सिद्ध किया कि विशेषज्ञों को अलग बनाने के लिए यही एकमात्र चीज़ है। जब उन्होंने एक ऐसे संस्करण का परीक्षण किया जहाँ विशेषज्ञ कोई भी किताब पढ़ सकते थे (रैंडम रूटिंग), तो विशेषज्ञ फिर से एक जैसे क्लोन बन गए, जिनका समानता स्कोर 1.00 था (जिसका अर्थ है कि वे बिल्कुल एक जैसे थे)। लेकिन "डेटा शार्ड" विधि के साथ, समानता घटकर 0.85 रह गई, जिससे सिद्ध हुआ कि उन्होंने अपने स्वयं के अद्वितीय व्यक्तित्व विकसित कर लिए थे। दिलचस्प बात यह है कि इस विधि ने मॉडल को बुनियादी बातों में अधिक स्मार्ट नहीं बनाया (PPL स्कोर समान रहा), लेकिन विशेषज्ञों को क्लोन बनने से रोकने के लिए यह एकमात्र कारण था।

3. डुअल-लूप (Dual-Loop): आत्म-जांच

अंत में, कल्पना कीजिए कि एक विशेषज्ञ को उसकी विशिष्ट किताबों का ढेर सौंपा गया है। वह एक अध्याय पढ़ता है, उसके बारे में सोचता है, और फिर यह सुनिश्चित करने के लिए उसे तुरंत फिर से पढ़ता है कि उसने वास्तव में उसे समझा है या नहीं। यही डुअल-लूप है।

जानकारी को केवल एक बार पास करने के बजाय, विशेषज्ञ डेटा को लगातार दो बार अपने मस्तिष्क से गुजारता है। यह एक आत्म-सुधार चक्र की तरह है। शोध में पाया गया कि यह एक छोटा लेकिन सहायक लाभ देता है। इसने मॉडल के स्कोर में लगभग 2 अंक का सुधार किया (परप्लेक्सिटी को 22 से घटाकर 20 कर दिया) और हेलास्वैग (HellaSwag) नामक एक रीजनिंग टेस्ट में 2% की वृद्धि की। हालाँकि, उन्होंने एक सीमा भी पाई: इसे तीन बार करने (एक "ट्रिपल-लूप") से दो बार करने की तुलना में बहुत अधिक लाभ नहीं हुआ। दो लूप वह 'स्वीट स्पॉट' थे जहाँ आप बिना समय बर्बाद किए लाभ प्राप्त कर सकते थे।

परिणाम: एक टीम जो वास्तव में काम करती है

जब शोधकर्ताओं ने इन तीनों भागों को एक साथ रखा, तो परिणाम प्रभावशाली थे। पूर्ण प्रणाली (जिसे कॉन्फ़िगरेशन E कहा जाता है) ने 20 की परप्लेक्सिटी प्राप्त की, जो मानक "डेंस" मॉडल बेसलाइन 143 से बहुत बेहतर है। विशेषज्ञ विशिष्ट थे (क्लोन नहीं), मॉडल ने बोलना नहीं भुलाया, और यह प्रश्नों के सही उत्तर दे सका।

उदाहरण के लिए, "फ्रांस की राजधानी है" पूछे जाने पर, पूर्ण प्रणाली ने सही उत्तर दिया: "पेरिस। इसकी स्थापना 787 ईस्वी में शारलेमेन द्वारा की गई थी..." (नोट: उदाहरण में ऐतिहासिक तारीख मॉडल के आउटपुट का हिस्सा है, जिसका उपयोग शोध पत्र यह दिखाने के लिए करता है कि यह तथ्यों को याद रख सकता है, भले ही वास्तविक दुनिया में वह तारीख ऐतिहासिक रूप से विवादास्पद हो)।

इसके विपरीत, "फ्रोजनपाथ" के बिना वाला संस्करण (कॉन्फ़िगरेशन C) पूरी तरह विफल रहा और निरर्थक बातें करने लगा। "डेटा शार्ड्स" के बिना वाला संस्करण (कॉन्फ़िगरेशन I) सही वाक्य तो बनाता था लेकिन उसके विशेषज्ञ 100% समान थे, जिसका अर्थ था कि मॉडल की विशेष "स्पार्स" शक्ति का उपयोग बर्बाद किया जा रहा था।

यह भविष्य के लिए क्यों महत्वपूर्ण है

शोध पत्र सुझाव देता है कि यह प्रणाली उन कंपनियों के लिए आदर्श है जो अपने AI को नए, विशिष्ट विषयों (जैसे कानूनी दस्तावेज़ या चिकित्सा रिकॉर्ड) पर प्रशिक्षित करना चाहती हैं, बिना किसी विशाल शिक्षक मॉडल की निगरानी के। यह एक "डिस्टिलेशन-फ्री" और "ऑक्सिलरी-लॉस-फ्री" समाधान है, जिसका अर्थ है कि इसे काम करने के लिए अतिरिक्त जटिल गणित या विशाल संदर्भ मॉडल की आवश्यकता नहीं है।

व्यावहारिक पक्ष पर, शोधकर्ताओं ने दिखाया है कि यह मॉडल अपेक्षाकृत छोटे कंप्यूटरों पर चल सकता है। एक मानक ग्राफिक्स कार्ड (जैसे RTX 4080S) पर चलने वाले एक एकल विशेषज्ञ को केवल 3.5 GB वीडियो मेमोरी (VRAM) की आवश्यकता होती है। यह कई उपभोक्ता लैपटॉप या एज डिवाइसेस पर चलने के लिए पर्याप्त छोटा है। सिस्टम ने "लेवल 4" इंजीनियरिंग परिपक्वता हासिल की है, जिसका अर्थ है कि यह वास्तविक दुनिया के उपयोग के लिए तैयार है, हालांकि लेखक नोट करते हैं कि इसे बहुत बड़े मॉडलों (जैसे 7 बिलियन पैरामीटर्स) तक स्केल करने के लिए अधिक परीक्षण की आवश्यकता होगी।

संक्षेप में, यह शोध पत्र सिद्ध करता है कि एक सुरक्षा लंगर को फ्रीज करके, सीखने की सामग्री को सख्ती से विभाजित करके, और विशेषज्ञों को अपने काम की दोबारा जांच करने देकर, आप AI विशेषज्ञों की एक ऐसी टीम बना सकते हैं जो अद्वितीय, स्मार्ट है और बोलना नहीं भूलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →