← नवीनतम पेपर
💬 NLP

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

यह शोध पत्र यह प्रदर्शित करता है कि मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) भाषा मॉडल, एक इष्टतम सक्रियण दर (activation rate) की पहचान करके जो विभिन्न मॉडल आकारों में सुसंगत रहती है, समान संसाधन बाधाओं (कुल पैरामीटर, कंप्यूट, और डेटा) के तहत अपने डेंस समकक्षों से बेहतर प्रदर्शन कर सकते हैं, एक ऐसा निष्कर्ष जिसे लगभग 250 मॉडलों को प्रशिक्षित करने और 50 ट्रिलियन टोकन को प्रोसेस करने के व्यापक प्रयोगों के माध्यम से मान्य किया गया है।

मूल लेखक: Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

प्रकाशित 2026-05-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ज्ञान का एक विशाल पुस्तकालय बना रहे हैं। आपके पास एक सख्त बजट है: आप केवल एक विशिष्ट संख्या में पुस्तकें (पैरामीटर्स) ही खरीद सकते हैं, आप केवल उन्हें पढ़ने के लिए एक विशिष्ट मात्रा में समय (कंप्यूट) ही खर्च कर सकते हैं, और आपके पास पढ़ने के लिए केवल कहानियों की एक विशिष्ट संख्या (डेटा) ही उपलब्ध है।

लंबे समय तक, इस पुस्तकालय को बनाने का मानक तरीका एक विशाल, अत्यंत बुद्धिमान लाइब्रेरियन (पुस्तकालयाध्यक्ष) को काम पर रखना था, जो पुस्तकालय की हर एक पुस्तक को पूछे गए प्रत्येक प्रश्न के लिए पढ़ता था। यह क्या है जिसे यह पेपर डेंस मॉडल (Dense Model) कहता है। यह विश्वसनीय है, लेकिन यह धीमा और महंगा है क्योंकि उस एक लाइब्रेरियन को सारा भारी काम करना पड़ता है।

हाल ही में, एक नया विचार जिसे मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts - MoE) कहा जाता है, लोकप्रिय हुआ है। एक विशाल लाइब्रेरियन के बजाय, आप 100 विशेषज्ञ टीमों को काम पर रखते हैं। जब कोई प्रश्न आता है, तो एक "मैनेजर" (गेट) जल्दी से सबसे अच्छे विशेषज्ञों में से कुछ को चुन लेता है, जबकि बाकी लोग कॉफी ब्रेक लेते हैं। यह तेज़ है और यह आपको अधिक किताबें (कुल पैरामीटर्स) रखने की अनुमति देता है बिना पढ़ने की गति को धीमा किए।

बड़ा सवाल
यह पेपर एक बहुत ही विशिष्ट, पेचीदा सवाल पूछता है: यदि हम "एक विशाल लाइब्रेरियन" और "विशेषज्ञों की टीम" को किताबों, समय और अनूठी कहानियों के लिए बिल्कुल समान बजट दें, तो क्या विशेषज्ञों की टीम वास्तव में जीत सकती है?

पिछले अध्ययनों में अक्सर विशेषज्ञों की टीम को अधिक किताबें या अधिक समय देकर धोखाधड़ी की गई थी। यह पेपर देखना चाहता था कि क्या विशेषज्ञों की टीम तब भी जीत सकती है जब नियम सख्ती से समान हों।

प्रयोग: सही जगह (Sweet Spot) की खोज
शोधकर्ताओं ने केवल समस्या पर पैसा नहीं फेंका; उन्होंने कुशल वास्तुकारों (architects) की तरह काम किया। उन्होंने इन पुस्तकालयों के सर्वोत्तम डिज़ाइन को खोजने के लिए लगभग 200 अलग-अलग संस्करण बनाए।

  1. आर्किटेक्चर (संरचना): उन्होंने विशेषज्ञों को व्यवस्थित करने का सबसे अच्छा तरीका खोजा। उन्होंने पाया कि शुरुआत में एक "जनरलिस्ट" लेयर (जैसे एक मानक डेंस लेयर) रखने के बाद विशेषज्ञ लेयर्स का उपयोग करना सबसे अच्छा काम करता है।
  2. एक्टिवेशन रेट (कॉफी ब्रेक अनुपात): MoE टीम में, "एक्टिवेशन रेट" उन विशेषज्ञों का प्रतिशत है जो वास्तव में किसी समस्या पर काम करने के लिए जागते हैं।
    • यदि आप बहुत कम विशेषज्ञों को जगाते हैं (बहुत कम दर), तो टीम के पास पर्याप्त मानसिक शक्ति नहीं होगी।
    • यदि आप बहुत अधिक विशेषज्ञों को जगाते हैं (बहुत अधिक दर), तो टीम भ्रमित हो जाएगी और अपना विशेष फोकस खो देगी।
    • स्वर्ण नियम: शोधकर्ताओं ने पाया कि एक "स्वीट स्पॉट" है जहाँ ठीक 20% विशेषज्ञ जागते हैं। चाहे पुस्तकालय छोटा हो (2 बिलियन किताबें) या मध्यम आकार का (7 बिलियन किताबें), यह 20% का नियम हमेशा सबसे अच्छे परिणाम देता है।

डेटा की समस्या: कहानियों का पुन: उपयोग
एक अड़चन थी। क्योंकि विशेषज्ञों की टीम बहुत कुशल है, उन्हें उतना सीखने के लिए अधिक कहानियाँ पढ़ने की आवश्यकता होगी जितना कि विशाल लाइब्रेरियन को। यदि आप उन्हें विशाल लाइब्रेरियन के समान ही अनूठी कहानियाँ देते हैं, तो वे पीछे रह जाएंगे।

इस समस्या को हल करने के लिए, शोधकर्ताओं ने डेटा रियूज (Data Reuse) नामक रणनीति का परीक्षण किया। कल्पना कीजिए कि विशाल लाइब्रेरियन एक कहानी को एक बार पढ़ता है। विशेषज्ञों की टीम उसी कहानी को पढ़ती है, लेकिन वे उस कहानी को दो या तीन बार पढ़ते हैं (डेटा का पुन: उपयोग करते हैं)।

  • परिणाम: भले ही विशेषज्ञों की टीम को विशाल लाइब्रेरियन के समान ही अनूठी कहानियाँ पढ़ने के लिए मजबूर किया गया (पुनः पढ़कर), वे फिर भी विशाल लाइब्रेरियन से बेहतर प्रदर्शन करने में सफल रहे, बशर्ते वे उस 20% एक्टिवेशन रेट का पालन करें।

निष्कर्ष
पेपर निष्कर्ष निकालता है कि हाँ, विशेषज्ञों की टीम विशाल लाइब्रेरियन को हरा सकती है, भले ही उनके पास कुल संसाधन (किताबें, समय और अनूठी कहानियाँ) बिल्कुल समान हों।

हालाँकि, यह तभी काम करता है जब आप:

  1. टीम का लेआउट पूरी तरह से डिज़ाइन करें।
  2. विशेषज्ञों के "जागने" की दर को उस जादुई 20% पर रखें।
  3. टीम को दक्षता के अंतर की भरपाई करने के लिए कुछ कहानियों को अतिरिक्त बार पढ़ने की अनुमति दें।

संक्षेप में, यह पेपर सिद्ध करता है कि सही डिज़ाइन और थोड़े से "पुनः पढ़ने" के साथ, एक विशेष विशेषज्ञ टीम बनाना एक एकल, विशाल कार्यकर्ता की तुलना में अधिक शक्तिशाली तरीका है, भले ही बजट समान हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →