← नवीनतम पेपर
🤖 machine learning

Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts

यह शोध पत्र 'एडैप्टिव इनवर्टेड-इंडेक्स राउटिंग फॉर MoE' (AIR-MoE) को प्रस्तुत करता है, जो वेक्टर क्वांटाइजेशन पर आधारित एक दो-चरणीय, ड्रॉप-इन राउटिंग तंत्र है जो मॉडल में संरचनात्मक परिवर्तन की आवश्यकता के बिना उच्च प्रदर्शन बनाए रखते हुए रूटिंग लागत को कम करके ग्रैनुलर मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल्स को कुशलतापूर्वक संभालता है।

मूल लेखक: Klaus-Rudolf Kladny, Maximilian Mordig, Bernhard Schölkopf, Michael Muehlebach

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Klaus-Rudolf Kladny, Maximilian Mordig, Bernhard Schölkopf, Michael Muehlebach

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: "बहुत सारे शेफ" की समस्या

कल्पना कीजिए कि आप एक विशाल रेस्तरां (एक लार्ज लैंग्वेज मॉडल) चला रहे हैं जिसमें 65,000 अलग-अलग शेफ (विशेषज्ञ) हैं। प्रत्येक शेफ एक छोटा विशेषज्ञ है जो हर चीज़ के बारे में थोड़ा-थोड़ा जानता है।

पुराने तरीके में, जब कोई ग्राहक किसी व्यंजन का ऑर्डर देता है (टेक्स्ट का एक टोकन), तो मैनेजर को उन 65,000 शेफों में से हर एक से पूछना पड़ता था, "क्या आप यह बना सकते हैं?" फिर मैनेजर वास्तव में खाना पकाने के लिए शीर्ष 2 शेफों को चुनता था।

  • समस्या: 65,000 लोगों से पूछने में बहुत समय लगता है। यह बहुत धीमा है और ऊर्जा (कंप्यूटेशनल पावर) का एक बड़ा हिस्सा बर्बाद करता है, भले ही आप केवल 2 शेफों का उपयोग कर रहे हों।

"ग्रैनुलर" (Granular) समाधान:
हालिया शोध सुझाव देता है कि कुछ विशाल शेफों के बजाय कई छोटे शेफ होना वास्तव में बेहतर है। लेकिन यह "हर किसी से पूछने" की समस्या को और भी बदतर बना देता है। आपके पास पूछने के लिए अधिक शेफ हैं, लेकिन आपको अभी भी केवल कुछ ही चाहिए।

समाधान: AIR-MoE (एक स्मार्ट लाइब्रेरियन)

लेखक AIR-MoE नामक एक नई प्रणाली प्रस्तावित करते हैं। हर शेफ से पूछने के बजाय, वे एक दो-चरणीय "स्मार्ट लाइब्रेरियन" प्रणाली का उपयोग करते हैं जो इस बात से प्रेरित है कि लाइब्रेरी में किताबें कैसे व्यवस्थित की जाती हैं।

चरण 1: मोटा शॉर्टलिस्ट (कैटलॉग)

कल्पना कीजिए कि 65,000 शेफों को उनकी विशेषज्ञता के आधार पर 1,000 अलग-अलग "बिनों" या "शेल्फों" में व्यवस्थित किया गया है। इन बिनों को कोडवर्ड्स (codewords) कहा जाता है।

  1. जब कोई ग्राहक का ऑर्डर आता है, तो मैनेजर सभी 65,000 शेफों को नहीं देखता है।
  2. वे ऑर्डर को देखते हैं और जल्दी से पता लगाते हैं कि वह किस एक बिन से संबंधित है (जैसे, "यह एक फ्रेंच कुकिंग का ऑर्डर है, इसलिए यह बिन #42 में जाएगा")।
  3. बिन #42 के अंदर, उन शीर्ष 500 शेफों की एक पहले से बनी सूची है जो फ्रेंच भोजन के लिए सबसे उपयुक्त हैं।
  4. जादू: मैनेजर केवल इन 500 शेफों को देखता है। वे बाकी 64,500 शेफों को पूरी तरह से अनदेखा कर देते हैं।

चरण 2: सूक्ष्म स्कोरिंग (इंटरव्यू)

अब जब मैनेजर ने मामले को 500 शेफों तक सीमित कर दिया है, तो वे भोजन पकाने के लिए बिल्कुल शीर्ष 2 को खोजने के लिए केवल उन 500 के साथ एक त्वरित और सटीक इंटरव्यू करता है।

  • यह क्यों काम करता है: 65,000 के बजाय 500 लोगों का इंटरव्यू लेना बहुत तेज़ है। लेकिन क्योंकि "बिन" को समझदारी से व्यवस्थित किया गया था, इसलिए शीर्ष 2 शेफ लगभग निश्चित रूप से उस 500 के समूह में होंगे।

यह कैसे सीखता है (एक "बिना दिमाग वाला" लाइब्रेरियन)

यहाँ पेचीदा हिस्सा है: मैनेजर को कैसे पता चलता है कि कौन से शेफ किस बिन में जाते हैं?

कई कंप्यूटर प्रणालियों में, मैनेजर इसे एक शिक्षक द्वारा ग्रेड दिए जाने की भविष्यवाणी करके सीखने की कोशिश करता है (ग्रेडिएंट्स का उपयोग करके)। लेकिन इस प्रणाली में, मैनेजर (कोडबुक) थोड़ा अलग है।

  • शेफ और ग्राहक के ऑर्डर को शिक्षक (मुख्य AI लर्निंग प्रोसेस) द्वारा प्रशिक्षित किया जाता है।
  • बिन (कोडबुक) को एडैप्टिव स्फेरिकल k-मीन्स (adaptive spherical k-means) नामक एक सरल, नॉन-डिफरेंशिएबल विधि का उपयोग करके अलग से अपडेट किया जाता है। इसे एक ऐसे लाइब्रेरियन के रूप में सोचें जो बिना किसी शिक्षक के बताए, वर्तमान में चेक आउट की जा रही किताबों के आधार पर लगातार शेल्फ को पुनर्व्यवस्थित करता रहता है।

यह बेहतर क्यों है?

पेपर मुख्य रूप से तीन बातें दावा करता है:

  1. गति बनाम गुणवत्ता: यह लगभग उतनी ही अच्छी तरह से सर्वश्रेष्ठ शेफ खोज लेता है जितना कि सभी से पूछना, लेकिन यह काफी कम ऊर्जा (FLٍOPs) का उपयोग करता है। अपने परीक्षणों में, यह अन्य कुशल तरीकों की तुलना में टेक्स्ट का अनुमान लगाने में 10% तक बेहतर था, जबकि कम संसाधनों का उपयोग किया।
  2. कोई कठोर नियम नहीं: पिछले तरीकों ने शेफ को निश्चित समूहों में मजबूर किया (जैसे, "फ्रेंच शेफ केवल ग्रुप A में ही जा सकते हैं")। AIR-MoE लचीला है; एक शेफ कई बिनों में हो सकता है यदि वह कई चीजों में अच्छा है। यह विशेषज्ञों पर एक कठोर संरचना नहीं थोपता है।
  3. यह काम करता है: उन्होंने गणितीय रूप से सिद्ध किया कि यदि बिन अच्छी तरह से व्यवस्थित हैं, तो शीर्ष शेफ लगभग हमेशा शॉर्टलिस्ट में होंगे। उन्होंने यह भी दिखाया कि यह तरीका "डेड शेफ" (ऐसे शेफ जिन्हें कभी खाना पकाने का मौका नहीं मिलता) को रोकता है, जो इन प्रणालियों में एक आम समस्या है।

सारांश उपमा

  • पुराना तरीका: आपको किसी विशिष्ट बीमारी के लिए सर्वश्रेष्ठ 2 डॉक्टरों को खोजने की आवश्यकता है। आप देश के हर डॉक्टर को कॉल करते हैं कि कौन उपलब्ध है। (बहुत धीमा)।
  • अन्य कुशल तरीके: आप केवल एक विशिष्ट शहर के डॉक्टरों को या एक ही उपनाम साझा करने वाले डॉक्टरों को कॉल करते हैं। (तेज़, लेकिन आप उस सर्वश्रेष्ठ डॉक्टर को मिस कर सकते हैं जो कहीं और रहता है या जिसका नाम अलग है)।
  • AIR-MoE: आप एक स्मार्ट डायरेक्टरी का उपयोग करते हैं। आप अपनी बीमारी को देखते हैं, और डायरेक्टरी तुरंत आपको उन शीर्ष 500 डॉक्टरों की सूची दे देती है जो उसमें विशेषज्ञ हैं। फिर आप उस सूची में से सर्वश्रेष्ठ 2 को चुनते हैं। यह तेज़ है, लचीला है, और आप शायद ही कभी सर्वश्रेष्ठ को मिस करते हैं।

पेपर निष्कर्ष निकालता है कि यह "इनवर्टेड इंडेक्स" (लाइब्रेरी कैटलॉग की तरह) दृष्टिकोण एक शक्तिशाली तरीका है जिससे विशाल AI मॉडल को कंप्यूटिंग पावर पर भारी खर्च किए बिना तेज़ और स्मार्ट बनाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →