← नवीनतम पेपर
🤖 machine learning

A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs

यह शोध पत्र Replicate-and-Quantize (R&Q) का प्रस्ताव करता है, जो एक ट्रेनिंग-मुक्त, इन्फरेंस-टाइम फ्रेमवर्क है जो बार-बार चुने जाने वाले विशेषज्ञों (experts) को रेप्लिकेट करके और अन्य को क्वांटाइज़ करके स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल्स में लोड को गतिशील रूप से पुनर्संतुलित करता है, जिससे एक निश्चित मेमोरी बजट के भीतर मॉडल की सटीकता बनाए रखते हुए रूटिंग स्क्यू (routing skew) को काफी कम किया जा सकता है।

मूल लेखक: Zijie Liu, Jie Peng, Jinhao Duan, Zirui Liu, Kaixiong Zhou, Mingfu Liang, Luke Simon, Xi Liu, Zhaozhuo Xu, Tianlong Chen

प्रकाशित 2026-07-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zijie Liu, Jie Peng, Jinhao Duan, Zirui Liu, Kaixiong Zhou, Mingfu Liang, Luke Simon, Xi Liu, Zhaozhuo Xu, Tianlong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस की दुनिया एक हलचल भरी, हाई-टेक रसोई है जहाँ विशाल रोबोट एक साथ लाखों भूखे लोगों के लिए एक आदर्श भोजन बनाने की कोशिश कर रहे हैं। इस भारी मांग को संभालने के लिए, इन रोबोटों के पास केवल एक विशाल मस्तिष्क नहीं है; बल्कि उनके पास विशेषज्ञ शेफ की एक टीम है, जिनमें से प्रत्येक एक विशिष्ट सामग्री या रेसिपी का विशेषज्ञ है। इस सेटअप को "स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स" (SMoE) कहा जाता है। हर शेफ द्वारा हर एक व्यंजन पकाने के बजाय, एक स्मार्ट मैनेजर (जिसे "रूटर" कहा जाता है) प्रत्येक ऑर्डर को देखता है और उसे उन कुछ शेफों के पास भेजता है जो उस विशिष्ट कार्य के लिए सबसे अच्छे हैं। यह अविश्वसनीय रूप से कुशल है, जिससे ये रोबोट विशाल और बुद्धिमान हो सकते हैं बिना किसी शहर के आकार की रसोई की आवश्यकता के।

हालाँकि, एक समस्या है। एक वास्तविक रसोई की तरह, मैनेजर कभी-कभी थोड़ा पक्षपाती हो जाता है। यदि कोई ग्राहक एक लोकप्रिय व्यंजन का ऑर्डर देता है, तो मैनेजर शायद सभी ऑर्डर उन्हीं कुछ "स्टार शेफ" के पास भेजने लगता है, जबकि अन्य प्रतिभाशाली शेफ खाली हाथ खड़े रहते हैं, काम का इंतज़ार करते हुए। इसे "लोड इम्बैलेंस" (भार असंतुलन) कहा जाता है। स्टार शेफ अत्यधिक व्यस्त हो जाता है और पूरी लाइन को धीमा कर देता है, जबकि अन्य ऊर्जा बर्बाद करते हुए कुछ नहीं करते। यह शोध पत्र इस समस्या को हल करने के तरीके पर केंद्रित है: कि कैसे इस गड़बड़ी को ठीक किया जाए जब रसोई पहले से ही व्यवसाय के लिए खुली हो, बिना किसी को नौकरी से निकाले, नए कर्मचारी रखे या मैनेजर के नियम पुस्तिका को दोबारा लिखे।

समस्या: अत्यधिक व्यस्त स्टार शेफ

शोधकर्ताओं ने देखा कि भले ही ये AI रसोई निष्पक्ष होने के लिए डिज़ाइन की गई हों, वे अक्सर एक ही ढर्रे में फंस जाती हैं। जब एक साथ बहुत सारे ऑर्डर (एक "बैच") आते हैं, तो मैनेजर लगभग सब कुछ कुछ चुनिकी "हैवी-हिटर" विशेषज्ञों की ओर भेजने लगता है। ये विशेषज्ञ बाधा (bottleneck) बन जाते हैं, जिससे पूरा सिस्टम धीमा हो जाता है, जबकि बाकी टीम खाली बैठी रहती है।

टीम ने पहले यह जांचा कि क्या केवल मैनेजर को निष्पक्ष होने के लिए फिर से प्रशिक्षित करना समस्या को ठीक कर देगा। उन्होंने विभिन्न प्रशिक्षण युक्तियों का परीक्षण किया, जैसे कि अन्याय के लिए दंड जोड़ना, लेकिन उन्होंने एक निराशाजनक समझौता पाया: मैनेजर को निष्पक्ष बनाने से अक्सर रोबोट के उत्तर कम सटीक हो जाते थे। यह ऐसा था जैसे किसी शेफ को उसका सिग्नेचर डिश बनाना छोड़ने के लिए मजबूर करना ताकि बाकी सब खाना बना सकें; भोजन का स्वाद उतना अच्छा नहीं रहता। उन्होंने यह भी पाया कि जब आप एक साथ अधिक लोगों को सेवा देने की कोशिश करते हैं, तो समस्या और बढ़ जाती है। जैसे-जैसे बैच का आकार बढ़ा, असंतुलन विस्फोट की तरह बढ़ा, जिससे सिस्टम अक्षम और धीमा हो गया।

खोज: लोकप्रियता सब कुछ नहीं है

एक समाधान बनाने से पहले, टीम ने एक आश्चर्यजनक खोज की। उन्होंने बारीकी से देखा कि किन विशेषज्ञों को सबसे अधिक काम मिल रहा है और इसकी तुलना इस बात से की कि कौन से विशेषज्ञ सही उत्तर प्राप्त करने के लिए वास्तव में सबसे महत्वपूर्ण थे। उन्होंने पाया कि लोकप्रिय होने का मतलब महत्वपूर्ण होना नहीं है।

कुछ विशेषज्ञ बहुत अधिक काम (उच्च लोड) प्राप्त कर रहे थे, लेकिन यदि आप उन्हें हटा दें, तो रोबोट के प्रदर्शन में बहुत कम गिरावट आती है। इसके विपरीत, कुछ विशेषज्ञ जिन्हें शायद ही कभी बुलाया जाता था, लेकिन जब उपयोग किया जाता था तो वे अत्यंत महत्वपूर्ण होते थे। मैनेजर "बार-बार आने वाले अनुरोधों" और "उच्च मूल्य" के बीच भ्रमित हो रहा था। इसका मतलब था कि टीम को सभी विशेषज्ञों के साथ एक जैसा व्यवहार करने की आवश्यकता नहीं थी; वे अत्यधिक व्यस्त विशेषज्ञों और कम उपयोग किए जाने वाले विशेषज्ञों के साथ अलग-अलग व्यवहार कर सकते थे।

समाधान: "रेप्लिकेट-एंड-क्वांटाइज" रणनीति

पूरे सिस्टम को फिर से प्रशिक्षित किए बिना इस बाधा को ठीक करने के लिए, लेखकों ने रेप्लिकेट-एंड-क्वांटाइज (R&Q) नामक एक चतुर, प्लग-एंड-प्ले रणनीति प्रस्तावित की। इसे एक गतिशील रसोई पुनर्गठन के रूप में सोचें जो ऑर्डर आने पर तुरंत होता है।

  1. हैवी-हिटर्स को रेप्लिकेट (प्रतिलिपि बनाना) करें: जब सिस्टम एक ऐसे विशेषज्ञ की पहचान करता है जो काम में डूब रहा है ("हैवी-हिटर"), तो वह उसे हटाता नहीं है। इसके बजाय, वह उस विशेषज्ञ की एक "क्लोन" बनाता है। लेकिन यहाँ एक ट्रिक है: क्लोन एक "लाइटवेट" (हल्का) संस्करण है। यह वही शेफ है, लेकिन वे एक थोड़े छोटे, अधिक कुशल टूलकिट (कम-परिशुद्धता गणित, या "क्वांटाइजेशन" का उपयोग करके) के साथ काम कर रहे हैं। यह सिस्टम को भारी काम को मूल शेफ और क्लोन के बीच विभाजित करने की अनुमति देता है, जिससे बिना बड़ी रसोई की आवश्यकता के गति दोगुनी हो जाती है।
  2. अल्प-उपयोग किए गए विशेषज्ञों को क्वांटाइज करें: मेमोरी समाप्त किए बिना इन नए क्लोन के लिए जगह बनाने के लिए, सिस्टम उन विशेषज्ञों को देखता है जो बहुत कम काम कर रहे हैं। इन "कम महत्वपूर्ण" विशेषज्ञों को भी हल्का टूलकिट दिया जाता है। चूंकि वे बहुत कम ऑर्डर संभाल रहे हैं, इसलिए उनके टूलकिट को छोटा करने से भोजन की गुणवत्ता को नुकसान नहीं पहुँचता है।

इन दोनों को एक साथ करके—व्यस्त शेफ के भार को विभाजित करके और निष्क्रिय शेफ के औजारों को छोटा करके—सिस्टम अपने मूल मेमोरी बजट के भीतर रहता है लेकिन बहुत तेज़ी से और अधिक निष्पक्ष रूप से चलता है।

परिणाम: एक संतुलित रसोई

टीम ने इस रणनीति का परीक्षण कई अलग-अलग AI मॉडल और गणित की समस्याओं को हल करने से लेकर दुनिया के बारे में कठिन प्रश्न पूछने जैसे कार्यों की एक विस्तृत श्रृंखला पर किया। उन्होंने एक नया स्कोर बनाया जिसे उन्होंने लोड इम्बैलेंस स्कोर (LIS) कहा, जहाँ 1 का स्कोर पूर्ण संतुलन है और उच्च संख्या अधिक अराजकता का संकेत देती है।

परिणाम प्रभावशाली थे। R&Q रणनीति ने मूल, बिना संशोधित मॉडल की तुलना में लोड इम्बैलेंस को 1.4 गुना तक कम करने में सफलता प्राप्त की। उदाहरण के लिए, GSM8K नामक एक कठिन गणितीय डेटासेट पर, एक मॉडल के लिए असंतुलन स्कोर 1.9709 से गिरकर 1.3937 हो गया। PIQA नामक दूसरे डेटासेट पर, यह 4.3504 से गिरकर 3.2925 हो गया।

महत्वपूर्ण रूप से, इस दक्षता में भारी सुधार बिना उत्तरों की गुणवत्ता की लागत के आया। मॉडलों की सटीकता मूल से ±0.6% के भीतर रही। कुछ मामलों में, जैसे कि MMLU डेटासेट पर, सटीकता वास्तव में थोड़ी सुधरी (एक मॉडल के लिए 23.0% से 25.2%)। शोधकर्ताओं ने इसे एक "स्ट्रीमिंग" परिदृश्य में भी परीक्षण किया, जहाँ ऑर्डर एक के बाद एक एक निरंतर नदी की तरह आते हैं, और पाया कि सिस्टम समय के साथ स्थिर और संतुलित रहा, जिससे सिद्ध हुआ कि यह काम करता है जब कार्यभार अप्रत्याशित हो।

इसका क्या अर्थ है

यह शोध पत्र यह सुझाव देता है कि हमें अपने AI मॉडल को कुशल बनाने के लिए उन्हें पूरी तरह से फिर से बनाने की आवश्यकता नहीं है। केवल यह पहचानकर कि मस्तिष्क के कुछ हिस्से अत्यधिक व्यस्त हैं जबकि अन्य कम उपयोग किए जा रहे हैं, और फिर व्यस्त हिस्सों को क्लोन करते हुए और निष्क्रिय हिस्सों को छोटा करते हुए, हम एक बहुत अधिक सुचारू, तेज़ और निष्पक्ष प्रणाली बना सकते हैं। यह एक व्यावहारिक, "प्लग-एंड-प्ले" समाधान है जो इन विशाल AI मस्तिष्क को एक सुव्यवस्थित मशीन की तरह चलाने में मदद करता है, जो बिना किसी बड़े बदलाव के वास्तविक दुनिया के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →