OrderMoE: An expert similarity driven distributed edge MoE inference
OrderMoE एक नवीन फ्रेमवर्क है जो विशेषज्ञ समानता (expert similarity) का लाभ उठाकर रिमोट विशेषज्ञों के लिए स्थानीय प्रतिस्थापन (local substitution) को सक्षम बनाता है, जिससे डिस्ट्रीब्यूटेड एज MoE इन्फरेंस को त्वरित किया जाता है, और यह इन्फरेंस की गुणवत्ता को नियंत्रित रखते हुए विलंबता (latency) और संचार ओवरहेड को महत्वपूर्ण रूप से कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंटरनेट की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें जहाँ बहुत बुद्धिमान कंप्यूटर (जिन्हें लार्ज लैंग्वेज मॉडल्स कहा जाता है) रहते हैं। ये कंप्यूटर बहुत ही प्रतिभाशाली पुस्तकालयाध्यक्षों (लाइब्रेरियन) की तरह हैं जो आपके किसी भी प्रश्न का उत्तर दे सकते हैं, कहानियाँ लिख सकते हैं, या गणित की समस्याओं को हल कर सकते हैं। हालाँकि, ये लाइब्रेरियन इतने विशाल और भारी हैं कि वे आपके फोन या आपके स्थानीय कॉफी शॉप के कंप्यूटर में फिट नहीं हो सकते। आमतौर पर, उत्तर पाने के लिए, आपके फोन को एक सवाल लेकर पूरे शहर के पार एक विशाल डेटा सेंटर तक चिल्लाकर भेजना पड़ता है, फिर उस विशाल लाइब्रेरियन के सोचने का इंतज़ार करना पड़ता है, और फिर उत्तर वापस चिल्लाकर आने का इंतज़ार करना पड़ता है। इसमें समय लगता है और यह शहर के बहुत सारे "सड़क स्थान" (बैंडविड्थ) का उपयोग करता है।
इसे तेज़ बनाने के लिए, वैज्ञानिकों ने एक नए प्रकार के लाइब्रेरियन का आविष्कार किया है जिसे "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) कहा जाता है। एक विशाल मस्तिष्क के बजाय, यह लाइब्रेरियन वास्तव में कई छोटे विशेषज्ञों की एक टीम है। जब आप कोई प्रश्न पूछते हैं, तो एक स्मार्ट मैनेजर (जिसे राउटर कहा जाता है) उस विशिष्ट कार्य के लिए आवश्यक केवल दो या तीन विशेषज्ञों को जल्दी से चुन लेता है और बाकी को अनदेखा कर देता है। यह लाइब्रेरियन को बहुत तेज़ और हल्का बना देता है। लेकिन पेचीदा बात यह है कि एक वितरित एज सिस्टम (distributed edge system) में, ये विशेषज्ञ एक बड़ी इमारत में रहने के बजाय विभिन्न स्थानीय सर्वरों (जैसे विभिन्न कॉफी शॉप या पड़ोस के केंद्रों) में बिखरे हुए होते हैं। यदि राउटर एक ऐसा विशेषज्ञ चुनता है जो तीन कस्बों दूर एक कॉफी शॉप में काम कर रहा है, तो आपके फोन को अपना सवाल वहां तक भेजना होगा और उत्तर वापस आने का इंतज़ार करना होगा। एक शहर में संकरी, भीड़भाड़ वाली सड़कों के साथ, यह यात्रा का समय उतना ही धीमा हो सकता है जितना कि विशाल डेटा सेंटर से बात करना।
यहीं पर OrderMoE नामक एक नया अध्ययन आता है। आठ भौतिक सर्वरों के एक वास्तविक टेस्टबेड के साथ काम करने वाले शोधकर्ताओं ने एक सरल लेकिन चतुर प्रश्न पूछा: क्या होगा यदि हमेशा उस सटीक विशेषज्ञ को भेजने के बजाय जिसे राउटर ने चुना है, हम एक अलग विशेषज्ञ का उपयोग कर सकें जो बिल्कुल बगल में है और लगभग वही काम करता है?
यह शोध पत्र सुझाव देता है कि इनमें से कई विशेषज्ञ, भले ही उनके नाम अलग हों, वास्तव में बहुत समान तरीके से सोचते हैं। लेखकों ने पाया कि उनके "विचार पैटर्न" (जिसे राउटर-इंड्यूस्ड लॉजिट्स कहा जाता है) की समानता को मापकर, वे इन विशेषज्ञों को परिवारों में समूहित कर सकते हैं। यदि राउटर एक ऐसे विशेषज्ञ को चुनता है जो दूर है, तो OrderMoE जाँचता है कि क्या पास में कोई "कजिन" (समान) विशेषज्ञ है जो काम करने के लिए पर्याप्त समान है। यदि ऐसा है, तो प्रश्न को स्थानीय स्तर पर ही संभाल लिया जाता है, जिससे शहर के लंबे, धीमे सफर की बचत होती है।
हालाँकि, शोधकर्ता जानते थे कि यह एक नाजुक संतुलन है। एक सटीक विशेषज्ञ के बजाय एक 'कजिन' का उपयोग करने से समय तो बच सकता है, लेकिन इसका मतलब यह भी हो सकता है कि उत्तर उतना सटीक नहीं होगा। इस समस्या को हल करने के लिए, उन्होंने एक स्मार्ट ट्रैफिक कंट्रोलर बनाया है जो हर एक प्रश्न के लिए यह तय करता है कि क्या दूर स्थित सटीक विशेषज्ञ तक प्रश्न भेजना सुरक्षित है या क्या पास के किसी 'कजिन' का उपयोग करना बेहतर है। यह कंट्रोलर आगे की ओर भी देखता है, यह सोचता है कि अगला प्रश्न कहाँ जा सकता है, ताकि वह गलती से प्रश्न को ऐसे सर्वर पर न भेज दे जो अगले चरण के लिए एक खराब जगह साबित हो।
जब उन्होंने आठ सर्वरों के एक वास्तविक नेटवर्क पर OrderMoE का परीक्षण किया, जिसमें अलग-अलग गति और मेमोरी आकार थे, तो परिणाम प्रभावशाली थे। सिस्टम अन्य तरीकों की तुलना में औसत प्रतीक्षा समय (लेटेंसी) को लगभग 40% से 51% तक कम करने में सफल रहा, और इसने सर्वरों के बीच यात्रा करने वाले डेटा की मात्रा को बहुत बड़े अंतर से कम कर दिया। शायद सबसे महत्वपूर्ण बात यह है कि उत्तरों की गुणवत्ता में बहुत मामूली गिरावट आई—केवल एक बहुत ही छोटा, लगभग न दिखने वाला अंतर। यह अध्ययन दिखाता है कि स्थानीय सर्वरों को समान विशेषज्ञों के साथ बदलने की अनुमति देकर, हम AI को बहुत तेज़ और अधिक प्रतिक्रियाशील बना सकते हैं बिना बड़े, अधिक महंगे डेटा सेंटर बनाए। यह कुछ ऐसा है जैसे यह महसूस करना कि आपको एक विशिष्ट प्रकार का सैंडविच पाने के लिए अगले शहर जाने की ज़रूरत नहीं है; आपके पास की दुकान में बिल्कुल वैसा ही मिलता-जुलता सैंडविच है, और वह सेकंडों में तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।