TrimMoE A communication aware and adaptive depth framework for distributed edge inference
TrimMoE एक संचार-जागरूक (communication-aware), अनुकूलनशील-गहराई (adaptive-depth) वाला ढांचा है जो वितरित एज इन्फरेंस (distributed edge inference) के लिए है, जो लेयर स्किपिंग, कॉन्फिडेंस-आधारित अर्ली एग्जिट और सब्स्टीट्यूट निष्पादन को गतिशील रूप से संयोजित करके लेटेंसी और क्रॉस-सर्वर ट्रैफिक को कम करता है, जबकि यह गारंटी देता है कि कार्य-गुणवत्ता में गिरावट एक कॉन्फ़िगर किए गए बजट के भीतर रहे।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर की तरह है जहाँ विशाल, सुपर-स्मार्ट रोबोट (जिन्हें लार्ज लैंग्वेज मॉडल कहा जाता है) रहते हैं। ये रोबोट कहानियाँ लिखने, गणित की समस्याओं को हल करने और हमसे बातचीत करने में अविश्वसनीय रूप से प्रतिभाशाली हैं, लेकिन वे बहुत बड़े हैं और उन्हें भारी मात्रा में शक्ति (power) की आवश्यकता होती है। क्योंकि वे इतने बड़े हैं कि एक अकेले स्मार्टफोन या छोटे स्थानीय कंप्यूटर के अंदर फिट नहीं हो सकते, इसलिए हमें उन्हें विभाजित करना पड़ता है और उन्हें शहर के विभिन्न भवनों में रहने देना पड़ता है। इसे "डिस्ट्रीब्यूटेड एज इन्फरेंस" (distributed edge-inference) कहा जाता है।
हालाँकि, यहाँ एक ट्रैफिक जाम है। हर बार जब रोबोट को सोचने की ज़रूरत होती है, तो उसे अक्सर किसी विशिष्ट विशेषज्ञ से मदद माँगने के लिए दूसरे भवन को संदेश भेजना पड़ता है। यदि भवन दूर हैं या सड़कें धीमी हैं, तो रोबोट संदेश के पहुँचने का इंतज़ार करते हुए फँस जाता है। लंबे समय तक, इंजीनियरों ने इसे तेज़ सड़कें बनाने या संदेशों को सही भवन तक पहुँचाने के लिए बेहतर डिलीवरी ट्रकों का उपयोग करने के माध्यम से हल करने की कोशिश की। लेकिन क्या होगा अगर असली समस्या ट्रैफिक नहीं है, बल्कि यह है कि रोबोट वास्तव में उस मदद के लिए पूछ रहा है जिसकी उसे ज़रूरत ही नहीं है? क्या होगा अगर वह सवाल को पूरी तरह से छोड़ सके, या अगर उसे उत्तर मिल जाए तो सोचना बंद कर सके? यही वह बड़ा सवाल है जिसे यह शोध पत्र (paper) हल करता है: केवल डिलीवरी को तेज़ बनाने के बजाय, क्या हम रोब-ट को अनावश्यक यात्राएँ करने से रोक सकते हैं?
यह शोध पत्र एक चतुर नया सिस्टम पेश करता है जिसे TrimMoE कहा जाता है (जो सुनने में मॉडल से "अतिरिक्त चर्बी हटाने" यानी "trimming the fat" जैसा लगता है)। इस रोबोट के दिमाग की कल्पना एक लंबे गलियारे के रूप में करें जिसमें कई दरवाजे हैं, जिनमें से प्रत्येक एक अलग विशेषज्ञ की ओर ले जाता है। पुराने तरीके में, रोबोट हर एक दरवाजे से होकर गुजरता था, भले ही बाद के दरवाजों के पीछे बैठे विशेषज्ञ केवल वही दोहरा रहे हों जो पहले वाले कह रहे थे, या यदि रोबोट ने गलियारे के बीच में ही उत्तर ढूंढ लिया हो। इसने समय बर्बाद किया और भवनों के बीच की सड़कों को जाम कर दिया।
TrimMoE खेल बदल देता है क्योंकि यह रोबोट को दो महाशक्तियाँ देता है। पहला, यह दरवाजों को छोड़ना (skip doors) सीखता है। यदि रोबोट को एहसास होता है कि किसी विशिष्ट विशेषज्ञ की वर्तमान कार्य के लिए बहुत अधिक आवश्यकता नहीं है, तो वह बस बिना दस्तक दिए उस दरवाजे के पास से निकल जाता है। दूसरा, यह जल्दी बाहर निकलना (exit early) सीखता है। यदि रोबोट को पर्याप्त आत्मविश्वास महसूस होता है कि उसके पास सही उत्तर है, तो वह गलियारे में चलना पूरी तरह से बंद कर देता है और सीधे फिनिश लाइन की ओर बढ़ जाता है।
लेकिन यहाँ पेच यह है कि आप चीजों को बिना सोचे-समझे नहीं छोड़ सकते, अन्यथा रोबोट गलत उत्तर दे सकता है। लेखकों ने एक स्मार्ट "ट्रैफिक कंट्रोलर" बनाया है जो यह तय करता है कि कब छोड़ना है या कब रुकना है। रोबोट के काम शुरू करने से पहले, यह कंट्रोलर अभ्यास के कई सवालों का अध्ययन करता है ताकि यह सीख सके कि कौन से दरवाजे आमतौर पर महत्वपूर्ण होते हैं और कौन से केवल भरने के लिए हैं। यह एक सख्त "क्वालिटी बजट" भी निर्धारित करता है। कल्पना कीजिए कि आपके पास "गलतियों" का एक छोटा सा भत्ता (allowance) है जिसे आप कर सकते हैं। सिस्टम सावधानीपूर्वक इस भत्ते का उपयोग केवल तभी करता है जब दरवाजा छोड़ने से बहुत अधिक समय बचता है, यह सुनिश्चित करते हुए कि रोबोट कभी भी अपना भत्ता खत्म न करे और गलत उत्तर न दे।
यह सिस्टम यह भी समझता है कि रोबोट कहाँ है। यदि रोबोट वर्तमान में भवन A में है, लेकिन अगले विशेषज्ञ की ज़रूरत भवन B (दूर) में है, तो सिस्टम जाँच करता है: "क्या यह विशेषज्ञ महत्वपूर्ण है?" यदि नहीं, तो यह भवन B की यात्रा को छोड़ देता है और भवन A में ही रहता है। यदि विशेषज्ञ महत्वपूर्ण है, तो यह रोबोट को वहाँ भेज देता है। लेकिन यदि रोबोट पहले से ही आश्वस्त है, तो वह पूरी यात्रा को वहीं रोक देता है, जिससे भविष्य की सभी यात्राओं की बचत होती है।
शोधकर्ताओं ने इस विचार का परीक्षण एक वास्तविक जीवन के टेस्टबेड पर किया जिसमें 10 अलग-अलग सर्वर (कंप्यूटर) थे जो सभी अलग-अलग आकार और गति के थे, और साधारण इंटरनेट लाइनों (सुपर-फास्ट, विशेष केबलों के बजाय) से जुड़े थे। उन्होंने तीन अलग-अलग वर्ज़न के स्मार्ट रोबोट्स का उपयोग किया, जिनमें Mixtral-8x7B नामक एक बड़ा रोबोट भी शामिल था। परिणाम प्रभावशाली थे। TrimMoE का उपयोग करके, उन्होंने रोबोट के उत्तर देने के औसत प्रतीक्षा समय को 62.8% तक कम कर दिया। यह एक 10 मिनट के इंतज़ार को केवल 3 मिनट में बदलने जैसा है! उन्होंने भवनों के बीच यात्रा करने वाले डेटा को 77.2% तक कम कर दिया, जिसका अर्थ है कि नेटवर्क की सड़कें बहुत कम भीड़भाड़ वाली थीं।
सबसे महत्वपूर्ण बात यह है कि रोबोट मूर्ख नहीं हुआ। भले ही उसने कुछ कदम छोड़े और जल्दी रुक गया, फिर भी उसके उत्तरों की गुणवत्ता बहुत उच्च बनी रही, जिसमें सबसे खराब मामलों में भी सटीकता (accuracy) 2% से भी कम गिरी। सिस्टम ने साबित कर दिया कि यह समझकर कि कब रुकना है और क्या छोड़ना है, आप अपनी बुद्धिमत्ता खोए बिना इन विशाल AI मॉडल्स को बहुत तेज़ और सस्ता बना सकते हैं। यह तेज़ सड़कें बनाने के बारे में नहीं है; यह यह समझने के बारे में है कि आपको दुकान तक जाने की ज़रूरत नहीं है यदि आपके पास वह वस्तु पहले से ही आपकी जेब में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।