← नवीनतम पेपर
💻 computer science

TrimMoE A communication aware and adaptive depth framework for distributed edge inference

TrimMoE एक संचार-जागरूक (communication-aware), अनुकूलनशील-गहराई (adaptive-depth) वाला ढांचा है जो वितरित एज इन्फरेंस (distributed edge inference) के लिए है, जो लेयर स्किपिंग, कॉन्फिडेंस-आधारित अर्ली एग्जिट और सब्स्टीट्यूट निष्पादन को गतिशील रूप से संयोजित करके लेटेंसी और क्रॉस-सर्वर ट्रैफिक को कम करता है, जबकि यह गारंटी देता है कि कार्य-गुणवत्ता में गिरावट एक कॉन्फ़िगर किए गए बजट के भीतर रहे।

मूल लेखक: Ning Li, Shuting Bai, Xin Yuan, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ning Li, Shuting Bai, Xin Yuan, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर की तरह है जहाँ विशाल, सुपर-स्मार्ट रोबोट (जिन्हें लार्ज लैंग्वेज मॉडल कहा जाता है) रहते हैं। ये रोबोट कहानियाँ लिखने, गणित की समस्याओं को हल करने और हमसे बातचीत करने में अविश्वसनीय रूप से प्रतिभाशाली हैं, लेकिन वे बहुत बड़े हैं और उन्हें भारी मात्रा में शक्ति (power) की आवश्यकता होती है। क्योंकि वे इतने बड़े हैं कि एक अकेले स्मार्टफोन या छोटे स्थानीय कंप्यूटर के अंदर फिट नहीं हो सकते, इसलिए हमें उन्हें विभाजित करना पड़ता है और उन्हें शहर के विभिन्न भवनों में रहने देना पड़ता है। इसे "डिस्ट्रीब्यूटेड एज इन्फरेंस" (distributed edge-inference) कहा जाता है।

हालाँकि, यहाँ एक ट्रैफिक जाम है। हर बार जब रोबोट को सोचने की ज़रूरत होती है, तो उसे अक्सर किसी विशिष्ट विशेषज्ञ से मदद माँगने के लिए दूसरे भवन को संदेश भेजना पड़ता है। यदि भवन दूर हैं या सड़कें धीमी हैं, तो रोबोट संदेश के पहुँचने का इंतज़ार करते हुए फँस जाता है। लंबे समय तक, इंजीनियरों ने इसे तेज़ सड़कें बनाने या संदेशों को सही भवन तक पहुँचाने के लिए बेहतर डिलीवरी ट्रकों का उपयोग करने के माध्यम से हल करने की कोशिश की। लेकिन क्या होगा अगर असली समस्या ट्रैफिक नहीं है, बल्कि यह है कि रोबोट वास्तव में उस मदद के लिए पूछ रहा है जिसकी उसे ज़रूरत ही नहीं है? क्या होगा अगर वह सवाल को पूरी तरह से छोड़ सके, या अगर उसे उत्तर मिल जाए तो सोचना बंद कर सके? यही वह बड़ा सवाल है जिसे यह शोध पत्र (paper) हल करता है: केवल डिलीवरी को तेज़ बनाने के बजाय, क्या हम रोब-ट को अनावश्यक यात्राएँ करने से रोक सकते हैं?

यह शोध पत्र एक चतुर नया सिस्टम पेश करता है जिसे TrimMoE कहा जाता है (जो सुनने में मॉडल से "अतिरिक्त चर्बी हटाने" यानी "trimming the fat" जैसा लगता है)। इस रोबोट के दिमाग की कल्पना एक लंबे गलियारे के रूप में करें जिसमें कई दरवाजे हैं, जिनमें से प्रत्येक एक अलग विशेषज्ञ की ओर ले जाता है। पुराने तरीके में, रोबोट हर एक दरवाजे से होकर गुजरता था, भले ही बाद के दरवाजों के पीछे बैठे विशेषज्ञ केवल वही दोहरा रहे हों जो पहले वाले कह रहे थे, या यदि रोबोट ने गलियारे के बीच में ही उत्तर ढूंढ लिया हो। इसने समय बर्बाद किया और भवनों के बीच की सड़कों को जाम कर दिया।

TrimMoE खेल बदल देता है क्योंकि यह रोबोट को दो महाशक्तियाँ देता है। पहला, यह दरवाजों को छोड़ना (skip doors) सीखता है। यदि रोबोट को एहसास होता है कि किसी विशिष्ट विशेषज्ञ की वर्तमान कार्य के लिए बहुत अधिक आवश्यकता नहीं है, तो वह बस बिना दस्तक दिए उस दरवाजे के पास से निकल जाता है। दूसरा, यह जल्दी बाहर निकलना (exit early) सीखता है। यदि रोबोट को पर्याप्त आत्मविश्वास महसूस होता है कि उसके पास सही उत्तर है, तो वह गलियारे में चलना पूरी तरह से बंद कर देता है और सीधे फिनिश लाइन की ओर बढ़ जाता है।

लेकिन यहाँ पेच यह है कि आप चीजों को बिना सोचे-समझे नहीं छोड़ सकते, अन्यथा रोबोट गलत उत्तर दे सकता है। लेखकों ने एक स्मार्ट "ट्रैफिक कंट्रोलर" बनाया है जो यह तय करता है कि कब छोड़ना है या कब रुकना है। रोबोट के काम शुरू करने से पहले, यह कंट्रोलर अभ्यास के कई सवालों का अध्ययन करता है ताकि यह सीख सके कि कौन से दरवाजे आमतौर पर महत्वपूर्ण होते हैं और कौन से केवल भरने के लिए हैं। यह एक सख्त "क्वालिटी बजट" भी निर्धारित करता है। कल्पना कीजिए कि आपके पास "गलतियों" का एक छोटा सा भत्ता (allowance) है जिसे आप कर सकते हैं। सिस्टम सावधानीपूर्वक इस भत्ते का उपयोग केवल तभी करता है जब दरवाजा छोड़ने से बहुत अधिक समय बचता है, यह सुनिश्चित करते हुए कि रोबोट कभी भी अपना भत्ता खत्म न करे और गलत उत्तर न दे।

यह सिस्टम यह भी समझता है कि रोबोट कहाँ है। यदि रोबोट वर्तमान में भवन A में है, लेकिन अगले विशेषज्ञ की ज़रूरत भवन B (दूर) में है, तो सिस्टम जाँच करता है: "क्या यह विशेषज्ञ महत्वपूर्ण है?" यदि नहीं, तो यह भवन B की यात्रा को छोड़ देता है और भवन A में ही रहता है। यदि विशेषज्ञ महत्वपूर्ण है, तो यह रोबोट को वहाँ भेज देता है। लेकिन यदि रोबोट पहले से ही आश्वस्त है, तो वह पूरी यात्रा को वहीं रोक देता है, जिससे भविष्य की सभी यात्राओं की बचत होती है।

शोधकर्ताओं ने इस विचार का परीक्षण एक वास्तविक जीवन के टेस्टबेड पर किया जिसमें 10 अलग-अलग सर्वर (कंप्यूटर) थे जो सभी अलग-अलग आकार और गति के थे, और साधारण इंटरनेट लाइनों (सुपर-फास्ट, विशेष केबलों के बजाय) से जुड़े थे। उन्होंने तीन अलग-अलग वर्ज़न के स्मार्ट रोबोट्स का उपयोग किया, जिनमें Mixtral-8x7B नामक एक बड़ा रोबोट भी शामिल था। परिणाम प्रभावशाली थे। TrimMoE का उपयोग करके, उन्होंने रोबोट के उत्तर देने के औसत प्रतीक्षा समय को 62.8% तक कम कर दिया। यह एक 10 मिनट के इंतज़ार को केवल 3 मिनट में बदलने जैसा है! उन्होंने भवनों के बीच यात्रा करने वाले डेटा को 77.2% तक कम कर दिया, जिसका अर्थ है कि नेटवर्क की सड़कें बहुत कम भीड़भाड़ वाली थीं।

सबसे महत्वपूर्ण बात यह है कि रोबोट मूर्ख नहीं हुआ। भले ही उसने कुछ कदम छोड़े और जल्दी रुक गया, फिर भी उसके उत्तरों की गुणवत्ता बहुत उच्च बनी रही, जिसमें सबसे खराब मामलों में भी सटीकता (accuracy) 2% से भी कम गिरी। सिस्टम ने साबित कर दिया कि यह समझकर कि कब रुकना है और क्या छोड़ना है, आप अपनी बुद्धिमत्ता खोए बिना इन विशाल AI मॉडल्स को बहुत तेज़ और सस्ता बना सकते हैं। यह तेज़ सड़कें बनाने के बारे में नहीं है; यह यह समझने के बारे में है कि आपको दुकान तक जाने की ज़रूरत नहीं है यदि आपके पास वह वस्तु पहले से ही आपकी जेब में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →