← नवीनतम पेपर
💻 computer science

RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA models

यह शोध पत्र RAPID को प्रस्तुत करता है, जो एक नवीन एज-क्लाउड कोलाबोरेटिव इन्फरेंस फ्रेमवर्क है जिसे विजुअल नॉइज़ इंटरफेरेंस और स्टेप-वाइज टास्क रेडंडेंसी को संबोधित करके विजन लैंग्वेज एक्शन मॉडल्स के परिनियोजन को अनुकूलित करने के लिए डिज़ाइन किया गया है, जिससे न्यूनतम ओवरहेड के साथ 1.73x तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Zihao Zheng, Sicheng Tian, Hangyu Cao, Chenyue Li, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihao Zheng, Sicheng Tian, Hangyu Cao, Chenyue Li, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ हैं जो सब्जियां काटने और बर्तन चलाने की कोशिश कर रहे हैं। आपका दिमाग दो हिस्सों से बना है: एक छोटा, तेज़ स्थानीय दिमाग (आपका एज डिवाइस/Edge device) और एक विशाल, अत्यंत बुद्धिमान क्लाउड दिमाग (Cloud)।

समस्या यह है कि आपका स्थानीय दिमाग अकेले जटिल खाना बनाने के कार्यों को करने के लिए बहुत कमजोर है, लेकिन हर बार क्लाउड से मदद मांगना बहुत धीमा हो जाता है क्योंकि इंटरनेट लैग (lag) होता है। आपको काम को बांटने का एक तरीका ढूंढना होगा: आसान काम स्थानीय रूप से करें, और केवल तभी क्लाउड को बुलाएं जब चीजें कठिन हो जाएं।

यह ठीक वही है जिसे RAPID हल करता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है।

समस्या: "भटका हुआ" रोबोट

पिछले तरीकों ने क्लाउड को कब बुलाना है, यह तय करने के लिए जो रोबोट देख रहा है (जैसे कैमरा फीड) पर ध्यान केंद्रित किया।

  • खामी: कल्पना कीजिए कि आप कार चला रहे हैं। यदि आपकी खिड़की के पास से कोई पक्षी उड़ता है या कोई पत्ता बहकर आता है, तो आपका "विज़न-आधारित" सिस्टम भ्रमित हो सकता है और सोच सकता है, "ओह नहीं! कुछ अजीब हो रहा है! मुझे मदद के लिए क्लाउड को बुलाना चाहिए!"
  • परिणाम: रोबोट मूर्खतापूर्ण कारणों (विजुअल नॉइज़) से बार-बार क्लाउड को बुलाता रहता है, जिससे समय और पैसा बर्बाद होता है। साथ ही, यह क्लाउड को ठीक उसी समय बुला सकता है जब रोबोट सहजता से चल रहा हो, जिससे उसकी सहज गति में बाधा आती है।

समाधान: RAPID (एक "शरीर-प्रथम" दृष्टिकोण)

RAPID के लेखकों ने महसूस किया: "दुनिया को मत देखो; अपने शरीर को देखो।"

कैमरे को देखने के बजाय, RAPID रोबोट की मांसपेशियों और जोड़ों (kinematics) को सुनता है। यह दो सरल प्रश्न पूछता है:

  1. क्या रोबोट सुचारू रूप से चल रहा है? (उच्च रेडंडेंसी/High Redundancy)
  2. क्या रोबट किसी चीज़ से टकरा रहा है या अचानक दिशा बदल रहा है? (कम रेडंडेंसी / क्रिटिकल)

उपमा 1: सहज चाल बनाम लड़खड़ाहट

  • सहज चाल (एज निष्पादन/Edge Execution): जब आप एक गलियारे में चल रहे होते हैं, तो आपका शरीर एक अनुमानित लय में चलता है। आपको हर कदम के बारे में गहराई से सोचने की आवश्यकता नहीं होती है। RAPID कहता है, "यह आसान है। स्थानीय रूप से चलते रहो।" यह क्लाउड को परेशान होने से बचाता है।
  • लड़खड़ाहट (क्लाउड ऑफलोड/Cloud Offload): अचानक, आप लड़खड़ा जाते हैं या आपको गिरते हुए फूलदान को पकड़ना पड़ता है। आपके जोड़ झटके लेते हैं, आपका टॉर्क (मांसपेशियों का बल) अचानक बढ़ जाता है, और त्वरण (acceleration) तुरंत बदल जाता है। RAPID इस शारीरिक "झटके" को देखता है और कहता है, "ओह! यह एक महत्वपूर्ण क्षण है! सबसे अच्छा कदम उठाने के लिए तुरंत क्लाउड ब्रेन को बुलाओ!"

उपमा 2: स्मार्ट ट्रैफिक लाइट

रोबोट की गति को एक हाईवे की तरह समझें।

  • पुराने सिस्टम: ट्रैफिक लाइट इस आधार पर बदलती है कि कितने रंगीन वाहन पास से गुजर रहे हैं (विजुअल नॉइज़)। यदि एक चमकीला लाल ट्रक गुजरता है, तो सड़क खाली होने पर भी लाइट लाल हो जाती है।
  • RAPID: ट्रैफिक लाइट ट्रैफिक जाम और दुर्घटनाओं (काइनेमैटिक स्पाइक्स) के आधार पर बदलती है। यदि गाड़ियाँ सुचारू रूप से चल रही हैं, तो लाइट हरी रहती है। यदि कोई दुर्घटना (बल में अचानक उछाल) होती है, तो लाइट लाल हो जाती है ताकि ट्रैफिक को फिर से रूट किया जा सके (डेटा क्लाउड पर भेजा जा सके)।

RAPID कैसे काम करता है (दो-चरणीय नृत्य)

RAPID एक चतुर "डुअल-थ्रेशोल्ड" (Dual-Threshold) प्रणाली का उपयोग करता है, जो एक स्मार्ट मैनेजर की तरह है जिसके अलग-अलग स्थितियों के लिए अलग-अलग नियम हैं:

  1. "गति" का नियम (त्वरण/Acceleration):
    • यदि रोबोट तेजी से चल रहा है (जैसे गेंद पकड़ने के लिए दौड़ना), तो RAPID अचानक रुकने या मुड़ने पर नज़र रखता है। यदि रोबोट झटका लेता है, तो वह क्लाउड को बुलाता है।
  2. "शक्ति" का नियम (टॉर्क/Torque):
    • यदि रोबोट धीरे चल रहा है (जैसे सावधानी से मेज पर कप रखना), तो RAPID पकड़ की ताकत में अचानक बदलाव पर नज़र रखता है। यदि रोबेक्ट को अचानक प्रतिरोध महसूस होता है, तो वह क्लाउड को बुलाता है।

इन दोनों को जोड़कर, RAPID जानता है कि विजुअल नॉइज़ से विचलित हुए बिना बिल्कुल कब अपना दिमाग बदलना है।

परिणाम: तेज़, सस्ता और सुचारू

लेखक ने वास्तविक रोबोट और सिमुलेशन पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • गति: रोबोट पिछले तरीकों की तुलना में 1.73 गुना तेज़ हो गया। इसने बिना किसी कारण के क्लाउड को बुलाने में समय बर्बाद करना बंद कर दिया।
  • दक्षता: इसने रोबोट के स्थानीय कंप्यूटर पर बहुत कम अतिरिक्त काम (5-7% ओवरहेड) जोड़ा।
  • विश्वसनीयता: भले ही कमरा अंधेरा हो, धुंधला हो, या हिलती हुई वस्तुओं से भरा हो, रोबोट ने पूरी तरह से काम करना जारी रखा क्योंकि यह अपनी आँखों पर नहीं, बल्कि अपने शरीर की संवेदनाओं पर निर्भर था।

सारांश

RAPID एक रोबोट को "अंतर्ज्ञान" (gut feeling) देने जैसा है। कुछ भी अजीब देखते ही घबराने के बजाय, यह अपनी शारीरिक संवेदनाओं पर भरोसा करता है। यह कार्य के उबाऊ और सहज हिस्सों को खुद संभालता है और केवल तभी मदद मांगता है जब उसे शारीरिक रूप से अचानक बदलाव या टक्कर महसूस होती है। यह रोबोट को तेज़, स्मार्ट और एक अस्त-व्यस्त वातावरण में भ्रमित होने से बचाने में बहुत सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →