← नवीनतम पेपर
💻 computer science

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

यह शोध पत्र DySL-VLA का प्रस्ताव करता है, जो एक नवीन ढांचा (framework) है जो क्रिया के महत्व के आधार पर कम महत्वपूर्ण नेटवर्क परतों को गतिशील रूप से छोड़कर रोबोटिक हेरफेर (manipulation) के लिए विजन-लैंग्वेज-एक्शन मॉडल के अनुमान (inference) को त्वरित करता है, जिससे कार्य सफलता दरों को बनाए रखते हुए या उनमें सुधार करते हुए महत्वपूर्ण गति वृद्धि और पैरामीटर में कमी प्राप्त होती है।

मूल लेखक: Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी बनाना सिखा रहे हैं। आप उसे एक सरल कमांड देते हैं: "कप उठाओ और कॉफी डालो।"

इसे करने के लिए, रोबोट एक बहुत ही स्मार्ट दिमाग का उपयोग करता है जिसे विज़न-लैंग्वेज-एक्शन (VLA) मॉडल कहा जाता है। यह दिमाग कैमरे को देखता है, आपके शब्दों को समझता है, और तय करता है कि उसके हाथ को ठीक कैसे हिलाना है।

समस्या:
यह दिमाग अविश्वसनीय रूप से शक्तिशाली है, लेकिन यह एक विशाल, हाई-परफॉर्मेंस सुपरकंप्यूटर की तरह है। यह इतना भारी और धीमा है कि रोबोट वास्तविक समय के कार्यों को करने के लिए पर्याप्त तेज़ नहीं हो पाता है। यह ऐसा है जैसे भीड़भाड़ वाली शहर की सड़क पर फॉर्मूला 1 कार चलाने की कोशिश करना; इसका इंजन बहुत बड़ा है, और कार पैदल यात्रियों के प्रति प्रतिक्रिया देने के लिए बहुत धीमी गति से चलती है।

अंतर्दृष्टि (Insight):
शोधकर्ताओं ने कुछ दिलचस्प देखा: कॉफी बनाने के हर कदम का महत्व समान नहीं होता है।

  • महत्वपूर्ण चरण (Critical Steps): जब रोबोट का ग्रिपर कप को छूने वाला होता है, या जब वह तरल पदार्थ डाल रहा होता है, तो उसे 100% सटीक होने की आवश्यकता होती है। यहाँ एक छोटी सी गलती का मतलब है कि कप टूट जाएगा या कॉफी छलक जाएगी।
  • बोरिंग चरण (Boring Steps): जब रोबोट कप के करीब पहुँचने के लिए खाली स्थान में अपना हाथ घुमा रहा होता है, तो उसे एकदम सटीक होने की आवश्यकता नहीं होती है। वह थोड़ा ढीला-ढाला भी चल सकता है, और कार्य फिर भी सफल हो जाएगा।

समाधान: DySL-VLA (एक "स्मार्ट स्किप" सिस्टम)
यह शोध पत्र एक नया तरीका पेश करता है जिसे DySL-VLA कहा जाता है। इसे एक स्मार्ट ट्रैफिक मैनेजर की तरह समझें जो रोबोट के दिमाग को नियंत्रित करता है। हर कदम पर पूरी ताकत से सोचने के बजाय, यह गतिशील रूप से तय करता है कि किन विचारों के लिए गहरी सोच की आवश्यकता है और किन विचारों को सरसरी तौर पर देखा जा सकता है।

यह कैसे काम करता है, इसके लिए कुछ उपमाएँ (analogies) दी गई हैं:

1. "स्टैटिक बनाम डायनेमिक" लेयर्स (हाईवे की लेन)

रोबोट का दिमाग कई प्रोसेसिंग लेयर्स से बना है, जैसे एक लंबी हाईवे जिसमें कई लेन हों।

  • स्टैटिक लेयर्स (महत्वपूर्ण लेन): ये दिमाग के "महत्वपूर्ण" हिस्सों (जैसे कि सटीक पकड़ की गणना करने वाले हिस्से) के लिए लेन हैं। सिस्टम इन कभी भी स्किप नहीं करता। सुरक्षा सुनिश्चित करने के लिए ये हमेशा पूरी गति से चालू रहती हैं।
  • डायनेमिक लेयर्स (सुंदर दृश्य वाली लेन): ये "बोरिंग" हिस्सों (जैसे खाली स्थान में हाथ हिलाना) के लिए लेन हैं। यदि सुरक्षित हो, तो सिस्टम इन्हें स्किप कर सकता है। यह एक रोड ट्रिप पर शॉर्टकट लेने जैसा है जब आप जानते हैं कि मंजिल अभी भी मिल सकती है।

2. "ट्रैफिक लाइट" (प्रायर-पोस्ट गाइडेंस)

सिस्टम को कैसे पता चलता है कि कब स्किप करना है? यह प्रायर-पोस्ट स्किपिंग गाइडेंस नामक एक चतुर दो-चरणीय जांच का उपयोग करता है।

  • "प्रायर" चेक (आगे देखना): सिस्टम रोबोट की मूवमेंट हिस्ट्री को देखता है। यदि रोबोट सुचारू रूप से और स्थिरता से चल रहा है (जैसे सीधी सड़क पर गाड़ी चलाना), तो सिस्टम कहता है, "ठीक है, हम समय बचाने के लिए अगली कुछ लेयर्स को स्किप कर सकते हैं।"
  • "पोस्ट" चेक (पीछे देखना): यदि रोबोट अचानक रुक जाता है, हिचकिचाता है, या तीखा मोड़ लेता है (जैसे रेड लाइट या पैदल यात्री के पास पहुँचने पर), तो सिस्टम महसूस करता है, "रुको! यह एक महत्वपूर्ण क्षण है!" यह तुरंत स्किपिंग को रोक देता है और सटीकता सुनिश्चित करने के लिए दिमाग को पूरी तरह से प्रोसेस करने के लिए मजबूर करता है।

यह उस ड्राइवर की तरह है जो आमतौर पर हाईवे लेता है लेकिन स्कूल ज़ोन देखते ही तुरंत स्थानीय सड़कों पर आ जाता है और धीमा हो जाता है।

3. "ट्रेनिंग कैंप" (दो-चरणीय डिस्टिलेशन)

रोबोट को यह सिखाना कि कब स्किप करना है, यह कठिन है। यदि आप इसे केवल स्किप करने के लिए कहते हैं, तो यह आलसी हो सकता है और गलत चीज़ों को स्किप कर सकता है।
शोधकर्ताओं ने एक विशेष दो-चरणीय प्रशिक्षण शिविर बनाया:

  1. चरण 1: वे "स्किपिंग शॉर्टकट्स" (जिन्हें एडेप्टर कहा जाता है) को पूरे दिमाग की तरह सोचना सिखाते हैं। यह सुनिश्चित करता है कि शॉर्टकट सटीक हों।
  2. चरण 2: वे "ट्रैफिक लाइट्स" (कंट्रोलर्स) को सिखाते हैं कि इन शॉर्टकट्स का उपयोग कब करना है। वे इसे बहुत सावधानी से करते हैं ताकि रोबोट केवल तभी आलसी बने जब यह सुरक्षित हो, और महत्वपूर्ण समय पर सटीक बना रहे।

परिणाम: तेज़ और स्मार्ट

इस तरीके का उपयोग करके, रोबोट अविश्वसनीय रूप से कुशल हो जाता है:

  • गति: यह पिछले मॉडलों की तुलना में 3.75 गुना तेज़ चलता है।
  • सटीकता: यह वास्तव में कार्यों में बेहतर (2.1% सुधार) हो जाता है क्योंकि यह अपनी ऊर्जा महत्वपूर्ण क्षणों पर केंद्रित करता है।
  • दक्षता: यह 85 गुना कम ट्रेन करने योग्य पैरामीटर्स का उपयोग करता है, जिसका अर्थ है कि इसे वास्तविक दुनिया के छोटे रोबोट कंप्यूटरों (जैसे लैपटॉप या छोटे रोबोटिक आर्म) पर चलाना बहुत सस्ता और आसान है।

सारांश में:
DySL-VLA एक स्मार्ट असिस्टेंट देने जैसा है जो जानता है कि सटीकता के लिए कब "पावर अप" करना है और ऊर्जा बचाने के लिए कब "पावर डाउन" करना है। यह रोबोट को साधारण गतिविधियों पर बहुत अधिक सोचने से रोकता है, जिससे वह वास्तविक दुनिया में अधिक तेज़ी से, सुचारू रूप से और अधिक विश्वसनीयता के साथ चल पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →