← नवीनतम पेपर
💻 computer science

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

यह शोध पत्र ReactVLA को प्रस्तुत करता है, जो एक हल्का और कम विलंबता वाला विजन-लैंग्वेज-एक्शन फ्रेमवर्क है, जो वन-टू-फ्यू-स्टेप इन्फरेंस के लिए एक उन्नत मीन फ्लो एक्शन जनरेटर और बेहतर फीचर रूटिंग के लिए एक डायनेमिक अटेंशन रेसिडुअल्स मैकेनिज्म को संयोजित करके वास्तविक समय की रिएक्टिव रोबोट मैनिपुलेशन प्राप्त करता है, जिसके परिणामस्वरूप मौजूदा डिफ्यूजन-आधारित मॉडलों की तुलना में काफी तेज़ इन्फरेंस गति और बेहतर कार्य प्रदर्शन प्राप्त होता है।

मूल लेखक: Yanzhao Guo, Wenkai Chen, Jianwei Zhang

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanzhao Guo, Wenkai Chen, Jianwei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को एक संतरा उठाने और उसे एक टोकरी में रखने के लिए सिखाने की कोशिश कर रहे हैं। इसके लिए, रोबोट को एक "दिमाग" (एक सॉफ्टवेयर पॉलिसी) की आवश्यकता होगी जो दुनिया को देखे, आपके वॉयस कमांड को समझे, और यह तय करे कि उसके जोड़ों (joints) को ठीक से कैसे हिलाना है।

लंबे समय तक, सबसे स्मार्ट रोबोट दिमागों ने डिफ्यूजन (Diffusion) नामक एक विधि का उपयोग किया है। इसे इस तरह समझें जैसे आप शोर (static noise) से भरे कैनवास से धीरे-धीरे शोर को मिटाकर एक सटीक चित्र बनाने की कोशिश कर रहे हैं। यह बहुत खूबसूरती से काम करता है और बहुत सुचारू और जटिल मूवमेंट बनाता है। लेकिन इसमें एक कमी है: उस शोर को मिटाने में बहुत समय लगता है। रोबोट को रुकना पड़ता है, सोचना पड़ता है, थोड़ा शोर मिटाना पड़ता है, फिर से रुकना पड़ता है, और इमेज दिखने तक यह प्रक्रिया दर्जनों बार दोहरानी पड़ती है। जब तक वह हिलने का निर्णय लेता है, तब तक शायद संतरा लुढ़क चुका हो, या रोबट इतनी धीमी गति से चल रहा हो कि वह गिरती हुई वस्तु को पकड़ न सके।

ReactVLA एक नया रोबोट दिमाग है जिसे इस "बहुत धीरे सोचने" वाली समस्या को हल करने के लिए बनाया गया है। लेखकों ने इसे दो मुख्य ट्रिक्स के साथ बनाया है:

1. "शॉर्टकट" ड्राइवर (इम्प्रूव्ड मीन फ्लो - Improved Mean Flow)

धीमी, स्टेप-बाय-स्टेप "शोर मिटाने" वाले रास्ते के बजाय, ReactVLA इम्प्रूव्ड मीन फ्लो (Improved Mean Flow) नामक एक विधि का उपयोग करता है।

  • पुराना तरीका: कल्पना कीजिए कि आप न्यूयॉर्क से बोस्टन जा रहे हैं। पुराना तरीका ऐसा है जैसे आप अपना GPS चेक करते हैं, 10 मील चलते हैं, फिर से मैप देखने के लिए रुकते हैं, फिर 10 मील चलते हैं, और फिर रुक जाते हैं। आप पहुँच तो जाते हैं, लेकिन इसमें बहुत समय लगता है।
  • ReactVLA का तरीका: यह विधि पूरी यात्रा के लिए आवश्यक औसत गति और दिशा की गणना एक ही बार में करती है। यह ऐसा है जैसे मैप देखकर यह महसूस करना कि "मुझे उत्तर-पूर्व की ओर 60 मील प्रति घंटे की रफ्तार से जाना है," और बस एक या दो बड़े कदमों में सीधे वहां पहुँच जाना।
  • परिणाम: रोबोट को दर्जनों बार रुककर सोचने की जरूरत नहीं होती। वह लगभग तुरंत निर्णय ले सकता है और हिल सकता है। पेपर का दावा है कि यह मौजूदा सर्वोत्तम मॉडलों की तुलना में 4 गुना तेज़ है और फिर भी सटीक है।

2. "स्मार्ट लाइब्रेरियन" (अटेंशन रेसिडुअल्स - Attention Residuals)

क्योंकि ReactVLA इन "बड़े कदमों" को ले रहा है, इसलिए इसे एक ही नज़र में बहुत स्मार्ट होना होगा। यदि यह कोई विवरण भूल जाता है (जैसे "संतरा फिसलन भरा है" या "टोकरी बाईं ओर है"), तो यह टकरा सकता है।

  • समस्या: मानक रोबोट दिमागों में, जैसे-जैसे जानकारी प्रसंस्करण (processing) की कई परतों से गुजरती है, महत्वपूर्ण विवरण धुंधले हो सकते हैं, जैसे कॉफी के कप में बहुत अधिक पानी मिला देना। स्वाद (महत्वपूर्ण विवरण) कमजोर हो जाता है।
  • ReactVLA का समाधान: उन्होंने अटेंशन रेसिडुअल्स (Attention Residuals) नामक एक फीचर पेश किया है। कल्पना कीजिए कि एक लाइब्रेरियन है जो किताबों को केवल ढेर के रूप में नहीं रखता (जहाँ ऊपर की किताब नीचे वाली को छिपा देती है)। इसके बजाय, इस लाइब्रेरियन के पास एक जादुई प्रणाली है जहाँ, यदि आप कोई प्रश्न पूछते हैं, तो वे लाइब्रेरी में किसी भी किताब से, चाहे वह ढेर में कितनी भी गहराई में क्यों न हो, तुरंत प्रासंगिक पृष्ठ निकाल सकते हैं।
  • परिणाम: रोबोट अपने सभी महत्वपूर्ण संवेदी विवरणों (वह क्या देखता है, क्या सुनता है, उसके जोड़ कहाँ हैं) को स्पष्ट और तीक्ष्ण बनाए रखता है, भले ही वह बहुत तेज़ी से निर्णय ले रहा हो।

उन्होंने क्या सिद्ध किया?

टीम ने इस नए दिमाग का तीन तरीकों से परीक्षण किया:

  1. वीडियो गेम्स (सिमुलेशन): उन्होंने इसे जटिल आभासी दुनिया (LIBERO और RoboIMI) में टेस्ट किया। ReactVLA अन्य स्मार्ट रोबोटों की तुलना में अधिक बार जीता और इसने यह काम बहुत तेज़ी से किया। उदाहरण के लिए, एक कार्य में जहाँ दो रोबोटिक भुजाओं को एक ब्लॉक एक-दूसरे को पास करना था, ReactVLA सुचारू और तेज़ था, जबकि पुराने मॉडल धीमे और अनाड़ी थे।
  2. असली रोबोट: उन्होंने इस दिमाग को एक वास्तविक भौतिक रोबोटिक हाथ (Diana 7) पर लगाया।
    • कार्य: एक संतरा उठाना और लकड़ी के ब्लॉक को स्टैक करना।
    • परिणाम: रोबोट इतनी तेज़ी से प्रतिक्रिया (39 मिलीसेकंड से कम में) दे सका कि वह संतरे को बिना गिराए संभाल सका। जब कार्य कठिन हुआ (ब्लॉक को स्टैक करना), तो ReactVLA 90% बार सफल रहा, जबकि धीमा रोबोट केवल 75% बार सफल हो पाया क्योंकि वह अपनी गलतियों को सुधारने के लिए बहुत धीमा था।

निचोड़ (The Bottom Line)

ReactVLA एक रोबोट को "बहुत सावधानी बरतने वाले धीमे विचारक" से "सावधानी बरतने वाले तेज़ विचारक" में अपग्रेड करने जैसा है। यह यह हासिल करता है कि वह मूवमेंट की गणना करने के तरीके में शॉर्टकट लेता है और देखने के तरीके में अधिक स्मार्ट तरीका अपनाता है। यह रोबोट को रियल-टाइम में प्रतिक्रिया करने में सक्षम बनाता है, जिससे वे उन कार्यों के लिए बहुत बेहतर हो जाते हैं जिनमें गति और सटीकता की आवश्यकता होती है, जैसे गेंद को पकड़ना या चलती हुई लाइन पर पुर्जों को असेंबल करना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →