← नवीनतम पेपर
💻 computer science

RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation

यह शोध पत्र RA-VLA को प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो व्यवहार-संरेखित संदर्भ पुनर्प्राप्ति (behavior-aligned context retrieval) को एक ग्राउंडेड निष्पादन पाइपलाइन के साथ एकीकृत करके मौजूदा ट्रेनिंग-फ्री विधियों की अनुकूलन बाधाओं (adaptation bottlenecks) को दूर करता है, जिससे सिम्युलेटेड और वास्तविक दुनिया दोनों वातावरणों में नवीन रोबोटिक कार्यों में बेहतर सफलता दर और दक्षता प्राप्त होती है।

मूल लेखक: Sanghwan Jang, Minjin Jeon, Minsoo Kim, Seongjin Choi, Dongha Kim, Hwanjo Yu

प्रकाशित 2026-08-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sanghwan Jang, Minjin Jeon, Minsoo Kim, Seongjin Choi, Dongha Kim, Hwanjo Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से नए कार्यों को उसी तरह सीखने के लिए संघर्ष कर रहे हैं जैसे इंसान करते हैं। जहाँ एक व्यक्ति किसी जिद्दी जार को खोलने या बक्सों के एक विशिष्ट सेट को स्टैक करने के एक ही प्रदर्शन (डेमोन्स्ट्रेशन) को देखकर तुरंत लक्ष्य को समझ सकता है, वहीं एक रोबोट जिसे हजारों उदाहरणों पर प्रशिक्षित किया गया है, वह थोड़ी सी भिन्न स्थिति आने पर अक्सर ठप हो जाता है। ऐसा इसलिए है क्योंकि आधुनिक रोबले पूर्व-प्रशिक्षित ज्ञान के विशाल पुस्तकालयों पर निर्भर करते हैं, जो उन्हें परिचित कार्यों में तो उत्कृष्ट बनाता है लेकिन स्थिति बदलने पर उन्हें नाजुक बना देता है। इस अंतर को पाटने के लिए, शोधकर्ताओं ने 'इन-कॉन्टेक्स्ट इमिटेशन लर्निंग' नामक एक विधि विकसित की है। रोबोट के मस्तिष्क को शुरू से फिर से प्रशिक्षित करने के बजाय, यह दृष्टिकोण मशीन को उसके निर्देशों के साथ ही नए कार्य के कुछ उदाहरण प्रदान करता है, इस उम्मीद में कि वह इन ताज़ा सुरागों का उपयोग करके यह समझ सके कि क्या करना है। हालाँकि, इस विधि के वर्तमान प्रयास अक्सर विफल हो जाते हैं क्योंकि रोबोट गलत उदाहरण चुन लेता है या संकेतों को पूरी तरह से अनदेखा कर देता है, और अपने पुराने, पूर्व-निर्धारित अभ्यासों पर वापस लौट आता है।

शोधकर्ताओं की एक टीम ने इस विशिष्ट समस्या को हल करने के लिए RA-VLA नामक एक नया सिस्टम पेश किया है। उनका कार्य इस मूल मुद्दे को संबोधित करता है कि मौजूदा रोबोट उन उदाहरणों के बीच प्रभावी ढंग से अंतर नहीं कर सकते जो दिखने में समान हैं और जो वास्तव में एक ही कार्य करते हैं। उनके प्रयोगों में, मानक तरीके अक्सर ऐसे दृश्य मिलान (विजुअल मैच) प्राप्त करते थे जो कार्यात्मक रूप से बेकार थे, जैसे कि एक वीडियो ढूंढना जिसमें हाथ कप उठा रहा हो, जबकि रोबोट को वास्तव में यह जानने की आवश्यकता थी कि चूल्हा कैसे चालू किया जाए। यह नया ढांचा इस समस्या को ठीक करता है क्योंकि यह रोबोट को केवल दृश्य समानताओं के बजाय व्यवहारिक पैटर्न खोजने के लिए प्रशिक्षित करता है। यह सीखने में सक्षम है कि दो अलग-अलग दिखने वाली क्रियाएं कार्यात्मक रूप से समान हो सकती हैं यदि वे एक ही लक्ष्य को प्राप्त करती हैं, जिससे यह सुनिश्चित होता है कि रोबोट अपने मेमोरी बैंक से सबसे प्रासंगिक मार्गदर्शन निकाल सके।

एक बार जब रोबोट सही उदाहरण प्राप्त कर लेता है, तो यह सिस्टम सुनिश्चित करता है कि रोबोट वास्तव में उसका उपयोग करे। पिछले तरीके एक प्रकार की हठधर्मिताता से ग्रस्त थे, जहाँ रोबोट नया निर्देश और सहायक उदाहरण देखता तो था लेकिन फिर भी अपने मूल प्रशिक्षण पर ही वापस चला जाता था। शोधकर्ताओं ने इसे एक विशिष्ट प्रशिक्षण चरण जोड़कर हल किया जो रोबलो को प्राप्त मार्गदर्शन पर ध्यान देने के लिए मजबूर करता है। उन्होंने एक ऐसी प्रणाली बनाई जो रोबोट को दंडित करती है यदि वह नए संदर्भ को अनदेखा करता है और केवल अपने पुराने ज्ञान पर निर्भर रहता है। यह रोबोट को वर्तमान क्षण के लिए दिए गए विशिष्ट निर्देशों और उदाहरणों के आधार पर अपनी गतिविधियों को स्थापित करने के लिए मजबूर करता है, न कि अपने पूर्व-प्रशिक्षित सहज ज्ञान की ओर वापस जाने के लिए।

टीम ने दो अलग-अलग वातावरणों में इस दृष्टिकोण का परीक्षण किया: एक जटिल कंप्यूटर सिमुलेशन जिसे LIBERO बेंचमार्क कहा जाता है और एक भौतिक UR5e रोबोट आर्म का उपयोग करते हुए वास्तविक दुनिया का परिवेश। सिमुलेशन में, रोबोट को केवल कुछ प्रदर्शन क्लिप्स के मार्गदर्शन के रूप में उपयोग करके, उन कार्यों को करने के लिए कहा गया जिन्हें उसने पहले कभी नहीं देखा था, जैसे वस्तुओं को स्टैक करना या विशिष्ट वस्तुओं का हेरफेर करना। परिणामों ने एक नाटकीय सुधार दिखाया। जहाँ पुराने तरीके एक छोटे से अंश से अधिक समय तक सफल होने के लिए संघर्ष करते थे, वहीं नए सिस्टम ने सफलता दर में उल्लेखनीय वृद्धि हासिल की, सिमुलेशन कार्यों पर प्रदर्शन में लगभग अठारह प्रतिशत अंकों का सुधार हुआ। वास्तविक दुनिया के परीक्षणों में, भौतिक रोबोट के साथ, सुधार और भी स्पष्ट था, जहाँ नया सिस्टम पिछले तरीकों की बहुत कम सफलता दर की तुलना में आधे से अधिक परीक्षणों में सफल रहा।

इस नए सिस्टम का एक महत्वपूर्ण लाभ इसकी गति और दक्षता है। कई मौजूदा दृष्टिकोण जैसे-जैसे अधिक उदाहरणों को प्रोसेस करने की कोशिश करते हैं, काफी धीमे हो जाते हैं, जिससे एक बाधा उत्पन्न होती है जो उन्हें वास्तविक समय के उपयोग के लिए अव्यवहारिक बना देती है। शोधकर्ताओं ने अपने सिस्टम को इस तरह से डिजाइन किया है कि यह बिना धीमा हुए कई उदाहरणों को देख सकता है। प्रत्येक उदाहरण को रोबोट के कार्य करने से पहले स्वतंत्र रूप से प्रोसेस करके, निर्णय लेने में लगने वाला समय लगभग स्थिर रहता है, चाहे कितने भी उदाहरण उपलब्ध हों। इसका अर्थ है कि रोबोट उन देरी से ग्रस्त हुए बिना ज्ञान के एक बड़े पुस्तकालय तक पहुँच सकता है जो आमतौर पर ऐसे सिस्टम में देखी जाती है।

शोधकर्ताओं ने यह भी विश्लेषण किया कि यह सिस्टम इतना अच्छा क्यों काम कर रहा था। उन्होंने पाया कि कुंजी केवल अधिक डेटा होना नहीं था, बल्कि सही प्रकार का डेटा रिट्रीवल (प्राप्ति) था। जब उन्होंने अपने विशेष खोज टूल को एक मानक, ऑफ-द-शेल्फ विजुअल सर्च इंजन से बदल दिया, तो रोबोट का प्रदर्शन तेजी से गिर गया, जिससे पुष्टि हुई कि कार्यात्मक इरादे को पहचानना दृश्य उपस्थिति से मेल खाने से अधिक महत्वपूर्ण है। इसके अलावा, उन्होंने मापा कि नया संदर्भ दिए जाने पर बनाम यादृच्छिक (रैंडम) जानकारी दिए जाने पर रोबोट की क्रियाएं कितनी बदलती हैं। नया सिस्टम प्रदान किए गए संदर्भ के प्रति एक मजबूत संवेदनशीलता दिखाता है, जो यह सिद्ध करता है कि वह वास्तव में उदाहरणों से सीख रहा है न कि उन्हें अनदेखा कर रहा है।

यह कार्य प्रदर्शित करता है कि रोबोटों को महंगे और समय लेने वाले पुन: प्रशिक्षण की आवश्यकता के बिना अधिक अनुकूलनीय बनाया जा सकता है। प्रासंगिक उदाहरणों को खोजने के स्मार्ट तरीके को एक ऐसे तरीके के साथ जोड़कर, जो रोबोट को उन उदाहरणों को सुनने के लिए मजबूर करता है, शोधकर्ताओं ने एक ऐसा ढांचा तैयार किया है जो मशीनों को उस स्तर की लचीलापन के साथ नवीन कार्यों को संभालने की अनुमति देता है जो पहले पहुंच से बाहर था। निष्कर्ष बताते हैं कि गतिशील, वास्तविक दुनिया के वातावरण में रोबोटों के सुरक्षित और प्रभावी ढंग से संचालित होने के लिए, उन्हें तत्काल संदर्भ से सीखना सक्षम होना चाहिए, और यह नया दृष्टिकोण उस लक्ष्य को प्राप्त करने के लिए एक विश्वसनीय मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →