Make Your VLA More Robust Without More Data By Interleaving Motion Planning
यह शोध पत्र MPVI को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो बिना किसी अतिरिक्त प्रशिक्षण डेटा की आवश्यकता के, लॉन्ग-होरिज़न मोबाइल मैनिपुलेशन में रोबस्टनेस और टास्क प्रोग्रेस को महत्वपूर्ण रूप से बढ़ाने के लिए मॉडल-आधारित मोशन प्लानिंग को विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स के साथ इंटरलीव करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अपना घर साफ करना सिखा रहे हैं। आप उसे एक बड़ा, जटिल निर्देश देते हैं: "लिविंग रूम में जाओ, तीन सोडा कैन ढूँढो, उन्हें किचन में लाओ, और उन्हें कूड़ेदान में डाल दो।"
वर्तमान "सुपर-स्मार्ट" रोबोट (जिन्हें विज़न-लैंग्वेज-एक्शन मॉडल्स या VLAs कहा जाता है) प्रतिभाशाली लेकिन जल्दी घबरा जाने वाले छात्रों की तरह हैं। उन्होंने लाखों किताबें पढ़ी हैं और लोगों को सफाई करते हुए हजारों वीडियो देखे हैं। हालांकि, जब उन्हें एक लंबे, बहु-चरणीय कार्य के लिए किसी बिखरे हुए कमरे में भेजा जाता है, तो वे अक्सर भटक जाते हैं, चीजों से टकराते हैं, या यह भूल जाते हैं कि उन्हें आगे क्या करना था। वे केवल अपने "दिमाग" का उपयोग करके एक साथ सब कुछ करने की कोशिश करते हैं, और वे ऐसी गलतियाँ करते हैं जो बढ़ते ही क्रम में जमा होती रहती हैं जब तक कि पूरा कार्य विफल न हो जाए।
यह शोध पत्र एक नई विधि पेश करता है जिसे MPVI (मोशन प्लानर / VLA इंटरलीविंग) कहा जाता है। MPVI को एक नए छात्र के रूप में नहीं, बल्कि एक स्मार्ट प्रोजेक्ट मैनेजर के रूप में सोचें जो प्रतिभाशाली छात्र को एक विश्वसनीय जीपीएस नेविगेटर के साथ जोड़ता है।
यह इस प्रकार काम करता है, जिसे सरल भागों में विभाजित किया गया है:
1. समस्या: "ऑल-इन-वन" का जाल
पुराना तरीका रोबोट के दिमाग से सब कुछ करने के लिए कहना था: यह पता लगाना कि कूड़ेदान कहाँ है, सोफे से टकराए बिना वहाँ तक पहुँचना, कैन उठाना और उसे बिन में डालना।
- उपमा: यह एक कुशल शेफ को खाना पकाने के साथ-साथ डिलीवरी ट्रक चलाने, ट्रैफिक के बीच रास्ता खोजने और कार पार्क करने के लिए कहने जैसा है। यदि शेफ ट्रैफिक से विचलित हो जाता है, तो भोजन जल जाता है। यदि वह रास्ता भटक जाता है, तो भोजन ठंडा पहुँचता है। शोध पत्र दिखाता है कि भारी मात्रा में प्रशिक्षण डेटा के बावजूद, ये "ऑल-इन-वन" रोबोट लंबे कार्यों में विफल हो जाते हैं क्योंकि वे दूरी और अव्यवस्था से भ्रमित हो जाते हैं।
2. समाधान: "हाइब्रिड टीम"
लेखकों ने एक ऐसा सिस्टम बनाया है जो काम को दो अलग-अलग भूमिकाओं में विभाजित करता है, और उनके बीच बारी-बारी से स्विच करता है:
- नेविगेटर (मोशन प्लानर): यह रोबलेट का "जीपीएस" है। इसे स्मार्ट या रचनात्मक होने की आवश्यकता नहीं है; इसे बस गणित और ज्यामिति में अच्छा होना चाहिए। इसका काम रोबोट को बिना टकराए बिंदु A से बिंदु B तक पहुँचाना है। यह घर के मानचित्र का उपयोग करके एक सटीक, बाधा-मुक्त मार्ग बनाता है।
- करने वाला (VLA): यह "प्रतिभाशाली छात्र" है। एक बार जब रोबोट वस्तु (जैसे सोडा कैन) के बिल्कुल पास पहुँच जाता है, तो नेविगेटर नियंत्रण सौंप देता है। अब, VLA कैन को पकड़ने और उसे बिन में डालने के तरीके को समझने के लिए अपने विजन और लैंग्वेज कौशल का उपयोग करता है।
जादुई स्विच: सिस्टम लगातार जाँच करता है, "क्या हम वहाँ पहुँच गए?" यदि रोबोट दूर है, तो नेविगेटर चलाता है। यदि रोबोट पास है, तो 'करने वाला' कार्य करता है।
3. गुप्त नुस्खा: "प्रोपियोसेप्टिव ट्रिगर्स" (Proprioceptive Triggers)
इन सिस्टमों में सबसे बड़ी समस्याओं में से एक यह जानना है कि कोई चरण वास्तव में कब समाप्त हुआ।
- पुराना तरीका: रोबोट हर कुछ सेकंड में एक सुपर-कंप्यूटर (विज़न-लैंग्वेज मॉडल) से पूछता था, "क्या मैंने पूरा कर लिया?" यह महंगा है और इसमें "भ्रम" (Hallucinations) की संभावना होती है (कंप्यूटर काम पूरा होने का भ्रम दे सकता है भले ही वह न हुआ हो, सिर्फ इसलिए क्योंकि उसने एक ऐसी तस्वीर देखी जो दिखने में समान थी)।
- नया तरीका (MPVI): सिस्टम एक भौतिक संकेत का इंतजार करता है। यह केवल तभी पूछता है, "क्या यह हो गया?" जब रोबोट का हाथ वास्तव में हिलना बंद कर देता है या ग्रिपर बंद हो जाता है।
- उपमा: एक वेटर की कल्पना करें। शेफ से हर 10 सेकंड में यह पूछने के बजाय कि "क्या स्टेक तैयार है?", वेटर तब तक इंतजार करता है जब तक कि शेफ पैन को जोर से नीचे न रख दे और कहे, "हो गया!" वेटर को तब पता चलता है कि अब परोसने का समय है। यह रोबोट को भ्रमित होने या अगला कार्य बहुत जल्दी शुरू करने से रोकता है।
4. परिणाम
टीम ने इसका परीक्षण BEHAVIOR-1K नामक बेंचमार्क पर किया, जो 1,000 अलग-अलग घरेलू कार्यों का अनुकरण करता है।
- उन्होंने अपने "हाइब्रिड टीम" (MPVI) की तुलना हाल ही की एक प्रतियोगिता के सर्वश्रेष्ठ "ऑल-इन-वन" रोबोट से की।
- परिणाम: हाइब्रिड टीम ने रोबोट की सफलता दर में 113% का सुधार किया।
- क्यों? नेविगेटर ने उबाऊ और कठिन हिस्सों (छिपी हुई वस्तु को खोजने के लिए अव्यवस्थित कमरे में चलना) को संभाला, जबकि 'करने वाले' ने कठिन हिस्सों (वस्तु को पकड़ना) को संभाला। रोबोट को कुछ भी नया सीखने की आवश्यकता नहीं थी; उसे बस अपने मौजूदा कौशल को व्यवस्थित करने के एक बेहतर तरीके की आवश्यकता थी।
सारांश
शोध पत्र का तर्क है कि रोबोट की विफलताओं को ठीक करने के लिए हमें आवश्यक रूप से अधिक डेटा या अधिक स्मार्ट AI की आवश्यकता नहीं है। इसके बजाय, हमें इस बात के बारे में स्मार्ट होने की आवश्यकता है कि हम विभिन्न उपकरणों को कैसे जोड़ते हैं। चलने के लिए एक सरल, विश्वसनीय प्लानर को संभालने देने और पकड़ने के लिए स्मार्ट AI को संभालने देने से, रोबोट बहुत अधिक मजबूत हो जाता है और लंबे, बिखरे हुए कार्य में खो जाने या भ्रमित होने की संभावना कम हो जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।