Evidence-Gated Task and Motion Planning with Vision-Language Models
यह शोध पत्र एविडेंस एक्विजिशन एंड फिएसिबिलिटी गेटिंग (EAFG) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो विजन-लैंग्वेज मॉडल्स को टास्क एंड मोशन प्लानिंग के साथ एकीकृत करता है ताकि विजुअल एविडेंस को गतिशील रूप से प्राप्त किया जा सके और प्लानिंग निर्णयों को गेट किया जा सके, जिससे अनवेरिफाइड धारणाओं पर निष्पादन को रोककर आंशिक दृश्यता (पार्शियल ऑब्जर्वेबिलिटी) के तहत लॉन्ग-होरिज़न मैनिपुलेशन कार्यों में सफलता की दर में सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
हमारे घरों और रसोईघरों में घूमने वाले रोबोटों के सामने एक मौलिक चुनौती है: उन्हें न केवल यह समझना चाहिए कि क्या करना है, बल्कि यह भी कि क्या वे वास्तव में इसे कर सकते हैं। "सूप बनाओ" जैसे सरल निर्देश का पालन करने के लिए, एक मशीन को दो बहुत अलग दुनियाओं के बीच सेतु बनाना होगा। सबसे पहले, उसे शब्दों के अर्थ को समझना होगा, यह जानना कि सूप के लिए चिकन और नमक जैसी सामग्रियों की आवश्यकता होती है, और इन चीजों को गर्म करने की आवश्यकता होती है। यह भाषा और सामान्य ज्ञान का क्षेत्र है। दूसरा, उसे भौतिक दुनिया को समझना होगा, यह जानना कि बर्तन कहाँ है, क्या कैबिनेट का दरवाजा दीवार से टकराए बिना खोला जा सकता है, और क्या रोबोट का हाथ मसाला जार तक पहुँच सकता है। वर्षों से, शोधकर्ताओं ने इन दोनों कौशलों को मिलाने की कोशिश की है, उन्नत कंप्यूटर मॉडल का उपयोग किया है जो रोबोट को उनके कार्यों की योजना बनाने में मदद करने के लिए देख और पढ़ सकते हैं। हालाँकि, एक निरंतर समस्या बनी हुई है: क्या होता है जब रोबोट रसोई की ओर देखता है और वह सब कुछ नहीं देख पाता जिसकी उसे आवश्यकता है? यदि कोई महत्वपूर्ण सामग्री बंद दराज के अंदर छिपी है, या यदि वह वहां है ही नहीं, तो रोबोट अपने प्रशिक्षण डेटा के आधार पर अनुमान लगा सकता है। वह ऐसी चीज़ उठाने की योजना बना सकता है जो मौजूद ही नहीं है, जिससे कार्य विफल हो सकता है या एक भ्रमित मशीन बार-बार खाली जगह को पकड़ने की कोशिश करती रह सकती है।
वासेदा विश्वविद्यालय और फ्लिंडर्स विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने का एक नया तरीका प्रस्तावित किया है, जो रोबोट को कूदने से पहले देखने के लिए मजबूर करता है। उनका दृष्टिकोण, जिसे 'एविडेंस एक्विजिशन एंड फिजिबिलिटी गेटिंग' (साक्ष्य प्राप्ति और व्यवहार्यता द्वार) कहा जाता है, संचालन के क्रम को बदल देता है। तुरंत सूप पकाने की योजना बनाने के बजाय, रोबोट पहले एक जिज्ञासु खोजकर्ता की तरह कार्य करता है। इसे विशेष रूप से जानकारी एकत्र करने के लिए डिज़ाइन किए गए छोटे, सुरक्षित कार्य करने के लिए प्रोग्राम किया गया है, जैसे कि एक बंद कैबिनेट खोलना या एक बॉक्स को हटाना जो शायद दृश्य को बाधित कर रहा हो। एक बार जब रोबोट ये कार्य कर लेता है, तो वह दृश्य की एक नई तस्वीर लेता है। एक शक्तिशाली विजन-लैंग्वेज मॉडल इस नए दृश्य साक्ष्य की समीक्षा करता है ताकि यह तय किया जा सके कि आगे क्या करना है। सिस्टम एक सरल लेकिन महत्वपूर्ण प्रश्न पूछता है: "क्या अब मेरे पास खाना पकाने के कार्य की योजना बनाने के लिए पर्याप्त प्रमाण है?" यदि उत्तर 'हाँ' है, तो रोबोट खाना पकाने के पूर्ण चरणों की योजना बनाने के साथ आगे बढ़ता है। यदि उत्तर 'नहीं' है, लेकिन अभी भी देखने के लिए स्थान शेष हैं, तो रोबोट फिर से अन्वेषण करने जाता है। यदि उत्तर 'नहीं' है, और यह स्पष्ट हो जाता है कि आवश्यक वस्तु गायब है, तो रोबोट खाली समय बर्बाद करने के बजाय पूरी तरह से रुक जाता है।
शोधकर्ताओं ने एक सिम्युलेटेड किचन वातावरण में इस पद्धति का परीक्षण किया जिसे वास्तविक घर की जटिलताओं की नकल करने के लिए डिज़ाइन किया गया था। रोबोट को एक हाथ दिया गया था और उसे चिकन सूप बनाने का कार्य दिया गया था, जिसमें सामग्रियां खोजना, चूल्हा उपयोग करना और विभिन्न कंटेनरों का प्रबंधन करना शामिल है। उन्होंने यह देखने के लिए तीन अलग-अलग परिदृश्य स्थापित किए कि नया सिस्टम पुराने तरीकों की तुलना में कैसा प्रदर्शन करता है जो पहले साक्ष्य की जांच नहीं करते हैं। पहले परिदृश्य में, सभी आवश्यक वस्तुएं मौजूद थीं और निर्देशों में स्पष्ट रूप से सूचीबद्ध थीं। यहाँ, नया सिस्टम मानक दृष्टिकोण के समान ही प्रदर्शन करता है, यह सिद्ध करता है कि जांच का यह अतिरिक्त चरण जोड़ने से रोबोट धीमा या भ्रमित नहीं होता है जब सब कुछ स्पष्ट हो। वास्तविक अंतर दूसरे परिदृश्य में दिखाई दिया, जहाँ निर्देश अस्पष्ट थे। रोबोट को "चिकन सूप बनाओ" कहा गया था, बिना यह बताए कि नमक या काली मिर्च का उपयोग करना है। नए सिस्टम के बिना, रोबोट शायद ही कभी सफल हो पाता क्योंकि उसे नहीं पता था कि उन छिपे हुए मसालों को कहाँ ढूँढना है। साक्ष्य-एकत्र करने वाली पद्धति के साथ, रोबोट ने कैबिनेट खोले, नमक और काली मिर्च ढूँढी, और चालीस प्रतिशत परीक्षणों में रेसिपी पूरी की, जो बेसलाइन की तुलना में एक महत्वपूर्ण सुधार है।
तीसरे परिदृश्य ने कार्य के असंभव होने को पहचानने की क्षमता का परीक्षण किया। रोबोट को नमक, काली मिर्च और गाजर के साथ सूप बनाने का निर्देश दिया गया था, लेकिन गाजर रसोई में नहीं थी। एक मानक सिस्टम अक्सर एक लूप में फंस जाता, बार-बार गायब गाजर को खोजने या उपयोग करने की कोशिश करता, जिससे समय और ऊर्जा बर्बाद होती। हालाँकि, नया सिस्टम रुकना सीख गया। संभव स्थानों पर सक्रिय रूप से गाजर की तलाश करने और कुछ न पाने के बाद, रोबोट के आंतरिक गेट ने कार्य को रोकने का निर्णय लिया। इन परीक्षणों में, एक मॉडल के लिए सिस्टम ने नब्बे प्रतिशत बार और दूसरे के लिए पूरे सौ प्रतिशत बार सही ढंग से रोका, जबकि गायब सब्जी को पकड़ने के विफल प्रयासों को काफी कम कर दिया। "मैं यह नहीं कर सकता" कहने की यह क्षमता सफल होने की क्षमता जितनी ही महत्वपूर्ण है, क्योंकि यह रोबदन को गलत धारणाओं पर कार्य करने से रोकता है।
शोधकर्ता स्वीकार करते हैं कि उनकी पद्धति पूर्ण नहीं है। यह रोबोट की दरवाजे खोलने और वस्तुओं को हटाने की क्षमता पर निर्भर करती है ताकि बेहतर दृश्य प्राप्त किया जा सके। यदि रोबोट यांत्रिक समस्या या भौतिक बाधा के कारण कैबिनेट खोलने में विफल रहता है, तो वह साक्ष्य नहीं पा सकेगा, भले ही वस्तु वहां मौजूद हो। इस सीमा के बावजूद, यह कार्य उन रोबोटों के लिए एक स्पष्ट मार्ग प्रदर्शित करता है जिन्हें अनिश्चित वातावरण में काम करने की आवश्यकता होती है। अंतिम योजना चरण से पहले सक्रिय सूचना एकत्र करने का चरण डालकर, सिस्टम यह सुनिश्चित करता है कि रोबोट के कार्य जो वह केवल मान लेता है, उसके बजाय जो वह वास्तव में देख सकता है, उस पर आधारित हों। अनुमान लगाने से सत्यापन की ओर यह बदलाव रोबोट को मानव स्थानों की अव्यवस्थित और अपूर्ण वास्तविकता को अधिक प्रभावी ढंग से संभालने की अनुमति देता है, जिससे वे भोजन बनाने से लेकर कमरा व्यवस्थित करने जैसे कार्यों में अधिक विश्वसनीय साथी बनते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।