MessyMem: Learning-from-Doing Memory for Mobile Manipulation
MessyMem मोबाइल मैनिपुलेटर्स के लिए एक निरंतर स्मृति प्रणाली (persistent memory system) है जो इंटरेक्शन-व्युत्पन्न ज्ञान से संवर्धित एक स्थानिक रूप से ग्राउंडेड 3D सीन ग्राफ को बनाए रखती है, जिससे रोबोटों को अनुभव से सीखने और दीर्घकालिक कार्यों (long-horizon tasks) में पिछले खोजों का पुन: उपयोग करके मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
हमारे घरों और कार्यालयों में इधर-उधर घूमने वाले रोबोट अधिक सामान्य होते जा रहे हैं, लेकिन वे अभी भी एक मौलिक मानवीय कौशल में संघर्ष करते हैं: जो उन्होंने सीखा है उसे याद रखना। आज के घरेलू रोबोट अक्सर हर नई अनुरोध को इस तरह देखते हैं जैसे कि वे पहली बार किसी कमरे में आए हों। यदि कोई रोबोट एक कैबिनेट खोलता है और उसे खाली पाता है, तो वह अगली सुबह तक उस तथ्य को भूल सकता है। यदि वह पाता है कि एक दराज लॉक है, तो वह भविष्य के कार्यों में उसे बार-बार खोलने की कोशिश कर सकता है। स्मृति की यह कमी रोबोट को लगातार शून्य से शुरुआत करने के लिए मजबूर करती है, जिससे समय और ऊर्जा बर्बाद होती है। एक वास्तविक घर में प्रभावी ढंग से कार्य करने के लिए, एक मशीन को केवल इस बात के मानचित्र की आवश्यकता नहीं है कि चीजें कहाँ हैं; उसे यह जानने के लिए एक रिकॉर्ड की आवश्यकता है कि उसने स्पर्श और क्रिया के माध्यम से क्या खोजा है, और कुछ घंटों या दिनों पहले के विशिष्ट दृश्य विवरणों को याद करने के तरीके की आवश्यकता है।
स्टैनफोर्ड यूनिवर्सिटी के शोधकर्ताओं ने इस समस्या को हल करने के लिए 'मेसीमेम' (MessyMem) नामक एक प्रणाली विकसित की है। यह प्रणाली मोबाइल रोबोटों के लिए दीर्घकालिक स्मृति के रूप में कार्य करती है, जिससे वे विभिन्न कमरों में और लंबे समय तक ज्ञान ले जा सकते हैं। वस्तुओं की एक साधारण सूची या एक निरंतर वीडियो फीड पर निर्भर रहने के बजाय, जो खोजने के लिए बहुत बड़ा होता है, मेसीमेम दुनिया का एक संरचित मानचित्र बनाता है जो हर अंतःक्रिया के साथ स्मार्ट होता जाता है। यह तीन अलग-अलग प्रकार की जानकारी को जोड़ता है: वस्तुओं के स्थान का एक स्थानिक मानचित्र (spatial map), रोबोट ने चीजों को भौतिक रूप से छूकर या हिलाकर क्या सीखा इसका एक रिकॉर्ड, और महत्वपूर्ण क्षणों पर ली गई विशिष्ट तस्वीरों का एक पुस्तकालय। इन तीनों तत्वों को एक साथ जोड़कर, रोबोट जटिल प्रश्नों का उत्तर दे सकता है जैसे कि "मैंने कैंची कहाँ देखी थी?" या "कौन सा कैबिनेट लॉक है?" बिना पूरे घर को फिर से एक्सप्लोर किए।
इस प्रणाली का मुख्य आधार एक 3D सीन ग्राफ है, जो अनिवार्य रूप से एक डिजिटल मानचित्र है जो सूचीबद्ध करता है कि रोबोट ने प्रत्येक वस्तु को देखा है और वह दुनिया में कहाँ स्थित है। एक मानक मानचित्र के विपरीत जो केवल ज्यामिति को रिकॉर्ड करता है, यह प्रणाली प्रत्येक वस्तु के साथ एक विस्तृत प्रोफाइल संलग्न करती है। जब रोबोट किसी वस्तु के साथ अंतःक्रिया करता है, जैसे कि दराज खोलने या कप उठाने की कोशिश करना, तो एक विशेष सॉफ्टवेयर घटक परिणाम का विश्लेषण करता है। यह निर्धारित करता है कि क्या दराज लॉक थी, क्या कप खाली था, या क्या क्रिया इसलिए विफल हुई क्योंकि रोबोट फिसल गया था। यह जानकारी सीधे उस वस्तु के डिजिटल प्रोफाइल पर लिखी जाती है। इसलिए, यदि रोबोट एक कैबिनेट खोलने की कोशिश करता है और उसे लॉक पाता है, तो वह तथ्य सहेज लिया जाता है। बाद में, जब उसे किसी चीज़ को खोजने के लिए कहा जाता है, तो रोबोट अपनी स्मृति की जाँच करता है, "लॉक" नोट देखता है, और उस कैबिनेट को पूरी तरह से छोड़कर सीधे दूसरे खुले कैबिनेट की ओर बढ़ जाता है।
हालाँकि, यह जानना कि एक कैबिनेट लॉक है, हमेशा पर्याप्त नहीं होता है। कभी-कभी रोबक्रम को सूक्ष्म विवरणों को याद करने की आवश्यकता होती जिसे एक साधारण टेक्स्ट नोट कैप्चर नहीं कर सकता, जैसे कि मग पर लगा कोई विशिष्ट स्टिकर या जार पर लगा लेबल। इसे संभालने के लिए, मेसीमेम चुनिकी फोटोग्राफ्स, जिन्हें 'कीफ्रेम्स' (keyframes) कहा जाता है, सहेजता है और उन्हें अपने मानचित्र में वस्तुओं से सीधे जोड़ता है। ये तस्वीरें केवल वीडियो का एक रैंडम स्ट्रीम नहीं हैं; वे सावधानीपूर्वक चुने गए क्षण हैं, जैसे कि रोबोट द्वारा किसी वस्तु को पकड़ने से ठीक पहले का दृश्य या दराज खोलने के बाद के अंदर का दृश्य। जब रोबोट के सामने कोई नया कार्य आता है, तो वह अपनी स्मृति में सबसे प्रासंगिक फोटो खोजता है। वह एक फोटो देख सकता है जो दिखा रहा हो कि कॉफी कंटेनर पिछली बार सटीक रूप से किस शेल्फ पर देखा गया था, या किसी विशिष्ट पैटर्न वाला मोज़े का चित्र। यह रोबोट को अतीत में एकत्र किए गए दृश्य साक्ष्य के आधार पर दो समान दिखने वाली वस्तुओं के बीच अंतर करने की अनुमति देता है।
शोधकर्ताओं ने कंप्यूटर सिमुलेशन और एक वास्तविक वातावरण में घूमते हुए वास्तविक रोबोट, दोनों में इस प्रणाली का परीक्षण किया। तीन घंटे से अधिक समय तक चलने वाले बीस अलग-अलग घरेलू कार्यों के निरंतर अनुक्रम वाले सिमुलेशन में, मेसीमेम का उपयोग करने वाले रोबोट ने अस्सी प्रतिशत कार्यों को सफलतापूर्वक पूरा किया। यह अन्य तरीकों की तुलना में एक महत्वपूर्ण सुधार था। वे रोबोट जो केवल स्थानिक मानचित्र पर निर्भर थे (बिना अंतःक्रिया नोट्स के), या जिनमें नोट्स थे लेकिन फोटो नहीं थे, वे बहुत खराब प्रदर्शन करते थे। उदाहरण के लिए, जब एक अव्यवस्थित कैबिनेट में छिपी किसी विशिष्ट वस्तु को खोजने के लिए कहा गया, तो पूर्ण प्रणाली सटीक दृश्य व्यवस्था को याद करने में सक्षम थी, जबकि अन्य विफल रहे क्योंकि वे लक्ष्य को समान दिखने वाली वस्तुओं से अलग नहीं कर सके। एक कार्यालय डेस्क वाले वास्तविक दुनिया के परीक्षण में जिसमें कई दराजें थीं, रोबोट ने पिछले चरणों में एकत्र किए गए ज्ञान का पुन: उपयोग करके कैंची ढूंढ ली, जॉन नामक व्यक्ति का एक विशिष्ट कप पहचाना और एक गेम कंट्रोलर का पता लगाया।
प्रयोगों ने दिखाया कि यह प्रणाली सबसे अच्छा काम करती है जब तीनों घटक मौजूद होते हैं। स्थानिक मानचित्र स्थान प्रदान करता है, अंतःक्रिया नोट्स दुनिया की स्थिति (जैसे कि क्या लॉक है या खाली है) प्रदान करते हैं, और फोटो कठिन अंतरों के लिए आवश्यक दृश्य प्रमाण प्रदान करते हैं। अंतःक्रिया नोट्स के बिना, रोबोट लॉक दराजों को खोलने में समय बर्बाद करता। फोटो के बिना, वह दो समान दिखने वाली बोतलों के बीच अंतर नहीं कर पाता। सिस्टम कुशल भी साबित हुआ; हजारों फोटो स्टोर करने और घंटों तक चलने के बाद भी, यह किसी कार्य के लिए आवश्यक विशिष्ट साक्ष्य को जल्दी से खोज सकता था, निर्णय लेने के लिए पिछले एक घंटे की गतिविधि को पीछे मुड़कर देख सकता था।
यह कार्य सुझाव देता है कि हमारे दैनिक जीवन में वास्तव में उपयोगी सहायक बनने के लिए, रोबोटों को अपने स्वयं के कार्यों से सीखने और उन पाठों को याद रखने में सक्षम होना चाहिए। मेसीमेम प्रणाली यह प्रदर्शित करती है कि एक मानचित्र, एक अंतःक्रिया लॉग और प्रमुख छवियों के पुस्तकालय को जोड़कर, एक रोबोट हर कार्य को एक नई खोज के रूप में मानना बंद कर सकता है और अपने अनुभव का एक निरंतर इतिहास बनाना शुरू कर सकता है। जबकि वर्तमान प्रणाली वस्तुओं की एक पूर्व-निर्धारित सूची का उपयोग करती है जिसे वह पहचान सकता है, शोधकर्ता नोट करते हैं कि भविष्य के संस्करणों को वस्तुओं की एक विस्तृत श्रृंखला को पहचानने और यहाँ तक कि मानवीय कार्यों से सीखने के लिए विस्तारित किया जा सकता है। फिलहाल, परिणाम एक स्पष्ट मार्ग दिखाते हैं: एक रोबोट जो यह याद रखता है कि उसने क्या छुआ और क्या देखा है, वह अंततः हमारे साथ काम करने में सक्षम है बिना हर बार शुरुआत से शुरू किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।