← नवीनतम पेपर
💻 computer science

MessyMem: Learning-from-Doing Memory for Mobile Manipulation

MessyMem मोबाइल मैनिपुलेटर्स के लिए एक निरंतर स्मृति प्रणाली (persistent memory system) है जो इंटरेक्शन-व्युत्पन्न ज्ञान से संवर्धित एक स्थानिक रूप से ग्राउंडेड 3D सीन ग्राफ को बनाए रखती है, जिससे रोबोटों को अनुभव से सीखने और दीर्घकालिक कार्यों (long-horizon tasks) में पिछले खोजों का पुन: उपयोग करके मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

मूल लेखक: Anuva Banwasi, William Muckelroy III, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho

प्रकाशित 2026-09-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anuva Banwasi, William Muckelroy III, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हमारे घरों और कार्यालयों में इधर-उधर घूमने वाले रोबोट अधिक सामान्य होते जा रहे हैं, लेकिन वे अभी भी एक मौलिक मानवीय कौशल में संघर्ष करते हैं: जो उन्होंने सीखा है उसे याद रखना। आज के घरेलू रोबोट अक्सर हर नई अनुरोध को इस तरह देखते हैं जैसे कि वे पहली बार किसी कमरे में आए हों। यदि कोई रोबोट एक कैबिनेट खोलता है और उसे खाली पाता है, तो वह अगली सुबह तक उस तथ्य को भूल सकता है। यदि वह पाता है कि एक दराज लॉक है, तो वह भविष्य के कार्यों में उसे बार-बार खोलने की कोशिश कर सकता है। स्मृति की यह कमी रोबोट को लगातार शून्य से शुरुआत करने के लिए मजबूर करती है, जिससे समय और ऊर्जा बर्बाद होती है। एक वास्तविक घर में प्रभावी ढंग से कार्य करने के लिए, एक मशीन को केवल इस बात के मानचित्र की आवश्यकता नहीं है कि चीजें कहाँ हैं; उसे यह जानने के लिए एक रिकॉर्ड की आवश्यकता है कि उसने स्पर्श और क्रिया के माध्यम से क्या खोजा है, और कुछ घंटों या दिनों पहले के विशिष्ट दृश्य विवरणों को याद करने के तरीके की आवश्यकता है।

स्टैनफोर्ड यूनिवर्सिटी के शोधकर्ताओं ने इस समस्या को हल करने के लिए 'मेसीमेम' (MessyMem) नामक एक प्रणाली विकसित की है। यह प्रणाली मोबाइल रोबोटों के लिए दीर्घकालिक स्मृति के रूप में कार्य करती है, जिससे वे विभिन्न कमरों में और लंबे समय तक ज्ञान ले जा सकते हैं। वस्तुओं की एक साधारण सूची या एक निरंतर वीडियो फीड पर निर्भर रहने के बजाय, जो खोजने के लिए बहुत बड़ा होता है, मेसीमेम दुनिया का एक संरचित मानचित्र बनाता है जो हर अंतःक्रिया के साथ स्मार्ट होता जाता है। यह तीन अलग-अलग प्रकार की जानकारी को जोड़ता है: वस्तुओं के स्थान का एक स्थानिक मानचित्र (spatial map), रोबोट ने चीजों को भौतिक रूप से छूकर या हिलाकर क्या सीखा इसका एक रिकॉर्ड, और महत्वपूर्ण क्षणों पर ली गई विशिष्ट तस्वीरों का एक पुस्तकालय। इन तीनों तत्वों को एक साथ जोड़कर, रोबोट जटिल प्रश्नों का उत्तर दे सकता है जैसे कि "मैंने कैंची कहाँ देखी थी?" या "कौन सा कैबिनेट लॉक है?" बिना पूरे घर को फिर से एक्सप्लोर किए।

इस प्रणाली का मुख्य आधार एक 3D सीन ग्राफ है, जो अनिवार्य रूप से एक डिजिटल मानचित्र है जो सूचीबद्ध करता है कि रोबोट ने प्रत्येक वस्तु को देखा है और वह दुनिया में कहाँ स्थित है। एक मानक मानचित्र के विपरीत जो केवल ज्यामिति को रिकॉर्ड करता है, यह प्रणाली प्रत्येक वस्तु के साथ एक विस्तृत प्रोफाइल संलग्न करती है। जब रोबोट किसी वस्तु के साथ अंतःक्रिया करता है, जैसे कि दराज खोलने या कप उठाने की कोशिश करना, तो एक विशेष सॉफ्टवेयर घटक परिणाम का विश्लेषण करता है। यह निर्धारित करता है कि क्या दराज लॉक थी, क्या कप खाली था, या क्या क्रिया इसलिए विफल हुई क्योंकि रोबोट फिसल गया था। यह जानकारी सीधे उस वस्तु के डिजिटल प्रोफाइल पर लिखी जाती है। इसलिए, यदि रोबोट एक कैबिनेट खोलने की कोशिश करता है और उसे लॉक पाता है, तो वह तथ्य सहेज लिया जाता है। बाद में, जब उसे किसी चीज़ को खोजने के लिए कहा जाता है, तो रोबोट अपनी स्मृति की जाँच करता है, "लॉक" नोट देखता है, और उस कैबिनेट को पूरी तरह से छोड़कर सीधे दूसरे खुले कैबिनेट की ओर बढ़ जाता है।

हालाँकि, यह जानना कि एक कैबिनेट लॉक है, हमेशा पर्याप्त नहीं होता है। कभी-कभी रोबक्रम को सूक्ष्म विवरणों को याद करने की आवश्यकता होती जिसे एक साधारण टेक्स्ट नोट कैप्चर नहीं कर सकता, जैसे कि मग पर लगा कोई विशिष्ट स्टिकर या जार पर लगा लेबल। इसे संभालने के लिए, मेसीमेम चुनिकी फोटोग्राफ्स, जिन्हें 'कीफ्रेम्स' (keyframes) कहा जाता है, सहेजता है और उन्हें अपने मानचित्र में वस्तुओं से सीधे जोड़ता है। ये तस्वीरें केवल वीडियो का एक रैंडम स्ट्रीम नहीं हैं; वे सावधानीपूर्वक चुने गए क्षण हैं, जैसे कि रोबोट द्वारा किसी वस्तु को पकड़ने से ठीक पहले का दृश्य या दराज खोलने के बाद के अंदर का दृश्य। जब रोबोट के सामने कोई नया कार्य आता है, तो वह अपनी स्मृति में सबसे प्रासंगिक फोटो खोजता है। वह एक फोटो देख सकता है जो दिखा रहा हो कि कॉफी कंटेनर पिछली बार सटीक रूप से किस शेल्फ पर देखा गया था, या किसी विशिष्ट पैटर्न वाला मोज़े का चित्र। यह रोबोट को अतीत में एकत्र किए गए दृश्य साक्ष्य के आधार पर दो समान दिखने वाली वस्तुओं के बीच अंतर करने की अनुमति देता है।

शोधकर्ताओं ने कंप्यूटर सिमुलेशन और एक वास्तविक वातावरण में घूमते हुए वास्तविक रोबोट, दोनों में इस प्रणाली का परीक्षण किया। तीन घंटे से अधिक समय तक चलने वाले बीस अलग-अलग घरेलू कार्यों के निरंतर अनुक्रम वाले सिमुलेशन में, मेसीमेम का उपयोग करने वाले रोबोट ने अस्सी प्रतिशत कार्यों को सफलतापूर्वक पूरा किया। यह अन्य तरीकों की तुलना में एक महत्वपूर्ण सुधार था। वे रोबोट जो केवल स्थानिक मानचित्र पर निर्भर थे (बिना अंतःक्रिया नोट्स के), या जिनमें नोट्स थे लेकिन फोटो नहीं थे, वे बहुत खराब प्रदर्शन करते थे। उदाहरण के लिए, जब एक अव्यवस्थित कैबिनेट में छिपी किसी विशिष्ट वस्तु को खोजने के लिए कहा गया, तो पूर्ण प्रणाली सटीक दृश्य व्यवस्था को याद करने में सक्षम थी, जबकि अन्य विफल रहे क्योंकि वे लक्ष्य को समान दिखने वाली वस्तुओं से अलग नहीं कर सके। एक कार्यालय डेस्क वाले वास्तविक दुनिया के परीक्षण में जिसमें कई दराजें थीं, रोबोट ने पिछले चरणों में एकत्र किए गए ज्ञान का पुन: उपयोग करके कैंची ढूंढ ली, जॉन नामक व्यक्ति का एक विशिष्ट कप पहचाना और एक गेम कंट्रोलर का पता लगाया।

प्रयोगों ने दिखाया कि यह प्रणाली सबसे अच्छा काम करती है जब तीनों घटक मौजूद होते हैं। स्थानिक मानचित्र स्थान प्रदान करता है, अंतःक्रिया नोट्स दुनिया की स्थिति (जैसे कि क्या लॉक है या खाली है) प्रदान करते हैं, और फोटो कठिन अंतरों के लिए आवश्यक दृश्य प्रमाण प्रदान करते हैं। अंतःक्रिया नोट्स के बिना, रोबोट लॉक दराजों को खोलने में समय बर्बाद करता। फोटो के बिना, वह दो समान दिखने वाली बोतलों के बीच अंतर नहीं कर पाता। सिस्टम कुशल भी साबित हुआ; हजारों फोटो स्टोर करने और घंटों तक चलने के बाद भी, यह किसी कार्य के लिए आवश्यक विशिष्ट साक्ष्य को जल्दी से खोज सकता था, निर्णय लेने के लिए पिछले एक घंटे की गतिविधि को पीछे मुड़कर देख सकता था।

यह कार्य सुझाव देता है कि हमारे दैनिक जीवन में वास्तव में उपयोगी सहायक बनने के लिए, रोबोटों को अपने स्वयं के कार्यों से सीखने और उन पाठों को याद रखने में सक्षम होना चाहिए। मेसीमेम प्रणाली यह प्रदर्शित करती है कि एक मानचित्र, एक अंतःक्रिया लॉग और प्रमुख छवियों के पुस्तकालय को जोड़कर, एक रोबोट हर कार्य को एक नई खोज के रूप में मानना बंद कर सकता है और अपने अनुभव का एक निरंतर इतिहास बनाना शुरू कर सकता है। जबकि वर्तमान प्रणाली वस्तुओं की एक पूर्व-निर्धारित सूची का उपयोग करती है जिसे वह पहचान सकता है, शोधकर्ता नोट करते हैं कि भविष्य के संस्करणों को वस्तुओं की एक विस्तृत श्रृंखला को पहचानने और यहाँ तक कि मानवीय कार्यों से सीखने के लिए विस्तारित किया जा सकता है। फिलहाल, परिणाम एक स्पष्ट मार्ग दिखाते हैं: एक रोबोट जो यह याद रखता है कि उसने क्या छुआ और क्या देखा है, वह अंततः हमारे साथ काम करने में सक्षम है बिना हर बार शुरुआत से शुरू किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →