Retrospective Open-Vocabulary Memory for Long-Term Object Search
यह शोध पत्र ECROM को प्रस्तुत करता है, जो दीर्घकालिक वस्तु खोज (object search) के लिए एक विधि है जो डिटेक्शन अवसरों के बारे में तर्क करने और खोज दक्षता में सुधार करने के लिए रेट्रोस्पेक्टिव ओपन-वोकेबुलरी मेमोरी का उपयोग करती है, जिसे एक नए बेंचमार्क द्वारा मान्य किया गया है जो मौजूदा मेमोरी सिस्टम की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
दुनिया में घूमने वाले रोबोट देखने में तो बेहतर हो रहे हैं, लेकिन वे चीजें आमतौर पर कहाँ होती हैं, इसे याद रखने में अभी भी बहुत खराब हैं। कल्पना कीजिए कि एक रोबोट को उस घर में खोई हुई चाबियों को खोजने का काम सौंपा गया है जहाँ वह कई बार जा चुका है। यदि रोबोट को केवल पिछली बार चाबियाँ देखने की याद रहती है, तो यदि चाबियाँ कल हटा दी गई थीं, तो वह गलत जगह देख सकता है। यदि वह केवल इस बात को गिनता है कि उसने किसी विशिष्ट स्थान पर कितनी बार चाबियाँ देखी हैं, तो वह अपनी ही बदकिस्मती से धोखा खा सकता है: शायद वह सौ बार किचन टेबल के पास से गुजरा लेकिन उसने नीचे नहीं देखा, जबकि उसने लिविंग रूम सोफे पर केवल एक बार नज़र डाली और वहाँ चाबियाँ देख लीं। एक साधारण गिनती रोबोट को यह सोचने पर मजबूर कर देगी कि सोफा देखने के लिए सबसे अच्छी जगह है, भले ही टेबल वास्तव में वह जगह हो जहाँ चाबियाँ अक्सर रहती हैं। यह लंबी अवधि की वस्तु खोज (long-term object search) की मूल समस्या है: किसी वस्तु के वास्तविक निवास स्थान और जहाँ रोबोट ने वास्तव में देखा, उसके बीच अंतर करना।
इस समस्या को हल करने के लिए, नेशनल यूनिवर्सिटी ऑफ सिंगापुर के शोधकर्ताओं ने रोबोटों के लिए अपने वातावरण की स्मृति (memory) बनाने का एक नया तरीका विकसित किया है। वे अपने सिस्टम को ECROM कहते हैं, जिसका अर्थ है एक्सपोज़र-कैलिब्रेटेड रेट्रोस्पेक्टिव ओपन-वॉयकैबुलरी मेमोरी (Exposure-Calibrated Retrospective Open-Vocabulary Memory)। टीम ने दस अलग-अलग डिजिटल घरों में नियंत्रित सिमुलेशन की एक श्रृंखला में इस प्रणाली का परीक्षण किया, जहाँ वस्तुओं को छिपे हुए पैटर्न के अनुसार इधर-उधर रखा गया था, और रोबोट के पथ को जानबूझकर बदला गया था ताकि कुछ सतहें अक्सर देखी जाएँ और कुछ कम। उन्होंने पाया कि यह गणना करके कि रोबोट ने वास्तव में क्या देखा और किसी सतह को देखने का उसका कितना अवसर था, रोबोट वस्तुओं की वास्तविक आदतों को सीख सकता है। जब उन वस्तुओं को खोजने के लिए कहा गया जिन्हें खोजने के लिए उसे पहले कभी नहीं बताया गया था, तो इस नई मेमोरी सिस्टम ने रोबोट को पिछले तरीकों की तुलना में बहुत तेज़ी से और अधिक विश्वसनीयता के साथ लक्ष्य खोजने में मदद की।
शोधकर्ताओं ने जिस चुनौती का सामना किया वह रोबोट के चलने की अव्यवस्थित वास्तविकता में निहित है। एक वास्तविक घर में, एक रोबोट हर कमरे के हर इंच को पूर्ण स्पष्टता के साथ स्कैन नहीं करता है। वह छत की ओर देखते हुए किचन से गुजर सकता है, या एक डाइनिंग टेबल के पास से गुजर सकता है जो आंशिक रूप से कुर्सी द्वारा ढका हुआ है। यदि एक रोबोट केवल एक मेज बनाम एक आइलैंड पर "स्ट्रॉ हैट" (straw hat) का पता लगाने की संख्या गिनता है, तो वह गलत उत्तर दे सकता है यदि उसने आइलैंड को देखने में अधिक समय बिताया हो। टोपी मेज पर आधी बार हो सकती है, लेकिन यदि रोबोट ने केवल आइलैंड को ही देखा, तो एक साधारण गिनती यह सुझाव दे सकती है कि आइलैंड ही टोपी का घर है। शोधकर्ताओं ने महसूस किया कि चीजों के कहाँ होने का पता लगाने के लिए, एक रोबोट को किसी वस्तु की उपस्थिति के साक्ष्य को उसे देखने के अवसर से अलग करना होगा। एक मिस डिटेक्शन (missed detection) तभी सार्थक है जब रोबोट वास्तव में सही दिशा में देख रहा था; यदि रोबोट दूसरी ओर देख रहा था, तो डिटेक्शन का न होना हमें कुछ नहीं बताता।
इस विचार का परीक्षण करने के लिए, टीम ने LOOP-Bench नामक एक बेंचमार्क बनाया, जिसमें दस यथार्थवादी घरेलू वातावरण शामिल हैं। इन सिमुलेशन में, उन्होंने कप, कैंची और टोपियों जैसी वस्तुओं को विभिन्न सतहों पर छिपे हुए संभाव्यता वितरण (probability distributions) के अनुसार रखा। कुछ वस्तुएं हमेशा एक ही मेज पर थीं, जबकि कुछ कुछ स्थानों के बीच घूमती थीं, और कुछ बहुत कम दिखाई देती थीं। महत्वपूर्ण रूप से, इन घरों में रोबोट का पथ वस्तुओं के रखे जाने के स्थान से स्वतंत्र रूप से उत्पन्न किया गया था। इसका मतलब था कि रोबोट एक मेज के पास दस बार जा सकता है बिना उसकी सतह को स्पष्ट रूप से देखे, जबकि वह किचन आइलैंड के पास केवल एक बार गुजर सकता है और उसे एक आदर्श दृश्य मिल सकता है। इस सेटअप ने मेमोरी सिस्टम को मजबूर किया कि वह रोबोट के अपने मूवमेंट पैटर्न से धोखा खाए बिना वस्तुओं के वास्तविक स्थान का पता लगाए।
नया सिस्टम, ECROM, रोबोट के इतिहास को सतहों, या "सपोर्ट्स" (supports) के मानचित्र के रूप में व्यवस्थित करके और हर चक्कर के दौरान प्रत्येक सतह का कितना हिस्सा दिखाई दे रहा था, इसे रिकॉर्ड करके काम करता है। जब बाद में कोई इंसान रोबोट को कोई विशिष्ट वस्तु खोजने के लिए कहता है, तो सिस्टम सभी पिछली यात्राओं को देखता है। यह केवल डिटेक्शन को नहीं गिनता; इसके बजाय, यह इस आधार पर एक संभावना की गणना करता है कि सतह का कितना हिस्सा कैमरे के सामने एक्सपोज्ड (exposed) था। यदि रोबोट ने एक सतह को स्पष्ट रूप से देखा और वस्तु नहीं पाई, तो सिस्टम उस स्थान पर वस्तु होने के विश्वास को दृढ़ता से कम कर देता है। लेकिन यदि रोबोट ने केवल एक झलक देखी थी, या यदि दृश्य बाधित था, तो सिस्टम डिटेक्शन की कमी को 'न्यूट्रल' (neutral) मानता है, और उस स्थान को दंडित करने से इनकार करता है। यह रोबोट को यह सीखने की अनुमति देता है कि किसी वस्तु के किसी सतह पर होने की संभावना अधिक है, बशर्ते कि वह सतह एकमात्र ऐसी जगह हो जहाँ वस्तु को तब देखा गया था जब वह दृश्यमान थी।
सिमुलेशन के परिणाम स्पष्ट थे। जब शोधकर्ताओं ने रोबोट को उन वस्तुओं को खोजने के लिए कहा जिन्हें खोजने के लिए उसे स्पष्ट रूप से नहीं बताया गया था, तो नए सिस्टम ने उनके द्वारा परीक्षण किए गए हर अन्य तरीके को पछाड़ दिया। इसने भविष्यवाणियों की सटीकता में महत्वपूर्ण अंतर से सुधार किया और अधिक महत्वपूर्ण बात यह है कि इसने सक्रिय खोज के दौरान वस्तुओं को बहुत तेज़ी से खोजा। सिमुलेशन में, ECROM का उपयोग करने वाले रोबोट ने लगभग 53 प्रतिशत के अगले सर्वश्रेष्ठ तरीके की तुलना में, लगभग 59 प्रतिशत प्रयासों में लक्ष्य को खोजा। इससे भी अधिक आश्चर्यजनक रूप से, पेपर में दिखाए गए एक विशिष्ट केस स्टडी में, वस्तु को खोजने के लिए रोबोट को तय करने वाली दूरी 17.8 मीटर से घटकर केवल 3.2 मीटर रह गई। यह दक्षता इस कारण आई क्योंकि रोबोट को ठीक से पता था कि किन सतहों की जांच पहले करना सार्थक है, बजाय इसके कि वह बिना सोचे-समझे भटकता रहे या उन जगहों पर वापस जाने में फंस जाए जिन्हें वह पहले ही खारिज कर चुका था।
यह सुनिश्चित करने के लिए कि यह केवल एक डिजिटल ट्रिक नहीं है, टीम ने एक भौतिक रोबोट, हेलो रोबोट स्ट्रैच 3 (Hello Robot Stretch 3) पर, एक वास्तविक कार्यालय वातावरण में इस प्रणाली का परीक्षण किया। उन्होंने लाल कप, कैंची और लंच मीट के डिब्बे जैसी वास्तविक वस्तुओं के साथ उसी प्रकार का खोज कार्य चलाया। रोबोट को 500 वर्ग मीटर के स्थान में नेविगेट करना था, डेस्क और शेल्फ के बीच घूमना था, ताकि इन वस्तुओं को खोजा जा सके। परिणाम सिमुलेशन के समान ही थे। नए मेमोरी सिस्टम का उपयोग करने वाले रोबोट ने 15 में से 14 परीक्षणों में वस्तुओं को खोजने में सफलता प्राप्त की, जबकि अन्य तरीकों ने केवल 10 या 11 में सफलता प्राप्त की। भौतिक रोबोट ने काफी कम दूरी तय की, अन्य दृष्टिकोणों के लगभग 29 मीटर की तुलना में औसतन 19.4 मीटर की दूरी तय की। इसने सिद्ध कर दिया कि अवलोकन के अवसर को वस्तु की उपस्थिति से अलग करने का तर्क तब भी काम करता है जब रोबोट वास्तविक दुनिया की अनिश्चित रोशनी और अव्यवस्था (clutter) से जूझ रहा हो।
शोधकर्ताओं ने यह भी पता लगाया कि क्या होगा यदि वे अपने सिस्टम के मुख्य हिस्सों को हटा दें। जब उन्होंने रोबोट को यह मानने के लिए मजबूर किया कि उसने हर सतह को पूरी तरह से देखा है, भले ही उसने स्पष्ट रूप से ऐसा नहीं किया था, तो रोबोट का प्रदर्शन गिर गया। यह मिस डिटेक्शन को वस्तु की अनुपस्थिति के प्रमाण के रूप में मानने लगा, जिससे वह सही स्थानों को अनदेखा करने लगा। इसी तरह, जब उन्होंने सिस्टम को केवल यह देखने तक सीमित कर दिया कि वस्तु देखी गई या नहीं, और दृश्य साक्ष्य की शक्ति को अनदेखा कर दिया, तो रोबोट कम सटीक हो गया। इन परीक्षणों ने पुष्टि की कि सिस्टम की सफलता दो विशिष्ट चीजों पर निर्भर थी: यह कि सतह का कितना हिस्सा वास्तव में दृश्यमान था, इसका सावधानीपूर्वक लेखा-जोखा रखना, और दृश्य साक्ष्य की शक्ति की सूक्ष्म व्याख्या करना।
यह कार्य उन रोबोटों के लिए आगे का मार्ग सुझाता है जिन्हें लंबे समय तक गतिशील, बदलते परिवेश में काम करने की आवश्यकता है। केवल पिछली बार देखी गई चीज़ को याद रखने या देखे जाने की सरल गिनती रखने के बजाय, ये रोबोट अपने आस-पास की दुनिया की आदतों को सीख सकते हैं। वे समझ सकते हैं कि सिर्फ इसलिए कि उन्होंने हाल ही में काउंटर पर कॉफी मग नहीं देखा है, इसका मतलब यह नहीं है कि मग वहां नहीं है; इसका मतलब यह हो सकता है कि उन्होंने उस काउंटर को काफी समय से नहीं देखा है। अपनी दृष्टि की सीमाओं का सम्मान करने वाली स्मृति बनाकर, एक रोबोट घर में एक अधिक विश्वसनीय साथी बन सकता है, जो खोई हुई वस्तुओं को खोजने में सक्षम होगा, भले ही उसके आस-पास की दुनिया निरंतर परिवर्तनशील हो। शोधकर्ता अपने कोड और बेंचमार्क डेटा को जनता के लिए जारी करने की योजना बना रहे हैं, जिससे अन्य लोग इस स्मार्ट, अधिक अवलोकनशील मशीनों की नींव पर निर्माण कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।