Visual Navigation Transformer with Pose Attention
यह शोध पत्र VNT-PA का प्रस्ताव करता है, जो एक ट्रांसफॉर्मर-आधारित नेविगेशन प्लैनर है जो डेप्थ कीफ्रेम्स को इंडेक्स करने के लिए कैमरा पोज़ेस को पोजीशनल एनकोडिंग के रूप में उपयोग करता है, जिससे विभिन्न प्रक्षेप पथों (ट्रैजेक्टरीज) में स्थानिक अनुभव का कुशल पुन: उपयोग सक्षम होता है और लॉन्ग-होरिजन पॉइंट-गोल नेविगेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
दुनिया में घूमने वाले रोबोटों को एक मौलिक स्मृति (मेमोरी) की समस्या का सामना करना पड़ता है। बिंदु A से बिंदु B तक पहुँचने के लिए, एक मशीन को यह याद रखना चाहिए कि उसने क्या देखा है, लेकिन उसे यह भी जानना आवश्यक है कि वे स्मृतियाँ स्थान के संदर्भ में कहाँ thuộc हैं। पारंपरिक नेविगेशन सिस्टम अक्सर एक रोबोट की यात्रा को एक वीडियो टेप की तरह मानते हैं, जो अवलोकनों को उनके घटित होने के सटीक क्रम में संग्रहीत करते हैं। यह एक एकल यात्रा के लिए तो अच्छा काम करता है, लेकिन जब रोबोट अपने पुराने अनुभवों का पुन: उपयोग करने की कोशिश करता है, तो यह एक अव्यवस्था पैदा कर देता है। यदि एक रोबोट आज एक गलियारे में जाता है और अगले सप्ताह वहां वापस आता है, तो वीडियो-शैली की स्मृति इन दोनों यात्राओं को एक एकल, सुसंगत मानचित्र में मिलाने में संघर्ष करती है। वह आसानी से यह नहीं बता पाता कि कल देखा गया दरवाजा आज देखे गए दरवाजे के समान ही है, या किसी अलग क्रम में ली गई मोड़ एक ही गंतव्य तक ले जाती है। इसे हल करने के लिए, इंजीनियरों ने अक्सर स्पष्ट मानचित्र बनाए हैं, जिसमें रोबोट के चलने से पहले दुनिया का ग्रिड या ग्राफ तैयार किया जाता है। हालाँकि, इन मानचित्रों के निर्माण के लिए जटिल प्रक्रिया की आवश्यकता होती है और यदि रोबोट के सेंसर थोड़े भी गलत हो जाएं, तो वे टूट सकते हैं। प्रश्न यह बना हुआ है: क्या एक रोबोट बिना पहले से मानचित्र बनाए, केवल यह याद रखकर नेविगेट करना सीख सकता है कि उसने कुछ देखते समय वह कहाँ था?
पेंसिल्वेनिया विश्वविद्यालय के शोधकर्ताओं की एक टीम ने रोबोट के सोचने के तरीके का एक नया तरीका विकसित किया है, जिसे वे 'विजुअल नेविगेशन ट्रांसफॉर्मर विद पोज अटेंशन' (Visual Navigation Transformer with Pose Attention) कहते हैं। रोबोट की स्मृतियों को समय के आधार पर व्यवस्थित करने के बजाय, वे उन्हें स्थान के आधार पर व्यवस्थित करते हैं। एक घर के माध्यम से टहलते समय ली गई तस्वीरों के संग्रह की कल्पना करें। एक मानक दृष्टिकोण में, ये तस्वीरें लिए गए क्रम में एक ढेर में रखी जाती हैं। इस नई प्रणाली में, प्रत्येक फोटो के साथ उस कैमरे की सटीक स्थिति और कोण टैग किया जाता है जब वह खींची गई थी। रोबोट ढेर को क्रम में नहीं देखता; वह पूरे संग्रह को एक इकाई के रूप में देखता है, और पूछता है, "मैं अभी कहाँ हूँ, और मेरा लक्ष्य क्या है?" सिस्टम फिर सभी संग्रहीत फोटो में से उन फोटो को खोजने के लिए खोज करता है जो वर्तमान स्थिति के लिए स्थानिक रूप से प्रासंगिक हैं, और इस बात को अनदेखा करता है कि उन्हें कब लिया गया था। यह रोबोट को विभिन्न यात्राओं की स्मृतियों को एक एकल, लचीली समझ में मिलाने की अनुमति देता है।
शोधकर्ताओं ने इस विचार का परीक्षण एक कंप्यूटर सिमुलेशन में वास्तविक दुनिया के इनडोर वातावरण के डेटासेट का उपयोग करके किया, विशेष रूप से 'हैबिटेट-मैटरपोर्ट 3D' (Habitat-Matterport 3D) डेटासेट, जिसमें वास्तविक इमारतों के 3D स्कैन शामिल हैं। उन्होंने रोबोट को गहराई वाली छवियों (depth images) का एक सेट दिया—दृश्य डेटा जो वस्तुओं की दूरी को दर्शाता है—जो एक इमारत के प्रारंभिक अन्वेषण के दौरान एकत्र की गई थीं। इन छवियों को "कीफ्रेम्स" (keyframes) के एक सेट तक फ़िल्टर किया गया था, जो कि सबसे उपयोगी स्नैपशॉट हैं जो कमरे के नए हिस्सों को दिखाते हैं, न कि एक ही दीवार के दोहराए गए दृश्य। रोबोट को फिर केवल इन संग्रहीत छवियों और अपनी वर्तमान स्थिति का उपयोग करके, एक यादृच्छिक स्थान से शुरू होकर, एक विशिष्ट लक्ष्य बिंदु को खोजने का कार्य दिया गया। इसने किसी पूर्व-निर्मित मानचित्र या अपनी वर्तमान गति के वीडियो स्ट्रीम पर भरोसा नहीं किया। इसके बजाय, इसने 'ट्रांसफॉर्मर' नामक एक प्रकार की कृत्रिम बुद्धिमत्ता का उपयोग किया, जिसे विभिन्न सूचनाओं के महत्व को तौलने के लिए डिज़ाइन किया गया है। इस मामले में, ट्रांसफॉर्मर ने कैमरा की स्थिति और कोण का उपयोग यह तय करने के लिए किया कि किन स्मृतियों पर ध्यान देना है।
परिणामों ने दिखाया कि यह दृष्टिकोण अत्यधिक प्रभावी था। परीक्षणों की एक श्रृंखला में, रोब manera सफलतापूर्वक अपने लक्ष्य तक पहुँचा, जो 93.3% प्रयासों में सफल रहा, जो उन अन्य तरीकों की तुलना में एक महत्वपूर्ण सुधार है जो समान स्मृतियों को समय-क्रमित अनुक्रम के रूप में देखते हैं। जब लक्ष्य दूर होता या उसके लिए एक लंबे, घुमावदार मार्ग की आवश्यकता होती, तो नया सिस्टम उच्च सटीकता बनाए रखता था, जबकि अन्य सिस्टम अक्सर भटक जाते या अक्षम मार्ग लेते थे। शोधकर्ताओं ने पाया कि इस सफलता की कुंजी इस बात में थी कि रोबोट अपनी स्मृतियों को कैसे जोड़ता है। वर्तमान स्थान और संग्रहीत छवियों के बीच के अंतर पर ध्यान केंद्रित करके, न कि उनके बीच के समय के अंतराल पर, रोबोट कमरे की ज्यामिति के बारे में अधिक प्रभावी ढंग से तर्क कर सका। उसने सीखा कि अब ली गई एक मोड़ उस मोड़ से संबंधित थी जो इमारत के दूसरे हिस्से में ली गई थी, केवल इसलिए क्योंकि दोनों बिंदुओं के बीच स्थानिक संबंध सुसंगत था।
सबसे आश्चर्यजनक निष्कर्षों में से एक यह था कि सिस्टम ने अपने स्वयं के स्थान के बोध में त्रुटियों को कितनी अच्छी तरह से संभाला। वास्तविक दुनिया में, रोबोटों के पास अक्सर अपूर्ण सेंसर होते हैं और वे शायद अपनी सटीक स्थिति मिलीमीटर तक न जान पाएं। जब शोधकर्ताओं ने इन त्रुटियों को सिम्युलेट करने के लिए शोर (noise) पेश किया, तो नया सिस्टम मजबूत बना रहा, और प्रदर्शन में बहुत कम गिरावट आई। इसके विपरीत, एक पारंपरिक प्रणाली जो उसी डेटा से एक कठोर मानचित्र बनाती है, नाटकीय रूप से विफल हो गई, क्योंकि शोर वाले स्थिति डेटा ने दीवारों को गलत स्थानों पर रख दिया, जिससे खुले गलियारों को अवरुद्ध दीवारों के रूप में गलत पहचान लिया गया। नया सिस्टम, वातावरण को स्थान-टैग की गई स्मृतियों के एक लचीले सेट के रूप में मानकर, इन अशुद्धियों को बिना ध्वस्त हुए सहन कर सकता था। इसे दुनिया के एकल, पूर्ण ग्रिड के प्रति प्रतिबद्ध होने की आवश्यकता नहीं थी; यह बस अपनी स्मृतियों को क्वेरी कर सकता था जहाँ उसे लगता था कि वह है, और चलते समय अपना मार्ग समायोजित कर सकता था।
शोधकर्ताओं ने यह भी पाया कि सिस्टम केवल प्रारंभिक अन्वेषण से ही सीख सकता है। यदि रोबोट अपनी यात्रा के दौरान कमरे के एक नए कोण या पहले से अनदेखे क्षेत्र का सामना करता है, तो वह बिना पुन: प्रशिक्षित हुए तुरंत उस नए दृश्य को अपने स्मृति सेट में जोड़ सकता है। इसका अर्थ है कि रोबोट विभिन्न पथों के अवलोकनों का उपयोग करके अंतराल को भरने के लिए, ऑन-द-फ्लाई (तुरंत) अपने परिवेश की समृद्ध समझ बना सकता है। सिस्टम को एक विशेषज्ञ योजनाकार (expert planner) की नकल करने के लिए प्रशिक्षित किया गया था जो इमारत के माध्यम से सटीक मार्ग जानता था, और इसने अपने परिवेश के स्थानिक संदर्भ को देखकर अगले कदम की भविष्यवाणी करना सीखा। निर्णय लेने के लिए इसे वर्तमान दृश्य देखने की आवश्यकता नहीं थी; इसे केवल यह जानने की आवश्यकता थी कि यह कहाँ है और कहाँ जाना चाहता है, और फिर प्रासंगिक स्मृतियों को याद करना था।
यह कार्य सुझाव देता है कि जटिल, परिवर्तनशील वातावरणों में नेविगेट करने के लिए रोबोटों को अनिवार्य रूप से दुनिया का एक स्थिर मानचित्र बनाने की आवश्यकता नहीं है। इसके बजाय, वे अनुभवों के एक गतिशील संग्रह पर भरोसा कर सकते हैं, जो इस आधार पर इंडेक्स किए गए हों कि वे कहाँ हुए थे। अध्ययन प्रदर्शित करता है कि स्मृतियों को समय के बजाय स्थान द्वारा व्यवस्थित करने से तेजी से सीखने और कठिन कार्यों पर बेहतर प्रदर्शन करने में मदद मिलती है। हालाँकि प्रयोग सिमुलेशन में किए गए थे, लेकिन इसके सिद्धांत ज्यामितीय तर्क पर आधारित हैं जो भौतिक दुनिया पर लागू होते हैं। शोधकर्ता नोट करते हैं कि उनका सिस्टम वर्तमान में दो आयामों (2D) में संचालित होता है, यह मानते हुए कि रोबोट एक सपाट फर्श पर चलता है, लेकिन अंतर्निहित पद्धति को तीन-आयामी (3D) गति के लिए विस्तारित किया जा सकता है। यह दिखाकर कि एक रोबोट केवल 'पोज-स्टैम्प्ड' (pose-stamped) स्मृतियों का उपयोग करके प्रभावी ढंग से नेविगेट कर सकता है, यह शोध मशीनों को दुनिया में उसी लचीलेपन और अनुकूलन क्षमता के साथ घूमने के योग्य बनाने के लिए एक नया मार्ग प्रदान करता है जो मनुष्यों में होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।