← नवीनतम पेपर
💻 computer science

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

यह शोध पत्र GLAM प्रस्तुत करता है, जो एक ग्लोबल स्पैटियोटेम्पोरल मेमोरी पर प्रशिक्षित एक गोल-कंडीशन्ड लेटेंट वर्ल्ड मॉडल है, जो बेहतर एक्टिव एक्सप्लोरेशन और सिमेंटिक नेविगेशन को सक्षम करने के लिए भविष्य के मैप रिप्रेजेंटेशन और नेविगेशन वेपॉइंट्स की भविष्यवाणी करता है, जिसे GLAM NAV सिस्टम द्वारा HM3D-ObjectNav कार्यों पर BSC-Nav बेसलाइन से बेहतर प्रदर्शन करके प्रदर्शित किया गया है।

मूल लेखक: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

प्रकाशित 2026-09-16
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक ऐसे कमरे में प्रवेश करता है जिसे उसने पहले कभी नहीं देखा है, और उसे एक विशिष्ट वस्तु खोजने का काम दिया गया है, जैसे कि एक लाल कुर्सी, जिसे वह जहाँ खड़ा है वहाँ से देख नहीं सकता। सफल होने के लिए, रोबोट केवल अपने कैमरे के सामने जो कुछ भी है उस पर प्रतिक्रिया नहीं दे सकता। उसे चलते समय स्थान की एक मानसिक तस्वीर बनानी होगी, यह याद रखना होगा कि वह कहाँ रहा है, और यह अनुमान लगाना होगा कि अगले कोने के पीछे क्या हो सकता है। मेमोरी में एक मानचित्र रखने, यह अनुमान लगाने की क्षमता कि रोबंतु के आगे बढ़ने पर वह मानचित्र कैसे बदलेगा, और उस अनुमान का उपयोग अपने अगले कदम की योजना बनाने के लिए करना ही सक्रिय अन्वेषण (active exploration) की मुख्य चुनौती है। वर्षों तक, शोधकर्ताओं ने मशीनों को यह कौशल सिखाने की कोशिश की है, उन्हें उच्च-परिभाषा (high-definition) विवरण में, पिक्सेल-दर-पिक्सेल दुनिया का पुनर्निर्माण करने के लिए प्रशिक्षित करके, या पूर्व-निर्मित मानचित्रों पर निर्भर करके। हालाँकि, एक नया दृष्टिकोण सुझाव देता है कि एक रोबोट को नेविगेट करने के लिए हर ईंट और छाया को देखने की आवश्यकता नहीं है; उसे केवल स्थान की संरचना और अपने लक्ष्य तक पहुँचने के संभावित मार्ग को समझने की आवश्यकता है।

शोधकर्ताओं की एक टीम ने GLAM नामक एक प्रणाली विकसित की है, जिसका अर्थ है 'गोल-कंडीशन्ड लेटेंट वर्ल्ड मॉडल ट्रेंड ओवर ग्लोबल स्पैटियोटेम्पोरल मेमोरी' (goal-conditioned latent world model trained over global spatiotemporal memory)। सरल शब्दों में, यह एक ऐसा नेविगेशन सिस्टम है जो बिना दुनिया को पूर्ण विवरण के साथ फिर से बनाने की आवश्यकता के, कमरे के भविष्य के लेआउट और गंतव्य तक जाने के सर्वोत्तम पथ की भविष्यवाणी करना सीखता है। कमरे का अगला दृश्य कैसा दिखेगा, इसके लिए एक नया वीडियो फ्रेम उत्पन्न करने के बजाय, यह प्रणाली मानचित्र के एक संकुचित, अमूर्त प्रतिनिधित्व और आगे कहाँ जाना है, इसके लिए एक छिपे हुए प्लान की भविष्यवाणी करती है। यह दृष्टिकोण इस बात से प्रेरित है कि कैसे जैविक मस्तिष्क, विशेष रूप से हिप्पोकैम्पस (hippocampus), स्थानिक स्मृतियों को व्यवस्थित करते हैं और भविष्य के परिदृश्यों का अनुकरण करने के लिए उनका उपयोग करते हैं। शोधकर्ताओं ने इस मॉडल के इर्द-गिर्द एक पूर्ण नेविगेशन सिस्टम बनाया, जिसे GLAM NAV नाम दिया गया है, जो ऑनलाइन मैपिंग, मेमोरी रिट्रीवल और प्रेडिक्टिव प्लानिंग को एक एकल लूप में जोड़ता है।

यह प्रणाली रोबोट के चलते रहने के साथ-साथ वातावरण की एक विरल (sparse), डिजिटल स्मृति को लगातार अपडेट करके काम करती है। यह स्मृति वातावरण की पूर्ण 3D तस्वीर नहीं है, बल्कि प्रमुख स्थलों (landmarks) और स्थानिक संबंधों का एक संग्रह है। जब रोबोट को किसी लक्ष्य को खोजने की आवश्यकता होती है, तो वह अपनी वर्तमान स्थिति और जो उसने पहले देखा है उसकी स्मृति का उपयोग करके एक सरल प्रश्न पूछता है: "यदि मैं इस दिशा में चलता हूँ, तो मानचित्र कैसा दिखेगा, और क्या मैं अपने लक्ष्य के करीब पहुँच जाऊँगा?" GLAM मॉडल इसका उत्तर दो चीजों की भविष्यवाणी करके देता है। पहला, यह पूर्वानुमान लगाता है कि रोबोट के अन्वेषण करने के साथ मैप टोकन (स्मृति के अमूर्त निर्माण खंड)—कैसे विकसित होंगे। दूसरा, यह एक 'लेटेंट वेपॉइंट' (latent waypoint) की भविष्यवाणी करता है, जो अगले कदम का एक छिपा हुआ प्रतिनिधित्व है जिसे रोबोट को लेना चाहिए। ये भविष्यवाणियाँ एक साझा स्थान (shared space) में होती हैं, जिसका अर्थ है कि मॉडल बदलते हुए मानचित्र को सीधे आवश्यक गति से जोड़ने के लिए सीखता है, और यह सब बिना भविष्य के कच्चे दृश्यों (raw visual images) को पुनर्गठित करने की कोशिश किए।

इस प्रणाली को प्रशिक्षित करने के लिए, शोधकर्ताओं ने रोबोटों को वास्तविक दुनिया में गलतियाँ करने के लिए नहीं भेजा। इसके बजाय, उन्होंने 'हैबिटेट' (Habitat) नामक एक उच्च-विश्वसनीयता वाले सिम्युलेटर का उपयोग किया, जिसमें अपार्टमेंट और कार्यालयों जैसे वास्तविक इनडोर वातावरण के सैकड़ों विस्तृत 3D स्कैन शामिल हैं। उन्होंने विशेषज्ञ प्रक्षेप पथों (expert trajectories)—एक आदर्श, कंप्यूटर-नियंत्रित एजेंट द्वारा लिए गए पथ जो ठीक जानता था कि वस्तुएं कहाँ थीं—को फिर से चलाया और इन पथों को हजारों प्रशिक्षण नमूनों में विभाजित किया। मॉडल ने मैप टोकन के इतिहास और एक लक्ष्य को देखना और भविष्य के मानचित्र तथा अगले वेपॉइंट की भविष्यवाणी करना सीखा। महत्वपूर्ण रूप से, सिस्टम को दृश्य दुनिया के पुनर्निर्माण के कार्य को अनदेखा करने के लिए सिखाया गया था। इसने पूरी तरह से स्थान की संरचना और नेविगेट करने की योजना की भविष्यवाणी करने पर ध्यान केंद्रित किया। मुख्य मॉडल को प्रशिक्षित करने से पहले, शोधकर्ताओं ने एक अलग घटक को यह समझने के लिए प्री-ट्रेन किया कि इन छिपे हुए वेपॉइंट प्लान को वास्तविक भौतिक गतिविधियों में कैसे अनुवादित किया जाए, जिससे यह सुनिश्चित हो सके कि भविष्यवाणियों को वास्तविक कमांड में बदला जा सके।

सिम्युलेटर में परीक्षण करने पर, परिणामों ने दिखाया कि यह प्रेडिक्टिव दृष्टिकोण उन पिछले तरीकों की तुलना में बेहतर काम करता है जो विभिन्न प्रकार की मेमोरी संरचनाओं पर निर्भर थे। परीक्षण दृश्यों के एक विशिष्ट पचास प्रतिशत सेट पर, नए सिस्टम, GLAM NAV ने 86.89 प्रतिशत प्रयासों में सफलतापूर्वक लक्ष्य वस्तु को खोजा, जो कि इसके मुकाबले किए गए बेसलाइन सिस्टम की 78.50 प्रतिशत सफलता दर से काफी अधिक है। इसने लक्ष्य तक अधिक कुशलता से पहुँचने में भी सफलता प्राप्त की, जिसमें 'सक्सेस वेटेड बाय पाथ लेंथ' (Success weighted by Path Length) का मीट्रिक 47.70 प्रतिशत से बढ़कर 48.35 प्रतिशत हो गया। ये संख्याएँ बताती हैं कि मानचित्र की भविष्य की संरचना और पथ की भविष्यवाणी एक साथ करके, रोबोट रास्ता खोजने में अधिक विश्वसनीय हो गया, भले ही लक्ष्य शुरुआत में दृष्टि से बाहर हो। सिस्टम ने केवल एक मार्ग को याद नहीं किया; इसने वातावरण के लेआउट का अनुमान लगाना सीखा और उस अनुमान के आधार पर अपनी योजना को समायोजित करना सीखा।

यह सिद्ध करने के लिए कि यह केवल सिम्युलेटर का परिणाम नहीं था, शोधकर्ताओं ने इस सिस्टम को एक वास्तविक कार्यालय वातावरण में एक पहिये वाले मानव रूपी (wheeled humanoid) दोहरे हाथों वाले रोबोट पर तैनात किया। अपने पहले वास्तविक दुनिया के परीक्षण में, रोबोट को एक ऐसे कमरे में गमले वाले पौधे को खोजने के लिए कहा गया जिसे उसने पहले कभी नहीं देखा था, और कोई पूर्व-निर्मित मानचित्र प्रदान नहीं किया गया था। जैसे-जैसे वह आगे बढ़ा, उसने स्थान की अपनी स्मृति बनाई, नए दृश्य अवलोकनों को अपने बढ़ते मानचित्र से जोड़ा। वह सफलतापूर्वक पौधे तक पहुँचा, जिससे यह प्रदर्शित हुआ कि सिस्टम वास्तविक, भौतिक सेटिंग में शून्य से एक उपयोगी स्थानिक स्मृति का निर्माण कर सकता है। दूसरे परीक्षण में, रोबोट को यह याद करने के लिए कहा गया कि उसने पौधे को कहाँ देखा था जब वस्तु दृष्टि से बाहर हो गई थी। सिस्टम ने अपनी स्मृति से संग्रहीत स्थान को पुनः प्राप्त किया और सफलतापूर्वक उस स्थान पर वापस जाने में सफल रहा। इन प्रदर्शनों ने पुष्टि की कि मॉडल द्वारा की गई अमूर्त भविष्यवाणियाँ एक वास्तविक रोबोट को वास्तविक वातावरण के माध्यम से मार्गदर्शन कर सकती हैं, जो देखे गए और आवश्यक के बीच के अंतर को पाटने के लिए स्मृति का उपयोग करती हैं।

इन सफलताओं के बावजूद, शोधकर्ता अपने कार्य की सीमाओं को नोट करने में सावधानी बरतते हैं। सिस्टम सिम्युलेटर में विशेषज्ञ एजेंटों द्वारा लिए गए पथों से सीखता है, इसलिए यह तब सबसे प्रभावी होता है जब रोबोट का व्यवहार प्रशिक्षण के दौरान देखे गए पैटर्न के भीतर रहता है। यह कोई सामान्य सिम्युलेटर नहीं है जो किसी भी यादृच्छिक क्रिया के परिणाम की भविष्यवाणी कर सके; बल्कि, यह एक लक्ष्य-निर्देशित उपकरण है जो एक विशिष्ट उद्देश्य के लिए सबसे संभावित मानचित्र और पथ का अनुमान लगाता है। मॉडल एक एकल, निश्चित भविष्यवाणी उत्पन्न करता है न कि संभावनाओं की एक श्रृंखला, जिसका अर्थ है कि यह अपनी भविष्यवाणियों की अनिश्चितता की स्पष्ट रूप से गणना नहीं करता है। यदि रोबोट एक ऐसे लेआउट का सामना करता है जो उसके द्वारा सीखे गए लेआउट से बहुत अलग है, या यदि उसके सेंसर भटक जाते हैं और स्थान का पता लगाने में विफल रहते हैं, तो सिस्टम संघर्ष कर सकता है। शोधकर्ता इस बात पर जोर देते हैं कि रोबोट अभी भी अपने स्थान को सत्यापित करने और टकरावों से बचने के लिए वास्तविक समय के अवलोकनों पर निर्भर करता है, भविष्यवाणियों का उपयोग केवल अपनी खोज को निर्देशित करने के लिए करता है।

यह कार्य रोबोट नेविगेशन के बारे में हमारी सोच में एक बदलाव का प्रतिनिधित्व करता है। एक पूर्ण, उच्च-रिज़ॉल्यूशन प्रतिलिपि बनाने के बजाय, सिस्टम एक कार्यात्मक, अमूर्त मानचित्र के साथ काम करना सीखता है जो योजना बनाने के लिए पर्याप्त है। भविष्य के मानचित्र की भविष्यवाणी और अगले कदम की योजना को एक एकल, जुड़े हुए कार्य के रूप में मानकर, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो लक्ष्य खोजने में अधिक विश्वसनीय है और वास्तविक दुनिया की सेटिंग्स में संचालित करने में सक्षम है। निष्कर्ष बताते हैं कि प्रभावी ढंग से अन्वेषण करने के लिए, एक रोबोट को सब कुछ देखने की आवश्यकता नहीं है; उसे स्थान की संरचना को इतना समझने की आवश्यकता है कि वह कल्पना कर सके कि आगे क्या होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →