← नवीनतम पेपर
💻 computer science

ODG-NoMaD: Overhead-Camera Direction-Guided NoMaD

ODG-NoMaD, ओवरहेड-कैमरा से प्राप्त वैश्विक दिशा मार्गदर्शन को अपनी डिफ्यूजन-आधारित अन्वेषण प्रक्रिया में एकीकृत करके NoMaD विजन-नेविगेशन पॉलिसी को उन्नत करता है, जो बिना किसी पॉलिसी रिट्रेनिंग के अनदेखे वातावरण में लक्ष्य की दूरी को काफी कम करता है और टकराव-मुक्त नेविगेशन सुनिश्चित करता है।

मूल लेखक: Blossom Treesa Bastian, Keerthi S. Shetty, Manish Kolachalam, Rani Malhotra, Ashish Dutta

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Blossom Treesa Bastian, Keerthi S. Shetty, Manish Kolachalam, Rani Malhotra, Ashish Dutta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट को एक ऐसे कमरे में भेजा गया है जिसे उसने पहले कभी नहीं देखा है, उसे फर्श पर एक विशिष्ट स्थान खोजने का कार्य दिया गया है। रोबोट के पास कोई मानचित्र नहीं है, कोई निर्देश नहीं हैं, और न ही कोई मार्गदर्शन करने वाला है। वह केवल अपनी आँखों के सामने मौजूद एक एकल कैमरे के माध्यम से सीधे अपने सामने देख सकता है। ऐसी स्थिति में, अन्वेषण (explore) करने के लिए प्रशिक्षित एक रोबोट एक नए शहर में बिना दिशा-सूचक यंत्र (compass) के घूमने वाले व्यक्ति की तरह व्यवहार करता है: वह आगे बढ़ता है, दीवार से टकराने पर मुड़ता है, और कभी-कभी उन जगहों पर वापस लौट आता है जहाँ वह पहले जा चुका होता है। वह शुद्ध भाग्य के भरोसे लक्ष्य तक पहुँच सकता है, लेकिन अक्सर, वह कमरे के स्थानीय कोनों में फँसा हुआ बिना किसी उद्देश्य के भटकता रहता है, क्योंकि वह इस बात को समझने में असमर्थ होता है कि उसे कहाँ जाना है। यह अज्ञात स्थानों में स्वायत्त नेविगेशन (autonomous navigation) की मुख्य चुनौती है: रोबोट को तत्काल बाधाओं से बचने के लिए स्थानीय प्रतिक्रियात्मक क्षमता (local reflexes) देने के साथ-साथ एक दूर के गंतव्य तक पहुँचने के लिए वैश्विक जागरूकता (global awareness) कैसे प्रदान की जाए।

शोधकर्ताओं ने शक्तिशाली लर्निंग-आधारित प्रणालियाँ विकसित की हैं जो रोबोट को सख्त नियमों के साथ प्रोग्राम करने के बजाय हजारों उदाहरणों को देखकर चलना सीखने की अनुमति देती हैं। ऐसा ही एक सिस्टम, जिसे NoMaD के रूप में जाना जाता है, दो चीजों में बहुत अच्छा है: किसी चित्र को देखकर एक विशिष्ट लक्ष्य तक पहुँचना, और लक्ष्य दिए बिना एक अज्ञात क्षेत्र का अन्वेषण करना। हालाँकि, इसके अन्वेषण मोड में, सिस्टम में दिशा का बोध नहीं होता है। यह कई संभावित पथ उत्पन्न करता है, लेकिन वैश्विक मार्गदर्शक के बिना, यह नहीं बता सकता कि कौन सी दिशा लक्ष्य की ओर ले जाती है। यह प्रतिक्रियात्मक (reactive) है, जिसका अर्थ है कि यह वही देखता है जो अभी उसके सामने है, लेकिन यह रणनीतिक नहीं है। इसे हल करने के लिए, इंफोसिस और भारतीय प्रौद्योगिकी संस्थान कानपुर के शोधकर्ताओं की एक टीम ने एक नया तरीका बनाया है जो रोब-ोट की चलने की सीखी हुई क्षमता को कमरे के ऊपर से देखे गए एक सरल, एकमुश्त दृश्य के साथ जोड़ता है।

नया दृष्टिकोण, जिसे ODG-NoMaD कहा जाता है, रोबोट को शुरू करने से पहले छत पर लगे कैमरे से पूरे कार्यक्षेत्र की एक संक्षिप्त झलक देकर काम करता है। यह ओवरहेड कैमरा एक एकल डेप्थ इमेज (depth image) लेता है, जो वस्तुओं की दूरी मापता है, और इसका उपयोग कमरे का टॉप-डाउन मैप बनाने के लिए करता है। यह मानचित्र दिखाता है कि दीवारें कहाँ हैं, फर्नीचर कहाँ स्थित है, और खुला फर्श कहाँ है। इस मानचित्र का उपयोग करके, एक कंप्यूटर प्लानर रोबोट के शुरुआती बिंदु से लक्ष्य तक एक सुरक्षित, सीधी रेखा वाला पथ बनाता है। इस पथ को फिर सरल निर्देशों में विभाजित किया जाता है, जो रोबोट को किसी भी दिए गए क्षण में यह बताता है कि उसे किस दिशा में जाना है। महत्वपूर्ण नवाचार यह है कि इस वैश्विक दिशा का उपयोग रोबोट के अपने निर्णय लेने की प्रक्रिया को बदलने के लिए नहीं किया जाता है। इसके बजाय, इसे चलते समय रोबोट के मौजूदा लर्निंग मॉडल में धीरे से इंजेक्ट (inject) किया जाता है। रोबोट अभी भी फर्श को देखने और तत्काल टक्करों से बचने के लिए अपने स्वयं के कैमरे का उपयोग करता है, लेकिन अब उसके पास सही दिशा की ओर खींचने वाला एक सूक्ष्म झुकाव (subtle bias) है।

शोधकर्ताओं ने इस प्रणाली का परीक्षण एक सिम्युलेटेड कार्यालय वातावरण में किया, जो एक ऐसा स्थान है जिसमें मेज, कुर्सियाँ और बिन (bins) भरे हुए हैं, जैसा कि वास्तविक कार्यस्थल में पाया जा सकता है। उन्होंने इस नई पद्धति की तुलना रोबोट के मानक, बिना मार्गदर्शन वाले संस्करण और एक अन्य सिस्टम से की जो रोबोट को सीधे लक्ष्य की ओर इशारा करके निर्देशित करने का प्रयास करता है। परिणामों ने एक नाटकीय अंतर दिखाया। बिना किसी मार्गदर्शन के, मानक रोबोट रास्ते से भटक गया और अधिकांश प्रयासों में लक्ष्य से दूर रुक गया। हालाँकि, नई पद्धति ने हर एक प्रयास में रोबोट को लक्ष्य तक सफलतापूर्वक पहुँचाया, और अनगाइडेड (unguided) संस्करण की तुलना में लक्ष्य से रह जाने वाली औसत दूरी को लगभग सात गुना कम कर दिया। इसने उस सिस्टम से भी बेहतर प्रदर्शन किया जो सीधे लक्ष्य की ओर इशारा करता था, क्योंकि नई पद्धति ने रोबोट को एक एकल बिंदु की ओर मजबूर करने के बजाय एक सामान्य दिशा में निर्देशित किया, जिससे यह लचीला और अनुकूलनीय बना रहा।

शायद सबसे महत्वपूर्ण खोज यह थी कि सिस्टम ने आश्चर्यों को कैसे संभाला। कुछ परीक्षणों में, शोधकर्ताओं ने ओवरहेड मैप बनाए जाने और पथ की योजना बनाने के बाद कमरे में नई बाधाएं रखीं। ये बाधाएं मानचित्र पर नहीं थीं, इसलिए रोबोट को पता नहीं चल सकता था कि वे वहाँ हैं। मानक गाइडेड रोबोट, जो केवल पूर्व-निर्धारित पथ पर निर्भर था, सीधे इन नई वस्तुओं से टकराने की कोशिश करता। हालाँकि, पूर्ण ODG-NoMaD सिस्टम ने एक दूसरा, रीयल-टाइम चेक उपयोग किया। जैसे ही रोबोट चलता, वह अपने स्वयं के ऑनबोर्ड कैमरे का उपयोग करके अपने ठीक सामने के फर्श को स्कैन करता। यदि इसने निर्धारित पथ को अवरुद्ध करने वाली एक नई बाधा का पता लगाया, तो यह तुरंत एक सुरक्षित मोड़ (detour) की गणना करता, लक्ष्य की ओर अपनी सामान्य दिशा बनाए रखते हुए वस्तु के चारों ओर मुड़ जाता। इसने रोबोट को लक्ष्य तक पहुँचने में सक्षम बनाया, भले ही प्रारंभिक मानचित्र बनने के बाद वातावरण बदल गया हो।

यह अध्ययन प्रदर्शित करता है कि यह संभव है कि एक लर्निंग-आधारित रोबोट को उसे फिर से प्रशिक्षित किए बिना या उसे नए नियम सिखाए बिना वैश्विक दिशा का बोध कराया जा सके। केवल एक बार के ओवरहेड दृश्य और तत्काल बाधाओं की जाँच करने के तरीके को जोड़कर, शोधकर्ताओं ने एक भटकते हुए अन्वेषक को एक उद्देश्यपूर्ण नेविगेटर में बदल दिया। यह प्रणाली पूरी तरह से रोबोट के चलते समय काम करती है, इसके पूर्व-प्रशिक्षित मॉडल का बिल्कुल वैसे ही उपयोग करती है जैसा वह था, लेकिन इसके विकल्पों को एक सूक्ष्म, वैश्विक धक्के (nudge) के साथ निर्देशित करती है। यह उन रोबोटों के लिए एक व्यावहारिक मार्ग सुझाता है जिन्हें गतिशील, अज्ञात स्थानों में काम करने की आवश्यकता होती है, जैसे कि आपदा क्षेत्र या व्यस्त गोदाम, जहाँ उन्हें वास्तविक दुनिया के अप्रत्याशित परिवर्तनों के प्रति सुरक्षित रूप से प्रतिक्रिया करते हुए लक्ष्य तक पहुँचने में सक्षम होना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →