← नवीनतम पेपर
🤖 AI

RTNav: Towards Real-Time Zero-Shot Object Navigation

यह शोध पत्र RTNav को प्रस्तुत करता है, जो एक वास्तविक समय (रियल-टाइम) नेविगेशन आर्किटेक्चर है जो यथार्थवादी समय संबंधी बाधाओं के तहत मौजूदा ज़ीरो-शॉट ऑब्जेक्ट नेविगेशन विधियों के प्रदर्शन में गिरावट को दूर करने के लिए इन्फरेंस लेटेंसी (अनुमान विलंबता) और एसिंक्रोनस एनवायरनमेंट स्टेपिंग को स्पष्ट रूप से ध्यान में रखता है, जिससे HM3D बेंचमार्क पर सफलता दरों में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Easop Lee, Lingyu Zhang, Boyuan Chen

प्रकाशित 2026-08-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Easop Lee, Lingyu Zhang, Boyuan Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक रोबोट की कल्पना करें जिसे किसी अपरिचित घर में एक विशिष्ट वस्तु, जैसे कि लाल मग, खोजने के लिए भेजा गया है, बिना उस विशेष कमरे के बारे में किसी पूर्व प्रशिक्षण के। सफल होने के लिए, रोबोट को अपने चारों ओर देखना होगा, जो वह देख रहा है उसे समझना होगा, यह तय करना होगा कि आगे कहाँ जाना है, और अपने पहियों या पैरों को चलाना होगा, और यह सब तब करना होगा जब उसके आसपास की दुनिया बदलती रहेगी। यह ज़ीरो-शॉट ऑब्जेक्ट नेविगेशन (zero-shot object navigation) की चुनौती है: अज्ञात में मशीन को निर्देशित करने के लिए शक्तिशाली कृत्रिम बुद्धिमत्ता (AI) का उपयोग करना। वर्षों से, शोधकर्ताओं ने इन प्रणालियों का कंप्यूटर सिमुलेशन में परीक्षण किया है जहाँ वर्चुअल दुनिया रोबोट के मस्तिष्क के सोचने के दौरान रुक जाती है। इस ठहरे हुए अवस्था में, रोबिमोट किसी छवि को प्रोसेस करने या निर्णय लेने के लिए जितना चाहे उतना समय ले सकता है, और घड़ी नहीं चलती है। इस सेटअप ने वैज्ञानिकों को तेजी से जटिल और सक्षम नेविगेशन एजेंट बनाने की अनुमति दी है, लेकिन यह एक गंभीर दोष को छिपाता है। वास्तविक दुनिया में, समय कभी नहीं रुकता। जब एक रोबोट अपने अगले कदम की गणना कर रहा होता है, तो सेकंड बीत जाते हैं, रोबोट स्थिर खड़ा रहता है, और कार्य बजट—काम पूरा करने के लिए दिया गया समय—कम हो जाता है। यदि एक रोबोट सोचने में बहुत अधिक समय लेता है, तो वह कार्य को पूरा करने में सक्षम ही नहीं हो पाता, चाहे उसकी तर्क क्षमता कितनी भी स्मार्ट क्यों न हो।

ड्यूक यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने अब इस छिपी हुई लागत को उजागर किया है और नेविगेशन सिस्टम बनाने का एक नया तरीका प्रस्तावित किया है जो टिक-टिक करती घड़ी का सम्मान करता है। उन्होंने पाया कि सबसे उन्नत नेविगेशन एजेंट, जो भाषा और दृष्टि को समझने के लिए बड़े, शक्तिशाली AI मॉडल पर निर्भर करते हैं, वास्तविक समय (real-time) में काम करने के लिए मजबूर होने पर प्रदर्शन में भारी गिरावट का सामना करते हैं। अपने अध्ययन में, उन्होंने एक नया परीक्षण वातावरण बनाया जहाँ सिमुलेशन निरंतर चलता रहता है, बिल्कुल एक वास्तविक कमरे की तरह, जबकि रोबोट का कंप्यूटर अपना अगला कदम तय करने के लिए काम करता है। जब उन्होंने मानक नेविगेशन विधियों को इस सेटिंग में चलाया, तो एजेंट सुस्त और अक्षम हो गए। कंप्यूटर द्वारा अपनी गणना पूरी करने के इंतजार में बिताया गया समय मतलब रोबोट अपना एक महत्वपूर्ण हिस्सा स्थिर खड़े रहने में बिता देता था, जिससे वह अक्सर समय समाप्त होने से पहले अपने लक्ष्य तक पहुँचने के अवसर खो देता था। शोधकर्ताओं ने इसे एक नए मीट्रिक का उपयोग करके मापा जो न केवल वस्तु को खोजने के लिए पुरस्कृत करता है, बल्कि इसे जल्दी करने के लिए भी पुरस्कृत करता है, और बर्बाद हुए सेकंडों के लिए दंडित करता है।

इसे हल करने के लिए, टीम ने RTNav नामक एक नया आर्किटेक्चर पेश किया, जो समय के प्रवाह को एक विचार के बाद की चीज़ के बजाय डिज़ाइन के एक मौलिक हिस्से के रूप में मानता है। रोबोट को अपने मस्तिष्क के हर हिस्से के एक एकल विचार को पूरा करने के लिए रुकने और प्रतीक्षा करने के लिए मजबूर करने के बजाय, RTNav विभिन्न हिस्सों को उनकी अपनी स्वाभाविक गति पर काम करने देता है। सिस्टम का वह हिस्सा जो वस्तुओं का पता लगाता है, लगातार चलता रहता है, एक सेकंड में कई बार वातावरण को स्कैन करता है। मार्ग की योजना बनाने वाला हिस्सा कम बार चलता है, केवल आवश्यकता होने पर अपडेट होता है। पहियों को नियंत्रित करने वाला हिस्सा लगातार चलता है, नवीनतम योजना के बिना प्रतीक्षा किए बिना प्रतिक्रिया देता है। यह बिल्कुल वैसा ही है जैसे कोई व्यक्ति भीड़भाड़ वाली सड़क पर चलता है: आप हर कदम के बारे में सोचने के लिए पूरी तरह से नहीं रुकते; आप चलते रहते हैं जबकि आपकी आँखें बाधाओं को स्कैन करती हैं और आपका मन आपके पथ को अपडेट करता है। इन प्रक्रियाओं को एक सख्त रेखा के बजाय समानांतर रूप से होने की अनुमति देकर, रोबोट गति में रहता है और अपने समय का कुशलतापूर्वक उपयोग करता है।

इस दृष्टिकोण के परिणाम चौंकाने वाले थे। मानक नेविगेशन बेंचमार्क पर परीक्षण किए जाने पर, नया सिस्टम पिछले तरीकों से काफी बेहतर प्रदर्शन करता है। उन परीक्षणों में जहाँ रोबोट को जटिल, बहु-कक्षीय वातावरण में वस्तुओं को खोजना था, नए सिस्टम ने मौजूदा सर्वोत्तम तरीकों की तुलना में सफलता दर में 11 प्रतिशत तक सुधार किया। इससे भी महत्वपूर्ण बात यह है कि इसने कार्यों को बहुत तेज़ी से पूरा किया। शोधकर्ताओं ने 'सक्सेस वेटेड बाय कंप्लीशन टाइम' (success weighted by completion time) नामक एक मीट्रिक को मापा, जो यह जोड़ता है कि रोबोट ने वस्तु को पाया या नहीं और इसमें कितना समय लगा। नया सिस्टम इस मीट्रिक पर 5.1 अंक अधिक स्कोर करता है, जो यह दर्शाता है कि यह न केवल अधिक सफल था बल्कि बहुत अधिक कुशल भी था। अध्ययन ने दिखाया कि पुराने तरीके, जो ठहरे हुए सिमुलेशन विश्व के लिए डिज़ाइन किए गए थे, गणना पूरी होने का इंतजार करने में बहुत अधिक समय बर्बाद करते थे। इसके विपरीत, नया सिस्टम रोबोट को गतिमान रखता है, जिससे निष्क्रिय रहने के समय में प्रतिस्पर्धियों की तुलना में 14 प्रतिशत से अधिक की कमी आई।

शोधकर्ताओं ने यह भी परीक्षण किया कि यह सिस्टम विभिन्न प्रकार के कंप्यूटर हार्डवेयर पर कितना मजबूत है, जिसमें शक्तिशाली डेस्कटॉप ग्राफिक्स कार्ड से लेकर छोटे, अधिक ऊर्जा-कुशल चिप्स तक शामिल हैं जो एज डिवाइस के लिए डिज़ाइन किए गए हैं। सिस्टम ने उन सभी पर लगातार अच्छा प्रदर्शन किया, कंप्यूटिंग पावर कम होने पर भी उच्च सफलता दर बनाए रखी। यह सुझाव देता है कि डिज़ाइन इतना लचीला है कि उपलब्ध सबसे महंगे हार्डवेयर की आवश्यकता के बिना विभिन्न रोबोटों पर काम कर सके। टीम ने तर्क करने के लिए उपयोग किए जाने वाले कृत्रिम बुद्धिमत्ता मॉडलों के विभिन्न आकारों के साथ भी प्रयोग किया। उन्होंने पाया कि बहुत बड़ा मॉडल अनिवार्य नहीं था, बल्कि एक मध्यम आकार का मॉडल गति और सटीकता का सबसे अच्छा संतुलन प्रदान करता है, जिससे रोबोट धीमी प्रोसेसिंग के कारण अटके बिना अच्छे निर्णय ले पाता है।

यह कार्य इस बात पर प्रकाश डालता है कि हमें वास्तविक दुनिया के लिए रोबोट कैसे बनाने चाहिए। पुराना तरीका, जहाँ दुनिया रोबोट के सोचने के लिए प्रतीक्षा करती है, अब तैनाती की वास्तविकता को नहीं दर्शाता है। अध्ययन प्रदर्शित करता है कि रोजमर्रा के वातावरण में रोबोट के व्यावहारिक होने के लिए, उनके सॉफ़्टवेयर को वास्तविक समय के निष्पादन की बाधाओं को संभालने के लिए डिज़ाइन किया जाना चाहिए। धारणा (perception), योजना (planning) और गति (movement) के विभिन्न कार्यों को अलग करके, और उन्हें समानांतर में चलने की अनुमति देकर, रोबोट बहुत अधिक उत्तरदायी और प्रभावी हो सकते हैं। शोधकर्ता निष्कर्ष निकालते हैं कि गणना समय की लागत को अनदेखा करना ऐसे सिस्टम की ओर ले जाता है जो सिमुलेशन में अच्छे दिखते हैं लेकिन व्यवहार में विफल हो जाते हैं। उनका नया दृष्टिकोण एक मार्ग दिखाता है, जो यह दर्शाता है कि सही आर्किटेक्चर के साथ, रोबोट अज्ञात दुनिया में तेज़ी से और विश्वसनीय रूप से नेविगेट कर सकते हैं, जिससे कृत्रिम बुद्धिमत्ता के सैद्धांतिक वादे को एक व्यावहारिक वास्तविकता में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →