← नवीनतम पेपर
💻 computer science

Learning Category-level Last-meter Navigation from RGB Demonstrations of a Single-instance

यह शोध पत्र एक ऑब्जेक्ट-सेंट्रिक इमिटेशन लर्निंग फ्रेमवर्क प्रस्तुत करता है जो एक क्वाड्रुपेड मोबाइल मैनिपुलेटर को केवल RGB ऑब्जर्वेशन और टेक्स्ट प्रॉम्प्ट्स का उपयोग करके, डेप्थ सेंसर, LiDAR या मैप प्रायर्स पर निर्भर किए बिना, मैनिपुलेशन-रेडी पोजिशनिंग के लिए सटीक, कैटेगरी-लेवल लास्ट-मीटर नेविगेशन प्राप्त करने में सक्षम बनाता है।

मूल लेखक: Tzu-Hsien Lee, Fidan Mahmudova, Karthik Desingh

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tzu-Hsien Lee, Fidan Mahmudova, Karthik Desingh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बिखरे हुए लिविंग रूम में एक विशिष्ट कुर्सी उठाने के लिए सिखा रहे हैं। आप सोच सकते हैं, "बस रोबोट को कुर्सी के पास जाने के लिए कह दो!" लेकिन समस्या यह है: अधिकांश रोबोट खराब गहराई बोध (depth perception) वाले लोगों की तरह होते हैं। वे आपको कुर्सी के पड़ोस तक तो पहुँचा सकते हैं (लगभग 3 फीट के भीतर), लेकिन वे आपको उस सटीक स्थान पर नहीं पहुँचा पाते जहाँ से उसे पकड़ा जा सके। यदि रोबोट थोड़ा भी केंद्र से हट गया या गलत दिशा में मुड़ गया, तो रोबोट का हाथ (manipulator) कुर्सी को पूरी तरह से मिस कर देगा, ठीक वैसे ही जैसे आप तब कप को पकड़ने की कोशिश करते हैं जब आपका हाथ थोड़ा बाईं ओर बहुत दूर होता है।

यह शोध पत्र इस अंतिम, कठिन चरण के लिए एक समाधान पेश करता है: "लास्ट-मीटर नेविगेशन" (अंतिम-मीटर नेविगेशन)। यह आपके कार को सही पड़ोस में पार्क करने और उसे गैरेज के सही स्पॉट में बिल्कुल सटीक तरीके से खड़ा करने के बीच का अंतर है ताकि आप सीधे दरवाजे से बाहर निकल सकें।

उन्होंने इसे कैसे किया, सरल शब्दों में यहाँ दिया गया है:

1. समस्या: "ठीक-ठाक" काफी नहीं है

अधिकांश रोबोट नेविगेशन सिस्टम को लक्ष्य से लगभग 1 मीटर दूर रुकने के लिए प्रशिक्षित किया जाता है। यह किसी दरवाजे तक जाने के लिए तो ठीक है, लेकिन चीजें उठाने के लिए बहुत बुरा है। लेखक इसे "गैप" (अंतराल) कहते हैं। यदि रोबोट की स्थिति एकदम सटीक नहीं है, तो बाकी का कार्य विफल हो जाएगा।

आमतौर पर, उस सटीक स्थिति को पाने के लिए, रोबोटों को महंगे उपकरणों जैसे 3D लेजर (LiDAR) या कमरे के विस्तृत मानचित्रों की आवश्यकता होती है। लेखकों ने जानना चाहा: क्या एक रोबोट केवल एक मानक कैमरे (RGB) का उपयोग करके यह कर सकता है, ठीक वैसे ही जैसे एक इंसान अपनी आँखों का उपयोग करता है?

2. समाधान: देखकर सीखना (अनुकरण)

रोबोट को जटिल नियमों (जैसे "यदि कुर्सी इतनी बड़ी दिखती है, तो बाएं मुड़ें") के साथ प्रोग्राम करने के बजाय, उन्होंने रोबोट को देखकर सीखने के लिए प्रशिक्षित किया।

  • शिक्षक: उन्होंने एक वास्तविक रोबोट (एक बोस्टन डायनेमिक्स स्पॉट) का उपयोग किया ताकि एक इंसान द्वारा एक विशिष्ट हरी कुर्सी तक उसे चलाने की प्रक्रिया को रिकॉर्ड किया जा सके। रोबोट ने रिकॉर्ड किया कि कैमरे ने क्या देखा और वहां पहुँचने के लिए वह बिल्कुल कैसे चला।
  • छात्र: उन्होंने एक कंप्यूटर मॉडल को इन गतिविधियों की नकल करने के लिए प्रशिक्षित किया।
  • गुप्त नुस्खा (Secret Sauce): उन्होंने केवल रोबोट को पूरा कमरा नहीं दिखाया। उन्होंने रोबोट को विशेष रूप से वस्तु (कुर्सी) पर ध्यान केंद्रित करना सिखाया। उन्होंने एक "टेक्स्ट प्रॉम्प्ट" (जैसे "कुर्सी खोजो" कहना) का उपयोग किया ताकि रोबोट को पता चले कि किस वस्तु को देखना है, और फिर कमरे की बाकी चीजों को अनदेखा करने के लिए एक विशेष फ़िल्टर का उपयोग किया।

3. रोबोट कैसे "सोचता" है

रोबोट का मस्तिष्क तीन चरणों में काम करता है, जो बिल्कुल वैसा ही है जैसे आप नेविगेट कर सकते हैं:

  1. लक्ष्य को पहचानना: रोबोट अपने वर्तमान दृश्य और "लक्ष्य" दृश्य (एक तस्वीर कि जब कुर्सी एकदम सही जगह पर हो तो वह कैसी दिखनी चाहिए) को देखता है। वह कुर्सी को दोनों तस्वीरों में खोजने के लिए एक टेक्स्ट कमांड का उपयोग करता है।
  2. दृश्यों की तुलना करना: यह एक "स्कोर मैट्रिक्स" बनाता है। कल्पना कीजिए कि आपके पास दो पारदर्शी शीट हैं जिन पर ग्रिड बना है। एक शीट वर्तमान दृश्य है, दूसरी लक्ष्य दृश्य है। रोबगर उन्हें एक-दूसरे के ऊपर स्लाइड करता है ताकि पैटर्न का मिलान देखा जा सके। यदि वर्तमान दृश्य में कुर्सी वहां से बाईं ओर है जहां उसे होना चाहिए, तो रोबोट जानता है कि उसे दाईं ओर जाना है।
  3. चलना और रुकना: रोबोट पैटर्न को संरेखित करने के लिए छोटे कदम (आगे, बगल में, या मुड़ना) लेता है। महत्वपूर्ण रूप से, उन्होंने एक "ब्रेक" प्रणाली जोड़ी। चूंकि रोबोट के प्रशिक्षण डेटा में अंत में कुछ मामूली झटके थे, इसलिए रोबोट को शायद यह नहीं पता चल पाता कि ठीक कब रुकना है। इसलिए, उन्होंने एक नियम जोड़ा: "यदि कुर्सी लक्ष्य चित्र के 60% समान दिखती है और केंद्र में है, तो ब्रेक लगा दें।"

4. परिणाम: एक कुर्सी, कई कुर्सियाँ

सबसे प्रभावशाली बात यह है कि यह कितनी अच्छी तरह से सामान्य होता है।

  • प्रशिक्षण: उन्होंने रोबोट को केवल एक ही हरी कुर्सी पर एक विशिष्ट कमरे में प्रशिक्षित किया।
  • परीक्षण: इसके बाद उन्होंने इसे पूरी तरह से अलग कुर्सियों (भूरी, लकड़ी की, धातु की) पर, अलग-अलग कमरों (लिविंग रूम, ऑफिस और यहाँ तक कि बाहर भी) में टेस्ट किया।
  • परिणाम: रोबोट सही स्थान पर लगभग 75% से 90% बार सफलतापूर्वक पहुँचा, जो इस बात पर निर्भर करता है कि परीक्षण कितना सख्त था। इसने बिना किसी 3D लेजर या मानचित्र के, केवल कैमरा फीड का उपयोग करके काम किया।

5. जहाँ यह संघर्ष करता है

यह शोध पत्र इसकी सीमाओं के बारे में ईमानदार है। यह प्रणाली प्रकाश (lighting) के प्रति बहुत संवेदनशील है।

  • तेज, प्राकृतिक रोशनी में (जैसे बाहर), रोबोट का प्रदर्शन सबसे अच्छा रहा क्योंकि कैमरा कुर्सी को स्पष्ट रूप रूप से देख सकता था।
  • कम रोशनी वाले कमरों में, रोबोट कभी-कभी भ्रमित हो जाता था क्योंकि वह खुद को संरेखित करने के लिए कुर्सी को स्पष्ट रूप से "देख" नहीं पाता था।
  • यदि कुर्सी किसी चीज़ से ढकी हुई है (occlusion), तो रोबोट अपना काम नहीं कर सकता क्योंकि वह लक्ष्य को स्पष्ट रूप से देखने पर निर्भर करता है।

सारांश

यह शोध पत्र सिद्ध करता है कि एक रोबोट, केवल एक मानक कैमरे और थोड़े से "दिखाओ और बताओ" प्रशिक्षण के साथ, किसी ऐसी वस्तु के बगल में खुद को पूरी तरह से पार्क करना सीख सकता है जिसे उसने पहले कभी नहीं देखा है। यह "पास पहुँचने" और "पकड़ने के लिए तैयार होने" के बीच के अंतर को पाटता है, और यह सब बिना किसी महंगे 3D सेंसर के करता है। यह एक रोबोट को एक उदाहरण दिखाकर पार्किंग में गाड़ी चलाना सिखाने जैसा है, और फिर उसे किसी भी अन्य स्थान पर खुद से पार्क करने के लिए छोड़ने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →