← नवीनतम पेपर
💻 computer science

Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion

यह शोध पत्र ग्लोबल-लोकल अटेंशन डीकंपोजिशन (GLAD) को प्रस्तुत करता है, जो एक नवीन टेरेन एनकोडिंग फ्रेमवर्क है जो व्यापक संदर्भ जागरूकता को सटीक फुटहोल्ड चयन से अलग करता है ताकि विरल और सीमित भूभागों पर ह्यूमनॉइड रोबोटों के लिए सुदृढ़, ज़ीरो-शॉट सिम-टू-रियल परसेप्टिव लोकोमोशन को सक्षम बनाया जा सके।

मूल लेखक: Shengcheng Fu, Yang Zhang, Zhanxiang Cao, Liyun Yan, Yizhi Chen, Yunpeng Yin, Yue Gao

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shengcheng Fu, Yang Zhang, Zhanxiang Cao, Liyun Yan, Yizhi Chen, Yunpeng Yin, Yue Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक मानव सदृश (humanoid) रोबोट एक ऐसे कमरे में चलने की कोशिश कर रहा है जो बिखरे हुए पत्थरों, संकीर्ण रास्तों और अचानक आने वाले अंतराल (gaps) से भरा हुआ है। इसे सफलतापूर्वक करने के लिए, रोबोट को एक साथ दो बहुत अलग समस्याओं को हल करने की आवश्यकता है:

  1. बड़ी तस्वीर (The Big Picture): उसे आगे के लेआउट को देखने के लिए काफी दूर तक देखना होगा (जैसे, "क्या आगे कोई रास्ता है, या यह एक बंद रास्ता है?")।
  2. बारीक विवरण (The Fine Print): उसे उस सटीक स्थान को बहुत करीब से देखना होगा जहाँ उसका पैर लैंड करने वाला है, ताकि यह सुनिश्चित हो सके कि वह सटीक पत्थर ठोस और पहुँच योग्य है।

लंबे समय तक, रोबनों के "दिमाग" (न्यूरल नेटवर्क) ने इन दोनों चीजों को एक ही, उलझे हुए फोकस के साथ करने की कोशिश की। यह एक नक्शा पढ़ने के साथ-साथ सुई में धागा पिरोने की कोशिश करने जैसा था; दिमाग भ्रमित हो जाता था, जिससे महत्वपूर्ण विवरण कम हो जाते थे।

यह पेपर इस समस्या को ठीक करने के लिए GLAD (ग्लोबल-लोकल अटेंशन डीकंपोजिशन) नामक एक नई विधि पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "ओवरलोडेड शेफ" (The Overloaded Chef)

सोचिए कि एक पारंपरिक रोबोट एनकोडर एक ऐसे शेफ की तरह है जो एक जटिल भोजन बनाने के साथ-साथ एक उपन्यास पढ़ने की कोशिश कर रहा है। वे सब कुछ एक साथ प्रोसेस करने की कोशिश कर रहे हैं।

  • वे पूरे किचन को देखते हैं (ग्लोबल व्यू)।
  • वे अपने हाथ में मौजूद विशिष्ट सामग्री को देखते हैं (लोकल व्यू)।
  • परिणाम: वे विचलित हो जाते हैं। वे यह मिस कर सकते हैं कि सामग्री थोड़ी सड़ गई है क्योंकि वे कहानी पर बहुत अधिक ध्यान केंद्रित कर रहे थे, या वे कहानी को मिस कर सकते हैं क्योंकि वे सामग्री पर बहुत अधिक ध्यान केंद्रित कर रहे थे। रोबोट के संदर्भ में, इससे लड़खड़ाकर चलना या पत्थरों से गिरना जैसी स्थितियां पैदा होती हैं।

समाधान: GLAD (एक "विशेषज्ञ टीम")

लेखक रोबोट के दिमाग को दो विशेषज्ञ सहायकों में विभाजित करने का प्रस्ताव देते हैं जो एक साथ काम करते हैं लेकिन उनके काम स्पष्ट रूप से अलग हैं।

1. "स्काउट" (The Scout - ग्लोबल अटेंशन ब्रांच)

  • काम: यह सहायक एक पहाड़ी पर खड़ा होता है और पूरे परिदृश्य को देखता है।
  • यह कैसे काम करता है: यह "अटेंशन पूलिंग" नामक तकनीक का उपयोग करता है ताकि सामने के इलाके का एक त्वरित, व्यापक सारांश लिया जा सके। इसे हर एक पत्थर की बनावट की चिंता नहीं करनी है; इसे बस यह जानना है, "क्या कोई रास्ता है? क्या बड़े अंतराल हैं? क्या जमीन आम तौर पर सुरक्षित है?"
  • उपमा: यह आपको शहर का सामान्य अवलोकन देने वाले एक टूर गाइड की तरह है।

2. "स्पॉटर" (The Spotter - लोकल अटेंशन ब्रांच)

  • काम: यह सहायक रोबोट की आँखें हैं, जो उस विशिष्ट स्थान पर ज़ूम करती हैं जहाँ पैर लैंड करने वाला है।
  • यह कैसे काम करता है: यही सबसे चतुर हिस्सा है। पथ के हर पत्थर को देखने के बजाय, स्पॉटर रोबोट की वर्तमान शारीरिक स्थिति (क्या वह बाईं ओर झुक रहा है? क्या वह तेज़ चल रहा है?) का उपयोग करके उन पत्थरों को फ़िल्टर कर देता है जो मायने नहीं रखते। यह 80% विजुअल डेटा को हटा देता है और केवल उन शीर्ष कुछ पत्थरों को रखता है जो अगले कदम के लिए वास्तव में प्रासंगिक हैं। फिर यह उन कुछ पत्थरों का अत्यधिक विस्तार से विश्लेषण करता है।
  • उपमा: यह एक स्नाइपर की तरह है जो बैकग्राउंड के शोर को अनदेखा करते हुए केवल लक्ष्य पर ध्यान केंद्रित करता है।

यह क्यों महत्वपूर्ण है

इन दो कामों को अलग करके, रोबोट भ्रमित नहीं होता है।

  • स्काउट यह सुनिश्चित करता है कि रोबोट किसी खाई में या दीवार से न टकरा जाए।
  • स्पॉटर यह सुनिश्चित करता है कि रोबोट अपना पैर सटीक रूप से एक छोटे, डगमगाते पत्थर पर रखे।

चूंकि स्पॉटर अप्रासंगिक डेटा को अनदेखा कर देता है, इसलिए रोबोट का दिमाग तेज़ी से काम करता है और बेहतर तरीके से सीखता है। उसे पूरी दुनिया को प्रोसेस करने में ऊर्जा बर्बाद करने की ज़रूरत नहीं है; उसे बस अगले कदम के लिए जो चाहिए, वही प्रोसेस करना है।

परिणाम: चलना सीखना (Walking the Walk)

शोधकर्ताओं ने एक वास्तविक रोबोट (Unitree G1) और कंप्यूटर सिमुलेशन में इसका परीक्षण किया।

  • परीक्षण: उन्होंने रोबोट को कठिन परिदृश्यों में डाला: संकीर्ण स्टेपिंग स्टोन्स, चौड़े अंतराल (70 सेमी तक), छूटे हुए स्टेप्स वाली सीढ़ियाँ, और बाधाओं से भरे रास्ते।
  • परिणाम: GLAD का उपयोग करने वाला रोबोट इन इलाकों में सुचारू रूप से चल सका। वह संकीर्ण रास्तों पर चल सकता था और बाधाओं से बच सकता था, केवल "आगे बढ़ो" कहे जाने पर, बिना किसी अलग कंप्यूटर द्वारा रूट प्लान किए।
  • वास्तविक दुनिया की सफलता: रोबोट ने सिमुलेशन में सीखा और फिर बिना किसी अतिरिक्त ट्यूनिंग के वास्तविक दुनिया में पूरी तरह से चला। इसने केवल अपने ऑनबोर्ड लेजर स्कैनर (LiDAR) का उपयोग करके ज़मीन को "देखा"।

सारांश

संक्षेप में, यह पेपर रोबोट को एक साथ सब कुछ करने की कोशिश करना छोड़ने की शिक्षा देता है। इसके बजाय, यह रोबोट को बड़ी तस्वीर देखने के लिए एक स्काउट और तत्काल कदम पर ध्यान केंद्रित करने के लिए एक स्पॉटर देता है। श्रम का यह सरल विभाजन रोबोट को कठिन और ऊबड़-खाबड़ ज़मीन पर आत्मविश्वास से चलने की अनुमति देता है जहाँ पिछले रोबोट लड़खड़ा जाते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →