← नवीनतम पेपर
💻 computer science

Quadruped Parkour Learning: Sparsely Gated Mixture of Experts with Visual Input

यह शोध पत्र प्रदर्शित करता है कि विज़न-आधारित नियंत्रण नीतियों पर स्पार्सली गेटेड मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर को लागू करने से मानक MLPs की तुलना में चुनौतीपूर्ण इलाके पर क्वाड्रुपेड रोबोट के पार्कौर प्रदर्शन में काफी सुधार होता है, जो कम्प्यूटेशनल दक्षता बनाए रखते हुए सफलता की दर को दोगुना कर देता है।

मूल लेखक: Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुत्ते को पार्कौर (parkour) सिखा रहे हैं। आप चाहते हैं कि वह ऊँची बाड़ के ऊपर से कूदे, सीढ़ियाँ चढ़े और बिना गिरे एक अस्त-व्यस्त बाधा दौड़ (obstacle course) को पार करे। यह बिल्कुल वही है जो इस शोध पत्र के शोधकर्ता एक चार पैरों वाले रोबोट (एक Unitree Go2) के साथ करने की कोशिश कर रहे हैं।

यहाँ उनकी खोज का सरल विवरण दिया गया, जिसमें कुछ रोज़मर्रा के उदाहरणों का उपयोग किया गया है।

समस्या: "एक ही आकार सबके लिए" वाला दिमाग (The "One-Size-Fits-All" Brain)

लंबे समय तक, रोबोट इंजीनियरों ने रोबोट के "दिमाग" (वह सॉफ़्टवेयर जो पैरों को कहाँ हिलना है यह बताता है) को एक मानक फैक्ट्री असेंबली लाइन की तरह बनाया। उन्होंने एक Sequential MLP (मल्टी-लेयर पर्सेप्ट्रॉन) का उपयोग किया।

इसे एक छोटे से किचन में काम करने वाले एक अकेले, अत्यधिक व्यस्त शेफ की तरह समझें। ग्राहक चाहे जो भी ऑर्डर दे (सलाद, स्टेक या सूप), इस एक शेफ को सब कुछ करना पड़ता है। उन्हें एक साथ काटना, ग्रिल करना और उबालना पड़ता है।

  • समस्या: इस शेफ को हर संभव पार्कौर मूव को संभालने के लिए सक्षम बनाने के लिए, आपको किचन को बहुत बड़ा बनाना होगा और एक विशाल टीम रखनी होगी। लेकिन फिर भी, शेफ काम के बोझ से दब जाता है, धीमा हो जाता है, और कभी-कभी प्लेट गिरा देता है।

समाधान: "विशेषज्ञों की टीम" (Mixture of Experts)

शोधकर्ताओं ने पूछा: क्या होगा अगर हमारे पास एक विशाल दिमाग के बजाय विशेषज्ञों की एक टीम हो?

उन्होंने एक Sparsely Gated Mixture of Experts (MoE) पेश किया।

  • उदाहरण: एक हाई-एंड रेस्टोरेंट की कल्पना करें जहाँ एक हेड शेफ और 16 विशेषज्ञ सहायक शेफ (sous-chefs) की एक टीम है।
    • एक सहायक शेफ कूदने (jumping) में माहिर है।
    • एक संकीर्ण बीम पर संतुलन बनाने में बेहतरीन है।
    • एक सीढ़ियाँ चढ़ने में विशेषज्ञ है।
    • एक धीरे से लैंडिंग (landing) करने को संभालता है।

जब रोबोट किसी बाधा को देखता है, तो एक "गेटकीपर" (गेटिंग नेटवर्क) स्थिति को देखता है और कहता है, "ठीक है, हम अभी कूद रहे हैं। 'जंपिंग शेफ' और 'लैंडिंग शेफ' को जगाओ, लेकिन 'सीढ़ी चढ़ने वाले शेफ' को सोने दो।"

इसे स्पार्स गेटिंग (Sparse Gating) कहा जाता है। रोबोट केवल वर्तमान क्षण के कार्य के लिए आवश्यक विशिष्ट विशेषज्ञों को ही "सक्रिय" करता है, जबकि बाकी दिमाग आराम करता है।

यह एक बड़ी बात क्यों है

यह शोध पत्र उनके "विशेषज्ञों की टीम" (MoE) की तुलना "अत्यधिक व्यस्त शेफ" (Standard MLP) से करता है।

  1. दोगुनी सफलता दर: जब उन्होंने रोबोटों का परीक्षण एक ऐसे बॉक्स पर किया जो रोबोट की ऊंचाई का 80% था (एक बहुत कठिन छलांग), तो "विशेषज्ञों की टीम" मानक रोबोट की तुलना में दोगुनी बार सफल रही।
  2. तेज़ सोच: क्योंकि MoE केवल कुछ विशेषज्ञों को ही जगाता है, इसलिए यह तेज़ी से सोचता है। मानक रोबोट को MoE की सफलता दर के बराबर पहुँचने के लिए बहुत बड़ा (अधिक "शेफ" जोड़कर) बनाया जाना पड़ा था, लेकिन इससे वह सोचने में 14% धीमा हो गया।
    • रूपक: MoE एक स्मार्ट फोन की तरह है जो केवल उन्हीं ऐप्स का उपयोग करता है जिनकी आपको अभी आवश्यकता है, जिससे बैटरी और गति बचती है। मानक रोबोट एक ऐसे कंप्यूटर की तरह है जो कैलकुलेटर खोलने के लिए भी 500 बैकग्राउंड प्रोग्राम चला रहा है।

रोबोट की "आंखें"

रोबोट केवल अपने पैरों को महसूस नहीं करता; उसके पास दुनिया को देखने के लिए एक कैमरा (डेप्थ सेंसर) भी है।

  • चुनौती: कंप्यूटर में कैमरे का अनुकरण (simulate) करना आसान है, लेकिन वास्तविक कैमरे अव्यवस्थित होते हैं। उनमें चमक (glare), शोर (noise) और अजीब कलाकृतियाँ (artifacts) आ जाती हैं।
  • समाधान: शोधकर्ताओं ने रोबोट को एक "अस्त-व्यस्त सिम्युलेटर" में प्रशिक्षित किया। उन्होंने जानबूझकर प्रशिक्षण डेटा में "शोर" (जैसे धुंधली दृष्टि या नकली छाया) जोड़ा। यह एक पायलट को भारी कोहरे और टर्बुलेंस के साथ सिम्युलेटर में प्रशिक्षित करने जैसा है ताकि वे वास्तविक खराब मौसम में उड़ते समय घबराएँ नहीं।
  • परिणाम: रोबोट ने दृश्य "शोर" को अनदेखा करना और वास्तविक बाधा पर ध्यान केंद्रित करना सीख लिया।

"चक्रीय" खोज (The "Cyclical" Discovery)

शोधकर्ताओं ने देखा कि कूदने के दौरान कौन से विशेषज्ञ सक्रिय हो रहे थे। उन्होंने पाया कि यह बहुत दिलचस्प था:

  • लय (Rhythm): क्योंकि चलना और कूदना लयबद्ध होते हैं (बायां पैर, दायां पैर, बायां पैर), विशेषज्ञ एक चक्र (cycle) में जागते थे।
  • विशेषज्ञ: एक विशिष्ट विशेषज्ञ (विशेषज्ञ #7) अजीब था। यह लय का पालन नहीं करता था। यह केवल डेप्थ इमेज (कैमरा व्यू) को देखते समय जागता था। यह रोबोट का "आंखों का विशेषज्ञ" था, जो लगातार क्षितिज की जांच कर रहा था, जबकि अन्य पैरों की गतिविधियों को संभाल रहे थे।

निष्कर्ष

यह शोध पत्र यह सिद्ध करता है कि रोबोट को शानदार, गतिशील पार्कौर करने के लिए हमें केवल अधिक कंप्यूटिंग पावर की नहीं, बल्कि स्मार्टर कंप्यूटिंग पावर की आवश्यकता है।

"मिश्रण विशेषज्ञों" (Mixture of Experts) का उपयोग करके, रोबोट बनता है:

  1. अधिक स्मार्ट: यह कठिन छलांगों में दोगुना सफल होता है।
  2. तेज़: यह तेज़ी से सोचता है क्योंकि यह अप्रयुक्त ब्रेन सेल्स पर ऊर्जा बर्बाद नहीं करता है।
  3. अनुकूलन योग्य: यह पुराने तरीकों की तुलना में वास्तविक दुनिया की खराब रोशनी और बाधाओं को बेहतर तरीके से संभाल सकता है।

यह एक जटिल काम करने के लिए एक थके हुए सामान्य विशेषज्ञ को काम पर रखने बनाम विशेषज्ञों की एक अच्छी तरह से संगठित टीम को काम पर रखने के बीच का अंतर है, जिन्हें पता है कि कब कदम रखना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →