← नवीनतम पेपर
💻 computer science

Mixture-of-Experts RL for Fault-Tolerant Legged Locomotion

यह शोध पत्र एक दोष-जागरूक (fault-aware) मॉड्यूलर नियंत्रण आर्किटेक्चर प्रस्तावित करता है जो सुदृढीकरण शिक्षण (reinforcement learning) और स्पष्ट दोष-निदान जानकारी का लाभ उठाकर विभिन्न एक्चुएटर विफलताओं के लिए विशिष्ट विशेषज्ञों को सक्रिय करता है, जो कंप्यूट-सीमित और दोष-प्रवण वातावरण में लेग्ड रोबोट्स के लिए मोनोलिथिक नीतियों की तुलना में बेहतर प्रदर्शन और दक्षता प्रदर्शित करता है।

मूल लेखक: Giulio Turrisi, Ozan Pali, Luca Oneto, Claudio Semini

प्रकाशित 2026-07-02
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Giulio Turrisi, Ozan Pali, Luca Oneto, Claudio Semini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक चार पैरों वाला रोबोट कुत्ता है जिसे अन्य ग्रहों जैसे पथरीले और खतरनाक स्थानों की खोज करने के लिए डिज़ाइन किया गया है। आमतौर पर, इन रोबोटों को चारों पैरों पर पूरी तरह से चलने के लिए प्रशिक्षित किया जाता है। लेकिन क्या होता है यदि कोई मोटर टूट जाए, या कोई पैर फंस जाए?

अधिकांश रोबोट मस्तिष्क एक एकल, बहुत व्यस्त शेफ (रसोइया) की तरह होते हैं। यह शेफ एक साथ हर संभव रेसिपी सीखने की कोशिश करता है: सामान्य रूप से चलना, तीन पैरों पर लंगड़ाकर चलना, और यदि दो पैर विफल हो जाएं तो शरीर को घसीटना। समस्या यह है कि जब रसोई बहुत अराजक हो जाती है (बहुत अधिक अलग-अलग विफलता मोड होने पर), तो शेफ भ्रमित हो जाता है। वे "चलने" वाली रेसिपी का उपयोग करने की कोशिश कर सकते हैं जब उन्हें "लंगड़ाने" वाली रेसिपी का उपयोग करना चाहिए, जिससे वे अनाड़ी तरीके से गिर सकते हैं।

यह पेपर इस रसोई को चलाने का एक स्मार्ट तरीका प्रस्तावित करता है: "विशेषज्ञों की टीम" वाला दृष्टिकोण।

मुख्य विचार: विशेषज्ञों की एक टीम

एक शेफ जो सब कुछ करने की कोशिश करता है, उसके बजाय, लेखकों ने एक सिस्टम बनाया है जिसमें एक मैनेजर (प्रबंधक) और विशेषज्ञों की एक टीम है।

  1. मैनेजर (दोष डिटेक्टर): यह एक छोटा, स्मार्ट मॉड्यूल है जो लगातार रोबोट के स्वास्थ्य की जांच करता है। यह एक मैकेनिक की तरह है जो तुरंत जान जाता है, "हे, बायां-सामने वाला पैर का मोटर मर गया है!" या "दोनों पिछले पैर टूट गए हैं!"
  2. विशेषज्ञ (एक्सपर्ट्स): रोबट के पास विशिष्ट स्थितियों के लिए अलग-अलग "मस्तिष्क" (या विशेषज्ञ) होते हैं।
    • एक्सपर्ट A सामान्य, चार पैरों वाली दौड़ (trotting) का मास्टर है।
    • एक्सपर्ट B तीन पैरों पर चलने का मास्टर है।
    • एक्सपर्ट C शरीर को घसीटने का मास्टर है जब दो पैर चले जाते हैं।
  3. हैंडऑफ (नियंत्रण सौंपना): जब मैनेजर किसी समस्या को देखता है, तो वह टीम से यह अनुमान लगाने के लिए नहीं पूछता कि क्या करना है। वह बस नियंत्रण को सही विशेषज्ञ को बदल (switch) देता है। यदि पिछले पैर विफल हो जाते हैं, तो मैनेजर तुरंत नियंत्रण "दो-पैर-नीचे" वाले विशेषज्ञ को सौंप देता है।

यह बेहतर क्यों है

इस पेपर ने एक वर्चुअल दुनिया और एक वास्तविक रोबोट (Unitree Go2) पर इस दृष्टिकोण का "सिंगल शेफ" (एक मानक AI मॉडल) के विरुद्ध परीक्षण किया।

  • परिणाम: जब चीजें गलत हुईं, तो "विशेषized टीम" ने "सिंगल शेफ" की तुलना में बहुत बेहतर तरीके से चलना जारी रखा। सिंगल शेफ एक साथ सब कुछ करने की कोशिश करता है और भ्रमित हो जाता है, जबकि टीम बस काम के लिए सही उपकरण चुन लेती है।
  • "छोटा मस्तिष्क" बोनस: लेखकों ने यह भी परीक्षण किया कि यदि आप बिजली बचाने के लिए कंप्यूटर मस्तिष्क को छोटा करते हैं (जो अंतरिक्ष रोबोटों के लिए महत्वपूर्ण है) तो क्या होता है। एक छोटे मस्तिष्क के साथ भी, "विशेषज्ञों की टीम" एक विशाल, जटिल मस्तिष्क के लगभग समान प्रदर्शन करती है। ऐसा इसलिए है क्योंकि प्रत्येक विशेषज्ञ को केवल एक चीज़ पूरी तरह से जानने की आवश्यकता होती है, न कि सब कुछ अस्पष्ट रूप से जानने की।

वास्तविक दुनिया का परीक्षण

उन्होंने इसे केवल सिम्युलेट नहीं किया; उन्होंने इसे एक वास्तविक रोबोट कुत्ते पर आजमाया।

  • पहले, उन्होंने इसे चट्टानों पर सामान्य रूप से चलाया।
  • फिर, उन्होंने इसके दोनों पिछले पैरों के मोटर्स को बंद कर दिया। रोबोट अपने "दो-पैर-नीचे" वाले विशेषज्ञ पर स्विच हो गया और सफलतापूर्वक खुद को आगे खींचने में कामयाब रहा।
  • अंत में, उन्होंने एक पैर की विफलता का अनुकरण किया, और रोबोट अपने "तीन-पैर" वाले विशेषज्ञ पर स्विच हो गया और चलता रहा।

कमी (The Catch)

यहाँ एक समझौता (trade-off) है। क्योंकि विशेषज्ञ अलग-अलग हैं, रोबोट को प्रत्येक को व्यक्तिगत रूप से सीखने की आवश्यकता होती है। इसका मतलब है कि प्रशिक्षण प्रक्रिया थोड़ी अधिक "शोर भरी" (noisy) है और सब कुछ सटीक करने के लिए अधिक अभ्यास डेटा (सिमुलेशन) की आवश्यकता होती है, जो सिंगल-शेफ दृष्टिकोण की तुलना में अधिक है। हालाँकि, एक बार प्रशिक्षित होने के बाद, यह सिस्टम अविश्वसनीय रूप से मजबूत और कुशल है।

संक्षेप में: एक मस्तिष्क को सभी आपदाओं का मास्टर बनाने के बजाय, यह पेपर रोबोट को विशेषज्ञों की एक टीम और चीजों के गलत होने पर सही एक को चुनने के लिए एक त्वरित स्विच देता है। यह रोबोट को अधिक मजबूत, स्मार्ट और छोटे, सस्ते कंप्यूटरों पर चलने में सक्षम बनाता है—जो अज्ञात की खोज करने के लिए एकदम सही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →