← नवीनतम पेपर
🤖 AI

DynaWM: Dynamics-Aware Distillation with World Model and Momentum Targets for Smooth Locomotion over Continuous Stairs

यह शोध पत्र DynaWM प्रस्तुत करता है, जो एक डायनेमिक्स-अवेयर डिस्टिलेशन फ्रेमवर्क है जो टेरेन रिप्रजेंटेशन को बढ़ाने और नॉलेज ट्रांसफर को स्थिर करने के लिए एक वर्ल्ड मॉडल रेगुलराइज़र और मोमेंटम टारगेट एनकोडिंग को जोड़ता है, जिससे द्विपाद-पहिए वाले (bipedal-wheeled) रोबोट निरंतर सीढ़ियों पर सुचारू और अनुकूलन योग्य लोकोमोशन प्राप्त कर सकते हैं।

मूल लेखक: Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसे रोबोट की कल्पना करें जो आधा साइकिल और आधा इंसान है: इसमें समतल जमीन पर चलने के लिए पहिए हैं लेकिन बाधाओं को पार करने के लिए पैर भी हैं। यह एक बाइपेडल-व्हील्ड रोबोट (दो पैरों वाला पहिये वाला रोबोट) है। हालांकि ये रोबोट समतल फर्श या छोटे कदमों को संभालने में बेहतरीन होते हैं, लेकिन वे अक्सर लंबी, निरंतर सीढ़ियों का सामना करने पर लड़खड़ा जाते हैं। वे डगमगाते हैं, अपना संतुलन खो देते हैं, या बस सुचारू रूप से चढ़ने का तरीका नहीं निकाल पाते।

यह शोध पत्र एक नया तरीका पेश करता है जिसे DynaWM कहा जाता है, ताकि इन रोबोट्स को पेशेवर तरीके से सीढ़ियां चढ़ना सिखाया जा सके। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है।

समस्या: "ब्लैक बॉक्स" शिक्षक

वर्तमान में, रोबट चलने के लिए एक "शिक्षक-छात्र" (Teacher-Student) प्रणाली का उपयोग करके सीखते हैं।

  • शिक्षक: एक सुपर-स्मार्ट AI जो सीढ़ियों को स्पष्ट रूप से देख सकता है (कैमरों और सेंसरों का उपयोग करके) और जानता है कि रोबोट के शरीर को कैसे प्रतिक्रिया देनी चाहिए। यह एक ड्राइविंग इंस्ट्रक्टर की तरह है जो पूरी सड़क को देख सकता है।
  • छात्र: रोबट का वास्तविक मस्तिष्क, जो केवल अपने शरीर को महसूस कर सकता है (जैसे यह जानना कि उसके जोड़ मुड़े हुए हैं) लेकिन वह सीढ़ियों को देख नहीं सकता। उसे यह अनुमान लगाना होता है कि क्या करना है, यह इस आधार पर कि शिक्षक कैसे व्यवहार करता है।

दोष: वर्तमान शिक्षक तत्काल पुरस्कार (अभी सीढ़ी के ऊपर पहुँचने) पर बहुत अधिक ध्यान केंद्रित करते हैं। वे इलाके के आकार के "बड़ी तस्वीर" (big picture) को अनदेखा कर देते हैं। इसके अलावा, क्योंकि शिक्षक सीखने के दौरान बहुत तेज़ी से अपना निर्णय बदलता है, छात्र भ्रमित हो जाता है और सरल, दोहराव वाली गलतियाँ करने लगता है (जैसे एक छात्र जो एक ऐसे शिक्षक की नकल करने की कोशिश कर रहा हो जो लगातार अपनी लिखावट बदल रहा हो)।

समाधान: DynaWM

लेखकों ने इन समस्याओं को ठीक करने के लिए दो मुख्य अपग्रेड के साथ एक नया प्रशिक्षण सिस्टम बनाया है।

1. "क्रिस्टल बॉल" (वर्ल्ड मॉडल)

शिक्षक को स्मार्ट बनाने के लिए, उन्होंने इसे एक वर्ल्ड मॉडल (World Model) दिया। इसे शिक्षक के दिमाग के अंदर एक क्रिस्टल बॉल या फ्लाइट सिम्युलेटर की तरह समझें।

  • यह कैसे काम करता है: शिक्षक छात्र को यह बताने से पहले कि क्या करना है, वह क्रिस्टल बॉल से पूछता है: "यदि मैं अपना पैर इस तरह हिलाता हूँ, तो अगले सेकंड में इलाके का स्वरूप कैसा दिखेगा?"
  • परिणाम: यह शिक्षक को मजबूर करता है कि वह केवल तत्काल पुरस्कार के बजाय सीढ़ियों के वास्तविक आकार और भौतिकी (dynamics) पर ध्यान दे। यह शिक्षक को महत्वपूर्ण विवरणों को अनदेखा करने से रोकता है, भले ही वे तुरंत कोई पॉइंट न दिला रहे हों। यह सुनिश्चित करता है कि रोबोट सीढ़ियों के लक्ष्य को ही नहीं, बल्कि उनकी ज्यामिति (geometry) को भी समझता है।

2. "स्थिर हाथ" (मोमेंटम टारगेट)

छात्र को शिक्षक के तीव्र परिवर्तनों से भ्रमित होने से रोकने के लिए, उन्होंने एक मोमेंटम टारगेट (Momentum Target) पेश किया।

  • उपमा: एक ऐसे शिक्षक से डांस स्टेप्स सीखने की कोशिश करें जो हर सेकंड अपने स्टेप्स बदल रहा हो। आप कभी नहीं सीख पाएंगे। इसके बजाय, DynaWM शिक्षक के एक "स्थिर हाथ" वाले संस्करण का उपयोग करता है। यह संस्करण शिक्षक के हालिया मूव्स का एक धीमा औसत (slow-moving average) है।
  • परिणाम: छात्र इस शांत, सुसंगत संस्करण से सीखता है। भले ही असली शिक्षक घबराया हुआ हो और तेज़ी से बदल रहा हो, छात्र को कॉपी करने के लिए एक सहज, स्थिर लक्ष्य मिलता है। यह छात्र के मस्तिष्क को उस स्थिति में "ढहने" (collapse) से रोकता है जहाँ वह जटिल पैटर्न सीखना बंद कर देता है।

परिणाम: सुचारू चढ़ाई

टीम ने एक वास्तविक रोबोट (नाम: जियारान - JiaRan) और सिमुलेशन पर इसका परीक्षण किया।

  • परीक्षण: उन्होंने रोबोट को विभिन्न प्रकार की सीढ़ियों के सामने रखा, जिनमें असमान किनारे और ऐसी ऊंचाइयां भी शामिल थीं जिन्हें उसने पहले कभी नहीं देखा था।
  • निष्कर्ष:
    • बेहतर दृष्टि: सीढ़ियों का रोबोट का आंतरिक "मानचित्र" बहुत स्पष्ट हो गया। डेटा के एक उलझे हुए ढेर के बजाय, रोबोट ने जानकारी को ऊंचाई के आधार पर व्यवस्थित किया, जैसे कि एक अच्छी तरह से व्यवस्थित लाइब्रेरी।
    • सुचारू गति: पुराने तरीकों की तुलना में, रोबोट बहुत कम कंपन के साथ चढ़ा। वह सीढ़ियां चढ़ते समय झटके लेने के बजाय, एक इंसान की तरह सहजता से चला।
    • सफलता दर: इसने वास्तविक दुनिया के परीक्षणों में 20 सेमी (लगभग 8 इंच) ऊंची निरंतर सीढ़ियों को 100% सफलता दर के साथ सफलतापूर्वक चढ़ लिया, जबकि अन्य तरीके अक्सर विफल हो जाते या गिर जाते।

सारांश में

DynaWM एक रोबोट को एक ऐसा ड्राइविंग इंस्ट्रक्टर देने जैसा है जो न केवल सड़क को जानता है, बल्कि इलाके को बेहतर ढंग से समझने के लिए भविष्य का सिमुलेशन भी करता है, और साथ ही एक शांत, स्थिर मार्गदर्शक प्रदान करता है ताकि रोबोट अभिभूत (overwhelmed) न हो जाए। परिणाम स्वरूप, एक ऐसा रोबोट मिलता है जो बिना गिरे आत्मविश्वास और सुचारू रूप से लंबी, कठिन सीढ़ियां चढ़ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →