SCDP: Learning Humanoid Locomotion from Partial Observations via Mixed-Observation Distillation
यह शोध पत्र सेंसर-कंडीशन्ड डिफ्यूजन पॉलिसीज (SCDP) प्रस्तुत करता है, जो एक नवीन ढांचा है जो केवल ऑनबोर्ड सेंसर का उपयोग करके सुदृढ़ ह्युमनॉइड लोकोमोशन को सक्षम बनाता है, जो मिश्रित-अवलोकन प्रशिक्षण और विशिष्ट डिनोइजिंग तकनीकों के माध्यम से विशेषाधिकार प्राप्त पूर्ण-शरीर ज्ञान को संकुचित (distill) करता है, और बिना किसी स्पष्ट स्टेट एस्टिमेशन के, सिम्युलेशन में लगभग पूर्ण प्रदर्शन और G1 रोबोट पर वास्तविक दुनिया में तैनाती को सफलतापूर्वक प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह चलना सिखाने की कोशिश कर रहे हैं। आमतौर पर, ऐसा करने के लिए आप रोबोट को एक "सुपरपावर" देते हैं: दुनिया का एक सटीक, ईश्वर जैसा दृश्य (view)। आप उसे बताते हैं कि उसके पैर कहाँ हैं, उसकी गति कितनी है, और अंतरिक्ष में उसका सटीक ओरिएंटेशन क्या है। यह वैसा ही है जैसे किसी रोबोट के पास एक जीपीएस (GPS), एक स्पीडोमीटर और एक जायरोस्कोप एक ही परफेक्ट दिमाग में समाहित हो।
समस्या:
वास्तविक दुनिया में, रोबोटों के पास ये सुपरपावर्स नहीं होतीं। उनके पास केवल "ऑनबोर्ड सेंसर्स" होते हैं—बेसिकली, वे अपने जोड़ों (joints) के हिलने को महसूस कर सकते हैं और गुरुत्वाकर्षण (gravity) को महसूस कर सकते हैं, लेकिन वे महंगे बाहरी कैमरों के बिना अपनी गति या सटीक स्थिति को "देख" नहीं सकते। यदि आप मौजूदा रोबोट कंट्रोलर्स से "सुपरपावर" वाला दृश्य छीन लेते हैं, तो वे तुरंत गिर जाते हैं। यह आँखें बंद करके कार चलाने की कोशिश करने जैसा है, जहाँ आप केवल स्टीयरिंग व्हील के अहसास पर निर्भर हैं।
समाधान: SCDP (सेंसर-कंडीशन्ड डिफ्यूजन पॉलिसीज़)
UCL के शोधकर्ताओं ने एक नई विधि बनाई जिसे SCDP कहा जाता है। इसे रोबोट को केवल अपनी आंतरिक इंद्रियों का उपयोग करके चलने के लिए सिखाने का एक "जादुई तरीका" समझें, बिना किसी परफेक्ट बाहरी दृश्य के।
उन्होंने इसे कैसे किया, इसका विवरण सरल उपमाओं (analogies) के माध्यम से यहाँ दिया गया है:
1. "सीक्रेट टीचर" गेम (मिक्स्ड-ऑब्जर्वेशन डिस्टिलेशन)
कल्पना कीजिए कि आप एक जटिल वीडियो गेम खेलना सीख रहे हैं।
- पुराना तरीका: आप एक 'चीट शीट' के साथ अभ्यास करते हैं जो आपको दुश्मन का सटीक स्थान और गति दिखाती है। जब आप उस चीट शीट के बिना खेलने की कोशिश करते हैं, तो आप असफल हो जाते हैं क्योंकि आपने कभी दुश्मन के स्थान का अनुमान लगाना सीखा ही नहीं।
- SCDP का तरीका: रोबोट एक ऐसा खेल खेलता है जहाँ वह केवल अपने हाथों और पैरों (सेंसर्स) को देखता है। हालांकि, "टीचर" (ट्रेनिंग एल्गोरिदम) गुप्त रूप से उसे एक ऐसी चीट शीट के आधार पर ग्रेड करता है जो दुश्मन के स्थान को भी दिखाती है।
- परिणाम: रोबोट को अपने सीमित दृश्य (हाथ/पैर) को देखने और यह निष्कर्ष निकालने के लिए मजबूर किया जाता है कि, "यदि मेरा बायां पैर इस तरह हिल रहा है और मैं इतनी हवा महसूस कर रहा हूँ, तो मैं निश्चित रूप से 2 मीटर प्रति सेकंड की गति से चल रहा हूँ।" वह अपने स्वयं के मोशन के संकेतों (clues) को देखकर छिपी हुई जानकारी (गति और स्थिति) का अनुमान लगाना सीख जाता है। वह अपने ही मोशन का एक जासूस बन जाता है।
2. "आँखों पर पट्टी बांधकर दौड़ना" (रिस्ट्रिक्टेड डिनोइजिंग)
एक विशिष्ट संकेत जिस पर रोबोट आमतौर पर निर्भर करता है, वह है "मैं कितनी तेजी से जा रहा हूँ?" (वेलोसिटी)। लेकिन वास्तविक रोबोट अपनी गति को सटीक रूप से मापने में खराब होते हैं।
- ट्रिक: ट्रेनिंग के दौरान, शोधकर्ताओं ने रोबोट को बताया: "मैं तुम्हें बताऊंगा कि तुम्हें कहाँ जाना चाहिए, लेकिन मैं इनपुट से 'स्पीड' का नंबर छिपा दूंगा।"
- उपमा: कल्पना कीजिए कि आप आँखों पर पट्टी बांधकर एक दौड़ में भाग ले रहे हैं। आपका कोच चिल्लाता है, "तेज चलो!" लेकिन वह आपको आपकी वर्तमान गति नहीं बताता। आपको यह अंदाजा लगाने के लिए कि आप कितनी तेजी से दौड़ रहे हैं और उसके अनुसार खुद को ढालने के लिए हवा के झोंके और अपनी मांसपेशियों के खिंचाव को महसूस करना होगा।
- परिणाम: रोबोट अपने मूवमेंट के "अहसास" से अपनी गति का अनुमान लगाना सीख जाता है, जिससे वह शोर (noise) या अपूर्ण सेंसरों के बावजूद मजबूत बना रहता है।
3. "टाइम-ट्रैवलिंग मेमोरी" (कॉन्टेक्स्ट डिस्ट्रीब्यूशन अलाइनमेंट)
रोबोट को सिखाते समय, शोधकर्ताओं को सावधान रहना था कि वे उसे धोखा न दें।
- समस्या: यदि आप रोबोट को "नॉइजी" (अव्यवस्थित) डेटा का उपयोग करके प्रशिक्षित करते हैं और फिर उसे वास्तविक दुनिया में "क्लीन" डेटा पर चलाते हैं, तो वह भ्रमित हो जाता है। यह बास्केटबॉल के साथ अभ्यास करने जैसा है जिसमें गेंद फिसलन भरी है, और फिर एक सूखी गेंद के साथ खेलने की कोशिश करना।
- समाधान: उन्होंने यह सुनिश्चित किया कि रोबोट का अभ्यास वास्तविक दुनिया के साथ पूरी तरह मेल खाता हो। उन्होंने रोबोट को एक "मेमोरी विंडो" (कॉन्टेक्स्ट) भी दी जहाँ वह वर्तमान को समझने के लिए अपने हालिया इतिहास को देख सकता था।
- उपमा: फिल्म के एक स्थिर फ्रेम को देखने के बजाय, रोबोट फिल्म के पिछले कुछ सेकंड देखता है ताकि वह कहानी को समझ सके। यह उसे भविष्य की भविष्यवाणी करने में मदद करता है, भले ही वह पूरे भविष्य को न देख सके।
परिणाम: सिमुलेशन से वास्तविक जीवन तक
टीम ने इसे एक Unitree G1 पर टेस्ट किया, जो एक असली ह्यूमनॉइड रोबोट है जो एक भविष्यवादी मानव जैसा दिखता है।
- कंप्यूटर में: रोबोट ने लगभग 100% सफलता के साथ चलना, मुड़ना और धक्कों से उबरना सीखा, जो उन रोबोट्स के बराबर था जिनके पास "सुपरपावर्स" (परफेक्ट सेंसर्स) थे।
- वास्तविक दुनिया में: उन्होंने रोबोट को एक वास्तविक कमरे में रखा। बिना किसी बाहरी कैमरे या मोशन-कैप्चर सूट के, रोबोट ने प्रति सेकंड 50 बार (50 Hz) की दर से काम किया, धक्कों पर प्रतिक्रिया दी और सुचारू रूप से कमांड का पालन किया।
यह क्यों महत्वपूर्ण है
इससे पहले, यदि आप चाहते थे कि कोई रोबोट इंसान की तरह चले, तो आपको प्रयोगशाला के ढेर सारे महंगे कैमरों की आवश्यकता होती थी जो उसकी हर हरकत को ट्रैक कर सकें। SCDP खेल बदल देता है। यह साबित करता है कि एक रोबोट "स्व-जागरूक" (self-aware) होकर चल सकता है, जो केवल अपने शरीर को महसूस करके अपनी गति और स्थिति का अनुमान लगा सकता है, ठीक वैसे ही जैसे इंसान अपनी आँखें बंद करके चलते समय करते हैं।
संक्षेप में: उन्होंने एक रोबोट को दुनिया को "महसूस" करना सिखाया, जिससे एक अंधे, लड़खड़ाते हुए मशीन से एक आत्मविश्वासी और आत्म-जागरूक चलने वाले रोबोट में बदलाव आया, जिसने एक चतुर ट्रेनिंग गेम के माध्यम से भौतिकी (physics) के छिपे हुए नियमों का अनुमान लगाना सीखा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।