InterReal: A Unified Physics-Based Imitation Framework for Learning Human-Object Interaction Skills
InterReal एक एकीकृत भौतिकी-आधारित इमिटेशन लर्निंग फ्रेमवर्क है जो एक नवीन मोशन डेटा ऑग्मेंटेशन स्कीम और एक ऑटोमैटिक रिवॉर्ड लर्नर के माध्यम से मानवोय रोबोटों को वास्तविक दुनिया के परिवेश में जटिल मानव-वस्तु संपर्क कौशल को मजबूती से सीखने और निष्पादित करने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे कि एक भारी डिब्बा उठाना या एक गाड़ी को धकेलना। अतीत में, रोबोट अपने आप चलने या नाचने में माहिर थे, लेकिन जैसे ही उन्हें किसी चीज़ को छूना और हिलाना होता था, वे अक्सर उसे गिरा देते थे, उसे उलट देते थे, या अटक जाते थे। उनमें इस बात की "समझ" की कमी थी कि वास्तविक दुनिया में वस्तुएं कैसे व्यवहार करती हैं।
यह शोध पत्र InterReal पेश करता है, जो मानव सदृश (humanoid) रोबोटों के लिए एक नया "प्रशिक्षण शिविर" है, जिसे जटिल कार्यों में महारत हासिल करने के लिए डिज़ाइन किया गया है। एक अनाड़ी रोबोट को एक कुशल संचालक में बदलने के लिए इसे एक तीन-चरणीय रेसिपी की तरह समझें।
1. "क्या-होता-अगर" सिम्युलेटर (मोशन ऑग्मेंटेशन)
कल्पना कीजिए कि आप गेंद पकड़ना सीख रहे हैं। यदि आप केवल उसी गेंद के साथ अभ्यास करते हैं जो हर बार बिल्कुल एक ही जगह से फेंकी जाती है, तो आप उस विशिष्ट थ्रो में तो अच्छे हो जाएंगे, लेकिन यदि कोई गेंद को थोड़ा बाईं ओर फेंकता है, तो आप असफल हो जाएंगे।
शोधकर्ताओं ने महसूस किया कि वास्तविक दुनिया के रोबोट इसलिए विफल होते हैं क्योंकि उनके सेंसर शोर (noise) पैदा करते हैं, या डिब्बा ठीक वहीं नहीं होता जहाँ रोबोट उसकी अपेक्षा करता है। इसे ठीक करने के लिए, InterReal मोशन ऑग्मेंटेशन (Motion Augmentation) नामक तकनीक का उपयोग करता है।
- उपमा: एक नृत्य प्रशिक्षक की कल्पना करें जो एक छात्र को सिखा रहा है। केवल एक आदर्श रूटीन दिखाने के बजाय, प्रशिक्षक कहता है, "ठीक है, अब कल्पना करो कि संगीत थोड़ा तेज़ है," या "अब, मान लो कि फर्श फिसलन भरा है," या "अब, साथी दो इंच बाईं ओर खड़ा है।"
- यह कैसे काम करता है: सिस्टम एक इंसान द्वारा डिब्बा हिलाने के एक आदर्श वीडियो को लेता है और गणितीय रूप से डिब्बे की स्थिति को हजारों अलग-अलग तरीकों से थोड़ा "बदल" (shuffle) देता है। फिर यह रोबोट को मजबूर करता है कि वह अपने हाथ के जोड़ों को इस तरह समायोजित करे कि वह डिब्बे को पूरी तरह से पकड़ सके, भले ही डिब्बा हिल गया हो। यह रोबोट को कठोर होने के बजाय लचीला बनना सिखाता है।
2. "स्मार्ट कोच" (ऑटोमैटिक रिवॉर्ड लर्निंग)
रोबोट प्रशिक्षण में, आपको रोबोट को सही काम करने के लिए अंक (रिवॉर्ड्स) देने होते हैं। आमतौर पर, इंसानों को मैन्युअल रूप से तय करना पड़ता है: "ठीक है, यदि रोबोट डिब्बा पकड़ता है, तो 5 अंक दें। यदि वह इसे गिरा देता है, तो 10 अंक घटा दें।" यह एक शिक्षक की तरह है जो हर एक टेस्ट प्रश्न के लिए हाथ से कैलकुलेटर चलाकर छात्र को ग्रेड देने की कोशिश कर रहा है। यह धीमा है, और शिक्षक संतुलन गलत कर सकता है (जैसे, तेज चलने पर बहुत अधिक ध्यान देना और डिब्बा पकड़ने पर पर्याप्त ध्यान न देना)।
InterReal एक ऑटोमैटिक रिवॉर्ड लर्नर पेश करता है, जो एक स्मार्ट कोच की तरह कार्य करता है।
- उपमा: एक कोच की कल्पना करें जो रोबोट को अभ्यास करते हुए देखता है और कहता है, "अभी, रोबोट डगमगा रहा है, इसलिए आइए संतुलन पर ध्यान केंद्रित करें। लेकिन अब जब वह स्थिर है, तो आइए डिब्बे को मजबूती से पकड़ने पर ध्यान केंद्रित करें।"
- यह कैसे काम करता है: सिस्टम एक "मेटा-पॉलिसी" (एक उच्च-स्तरीय मस्तिष्क) का उपयोग करता है जो रोबोट की गलतियों को देखता है। यदि रोबोट डिब्बे को स्थिर रखने में संघर्ष कर रहा है, तो कोच स्वचालित रूप से रिवॉर्ड सिस्टम को स्थिरता को प्राथमिकता देने के लिए बदल देता है। यदि रोबोट स्थिर है लेकिन डिब्बे तक पहुँचने में चूक रहा है, तो कोच सटीकता पर ध्यान केंद्रित करने के लिए बदलाव करता है। यह रोबोट को तेजी से और बेहतर तरीके से सीखने में मदद करने के लिए वास्तविक समय में "ग्रेडिंग रूब्रिक" को लगातार ट्यून करता रहता है।
3. "वास्तविक दुनिया का परीक्षण" (डिप्लॉयमेंट)
अधिकांश रोबोट प्रशिक्षण एक वीडियो गेम की दुनिया (सिमुलेशन) में होता है जहाँ भौतिकी (physics) एकदम सटीक होती है। समस्या यह है कि वास्तविक जीवन अव्यवस्थित होता है।
InterReal का परीक्षण Unitree G1 नामक एक वास्तविक रोबोट पर किया गया था।
- परिदृश्य: रोबोट को एक भारी डिब्बा उठाना था और उसके साथ चलना था, और फिर झुकते हुए एक डिब्बे को आगे धकेलना था।
- परिणाम: जबकि अन्य रोबोट (बेसलाइन) अक्सर डिब्बा गिरा देते थे या डिब्बे के हिलने पर गिर जाते थे, InterReal तुरंत सामंजस्य बिठा लेता था। इसने यह देखने के लिए एक कैमरा सिस्टम का उपयोग किया कि डिब्बा वास्तव में कहाँ था और ठीक उसी तरह से अपनी गतिविधियों को बदला जैसे कि कोई इंसान करेगा।
मुख्य विचार (The Big Picture)
InterReal को एक तोते और एक इंसान के बीच के अंतर के रूप में सोचें।
- पुराने रोबोट (तोते): उन्होंने एक विशिष्ट स्क्रिप्ट याद कर ली थी। यदि आपने स्क्रिप्ट बदल दी (डिब्बे को हिला दिया), तो वे अनुकूलित नहीं हो सके।
- InterReal (इंसान): इसने भौतिकी और अंतःक्रिया (interaction) के सिद्धांतों को सीखा। यह समझता है कि यदि डिब्बा हिलता है, तो मुझे अपना हाथ हिलाना होगा। इसने अराजकता के अनुकूल होना सीखा, जिससे यह गोदाम के काम या लोगों की मदद करने जैसे वास्तविक दुनिया के कामों के लिए तैयार हो गया।
संक्षेप में: InterReal रोबोटों को "क्या-होता-अगर" वाले परिदृश्यों के साथ अभ्यास करके अनुकूलन योग्य बनाना सिखाता है और एक स्मार्ट कोच का उपयोग करता है जो जानता है कि हर क्षण में प्रशंसा किस बात की करनी है, जिसके परिणामस्वरूप एक ऐसा रोबोट मिलता है जो वास्तव में वास्तविक दुनिया की अव्यवस्था को संभाल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।