Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA
यह शोध पत्र डेटा और लर्निंग बाधाओं को दूर करने के लिए IMCopilot सहायक के माध्यम से RL-संवर्धित टेलीऑपरेशन और एक Mixture-of-Dexterous-Experts VLA (MoDE-VLA) आर्किटेक्चर को संयोजित करने वाले एक एकीकृत ढांचे का प्रस्ताव करता है, जो काफी बेहतर सफलता दरों के साथ मजबूत मानव-समान, संपर्क-समृद्ध द्विपक्षीय इन-हैंड मैनिपुलेशन को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सेब छीलने जैसा कठिन काम सिखा रहे हैं। यह हमें सरल लगता है, लेकिन एक रोबोट के लिए, यह एक हाथ में सुई पिरोने जैसा है जबकि वह एक ऊँची रस्सी पर साइकिल चला रहा हो। रोबोट को फल को पकड़ना होगा, अपनी उंगलियों से उसे घुमाना होगा, और फल को कुचले या गिराए बिना उसकी त्वचा को छीलना होगा।
यह शोध पत्र एक नई प्रणाली पेश करता है जो रोबोट को ऐसे "मानवीय" कौशल सीखने में मदद करती है। इसे रोबोट की महारत के लिए तीन-भागों वाली एक रेसिपी की तरह समझें: बेहतर ट्रेनिंग व्हील्स (सहायक पहिए), एक स्मार्ट असिस्टेंट (स्मार्ट सहायक), और एक सुपर-ब्रेन (सुपर-दिमाग)।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. समस्या: रोबोट अपनी उंगलियों के साथ "भोंडे" होते हैं
आज के अधिकांश रोबोट चीजों को उठाने और रखने (जैसे एक फोर्कलिफ्ट) में बहुत अच्छे होते हैं। लेकिन वे डेक्सट्रस मैनिपुलेशन (Dexterous Manipulation)—यानी वस्तुओं को घुमाने, मरोड़ने और महसूस करने के लिए उंगलियों का उपयोग करने—में संघर्ष करते हैं।
- डेटा गैप (Data Gap): रोबोट को सिखाने के लिए, हम आमतौर पर एक इंसान द्वारा इसे रिमोटली कंट्रोल करवाते हैं (टेलीऑपरेशन)। लेकिन 63 हिलने वाले हिस्सों (दो हाथ, दो हाथ, उंगलियां) वाले रोबोट को नियंत्रित करना बेहद कठिन है। यह ऐसा है जैसे केवल अपनी कोहनियों का उपयोग करके 63 चाबियों वाला पियानो बजाना। यहाँ तक कि विशेषज्ञ भी "सेब" को गिरा देते हैं या "छीलने वाले उपकरण" को फिसलने देते हैं क्योंकि वे दबाव महसूस नहीं कर पाते।
- सेंसरी गैप (Sensory Gap): रोबोट आमतौर पर कैमरों से केवल "देखते" हैं। लेकिन सेब छीलने के लिए "महसूस करने" की आवश्यकता होती है। आपको यह जानने की जरूरत है कि त्वचा फिसल रही है या आप बहुत अधिक दबाव डाल रहे हैं। वर्तमान रोबोट के दिमाग प्रभावी ढंग से "दृष्टि" को "स्पर्श" और "दबाव" के साथ नहीं मिला पाते।
2. समाधान: "IMCopilot" (ट्रेनिंग व्हील्स और असिस्टेंट)
लेखकों ने IMCopilot नामक एक टूल बनाया है। इसे रोबोट के हाथों के लिए एक स्मार्ट ऑटोपायलट समझें।
- ट्रेनिंग के दौरान (ट्रेनिंग व्हील्स): जब इंसान रोबोट को सिखा रहे होते हैं, तो वे सेब को घुमाने के लिए उंगलियों को पूरी तरह से नियंत्रित नहीं कर पाते। इसलिए, वे फुट पेडल का उपयोग करके कहते हैं, "हे, बस सेब को स्थिर पकड़ लो और इसे मेरे लिए घुमा दो।" IMCopilot उंगलियों के कठिन काम को संभाल लेता है, जबकि इंसान केवल हाथों को हिलाता है। इससे ट्रेनिंग डेटा इकट्ठा करना बहुत तेज़ और कम निराशाजनक हो जाता है।
- एग्जीक्यूशन के दौरान (असिस्टेंट): एक बार जब रोबोट अकेले काम कर रहा होता है, तो मुख्य दिमाग (VLA) कह सकता है, "मुझे अब सेब को घुमाने की जरूरत है," और यह IMCopilot को सक्रिय करता है ताकि वह वास्तव में घुमा सके। यह एक कंडक्टर (मुख्य दिमाग) की तरह है जो एक माहिर वायलिन वादक (IMCopilot) को एक विशिष्ट सोलो बजाने के लिए कहता है।
3. समाधान: "MoDE-VLA" (सुपर-ब्रेन)
दूसरा भाग रोबोट का दिमाग है, जिसे MoDE-VLA कहा जाता है।
- पुराना तरीका: कल्पना कीजिए कि आप एक किताब पढ़ने की कोशिश कर रहे हैं जबकि कोई आपके कान में नंबर चिल्ला रहा है। यदि आप टेक्स्ट और नंबरों को बस एक साथ मिला देते हैं, तो आप भ्रमित हो जाते हैं। ऐसा ही तब होता है जब रोबोट कैमरा इमेज और फोर्स सेंसर को मिलाने की कोशिश करते हैं।
- नया तरीका (MoDE): यह सिस्टम विशेषज्ञों की एक विशेष टीम की तरह है।
- इसमें एक मुख्य दिमाग है जो जानता है कि देखने और सुनने के आधार पर कैसे हिलना है (विज़न-लैंग्वेज-एक्शन)।
- इसमें एक विशेष "टच टीम" है जो केवल बल (force) और स्पर्श (tactile) डेटा को देखती है।
- जादू: टच डेटा को पूरे दिमाग को बदलने के लिए मजबूर करने के बजाय, यह एक फाइन-ट्यूनिंग नॉब (बारीक समायोजन करने वाला बटन) की तरह काम करता है। यह कहता है, "मुख्य दिमाग सोचता है कि हाथ को यहाँ हिलना चाहिए, लेकिन मेरे टच सेंसर कहते हैं कि सेब फिसलन भरा है, इसलिए चलिए हलचल को थोड़ा बाईं ओर खिसकाते हैं।" यह एक "रेसिडुअल करेक्शन" (अवशिष्ट सुधार) जोड़ता है—महसूस करने के आधार पर एक छोटा, स्मार्ट समायोजन, बिना रोबोट के सामान्य ज्ञान को बिगाड़े।
4. परिणाम: "फंबल" करने से "छीलने" तक
टीम ने चार कठिन कार्यों पर इसका परीक्षण किया:
- गियर असेंबलिंग: शाफ्ट पर गियर को धकेलना (सटीक दबाव की आवश्यकता)।
- चार्जर प्लगिंग: छेद ढूँढना और प्लग को अंदर धकेलना (उस "क्लिक" को महसूस करने की आवश्यकता)।
- टेस्ट ट्यूब पुनर्व्यवस्था: हाथों के बीच ट्यूब को बिना गिराए इधर-उधर ले जाना।
- सेब छीलना: अंतिम परीक्षा। एक हाथ में छीलने वाला उपकरण पकड़ना और दूसरे में सेब, और सेब को घुमाते हुए छीलना।
परिणाम:
- उनके सिस्टम के बिना, रोबोट औसतन केवल 15% बार सफल हुआ।
- IMCopilot और MoDE-VLA के साथ, सफलता बढ़कर 34% हो गई (जो रोबोटिक्स में बहुत बड़ी बात है!)।
- सबसे प्रभावशाली बात यह है कि उन्होंने सेब छीलने वाला पहला स्वायत्त (autonomous) रोबोट बनाया। रोबोट फल को पकड़ सकता था, उसे घुमा सकता था, और बिना गिराए त्वचा की एक पूरी रिंग छील सकता था।
बड़ा चित्र (एनालॉजी)
कल्पना कीजिए कि आप जगलिंग (juggle) सीख रहे हैं।
- पुराने रोबोट: आप केवल गेंदों को देखकर जगलिंग करने की कोशिश करते हैं। आप उन्हें लगातार गिरा देते हैं क्योंकि आप महसूस नहीं कर पाते कि वे कब फिसल रही हैं।
- IMCopful: एक दोस्त आपके लिए गेंदों को थामे रखता है जब आप हाथ की गति सीख रहे होते हैं, और फिर जब आप तैयार होते हैं तो छोड़ देता है।
- MoDE-VLA: आप विशेष दस्ताने पहनते हैं जो तब कंपन करते हैं जब कोई गेंद फिसलने वाली होती है, और आपका दिमाग तुरंत आपकी हाथ की स्थिति को समायोजित करता है बिना यह सोचे कि आपको क्या करना है।
स्मार्ट ट्रेनिंग टूल्स (IMCopilot) को एक ऐसे दिमाग (MoDE-VLA) के साथ जोड़कर, जो दृष्टि और स्पर्श दोनों को समझता है, लेखकों ने उन नाजुक, बिखरे हुए, मानवीय कार्यों की ओर एक बड़ा कदम बढ़ाया है जिन्हें हम रोज़मर्रा के जीवन में स्वाभाविक रूप से करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।