← नवीनतम पेपर
💻 computer science

Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA

यह शोध पत्र डेटा और लर्निंग बाधाओं को दूर करने के लिए IMCopilot सहायक के माध्यम से RL-संवर्धित टेलीऑपरेशन और एक Mixture-of-Dexterous-Experts VLA (MoDE-VLA) आर्किटेक्चर को संयोजित करने वाले एक एकीकृत ढांचे का प्रस्ताव करता है, जो काफी बेहतर सफलता दरों के साथ मजबूत मानव-समान, संपर्क-समृद्ध द्विपक्षीय इन-हैंड मैनिपुलेशन को सक्षम बनाता है।

मूल लेखक: Tutian Tang, Xingyu Ji, Wanli Xing, Ce Hao, Wenqiang Xu, Lin Shao, Cewu Lu, Qiaojun Yu, Jiangmiao Pang, Kaifeng Zhang

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tutian Tang, Xingyu Ji, Wanli Xing, Ce Hao, Wenqiang Xu, Lin Shao, Cewu Lu, Qiaojun Yu, Jiangmiao Pang, Kaifeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सेब छीलने जैसा कठिन काम सिखा रहे हैं। यह हमें सरल लगता है, लेकिन एक रोबोट के लिए, यह एक हाथ में सुई पिरोने जैसा है जबकि वह एक ऊँची रस्सी पर साइकिल चला रहा हो। रोबोट को फल को पकड़ना होगा, अपनी उंगलियों से उसे घुमाना होगा, और फल को कुचले या गिराए बिना उसकी त्वचा को छीलना होगा।

यह शोध पत्र एक नई प्रणाली पेश करता है जो रोबोट को ऐसे "मानवीय" कौशल सीखने में मदद करती है। इसे रोबोट की महारत के लिए तीन-भागों वाली एक रेसिपी की तरह समझें: बेहतर ट्रेनिंग व्हील्स (सहायक पहिए), एक स्मार्ट असिस्टेंट (स्मार्ट सहायक), और एक सुपर-ब्रेन (सुपर-दिमाग)।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: रोबोट अपनी उंगलियों के साथ "भोंडे" होते हैं

आज के अधिकांश रोबोट चीजों को उठाने और रखने (जैसे एक फोर्कलिफ्ट) में बहुत अच्छे होते हैं। लेकिन वे डेक्सट्रस मैनिपुलेशन (Dexterous Manipulation)—यानी वस्तुओं को घुमाने, मरोड़ने और महसूस करने के लिए उंगलियों का उपयोग करने—में संघर्ष करते हैं।

  • डेटा गैप (Data Gap): रोबोट को सिखाने के लिए, हम आमतौर पर एक इंसान द्वारा इसे रिमोटली कंट्रोल करवाते हैं (टेलीऑपरेशन)। लेकिन 63 हिलने वाले हिस्सों (दो हाथ, दो हाथ, उंगलियां) वाले रोबोट को नियंत्रित करना बेहद कठिन है। यह ऐसा है जैसे केवल अपनी कोहनियों का उपयोग करके 63 चाबियों वाला पियानो बजाना। यहाँ तक कि विशेषज्ञ भी "सेब" को गिरा देते हैं या "छीलने वाले उपकरण" को फिसलने देते हैं क्योंकि वे दबाव महसूस नहीं कर पाते।
  • सेंसरी गैप (Sensory Gap): रोबोट आमतौर पर कैमरों से केवल "देखते" हैं। लेकिन सेब छीलने के लिए "महसूस करने" की आवश्यकता होती है। आपको यह जानने की जरूरत है कि त्वचा फिसल रही है या आप बहुत अधिक दबाव डाल रहे हैं। वर्तमान रोबोट के दिमाग प्रभावी ढंग से "दृष्टि" को "स्पर्श" और "दबाव" के साथ नहीं मिला पाते।

2. समाधान: "IMCopilot" (ट्रेनिंग व्हील्स और असिस्टेंट)

लेखकों ने IMCopilot नामक एक टूल बनाया है। इसे रोबोट के हाथों के लिए एक स्मार्ट ऑटोपायलट समझें।

  • ट्रेनिंग के दौरान (ट्रेनिंग व्हील्स): जब इंसान रोबोट को सिखा रहे होते हैं, तो वे सेब को घुमाने के लिए उंगलियों को पूरी तरह से नियंत्रित नहीं कर पाते। इसलिए, वे फुट पेडल का उपयोग करके कहते हैं, "हे, बस सेब को स्थिर पकड़ लो और इसे मेरे लिए घुमा दो।" IMCopilot उंगलियों के कठिन काम को संभाल लेता है, जबकि इंसान केवल हाथों को हिलाता है। इससे ट्रेनिंग डेटा इकट्ठा करना बहुत तेज़ और कम निराशाजनक हो जाता है।
  • एग्जीक्यूशन के दौरान (असिस्टेंट): एक बार जब रोबोट अकेले काम कर रहा होता है, तो मुख्य दिमाग (VLA) कह सकता है, "मुझे अब सेब को घुमाने की जरूरत है," और यह IMCopilot को सक्रिय करता है ताकि वह वास्तव में घुमा सके। यह एक कंडक्टर (मुख्य दिमाग) की तरह है जो एक माहिर वायलिन वादक (IMCopilot) को एक विशिष्ट सोलो बजाने के लिए कहता है।

3. समाधान: "MoDE-VLA" (सुपर-ब्रेन)

दूसरा भाग रोबोट का दिमाग है, जिसे MoDE-VLA कहा जाता है।

  • पुराना तरीका: कल्पना कीजिए कि आप एक किताब पढ़ने की कोशिश कर रहे हैं जबकि कोई आपके कान में नंबर चिल्ला रहा है। यदि आप टेक्स्ट और नंबरों को बस एक साथ मिला देते हैं, तो आप भ्रमित हो जाते हैं। ऐसा ही तब होता है जब रोबोट कैमरा इमेज और फोर्स सेंसर को मिलाने की कोशिश करते हैं।
  • नया तरीका (MoDE): यह सिस्टम विशेषज्ञों की एक विशेष टीम की तरह है।
    • इसमें एक मुख्य दिमाग है जो जानता है कि देखने और सुनने के आधार पर कैसे हिलना है (विज़न-लैंग्वेज-एक्शन)।
    • इसमें एक विशेष "टच टीम" है जो केवल बल (force) और स्पर्श (tactile) डेटा को देखती है।
    • जादू: टच डेटा को पूरे दिमाग को बदलने के लिए मजबूर करने के बजाय, यह एक फाइन-ट्यूनिंग नॉब (बारीक समायोजन करने वाला बटन) की तरह काम करता है। यह कहता है, "मुख्य दिमाग सोचता है कि हाथ को यहाँ हिलना चाहिए, लेकिन मेरे टच सेंसर कहते हैं कि सेब फिसलन भरा है, इसलिए चलिए हलचल को थोड़ा बाईं ओर खिसकाते हैं।" यह एक "रेसिडुअल करेक्शन" (अवशिष्ट सुधार) जोड़ता है—महसूस करने के आधार पर एक छोटा, स्मार्ट समायोजन, बिना रोबोट के सामान्य ज्ञान को बिगाड़े।

4. परिणाम: "फंबल" करने से "छीलने" तक

टीम ने चार कठिन कार्यों पर इसका परीक्षण किया:

  1. गियर असेंबलिंग: शाफ्ट पर गियर को धकेलना (सटीक दबाव की आवश्यकता)।
  2. चार्जर प्लगिंग: छेद ढूँढना और प्लग को अंदर धकेलना (उस "क्लिक" को महसूस करने की आवश्यकता)।
  3. टेस्ट ट्यूब पुनर्व्यवस्था: हाथों के बीच ट्यूब को बिना गिराए इधर-उधर ले जाना।
  4. सेब छीलना: अंतिम परीक्षा। एक हाथ में छीलने वाला उपकरण पकड़ना और दूसरे में सेब, और सेब को घुमाते हुए छीलना।

परिणाम:

  • उनके सिस्टम के बिना, रोबोट औसतन केवल 15% बार सफल हुआ।
  • IMCopilot और MoDE-VLA के साथ, सफलता बढ़कर 34% हो गई (जो रोबोटिक्स में बहुत बड़ी बात है!)।
  • सबसे प्रभावशाली बात यह है कि उन्होंने सेब छीलने वाला पहला स्वायत्त (autonomous) रोबोट बनाया। रोबोट फल को पकड़ सकता था, उसे घुमा सकता था, और बिना गिराए त्वचा की एक पूरी रिंग छील सकता था।

बड़ा चित्र (एनालॉजी)

कल्पना कीजिए कि आप जगलिंग (juggle) सीख रहे हैं।

  • पुराने रोबोट: आप केवल गेंदों को देखकर जगलिंग करने की कोशिश करते हैं। आप उन्हें लगातार गिरा देते हैं क्योंकि आप महसूस नहीं कर पाते कि वे कब फिसल रही हैं।
  • IMCopful: एक दोस्त आपके लिए गेंदों को थामे रखता है जब आप हाथ की गति सीख रहे होते हैं, और फिर जब आप तैयार होते हैं तो छोड़ देता है।
  • MoDE-VLA: आप विशेष दस्ताने पहनते हैं जो तब कंपन करते हैं जब कोई गेंद फिसलने वाली होती है, और आपका दिमाग तुरंत आपकी हाथ की स्थिति को समायोजित करता है बिना यह सोचे कि आपको क्या करना है।

स्मार्ट ट्रेनिंग टूल्स (IMCopilot) को एक ऐसे दिमाग (MoDE-VLA) के साथ जोड़कर, जो दृष्टि और स्पर्श दोनों को समझता है, लेखकों ने उन नाजुक, बिखरे हुए, मानवीय कार्यों की ओर एक बड़ा कदम बढ़ाया है जिन्हें हम रोज़मर्रा के जीवन में स्वाभाविक रूप से करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →