← नवीनतम पेपर
💻 computer science

HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

HoMMI एक ऐसा फ्रेमवर्क है जो रोबोटों को एक विशेष क्रॉस-एम्बॉडिमेंट हैंड-आई पॉलिसी डिज़ाइन के माध्यम से मानव-से-रोबोट एम्बॉडिमेंट अंतराल को पाटकर, पोर्टेबल और रोबोट-मुक्त मानव प्रदर्शनों से सीधे जटिल होल-बॉडी मोबाइल मैनिपुलेशन कार्यों को सीखने में सक्षम बनाता है।

मूल लेखक: Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, Shuran Song

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, Shuran Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपने घर के काम करना सिखाना चाहते हैं, जैसे कपड़े उठाना, कोई पैकेज पहुँचाना, या मेज़पोश (tablecloth) को अनफोल्ड करना। सबसे कठिन हिस्सा केवल उसके हाथों को हिलाना नहीं है; बल्कि पूरे शरीर को हिलाना (चलना, झुकना, सिर घुमाना) है और साथ ही अपनी नज़रें लक्ष्य पर टिकाए रखना है।

लंबे समय तक, रोबोट को इस तरह सिखाना एक इंसान को भारी, अजीबोगरीब सूट पहनाकर और एक जॉयस्टिक से चलाने जैसा था। यह धीमा, महंगा और बड़े पैमाने पर करना कठिन था।

यहाँ आता है HoMMI (Whole-Body Mobile Manipulation Interface)। HoMMI को एक "जादुई पोशाक" की तरह समझें जो आम इंसानों को केवल खुद कार्य करके, एक स्मार्टफोन-आधारित सिस्टम का उपयोग करके, बिना कभी रोबोट को छुए, रोबोट को सिखाने की अनुमति देती है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: गति का "अनकैनी वैली" (Uncanny Valley)

शोधकर्ताओं ने UMI नामक एक सिस्टम से शुरुआत की, जहाँ एक व्यक्ति कैमरे वाले दो फोन जैसे ग्रिपर्स पकड़ता है। यह एक रोबोट को उसके हाथों को कैसे चलाना है, यह सिखाने के लिए बहुत अच्छा है। लेकिन, यह एक ड्राइवर को कार पार्क करना सिखाने जैसा है जबकि वह केवल रियरव्यू मिरर में देख रहा हो। आप बड़ी तस्वीर को मिस कर देते हैं: फुटपाथ, दूसरी कारें, और वहाँ पहुँचने के लिए आपको कहाँ चलना होगा।

इसे ठीक करने के लिए, उन्होंने व्यक्ति के सिर पर एक कैमरा (जैसे GoPro) लगाया। अचानक, इंसान पूरे कमरे को देख सकता था। लेकिन इसने एक नई समस्या पैदा कर दी: द एम्बॉडमेंट गैप (Embodiment Gap - शरीर की संरचना का अंतर)।

  • विजुअल गैप (दृश्य अंतराल): इंसान रोबोट से लंबे होते हैं, और हमारे हाथ अलग दिखते हैं। यदि आप केवल इंसान के सिर से वीडियो को रोबोट के सिर में कॉपी करते हैं, तो रोबोट भ्रमित हो जाता है क्योंकि उसका दृष्टिकोण (perspective) अलग होता है।
  • काइनेमैटिक गैप (गति संबंधी अंतराल): इंसानों के पास लचीली गर्दन होती है और वे आसानी से ऊपर, नीचे देख सकते हैं या घूम सकते हैं। रोबोट की गर्दन अक्सर सख्त और सीमित होती है। यदि आप रोबलेट को कहते हैं, "मेरे सिर की गति की बिल्कुल नकल करो," तो वह अपनी गर्दन को ऐसे आकार में मोड़ने की कोशिश कर सकता है जिससे वह टूट जाए।

2. समाधान: "ट्रांसलेटर" सिस्टम

HoMMI मानव शिक्षक और रोबोट छात्र के बीच एक शानदार अनुवादक के रूप में कार्य करता है। यह अंतर को पाटने के लिए तीन चतुर तरीकों का उपयोग करता है:

  • ट्रिक #1: 3D "घोस्ट" व्यू (विजुअल ट्रांसलेशन)
    रोबोट को कच्चा वीडियो (जो इंसान बनाम रोबोट के लिए अलग दिखता है) देने के बजाय, सिस्टम मानव वीडियो को एक 3D पॉइंट क्लाउड में बदल देता है। यह मानव शरीर और हाथों को हटा देता है, और केवल वस्तुओं और कमरे का "भूतिया साया" (ghost) छोड़ देता है। इस तरह, रोबोट दुनिया के आकार को देखता है, न कि उसमें मौजूद इंसान को। यह किसी फोटो के बजाय ब्लूप्रिंट देखने जैसा है; ब्लूप्रिंट किसी भी घर के लिए काम करता है, चाहे उसे किसी ने भी बनाया हो।

  • ट्रिक #2: "लुक-एट" पॉइंट (मूवमेंट ट्रांसलेशन)
    सिस्टम रोबोट को यह बताने के बजाय कि, "अपनी गर्दन को इन सटीक निर्देशांकों (coordinates) पर ले जाओ," सिस्टम रोबोट को कहता है, "कमरे में इस विशिष्ट स्थान को देखो।"

    • उपमा: कल्पना कीजिए कि एक मानव शिक्षक पेड़ में एक पक्षी की ओर इशारा कर रहा है। रोबोट को मानव के हाथ के सटीक कोण की नकल करने की आवश्यकता नहीं है। उसे बस यह जानने की आवश्यकता है कि पक्षी कहाँ है। रोबोट फिर अपनी सख्त गर्दन का उपयोग करके यह पता लगाता है कि बिना गर्दन तोड़े उस पक्षी को देखने का सबसे अच्छा तरीका क्या है। इसे "रिलैक्स्ड" एक्शन कहा जाता है।
  • ट्रिक #3: "ग्रिपर-सेंट्रिक" मैप
    सिस्टम रोबोट को उसके सिर के बजाय उसके हाथों के दृष्टिकोण से सोचने के लिए मजबूर करता है। भले ही इंसान इधर-उधर घूम रहा हो, रोबोट का दिमाग इस बात पर केंद्रित रहता है कि "वस्तु के सापेक्ष मेरे हाथ कहाँ हैं?" यह रोबोट को स्थिर और केंद्रित रखता है, जैसे एक रस्सी पर चलने वाला कलाकार जो भीड़ को नहीं, बल्कि रस्सी को देखता रहता है।

3. "दिमाग" और "शरीर"

एक बार जब इंसान किसी कार्य का प्रदर्शन करता है (जैसे शर्ट मोड़ना), तो सिस्टम एक पॉलिसी (Policy) (दिमाग) सीखता है। यह दिमाग तय करता है कि 3D दृश्य और "लुक-एट" पॉइंट्स के आधार पर आगे क्या करना है।

लेकिन दिमाग को हिलने के लिए एक शरीर चाहिए। यहीं पर होल-बॉडी कंट्रोलर (Whole-Body Controller) आता है।

  • उपमा: सोचिए कि पॉलिसी एक ऑर्केस्ट्रा के कंडक्टर की तरह है, और रोबोट वह ऑर्केस्ट्रा है। कंडक्टर कहता है, "यहाँ वायलिन बजाओ, वहाँ बास बजाओ।" कंट्रोलर वह संगीतकार है जिसे यह समझना होगा कि अपने पड़ोसी से टकराए बिना वह ठीक से कौन सी उंगलियां दबाए और अपने शरीर को कैसे हिलाए।
  • कंट्रोलर यह सुनिश्चित करता है कि रोबोट गिरे नहीं, दीवारों से न टकराए, और सुचारू रूप से चले, भले ही "कंडक्टर" (मानव का डेमो) थोड़ा डगमगा रहा हो।

4. परिणाम: क्या यह वास्तव में कर सकता है?

टीम ने तीन कठिन कार्यों पर इसका परीक्षण किया:

  1. लॉन्ड्री (कपड़े): एक शर्ट उठाना, बिन (bin) तक चलना, और उसमें डालना। (रोबोट को बिन को खोजने के लिए चारों ओर देखना पड़ा)।
  2. डिलीवरी: एक बॉक्स को बड़े कमरे में पार करके एक कार्ट तक ले जाना। (रोबोट को लंबी दूरी तय करनी पड़ी और कार्ट को खोजने के लिए मुड़ना पड़ा)।
  3. टेबलक्लॉथ: मेज़ पर रखे मैट को अनफोल्ड करना। (इसके लिए रोबोट के शरीर के हिलते समय दो हाथों के सटीक तालमेल की आवश्यकता थी)।

निर्णय:

  • HoMMI (नया सिस्टम): लगभग 80-90% बार सफल रहा। यह चल सका, चारों ओर देख सका और दो हाथों का प्रभावी ढंग से उपयोग कर सका।
  • पुराने सिस्टम (केवल हाथ या केवल सिर): बुरी तरह विफल रहे।
    • केवल हाथ: रोबोट दीवारों से टकरा गया क्योंकि वह कमरे को नहीं देख पा रहा था।
    • केवल सिर: रोबोट चीजों को पकड़ नहीं पाया क्योंकि वह बारीक विवरण नहीं देख पा रहा था।
    • सिर की गति की सटीक नकल करना: रोबोट फंस गया या अजीब तरह से हिलने लगा क्योंकि उसने उस लचीलेपन की नकल करने की कोशिश की जो उसके पास नहीं था।

बड़ी तस्वीर

HoMMI एक बड़ी उपलब्धि है क्योंकि यह हमें केवल कार्य को स्वयं करके, एक साधारण हेडसेट पहनने और दो फोन पकड़कर, रोबोट को सिखाने की अनुमति देता है। यह हमारे मानव आंदोलनों को उस भाषा में अनुवादित करता है जिसे रोबोट समझता है, और ऊंचाई तथा शरीर के आकार के अंतर को अनदेखा करता है।

यह एक यूनिवर्सल ट्रांसलेटर होने जैसा है जो हमें एक इंसान को रोबोट को अपना सहायक बनाने के लिए सिखाने की अनुमति देता है, बस यह दिखाकर कि काम कैसे किया जाता है, बिना किसी महंगे, धीमे या खतरनाक रोबोट प्रशिक्षण सत्रों के। यह हमें उन रोबोटों के करीब लाता है जो वास्तव में हमारे घर के कामों में हमारी मदद कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →