← नवीनतम पेपर
💻 computer science

ContactMimic: Humanoid Object Interaction via Contact Control

कॉन्टैक्टमिमिक (ContactMimic) एक लर्निंग फ्रेमवर्क है जो कीपॉइंट ट्रैजेक्टरीज के साथ बाइनरी कॉन्टैक्ट कमांड्स को स्पष्ट रूप से ट्रैक करके ह्यूमनॉइड ऑब्जेक्ट इंटरेक्शन को बढ़ाता है, जिससे विविध मैनिपुलेशन कार्यों में सटीक भौतिक संपर्क और ऑन-डिमांड कॉन्टैक्ट कंट्रोलेबिलिटी सक्षम होती है।

मूल लेखक: Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

प्रकाशित 2026-07-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डांस करना सिखा रहे हैं। लंबे समय तक, इसे करने का सबसे अच्छा तरीका यह था कि रोबोट को एक मानव नर्तक का वीडियो दिया जाए और कहा जाए, "इन सटीक शारीरिक स्थितियों की नकल करें।" रोबोट अपने जोड़ों को मानव के कूल्हों, कोहनियों और घुटनों से मेल खाने के लिए घुमाता।

लेकिन समस्या यह है: केवल नृत्य के आकार की नकल करना पर्याप्त नहीं है।

यदि एक मानव नर्तक व्हाइटबोर्ड के पास अपना हाथ हिलाता है, तो वह केवल हाथ हिला रहा होता है। यदि वह व्हाइटबोर्ड पर अपना हाथ दबाता है, तो वह उसे पोंछ रहा होता है। यदि एक रोबोट केवल हाथ की स्थिति को देखता है, तो वह हाथ हिलाकर यह सोच सकता है कि वह बहुत अच्छा काम कर रहा है, भले ही वह वास्तव में कुछ भी साफ नहीं कर रहा हो। यह एक दरवाजे को खोलने की कोशिश करने जैसा है जैसे कि हैंडल को छुए बिना बस उसके पास खड़े रहना।

यह CONTACTMIMIC नामक एक नए प्रोजेक्ट के पीछे का बड़ा विचार है। शोधकर्ताओं ने पाया कि यदि आप चाहते हैं कि एक रोबोट बैठने, पोंछने या फर्नीचर को धकेलने जैसे कार्यों के लिए वास्तव में उपयोगी हो, तो आप इसे केवल यह नहीं बता सकते कि उसे कहाँ होना है; आपको इसे यह बताना होगा कि उसे चीजों को छूना है या नहीं।

छूने के लिए "जादुई स्विच"

टीम ने एक ऐसी प्रणाली बनाई जहाँ, रोबोट को केवल एक पथ (path) का पालन करने के लिए देने के बजाय, वे उसे एक स्विच देते हैं। यह स्विच रोबोट के शरीर के हर हिस्से के लिए एक सरल "हाँ/नहीं" लेबल है।

  • स्विच चालू (Contact ✔): "ठीक है, रोबोट, मैं चाहता हूँ कि तुम अपना हाथ उस व्हाइटबोर्ड पर दबाओ।"
  • स्विच बंद (Contact ✘): "ठीक है, रोबोट, अपने हाथ को उसी स्थान पर ले जाओ, लेकिन बोर्ड को छूना मत। बस उसके ऊपर हवा में रहो।"

अपने परीक्षणों में, उन्होंने दिखाया कि इस स्विच के साथ, वही रोबोट एक ही डांस मूव्स कर सकता है लेकिन अपना व्यवहार पूरी तरह से बदल सकता है। वह कुर्सी में बैठ सकता है और पीछे झुक सकता है, या उसी कुर्सी में बिना पीठ टिकाए सीधा बैठ सकता है। वह एक बॉक्स उठा सकता है, या बिना उसे उठाए बस बॉक्स पकड़ने की आकृति में अपने हाथ रख सकता है।

यह इतना कठिन क्यों था?

आप सोच सकते हैं, "रोबोट को स्वाभाविक रूप से चीजों को छूना क्यों नहीं सिखा देते?" शोधकर्ताओं ने डेटा में एक चालाकी भरा जाल खोजा।

जब इंसान वस्तुओं के साथ क्रिया करते हैं, तो उनकी शारीरिक स्थितियाँ और उनके स्पर्श आमतौर पर एक साथ जुड़े होते हैं। यदि कोई इंसान कुर्सी में बैठता है, तो उसका निचला हिस्सा हमेशा सीट को छू रहा होता है। यदि कोई इंसान बोर्ड पोंछ रहा है, तो उसका हाथ हमेशा सतह को छू रहा होता है। इस कारण से, यदि आप केवल रोबोट को बैठने के हजारों वीडियो दिखाते हैं, तो रोबोट सीख जाता है: "ओह, यदि कूल्हे इस स्थिति में हैं, तो निचला हिस्सा कुर्सी को छू रहा होगा।" वह "स्पर्श" (touch) कमांड को सुनना बंद कर देता है क्योंकि उसे लगता है कि स्थिति ही पूरी कहानी बता रही है।

इसे ठीक करने के लिए, टीम को रचनात्मक होना पड़ा। उन्होंने अपने प्रशिक्षण डेटा को लिया और नियमों को तोड़ना शुरू किया:

  1. "घोस्ट" (भूतिया) ऑब्जेक्ट: उन्होंने किसी व्यक्ति का बोर्ड पोंछने का वीडियो लिया लेकिन रोबोट को बताया, "बोर्ड वहाँ नहीं है।" रोबोट को बोर्ड की जगह पर अपना हाथ ले जाना था बिना किसी चीज़ को छुए।
  2. "फूले हुए" ऑब्जेक्ट: उन्होंने सिमुलेशन में वस्तुओं को बड़ा बनाया (जैसे गुब्बारे को फुलाना) ताकि रोबोट को वस्तु के चारों ओर घूमना पड़े ताकि वह उससे टकराने से बच सके, भले ही "टच" कमांड कह रहा हो कि उसे छूना चाहिए।
  3. "नकली" स्पर्श: उन्होंने एक वीडियो लिया जहाँ रोबोट को छूना था, लेकिन उन्होंने उसे बताया, "छूना मत," और इसके विपरीत भी किया।

इन सबको मिलाकर, उन्होंने रोबोट को स्थिति के आधार पर अनुमान लगाने के बजाय वास्तव में "टच" स्विच को सुनने के लिए मजबूर किया।

क्या यह काम आया?

टीम ने इसका परीक्षण Unitree G1 (एक 29-जॉइंट वाला ह्यूमनॉइड) और एक कंप्यूटर सिमुलेशन पर किया।

  • सिमुलेशन में: उन्होंने 10 अलग-अलग कार्य चलाए, जैसे कुर्सी को लात मारना, कुर्सी पर कदम रखना और एक बॉक्स उठाना। जब उन्होंने स्विच को "Contact" पर सेट किया, तो रोब ने संपर्क किया। जब उन्होंने इसे "No Contact" पर सेट किया, तो उसने छूना बंद कर दिया। रोबोट केवल उसे छूने के निर्देश से एक बॉक्स उठा भी सकता था, बिना किसी विशेष "बॉक्स उठाने" के निर्देश के।
  • वास्तविक दुनिया में: उन्होंने पाँच वास्तविक जीवन की गतियों का परीक्षण किया, जिसमें व्हाइटबोर्ड पोंछना और कुर्सी के पीछे झुकना शामिल था।
    • जब उसे पोंछने के लिए कहा गया, तो रोबोट के हाथ ने बोर्ड पर निशान छोड़ने के लिए पर्याप्त दबाव डाला।
      ने जब उसे हवा में रहने (hover) के लिए कहा गया, तो हाथ उसी स्थान पर गया लेकिन कोई निशान नहीं छोड़ा।
    • जब उसे झुकने के लिए कहा गया, तो रोबोट ने अपनी वज़न कुर्सी के पीछे टिका दिया। जब उसे न झुकने के लिए कहा गया, तो वह खुद को संतुलित रखते हुए सीधा खड़ा रहा।

परिणाम प्रभावशाली थे। वास्तविक दुनिया में, रोबोट अधिकांश कार्यों के लिए संपर्क कमांड का पालन करने में लगभग 90% से 100% बार सफल रहा (उदाहरण के लिए, कुर्सी के पीछे झुकने के लिए 10 में से 9 बार और बोर्ड पोंछने के लिए 5 में से 5 बार)।

यह क्या नहीं कर सकता (अभी तक)

पेपर बहुत स्पष्ट है कि यह क्या नहीं है।

  • यह एक ऐसा "यूनिवर्सल" रोबोट नहीं है जो एक ही दिमाग से कोई भी कार्य कर सके। शोधकर्ताओं ने प्रत्येक विशिष्ट गति के लिए एक अलग "दिमाग" (पॉलिसी) को प्रशिक्षित किया है। उन्होंने अभी तक यह नहीं पता लगाया है कि एक अकेला रोबोट कैसे इन सभी चीजों को एक साथ कर सकता है।
  • यह मानव और वस्तुओं के बीच की बातचीत के उच्च गुणवत्ता वाले वीडियो पर निर्भर करता है। उन्होंने इंटरनेट से रैंडम वीडियो का उपयोग नहीं किया; उन्होंने HUMOTO नामक एक विशिष्ट डेटासेट का उपयोग किया।
  • उन्होंने रोबोट की त्वचा पर विशेष टच सेंसर का उपयोग नहीं किया। इसके बजाय, रोबोट ने यह पता लगाया कि क्या वह किसी चीज़ को छू रहा है, केवल अपनी मांसपेशियों और जोड़ों (proprioception) को महसूस करके। उन्होंने यह साबित किया कि यह काम करता है क्योंकि यदि आप एक साधारण कंप्यूटर प्रोग्राम से पूछते कि "क्या रोबोट छू रहा है?" तो वह रोबोट की आंतरिक संवेदनाओं के आधार पर लगभग हमेशा सही होता (अधिकांश कार्यों के लिए F1 स्कोर 0.90 से 0.99 के बीच था)।

निचोड़

पेपर सुझाव देता है कि यदि आप चाहते हैं कि एक रोबोट भौतिक कार्य करे, तो आपको केवल उसे यह नहीं बताना चाहिए कि उसे कहाँ जाना है। आपको स्पष्ट रूप से यह बताना होगा कि उसे छूना है या नहीं। प्रशिक्षण के दौरान "स्थिति" और "स्पर्श" के बीच के संबंध को तोड़कर, उन्होंने रोबोट को एक साधारण स्विच को सुनना सिखाया। यह उन रोबोटों की ओर एक कदम है जो केवल कार्य करते हुए दिखते नहीं हैं, बल्कि सही शारीरिक संपर्क बनाकर वास्तव में कार्य करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →