← नवीनतम पेपर
💻 computer science

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

यह शोध पत्र Cloak को पेश करता है, जो एक प्रशिक्षण विधि है जो विजन-लैंग्वेज-एक्शन मॉडल्स को प्रशिक्षण के दौरान रिस्ट कैमरा व्यू से एंड-इफेक्टर को मास्क करके ज़ीरो-शॉट क्रॉस-एम्बोडिमेंट मैनिपुलेशन प्राप्त करने में सक्षम बनाती है, जिससे एक मॉडल जो एक ही रोबोट पर प्रशिक्षित है, बिना नया डेटा एकत्र किए अनदेखे हार्डवेयर तक सामान्यीकरण कर सकता है।

मूल लेखक: Michael Piseno, Guy Tevet, C. Karen Liu

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Piseno, Guy Tevet, C. Karen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कप उठाना सिखा रहे हैं। आप उसे अपने ही "आंख" (कलाई पर लगे कैमरे) से लिया गया एक वीडियो दिखाते हैं। समस्या यह है कि उस वीडियो में, रोबोट का अपना हाथ (ग्रिपर) स्क्रीन का एक बहुत बड़ा हिस्सा घेर लेता है।

यदि आप एक रोबोट को एक विशिष्ट प्रकार के हाथ से प्रशिक्षित करते हैं—मान लीजिए, एक साधारण दो-उंगलियों वाला पिंसर (pincer)—तो वह उस विशिष्ट आकार को पहचानना सीख जाता है। यदि आप फिर उस रोबोट का हाथ बदलकर पूरी तरह से अलग हाथ, जैसे कि पांच उंगलियों वाला मानव जैसा हाथ लगा देते हैं, तो रोबोट भ्रमित हो जाता है। यह ऐसा है जैसे आपने किसी को फोर्ड के स्टीयरिंग व्हील दिखाकर कार चलाना सिखाया हो। यदि अचानक आप उन्हें टेस्ला में रख दें जिसमें अलग स्टीयरिंग व्हील हो, तो वे घबरा सकते हैं क्योंकि उनके दिमाग का "विजुअल मैप" (दृश्य मानचित्र) अब मेल नहीं खाता।

समस्या: "हाथ" का ध्यान भटकाना
रोबोटिक्स की दुनिया में, डेटा इकट्ठा करना महंगा और धीमा है। हमारे पास ऐसे डेटा की विशाल लाइब्रेरी है जो दो-उंगलियों वाले ग्रिपर वाले रोबोटों को कार्य करते हुए दिखाती है। लेकिन रोबोटिक्स का भविष्य जटिल, बहु-उंगली वाले हाथों की ओर बढ़ रहा है। हम अपने पुराने डेटा का उपयोग इन नए हाथों को सिखाने के लिए करना चाहते, लेकिन पुराने रोबोट का हाथ बिल्कुल भी वैसा नहीं दिखता। रोबोट का दिमाग अपने ही हाथ के विशिष्ट आकार पर बहुत अधिक केंद्रित हो जाता है।

समाधान: "Cloak" (क्लोक)
यह शोध पत्र एक चतुर तकनीक पेश करता है जिसे Cloak कहा जाता है। इसे रोबोट की दृष्टि के लिए एक डिजिटल "नेत्र पट्टी" या "मजल" (muzzle) के रूप में समझें।

  1. हाथ को छिपाना: रोबोट को कैमरा फीड में अपना हाथ दिखाने के बजाय, Cloak हाथ को एक मास्क के साथ डिजिटल रूप से ढक देता है। यह ऐसा है जैसे कैमरे के लेंस के उस हिस्से पर टेप लगा दिया जाए जहाँ हाथ दिखाई देता है।
  2. दृश्य को सीखना, हाथ को नहीं: हाथ को छिपाकर, रोबोट को दुनिया के बाकी हिस्से को देखने के लिए मजबूर किया जाता है—जैसे मेज, कप, बाधाएं। वह कार्य के तर्क को सीखता है (उदाहरण के लिए, "आगे बढ़ो जब तक कि मैं कप से न टकरा जाऊं") बिना अपनी उंगलियों के विशिष्ट आकार से विचलित हुए।
  3. "गिरगिट" (Chameleon) प्रशिक्षण: यह सुनिश्चित करने के लिए कि रोबोट केवल एक विशिष्ट आकार के "टेप" को अनदेखा करना न सीख जाए, शोधकर्ता प्रशिक्षण के दौरान "नेत्र पट्टी" के आकार को बेतरतीब ढंग से बदलते रहते हैं। कभी मास्क बड़ा होता है, कभी छोटा, कभी अजीब आकार का। यह रोबोट को सिखाता है कि "मेरा हाथ कल अलग दिख सकता है, इसलिए मुझे उसे देखने पर निर्भर नहीं रहना चाहिए।"

वास्तविक जीवन में यह कैसे काम करता है
जब रोबोट वास्तव में काम कर रहा होता है:

  • आंखें: कैमरा फीड में हाथ मौजूद होता है, लेकिन सॉफ्टवेयर रोबोट के दिमाग के देखने से पहले ही हाथ को एक डिजिटल मास्क से तुरंत ढक देता है।
  • दिमाग: रोब의 दिमाग एक मास्क की गई छवि और "कप उठाओ" जैसा टेक्स्ट कमांड देखता है। वह वातावरण के आधार पर गति का निर्धारण करता है।
  • शरीर: एक बार जब दिमाग तय कर लेता है कि "मेरी उंगलियों को इस स्थान पर ले जाओ," तो एक अनुवादक (जिसे 'टिप-पोज रिटारगेटिंग' कहा जाता है) उस निर्देश को नए हाथ के लिए आवश्यक विशिष्ट मांसपेशियों की गतिविधियों में बदल देता है। यदि नए हाथ में पांच उंगलियां हैं, तो सिस्टम यह पता लगाता है कि दो-उंगलियों वाली योजना से मेल खाने के लिए उन पांच उंगलियों को कैसे हिलाया जाए।

परिणाम
शोधकर्ताओं ने इसका परीक्षण करने के लिए एक साधारण दो-उंगलियों वाले ग्रिपर का उपयोग करके मौजूदा डेटा पर एक रोबोट को प्रशिक्षित किया। फिर, उन्होंने उसी प्रशिक्षित दिमाग को तीन पूरी तरह से अलग रोबोटों पर आजमाया जिन्हें उसने पहले कभी नहीं देखा था:

  1. एक अलग दो-उंगलियों वाला ग्रिपर (अलग रंग और आकार का)।
  2. एक पूरी तरह से अलग रोबोट आर्म।
  3. एक जटिल, पांच उंगलियों वाला मानव जैसा हाथ।

निष्कर्ष:

  • Cloak के बिना: रोबोट नए हाथों पर बुरी तरह विफल रहा। वह भ्रमित था क्योंकि उसका विजुअल "मैप" मेल नहीं खा रहा था।
  • Cloak के साथ: रोबोट ने नए हाथों पर लगभग उतना ही अच्छा प्रदर्शन किया जितना कि मूल वाले पर किया था। उसने शून्य-शॉट (zero-shot) सफलता के साथ अपने कौशल का हस्तांतरण किया (इसका मतलब है कि उसे नए हाथों के लिए किसी नए प्रशिक्षण डेटा की आवश्यकता नहीं थी)।

मुख्य निष्कर्ष
Cloak यह सिद्ध करता है कि आप रोबोट के "दिमाग" (कार्य करने के कौशल) को उसके "शरीर" (विशिष्ट हार्डवेयर) से अलग कर सकते हैं। सीखने के दौरान मस्तिष्क से शरीर को छिपाकर, एक रोबोट पर एकत्र किए गए डेटा का उपयोग भविष्य में पूरी तरह से अलग रोबोटों पर किया जा सकता है। यह एक व्यक्ति को तैरना सिखाने जैसा है, जिसमें उन्हें आंखों पर पट्टी बांधकर सिखाया जाता है ताकि वे अपने अंगों के बजाय पानी की गति पर ध्यान केंद्रित करें; एक बार जब वे पानी की लय सीख जाते हैं, तो वे किसी भी प्रकार के फिन्स या फ्लिपर्स के साथ तैर सकते हैं।

सीमाएं
शोध पत्र में उल्लेख है कि यह उन कार्यों के लिए सबसे अच्छा काम करता है जिन्हें दो बिंदुओं (जैसे दो उंगलियों के पोरों) को किसी वस्तु पर रखने से किया जा सकता है। यह अभी तक जटिल कार्यों को हल नहीं करता है जो हाथ के भीतर सूक्ष्म हेरफेर (जैसे हाथ के अंदर गेंद को उछालना) के लिए आवश्यक होते हैं, क्योंकि वे उंगलियों के विशिष्ट स्पर्श और आकार पर बहुत अधिक निर्भर करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →