← नवीनतम पेपर
🤖 AI

UMI-Underwater: Learning Underwater Manipulation without Underwater Teleoperation

UMI-अंडरवॉटर सिस्टम एक स्व-पर्यवेक्षित (self-supervised) डेटा संग्रह पाइपलाइन को डेप्थ-आधारित अफोर्डेंस (affordance) प्रतिनिधित्व के साथ जोड़कर मजबूत अंडरवॉटर रोबोटिक ग्रैस्पिंग को सक्षम बनाता है, जो ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त करने के लिए ऑन-लैंड प्रदर्शनों से ज्ञान को अंडरवॉटर डोमेन में स्थानांतरित करता है और RGB-ओनली बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Hao Li, Long Yin Chung, Jack Goler, Ryan Zhang, Xiaochi Xie, Huy Ha, Shuran Song, Mark Cutkosky

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Li, Long Yin Chung, Jack Goler, Ryan Zhang, Xiaochi Xie, Huy Ha, Shuran Song, Mark Cutkosky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को गहरे, धुंधले समुद्र के तल से एक विशिष्ट शंख (seashell) उठाने के लिए सिखाने की कोशिश कर रहे हैं। अब, कल्पना कीजिए कि आप खुद पानी के नीचे जाकर रोबोट को यह नहीं दिखा सकते क्योंकि यह बहुत महंगा, खतरनाक या इस वातावरण में रोबोट को रिमोटली कंट्रोल करना बहुत कठिन है।

यही वह समस्या है जिसे UMI-Underwater टीम ने हल किया है। उन्होंने एक ऐसा सिस्टम बनाया है जो रोबटेज को बिना किसी इंसान के पानी के नीचे उसे चलाने (steer करने) और बिना हजारों अंडरवॉटर वीडियो दिखाए, पानी के नीचे चीजें पकड़ना सीखने देता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "स्व-शिक्षित" रोबोट (द ऑटोनॉमस कलेक्टर)

आमतौर पर, रोबोट को सिखाने के लिए इंसानों को एक कंट्रोलर पकड़ना पड़ता है और रोबोटिक हाथ को हजारों बार मैन्युअल रूप से गाइड करना पड़ता है ताकि उसे दिखाया जा सके कि "सफलता" कैसी दिखती है। पानी के नीचे, यह एक बुरा सपना है।

समाधान: टीम ने रोबोट को "कोशिश करो और सीखो" वाली मानसिकता दी।

  • उपमा (Analogy): एक छोटे बच्चे की कल्पना करें जो खिलौना उठाना सीख रहा है। उसे कोई लेक्चर नहीं मिलता; वह बस हाथ बढ़ाता है, शायद चूक जाता है, गलत चीज़ पकड़ लेता है, उसे गिरा देता है, और फिर से कोशिश करता है। अंततः, वह इसे सही ढंग से कर लेता है।
  • यह कैसे काम करता है: रोबोट नीचे गोता लगाता है, एक रैंडम वस्तु चुनता है, और नियमों के एक साधारण सेट का उपयोग करके उसे पकड़ने की कोशिश करता है (जैसे कि "आगे बढ़ें जब तक कि यह बड़ा न दिखने लगे")। यदि वह इसे पकड़ लेता है और रोबोट द्वारा पीछे खींचने पर वस्तु फिसलती नहीं है, तो कंप्यूटर कहता है, "अच्छा काम किया!" और उस पल को एक सबक के रूप में सहेज लेता है। यदि वह विफल हो जाता है, तो रोबोट बस पीछे हट जाता है और फिर से कोशिश करता है।
  • परिणाम: रोबोट ने बिना किसी मानवीय मदद के अपने आप सैकड़ों सफल "ग्रैस्पिंग" (पकड़ने के) वीडियो एकत्र किए।

2. "ज़मीन-से-समुद्र" अनुवादक (द अफोर्डेंस मैप)

रोबोट के अपने स्व-संग्रहित वीडियो के साथ भी, एक बड़ी समस्या है: पानी के नीचे का माहौल अजीब होता है। रोशनी नीली होती है, चीजें धुंधली दिखती हैं, और रंग विकृत हो जाते हैं। ज़मीन पर धूप वाले साफ़ वीडियो पर प्रशिक्षित रोबोट पानी के नीचे पूरी तरह से भ्रमित हो जाएगा।

समाधान: उन्होंने एक "यूनिवर्सल ट्रांसलेटर" बनाया जिसे अफोर्डेंस हीटमैप (Affordance Heatmap) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप भीड़ भरे कमरे में एक विशिष्ट व्यक्ति को खोजने की कोशिश कर रहे हैं। यदि आप उनके चेहरे को देखते हैं (जो अंधेरे में अलग दिख सकता है), तो यह कठिन है। लेकिन यदि आपके पास उनके सीने पर एक चमकता हुआ लाल बिंदु है जो कहता है "यहाँ पकड़ें" (GRAB HERE), तो आपको इससे फर्क नहीं पड़ता कि लाइटिंग कैसी है। आप बस उस बिंदु का अनुसरण करते हैं।
  • यह कैसे काम करता है:
    1. लैंड ट्रेनिंग: टीम ने एक पार्क (ज़मीन पर) में एक कैमरा वाले हैंडहेल्ड ग्रिपर का उपयोग करके विभिन्न वस्तुओं (पत्थर, बत्तख, कैन) को पकड़ा। इसके लिए उन्हें रोबोट की आवश्यकता नहीं थी; एक इंसान ने बस ग्रिपर पकड़ा था।
    2. जादुई ट्रिक: रोबोट को वस्तु के रंग या आकार को पहचानने के लिए सिखाने के बजाय, उन्होंने उसे डेप्थ (गहराई/दूरी) के आधार पर यह पहचानने के लिए सिखाया कि कहाँ पकड़ना है।
    3. ट्रांसफर: वे ज़मीन से यह "यहाँ पकड़ें" वाला ज्ञान लेकर आए और इसे पानी के नीचे लागू किया। क्योंकि गहराई (depth) ज़मीन और पानी के बीच बहुत अधिक नहीं बदलती (एक पत्थर अभी भी एक निश्चित दूरी पर है), रोबोट अंडरवॉटर सीन को देख सकता है, "डेप्थ मैप" देख सकता है, और तुरंत समझ जाता है, "आह, लाल बिंदु उस पत्थर पर है, मुझे वहां पकड़ना चाहिए।"

3. "दिमाग" (द डिफ्यूजन पॉलिसी)

एक बार जब रोबोट को पता चल जाता है कि कहाँ पकड़ना है (डेप्थ मैप की मदद से), तो उसे वहां तक पहुँचने के लिए अपने हाथ को कैसे हिलाना है, यह जानने की आवश्यकता होती है।

समाधान: उन्होंने एक "डिफ्यूजन पॉलिसी" का उपयोग किया।

  • उपमा: इसे एक ऐसे GPS की तरह समझें जो केवल गंतव्य नहीं देता, बल्कि पूरी यात्रा का सिमुलेशन (simulation) भी करता है। यह "पकड़ें यहाँ" वाले मैप और रोबोट की वर्तमान स्थिति को लेता है, और अपने दिमाग में एक सिमुलेशन चलाता है: "यदि मैं बाएँ, फिर नीचे, फिर ग्रिपर बंद करता हूँ, तो मैं सफल हो जाऊँगा।" यह लक्ष्य तक पहुँचने के लिए एक सुचारू, पूर्ण पथ (path) बनाता है।
  • यह क्यों विशेष है: यह "दिमाग" रोबोट के अपने स्व-संग्रहित अंडरवॉटर वीडियो पर प्रशिक्षित किया गया था, इसलिए वह जानता है कि पानी के प्रतिरोध (resistance) में बिल्कुल कैसे हिलना है।

यह एक बड़ी बात क्यों है

  • "ह्यूमन-इन-द-लूप" की ज़रूरत नहीं: आपको रोबोट को सिखाने के लिए गोताखोर या पायलट की घंटों पानी के नीचे बिताने की आवश्यकता नहीं है। रोबोट खुद को सिखाता है।
  • ज़ीरो-शॉट ट्रांसफर (Zero-Shot Transfer): आप रोबोट को ज़मीन पर प्रशिक्षित कर सकते हैं (जहाँ यह सस्ता और आसान है) और यह बिना किसी अंडरवॉटर डेटा के पुन: प्रशिक्षण (re-training) के तुरंत पानी के नीचे पूरी तरह से काम करता है।
  • मजबूती (Robustness): यदि आप बैकग्राउंड बदलते हैं (जैसे पूल की दीवार पर नया वॉलपेपर लगाना), तो एक सामान्य रोबोट भ्रमित हो जाएगा। यह रोबोट बैकग्राउंड के रंगों को अनदेखा करता है और "डेप्थ मैप" पर ध्यान केंद्रित करता है, इसलिए दृश्य बदलने पर भी यह काम करता रहता है।

निचोड़ (The Bottom Line)

टीम ने एक ऐसा सिस्टम बनाया है जहाँ एक रोबोट अपने आप तैरना और पकड़ना सीखता है, और ज़मीन के आधार पर बने "चीट शीट" (डेप्थ मैप) का उपयोग करता है ताकि यह समझ सके कि क्या पकड़ना है, भले ही पानी के नीचे की दुनिया ज़मीन की दुनिया से बिल्कुल अलग दिखे। यह एक मछली को किताब में मक्खी की तस्वीर दिखाकर उसे पकड़ना सिखाने जैसा है, और फिर उसे पानी में बाकी सब खुद समझने देने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →