← नवीनतम पेपर
💻 computer science

Towards Dexterous Embodied Manipulation via Deep Multi-Sensory Fusion and Sparse Expert Scaling

यह शोध पत्र DeMUSE पेश करता है, जो एक गहरा मल्टीमॉडल फ्रेमवर्क है जो सिमुलेशन और वास्तविक दुनिया दोनों वातावरणों में अत्याधुनिक डेक्सट्रस एम्बोडीड मैनिपुलेशन प्राप्त करने के लिए एडेप्टिव नॉर्मलाइजेशन और स्पार्स एक्सपर्ट स्केलिंग के साथ डिफ्यूजन ट्रांसफॉर्मर के माध्यम से RGB, डेप्थ और 6-एक्सिस फोर्स डेटा को एकीकृत करता है।

मूल लेखक: Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Zhihao xia, Qionglin Ren, Chunxu tian, Zhongxue Ga

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Zhihao xia, Qionglin Ren, Chunxu tian, Zhongxue Ga

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को बहुत ही नाजुक काम करना सिखा रहे हैं, जैसे कि कोला का गिलास बिना गिराए भरना, या डस्टपैन को बिना गिराए बिखरने वाले कचरे को झाड़ू से समेटना।

लंबे समय से, हमने रोबोटों को मुख्य रूप से वीडियो दिखाकर सिखाने की कोशिश की है। हम कहते हैं, "इस तस्वीर को देखो, और जो तुम देख रहे हो वही करो।" यह सरल चीजों के लिए ठीक काम करता है, लेकिन यह एक कार चलाने जैसा है जब आप आंखों पर पट्टी बांधकर केवल रियरव्यू मिरर (पीछे देखने वाले शीशे) में देख रहे हों। आप स्टीयरिंग व्हील का अहसास, सड़क का कंपन और ब्रेक पर दबाव महसूस नहीं कर पाते।

यह पेपर एक नया रोबोटिक मस्तिष्क पेश करता है जिसे DeMUSE कहा जाता है। DeMUSE को केवल आंखों के जोड़े के रूप में नहीं, बल्कि एक सुपर-सेंसरी ब्रेन (अति-संवेदी मस्तिष्क) के रूप में सोचें जो दृष्टि, स्पर्श और "महसूस करने" को एक एकीकृत विचार प्रक्रिया में जोड़ता है।

यह इस प्रकार काम करता है, जिसे सरल उपमाओं के साथ समझाया गया है:

1. समस्या: "अंधा" रोबोट

वर्तमान रोबोट केवल दृष्टि-आधारित शेफ (रसोइयों) की तरह हैं। यदि आप उन्हें अंडा फोड़ने के लिए कहते हैं, तो वे अंडे को देखते हैं। लेकिन यदि वे उसे बहुत ज़ोर से दबाते हैं, तो वे उसे कुचल देते हैं। यदि वे बहुत धीरे दबाते हैं, तो कुछ नहीं होता। वे अंडे के छिलके के टूटने को "महसूस" नहीं कर पाते। उनमें फोर्स फीडबैक (वे कितनी ज़ोर से धक्का दे रहे हैं) और डेप्थ परसेप्शन (चीजें वास्तव में कितनी दूर हैं) की कमी है।

2. समाधान: "सुपर-सेंसरी" मस्तिष्क

DeMUSE इसे हल करता है एक ही समय में तीन प्रकार की जानकारी देकर, जिन्हें एक स्मूदी के अवयवों (ingredients) की तरह आपस में मिला दिया जाता है:

  • RGB (आंखें): जो रोबोट देखता है (रंग, आकार)।
  • डेप्थ (3D विजन): वस्तुएं कितनी दूर हैं (एक 3D मानचित्र की तरह)।
  • 6-एक्सिस फोर्स (स्पर्श): रोबोट कितनी ज़ोर से धक्का दे रहा है या खींच रहा है (आपकी उंगलियों के अहसास की तरह)।

इन सबको अलग-अलग स्ट्रीम (एक आंखों के लिए, एक हाथों के लिए) के रूप में मानने के बजाय, DeMUSE इन सभी को एक ही "चेतना की धारा" (stream of consciousness) में मिला देता है। इससे रोबोट यह समझ पाता है कि एक नरम स्पंज को देखना और उसे दबते हुए महसूस करना एक ही घटना का हिस्सा है।

3. गुप्त सूत्र: "एडाप्टिव नॉर्मलाइजेशन" (वॉल्यूम नॉब)

यहाँ एक कठिन हिस्सा है: कैमरा डेटा बहुत बड़ा होता है (लाखों पिक्सल), लेकिन फोर्स सेंसर का डेटा बहुत छोटा होता (केवल कुछ संख्याएं)। यदि आप उन्हें सीधे मिलाते हैं, तो कैमरा डेटा फोर्स डेटा को दबा देगा, जैसे किसी जेट इंजन के शोर के बीच फुसफुसाहट सुनने की कोशिश करना।

DeMUSE एक चतुर तकनीक AdaMN (Adaptive Modality-specific Normalization) का उपयोग करता है।

  • उपमा: एक कॉन्सर्ट में साउंड मिक्सर की कल्पना करें। कैमरा तेज़ ड्रम है, और फोर्स सेंसर एक शांत वायलिन है। एक सामान्य मिक्सर सब कुछ एक ही वॉल्यूम पर कर देगा, जिससे वायलिन की आवाज़ विकृत हो जाएगी।
  • DeMUSE का मिक्सर: इसमें एक स्मार्ट इंजीनियर है जो संगीत को सुनता है और स्वचालित रूप से प्रत्येक वाद्य यंत्र के लिए वॉल्यूम नॉब को अलग-अलग समायोजित करता है। यह ड्रम की आवाज़ को बस इतना कम कर देता है कि वायलिन भी स्पष्ट रूप से सुनाई दे सके, बिना लय खोए। यह सुनिश्चित करता है कि रोबोट "स्पर्श" पर भी उतना ही ध्यान दे जितना कि वह "दृष्टि" पर देता है।

4. इंजन: "स्पार्स एक्सपर्ट्स" (विशेषज्ञों की टीम)

रोबोट को जटिल कार्यों को संभालने के लिए पर्याप्त स्मार्ट बनाने के लिए, आपको आमतौर पर एक विशाल कंप्यूटर मस्तिष्क की आवश्यकता होती है। लेकिन विशाल मस्तिष्क धीमे होते हैं, और रोबकों को मिलीसेकंड में प्रतिक्रिया देने की आवश्यकता होती है।

DeMUSE एक मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर का उपयोग करता है।

  • उपमा: एक बड़े अस्पताल की कल्पना करें। एक ऐसे डॉक्टर के होने के बजाय जो हर बीमारी के बारे में सब कुछ जानने की कोशिश करता है (जो धीमा और थका देने वाला है), आपके पास विशेषज्ञों की एक टीम है।
    • जब रोबोट एक फिसलन भरी वस्तु देखता है, तो वह "फ्रिक्शन एक्सपर्ट" (घर्षण विशेषज्ञ) को बुलाता है।
    • जब उसे ब्लॉक रखने होते, तो वह "ग्रैविटी एक्सपर्ट" (गुरुत्वाकर्षण विशेषज्ञ) को बुलाता है।
    • जब उसे बटन दबाना होता, तो वह "फोर्स एक्सपर्ट" (बल विशेषज्ञ) को बुलाता है।
  • जादू: केवल आवश्यक विशिष्ट विशेषज्ञ ही काम करने के लिए जागता है। बाकी टीम सोती रहती है। यह रोबोट को अविश्वसनीय रूप से स्मार्ट बनाता है (इसके पास ज्ञान की एक बड़ी "टीम" है) लेकिन अविश्वसनीय रूप से तेज़ भी (यह किसी भी क्षण केवल एक छोटी सी ऊर्जा का उपयोग करता है)।

5. प्रशिक्षण: भविष्य का "सपना देखना"

DeMUSE को डिफ्यूजन (Diffusion) नामक विधि का उपयोग करके प्रशिक्षित किया जाता है।

  • उपमा: कल्पना कीजिए कि रोबोट पेंटिंग करना सीख रहा है। शुरू में, वह स्टैटिक शोर (रैंडम पिक्सल) से ढके हुए कैनवास को देखता है। उसे अनुमान लगाना होता है कि अंतिम चित्र कैसा दिखना चाहिए।
  • DeMUSE केवल चित्र का अनुमान नहीं लगाता; वह भविष्य का अनुमान लगाता है। वह पूछता है, "यदि मैं अपना हाथ इस तरह चलाता हूँ, तो 0.5 सेकंड में दुनिया कैसी दिखेगी?" वह भविष्य के परिणाम और भौतिक गति को एक साथ "सपना" देखने का अभ्यास करता है। यह सुनिश्चित करता है कि जो रोबोट कल्पना करता है कि होगा, वह वास्तव में होने वाली घटना से मेल खाता है।

परिणाम: सिमुलेशन से वास्तविकता तक

शोधकर्ताओं ने कठिन कार्यों पर DeMUSE का परीक्षण किया:

  • कोला का ठीक 1/3 भाग भरना (जिसके लिए सटीक रुकने की आवश्यकता होती है)।
  • कचरे को डस्टपैन में समेटना (जिसके लिए झाड़ू और पैन के बीच समन्वय की आवश्यकता होती है)।
  • दराज में औजारों को व्यवस्थित करना (जिसके लिए दराज के फिसलने को महसूस करने की आवश्यकता होती है)।

परिणाम:

  • कंप्यूटर सिमुलेशन में, यह 83% बार सफल रहा।
  • वास्तविक दुनिया में (असली रोबोट और असली गुरुत्वाकर्षण के साथ), यह 72.5% बार सफल रहा।

यह पिछले रोबोटों की तुलना में एक बड़ी छलांग है, जो अक्सर इन कार्यों में विफल हो जाते थे क्योंकि वे समस्याओं को "महसूस" करने में सक्षम नहीं थे।

सारांश

DeMUSE एक ऐसा रोबोटिक मस्तिष्क है जो अंततः एक साथ देखना, महसूस करना और सोचना सीखता है। स्पर्श और दृष्टि को समान भागीदार मानकर, उन्हें संतुलित करने के लिए स्मार्ट वॉल्यूम नॉब का उपयोग करके, और चीजों को तेज़ रखने के लिए विशेषज्ञों की एक टीम का उपयोग करके, यह उन नाजुक, मानवीय कार्यों को कर सकता है जो पहले मशीनों के लिए असंभव थे। यह एक ऐसे रोबोट के बीच का अंतर है जो केवल कार्य को देखता है और एक ऐसे रोबोट के बीच जो वास्तव में उसे समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →