← नवीनतम पेपर
🤖 AI

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

यह शोध पत्र DECO को प्रस्तुत करता है, जो एक प्लगइन टैक्टाइल एडैप्टर और साथ में दिए गए DECO-50 डेटासेट के साथ एक डिकपल्ड मल्टीमॉडल डिफ्यूजन ट्रांसफार्मर है, जो 2,000 से अधिक वास्तविक दुनिया के रोबोट मूल्यांकन के माध्यम से विजन, प्रोप्रियोसेप्शन और टैक्टाइल संकेतों को प्रभावी ढंग से एकीकृत करके द्विपक्षीय डेक्सट्रस मैनिपुलेशन (bimanual dexterous manipulation) में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक बहुत छोटे प्लग को सॉकेट में डालना या कन्वेयर बेल्ट पर चलती हुई वस्तुओं को छाँटना। आप सोच सकते हैं, "बस इसे अच्छी आँखें (कैमरे) और एक दिमाग (AI) दे दो, और यह इसे समझ जाएगा।"

लेकिन यहाँ एक समस्या है: आँखें झूठ बोल सकती हैं।

यदि एक रोबोट जार पर ढक्कन कसने की कोशिश कर रहा है, तो उसका कैमरा देख सकता है कि ढक्कक जार के "करीब" है। लेकिन क्या वह वास्तव में छू रहा है? क्या वह टाइट है? क्या वह फिसल रहा है? कैमरा दबाव को महसूस नहीं कर सकता। यह अपने जूतों के फीते बाँधने जैसा है जब आपने मोटे सर्दियों वाले दस्ताने पहने हों; आप फीतों को देख तो सकते हैं, लेकिन आप यह महसूस नहीं कर सकते कि वे कितने कसे हुए हैं।

यहीं पर DECO पेपर काम आता है। यह एक नया तरीका है जिससे रोबोट को उनकी "आँखों" (कैमरे) के साथ-साथ अपने "हाथों" (स्पर्श सेंसर/टैक्टाइल सेंसर्स) का उपयोग करना सिखाया जाता है।

यहाँ बताया गया है कि उन्होंने क्या किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "स्विस आर्मी नाइफ" बनाम "विशेषज्ञ टीम"

पिछले रोबोट दिमाग सभी इंद्रियों (दृष्टि, शरीर की स्थिति और स्पर्श) को एक बड़े, अव्यवस्थित स्मूदी (smoothie) में मिलाने की कोशिश करते थे। वे कैमरा डेटा, स्पर्श डेटा और हाथ की स्थिति के डेटा को एक ही ब्लेंडर में डाल देते थे।

  • समस्या: कभी-कभी रोबोट भ्रमित हो जाता है। कैमरा बहुत अधिक विवरण देखता है, लेकिन स्पर्श सेंसर केवल कुछ चीज़ों को छूने पर एक छोटा सा "पिंग" भेजता है। उन्हें समान रूप से मिलाना एक रॉक कॉन्सर्ट और एक फुसफुसाहट को एक साथ सुनने जैसा है; तेज़ शोर महत्वपूर्ण फुसफुसाहट को दबा देता है।

2. समाधान: DECO (एक "डिकपल्ड" यानी अलग किया हुआ दिमाग)

शोधकर्ताओं ने एक नया रोबोट दिमाग बनाया जिसे DECO कहा जाता है। DECO को एक ब्लेंडर के रूप में नहीं, बल्कि एक अत्यधिक संगठित ऑर्केस्ट्रा कंडक्टर के रूप में सोचें।

  • विज़न (आँखें): कैमरा डेटा मुख्य सोलोइस्ट (soloist) है। यह बहुत ध्यान आकर्षित करता है और सामान्य गति का मार्गदर्शन करता है।
  • प्रोप्रियोसेप्शन (शरीर की संवेदना): यह रोबोट को यह जानने में मदद करता है कि उसकी भुजाएँ कहाँ हैं, बिना देखे। यह यह जानने जैसा है कि आँखें बंद होने पर भी आपका हाथ ऊपर है।
  • टच (उंगलियों के पोर): यह नया सितारा है। DECO में, स्पर्श डेटा को केवल डाला नहीं जाता; इसके पास अपना एक विशेष माइक्रोफ़ोन है।

जादुई ट्रिक: DECO कैमरे और एक्शन प्लान को सीधे एक-दूसरे से बात करने देता है (जैसे दो दोस्त आपस में चैट कर रहे हों)। लेकिन जब रोबोट को स्पर्श के बारे में जानने की आवश्यकता होती है, तो यह प्रवाह को बाधित किए बिना उस अहसास को डालने के लिए एक विशेष "प्लगइन" का उपयोग करता है।

3. "प्लगइन टैक्टाइल एडेप्टर" (द USB ड्राइव)

यह इस पेपर का सबसे शानदार हिस्सा है। आमतौर पर, यदि आप एक पुराने रोबोट को महसूस करना सिखाना चाहते हैं, तो आपको उसका पूरा दिमाग फिर से बनाना पड़ता है। इसमें सालों और लाखों डॉलर लगते हैं।

DECO एक प्लगइन एडेप्टर का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, महंगा लैपटॉप (पहले से प्रशिक्षित रोबोट) है जो देखने और चलने-फिरने में माहिर है। आप चाहते हैं कि वह बनावट (textures) को भी महसूस कर सके। नए लैपटॉप को खरीदने के बजाय, आप बस एक USB ड्राइव (एडेप्टर) प्लग इन करते हैं।
  • यह USB ड्राइव छोटी और सस्ती है। यह लैपटॉप को स्पर्श संकेतों की व्याख्या करना सिखाती है। लैपटॉप को फिर से प्रोग्राम करने की आवश्यकता नहीं है; यह बस उस नए USB ड्राइव को सुनने के लिए सीख जाता है जब उसे प्लग किया जाता है।
  • परिणाम: वे केवल 10% सामान्य कंप्यूटिंग शक्ति और प्रशिक्षण समय के साथ रोबोट की महसूस करने की क्षमता को अपग्रेड करने में सफल रहे।

4. नया डेटासेट: DECO-50 (ट्रेनिंग कैंप)

आप रोबोट को बिना कुछ महसूस कराए महसूस करना नहीं सिखा सकते। टीम ने DECO-50 नामक एक विशाल नया डेटासेट बनाया।

  • उन्होंने दो हाथों और संवेदनशील उंगलियों वाले एक वास्तविक रोबोट का उपयोग किया।
  • उन्होंने एक मानव ऑपरेटर (जैसे वीडियो गेम खिलाड़ी) को टेलीऑपरेशन के माध्यम से 4 प्रकार के कार्य करने के लिए रोबोट को नियंत्रित करने दिया:
    1. पिक एंड प्लेस (Pick and Place): एक प्लेट को उठाना और उस पर फल रखना (आसान, आँखें पर्याप्त हैं)।
    2. सॉर्टिंग (Sorting): बेल्ट पर चलती वस्तुओं को पकड़ना (मध्यम, गति की आवश्यकता है)।
    3. कचरा निपटान (Trash Disposal): एक बिन खोलना, कचरा फेंकना और ढक्कन बंद करना (कठिन, ढक्कन के 'क्लिक' को महसूस करने की आवश्यकता है)।
    4. असेंबली (Assembly): एक प्लग को सॉकेट में डालना (बहुत कठिन, घर्षण और संरेखण को महसूस करने की आवश्यकता है)।

5. परिणाम: स्पर्श कब मायने रखता है?

प्रयोगों ने कुछ बहुत दिलचस्प दिखाया:

  • सरल कार्यों के लिए (जैसे स्थिर सेब को उठाना), रोबोट केवल अपनी आँखों के साथ ठीक से काम कर रहा था। स्पर्श आवश्यक नहीं था।
  • "कॉन्टैक्ट-रिच" कार्यों के लिए (जैसे ढक्कन कसना या प्लग जोड़ना), रोबोट बिना स्पर्श के विफल हो गया। वह ढक्कन को बंद करने की कोशिश करता, सोचता कि काम हो गया, और पीछे हट जाता, तभी ढक्कन गिर जाता।
  • DECO प्लगइन के साथ: रोबोट अचानक एक उस्ताद बन गया। वह ढक्कन के "क्लिक" या प्लग के "फिसलने" को महसूस कर सकता था।
    • सफलता दर: इस छोटे से "टच प्लगइन" को जोड़ने से रोबोट की सफलता दर कुल मिलाकर 21% बढ़ गई, और सबसे कठिन कार्यों पर 20% बढ़ गई।

मुख्य निष्कर्ष

यह पेपर हमें सिखाता है कि रोबोट को स्मार्ट होने के लिए "सर्व-द्रष्टा" (all-seeing) होने की आवश्यकता नहीं है। उन्हें यह जानने की आवश्यकता है कि अपनी आँखों का उपयोग कब करना है और अपनी उंगलियों का उपयोग कब करना है।

इन इंद्रियों को अलग करके (Decoupled) और मौजूदा रोबोट दिमागों में आसानी से "महसूस करने की क्षमता" जोड़ने (Plugin Adapter) के माध्यम से, हम ऐसे रोबोट बना सकते हैं जो न केवल तेज़ हैं, बल्कि बहुत अधिक सावधान और सटीक भी हैं—ठीक एक मानव सर्जन या एक कुशल शिल्पकार की तरह।

संक्षेप में: DECO वह रोबोट है जिसने अंततः कठिन चीजों के लिए अपने "रास्ते को महसूस करना" सीख लिया है, और इसके लिए उसे पूरे ब्रेन ट्रांसप्लांट की आवश्यकता नहीं पड़ी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →