← नवीनतम पेपर
💻 computer science

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch एक विजन-लैंग्वेज-एक्शन मॉडल है जो एक टैक्टाइल-पैच एनकोडर और एक हाई-फ्रीक्वेंसी एक्शन मॉड्यूल का उपयोग करके स्पर्श-समृद्ध डेक्सट्रस मैनिपुलेशन (contact-rich dexterous manipulation) को बढ़ाता है ताकि टैक्टाइल अवस्थाओं और क्रियाओं को संयुक्त रूप से प्रेडिक्ट और ऑनलाइन-रिफाइन किया जा सके, जिससे नए पेश किए गए XHT-Dataset पर बेसलाइन्स की तुलना में काफी अधिक सफलता दर प्राप्त होती है।

मूल लेखक: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

प्रकाशित 2026-08-04
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ रोबोट जेन्गा ब्लॉक्स का टॉवर बनाने की कोशिश कर रहे अनाड़ी बच्चों की तरह हैं। उनके पास आँखें (कैमरे) और एक दिमाग (आर्टिफिशियल इंटेलिजेंस) है जो "लाल ब्लॉक उठाओ" जैसे निर्देशों को समझ सकता है। लेकिन यहाँ एक पेंच है: आँखें महसूस नहीं कर सकतीं। यदि कोई ब्लॉक फिसलन भरा है, या यदि रोबोट की पकड़ बहुत मजबूत है और वह ब्लॉक को कुचल देता है, या यदि ब्लॉक फिसलने लगता है, तो रोबोट की आँखें इसे तब तक नहीं देख पाएंगी जब तक कि बहुत देर न हो जाए। यह "डेक्सट्रस मैनिपुलेशन" (dexterous manipulation) में एक बड़ी समस्या है—जो कि रोबोट द्वारा अपने हाथों का उपयोग करके नाजुक, स्पर्श-प्रधान कार्य करने का एक फैंसी शब्द है। वैज्ञानिक रोबोट को स्पर्श की भावना देने की कोशिश कर रहे हैं, लेकिन यह कठिन है। रोबोट के दिमाग में केवल एक "महसूस करने वाला" सेंसर जोड़ना ही पर्याप्त नहीं होता क्योंकि रोबोट को यह अनुमान लगाने की आवश्यकता होती है कि आगे क्या होगा और उसे तुरंत अपनी पकड़ को समायोजित करना होता है, न कि केवल कुछ गिरने के बाद प्रतिक्रिया देना।

यहीं पर एक नया विचार आता है जिसे ReTouch कहा जाता है। इसे ऐसे समझें कि आपने रोबोट को न केवल स्पर्श की भावना दी है, बल्कि एक "छठी इंद्री" दी है जो उसे यह अंदाजा लगाने देती है कि अगले पल में उसकी उंगलियां कैसा महसूस करेंगी, और फिर तुरंत अपने अनुमान को ठीक करती है यदि वास्तविकता उस अनुमान से मेल नहीं खाती। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो स्पर्श को रोबोट के हाथ और उसके दिमाग के बीच एक जीवित, सांस लेते हुए संवाद की तरह मानता है। केवल एक हाथ को वस्तु पकड़े हुए देखने वाली तस्वीर के बजाय, ReTouch प्रत्येक उंगली के स्पर्श को विशिष्ट "पैच" (patches) में तोड़ देता है, जो प्रत्येक उंगली के सिरे पर दबाव का एक हाई-डेफिनिशन मैप है। फिर, यह रोबोट के हिलते समय अपने मैप को लगातार अपडेट करता रहता है, और यदि वस्तु फिसलती है या खिसकती है तो वास्तविक समय में अपने अनुमान को ठीक करता है। परिणाम? एक रोबोट जो जटिल, स्पर्श-प्रधान कार्यों—जैसे पिपेट पर बटन दबाना या व्हाइटबोर्ड पोंछना—को पहले की तुलना में बहुत बेहतर तरीके से कर सकता है, भले ही चीजें गलत हो जाएं।

समस्या: आँखें महसूस नहीं कर सकतीं, और भविष्यवाणियाँ पुरानी हो जाती हैं

रोबोट निर्देशों का पालन करने में बहुत अच्छे होते जा रहे हैं। यदि आप रोबोट को "कप उठाओ" कहते हैं, तो उसका कैमरा कप को देखता है, और उसका दिमाग हाथ को चलाने का तरीका तय करता है। लेकिन एक बार जब रोबोट की उंगलियां वास्तव में कप को छू लेती हैं, तो चीजें जटिल हो जाती हैं। क्या कप फिसलन भरा है? क्या वह फिसल रहा है? क्या रोबोट उसे बहुत जोर से दबा रहा है? कैमरा संपर्क बिंदु पर होने वाली अदृश्य शक्तियों को नहीं देख सकता।

वैज्ञानिकों ने रोबोट को "टैक्टाइल सेंसर" (स्पर्श सेंसर) देकर इसे ठीक करने की कोशिश की है। कुछ रोबोट केवल स्पर्श डेटा को देखते हैं और प्रतिक्रिया देते हैं, जैसे कि एक रिफ्लेक्स। अन्य यह अनुमान लगाने की कोशिश करते हैं कि भविष्य में स्पर्श कैसा होगा। लेकिन इन प्रणालियों के काम करने के तरीके में एक दोष है। कल्पना कीजिए कि आप एक गेंद को पकड़ने की कोशिश कर रहे हैं। आप भविष्यवाणी करते हैं कि एक सेकंड में वह कहाँ होगी। लेकिन अगर हवा बदल जाए या गेंद अजीब तरह से घूमे, तो आपकी भविष्यवाणी गलत हो जाएगी। यदि आप गेंद की ओर पहुँचते समय अपनी भविष्यवाणी को अपडेट नहीं करते हैं, तो आप चूक सकते हैं।

यह पेपर तर्क देता है कि वर्तमान रोबोट प्रणालियों में से कई यही गलती करती हैं। वे एक गति की शुरुआत में यह भविष्यवाणी करते हैं कि उनकी उंगलियां कैसा महसूस करेंगी, और फिर वे उस योजना पर टिके रहते हैं भले ही वस्तु फिसलने लगे। जब तक रोबोट को एहसास होता है कि वस्तु हिल रही है, तब तक बहुत देर हो चुकी होती है। भविष्यवाणी "पुरानी" (stale) हो चुकी होती है।

समाधान: ReTouch और "पैच" प्रणाली

शोधकर्ताओं ने ReTouch नामक एक नया सिस्टम पेश किया है, जो दो मुख्य चीजों को करके इस समस्या को हल करता है: स्पर्श डेटा को बेहतर ढंग से व्यवस्थित करना और अपनी भविष्यवाणियों को लगातार अपडेट करना।

1. टैक्टाइल पैच एनकोडर: एक उंगली का नक्शा
सबसे पहले, ReTouch यह बदल देता है कि रोबोट अपने स्पर्श सेंसर को कैसे "पढ़ता" है। अधिकांश रोबोट केवल सारा स्पर्श डेटा एक बड़े, अस्त-व्यस्त ढेर में डाल देते हैं। ReTouch, हालांकि, प्रत्येक उंगली को एक छोटे मानचित्र की तरह मानता है। यह प्रत्येक उंगली की सतह को पांच विशिष्ट "पैच" में विभाजित करता है (जैसे कि सिरा, केंद्र, आधार, बायां हिस्सा और दायां हिस्सा)।

इसे एक मौसम मानचित्र की तरह समझें। केवल यह कहने के बजाय कि "बारिश हो रही है," एक मौसम मानचित्र आपको सटीक रूप से बताता है कि कहाँ बारिश हो रही है और कितनी तेज है। ReTouch स्पर्श के लिए ऐसा ही करता है। यह रोबोट को बताता है: "तुम्हारी तर्जनी उंगली का सिरा जोर से दब रहा है, लेकिन तुम्हारी मध्य उंगली का किनारा मुश्किल से छू रहा है।" यह रोबोट को सूक्ष्म, सटीक समायोजन करने में मदद करता है, जैसे कि एक इंसान बिना अंगूर को कुचले, एक फिसलन भरे अंगूर पर अपनी पकड़ को एडजस्ट करता है।

2. "फॉरसाइट" (Foresight) और "हाइंडसाइट" (Hindsight) विशेषज्ञ
दूसरा, और सबसे महत्वपूर्ण हिस्सा यह है कि ReTouch भविष्य की भविष्यवाणी कैसे करता है। सिस्टम स्पर्श से सीखने के लिए दो "विशेषज्ञों" (AI मॉडल) का उपयोग करता है:

  • हाइंडसाइट एक्सपर्ट (Hindsight Expert): यह शिक्षक है। प्रशिक्षण के दौरान, यह वास्तविक भविष्य के स्पर्श डेटा (वास्तव में क्या हुआ) को देखता है ताकि यह सीख सके कि रोबोट को क्या भविष्यवाणी करनी चाहिए थी।
  • फॉरसाइट एक्सपर्ट (Foresight Expert): यह छात्र है। यह अभी जो देख रहा है उसके आधार पर भविष्य के स्पर्श की भविष्यवाणी करने की कोशिश करता है।

यहाँ जादू का मंत्र है: फॉरसाइट एक्सपर्ट केवल एक भविष्यवाणी नहीं करता और उस पर टिका नहीं रहता। यह बहुत तेज़ गति (प्रति सेकंड 36 बार) से चलता है। हर बार जब इसे रोबोट की उंगलियों से नया स्पर्श डेटा मिलता है, तो यह कहता है, "रुको, मेरा अनुमान थोड़ा गलत था। मुझे इसे अपडेट करने दो!" फिर यह अपने ताज़ा, अपडेट किए गए अनुमान का उपयोग करके रोबोट के अगले कदम को ठीक करता है।

यह एक वीडियो गेम खेलने जैसा है जहाँ आप गेम को पॉज़ कर सकते हैं, दुश्मन की नई स्थिति देख सकते हैं, और तुरंत अपनी रणनीति बदल सकते हैं। यदि वस्तु फिसलती है, तो रोबोट अगले "टर्न" का इंतजार नहीं करता; यह तुरंत अपनी पकड़ को पुनर्गणना करता है और वस्तु को बचा लेता है।

उन्होंने क्या पाया: रोबोट जो चीजें नहीं गिराते

इसका परीक्षण करने के लिए, शोधकर्ताओं ने एक वास्तविक रोबोट हाथ (जिसे XHand कहा जाता है) बनाया जो एक रोबोट आर्म (UR7e) से जुड़ा था और एक नया डेटासेट XHT-Dataset बनाया। उन्होंने सात अलग-अलग कठिन कार्यों को करने के लिए रोबोट के 900 वास्तविक प्रदर्शन रिकॉर्ड किए, जैसे कि:

  • पिपेट पर बटन दबाना।
  • अलग-अलग वजन की पानी की बोतलें पकड़ना।
  • स्पंज के साथ व्हाइटबोर्ड पोंछना।
  • बीकर निकालने के लिए कैबिनेट का दराज खोलना।

उन्होंने ReTouch की तुलना अन्य स्मार्ट रोबोट सिस्टम से की। परिणाम प्रभावशाली थे। सामान्य परिस्थितियों में, ReTouch अगले सबसे अच्छे रोबलेट की तुलना में 18.4% अधिक बार सफल रहा। "चुनौतीपूर्ण" परिस्थितियों में (जहाँ रोबोट को फिसलन भरी वस्तुओं, अलग-अलग ऊंचाइयों, या किसी के द्वारा वस्तु को खींचने जैसी स्थितियों से निपटना था), ReTouch 23.8% अधिक बार सफल रहा।

उदाहरण के लिए, "लिक्विड ट्रांसफर" कार्य में (एक कंटेनर से दूसरे में पानी ले जाना), Re-Touch सबसे अच्छे प्रतियोगी से 19% बेहतर था। "स्पंज वाइप" में, यह 25% बेहतर था। पेपर सुझाव देता है कि ये बड़े सुधार इसलिए होते हैं क्योंकि ReTouch "कॉन्टैक्ट-रिच" (contact-rich) कार्यों को संभाल सकता है—ऐसे कार्य जहाँ रोबोट लगातार वस्तु को छूता है, फिसलता है और उसके अनुसार खुद को ढालता है।

यह क्यों मायने रखता है

यह पेपर दिखाता है कि रोबोट को स्पर्श की भावना देना केवल सेंसर जोड़ने के बारे में नहीं है; यह इस बारे में है कि रोबोट उस जानकारी का उपयोग कैसे करता है। यदि रोबोट केवल स्पर्श पर प्रतिक्रिया देता है, तो वह बहुत धीमा है। यदि वह भविष्य की भविष्यवाणी करता है लेकिन अपनी भविष्यवाणी को अपडेट नहीं करता है, तो वह भ्रमित हो जाता है। ReTouch साबित करता है कि नाजुक, स्पर्श-प्रधान कार्यों को संभालने का सबसे अच्छा तरीका है—भविष्यवाणी करना और उसे ठीक करना, और यह सब एक साथ करना।

शोधकर्ताओं ने पाया कि यह "ऑनलाइन रिफाइनमेंट" (चलते समय भविष्यवाणी को अपडेट करना) ही कुंजी है। जब उन्होंने रोबोट के एक संस्करण का परीक्षण किया जिसने एक भविष्यवाणी की और उसे अपडेट नहीं किया, तो सफलता दर काफी कम हो गई। यह सुझाव देता है कि रोबोटों को सर्जरी, खाना पकाने या इलेक्ट्रॉनिक्स को जोड़ने जैसे कार्यों में महारत हासिल करने के लिए, उन्हें "भविष्य को महसूस करने" और वास्तविकता बदलने पर तुरंत अपना निर्णय बदलने में सक्षम होना चाहिए। ReTouch उन्हें उस तरह की निपुणता (dexterity) देने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →