← नवीनतम पेपर
💻 computer science

TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance

TouchGuide एक नवीन इन्फरेंस-टाइम स्टीयरिंग फ्रेमवर्क है जो लागत प्रभावी TacUMI डेटा संग्रह प्रणाली द्वारा समर्थित, स्पर्श मार्गदर्शन (tactile guidance) के साथ मोटे विजुअल कार्यों को परिष्कृत करने के लिए कंट्रास्टिवली प्रशिक्षित कॉन्टैक्ट फिजिकल मॉडल को एकीकृत करके संपर्क-समृद्ध हेरफेर (contact-rich manipulation) के लिए प्री-ट्रेंड विसुओमोटर नीतियों को बढ़ाता है।

मूल लेखक: Zhemeng Zhang, Jiahua Ma, Xincheng Yang, Xin Wen, Yuzhi Zhang, Boyan Li, Yiran Qin, Jin Liu, Can Zhao, Li Kang, Haoqin Hong, Zhenfei Yin, Philip Torr, Hao Su, Ruimao Zhang, Daolin Ma

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhemeng Zhang, Jiahua Ma, Xincheng Yang, Xin Wen, Yuzhi Zhang, Boyan Li, Yiran Qin, Jin Liu, Can Zhao, Li Kang, Haoqin Hong, Zhenfei Yin, Philip Torr, Hao Su, Ruimao Zhang, Daolin Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को नाजुक कार्य करना सिखा रहे हैं, जैसे जूते का फीता बांधना या एक नाजुक आलू के चिप के टुकड़े को बिना तोड़े हाथ में थमाना। यदि आप रोबोट को केवल "आंखें" (कैमरे) देते हैं, तो वह अक्सर संघर्ष करता है। वह जूते को देख तो सकता है, लेकिन वह यह महसूस नहीं कर पाता कि फीता फिसल रहा है या वह चिप को बहुत जोर से पकड़े हुए है। यह वैसा ही है जैसे मोटे सर्दियों के दस्ताने पहनकर सुई में धागा पिरोने की कोशिश करना; आप छेद को देख सकते हैं, लेकिन आप धागे को महसूस नहीं कर सकते।

यह शोध पत्र TouchGuide पेश करता है, जो रोबोट को अपने पूरे "दिमाग" को शुरू से फिर से प्रशिक्षित किए बिना, वास्तविक समय (real-time) में अपनी गलतियों को सुधारने के लिए अपने "स्पर्श की भावना" का उपयोग करना सिखाने का एक नया तरीका है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "अंधा" रोबोट

वर्तमान रोबोट बड़े परिदृश्य को देखने में बहुत अच्छे हैं (जैसे "जूता उठाना"), लेकिन वे सूक्ष्म, संपर्क-प्रधान विवरणों में खराब हैं (जैसे "क्या फीता पर्याप्त कड़ा है?")। जब वे इन कार्यों को करने की कोशिश करते हैं, तो वे अक्सर विफल हो जाते हैं क्योंकि वे दृष्टि (vision) पर बहुत अधिक निर्भर होते हैं और स्पर्श (feeling) पर कम।

2. समाधान: "टच गाइड" (TouchGuide)

लेखकों ने TouchGuide नामक एक प्रणाली बनाई है। रोबोट के मुख्य मस्तिष्क (पॉलिसी) को एक ड्राइवर के रूप में सोचें जो एक सीधे, खाली सड़क पर गाड़ी चलाने में बहुत अच्छा है (विजुअल कार्य)। हालांकि, जब सड़क ऊबड़-खाबड़ हो जाती है और नाजुक स्टीयरिंग की आवश्यकता होती है (कॉन्टैक्ट टास्क), तो ड्राइवर रास्ता भटक जाता है।

TouchGuide एक को-पायलट की तरह है जो ड्राइवर के बगल में बैठता है।

  • ड्राइवर (बेस पॉलिसी): सबसे पहले, ड्राइवर खिड़की से बाहर देखता है और जो कुछ भी वह देखता है उसके आधार पर कार को किस दिशा में मोड़ना है, इसका एक मोटा अनुमान लगाता है। यह "कोर्स एक्शन" (coarse action) है।
  • को-पायलट (TouchGuide): कार के चलने से पहले, को-पायलट एक विशेष सेंसर (स्पर्श) का उपयोग करके सड़क की स्थिति की जांच करता है। यदि ड्राइवर का अनुमान किसी दुर्घटना या फिसलन का कारण बनेगा, तो को-पायलट पथ को ठीक करने के लिए स्टीयरिंग व्हील को धीरे से मोड़ देता है।
  • परिणाम: कार (रोबोट) उस पथ का अनुसरण करती है जो दिखने में भी अच्छा है और शारीरिक रूप से भी सुरक्षित महसूस होता है।

महत्वपूर्ण बात यह है कि इस को-पायलट को ड्राइवर को शुरू से गाड़ी चलाना सिखाने की आवश्यकता नहीं है। यह केवल अंतिम क्षण में (इन्फरेंस के दौरान) ड्राइवर के मौजूदा निर्णयों को निर्देशित करता है ताकि क्रिया शारीरिक रूप से तर्कसंगत हो।

3. उपकरण: "स्मार्ट हैंड" (TacUMI)

इस को-पायलट को सिखाने के लिए, आपको उच्च गुणवत्ता वाले डेटा की आवश्यकता है। लेखकों ने डेटा संग्रह का एक नया टूल भी बनाया है जिसे TacUMI कहा जाता है।

कल्पना कीजिए कि आप एक रोबोट को उसके आंदोलनों की नकल करके सिखाने की कोशिश कर रहे हैं।

  • पुराना तरीका (टेलीऑपरेशन): इंसान एक वीआर (VR) हेडसेट पहनता है और एक कंट्रोलर पकड़ता है। वे रोबोट का दृश्य देख सकते हैं, लेकिन वे वस्तु को महसूस नहीं कर सकते। यह वैसा ही है जैसे किसी को किसी नाजुक अंडे को पकड़ना सिखाने के लिए किसी और के वीडियो को देखना। आप हिचकिचा सकते हैं या बहुत जोर से दबा सकते हैं क्योंकि आप अंडे को महसूस नहीं कर पा रहे हैं।
  • TacUMI का तरीका: इंसान एक हाथ में पकड़ने वाला उपकरण पकड़ता है जो बिल्कुल रोबोट के ग्रिपर जैसा दिखता है। इसमें कठोर उंगलियां (rigid fingertips) होती हैं जो सीधे इंसान की उंगलियों से जुड़ी होती हैं। जब इंसान वस्तु को छूता है, तो वह इसे तुरंत महसूस करता है, ठीक वैसे ही जैसे अपने हाथ को।
    • उपमा: यह स्क्रीन पर देखते हुए सुई में धागा पिरोने और अपने हाथों से इसे करने के बीच का अंतर है। TacUMI सिस्टम इंसानों को "परफेक्ट" डेटा एकत्र करने की अनुमति देता है क्योंकि वे महसूस कर सकते हैं कि कितनी जोर से दबाना है और कहाँ पकड़ना है।

4. यह सब मिलकर कैसे काम करता है

शोधकर्ताओं ने इसका परीक्षण पांच कठिन कार्यों पर किया:

  1. जूते का फीता बांधना: छोटे छेदों में धागा पिरोना।
  2. चिप हैंडओवर: आलू के चिप को बिना कुचले हाथ में थमाना।
  3. खीरा छीलना: सब्जी को बिना मांस काटे छीलना।
  4. वास वाइपिंग (फूलदान पोंछना): एक घुमावदार फूलदान को बिना गिराए पोंछना।
  5. लॉक खोलना: चाबी को ताले में डालना और घुमाना।

परिणाम:

  • TouchGuide के बिना, रोबोट अक्सर चिप गिरा देते थे, फीता तोड़ देते थे, या चाबी नहीं घुमा पाते थे।
  • TouchGuide के साथ, रोबोट वास्तविक समय में अपनी पकड़ और कोण को समायोजित करने के लिए "को-पायलट" का उपयोग करते हैं।
  • सफलता: रोबोट इन कार्यों में काफी बेहतर हो गए। उदाहरण के लिए, "चिप हैंडओवर" कार्य में, सफलता दर लगभग 25% से बढ़कर 60% हो गई। "लॉक ओपनिंग" में, यह 20% से 30% (और सर्वोत्तम सेटअप के साथ बहुत अधिक) हो गई।

5. "सीक्रेट सॉस": कॉन्टैक्ट फिजिकल मॉडल (CPM)

को-पायलट को कैसे पता चलता है कि कब स्टीयरिंग मोड़ना है? यह एक छोटे मस्तिष्क का उपयोग करता है जिसे कॉन्टैक्ट फिजिकल मॉडल (CPM) कहा जाता है।

  • इस मॉडल को TacUMI द्वारा एकत्र किए गए उच्च गुणवत्ता वाले डेटा पर प्रशिक्षित किया जाता है।
  • यह एक सरल नियम सीखता है: "क्या यह क्रिया शारीरिक रूप से संभव है?"
  • यदि रोबवर चिप को बहुत जोर से पकड़ने की कोशिश करता है, तो CPM कहता है, "नहीं, इससे यह टूट जाएगा," और क्रिया को एक कोमल पकड़ की ओर मोड़ देता है।
  • यह एक रियलिटी चेक की तरह कार्य करता है, यह सुनिश्चित करता है कि रोबोट की योजना भौतिकी के नियमों के अनुरूप हो।

सारांश

यह शोध पत्र दावा करता है कि रोबोट के विजुअल प्लान को वास्तविक समय में ठीक करने के लिए एक "टच गाइड" जोड़ने से, और एक नए हैंडहेल्ड टूल का उपयोग करने से जिससे इंसान वही महसूस कर सके जो रोबोट महसूस करता है, रोबोट अंततः उन नाजुक, संपर्क-प्रधान कार्यों में महारत हासिल कर सकते हैं जो पहले उनके लिए बहुत कठिन थे। उन्हें शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं है; उन्हें बस एक स्पर्श-संवेदी को-पायलट के थोड़े से मार्गदर्शन की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →