← नवीनतम पेपर
💻 computer science

Vi-TacMan: Articulated Object Manipulation via Vision and Touch

Vi-TacMan एक नवीन फ्रेमवर्क है जो ग्रैस्प इनिशियलाइजेशन के लिए मोटे विजुअल गाइडेंस और वास्तविक समय के कॉन्टैक्ट रेगुलेशन के लिए सटीक टैक्टाइल फीडबैक को सिनर्जिस्टिक रूप से संयोजित करके विविध आर्टिकुलेटेड ऑब्जेक्ट्स के सुदृढ़, मॉडल-मुक्त हेरफेर (manipulation) को प्राप्त करता है, जो सिम्युलेटेड और वास्तविक दुनिया के वातावरण में महत्वपूर्ण सामान्यीकरण प्रदर्शित करता है।

मूल लेखक: Leiyao Cui, Zihang Zhao, Sirui Xie, Wenhuan Zhang, Zhi Han, Yixin Zhu

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leiyao Cui, Zihang Zhao, Sirui Xie, Wenhuan Zhang, Zhi Han, Yixin Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने किसी दोस्त के घर में एक अजीब, अनजाने कैबिनेट को खोलने की कोशिश कर रहे हैं। आपने पहले कभी इस कैबिनेट को नहीं देखा है। आपको नहीं पता कि हैंडल बाईं ओर है या दाईं ओर, या दरवाजा बाहर की ओर खुलता है या बगल में स्लाइड होता है, या वह फंसा हुआ है।

यदि आप केवल अपनी आँखों (दृष्टि) पर भरोसा करते हैं, तो आप अनुमान लगा सकते हैं कि हैंडल बाईं ओर है और उसे खींचने की कोशिश कर सकते हैं। लेकिन यदि आप गलत हुए, तो आप दरवाजे को गलत दिशा में खींच सकते हैं, हैंडल तोड़ सकते हैं, या बस उसे खोलने में विफल हो सकते हैं। आपका मस्तिष्क एक जटिल गणितीय समस्या को हल करने की कोशिश कर रहा है ("हिंज/कब्जा कहाँ है?") जिसके पास पर्याप्त डेटा नहीं है।

यदि आप केवल अपने हाथों (स्पर्श) पर भरोसा करते हैं, तो आप अंधेरे में हाथ मारकर हैंडल खोजने की कोशिश कर सकते हैं। लेकिन यदि आप गलत हिस्से को पकड़ लेते हैं या गलत दिशा में धक्का देते हैं, तो आप बिना किसी शुरुआती बिंदु के, वस्तु को कैसे हिलाया जाए यह समझने में असमर्थ रहेंगे।

Vi-TacMan एक रोबोट सिस्टम है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यह एक रोबोट को उसकी आँखों से एक "स्मार्ट अनुमान" देने और फिर उसके "संवेदनशील उंगलियों" को बारीकियों को ठीक करने देने जैसा है।

यह कैसे काम करता है, इसका विवरण यहाँ दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. दो चरणों वाला नृत्य: पहले आँखें, फिर हाथ

यह सिस्टम दो अलग-अलग चरणों में काम करता है, जैसे कि एक नृत्य:

  • चरण 1: "बड़ी तस्वीर" का अनुमान (दृष्टि)
    रोबोट अपने कैमरे के साथ वस्तु को देखता है। वह "ठीक से हिंज कहाँ है?" जैसे असंभव गणित को हल करने की कोशिश नहीं करता। इसके बजाय, वह केवल दो सरल प्रश्नों के उत्तर देता है:

    • "वह कौन सा हिस्सा है जिसे मैं पकड़ सकता हूँ?" (हैंडल)।
    • "यह किस दिशा में हिल सकता है?" (शायद यह बाहर की ओर खुलता है, या शायद यह ऊपर की ओर स्लाइड होता है)।
    • उपमा: इसे एक बंद दरवाजे को देखने और यह अनुमान लगाने जैसा समझें कि, "ठीक है, मैं हैंडल को पकड़ूँगा और इसे घड़ी की दिशा में घुमाने की कोशिश करूँगा।" यह एक मोटा अनुमान है, लेकिन यह एक अच्छी शुरुआत है।
  • चरण 2: "बारीकी से सुधार करना" (स्पर्श)
    एक बार जब रोबोट अपने अनुमान के आधार पर हैंडल को पकड़ लेता है, तो वह अपनी "अति-संवेदनशील उंगलियों" (एक टैक्टाइल सेंसर) का उपयोग करना शुरू कर देता है। वह केवल पकड़ता ही नहीं है; वह दबाव और गति को महसूस करता है।

    • यदि रोबलेट खींचने की कोशिश करता है और प्रतिरोध महसूस करता है, तो उसे पता चल जाता है, "आह, मैं गलत दिशा में खींच रहा हूँ।" वह तुरंत खुद को समायोजित करता है।
    • यदि उसे महसूस होता है कि दरवाजा फिसलना शुरू हो गया है, तो उसे पता चल जाता है, "ठीक है, इसे खिसकाना जारी रखें।"
    • उपमा: यह एक आँखों पर पट्टी बंधे दोस्त की तरह है जो, एक बार जब वह दरवाजे को छू लेता है, तो वह बिल्कुल महसूस कर सकता है कि हिंज कैसे काम करते हैं और दरवाजे को सुचारू रूप से खोलने के लिए मार्गदर्शन कर सकता है, जिससे "दृष्टि" द्वारा किए गए अनुमान की गलतियों को सुधारा जा सके।

2. गुप्त सूत्र: "सरफेस नॉर्मल्स" और "डायरेक्शन क्लाउड्स"

पेपर में कुछ फैंसी गणितीय शब्द बताए गए हैं, लेकिन वे वास्तव में क्या करते हैं, यहाँ देखें:

  • सरफेस नॉर्मल्स (सतह की बनावट का संकेत):
    रोबोट वस्तु की सतह के सूक्ष्म कोणों को देखता है। यदि एक दरवाजे का हैंडल घुमावदार है, तो सतह के कोण रोबोट को बताते हैं, "हे, यह इस दिशा में मुड़ता है, इसलिए गति संभवतः उस दिशा में होगी।"

    • उपमा: यह लकड़ी के रेशों (grain) को महसूस करने जैसा है। यदि आप रेशों के साथ अपना हाथ चलाते हैं, तो आप जानते हैं कि लकड़ी किस दिशा में लचीली है। रोबोट केवल आकार को देखने के बजाय एक स्मार्ट अनुमान लगाने के लिए इस "रेशे" का उपयोग करता है।
  • "डायरेक्शन क्लाउड" (vMF डिस्ट्रीब्यूशन):
    कभी-कभी, रोबोट सुनिश्चित नहीं होता कि वस्तु किस दिशा में चलती है। शायद यह ऊपर या नीचे स्लाइड हो सकती है। एक रैंडम अनुमान लगाने और उम्मीद करने के बजाय, रोबोट संभावनाओं का एक "बादल" (cloud of possibilities) बनाता है।

    • उपमा: कल्पना कीजिए कि आप मौसम का अनुमान लगा रहे हैं। "बारिश होगी" कहने के बजाय, आप कहते हैं, "70% बारिश होने की संभावना है, 20% धूप की और 10% बर्फबारी की।" रोबोट अपने दिमाग में ऐसे ही अनुमानों का एक "बादल" रखता है। जब वह वस्तु को छूता है, तो वह जाँचता है कि बादल का कौन सा हिस्सा महसूस की गई भावना से मेल खाता है, जिससे वह घबराहट के बिना अनिश्चितता को संभाल पाता है।

3. यह क्यों महत्वपूर्ण है

आज के अधिकांश रोबोट उन छात्रों की तरह हैं जिन्होंने एक विशिष्ट परीक्षा के उत्तर रट लिए हैं। यदि आप उन्हें एक नए प्रकार का कैबिनेट देते हैं जिसे उन्होंने पहले नहीं देखा है, तो वे जम जाते हैं।

Vi-TacMan अलग है। इसे हर कैबिनेट को रटने की आवश्यकता नहीं है।

  • यह एक मोटा विचार ( "कोर्स गाइडेंस") प्राप्त करने के लिए अपनी आँखों का उपयोग करता है।
  • यह वास्तविक समय में विशिष्ट यांत्रिकी को सीखने के लिए अपने हाथों का उपयोग करता है ("प्रिसाइज एग्जीक्यूशन")।

परिणाम? रोबोट एक अस्त-व्यस्त, अपरिचित घर में जा सकता है और एक अजीब ओवन, एक स्लाइडिंग पेंट्री डोर, या एक जटिल दराज को सफलतापूर्वक खोल सकता है, भले ही उसने पहले कभी उस विशिष्ट वस्तु को न देखा हो। वह सफल होता है क्योंकि वह अपने "अनुमानों" को सुधारने के लिए अपने "एहसासों" पर भरोसा करता है।

सारांश

Vi-TacMan एक ऐसा रोबोट है जो कहता है: "मैं हैंडल खोजने और यह अनुमान लगाने के लिए अपनी आँखों का उपयोग करूँगा कि मुझे किस दिशा में धक्का देना है। फिर, मैं अपनी संवेदनशील उंगलियों का उपयोग यह महसूस करने के लिए करूँगा कि क्या मैं सही हूँ, और यदि मैं गलत हूँ, तो मैं तब तक खुद को तुरंत समायोजित करूँगा जब तक कि वह खुल न जाए।"

यह "किसी मशीन के काम करने के तरीके को समझने" की कठिन समस्या को दृष्टि और स्पर्श के बीच एक सरल बातचीत में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →