← नवीनतम पेपर
💻 computer science

ViTac-Tracing: Visual-Tactile Imitation Learning of Deformable Object Tracing

यह शोधपत्र ViTac-Tracing का प्रस्ताव करता है, जो एक एकीकृत विजुअल-टैक्टाइल इमिटेशन लर्निंग फ्रेमवर्क है जो विविध देखे गए और अनदेखे ऑब्जेक्ट्स के माध्यम से सुदृढ़ 1D और 2D डिफॉर्मेबल ऑब्जेक्ट ट्रेसिंग प्राप्त करने के लिए कम लागत वाली टेलीऑपरेशन प्रणाली के साथ भारित स्थानीय और वैश्विक कार्य हानियों (task losses) को एकीकृत करता है।

मूल लेखक: Yongqiang Zhao, Haining Luo, Yupeng Wang, Emmanouil Spyrakos Papastavridis, Yiannis Demiris, Shan Luo

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yongqiang Zhao, Haining Luo, Yupeng Wang, Emmanouil Spyrakos Papastavridis, Yiannis Demiris, Shan Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ऊन का एक उलझा हुआ गोला है या एक मुड़ा हुआ रुमाल है। इसे ठीक करने के लिए, आप इसे सिर्फ पकड़कर हाथ नहीं मारते; आपको अपनी उंगली को किनारे के साथ धीरे से चलाना होता है, इसे तब तक सहलाना होता है जब तक कि यह सपाट और सीधा न हो जाए। यह एक रोबोट के लिए बहुत कठिन काम है क्योंकि ये वस्तुएं (जैसे केबल, रस्सी, या तौलिया) ढीली, अप्रत्याशित और मोड़ने के "अनंत" तरीकों वाली होती हैं।

यह पेपर ViTac-Tracing नामक एक नया 'रोबोट ब्रेन' पेश करता है जो रोबोट को इस "ट्रेसिंग" (किनारे का पीछा करने) के काम को पूरी तरह से करना सिखाता है, चाहे वह एक पतला तार (1D) हो या एक सपाट तौलिया (2D)।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: रोबोट "अंधे" और "भोंडे" होते हैं

जब एक रोबोट किसी ढीली वस्तु को ट्रेस करने की कोशिश करता है, तो वह आमतौर पर दो कारणों से विफल हो जाता है:

  • ब्लाइंड स्पॉट (दृष्टि दोष): रोबोट का कैमरा बिल्कुल उस जगह को नहीं देख पाता जहाँ उसकी उंगलियां वस्तु को छू रही होती हैं क्योंकि उंगलियां दृश्य को बाधित करती हैं। यह वैसा ही है जैसे मोटे दस्ताने पहनकर सुई में धागा पिरोने की कोशिश करना; आप सुई के छेद को नहीं देख पाते।
  • फिसलन (The Slip): यदि रोबोट वस्तु को अपनी उंगलियों के किनारे के बहुत करीब पकड़ता है, तो वस्तु फिसल जाती है।

2. समाधान: रोबोट को "सुपर सेंस" देना

शोधकर्ताओं ने एक विशेष रोबोटिक हाथ बनाया है जो दो प्रकार की इंद्रियों से लैस है:

  • आंखें (दृष्टि - Vision): कार्यक्षेत्र को देखने के लिए ऊपर से देखती एक कैमरा।
  • स्पर्श (टैक्टाइल - Tactile): रोबोट की उंगलियों पर एक विशेष "त्वचा" जो उसके द्वारा छुई जाने वाली चीज़ की हाई-रिज़ॉल्यूशन तस्वीरें लेती है। यह रोबोट को अपनी उंगलियों पर आंखों की एक जोड़ी देने जैसा है।

रोबोट को सिखाने के लिए, उन्होंने केवल इसे गणित के माध्यम से प्रोग्राम नहीं किया। इसके बजाय, उन्होंने इमिटेशन लर्निंग (अनुकरण सीखना) का उपयोग किया। इसे एक मानव शिक्षक द्वारा छात्र के हाथ को निर्देशित करने की तरह समझें। एक मानव ऑपरेटर रिमोटली (टेलीऑपरेशन के माध्यम से) रोबोट को नियंत्रित करता है, लेकिन उसे मल्टी-मोडल फीडबैक मिलता है:

  • वह देखता है जो रोबोट देख रहा है।
  • वह देखता है कि रोबोट की उंगलियां क्या "महसूस" कर रही हैं (टैक्टाइल कैमरा के माध्यम से)।
  • यदि रोबोट का हाथ किसी अजीब या कठिन स्थिति में फंस जाता है (जैसे मानव हाथ का जोड़ अटक जाना), तो उनके कंट्रोलर में कंपन (vibrations) महसूस होते हैं। यह मानव शिक्षक को गलत चालों से बचने में मदद करता है।

3. "ब्रेन" की तरकीबें: दो विशेष नियम

रोबोट अपने मानव शिक्षक के प्रदर्शन से सीखता है, लेकिन शोधकर्ताओं ने इसे और स्मार्ट बनाने के लिए दो विशेष "सड़क के नियम" जोड़े हैं:

  • नियम #1: "सेंटर स्टेज" नियम (लोकल लॉस)
    कल्पना कीजिए कि आप साबुन की एक फिसलन भरी टिकिया पकड़े हुए हैं। यदि आप इसे किनारे के पास पकड़ते हैं, तो यह फिसल जाती है। यदि आप इसे बिल्कुल केंद्र में पकड़ते हैं, तो यह सुरक्षित रहती है।
    रोबोट के "दिमाग" में एक विशेष नियम है जो कहता है: "यदि वस्तु मेरी उंगली के कैमरे के केंद्र को छू रही है, तो उस क्रिया को उच्च स्कोर दें। यदि यह किनारे के पास है, तो उसे कम स्कोर दें।" यह रोबोट को वस्तु को गिरने से बचाने के लिए अपनी पकड़ को लगातार एडजस्ट करने के लिए मजबूर करता है।

  • नियम #2: "फिनिश लाइन" नियम (ग्लोबल लॉस)
    कभी-कभी, एक रोबोट केबल को बहुत दूर तक ट्रेस कर देता है या उसे सॉकेट से बाहर खींच लेता है, या बहुत जल्दी रुक जाता है।
    शोधकर्ताओं ने एक दूसरा नियम जोड़ा है जो एक प्रोग्रेस बार की तरह काम करता है। रोबोट भविष्यवाणी करना सीखता है: "मैंने अब तक वस्तु के कितने हिस्से को ट्रेस किया है?" इससे उसे यह जानने में मदद मिलती है कि उसे ठीक कब रुकना है, ठीक वैसे ही जैसे एक धावक को पता होता है कि उसने फिनिश लाइन पार कर ली है।

4. परिणाम: एक एकीकृत मास्टर

सबसे शानदार बात यह है कि इस एकल रोबोट ब्रेन ने एक ही नियमों के सेट का उपयोग करके दोनों पतले तारों (1D) और सपाट तौलिए (2D) को संभालना सीख लिया।

  • उन वस्तुओं पर जिनका उसने अभ्यास किया था: यह 80% बार सफल रहा।
  • उन नई वस्तुओं पर जिन्हें उसने पहले कभी नहीं देखा था: यह अभी भी 65% बार सफल रहा।

बड़ी तस्वीर का रूपक (Analogy)

इसे एक बच्चे को रस्सी पर संतुलन बनाना (tightrope walking) सिखाने जैसा समझें।

  • पुराने तरीकों ने बच्चे के लिए भौतिकी (physics) पर एक गणित की किताब लिखने की कोशिश की (जो बहुत कठिन है और वास्तविक दुनिया में काम नहीं करती)।
  • यह तरीका बच्चे के नीचे एक सुरक्षा जाल (टैक्टाइल सेंसर) रखता है और एक कोच (मानव शिक्षक) रखता है जो डंडा हिलाकर संकेत देता है जब बच्चा बहुत अधिक झुक जाता है।
  • बच्चा अपना संतुलन बनाए रखना सीखता है (सेंटर लॉस) और उसे पता होता है कि उसने रस्सी का अंत कब तक तय कर लिया है (टास्क लॉस)।

संक्षेप में, ViTac-Tracing एक ऐसा रोबोट है जो बिखरी हुई और ढीली वस्तुओं के बीच अपना रास्ता "महसूस" करना सीख सकता है, उन्हें अपनी पकड़ में सुरक्षित रख सकता है, और यह सब एक ऐसे मानव शिक्षक से सीख सकता है जो ठीक वही देख और महसूस कर सकता है जो रोबोट महसूस कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →