← नवीनतम पेपर
💻 computer science

TacSE3: Equivariant SE(3) Motion Estimation from Low-Texture Visuotactile Images for In-Gripper Tracking and Compensation

यह शोध पत्र TacSE3 प्रस्तुत करता है, जो एक इक्विवेरिएंट (equivariant) SE(3) मोशन एस्टीमेशन पाइपलाइन है जो डुअल-सेंसर लो-टेक्चर विज़ुओटैक्टाइल डेटा का लाभ उठाकर 3D फोर्स फील्ड्स को प्लेनर ट्रांसलेशन और शियर-आधारित रोटेशन में अलग करता है, जिससे बिना रिट्रेनिंग के रोबोटिक मैनिपुलेशन के लिए सुदृढ़ इन-ग्रिपर ट्रैकिंग और डिस्टर्बेंस कंपनसेशन सक्षम होता है।

मूल लेखक: Zhongyuan Liao, Junzhe Wang, Qingyang Liu, Zhenmin Huang, Jun Ma, Yi Cai, Fei Meng, Haobo Liang, Michael Yu Wang

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhongyuan Liao, Junzhe Wang, Qingyang Liu, Zhenmin Huang, Jun Ma, Yi Cai, Fei Meng, Haobo Liang, Michael Yu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपनी आँखें बंद करके अपने हाथ के अंदर एक चिकने, चमकदार मार्बल (कंचे) को हिलाने की कोशिश कर रहे हैं। यदि आप केवल अपनी हथेली की चिकनी त्वचा को महसूस करके यह अनुमान लगाने की कोशिश करते हैं कि मार्बल कैसे लुढ़क रहा है, तो यह अविश्वसनीय रूप से कठिन है। आपका मस्तिष्क किसी भी "बिंदु" या "रेखा" को ट्रैक नहीं कर पाता जिससे वह देख सके, इसलिए वह भ्रमित हो जाता है कि मार्बल बगल में फिसल रहा है या अपनी जगह पर घूम (spin) रहा है।

यह ठीक वही समस्या है जिसका सामना रोबोट तब करते हैं जब वे "टच कैमरों" का उपयोग करके चिकनी, बिना बनावट वाली वस्तुओं (जैसे एक पॉलिश किया हुआ गोला या धातु का गियर) को नियंत्रित करने की कोशिश करते हैं। ये कैमरे, जिन्हें विज़ुओटैक्टाइल सेंसर (Visuotactile Sensors) कहा जाता है, रोबोट की उंगलियों के विरुद्ध दबी वस्तु की तस्वीरें लेते हैं। लेकिन यदि वस्तु चिकनी है, तो तस्वीर एक खाली, धुंधले धब्बे जैसी दिखती है। पारंपरिक कंप्यूटर विज़न विधियाँ विफल हो जाती हैं क्योंकि वे पैटर्न खोजने पर निर्भर करती हैं, और यहाँ कोई पैटर्न पहचानने के लिए उपलब्ध ही नहीं है।

"TacSE3" से मिलिए: रोबोट का "महसूस करने" वाला सिस्टम

यह शोध पत्र एक नई विधि पेश करता है जिसे TacSE3 कहा जाता है, जो रोबोट को यह समझने में मदद करती है कि उनकी पकड़ के भीतर एक वस्तु बिल्कुल कैसे हिल रही है, भले ही वह वस्तु चिकनी हो और रोबोट उसे देख न पा रहा हो।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. तस्वीर देखना बंद करें, "धक्का" महसूस करना शुरू करें

एक इंसान द्वारा चलती हुई कार की टेललाइट्स को ट्रैक करने के बजाय, TacSE3 टच सेंसर को एक प्रेशर मैप (दबाव मानचित्र) की तरह मानता है।

  • उपमा: कल्पना कीजिए कि आप अपने अंगूठे को एक नरम, स्पंजी तकिए में दबा रहे हैं। यदि आप अपने अंगूठे को स्लाइड करते हैं, तो तकिया एक दिशा में खिंचता है। यदि आप अपने अंगूठे को घुमाते हैं, तो तकिया एक सर्पिल (spiral) की तरह खिंचता है।
  • विधि: रोबोट इमेज में "फीचर्स" नहीं ढूंढता। इसके बजाय, यह एक 3D फोर्स फील्ड (बल क्षेत्र) की गणना करता है। यह दबाव को दो भागों में विभाजित करता है:
    • नॉर्मल फोर्स (Normal Force): वस्तु उंगली के अंदर कितनी जोर से धक्का दे रही है (जैसे बटन दबाना)।
    • शियर फोर्स (Shear Force): वस्तु उंगली के ऊपर कितनी रगड़ खा रही है (जैसे हाथ को मेज पर रगड़ना)।

2. "सेंट्रॉइड" ट्रिक (फिसलने और घूमने के बीच अंतर करना)

रोबोट के लिए सबसे बड़ी समस्याओं में से एक यह पहचानना है कि एक वस्तु बगल में फिसल (slide) रही है या घूम (spin) रही है। एक एकल चिकनी उंगली पर, ये दोनों गतिविधियाँ बहुत समान दिख सकती हैं।

  • उपमा: मेज पर घूमते हुए सिक्के के बारे में सोचें। यदि आप सिक्के को किनारे से धक्का देते हैं, तो वह फिसलता है। यदि आप उसके किनारे को झटकते हैं, तो वह घूमता है। लेकिन यदि आप केवल सिक्के के केंद्र को देखते हैं, तो अंतर बताना कठिन है।
  • समाधान: TacSE3 एक चतुर ट्रिक का उपयोग करता है।
    • फिसलने (Sliding) को खोजने के लिए, यह संपर्क क्षेत्र के केंद्र (सेंट्रॉइड) पर नज़र रखता है। यदि दबाव का केंद्र बाईं ओर जाता है, तो वस्तु बाईं ओर फिसली है।
    • घूमने (Spining) को खोजने के लिए, यह उस केंद्र के आसपास के मरोड़ वाले बलों (twisting forces/shear) को देखता है।
    • इन दोनों गणनाओं को अलग करके, रोबोट भ्रमित होने से बच जाता है। यह ऐसा है जैसे मस्तिष्क का एक हिस्सा "मैं कहाँ जा रहा हूँ?" के लिए समर्पित है और दूसरा हिस्सा "क्या मैं घूम रहा हूँ?" के लिए।

3. "दो उंगलियों" की महाशक्ति

शोध पत्र दिखाता है कि दो टच सेंसर (ग्रिपर की प्रत्येक उंगली पर एक) का उपयोग करना गेम-चेंजर है।

  • उपमा: कल्पना कीजिए कि आप केवल एक उंगली से महसूस करके यह अनुमान लगाने की कोशिश कर रहे हैं कि एक गेंद लुढ़क रही है या नहीं। यह अस्पष्ट है। लेकिन यदि आप दो उंगलियों से विपरीत दिशाओं से महसूस करते हैं, तो सुराग स्पष्ट हो जाते हैं।
    • यदि गेंद आगे की ओर फिसलती (slide) है, तो दोनों उंगलियां एक ही दिशा में धक्का महसूस करती हैं।
    • यदि गेंद घूमती (spin) है, तो एक उंगली आगे की ओर धक्का महसूस करती है जबकि दूसरी उंगली पीछे की ओर धक्का महसूस करती है (जैसे एक सी-सॉ/झूला)।
  • परिणाम: दोनों उंगलियों की तुलना करके, रोबोट तुरंत भ्रम को दूर कर सकता है। वह निश्चित रूप से जान जाता है कि वस्तु घूम रही है या फिसल रही है, भले ही वस्तु पूरी तरह से चिकनी क्यों न हो।

4. "रेसिडुअल" हेल्पर (एक को-पायलट)

लेखकों ने इस सिस्टम का परीक्षण रोबोट के मुख्य मस्तिष्क को बदलने के बजाय, इसे एक को-पायलट के रूप में जोड़कर किया है।

  • उपमा: एक सेल्फ-ड्राइविंग कार की कल्पना करें जो ड्राइविंग में अच्छी है लेकिन अचानक हवा के झोंके से भटक जाती है। आपको कार का इंजन फिर से बनाने की आवश्यकता नहीं है; आपको बस एक छोटे सेंसर की आवश्यकता है जो कहे, "हे, हमें 5 डिग्री बाईं ओर धकेला गया है, वापस मुड़ने के लिए स्टीयरिंग एडजस्ट करें।"
  • अनुप्रयोग: रोबोट के पास एक मुख्य AI पॉलिसी (ड्राइवर) होती है जो एक कार्य करने की कोशिश करती है (जैसे छेद में पेग डालना)। यदि कोई इंसान गलती से ग्रिपर के अंदर वस्तु को टक्कर मार देता है, तो मुख्य AI भ्रमित हो सकता है और विफल हो सकता है। TacSE3 एक "रेसिडुअल" सिग्नल के रूप में कार्य करता है। यह टक्कर का पता लगाता है, सूक्ष्म रोटेशन की गणना करता है, और रोब सहित बताता है, "अपनी स्थिति को संतुलित करने के लिए अपना हाथ थोड़ा समायोजित करें।"
  • परिणाम: प्रयोगों में, जब इंसानों ने रोबोट की पकड़ के साथ छेड़छाड़ की, तो TacSE3 का उपयोग करने वाला रोबोट, बिना इसके उपयोग करने वाले रोबोट की तुलना में, रिकवर करने और कार्य पूरा करने में बहुत बेहतर था। इसे फिर से प्रशिक्षित करने की आवश्यकता नहीं थी; इसे बस इस अतिरिक्त "महसूस करने" वाले स्तर की आवश्यकता थी।

सारांश

TacSE3 रोबोट के लिए गति को "महसूस" करने का एक नया तरीका है। विजुअल पैटर्न (जो चिकनी वस्तुओं पर मौजूद नहीं होते) पर निर्भर रहने के बजाय, यह:

  1. टच इमेज को एक 3D प्रेशर मैप में बदल देता है।
  2. फिसलने (sliding) (केंद्र की गति) को घूमने (spinning) (मरोड़ बल) से अलग करता है।
  3. भ्रम को दूर करने और क्रॉस-चेक करने के लिए दो उंगलियों का उपयोग करता है।
  4. एक रियल-टाइम करेक्शन सिग्नल के रूप में कार्य करता है ताकि जब वस्तु उनकी पकड़ के भीतर शिफ्ट हो, तो रोबोट स्थिर रह सके।

यह रोबोट को चिकनी, फिसलन भरी या बिना बनावट वाली वस्तुओं को उसी आत्मविश्वास के साथ संभालने की अनुमति देता है जो उनके पास टेक्सचर्ड वस्तु को पकड़ने के दौरान होता है, बस इमेज के स्वरूप के बजाय स्पर्श के भौतिक विज्ञान (physics of touch) को समझकर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →