M3-Tele: A Unified Multimodal Teleoperational Framework for Compliant Whole-Body Mobile Manipulation
यह शोध पत्र M3-Tele को प्रस्तुत करता है, जो एक एकीकृत मल्टीमॉडल टेलीऑपरेशनल फ्रेमवर्क है जो विजुअल, टैक्टाइल, फोर्स और प्रोप्रियोसेप्टिव सेंसिंग को एकीकृत करता है ताकि कंप्लायंट होल-बॉडी मोबाइल मैनिपुलेशन को सक्षम बनाया जा सके, जो कॉन्टैक्ट-रिच टास्क परफॉरमेंस में महत्वपूर्ण सुधार करता है और डाउनस्ट्रीम पॉलिसी लर्निंग के लिए जॉइंट टैक्टाइल-फोर्स सेंसिंग के मूल्य को प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट जो घर में इधर-उधर घूम सकें और चीजों को उठा सकें, लंबे समय से विज्ञान कथाओं (साइंस फिक्शन) का एक सपना रहे हैं, लेकिन उस सपने को वास्तविकता में बदलने के लिए एक कठिन भौतिक पहेली को सुलझाना आवश्यक है। वास्तव में उपयोगी होने के लिए, एक रोबोट को एक साथ दो काम करने चाहिए: एक अव्यवस्थित कमरे में नेविगेट करना और वस्तुओं को बिना तोड़े उन्हें धीरे से उठाना। इसके लिए अपने शरीर को चलाने और जिस दुनिया को वह छू रहा है उसे महसूस करने के बीच एक नाजुक संतुलन की आवश्यकता होती है। यदि रोबोट बहुत जोर से धक्का देता है, तो वह एक फूलदान को गिरा सकता है; यदि वह बहुत कठोरता से चलता है, तो वह दराज नहीं खोल पाएगा या किसी सतह को साफ करने के लिए पोंछ नहीं पाएगा। एक रोबोट को इन कौशलों को इंसान से सीखने के लिए, इंसान को इसे एक ऐसे संवेदनशीलता के स्तर के साथ निर्देशित करने में सक्षम होना चाहिए जो स्वाभाविक लगे, जबकि रोबोट को अपने स्वयं के सेंसरों को सुनने और अपनी पकड़ और दबाव को वास्तविक समय में समायोजित करने में सक्षम होना चाहिए। महसूस करने और अनुकूलन करने की इस क्षमता के बिना, रोबटेज को सिखाने के लिए एकत्र किया गया डेटा अक्सर अनाड़ी और असंगत होता है, जिससे मशीन के लिए बाद में जटिल कार्यों को सीखना कठिन हो जाता है।
शेन्ज़ेन टेक्नोलॉजी यूनिवर्सिटी के शोधकर्ताओं ने इस समस्या को हल करने के लिए M3-Tele नामक एक नया सिस्टम विकसित किया है। उन्होंने एक ऐसा ढांचा बनाया है जो एक इंसान को स्मार्टफोन का उपयोग करके एक मोबाइल रोबोटिक आर्म को नियंत्रित करने की अनुमति देता है, लेकिन एक महत्वपूर्ण मोड़ के साथ: सिस्टम को इस तरह डिज़ाइन किया गया है कि वह रोबोट और दुनिया के बीच के संपर्क को महसूस कर सके। रोबोट अपनी ग्रिपर पर विशेष सेंसरों से लैस है जो यह देख सकते हैं कि जब वे किसी वस्तु को छूते हैं तो उनकी उंगलियों के नरम पैड कितने दबते हैं, साथ ही ऐसे सेंसर भी हैं जो उसकी कलाई पर लगने वाले बल को मापते हैं। जब एक मानव ऑपरेटर रोबोट को व्हाइटबोर्ड पोंछने या दराज खोलने के लिए निर्देशित करता है, तो सिस्टम केवल हाथ के पथ का अंधाधुंध अनुसरण नहीं करता है। इसके बजाय, यह लगातार दबाव और ग्रिपर के दबने की जांच करता है, और संपर्क को कोमल और स्थिर बनाए रखने के लिए रोबोट की गति को स्वचालित रूप से समायोजित करता है। यह एक सहज, प्रतिक्रियाशील अनुभव बनाता है जहाँ रोबोट एक कठोर मशीन के बजाय एक लचीले साथी की तरह व्यवहार करता है।
टीम ने इस सिस्टम का परीक्षण चार अलग-अलग कार्यों पर किया जो सरल से लेकर कठिन तक थे। उन्होंने स्वयंसेवकों से एक ब्लॉक उठाने, एक बार (bar) को घुमाने, दराज खींचकर खोलने और व्हाइटबोर्ड पपोंछने के लिए इस सिस्टम का उपयोग करने को कहा। परिणामों ने दिखाया कि नया सिस्टम वस्तुओं के संपर्क में रहने और पकड़ खोने या बहुत अधिक बल लगाने से बचने में काफी बेहतर था। जब शोधकर्ताओं ने अपने सिस्टम की तुलना पुराने तरीकों से की जिनमें बल-संवेदी समायोजन का उपयोग नहीं किया गया था, तो अंतर स्पष्ट था। नए कंट्रोलर ने वांछित बल के ट्रैकिंग एरर को 4 न्यूटन से अधिक से घटाकर 0с.35 न्यूटन से कम कर दिया। व्यावहारिक शब्दों में, इसका अर्थ है कि रोबोट बहुत अधिक सटीकता के साथ किसी सतह के विरुद्ध स्थिर दबाव बनाए रख सकता है। इसके अलावा, सिस्टम ने रोबोट को गलती से किसी वस्तु के संपर्क से बाहर होने से रोका, जिससे पकड़ फिसलने की संख्या प्रति प्रयास लगभग 2.5 बार से घटकर लगभग शून्य हो गई।
अध्ययन ने यह भी देखा कि सिस्टम मनुष्यों के लिए उपयोग में कितना आसान था। शोधकर्ताओं ने पाया कि ऑपरेटर को रोबोट के स्पर्श के बारे में फीडबैक देने से कार्य बहुत अधिक सहज महसूस हुआ। उपयोगकर्ताओं ने मानक नियंत्रण विधियों की तुलना में नए फीडबैक-सक्षम इंटरफ़ेस के उपयोग की आसानी को काफी अधिक रेटिंग दी, जिसने बुनियादी संस्करण के 5.8 के मुकाबले 8.4 (10 में से) अंक प्राप्त किए। यह सुझाव देता है कि जब एक इंसान कंट्रोलर के माध्यम से वह महसूस कर सकता है जो रोब lewat महसूस कर रहा है, तो वे इसे अधिक प्रभावी ढंग से निर्देशित कर सकते हैं। सिस्टम सभी विभिन्न कार्यों में अच्छी तरह से काम करता रहा, जिसने चुनौतीपूर्ण पोंछने वाले कार्य को 80% बार और सरल कार्यों को 94% तक सफलतापूर्वक पूरा किया। यह विश्वसनीयता आवश्यक है क्योंकि इसका मतलब है कि रोबोट उच्च-गुणवत्ता वाले प्रदर्शन (demonstrations) एकत्र कर सकता है जो प्रशिक्षण के लिए उपयोग किए जाने वाले पर्याप्त सुसंगत होते हैं।
अंत में, शोधकर्ताओं ने इस सिस्टम द्वारा एकत्र किए गए डेटा का उपयोग एक रोबोट को खुद बोर्ड पोंछना सिखाने के लिए किया, जिसे 'डिफ्यूजन पॉलिसी' नामक एक सीखने की विधि के रूप में जाना जाता है। उन्होंने परीक्षण किया कि क्या रोबोट बेहतर सीखता है जब उसके पास सभी प्रकार की संवेदी जानकारी उपलब्ध हो—कैमरा दृश्य, बल माप और स्पर्श संबंधी दबने का डेटा—या क्या वह केवल कैमरा देखकर काम चला सकता है। प्रयोगों ने दिखाया कि रोबोट ने सबसे प्रभावी पोंछने वाला व्यवहार तब सीखा जब उसके पास तीनों प्रकार की जानकारी का संयोजन था। यहाँ तक कि जब शोधकर्ताओं ने लर्निंग एल्गोरिदम को केवल थोड़ा सा डेटा दिया, तब भी स्पर्श और बल सेंसरों के संयोजन ने रोबोट को केवल दृष्टि (vision) की तुलना में कार्य को बेहतर ढंग से समझने में मदद की। यह पुष्टि करता है कि भौतिक संपर्क वाले कार्यों में महारत हासिल करने के लिए, रोबोटों को ऐसे डेटा के साथ सिखाने की आवश्यकता है जो न केवल यह कैप्चर करे कि रोबोट क्या देख रहा है, बल्कि यह भी कि वह दुनिया को बिल्कुल कैसे महसूस कर रहा है। यह कार्य यह प्रदर्शित करता है कि इन इंद्रियों को नियंत्रण प्रणाली में एकीकृत करके, हम ऐसे रोबोट बना सकते हैं जो न केवल हमारे घरों में घूमने में सक्षम हैं, बल्कि हमारे अंदर की वस्तुओं के साथ बातचीत करने के लिए कोमल और सटीक भी हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।