TAC-LOCO: Unified Whole-Body Control for Quadrupedal TACtile-Informed LOCO-Manipulation
यह शोध पत्र TAC-LOCO का प्रस्ताव करता है, जो एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो कंप्लायंट ग्रिपर्स से स्पर्श फीडबैक (tactile feedback) को होल-बॉडी कंट्रोल में एकीकृत करता है, जिससे एक चतुष्पाद रोबोट (quadrupedal robot) अनिश्चित बाहरी अंतःक्रियाओं के तहत उच्च सफलता दर बनाए रखते हुए पकड़ी गई वस्तुओं को गतिशील रूप से स्थिर करने और पकड़ बल (grasping force) को महत्वपूर्ण रूप से कम करने में सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक चार पैरों वाला रोबोट कुत्ता है जो न केवल इधर-उधर दौड़ता है, बल्कि अपने मुँह में एक नाजुक, नरम फल भी लेकर चलता है और बाधाओं से बचता है। अब, कल्पना कीजिए कि उस फल को एक अदृश्य हाथ द्वारा खींचा जा रहा है जो लगातार मजबूत होता जा रहा है, या अचानक छोड़ देता है। यदि रोबोट उसे बहुत कसकर पकड़ता है, तो वह फल को कुचल देगा; यदि वह बहुत ढीला पकड़ता है, तो फल उड़ जाएगा। यह "लोको-मैनिपुलेशन" (चलते हुए हेरफेर करना) का कठिन नृत्य है, और लंबे समय तक, रोबट इसमें बहुत खराब थे क्योंकि वे मूल रूप से इस बात के प्रति अंधे थे कि वे कितनी जोर से दबा रहे हैं।
TAC-LOCO से मिलिए, एक नया "मस्तिष्क" जो रोबोट कुत्तों को आखिरकार स्पर्श की भावना देता है।
समस्या: "लोहे की पकड़" वाली गलती
इस कार्य से पहले, चलते समय चीजें ले जाने की कोशिश करने वाले अधिकांश रोबोट कुत्ते एक "अनुमान लगाओ और पकड़ो" की रणनीति पर निर्भर थे। वे किसी वस्तु को मजबूती से पकड़ लेते थे और बेहतर की उम्मीद करते थे। शोध पत्र का तर्क है कि यह एक बुरा विचार है। वस्तु को महसूस किए बिना, रोबट यह नहीं बता सकता कि वह फिसल रही है या वस्तु को बाहर के बल द्वारा खींचा जा रहा है। यह एक गिलास पानी ले जाने जैसा है जबकि कोई मेज को हिला रहा है, लेकिन आप मोटे दस्ताने पहने हुए हैं और महसूस नहीं कर सकते कि गिलास कैसे डगमगा रहा है। परिणाम क्या होता है? या तो आप गिलास को कुचल देते हैं या उसे गिरा देते हैं।
लेखक स्पष्ट रूप से इस विचार को खारिज करते हैं कि रोबोटों को बस "मजबूती से पकड़ना" चाहिए और संपर्क को अनदेखा करना चाहिए। वे उन तरीकों के भी खिलाफ तर्क देते हैं जो वास्तव में हाथ में मौजूद वस्तु को महसूस किए बिना रोबोट के शरीर पर लगने वाले बलों का अनुमान लगाने की कोशिश करते हैं।
समाधान: "फिंगरटिप फील" वाला रोबोट
शोधकर्ताओं ने एक प्रणाली बनाई जिसे TAC-LOCO कहा जाता है, जो रोबोट के पैरों, उसके हाथ और उसके ग्रिपर (हाथ) के लिए एक एकीकृत मस्तिष्क के रूप में कार्य करती है। केवल यह देखने के बजाय कि उसके जोड़ कहाँ हैं, यह प्रणाली ग्रिपर की उंगलियों पर लगे टैक्टाइल सेंसर (स्पर्श सेंसर) से डेटा पढ़ती है। इन सेंसरों को ग्रिपर की उंगलियों पर हजारों छोटे दबाव बिंदुओं के रूप में समझें जो रोबोट को बताते हैं कि वस्तु उसकी "त्वचा" के विरुद्ध कितनी जोर से दब रही है।
रोबोट रीइन्फोर्समेंट लर्निंग (सुदृढीकरण सीखना) की एक प्रक्रिया के माध्यम से सीखता है, जो एक कुत्ते को इनाम देकर प्रशिक्षित करने जैसा है। रोबोट एक वीडियो गेम सिमुलेशन में लाखों परिदृश्यों को आजमाता है जहाँ अदृश्य हाथ उसके द्वारा पकड़ी गई वस्तु को खींचते हैं।
- यदि वह बहुत जोर से दबाता है, तो उसे "खराब स्कोर" मिलता है।
- यदि वह वस्तु को गिरा देता है, तो उसे "बहुत खराब स्कोर" मिलता है।
- यदि वह वस्तु को सुरक्षित रखते हुए चलता रहता है, तो उसे "इनाम" मिलता है।
समय के साथ, रोबोट एक गुप्त ट्रिक सीख जाता है: उतना ही जोर से दबाओ जितनी तुम्हें जरूरत है। वह ठीक उसी क्षण अपनी पकड़ को कस लेता है जब उसे महसूस होता है कि वस्तु फिसलना शुरू हो गई है, और जब खींचने वाला बल गायब हो जाता है तो अपनी पकड़ को ढीला कर देता है।
जादुई संख्याएँ
परिणाम काफी शानदार हैं, लेकिन स्पष्ट रहें: ये संख्याएँ सिमुलेशन और एक विशिष्ट रोबोट सेटअप (एक Unitree Go2 कुत्ता और एक Interbotix WidowX 250 हाथ) पर वास्तविक दुनिया के परीक्षणों से आती हैं।
- बल में कमी: रोबोट ने वस्तु को पकड़ने के लिए मजबूती से पकड़ने वाले रोबोटों की तुलना में 47% कम बल का उपयोग करना सीखा। यह ऊर्जा की भारी बचत है और नाजुक वस्तुओं को कुचलने से बचने के लिए एक बड़ी जीत है।
- ड्रॉप रेट (गिरने की दर): वास्तविक दुनिया के परीक्षणों में, रोबole ने वस्तु को 1% से भी कम बार गिराया। यह 100 प्रयासों में से 1 से भी कम की ड्रॉप दर है।
- सफलता दर: जब रोबोट को बदलते बलों के बीच वस्तु पकड़े हुए चलना था, तो वह 90% बार सफल रहा।
"जीरो-शॉट" आश्चर्य
यहाँ कहानी का सबसे चंचल हिस्सा है। रोबोट को एक विशिष्ट बेलनाकार वस्तु के साथ सिमुलेशन में प्रशिक्षित किया गया था। जब शोधकर्ताओं ने रोबोट को गेम से निकालकर वास्तविक दुनिया में पहुँचाया, तो उन्होंने इसे फिर से प्रशिक्षित नहीं किया या इसकी सेटिंग्स में बदलाव नहीं किया। उन्होंने बस इसे एक स्ट्रॉबेरी और एक गोला (sphere) थमा दिया।
रोबोट, जिसने पहले कभी स्ट्रॉबेरी नहीं देखी थी, उसे चलते समय और स्प्रिंग के विरुद्ध खींचते समय सफलतापूर्वक पकड़े रखा। उसे यह जानने की जरूरत नहीं थी कि स्ट्रॉबेरी क्या है; वह बस स्ट्रॉबेरी के फिसलने के एहसास के प्रति प्रतिक्रिया करना जानता था। यह बताता है कि रोबोट ने विशिष्ट आकारों को याद करने के बजाय "महसूस करने और समायोजित करने" के एक सामान्य कौशल को सीखा है।
जो यह पेपर दावा नहीं करता
यह जानना महत्वपूर्ण है कि यह रोबोट अभी क्या नहीं कर सकता। पेपर स्वीकार करता है कि सिमुलेशन एकदम सटीक नहीं है। रोबोट अभी भी न्यूटन में बल की सटीक मात्रा को 100% सटीकता के साथ नहीं माप सकता क्योंकि वास्तविक दुनिया अव्यवस्थित है और नरम रबर की उंगलियों का सिमुलेशन करना कठिन है। साथ ही, वास्तविक दुनिया में इसका हाथ सिमुलेशन के आदर्श संस्करण की तुलना में थोड़ा धीमा और कम शक्तिशाली है, इसलिए वास्तविक दुनिया का प्रदर्शन इसके वीडियो गेम वाले संस्करण जितना शानदार नहीं हो सकता है।
निष्कर्ष
TAC-LOCO दिखाता है कि रोबोट को स्पर्श की भावना देना सब कुछ बदल देता है। एक अनाड़ी ताकतवर जीव होने के बजाय जो बस मजबूती से पकड़ कर रखता है, रोबोट एक कुशल साथी बन जाता है जो वास्तविक समय में अपनी पकड़ को समायोजित करता है। यह साबित करता है कि यदि आप चाहते हैं कि एक रोबोट अराजक, अप्रत्याशित दुनिया में चले और चीजें ले जाए, तो उसे जो वह पकड़े हुए है उसे महसूस करने की आवश्यकता है, न कि केवल अनुमान लगाने की।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।