Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction
DEX-X एक ऐसा फ्रेमवर्क है जो मोनोकुलर मानव वीडियो से भौतिक रूप से आधारित हैंड-ऑब्जेक्ट इंटरैक्शन को पुनर्गठित करने के लिए टैक्टाइल कंप्लीशन इंजन के रूप में सिमुलेशन का लाभ उठाता है, जिससे बिना रोबोट-साइड डेटा संग्रह के विजुअल-टैक्टाइल डेक्सट्रस मैनिपुलेशन पॉलिसियों के प्रशिक्षण और ज़ीरो-शॉट रियल-वर्ल्ड परिनियोजन को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से कारखाने के फर्श के उस्ताद रहे हैं, जो कारों को असेंबल करने या बक्सों को रखने के लिए एक निश्चित पथ पर सटीकता के साथ चलते हैं। लेकिन उस नियंत्रित वातावरण से बाहर कदम रखें, और वही मशीनें अक्सर संघर्ष करती हैं। मानव हाथ अनुकूलन का एक चमत्कार है, जो एक नाजुक अंडे को उठाने, दरवाजे के नॉब को घुमाने या मेज को रगड़ने में सक्षम है, और यह सब संपर्क के अदृश्य दबाव और खिंचाव के प्रति लगातार समायोजित होते हुए करता है। इसे दोहराने के लिए, वैज्ञानिकों ने डेटा के दो मुख्य स्रोतों की ओर रुख किया है: प्रत्यक्ष रोबोट परीक्षण, जो धीमे और महंगे हैं, और मानव वीडियो, जो प्रचुर और मुफ्त हैं। चुनौती हमेशा एक लापता कड़ी रही है। मानव वीडियो हमें दिखाते हैं कि हाथ चलते समय कैसे दिखते हैं, लेकिन वे रोबोट के लिए सबसे महत्वपूर्ण जानकारी को छिपा देते हैं: स्पर्श की अनुभूति। यह जाने बिना कि कितनी जोर से दबाना है या कोई वस्तु कब फिसल रही है, एक रोबोट औजारों को संभालने या दुनिया के साथ जटिल, संपर्क-प्रधान तरीकों से बातचीत करना नहीं सीख सकता।
त्सिंहहुआ विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं की एक टीम ने इस अंतर को भरने के लिए एक समाधान प्रस्तावित किया है, जिसे DEX-X नामक प्रणाली कहा जाता है। उनका कार्य एक मौलिक प्रश्न पूछता है: क्या एक रोबोट केवल मानव वीडियो देखकर, बिना कभी अपना स्वयं का भौतिक डेटा एकत्र किए, सूक्ष्म, स्पर्श-आधारित कार्य करने के लिए सीख सकता है? उन्हें जो उत्तर मिला वह कंप्यूटर सिमुलेशन के चतुर उपयोग पर निर्भर करता है। वीडियो से अकेले छूने की जानकारी का अनुमान लगाने के बजाय, शोधकर्ता वीडियो का उपयोग एक आभासी दुनिया के भीतर रोबोट को निर्देशित करने के लिए करते हैं। इस डिजिटल सैंडबॉक्स में, भौतिकी के नियम सख्ती से लागू होते हैं। जब आभासी रोबोट किसी वस्तु को छूता है, तो कंप्यूटर शामिल सटीक बलों की गणना करता है, जिससे मूल वीडियो में कमी रह गई उस 'स्पर्श की अनुभूति' को प्रभावी रूप से "भर" दिया जाता है। यह प्रक्रिया एक निष्क्रिय दृश्य रिकॉर्ड को एक सक्रिय, भौतिक पाठ में बदल देती है।
शोधकर्ताओं ने विभिन्न कार्यों को करने वाले मनुष्यों के मोनोक्यूलर (एकल लेंस) वीडियो लेने से शुरुआत की, जैसे कि कप उठाना, मेज साफ करने के लिए स्क्वीजी का उपयोग करना, या कील ठोकना। उन्होंने मानव हाथों और उनके द्वारा पकड़ी गई वस्तुओं की गति को ट्रैक करने के लिए कंप्यूटर विजन का उपयोग किया, और उस गति को त्रि-आयामी (3D) रूप में पुनर्गठित किया। इस पुनर्गठित गति को एक डिजिटल रोबोटिक हाथ और भुजा में स्थानांतरित किया गया, जिसमें बाईसों-उनतीस (29) गतिशील भाग हैं, जो मानव अंग की जटिलता की बारीकी से नकल करते हैं। हालांकि, केवल मानव की गतिविधियों की नकल करना पर्याप्त नहीं था। वास्तविक दुनिया में, एक रोबोट जो अंधे होकर मानव के पथ का अनुसरण करता है, अक्सर विफल हो जाता है क्योंकि वह यह महसूस नहीं कर पाता कि वह बहुत जोर से दबा रहा है या कोई वस्तु फिसल रही है। इसे हल करने के लिए, टीम ने सिमुलेशन के भीतर एक "शिक्षक" (teacher) रोबोट को प्रशिक्षित किया। इस शिक्षक ने मानव गति को एक मार्गदर्शक के रूप में देखा लेकिन अपनी उंगलियों पर महसूस किए गए सिम्युलेटेड बलों के आधार पर अपनी गतिविधियों को खोजने और समायोजित करने के लिए स्वतंत्र था। आभासी दुनिया में हजारों परीक्षणों के माध्यम से, इस शिक्षक ने संपर्क के अदृश्य दबाव और खिंचाव के प्रति प्रतिक्रिया देकर एक स्थिर पकड़ बनाए रखना और वस्तुओं को संचालित करना सीखा, एक ऐसा कौशल जो मूल मानव वीडियो अकेले नहीं सिखा सकता था।
एक बार जब शिक्षक ने सिमुलेशन में इन कौशलों में महारत हासिल कर ली, तो शोधकर्ताओं ने उसके ज्ञान को एक "छात्र" (student) पॉलिसी में संकुचित कर दिया। इस छात्र को वास्तविक हार्डवेयर पर तैनात करने के लिए डिज़ाइन किया गया था। शिक्षक के विपरीत, जिसके पास सिमुलेशन का पूर्ण ज्ञान था, छात्र को केवल उसी पर निर्भर रहना था जिसे एक वास्तविक रोबोट महसूस कर सकता है: दृश्य दृश्य (scene), अपने स्वयं के जोड़ों की स्थिति, और अपनी उंगलियों पर लगे दबाव सेंसर। छात्र ने दुनिया का प्रतिनिधित्व करने वाले बिंदुओं के एक क्लाउड (point cloud) को समझने के लिए प्रशिक्षित किया, जो वस्तु के दृश्य आकार को उसके सेंसरों से प्राप्त बल डेटा के साथ मिलाता है। इसने छात्र को सिमुलेशन के पूर्ण, आंतरिक ज्ञान की आवश्यकता के बिना संचालित करने में सक्षम बनाया, जिससे वह भौतिक दुनिया की अव्यवस्थित वास्तविकता के लिए तैयार हो गया।
इस दृष्टिकोण के परिणामों का परीक्षण एक वास्तविक रोबोट पर किया गया जो बाईसों-उनतीस (29) डिग्री-ऑफ-फ्रीडम वाले हाथ और भुजा से लैस था। शोधकर्ताओं ने रोबोट को उन कार्यों को करने के लिए कहा जो उसने पहले कभी नहीं देखे थे, केवल मानव वीडियो और सिमुलेशन से सीखे गए नीतियों का उपयोग करके। एक क्यूब उठाने के परीक्षण में, रोबोट तीस में से अट्ठाईस प्रयासों में सफल रहा, जो 93 प्रतिशत सफलता दर है। इसने कप से पानी डालने और समान विश्वसनीयता के साथ वस्तुओं को उठाने का भी प्रबंधन किया। सिस्टम ने उन वस्तुओं के लिए भी सामान्यीकरण (generalize) करने की क्षमता दिखाई जिनका सामना उसने प्रशिक्षण के दौरान नहीं किया था। जब एक पतले क्यूब या एक खिलौना बत्तख के सामने रखा गया जो प्रशिक्षण वस्तुओं से भिन्न थी, तब भी रोबोट ने उन्हें उठाने में सफलता प्राप्त की, हालांकि सफलता दर थोड़ी कम थी, जो यह सिद्ध करता है कि सीखे गए कौशल केवल रटी हुई गतिविधियाँ नहीं बल्कि अनुकूलन योग्य रणनीतियाँ थीं।
हालांकि, यह प्रणाली सीमाओं से मुक्त नहीं है। शोधकर्ताओं ने नोट किया कि लंबे समय तक निरंतर संपर्क वाले कार्यों, जैसे कि स्क्वीजी के साथ मेज साफ करना, अधिक कठिन साबित हुए। रोबिड लगभग 53 प्रतिशत परीक्षणों में सफल रहा, जिसमें विफलताएं अक्सर तब हुईं जब रोबोट ने अपनी पकड़ खो दी या गति के दौरान मेज से टकरा गया। यह सुझाव देता है कि जबकि सिमुलेशन सीखने के लिए एक शक्तिशाली सेतु प्रदान करता है, समय के साथ संपर्क बनाए रखने की जटिलता एक महत्वपूर्ण बाधा बनी हुई है। टीम ने यह भी पाया कि या तो दृश्य इनपुट या स्पर्श फीडबैक को हटाने से प्रदर्शन में भारी गिरावट आई, जिससे पुष्टि हुई कि भौतिक दुनिया में प्रभावी ढंग से नेविगेट करने के लिए दोनों इंद्रियां आवश्यक हैं।
यह कार्य सुझाव देता है कि सिम्युलेटेड भौतिक संपर्क इंटरनेट पर उपलब्ध मानव वीडियो के विशाल पुस्तकालय और सक्षम, तैनात रोबोट के विकास के बीच एक महत्वपूर्ण कड़ी के रूप में कार्य कर सकता है। छूने की लापता डेटा उत्पन्न करने के लिए सिमुलेशन का उपयोग करके, शोधकर्ताओं ने दिखाया है कि रोबोट महंगे, विशेष डेटा संग्रह की आवश्यकता के बिना जटिल, संपर्क-समृद्ध कौशल सीख सकते हैं। निष्कर्ष संकेत देते हैं कि एक ऐसा मार्ग जहाँ रोबोट मानव गतिविधि के प्रचुरता से सीख सकते हैं, जो वीडियो में कैद है, एक आभासी दुनिया के कठोर परीक्षण के माध्यम से उन दृश्य प्रदर्शनों को भौतिक क्षमताओं में अनुवादित करते हैं। हालांकि सबसे जटिल अंतःक्रियाओं को संभालने में चुनौतियां बनी हुई हैं, बिना किसी अतिरिक्त ट्यूनिंग के इन कौशलों को सीधे वास्तविक हार्डवेयर में स्थानांतरित करने की क्षमता अधिक बहुमुखी और स्वायत्त मशीनों की ओर एक महत्वपूर्ण कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।