← नवीनतम पेपर
💻 computer science

UniDex-ViTac: Learning Unified Visuo-Tactile Dexterous Manipulation Policy from Human Video Data

UniDex-ViTac एक ऐसा फ्रेमवर्क है जो मानव वीडियो प्रदर्शनों का लाभ उठाकर स्पर्श प्रतिक्रिया (tactile feedback) से समृद्ध सिम्युलेटेड रोबोट प्रक्षेपवक्र (trajectories) उत्पन्न करता है, जिससे एक एकीकृत विज़ुओ-टैक्टाइल पॉलिसी को प्रशिक्षित करने में सक्षम होता है जो बिना किसी वास्तविक-रोबोट प्रदर्शन या फाइन-ट्यूनिंग के, केवल विज़न-आधारित बेसलाइन की तुलना में देखे गए और अनदेखे दोनों प्रकार के ऑब्जेक्ट्स पर काफी उच्च डेक्सट्रस मैनिपुलेशन सफलता दर प्राप्त करता है।

मूल लेखक: Hyesung Lee, Si-Hwan Heo, Sungwook Yang

प्रकाशित 2026-09-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyesung Lee, Si-Hwan Heo, Sungwook Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से कारखानों में दोहराव वाले कार्यों के विशेषज्ञ रहे हैं, जो पूर्व-निर्धारित पथों पर पूर्ण सटीकता के साथ चलते हैं। हालाँकि, एक रोबोट को एक नाजुक अंडे या एक फिसलन भरी बोतल को उठाने के लिए मानवीय हाथ जैसी निपुणता देना आधुनिक विज्ञान की सबसे कठिन चुनौतियों में से एक बना हुआ है। कठिनाई केवल वस्तु को देखने में नहीं है, बल्कि उसे महसूस करने में है। मानव हाथ सेंसरों से ढके होते हैं जो हमें तुरंत बताते हैं कि हम किसी चीज़ को छू रहे हैं, हम कितनी जोर से दबाव डाल रहे हैं, और क्या हमारी पकड़ फिसल रही है। इसके विपरीत, रोबोट अक्सर यह समझने में संघर्ष करते हैं कि वे जो देखते हैं उसे सही बल में कैसे बदलें, जिससे वे अक्सर उस चीज़ को कुचल देते हैं जिसे वे पकड़ने की कोशिश कर रहे होते हैं या उसे पूरी तरह से गिरा देते हैं। इन कौशलों को सिखाने के लिए, वैज्ञानिकों को आमतौर पर घंटों के डेटा की आवश्यकता होती है जो मनुष्यों द्वारा रोबोट को भौतिक रूप से नियंत्रित करने से एकत्र किया जाता है, जो एक धीमी और महंगी प्रक्रिया है जिसे बड़े पैमाने पर लागू करना कठिन है। इसके अलावा, लोगों द्वारा कार्य करने के मानक वीडियो में स्पर्श का महत्वपूर्ण डेटा नहीं होता है, जिससे एक रोबोट जो देखता है और जो वह महसूस करता है, उसके बीच एक अंतर रह जाता है।

शोधकर्ताओं की एक टीम ने इस अंतर को पाटने का एक नया तरीका विकसित किया है, एक ऐसी प्रणाली बनाई है जो एक रोबोट को साधारण मानव वीडियो से जटिल पकड़ने के कौशल सीखने की अनुमति देती है, भले ही रोबोट ने वास्तव में किसी मनुष्य को वस्तु को छूते हुए कभी नहीं देखा हो। उनका दृष्टिकोण, जिसे UniDex-ViTac कहा जाता है, कंप्यूटर सिमुलेशन और एक विशिष्ट प्रकार के लर्निंग का एक चतुर संयोजन उपयोग करता है ताकि हजारों अभ्यास प्रयास उत्पन्न किए जा सकें। मानव आंदोलनों की सीधे नकल करने के बजाय, यह प्रणाली पहले व्यक्ति के हाथ के वीडियो को रोबोट के लिए एक मोटे मार्गदर्शक (गाइड) के रूप में अनुवादित करती है। इसके बाद यह इस गाइड को एक उच्च-गति वाली आभासी दुनिया के माध्यम से चलाती है जहाँ रोबोट कार्य करने का प्रयास करता है। यदि रोबोट विफल होता है, तो एक विशेष शिक्षण एल्गोरिदम उसके आंदोलनों में सूक्ष्म समायोजन करता है जब तक कि वह सफल न हो जाए। महत्वपूर्ण बात यह है कि क्योंकि यह एक सिमुलेशन में होता है, सिस्टम ठीक से रिकॉर्ड कर सकता है कि हर सफल प्रयास के दौरान रोबोट की उंगलियों ने क्या महसूस किया, जिससे "स्पर्श" का एक ऐसा डेटासेट बनता है जो मूल वीडियो में मौजूद नहीं होता है। अनुभवों का यह विशाल संग्रह फिर एक एकल, बहुमुखी रोबोट मस्तिष्क को प्रशिक्षित करने के लिए उपयोग किया जाता है जो केवल एक कैमरे और स्पर्श की अपनी भावना का उपयोग करके विभिन्न प्रकार की वस्तुओं को उठा और पकड़ सकता है।

शोधकर्ताओं ने इस पद्धति का परीक्षण दस अलग-अलग वस्तुओं पर किया, जिसमें एक भारी पावर ड्रिल से लेकर एक नाजुक मग तक शामिल थे। उन्होंने इन वस्तुओं के साथ बातचीत करने वाले मनुष्यों के केवल पचास छोटे वीडियो से शुरुआत की। इन वीडियो से, सिस्टम ने दस हजार सिम्युलेटेड ट्रेजेक्टरीज, या अभ्यास रन उत्पन्न किए, जहाँ रोबोट ने अपने यांत्रिक शरीर के अनुकूल मानव आंदोलनों को ढालना सीखा। परिणाम एक एकल पॉलिसी, या निर्देशों का एक सेट था, जो प्रत्येक के लिए पुन: प्रशिक्षित होने की आवश्यकता के बिना सभी दस वस्तुओं को संभाल सकता था। आभासी वातावरण में, यह स्पर्श-जागरूक रोबोट दस में से 68.3% बार वस्तुओं को उठाने में सफल रहा। यह एक दृश्य डेटा पर निर्भर रहने वाले रोबोट के संस्करण की तुलना में एक महत्वपूर्ण सुधार था, जो केवल 55.5% बार सफल हो पाया था। यह अंतर रेखांकित करता है कि किसी वस्तु को देखना पर्याप्त नहीं है; यह जानना कि उंगलियां कब और कहाँ संपर्क कर रही हैं, एक सुरक्षित पकड़ के लिए आवश्यक है।

यह सुनिश्चित करने के लिए कि यह केवल एक सिमुलेशन आर्टिफैक्ट नहीं था, टीम ने प्रशिक्षित रोबोट को वास्तविक दुनिया में ले लिया। उन्होंने प्रशिक्षण के दौरान देखे गए छह ऑब्जेक्ट्स और पांच पूरी तरह से नए ऑब्जेक्ट्स पर इसका परीक्षण किया जिनका सामना उसने पहले कभी नहीं किया था। बिना किसी और ट्यूनिंग या वास्तविक दुनिया के प्रदर्शन के, रोबोट 110 भौतिक परीक्षणों में से 73 में सफल रहा, जिसकी सफलता दर 66.4% थी। उंगलियों को महसूस करने वाला रोबोट का संस्करण केवल देख पाने वाले संस्करण की तुलना में लगातार बेहतर प्रदर्शन करता रहा, जिसने सफलता दर में लगभग 12 प्रतिशत अंक अधिक हासिल की। यह अंतर नए ऑब्जेक्ट्स के लिए भी बना रहा, जिससे साबित हुआ कि रोबोट ने केवल विशिष्ट आंदोलनों को याद करने के बजाय एक सामान्य कौशल सीखा था। यह प्रणाली एक 3D दृश्य और इसकी उंगलियों पर चार सेंसरों से प्राप्त एक सरल सिग्नल को जोड़कर काम करती थी, जिनमें से प्रत्येक यह संकेत देता था कि वह किसी चीज़ को छू रहा है या नहीं। यह बाइनरी जानकारी, रोबोट के अपने हाथ की स्थिति के ज्ञान के साथ मिलकर, उसे एक सफल पकड़ तक ले जाने के लिए पर्याप्त थी।

अध्ययन सुझाव देता है कि रोबोट को परिष्कृत स्पर्श कौशल सिखाना संभव है, बशर्ते कि सिमुलेशन के माध्यम से स्पर्श की कमी को पूरा करने का कोई तरीका हो। शोधकर्ता नोट करते हैं कि उनकी वर्तमान प्रणाली स्पर्श का एक बहुत ही बुनियादी रूप का उपयोग करती है, जो विस्तृत प्रेशर मैप के बजाय सरल 'ऑन-ऑफ़' संकेतों पर निर्भर करती है। वे यह भी बताते हैं कि प्रशिक्षण के लिए उपयोग की गई आभासी दुनिया वास्तविकता के साथ सटीक मेल नहीं खाती है, यही कारण है कि कुछ वस्तुओं को पकड़ना दूसरों की तुलना में कठिन था। इन सीमाओं के बावजूद, यह कार्य एक स्पष्ट मार्ग प्रदर्शित करता है: मानव वीडियो का उपयोग करके सिमुलेशन को निर्देशित करके जो समृद्ध संवेदी डेटा उत्पन्न करते हैं, रोबोट भौतिक दुनिया को हेरफेर करने के लिए एक ऐसे स्तर की निपुणता के साथ संचालित कर सकते हैं जो पहले पहुंच से बाहर थी, और वह भी बिना किसी मनुष्य को हर परीक्षण में उनका हाथ थामे रखने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →