← नवीनतम पेपर
💻 computer science

LAMP: Latent Motion Prior-Guided Real-World Learning for Dexterous Hand Manipulation

यह शोध पत्र LAMP को पेश करता है, जो एक तीन-चरणीय वास्तविक-विश्व शिक्षण ढांचा है जो उच्च-आयामी हाथ की क्रियाओं को एक संक्षिप्त, इतिहास-सशर्त स्थान में मैप करने के लिए एक लेटेंट मोशन प्रायर का उपयोग करता है, जिससे कुशल और सुरक्षित ऑनलाइन सुदृढीकरण लर्निंग (reinforcement learning) सक्षम होती है जो डेक्सट्रस मैनिपुलेशन सफलता दर को 56.25% से बढ़ाकर 98.75% कर देती है।

मूल लेखक: Xinye Yang, Zhiyuan Ma, Hongze Yu, Yuanpei Chen, Yaodong Yang, Xiaojie Chai, Xinlei Chen, Chao Yu

प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinye Yang, Zhiyuan Ma, Hongze Yu, Yuanpei Chen, Yaodong Yang, Xiaojie Chai, Xinlei Chen, Chao Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को नाजुक काम करना सिखा रहे हैं, जैसे कि टिश्यू उठाना या दराज खोलना। आप सोच सकते हैं, "बस इसे दिखा दो कि क्या करना है, और यह आपकी नकल करेगा।" लेकिन यहाँ एक समस्या है: एक रोबोटिक हाथ में दर्जनों छोटे जोड़ (उंगलियां, पोर) होते हैं। यदि आप एक साधारण वीडियो के आधार पर रोबोट को एक साथ उन सभी जोड़ों को हिलाने के लिए कहते हैं, तो वह भ्रमित हो जाता है। यह किसी को पियानो बजाना सिखाने जैसा है—उसे यह बताने के बजाय कि कौन सी कुंजी दबानी है, उसे यह बताना कि उसकी बांह की कौन सी मांसपेशी को कैसे सिकोड़ना है। रोबोट अक्सर छोटी, झटकेदार गलतियाँ करता है जिससे वह वस्तु को गिरा देता है या उस नाजुक स्पर्श को खो देता है जिसकी उसे वस्तु पकड़ने के लिए आवश्यकता होती है।

इसके अलावा, यदि आप रोबोट को वास्तविक दुनिया में "ट्रायल एंड एरर" (सुदृढीकरण लर्निंग/reinforcement learning) के माध्यम से सीखने की कोशिश करते हैं, तो यह खतरनाक है। यदि रोबोट कांच पकड़े हुए अपनी उंगलियों को बेतरतीब ढंग से हिलाता है, तो वह कांच को तोड़ सकता है। एक बार वस्तु गिर जाने के बाद वह आसानी से अपनी गलती को "अनडू" (सुधार) नहीं कर सकता।

पेपर का समाधान: LAMP

इस पेपर के लेखक, LAMP, इसे हल करने के लिए एक चतुर तरीका प्रस्तावित करते हैं। वे एक "लेटेंट मोशन प्रायर" (Latent Motion Prior - LMPM) पेश करते हैं। इसे एक स्मार्ट, अदृश्य मार्गदर्शक के रूप में समझें जो यह समझता है कि मानव हाथ स्वाभाविक रूप से कैसे चलते हैं।

यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. "मोशन डिक्शनरी" (द प्रायर)

सबसे पहले, रोबोट एक इंसान को कार्य करते हुए देखता है। उंगलियों की हर एक हरकत को याद करने के बजाय, रोबोट प्राकृतिक हाथ के आकार और गतिविधियों की एक "डिक्शनरी" सीखता है।

  • उपमा: कल्पना कीजिए कि आप लिखना सीख रहे हैं। आप अपने हाथ की हर एक मांसपेशी की गति को याद नहीं करते। इसके बजाय, आप अक्षर 'A' के "आकार" को सीखते हैं। आपका मस्तिष्क जानता है कि 'A' लिखने के लिए, आपकी उंगलियां स्वाभाविक रूप से एक विशिष्ट, सुचारू पैटर्न में चलती हैं।
  • तकनीक: रोबोट इन प्राकृतिक हाथ की गतिविधियों का एक संक्षिप्त "मानचित्र" बनाता है। वह जानता है कि यदि हाथ वर्तमान में एक कप पकड़े हुए है, तो अगला स्वाभाविक कदम उसे उठाना होना चाहिए, न कि अचानक अपनी छोटी उंगली को स्वतंत्र रूप से घुमाना। यह मानचित्र हिस्ट्री-कंडीशन्ड (history-conditioned) है, जिसका अर्थ है कि यह भविष्यवाणी करने के लिए कि आगे क्या करना चाहिए, यह देखता है कि एक सेकंड पहले हाथ क्या कर रहा था।

2. "को-पायलट" (इमिटेशन लर्निंग)

इसके बाद, रोबोट इंसान की नकल करने की कोशिश करता है। लेकिन सीधे हर उंगली को नियंत्रित करने के बजाय (जो कठिन है), यह "मोशन डिक्शनरी" का उपयोग एक को-पायलट के रूप में करता है।

  • उपमा: रोबोट को एक ड्राइवर के रूप में सोचें। "मोशन डिक्शनरी" वह GPS है जो कहता है, "इस सड़क पर बने रहें।" रोबोट के मस्तिष्क (पॉलिसी) को बस छोटे समायोजन करने की आवश्यकता है, जैसे "थोड़ा बाईं ओर मुड़ें" या "थोड़ी गति बढ़ाएं" ताकि वह सड़क पर बना रहे। उसे इंजन, पहिये और स्टीयरिंग कॉलम को अलग-अलग चलाने का निर्णय लेने की आवश्यकता नहीं है; वह बस सड़क का अनुसरण करता है।
  • परिणाम: रोबोट प्राकृतिक पथ से एक छोटा "ऑफसेट" (एक सूक्ष्म सुधार) की भविष्यवाणी करता है। यह हाथ की गतिविधियों को सुचारू रखता है और उंगलियों के झटकेदार, खतरनाक हिलने-डुलने को रोकता है।

3. "फाइन-ट्यूनर" (सुदृढीकरण लर्निंग/Reinforcement Learning)

अंत में, रोबोट अपने आप अभ्यास करके और भी बेहतर होने की कोशिश करता है। सामान्य लर्निंग में, रोबोट यह देखने के लिए जंगली, यादृच्छिक (random) हरकतें कर सकता है कि क्या काम करता है। लेकिन LAMP के साथ, रोबोट को केवल "मोशन डिक्शनरी" के भीतर छोटे, स्थानीय सुधार करने की अनुमति है।

  • उपमा: कल्पना कीजिए कि आप एक रस्सी (tightrope) पर चलना सीख रहे हैं। आप यह देखने के लिए रस्सी से कूदने की कोशिश नहीं करते कि क्या होता है (यह एक आपदा होगी)। इसके बजाय, आप रस्सी पर बने रहने के लिए अपने संतुलन में बहुत छोटे, सावधानीपूर्वक बदलाव करते हैं। LAMP यह सुनिश्चित करता है कि रोबोट केवल प्राकृतिक हाथ की गतिविधियों के "सुरक्षित क्षेत्र" के भीतर ही छोटे, सुरक्षित बदलाव करे, न कि खतरनाक क्षेत्र में भटक जाए जहाँ वह वस्तु गिरा सकता है।

यह क्यों काम करता है (परिणाम)

लेखकों ने इसे चार वास्तविक कार्यों पर परखा:

  1. एक बोतल को पकड़ना और उसे बॉक्स में रखना।
  2. दराज खोलना।
  3. एक बॉक्स से टिश्यू खींचना (जो कि नरम और ट्रिकी है)।
  4. एक बॉक्स को असेंबल करना (ढक्कन लगाना)।

उन्होंने अपने तरीके (LAMP) की तुलना निम्नलिखित से की:

  • रॉ कंट्रोल (Raw Control): हर उंगली को सीधे नियंत्रित करने की कोशिश करना (जैसे मांसपेशियों को नियंत्रित करके लिखना)।
  • लीनियर कम्प्रेशन (Linear Compression): जोड़ों की संख्या को कम करने के लिए एक सरल गणितीय ट्रिक (जैसे एक बहुत ही सख्त पेन से लिखना)।
  • डिस्क्रीट स्टेप्स (Discrete Steps): गतिविधियों को "चंक्स" या चरणों में तोड़ना (जैसे एक रोबोट जो केवल 10 विशिष्ट स्थितियों में अपनी उंगलियों को हिला सकता है)।

परिणाम:

  • रॉ कंट्रोल: लगभग सब कुछ विफल रहा। हाथ बहुत अधिक झटकेदार था।
  • सरल गणित/चंक्स: ठीक-ठाक प्रदर्शन किया, लेकिन गतिविधियाँ झटकेदार थीं, और रोबोट अक्सर चीजें गिरा देता था।
  • LAMP: चार में से तीन कार्यों में 100% सफलता प्राप्त की और चौथे में 95%।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि रोबोट को जटिल हाथ कौशल सिखाने का रहस्य केवल उन्हें अधिक डेटा या अधिक कंप्यूटिंग पावर देना नहीं है। यह उन्हें एक स्मार्ट बाधा (smart constraint) देना है। रोबोट को हाथ की गतिविधियों के "प्राकृतिक" स्थान के भीतर चलने के लिए मजबूर करके, रोबोट खतरनाक गलतियों से बचता है, तेजी से सीखता है, और उन नाजुक कार्यों को सफलतापूर्वक पूरा कर सकता है जो पहले वास्तविक दुनिया के रोबोटों के लिए बहुत कठिन थे।

संक्षेप में: रोबोट को पहिया (या उंगली) दोबारा आविष्कार करने न दें। उसे मानव हाथों की प्राकृतिक लय सीखने दें, और फिर बस उसे छोटे, सुरक्षित सुधार करने दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →