← नवीनतम पेपर
💻 computer science

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

UniHM एक एकीकृत रूपरेखा पेश करता है जो विविध हैंड मॉर्फोलॉजी के लिए एक साझा टोकेनाइज़र और मानव-वस्तु अंतःक्रियाओं पर प्रशिक्षित एक विज़न-लैंग्वेज एक्शन मॉडल का लाभ उठाता है, ताकि व्यापक वास्तविक दुनिया के टेलीऑपरेशन डेटा की आवश्यकता के बिना, ओपन-वोकैबुलरी भाषा निर्देशों से भौतिक रूप से व्यवहार्य, मानव-समान हेरफेर अनुक्रम उत्पन्न किए जा सकें।

मूल लेखक: Zhenhao Zhang, Jiaxin Liu, Ye Shi, Jingya Wang

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenhao Zhang, Jiaxin Liu, Ye Shi, Jingya Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को कुछ जटिल काम करना सिखा रहे हैं, जैसे संतरे को छीलना, जार खोलना, या ब्लॉक्स को एक के ऊपर एक रखना। अतीत में, रोबोट को ये कौशल सिखाना एक बच्चे को स्टीयरिंग व्हील की केवल एक फोटो दिखाकर कार चलाना सिखाने जैसा था। रोबोट यह तो समझ सकता था कि उसे कहाँ पकड़ना है, लेकिन उसे यह नहीं पता था कि वास्तव में कार्य करने के लिए अपनी उंगलियों को सुचारू रूप से कैसे चलाना है।

यह पेपर UniHM पेश करता है, जो रोबोटिक हाथों के लिए एक नया "मस्तिष्क" है जो खेल बदल देता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "स्थिर फोटो" का जाल (The "Static Photo" Trap)

पिछले रोबोट फोटोग्राफर की तरह थे। वे एक कप की तस्वीर ले सकते थे और कह सकते थे, "ठीक है, मैं हैंडल को पकड़ूँगा।" लेकिन यदि आप उनसे "ढक्कन खोलने" के लिए कहते, तो वे ठिठक जाते। वे गति की कहानी को नहीं समझ पाते थे। वे तब भी संघर्ष करते थे जब आप उन्हें एक नया प्रकार का हाथ देते (जैसे 5 उंगलियों वाले मानव हाथ के बजाय 12 उंगलियों वाला एलियन हाथ), क्योंकि उन्हें विशेष रूप से एक ही आकार के लिए प्रशिक्षित किया गया था।

2. समाधान: "यूनिवर्सल ट्रांसलेटर" (The "Universal Translator" - UniHM)

UniHM एक बहुभाषी अनुवादक की तरह है जो एक साथ "रोबोटिक हाथ", "मानव हाथ" और "अंग्रेजी" बोल सकता है। यह एक रोबोट को "सेब उठाओ और उसे बॉक्स में डालो" जैसे मुक्त-रूप (free-form) कमांड को सुनने और आवश्यक उंगली की गतिविधियों के पूरे क्रम को समझने की अनुमति देता है।

यहाँ तीन जादुई तरीके दिए गए हैं जिनका उपयोग UniHM करता है:

क. "यूनिवर्सल लेगो सेट" (The "Universal Lego Set" - Unified Tokenizer)

कल्पना कीजिए कि आपके पास लेगो ब्रिक्स का एक डिब्बा है। कुछ सेट मानव हाथ (5 उंगलियां) के लिए हैं, कुछ रोबोट हाथ (4 उंगलियां) के लिए हैं, और कुछ स्पाइडर-बॉट (8 पैर) के लिए हैं। आमतौर पर, आप इन ब्रिक्स को मिला नहीं सकते।

  • UniHM की ट्रिक: यह एक यूनिवर्सल लेगो कोडबुक बनाता है। यह किसी भी हाथ की जटिल गतिविधियों को नंबरों वाले लेगो ब्रिक्स (टोकन) के एक सरल सेट में अनुवादित करता है।
  • इसका महत्व: यदि रोबोट मानव हाथ का उपयोग करके "कप उठाना" सीखता है, तो वह उन लेगो निर्देशों को तुरंत एक अलग आकार वाले रोबोट हाथ में अनुवादित कर सकता है। उसे पूरा कार्य फिर से सीखने की आवश्यकता नहीं है; उसे बस ब्रिक्स बदलने हैं।

ख. "मूवी डायरेक्टर" (The "Movie Director" - Vision Language Model)

केवल एक फोटो देखने के बजाय, UniHM इंसानों के वीडियो देखता है जो कार्य कर रहे होते हैं।

  • पुराना तरीका: रोबोटों को सीखने के लिए महंगे, धीमे "टेलीऑपरेशन" (एक इंसान जो सूट पहनकर रोबोट को वास्तविक समय में नियंत्रित करता है) की आवश्यकता होती थी। यह हर दृश्य के लिए एक स्टंट डबल को काम पर रखने जैसा है।
  • UniHM का तरीका: यह देखता है कि हजारों वीडियो में इंसान वस्तुओं के साथ कैसे व्यवहार कर रहे हैं (जैसे कि एक यूट्यूब ट्यूटोरियल)। यह गति के अंदाज़ (vibe) और प्रवाह (flow) को सीखता है।
  • परिणाम: यह किसी भी वस्तु के लिए, जिसे उसने पहले कभी नहीं देखा, एक हाथ के हिलने का एक सहज, मानव जैसा वीडियो बना सकता है, बस एक टेक्स्ट प्रॉम्प्ट पढ़कर।

ग. "फिजिक्स सेफ्टी नेट" (The "Physics Safety Net" - Dynamic Refinement)

कभी-कभी, रोबोट का "मूवी डायरेक्टर" थोड़ा अधिक रचनात्मक हो जाता है और ऐसा सुझाव देता है जिससे रोबोट की उंगलियां टूट सकती हैं या वस्तु फिसल सकती है।

  • UniHM की ट्रिक: रोबोट के वास्तव में हिलने से पहले, यह एक आभासी भौतिक सिम्युलेटर (virtual physics simulator) चलाता है। इसे एक "रियलिटी चेक" या सुरक्षा जाल के रूप में सोचें।
  • यह कैसे काम करता है: यह रोबोट की कच्ची योजना लेता है और उंगलियों को धीरे से समायोजित करता है ताकि यह सुनिश्चित हो सके कि वे चीजों से न टकराएं, पकड़ पर्याप्त मजबूत हो, और गति सुचारू हो। यह एक डांस इंस्ट्रक्टर की तरह है जो मंच पर कदम रखने से ठीक पहले छात्र के पोस्चर (मुद्रा) को सुधारता है।

3. परिणाम: एक रोबोट जो "समझता है"

इन तीन ट्रिक्स के कारण, UniHM कर सकता है:

  • कुछ भी सुन सकता है: आप कह सकते हैं "कैप घुमाओ," "दराज खिसकाओ," या "ब्लॉक्स को एक के ऊपर एक रखो," और यह समझ जाता है।
  • नए हाथों के अनुकूल हो सकता है: आप रोबोट के हाथ को दूसरे मॉडल से बदल सकते हैं, और यह फिर भी काम करता है।
  • वास्तविक दुनिया में काम कर सकता है: परीक्षणों में, इसने वास्तविक जीवन में वस्तुओं को पकड़ने, हिलाने और हेरफेर करने में पिछले तरीकों की तुलना में बहुत बेहतर प्रदर्शन किया, यहाँ तक कि उन वस्तुओं के लिए भी जिन्हें इसने पहले कभी नहीं देखा था।

बड़ी तस्वीर (The Big Picture)

UniHM को रोबोटिक हाथों के लिए रोसेटा स्टोन (Rosetta Stone) के रूप में सोचें। यह मानव भाषा, मानव गति और रोबोटिक मैकेनिक्स के बीच के अंतर को पाटता है। यह रोबोटों को कठोर, एकल-उद्देश्य वाली मशीनों के रूप में रुकने से रोकता है और उन्हें लचीले सहायकों में बदल देता है जो केवल एक वीडियो देखकर और एक सरल कमांड सुनकर नए करतब सीख सकते हैं।

संक्षेप में: यह रोबोटों को स्थिर पोज़ (static poses) में सोचना बंद करने और कहानियों (stories) के रूप में सोचना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →