← नवीनतम पेपर
💻 computer science

Cross-Hand Latent Representation for Vision-Language-Action Models

यह शोध पत्र XL-VLA को प्रस्तुत करता है, जो एक विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो स्केलेबल क्रॉस-एम्बॉडमेंट ट्रेनिंग को सक्षम करने और विविध रोबोटिक हाथों में डेक्सट्रस मैनिपुलेशन प्रदर्शन को बेहतर बनाने के लिए एक एकीकृत, एम्बॉडमेंट-इनवेरिएंट लेटेंट एक्शन स्पेस का उपयोग करता है।

मूल लेखक: Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "XL-VLA: Cross-Hand Latent Representation for Vision-Language-Action Models" का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "यूनिवर्सल रिमोट" की दुविधा

कल्पना कीजिए कि आपके घर में कई अलग-अलग रोबोट हैं।

  • रोबोट A के पास इंसान जैसा हाथ है जिसमें 5 उंगलियां और 12 जोड़ (joints) हैं।
  • रोबोट B के पास 4 उंगलियों और 16 जोड़ों वाला हाथ है।
  • रोबोट C के पास एक अजीब, एलियन जैसा दिखने वाला हाथ है जिसमें 3 उंगलियां हैं।

यदि आप उन सभी को "केला उठाने" के लिए सिखाना चाहते हैं, तो आपको आमतौर पर प्रत्येक के लिए निर्देशों का एक पूरी तरह से अलग सेट लिखना होगा। यह तीन अलग-अलग लोगों को पियानो बजाना सिखाने जैसा है, लेकिन एक के पास 88 कुंजियाँ (keys) हैं, एक के पास 60, और एक के पास 40। आप केवल यह नहीं कह सकते, "मिडल C दबाओ," क्योंकि हर कीबोर्ड पर "मिडल C" का अर्थ पूरी तरह से अलग होता है।

रोबोटिक्स की दुनिया में, इसे एम्बॉडमेंट समस्या (Embodiment Problem) कहा जाता है। हर रोबोट का हाथ अलग तरह से बनाया गया है, इसलिए उसके जोड़ों को हिलाने की "भाषा" (action space) अद्वितीय है। किसी रोबोट को कोई कार्य करने के लिए प्रशिक्षित करने के लिए आमतौर पर उस विशिष्ट रोबोट के लिए भारी मात्रा में डेटा एकत्र करने की आवश्यकता होती है। यदि कल एक नया रोबोट आता है, तो आपको फिर से शुरुआत करनी होगी।

समाधान: "यूनिवर्सल ट्रांसलेटर" (XL-VLA)

शोधकर्ताओं ने कैलिफोर्निया विश्वविद्यालय, सैन डिएगो और अमेज़न द्वारा विकसित एक प्रणाली बनाई जिसे XL-VLA कहा जाता है। इसे रोबोटिक हाथों के लिए एक यूनिवर्सल ट्रांसलेटर (सार्वभौमिक अनुवादक) के रूप में समझें।

रोबोट को यह सिखाने के बजाय कि "जोड़ नंबर 3 को 5 डिग्री ऊपर ले जाओ," XL-VLA रोबोट को एक गुप्त कोड ("लेटेंट एक्शन") सिखाता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. गुप्त कोड (द लेटेंट स्पेस)

एक "यूनिवर्सल रिमोट कंट्रोल" की कल्पना करें जिसे इस बात से फर्क नहीं पड़ता कि आपके पास किस ब्रांड का टीवी है। यह संकेत नहीं भेजता जैसे "सैमसंग का वॉल्यूम बढ़ाएं।" इसके बजाय, यह एक शुद्ध अवधारणा भेजता है: "इसे तेज़ करें।"

XL-VLA एक साझा "गुप्त कोड" स्थान बनाता है।

  • जब रोबोट केला देखता है और सुनता है "इसे उठाओ," तो वह तुरंत विशिष्ट जोड़ों के कोण (joint angles) की गणना नहीं करता है।
  • इसके बजाय, वह उस विचार को एक एकल, संक्षिप्त वेक्टर (एक गुप्त भाषा में एक संख्या) में बदल देता है।
  • यह संख्या हाथ की विशिष्ट यांत्रिकी के बजाय, गति के इरादे (intent) का प्रतिनिधित्व करती है।

2. अनुवादक (द एनकोडर/डिकोडर)

यहीं पर जादू होता है।

  • एनकोडर (Encoder): रोबोट के कार्य करने से पहले, एक विशेष अनुवादक उस विशिष्ट हाथ के लिए विशिष्ट निर्देशों (जैसे, "एबिलिटी हैंड जोड़ 1 को हिलाएं") को लेता है और उसे गुप्त कोड में बदल देता है।
  • दिमाग (VLA): मुख्य AI मस्तिष्क (विज़न-लैंग्वेज-एक्शन मॉडल) केवल और केवल उस गुप्त कोड को देखता है और सीखता है। उसे इस बात से कोई फर्क नहीं पड़ता कि हाथ में 4 उंगलियां हैं या 5। वह बस सीखता है: "जब मैं केला देखता हूँ, तो गुप्त कोड 'X' होता है।"
  • डिकोडर (Decoder): जब दिमाग कहता "कोड X करो," तो उस विशिष्ट हाथ के लिए एक विशेष अनुवादक "कोड X" को उस हाथ के विशिष्ट जोड़ों की गतिविधियों में बदल देता है।

उपमा:
गुप्त कोड को एक सार्वभौमिक भाषा में लिखी गई रेसिपी के रूप में सोचें।

  • दिमाग (Brain) वह शेफ है जो रेसिपी जानता है।
  • एबिलिटी हैंड (Ability Hand) एक फ्रांसीसी शेफ है जिसे खाना पकाने के लिए रेसिपी को फ्रेंच में अनुवादित करने की आवश्यकता है।
  • पैक्सिनी हैंड (Paxini Hand) एक जापानी शेफ है जिसे रेसिपी को जापानी में अनुवादित करने की आवश्यकता है।
  • XL-VLA सिस्टम वह अनुवादक है। शेफ (दिमाग) केवल सार्वभौमिक भाषा बोलता है। अनुवादक (एनकोडर/डिकोडर) प्रत्येक रोबोटिक हाथ के विशिष्ट बोलियों को संभालते हैं।

यह एक बड़ी बात क्यों है?

1. एक दिमाग, कई हाथ

अतीत में, यदि आप चाहते थे कि एक रोबोट डिब्बे को एक के ऊपर एक रखना सीखे, तो आपको "एबिलिटी हैंड" के लिए 2,000 घंटे का डेटा, फिर "इंस्पायर हैंड" के लिए 2,000 घंटे का डेटा, इत्यादि एकत्र करना पड़ता था।
XL-VLA के साथ, आप एक ही मस्तिष्क को सभी चार अलग-अलग हाथों के डेटा पर एक साथ प्रशिक्षित कर सकते हैं। क्योंकि वे सभी एक ही "गुप्त कोड" बोलते हैं, मस्तिष्क एक बार "स्टैकिंग" (एक के ऊपर एक रखना) की अवधारणा सीख जाता है, और यह सभी के लिए काम करता है।

2. ज़ीरो-शॉट लर्निंग (द मैजिक ट्रिक)

यह सबसे शानदार हिस्सा है। कल्पना कीजिए कि आपने एक रोबोट को 9 कार्यों (जैसे डिब्बे रखना, चीनी डालना) के लिए "एबिलिटी हैंड" का उपयोग करके प्रशिक्षित किया है। आपने उसे कभी भी "इंस्पायर हैंड" को वे कार्य करते हुए नहीं दिखाया है।
फिर, आप उसे "इंस्पायर हैंड" को एक नया कार्य (जैसे "बॉक्स को धक्का देना") देते हैं जो उसने पहले कभी नहीं देखा है।
क्योंकि "गुप्त कोड" सार्वभौमिक है, "इंस्पायर हैंड" अक्सर बिना किसी नए प्रशिक्षण डेटा के, केवल निर्देशों को देखकर यह समझने में सक्षम होता है कि नया कार्य कैसे करना है। यह एक ऐसे इंसान को साइकिल चलाने के ज्ञान को ट्राइसाइकिल पर लागू करने जैसा है; उन्हें संतुलन बनाना फिर से सीखने की आवश्यकता नहीं है, वे बस अनुकूलित हो जाते हैं।

3. "रिटारगेटिंग" बनाम "ट्रांसलेशन" की बहस

पुराने तरीके "रिटारगेटिंग" (re-targeting) का प्रयास करते थे। यह एक मानव हाथ के वीडियो को लेने और गणितीय रूप से उसे एक रोबोटिक हाथ में फिट होने के लिए खींचने जैसा है। यह अक्सर झटकेदार दिखता है या टूट जाता है क्योंकि हाथ बहुत अलग होते हैं।
XL-VLA बेहतर है क्योंकि यह हाथ को खींचने की कोशिश नहीं करता; यह इरादे (intent) का अनुवाद करता है। यह चौकोर खांचे में गोल खूंटा जबरदस्ती डालने के प्रयास (रिटारगेटिंग) और एक 3D प्रिंटर होने के बीच का अंतर है जो तुरंत खांचे के आकार के अनुसार खूंटे को नया रूप दे सकता है (XL-VLA)।

परिणाम

शोधकर्ताओं ने इसका परीक्षण चार बहुत अलग रोबोटिक हाथों और 10 अलग-अलग कार्यों (जैसे डिब्बे छाँटना, सॉस डालना और बोतलें पकड़ाना) पर किया।

  • पुराना तरीका (मानक AI): सफलता दर लगभग 32% थी। इसे हाथों के बीच स्विच करने में संघर्ष करना पड़ा।
  • XL-VLA: सफलता दर बढ़कर 72% हो गई।
  • "ज़ीरो-शॉट" टेस्ट: जब उन्होंने उन कार्यों को आज़माया जो रोबोट ने पहले कभी नहीं देखे थे, तो XL-VLA पुराने तरीकों की तुलना में बहुत बेहतर काम करता रहा।

सारांश

XL-VLA एक बड़ी उपलब्धि है क्योंकि यह हर रोबोटिक हाथ को एक अद्वितीय, अलग समस्या के रूप में देखना बंद कर देता है। इसके बजाय, यह गति की एक सार्वभौमिक "भाषा" बनाता है जो एक ही AI मस्तिष्क को कई अलग-अलग प्रकार के हाथों को एक साथ नियंत्रित करने की अनुमति देता है।

यह हर बार एक नए व्यक्ति से मिलने पर एक नई भाषा सीखने के बजाय, एक सार्वभौमिक अनुवादक होने के समान है जो आपको कहीं भी, किसी से भी तुरंत बात करने की अनुमति देता है। यह रोबोटों को प्रशिक्षित करना बहुत तेज़, सस्ता और रोबोटिक हार्डवेयर की तेज़ी से बदलती दुनिया के अनुकूल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →