← नवीनतम पेपर
💻 computer science

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA एक मर्जिंग-ओरिएंटेड विजन-लैंग्वेज-एक्शन आर्किटेक्चर है जो टास्क-मास्क्ड स्पार्स LoRA एडेप्टर्स और क्रॉस-अटेंशन-ओनली एक्शन एक्सपर्ट्स को पेश करके मौजूदा VLA एक्सपर्ट्स की नॉन-मर्जिएबिलिटी (विलय न होने की क्षमता) को दूर करता है, जिससे एक एकल जनरलिस्ट एजेंट को बिना किसी प्रदर्शन गिरावट के विविध कार्यों और एम्बॉडिमेंट्स को मजबूती से संभालने में सक्षम बनाया जा सके।

मूल लेखक: Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार रोबोट शेफ है। आपने इस शेफ को एक बेहतरीन पिज्जा (कार्य A) बनाना सिखाया है। फिर, आपने उसी शेफ के एक अलग संस्करण को बेहतरीन सुशी (कार्य B) बनाना सिखाया है। दोनों अपने आप में विशेषज्ञ हैं।

अब, आप एक ही रोबोट चाहते हैं जो पिज्जा और सुशी दोनों कर सके, बिना दो अलग-अलग दिमागों की आवश्यकता के। आप इन दोनों शेफों को एक "सुपर-शेफ" में मिलाने की कोशिश करते हैं।

समस्या:
वर्तमान AI रोबोट्स (जिन्हें विज़न-लैंग्वेज-एक्शन या VLA मॉडल कहा जाता है) की दुनिया में, यह विलय आमतौर पर बुरी तरह विफल हो जाता है। यदि आप "पिज्जा ब्रेन" और "सुशी ब्रेन" को मिलाने की कोशिश करते हैं, तो परिणाम एक भ्रमित रोबोट होता है जो दोनों में से कुछ भी नहीं कर पाता। वह शायद फिश रोल पर पेपरोनी डालने की कोशिश करेगा, या वह पूरी तरह से ठप हो जाएगा।

क्यों? शोधकर्ताओं ने इसके दो मुख्य कारण खोजे:

  1. "दिमाग" का संघर्ष: रोबोट का वह हिस्सा जो देखता है और भाषा को समझता है (विज़न-लैंग्वेज मॉडल), पिज्जा के लिए इतना विशिष्ट हो जाता है कि वह सुशी को कैसे संभालना है, यह भूल जाता है, और इसके विपरीत भी। जब आप इन्हें मिलाते हैं, तो निर्देश आपस में टकराते हैं।
  2. "हाथों" का संघर्ष: वह हिस्सा जो वास्तव में हाथों को चलाता है (एक्शन एक्सपर्ट), अपनी आंतरिक आदतों पर निर्भर रहने लगता है। यह एक पियानो वादक की तरह है जिसने हर उंगली की हरकत को एक चेन रिएक्शन के रूप में याद करके एक विशिष्ट गाना सीखा है। यदि आप उसे जैज़ प्लेयर की आदतों के साथ मिलाने की कोशिश करते हैं, तो वह चेन रिएक्शन टूट जाता है, और हाथ काम करना बंद कर देते हैं।

समाधान: MergeVLA
लेखकों ने एक नया रोबोट आर्किटेक्चर बनाया जिसे MergeVLA कहा जाता है। इसे एक एकल, कठोर मस्तिष्क के बजाय एक मॉड्यूलर टूलकिट वाले रोबोट के रूप में समझें। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए:

1. "स्मार्ट स्विचबोर्ड" (टास्क मास्क)

कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल पुस्तकालय है। जब रोबोट पिज्जा बनाना सीखता है, तो वह विशिष्ट पृष्ठों पर नए नोट्स लिखता है। जब वह सुशी सीखता है, तो वह अलग पृष्ठों पर लिखता है।

  • पुराना तरीका: आप दोनों किताबों को आपस में चिपकाने की कोशिश करते हैं। नोट्स एक-दूसरे के ऊपर आ जाते हैं, एक-दूसरे को काट देते हैं, और कहानी निरर्थक हो जाती है।
  • MergeVLA का तरीका: किताबों को चिपकाने के बजाय, आप हर पन्ने पर एक स्मार्ट स्विच लगाते हैं। जब रोबोट को पिज्जा बनाना होता है, तो स्विच पिज्जा वाले पन्नों को चालू कर देता है और सुशी वाले पन्नों को बंद कर देता है। जब उसे सुशी बनानी होती है, तो वह स्विच बदल देता है। इस तरह, "पिज्जा नोट्स" "सुशी नोट्स" से कभी नहीं लड़ते। वे एक ही किताब में शांति से सह-अस्तित्व में रहते हैं।

2. "डायरेक्ट लाइन" (क्रॉस-अटेंशन ओनली)

रोबोट के "हाथों" (एक्शन एक्सपर्ट) की एक आदत थी खुद से ही बातें करने की। "मैं चाकू पकड़े हुए हूँ, इसलिए मुझे अपनी कोहनी हिलानी चाहिए, जिसका अर्थ है कि मुझे अपनी कलाई घुमानी चाहिए..." इस आंतरिक शोर ने हाथों को एक विशिष्ट कार्य के लिए तो बहुत अच्छा बना दिया, लेकिन दूसरे कार्य के अनुकूल होने के लिए बहुत खराब।

  • MergeVLA का तरीका: लेखकों ने "आंतरिक शोर" (सेल्फ-अटेंशन) को हटा दिया है। अब, हाथ केवल "मस्तिष्क" (विज़न-लैंग्वेज भाग) की बात सुनते हैं। मस्तिष्क कहता है, "लाल ब्लॉक उठाओ," और हाथ बस उसे कर देते हैं। क्योंकि हाथ अपनी आंतरिक आदतों के बारे में बहुत अधिक नहीं सोच रहे हैं, वे विभिन्न कार्यों के बीच आसानी से साझा किए जा सकते हैं।

3. "मैजिक डिटेक्टिव" (टेस्ट-टाइम राउटर)

क्या होगा यदि आप रोबोट के पास जाएँ और कहें, "एक सैंडविच बनाओ," लेकिन आप उसे यह नहीं बताते कि कौन सा सैंडविच? वह कैसे जानेगा कि कौन सा "स्विच" चालू करना है?

  • MergeVLA का तरीका: रोबोट के भीतर एक मैजिक डिटेक्टिव (जादुई जासूस) है। वह रसोई की तस्वीर और आपके द्वारा कहे गए शब्दों को देखता है। वह जल्दी से अपने आंतरिक "सबस्पेस" (एक फैंसी तरीका यह कहने का कि वह अपने मस्तिष्क में छिपे पैटर्न को देखता है) की जाँच करता है और अनुमान लगाता है: "आह, यह एक 'पिज्जा' कार्य लग रहा है!" या "यह 'सुशी' जैसा लग रहा है!"
  • एक बार जब जासूस कार्य का अनुमान लगा लेता है, तो वह तुरंत सही स्विच चालू कर देता है और सही "हाथों" (एक्सपर्ट हेड) का उपयोग करता है। वह यह काम बिना पुन: प्रशिक्षित हुए या मदद मांगे करता है।

परिणाम

टीम ने वास्तविक रोबोट और सिमुलेशन पर इसका परीक्षण किया:

  • सिमुलेशन में: मर्ज किया गया रोबोट बिस्तर बनाने, ब्लॉक रखने और वस्तुओं को धकेलने के बीच 90% सफलता के साथ स्विच कर सका, जो लगभग उतना ही अच्छा है जितना कि प्रत्येक के लिए अलग से प्रशिक्षित किया गया हो।
  • वास्तविक दुनिया में: उन्होंने इसे एक वास्तविक रोबोटिक आर्म पर लगाया। यह क्यूब्स को उठाने, उन्हें धकेलने और उन्हें एक के ऊपर एक रखने में सक्षम था, भले ही क्यूब्स के रंग उन रंगों से अलग थे जिनके लिए इसे प्रशिक्षित किया गया था।

बड़ी तस्वीर

यह पेपर एक बड़ी उपलब्धि है क्योंकि यह साबित करता है कि हमें हर एक नए कौशल के लिए एक विशाल, नया रोबोट प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, हम छोटे, विशिष्ट "विशेषज्ञों" को प्रशिक्षित कर सकते हैं, उन्हें इस स्मार्ट "स्विचबोर्ड" डिज़ाइन का उपयोग करके एक साथ मिला सकते हैं, और एक ऐसा सामान्य रोबोट बना सकते हैं जो लगभग कुछ भी संभाल सकता है। यह 100 अलग-अलग औजारों वाले टूलबॉक्स बनाम एक ऐसे स्विस आर्मी नाइफ (Swiss Army Knife) के बीच का अंतर है जो तुरंत उस औजार में बदल सकता है जिसकी आपको आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →