← नवीनतम पेपर
💻 computer science

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

यह शोध पत्र इस धारणा को चुनौती देता है कि विजन-लैंग्वेज-एक्शन (VLA) मॉडलों में पैरामीटर रेडंडेंसी (parameter redundancy) समान होती है, और VLM-से-VLA अनुकूलन के दौरान संरचित विचलन पैटर्न (structured divergence patterns) को प्रकट करते हुए एक नवीन मल्टी-मॉड्यूल जॉइंट प्रूनिंग रणनीति प्रस्तुत करता है जो बिना किसी पोस्ट-प्रूनिंग रिकवरी की आवश्यकता के मूल प्रदर्शन का 90% बनाए रखते हुए महत्वपूर्ण पैरामीटर कमी (12%–30%) प्राप्त करता है।

मूल लेखक: Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व-स्तरीय शेफ है (जिसे विज़न-लैंग्वेज मॉडल, या VLM कहा जाता है) जो व्यंजनों का वर्णन कर सकता है, सामग्रियों की पहचान कर सकता है, और भोजन के बारे में अविश्वसनीय विवरण के साथ बात कर सकता है। अब, आप इस शेफ को एक रोबोट में बदलना चाहते हैं जो वास्तव में एक वास्तविक रसोई में खाना बना सके (जिसे विज़न-लैंग्वेज-एक्शन मॉडल, या VLA कहा जाता है)।

इसे करने के लिए, आप शेफ के दिमाग को लेते हैं और उसमें कुछ नए "मांसपेशी" कनेक्शन जोड़ते हैं ताकि वह चाकू उठा सके और बर्तन चला सके। लेकिन समस्या यह है कि शेफ का दिमाग बहुत विशाल है, जो लाखों न्यूरॉन्स से भरा हुआ है। रोबोट धीमा है, इसे चलाना महंगा है, और यह बहुत अधिक जगह घेरता है। आप इस दिमाग को छोटा करना चाहते हैं ताकि यह तेज़ हो सके, लेकिन आप गलत चीज़ काटने से डरते हैं, जिससे आपका रोबोट एक बेकार धातु के ढेर में बदल जाए।

पुराना तरीका: "काटो और उम्मीद करो"

पारंपरिक रूप से, जब इंजीनियर इन रोबोटिक दिमागों को सिकोड़ने की कोशिश करते थे, तो वे बस उन हिस्सों को काटना शुरू कर देते थे जिन्हें वे "अतिरिक्त" समझते थे।

  • परिणाम: रोबोट तुरंत काम करना बंद कर देता था। वह कप पकड़ना या अपना हाथ हिलाना भूल जाता था।
  • समाधान: इंजीनियर कहते थे, "ओह, यह अपेक्षित ही था।" फिर वे रोबोट को फिर से सिखाने (फाइन-ट्यूनिंग) में कई दिन या सप्ताह बिता देते थे ताकि उसे फिर से काम करने लायक बनाया जा सके।
  • पेपर का बड़ा सवाल: इस पेपर के लेखक पूछते हैं: "यदि हमें रोबोट को सब कुछ फिर से सिखाना पड़ता है जब हमने उसे काटा, तो क्या वह वास्तव में 'अतिरिक्त' चीज़ थी जिसे हमने हटाया? या हमने गलती से उसके हाथ और आँखें काट दीं?"

उनका तर्क है कि फिर से सिखाने पर निर्भर रहना इस तथ्य को छिपाता है कि हमने महत्वपूर्ण हिस्सों को काट दिया था। यदि कोई हिस्सा वास्तव में बेकार है, तो रोबोट बिना किसी मदद के, काटने के बाद भी ठीक से काम करता रहना चाहिए।

नई खोज: "ग्रोथ मैप" (विकास मानचित्र)

लेखकों ने खाना बनाना सीखने से पहले और बाद में रोबोट के दिमाग को देखा। उन्होंने "पुराने शेफ के दिमाग" (VLM) की तुलना "नए रोबोट के दिमाग" (VLA) से की।

उन्होंने पाया कि दिमाग बेतरतीब ढंग से नहीं बदला। यह बहुत विशिष्ट, संगठित पैटर्न में बदला, जैसे कि एक नक्शा जो दिखा रहा हो कि नए "मांसपेशी" कनेक्शन कहाँ बढ़ रहे हैं।

  • कुछ हिस्से बहुत बदले: ये वे हिस्से थे जो रोबोट के हाथ को नियंत्रित करना सीख रहे थे।
  • कुछ हिस्से वैसे ही रहे: ये वे हिस्से थे जिन्हें अभी भी केवल टमाटर या चम्मच को पहचानने की आवश्यकता थी।
  • कुछ हिस्से अजीब तरह से बदले: कुछ परतों में बदलाव बहुत बड़े थे; अन्य में वे बहुत छोटे थे।

उन्होंने महसूस किया कि यह "परिवर्तन मानचित्र" (जिसे वे Δ\DeltaW कहते हैं) एक गुप्त मार्गदर्शक है। यह आपको बताता है कि दिमाग के कौन से हिस्से रोबोट के लिए भारी काम कर रहे हैं और कौन से हिस्से शेफ के पुराने जीवन के अवशेष मात्र हैं।

प्रयोग: "नियंत्रित सर्जरी"

अपने सिद्धांत को सिद्ध करने के लिए, उन्होंने रोबोट के दिमाग पर एक "नियंत्रित सर्जरी" की। अंदाज़ा लगाने के बजाय, उन्होंने अपने "परिवर्तन मानचित्र" का उपयोग यह तय करने के लिए किया कि क्या काटना है।

  1. गलत कट: उन्होंने उन हिस्सों को काटने की कोशिश की जो बहुत कम बदले थे (यह सोचकर कि वे सुरक्षित अवशेष हैं)। परिणाम: रोबोट तुरंत ढह गया। वह हिल भी नहीं पा रहा था।
  2. सही कट: उन्होंने उन हिस्सों को काटने की कोशिश की जो बहुत अधिक बदले थे (यह सोचकर कि ये नए, सक्रिय हिस्से हैं)। परिणाम: आश्चर्यजनक रूप से, रोबोट लगभग पूरी तरह से काम करता रहा!

उपमा: एक घर की कल्पना करें। पुराने शेफ ने वहां रहा और उसके पास किताबों से भरी एक लाइब्रेरी थी (VLM)। जब रोबोट वहां आया, तो उसने बेसमेंट में एक नया जिम बनाया (VLA अनुकूलन)।

  • पुराना तरीका दीवारों को बेतरतीब ढंग से गिराना था। यदि घर गिर जाता, तो वे बाद में दीवारें फिर से बना लेते।
  • नया तरीका नए जिम के ब्लूप्रिंट को देखना था। उन्होंने महसूस किया कि जिम के नए सपोर्ट बीम वे हिस्से थे जो बदले थे। उन्होंने पाया कि पुराने लाइब्रेरी की किताबें, जो बिल्कुल नहीं बदली थीं, वास्तव में छत को थामे हुए थीं! जिम के उन नए हिस्सों को काटकर जो वास्तव में अनावश्यक थे (या बदले हुए हिस्सों को रखकर जो महत्वपूर्ण थे), वे घर को बिना ढहे छोटा कर सके।

परिणाम: छोटा, तेज़, कोई पुन: शिक्षण नहीं

इस "परिवर्तन मानचित्र" रणनीति का उपयोग करके, उन्होंने दो प्रसिद्ध रोबोटिक दिमागों (OpenVLA और π\pi0.5) को 12% से 30% तक सफलतापूर्वक सिकोड़ा।

  • जादू: उन्होंने यह सब बिना किसी पुन: शिक्षण या फाइन-ट्यूनिंग के किया। काटने के तुरंत बाद रोबोट काम करने लगा।
  • तुलना: जब उन्होंने अन्य लोकप्रिय काटने के तरीकों (जैसे "सबसे बड़ी संख्याओं को काटो" या "सबसे अधिक उपयोग की जाने वाली संख्याओं को काटो") को आजमाया, तो रोबोट पूरी तरह से विफल हो गया जब तक कि उन्हें लंबे समय तक पुन: प्रशिक्षित नहीं किया गया।
  • दक्षता: उन्होंने मूल प्रदर्शन का लगभग 90% बनाए रखते हुए बहुत सारी मेमोरी बचाई (जिससे रोबोट छोटे, सस्ते कंप्यूटरों पर चल सके)।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हमें केवल यह अनुमान नहीं लगाना चाहिए कि क्या काटना है या बाद में गलतियों को ठीक करने पर निर्भर नहीं रहना चाहिए। यह देखकर कि रोबोट ने चलने के लिए कैसे बदलाव किए, हम सटीकता के साथ "अतिरिक्त" हिस्सों को पा सकते हैं। यह हमें छोटे, तेज़ और अधिक कुशल रोबोट बनाने की अनुमति देता है जो सीमित संसाधनों पर चल सकें, केवल यह समझकर कि जब शेफ रोबोट बना तो विशेष रूप से क्या "विकास" हुआ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →