← नवीनतम पेपर
💻 computer science

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

यह शोध पत्र VLAct को पेश करता है, जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक रिप्रेजेंटेशन-केंद्रित निरंतर प्री-ट्रेनिंग दृष्टिकोण है, जो विविध कार्यों और अनदेखे रोबोट्स में बेहतर हस्तांतरणीयता और प्रदर्शन प्राप्त करने के लिए हेट्रोजेनियस मल्टी-एम्बॉडिमेंट डेटा का लाभ उठाता है, यहाँ तक कि मामूली कंप्यूट बजट और सीमित डाउनस्ट्रीम डेटा के तहत भी।

मूल लेखक: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, J
प्रकाशित 2026-08-31
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से मनुष्यों की तरह अनुभव से सीखने के लिए संघर्ष कर रहे हैं। जहाँ एक बच्चा अपने माता-पिता को पानी का गिलास भरते हुए देखकर उस गति को समझ सकता है, वहीं एक रोबोट को आमतौर पर उसी कार्य को करने के लिए हजारों विशिष्ट, हाथ से लिखे गए निर्देशों की आवश्यकता होती है। वर्षों से, वैज्ञानिकों ने रोबनों को भारी मात्रा में डेटा खिलाकर इसे हल करने की कोशिश की है, इस उम्मीद में कि डेटा की विशाल मात्रा उन्हें हिलना-डुलना सिखा देगी। यह दृष्टिकोण विजन-लैंग्वेज-एक्शन (Vision-Language-Action) मॉडल पर निर्भर करता है, जो ऐसे कंप्यूटर सिस्टम हैं जो एक छवि देख सकते हैं, एक वाक्य समझ सकते हैं, और एक भौतिक गति का निर्णय ले सकते हैं। प्रचलित धारणा यह रही है कि यदि आप पर्याप्त मात्रा में रोबोटिक गतिविधियाँ एकत्र कर लेते हैं, तो सिस्टम स्वाभाविक रूप से किसी भी स्थिति को संभालने के लिए पर्याप्त स्मार्ट हो जाएगा। हालाँकि, रोबोट का डेटा एकत्र करना अविश्वसनीय रूप से कठिन और महंगा है; इंटरनेट पर मौजूद फोटो या टेक्स्ट के विपरीत, रोबोट की गतिविधियों को वास्तविक भौतिक दुनिया में रिकॉर्ड किया जाना चाहिए, जो अक्सर मशीनों को निर्देशित करने वाले मनुष्यों द्वारा किया जाता है। इस कमी का अर्थ यह है कि सबसे बड़े रोबोट डेटासेट भी भौतिक दुनिया की विशालता की तुलना में बहुत छोटे और विरल होते हैं।

शोधकर्ताओं की एक टीम ने अब आगे बढ़ने का एक अलग रास्ता प्रस्तावित किया है, जिसमें सुझाव दिया गया है कि रोबोट जो देखता है उस डेटा की मात्रा से अधिक महत्वपूर्ण वह गुणवत्ता है जो वह सीखता है। उनका तर्क है कि केवल विशिष्ट गतिविधियों को याद करने के बजाय, रोबोट के मस्तिष्क को वस्तुओं और क्रियाओं के बीच संबंध की गहरी, लचीली समझ विकसित करने की आवश्यकता है। इस "रिप्रजेंटेशन" (representation)—वह आंतरिक मानचित्र जिसे रोबोट दुनिया का निर्माण करता है—पर ध्यान केंद्रित करके, उन्होंने एक नई प्रशिक्षण पद्धति बनाई है जो रोबोट को बहुत बेहतर तरीके से सामान्यीकरण (generalize) करने की अनुमति देती है। उनका कार्य प्रदर्शित करता है कि रोबोट के मुख्य मस्तिष्क को सिखाने के एक स्मार्ट तरीके के साथ, एक सिस्टम उन रोबोटों पर जटिल कार्य करने में सक्षम हो सकता है जिन्हें उसने पहले कभी नहीं देखा है, और इसके लिए पहले आवश्यक समझे जाने वाले डेटा के एक अंश का ही उपयोग होता है।

शोधकर्ता, जो VLAct के नाम से काम कर रहे हैं, एक मौलिक प्रश्न के साथ शुरू हुए: रोबोट सामान्यीकरण करने में विफल क्यों होते हैं? जब एक रोबोट को गतिविधियों के एक विशिष्ट सेट पर प्रशिक्षित किया जाता है, तो वह अक्सर बहुत अधिक विशिष्ट हो जाता है, जो कार्य के अंतर्निहित भौतिकी को समझने के बजाय केवल उन्हीं पैटर्न की नकल करने लगता है जिन्हें उसने देखा था। इसकी जांच करने के लिए, टीम ने इस बात पर गौर किया कि रोबोट को सिखाने के विभिन्न तरीकों ने उसकी आंतरिक समझ को कैसे प्रभावित किया। उन्होंने पाया कि यदि एक रोबोट को केवल एक विशिष्ट विधि का उपयोग करके क्रियाओं की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, तो वह उस विधि में "लॉक-इन" (locked in) हो जाता है। यह एक ऐसे छात्र की तरह है जो गणित के सवालों को हल करने के लिए केवल एक विशिष्ट सूत्र का उपयोग करना सीखता है; यदि परीक्षा में प्रश्न का प्रारूप बदल जाता है, तो छात्र विफल हो जाता है क्योंकि उसने कभी अवधारणा को नहीं सीखा था। शोधकर्ताओं ने पाया कि यह "लॉक-इन" तब होता है जब रोबोट के मस्तिष्क को प्रशिक्षण के दौरान एक एकल, कठोर संरचना में अपने ज्ञान को फिट करने के लिए मजबूर किया जाता है।

इसे ठीक करने के लिए, टीम ने एक नया प्रशिक्षण नुस्खा विकसित किया जो रोबोट के मस्तिष्क को लचीला रखता है। उन्होंने एक शक्तिशाली विजन-लैंग्वेज मॉडल से शुरुआत की, जो एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जो पहले से ही इंटरनेट की विशाल छवियों और टेक्स्ट पर प्रशिक्षित है, जो इसे दुनिया की एक व्यापक समझ देता है। रोबोट प्रशिक्षण को इस व्यापक ज्ञान को ओवरराइट करने देने के बजाय, उन्होंने मस्तिष्क के निचले स्तरों की रक्षा की जो बुनियादी दृश्य पहचान को संभालते हैं। फिर उन्होंने एक अनूठी प्रशिक्षण तकनीक पेश की जहाँ रोबोट से एक ही भौतिक गतिविधियों का तीन अलग-अलग गणितीय तरीकों से एक साथ अनुमान लगाने के लिए कहा गया। रोबोट को एक साथ तीनों विधियों को संतुष्ट करने के लिए मजबूर करके, शोधकर्ताओं ने इसे केवल एक विधि में विशेषज्ञ होने से रोका। इस दृष्टिकोण ने यह सुनिश्चित किया कि रोबोट क्रिया की एक सार्वभौमिक समझ सीखे, न कि गति की गणना करने के एक एकल तरीके से जुड़ी एक संकीर्ण दक्षता।

इसके अलावा, टीम ने अलग-अलग रोबोटिक शरीरों की समस्या का समाधान किया। दो भुजाओं वाला रोबोट एक भुजा वाले रोबोट की तुलना में अलग तरह से चलता है, और एक ग्रिपर वाला रोबोट एक हाथ वाले रोबोट की तुलना में अलग तरह से चलता है। पिछले तरीकों ने अक्सर इन अंतरों को अलग-अलग समस्याओं के रूप में माना, प्रत्येक रोबोट प्रकार के लिए एक अद्वितीय मस्तिष्क प्रशिक्षित किया। VLAct टीम ने इसके बजाय गति के लिए एक साझा भाषा बनाई। उन्होंने रोबोट को सिखाया कि एक मशीन पर ग्रिपर खोलना दूसरे पर ग्रिपर खोलने के समान विचार है, भले ही भौतिक यांत्रिकी भिन्न हो। उन्होंने इसे क्रिया के उन हिस्सों को संरेखित करके हासिल किया जो भौतिक रूप से समान हैं, जैसे कि हाथ को खोलना और बंद करना, जबकि प्रत्येक रोबोट के शरीर के अद्वितीय हिस्सों को अलग रखा। इसने रोबोट को एक मशीन के बारे में सीखी गई बात को पूरी तरह से अलग प्रकार की मशीन पर स्थानांतरित करने की अनुमति दी जिसे उसने पहले कभी नहीं देखा था।

इस दृष्टिकोण के परिणाम आश्चर्यजनक थे। कार्यों की एक विस्तृत श्रृंखला पर परीक्षण करते समय, नया सिस्टम मौजूदा मॉडलों को भी लगातार पछाड़ता है, जिनमें वे मॉडल भी शामिल हैं जिन्हें बहुत बड़े डेटासेट पर प्रशिक्षित किया गया है। LIBERO-Plus नामक एक सिमुलेशन बेंचमार्क में, जो यह परीक्षण करता है कि एक रोबोट प्रकाश व्यवस्था, कैमरा कोण और वस्तु के स्थान में बदलाव को कितनी अच्छी तरह संभालता है, नए सिस्टम ने 82.6 प्रतिशत की सफलता दर हासिल की। यह अन्य अग्रणी प्रणालियों से काफी अधिक था, जो यह सिद्ध करता है कि रोबोट ने केवल एक विशिष्ट परिदृश्य को याद करने के बजाय कार्य की एक मजबूत समझ सीखी है। एक अन्य बेंचमार्क जिसे RoboTwin 2.0 कहा जाता है, जिसमें दो रोबोटिक भुजाएं मिलकर काम करती हैं, सिस्टम ने 92.5 प्रतिशत की सफलता दर प्राप्त की, जो मालिकाना डेटा और विशाल कंप्यूटिंग शक्ति पर निर्भर बड़े पैमाने के औद्योगिक सिस्टमों से भी आगे निकल गया।

इस पद्धति की शक्ति का सबसे सम्मोहक प्रमाण एक मानवोïde (humanoid) रोबोट से जुड़े परीक्षण से आया जो प्रशिक्षण डेटा में पूरी तरह से नया था। शोधकर्ताओं ने अपने सिस्टम को मानक रोबोटिक भुजाओं के डेटा पर प्रशिक्षित किया और फिर एक मानवोïde रोबोट को नियंत्रित करने के लिए कहा जिसमें पैर और धड़ थे, एक ऐसी मशीन जिसे उसने पहले कभी नहीं देखा था। इस विशिष्ट शरीर के लिए प्रशिक्षित करने हेतु आवश्यक डेटा के केवल 20 प्रतिशत का उपयोग करके, सिस्टम ने उस बेसलाइन मॉडल से बेहतर प्रदर्शन किया जिसे 100 प्रतिशत डेटा पर प्रशिक्षित किया गया था। यह सुझाव देता है कि रोबोट ने "कैसे हिलना है" की एक मौलिक अवधारणा सीखी थी जिसे किसी भी शरीर पर लागू किया जा सकता है, न कि केवल उन भुजाओं की विशिष्ट गतिविधियों को याद किया जो उसे प्रशिक्षित की गई थीं।

शोधकर्ताओं ने अपने सिस्टम का वास्तविक दुनिया में भी परीक्षण किया, जिसमें भौतिक रोबोटिक भुजाओं का उपयोग करके ब्लॉक को स्टैक करने, मेज साफ करने और कपड़े मोड़ने जैसे कार्य किए गए। इन वास्तविक दुनिया के प्रयोगों में, सिस्टम ने बेसलाइन से बेहतर प्रदर्शन करना जारी रखा, अधिक स्थिरता और सटीकता दिखाई। इसने गाजर के बजाय मिर्च जैसे नए देखे गए ऑब्जेक्ट्स को सफलतापूर्वक उठाया, और बीन्स को स्कूप करने और उन्हें कटोरे में डालने जैसे जटिल, बहु-चरणीय कार्यों को बिना किसी चरण को छोड़े प्रबंधित किया। सिस्टम ने दो भुजाओं को एक साथ काम करने के लिए समन्वय करने में भी उत्कृष्टता प्राप्त की, जैसे कि प्लग खींचते समय सॉकेट को पकड़ना, जो एक ऐसा तालमेल प्रदर्शित करता है जिसके लिए पिछले मॉडल संघर्ष करते थे।

यह कार्य विशेष रूप से महत्वपूर्ण क्यों है, इसका कारण यह है कि इसे केवल ओपन-सोर्स डेटा और मध्यम मात्रा में कंप्यूटिंग पावर, विशेष रूप से 16 ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के सेटअप के साथ हासिल किया गया है। यह क्षेत्र के कई शीर्ष प्रदर्शन करने वाले सिस्टम के विपरीत है, जो मालिकाना डेटासेट और विशाल औद्योगिक-स्तर के कंप्यूटिंग संसाधनों पर निर्भर करते हैं। शोधकर्ताओं ने दिखाया है कि केवल डेटा की मात्रा को बढ़ाने के बजाय, रोबोट के आंतरिक रूप से दुनिया का प्रतिनिधित्व करने के तरीके पर ध्यान केंद्रित करके, अधिक सक्षम और अनुकूलन योग्य रोबोट बनाया जा सकता है। उनके निष्कर्ष बताते हैं कि रोबोट लर्निंग का भविष्य डेटा की अंतहीन धाराओं को एकत्र करने में नहीं है, बल्कि ऐसे प्रशिक्षण विधियों को डिजाइन करने में है जो रोबोट को भौतिक दुनिया की गहरी, अधिक लचीली समझ बनाने में मदद करें।

अध्ययन यह निष्कर्ष निकालता है कि रोबोट को कैसे सिखाया जाता है, यह उतना ही महत्वपूर्ण है जितना कि उसे क्या सिखाया जाता है। एक पूर्व-प्रशिक्षित मस्तिष्क की व्यापक जानकारी को सुरक्षित रखकर और रोबोट को एक ऐसी तरह से क्रियाएं सीखने के लिए प्रोत्साहित करके जो किसी एक विधि या शरीर के प्रकार से बंधी नहीं है, शोधकर्ता ऐसे सिस्टम बना सकते हैं जो वास्तविक दुनिया की अप्रत्याशित प्रकृति को संभालने में कहीं अधिक सक्षम हैं। यह दृष्टिकोण सामान्य-उद्देश्य वाले रोबोटों के लिए एक आशाजनक मार्ग प्रदान करता है जो नए कार्यों को जल्दी सीख सकते हैं और बिना किसी बड़े नए डेटा की आवश्यकता के नए वातावरण के अनुकूल हो सकते हैं। इस कार्य को जनता के लिए उपलब्ध कराया गया है, जिससे अन्य वैज्ञानिक इन निष्कर्षों पर निर्माण कर सकें और यह और अधिक खोज सकें कि मशीनों को जीवित प्राणियों की तरह लचीलेपन और समझ के साथ कैसे चलाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →