← नवीनतम पेपर
💻 computer science

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

यह शोध पत्र RLinf-VLA को प्रस्तुत करता है, जो एक एकीकृत और कुशल ढांचा है जो विविध VLA आर्किटेक्चर और RL एल्गोरिदम के एकीकरण को मानकीकृत करता है और कई एम्बोडीड इंटेलिजेंस बेंचमार्क में महत्वपूर्ण प्रशिक्षण गति और अत्याधुनिक प्रदर्शन प्राप्त करने के लिए संसाधन आवंटन को अनुकूलित करता है।

मूल लेखक: Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao
प्रकाशित 2026-08-13
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल निर्देशों की एक सख्त सूची का पालन करने वाली निर्जीव मशीनें नहीं हैं, बल्कि जिज्ञासु शिक्षार्थी हैं जो यह समझ सकते हैं कि आप क्या कहते हैं, जो आप देखते हैं उसे देख सकते हैं, और काम पूरा करने के लिए अपने शरीर को कैसे चलाना है, यह पता लगा सकते हैं। यह विज़न-लैंग्वेज-एक्शन (VLA) मॉडल्स का रोमांचक क्षेत्र है। इन मॉडल्स को रोबोट के "मस्तिष्क" के रूप में सोचें, जिन्हें भाषा और छवियों को समझने के लिए इंटरनेट के विशाल डेटा पर प्रशिक्षित किया गया है। लेकिन इसमें एक पेच है: सिर्फ इसलिए कि एक रोबोट जानता है कि कप क्या है और वह "कप उठाओ" सुन लेता है, इसका मतलब यह नहीं है कि उसे यह भी पता है कि बिना उसे गिराए उसे पकड़ने का सबसे अच्छा तरीका क्या है। भौतिक कार्यों में वास्तव में कुशल होने के लिए, इन रोबोटों को अभ्यास करने, गलतियाँ करने और परिणामों से सीखने की आवश्यकता होती है। यहीं पर रीइन्फोर्समेंट लर्निंग (RL) आता है। आप RL को एक वीडियो गेम ट्रेनिंग लूप की तरह समझ सकते हैं: रोबोट एक क्रिया करने की कोशिश करता है, यदि वह सफल होता है तो उसे एक "स्कोर" (पुरस्कार) मिलता है, और वह अच्छे मूव्स को दोहराना सीखता है जबकि बुरे मूव्स से बचता है। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है कि हम एक ऐसा प्रशिक्षण सिस्टम कितनी तेज़ी से और कितनी समझदारी से बना सकते हैं जो इन रोबोटों को जटिल कौशल सीखने में बहुत अधिक समय लिए बिना सक्षम बना सके?

पेश है RLinf-VLA, एक नया फ्रेमवर्क जो इन रोबोट मस्तिष्क के लिए एक सुपर-एफिशिएंट ट्रेनिंग जिम की तरह कार्य करता है। इस पेपर के पीछे के शोधकर्ताओं ने महसूस किया कि जबकि हमारे पास शक्तिशाली रोबोट मॉडल और बेहतरीन प्रशिक्षण एल्गोरिदम हैं, लेकिन "जिम" खुद अक्सर टूटा हुआ था। पिछले सिस्टम ऐसे थे जैसे भारी बैकपैक लेकर मैराथन दौड़ने की कोशिश करना; वे धीमे, बोझिल थे और विभिन्न प्रकार के प्रशिक्षण वातावरणों को अच्छी तरह से संभाल नहीं पाते थे। कभी-कभी रोबोट का मस्तिष्क (मॉडल) सिम्युलेटर (आभासी दुनिया) के पीछे आने का इंतज़ार कर रहा होता था, और कभी-कभी सिम्युलेटर मस्तिष्क का इंतज़ार कर रहा होता था, जिससे महंगे कंप्यूटर चिप्स खाली बैठे रह जाते थे।

टीम ने इस ट्रैफिक जाम को ठीक करने के लिए RLinf-VLA बनाया। उन्होंने एक एकीकृत प्रणाली बनाई जिसे एक साथ विभिन्न रोबोट सिम्युलेटर, विभिन्न मस्तिष्क आर्किटेक्चर और विभिन्न लर्निंग एल्गोरिदम को प्लग-इन किया जा सकता है। लेकिन असली जादू इस बात में है कि वे कंप्यूटर पावर को कैसे प्रबंधित करते हैं। उन्होंने एक चतुर "हाइब्रिड" मोड पेश किया जो एक सुव्यवस्थित नृत्य की तरह कार्य करता है। रोबोट के मस्तिष्क और आभासी दुनिया को एक-दूसरे का इंतज़ार करने देने के बजाय, वे इस प्रक्रिया को पाइपलाइन करते हैं: जबकि मस्तिष्क सिमुलेशन के एक हिस्से के लिए अगले कदम के बारे में सोच रहा होता है, सिम्युलेटर पहले से ही दूसरे हिस्से के लिए पिछले कदम को चला रहा होता है। यह सब कुछ पूरी गति से चालू रखता है।

इस नए सिस्टम के परिणाम प्रभावशाली हैं। अपने सिमुलेशन में, इस फ्रेमवर्क ने पिछले तरीकों की तुलना में प्रशिक्षण को 2.27 गुना तक तेज़ बनाया। जब उन्होंने अपने प्रशिक्षित मॉडल्स को टेस्ट किया, तो परिणाम मजबूत थे। RLinf-VLA के साथ प्रशिक्षित एक एकल मॉडल ने LIBERO बेंचमार्क में 130 अलग-अलग कार्यों में 98.11% सफलता दर और ManiSkill के 25 कार्यों में 97.66% हासिल की। यहाँ तक कि कठिन RoboTwin कार्यों पर भी, जिनमें दो हाथों का उपयोग शामिल है, मॉडल्स ने 84.63% की औसत सफलता दर प्राप्त की। शोधकर्ताओं ने एक भौतिक रोबोटिक आर्म द्वारा दराज बंद करने के वास्तविक दुनिया के परीक्षण में भी इसका एक संस्करण परखा। हालाँकि सफलता दर एक मानक मॉडल के समान थी (10 में से 8 बार), RL-प्रशिक्षित रोबोट ने अधिक सुचारू और कुशलता से काम किया, जिससे वह अनप्रशिक्षित संस्करण की अजीब, झटकेदार गतिविधियों से बच सका।

यह पेपर सुझाव देता है कि यह नया फ्रेमवर्क केवल गति बढ़ाने वाला उपकरण नहीं है; यह एक मौलिक उपकरण है जो इन जटिल रोबोट मस्तिष्क को पहले की तुलना में बहुत बड़े पैमाने पर प्रशिक्षित करना संभव बनाता है। इन प्रणालियों के आपस में बात करने के तरीके को मानकीकृत करके और अपने कंप्यूटर संसाधनों का उपयोग कैसे अनुकूलित किया जाए, इसे व्यवस्थित करके, RLinf-VLA इन जटिल रोबोट मस्तिष्क को तेज़ी से और विश्वसनीय रूप से नए भौतिक कौशल सीखने में सक्षम बनाने का एक मार्ग प्रदान करता है, जो हमें उस दिन के और करीब लाता है जब रोबोट वास्तव में हमारे दैनिक जीवन में मदद कर सकेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →