← नवीनतम पेपर
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA एक एकीकृत ढांचा पेश करता है जो एक साझा एक्शन हेड और एक बहु-चरणीय प्रगतिशील प्रशिक्षण रणनीति के साथ नेविगेशन और हेरफेर को एक ही आर्किटेक्चर में एकीकृत करता है, जिससे सामान्य-उद्देश्य वाले रोबोटिक एजेंटों के विकास को आगे बढ़ाने के लिए सिम्युलेटेड और वास्तविक दुनिया दोनों वातावरणों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

प्रकाशित 2026-06-02
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट सहायक है। अब तक, इस रोबोट को बनाना दो अलग-अलग विशेषज्ञों को काम पर रखने जैसा था: एक व्यक्ति जो चलने (नेविगेशन) में विशेषज्ञ है लेकिन अपने हाथों का उपयोग करने में बहुत खराब है, और दूसरा व्यक्ति जो एक मास्टर शेफ (मैनिपुलेशन) है लेकिन सामग्री लेने के लिए कमरे के आर-पार नहीं चल सकता। यदि आप चाहते कि रोबोट "रसोई में जाए और कप को माइक्रोवेव में रखे", तो आपको इन दो अलग-अलग "मस्तिष्क" या दो अलग-अलग मॉडलों के बीच स्विच करना पड़ता।

यह पेपर OneVLA को पेश करता है, जो एक ही "स्विस आर्मी नाइफ" कर्मचारी को काम पर रखने जैसा है जो स्वाभाविक रूप से चलने और अपने हाथों का उपयोग करने, दोनों में कुशल है, वह भी एक ही मस्तिष्क के भीतर।

यहाँ इसका एक सरल विवरण दिया गया है:

1. "यूनिवर्सल रिमोट कंट्रोल" (एकीकृत एक्शन हेड)

अधिकांश रोबोटों के अलग-अलग कामों के लिए अलग-अलग "रिमोट" होते हैं। एक रिमोट में आगे बढ़ने या बाएं मुड़ने के बटन होते हैं। दूसरा रिमोट रोबिक आर्म को ऊपर, नीचे करने या घुमाने के लिए स्लाइडर्स वाला होता है।

OneVLA एक एकल, यूनिवर्सल रिमोट बनाता है।

  • यह चलने के बटनों और हाथ के स्लाइडर्स को एक लंबी कंट्रोल स्ट्रिप में मिला देता है।
  • जब रोबोट को "दरवाजे तक जाओ" जैसा निर्देश मिलता है, तो यह स्ट्रिप पर केवल "चलने वाले बटन" दबाता है।
  • जब निर्देश "कप उठाओ" होता है, तो यह केवल "आर्म स्लाइडर्स" को हिलाता है।
  • जादू: रोबोट को अपने मस्तिष्क या अपने रिमोट को बदलने की आवश्यकता नहीं होती है। इसे बस पता होता है कि कार्य के आधार पर रिमोट के किस हिस्से का उपयोग करना है।

2. "तीन-चरणों वाला ट्रेनिंग कैंप" (बहु-चरणीय रणनीति)

आप एक रोबोट को सीधे एक जटिल दुनिया में नहीं फेंक सकते और उम्मीद नहीं कर सकते कि वह तुरंत सब कुछ जान जाएगा। लेखकों ने OneVLA को तीन विशिष्ट चरणों में प्रशिक्षित किया, जैसे कि एक छात्र स्कूल में प्रगति करता है:

  • चरण 1: हाथ चलाना सीखना। सबसे पहले, उन्होंने रोबोट को एक रोबोटिक आर्म का उपयोग करके वस्तुओं को पकड़ना, उठाना और रखना सिखाया। उन्होंने इसे चित्रों को देखना और उनका वर्णन करना भी सिखाया (ताकि यह दुनिया को समझ सके)।
  • चरण 2: चलना सीखना। इसके बाद, उन्होंने नेविगेशन डेटा जोड़ा। अब रोबोट सीखता है कि बिंदु A से बिंदु B तक कैसे पहुँचा जाए। क्योंकि चरण 1 से वह पहले से ही "देखना" और "सोचना" जानता है, इसलिए वह तेजी से और समझदारी से चलना सीख जाता है।
  • चरण 3: जोर से सोचना सीखना (चेन-ऑफ-थॉट)। अंत में, उन्होंने रोबोट को अपनी सोचने की प्रक्रिया को "बोलकर समझाने" के लिए प्रशिक्षित किया। हिलने से पहले, वह खुद से कहता है, "मैं गलियारे में हूँ। मुझे रसोई में जाने के लिए दाएं मुड़ने की जरूरत है।" यह चरण रोबोट को जो वह देखता है, उसे जो करना चाहिए और कैसे चलना चाहिए, उनके बीच संबंध बनाने में मदद करता है।

3. परिणाम: दो कौशल, एक मस्तिष्क

पेपर का दावा है कि इन दोनों कौशलों को एक साथ प्रशिक्षित करने से वे वास्तव में एक-दूसरे को बेहतर बनाने में मदद करते हैं।

  • उपमा: एक बास्केटबॉल खिलाड़ी के बारे में सोचें जो फुटबॉल भी खेलता है। बास्केटबॉल को ड्रिबल करना सीखना (मैनिपुलेशन) उसके फुटवर्क और संतुलन को सुधार सकता है, जिससे उसे फुटबॉल के मैदान (नेविगेशन) पर बेहतर दौड़ने में मदद मिलती है।
  • प्रमाण: परीक्षणों में, इस एकल रोबोट (OneVLA) ने उन रोबोटों को पछाड़ दिया जो केवल चलने या केवल हाथों के उपयोग में विशेषज्ञ थे। यह उन अन्य "हाइब्रिड" रोबोटों से भी बेहतर था जिन्होंने दोनों करने की कोशिश की लेकिन अभी भी प्रत्येक कार्य के लिए अलग-अलग "मोड" या सेटिंग्स की आवश्यकता थी।

सारांश

OneVLA एक नए प्रकार का रोबोट मस्तिष्क है जिसे आपको चलने के लिए या कुछ पकड़ने के लिए फिर से प्रोग्राम करने की आवश्यकता नहीं है। यह भाषा समझने, दुनिया को देखने और अपने पैरों और हाथों दोनों को नियंत्रित करने के लिए एक एकीकृत प्रणाली का उपयोग करता है। लेखक दिखाते हैं कि इन कौशलों को एक साथ सिखाने से रोबोट दोनों कार्यों में अधिक स्मार्ट हो जाता है बजाय इसके कि उन्हें अलग-अलग सिखाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →